NVIDIA Nemotron 3.5 Lightning 30B (Thinking)

NVIDIA Nemotron 3.5 Lightning ist ein offenes 30-Milliarden-Parameter-MoE mit 3 Milliarden aktiven Parametern pro Token (11. August 2026), destilliert aus Nemotron 3 Ultra und auf die Ausführungsschicht always-on laufender Agenten spezialisiert. Die hybride Mamba-2 + MoE + Attention-Architektur unter OpenMDW-1.1-Lizenz bietet bis zu 1 Million Tokens Kontext und bis zu 4-fache Ausgabegeschwindigkeit durch Multi-Token-Prediction und Speculative Decoding.

NVIDIA Version 3.5-Lightning Kommerzielle Nutzung erlaubt MoE 30 B (3 B aktiv) 1024 K Context 05/2026 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Instruction-Tuned
  • Long Context
  • Agentic Orchestrator
  • Interactive

Sovereign Risk: LOW NVIDIA ist ein US-Unternehmen und unterliegt dem CLOUD Act bei Nutzung der gehosteten API/NIM-Infrastruktur. Die Gewichte werden jedoch vollständig offen unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht (inklusive Trainingsdaten-Rezepten), was unabhängige Prüfung und vollständig lokalen Betrieb ohne jede Cloud-Abhängigkeit ermöglicht und das Risiko entsprechend senkt.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.59
First Request
MCP
1.82
Protocol Latency
Synthesis
20.22
Response Generation
Total
159.78
Sum of All Phases
Token
21065
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Long Context · Agentic Orchestrator

Tool-Use-Profil

NVIDIA Nemotron 3.5 Lightning 30B (Thinking) erzielt im Tool-Use-Benchmark einen Combined-Score von 73.1 (Good): P1-Execution 90, P2-Synthese 55.8, Fleet-Durchschnitt 67.1.

Stärkster Test: HTTP Fetch & Extract (57.5). Schwächster Test: Web Search & Tool Selection (91). Die Streuung zwischen diesen beiden Tests beträgt -33.5 Punkte.

Reliability-Status: Tool Call Valid Nein, Retry Nicht erforderlich, Halluzination Erkannt.

Diese datengetriebene Auto-Review wird aus den vorhandenen Tool-Use-Benchmark-Daten zusammengestellt. Sobald eine ausführliche LLM-generierte Analyse (GPT 4.5) vorliegt, ersetzt sie diese Vorlage automatisch. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.