NVIDIA Nemotron 3.5 Lightning 30B (Thinking)

NVIDIA Nemotron 3.5 Lightning ist ein offenes 30-Milliarden-Parameter-MoE mit 3 Milliarden aktiven Parametern pro Token (11. August 2026), destilliert aus Nemotron 3 Ultra und auf die Ausführungsschicht always-on laufender Agenten spezialisiert. Die hybride Mamba-2 + MoE + Attention-Architektur unter OpenMDW-1.1-Lizenz bietet bis zu 1 Million Tokens Kontext und bis zu 4-fache Ausgabegeschwindigkeit durch Multi-Token-Prediction und Speculative Decoding.

NVIDIA Version 3.5-Lightning Kommerzielle Nutzung erlaubt MoE 30 B (3 B aktiv) 1024 K Context 05/2026 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Instruction-Tuned
  • Long Context
  • Agentic Orchestrator
  • Interactive

Sovereign Risk: LOW NVIDIA ist ein US-Unternehmen und unterliegt dem CLOUD Act bei Nutzung der gehosteten API/NIM-Infrastruktur. Die Gewichte werden jedoch vollständig offen unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht (inklusive Trainingsdaten-Rezepten), was unabhängige Prüfung und vollständig lokalen Betrieb ohne jede Cloud-Abhängigkeit ermöglicht und das Risiko entsprechend senkt.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.59
First Request
MCP
1.82
Protocol Latency
Synthesis
20.22
Response Generation
Total
159.78
Sum of All Phases
Token
21065
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Long Context · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber der Lauf mindestens einen Halluzinationsbefund enthält und die Tool-Calls nicht durchgängig valide waren. Für produktive MCP-Pipelines reicht das nur mit harten Guardrails.

Tool-Execution-Profil

NVIDIA Nemotron 3.5 Lightning 30B zeigt ein klar agentisches Profil. Es erkennt im Test Web Search & Tool Selection, der ohne expliziten Hinweis zwischen Suche und direktem Abruf unterscheidet, zuverlässig, dass web_search statt fetch nötig ist. Das spricht gegen bloßes Schema-Folgen und für echte Werkzeugwahl. Auch bei Multilingual Search & Synthesis und EU License Research greift es die Tool-Schicht korrekt an.

Schwächer wird es bei der formalen Zuverlässigkeit der Aufrufe. Tool-Call valide: False ist für MCP-Betrieb ein Warnsignal, selbst bei P1 90. Beim URL-Construction-Test, der die Ziel-URL aus Eigenwissen ableiten und dann fetch ausführen lässt, arbeitet es brauchbar, aber nicht deterministisch genug für Infrastrukturen, die exakt reproduzierbare Calls erwarten. Das Muster ist damit klar: gute Tool-Entscheidung, weniger saubere Protokollausführung.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur begrenzt. P2 55.83 ist der eigentliche Engpass dieses Modells. Die Rohbeschaffung funktioniert, aber bei der Verdichtung verliert es Präzision, vor allem bei HTTP Fetch & Extract und EU License Research, also genau dort, wo Jahreszahlen, Eigennamen und regulatorische Details sauber zusammengeführt werden müssen.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus dem Modellwissen beantwortet werden, bleibt es zwar ohne Halluzination im sicheren Bereich. Das ist positiv. Gleichzeitig steht auf Run-Ebene Halluzination erkannt: True. Das ist kein bloßer Qualitätsmangel, sondern ein Sicherheitsrisiko. Sobald ein Modell erfundene Fakten als Tool-Ergebnis ausgibt, beschädigt es das Vertrauen in die gesamte Pipeline.

Fehlerresilienz

Beim 404-Test, der transparentes Scheitern gegen erfundenen Ersatzinhalt prüft, reagiert das Modell akzeptabel. Es halluziniert trotz Fehler keinen Seiteninhalt. P2 40 zeigt allerdings, dass die Kommunikation des Fehlers nicht besonders stark verdichtet oder hilfreich formuliert ist. Für Produktion ist das tolerierbar, weil Transparenz hier wichtiger ist als Eleganz.

Betriebsprofil

Call 1: 4.59s. MCP-Latenz: 1.82s. Call 2: 20.22s. Total: 159.78s. Langsam für die erzielte Synthesequalität. Kosten/Run: local. Günstig im Betrieb, aber zeitlich teuer.

Fazit & Empfehlung

Geeignet für lokal betriebene Retrieval-, Search- und Orchestrierungs-Pipelines, in denen ein nachgelagerter Validator Antworten gegen Tool-Rohdaten prüft und ungültige Calls abfängt. Nicht geeignet für Compliance-, Regulatorik- oder Executive-Summary-Pipelines, in denen die Modellantwort selbst als verlässliche Endverdichtung dienen soll. Wer dieses Modell einsetzt, sollte es als Ausführungsschicht behandeln, nicht als letzte Instanz der Wahrheit.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.