NVIDIA Nemotron 3.5 Lightning 30B (Thinking)

NVIDIA Nemotron 3.5 Lightning ist ein offenes 30-Milliarden-Parameter-MoE mit 3 Milliarden aktiven Parametern pro Token (11. August 2026), destilliert aus Nemotron 3 Ultra und auf die Ausführungsschicht always-on laufender Agenten spezialisiert. Die hybride Mamba-2 + MoE + Attention-Architektur unter OpenMDW-1.1-Lizenz bietet bis zu 1 Million Tokens Kontext und bis zu 4-fache Ausgabegeschwindigkeit durch Multi-Token-Prediction und Speculative Decoding.

NVIDIA Version 3.5-Lightning Kommerzielle Nutzung erlaubt MoE 30 B (3 B aktiv) 1024 K Context 05/2026 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Instruction-Tuned
  • Long Context
  • Agentic Orchestrator
  • Interactive

Sovereign Risk: LOW NVIDIA ist ein US-Unternehmen und unterliegt dem CLOUD Act bei Nutzung der gehosteten API/NIM-Infrastruktur. Die Gewichte werden jedoch vollständig offen unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht (inklusive Trainingsdaten-Rezepten), was unabhängige Prüfung und vollständig lokalen Betrieb ohne jede Cloud-Abhängigkeit ermöglicht und das Risiko entsprechend senkt.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
69.6
Routine
41.83
Reasoning
27.77

Rank #66

LLM Judge Avg
3.42
100 Coverage
Avg Task Duration
44.16
Interactive
Token Rate
93.55
Output Rate
P95 Latency
118.47
Top 5 %
Total Tokens
234300
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 234300 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

NVIDIA Nemotron 3.5 Lightning 30B (Thinking) Bestes Modell Ø Alle Modelle
Code Quality 64.5
CLI Benchmark 95
Logical Reasoning 69.14
UX Writing 68.65
Documentation 58.66
Content Transform. 65.83
Cultural Intelligence 74.6
Synthesis Quality 55.83
Tool Execution 90
ToolUse Score 73.08
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil