NVIDIA Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning ist ein offenes 30-Milliarden-Parameter-MoE mit 3 Milliarden aktiven Parametern pro Token (11. August 2026), destilliert aus Nemotron 3 Ultra und auf die Ausführungsschicht always-on laufender Agenten spezialisiert. Die hybride Mamba-2 + MoE + Attention-Architektur unter OpenMDW-1.1-Lizenz bietet bis zu 1 Million Tokens Kontext und bis zu 4-fache Ausgabegeschwindigkeit durch Multi-Token-Prediction und Speculative Decoding.

NVIDIA Version 3.5 Kommerzielle Nutzung erlaubt MoE 30 B (3 B aktiv) 1024 K Context 05/2026 $0.08 / $0.2 per 1M

  • Open Weights
  • Workstation
  • OpenRouter
  • Text
  • Instruction-Tuned
  • Long Context
  • Agentic Orchestrator
  • Real-Time

Sovereign Risk: LOW NVIDIA ist ein US-Unternehmen und unterliegt dem CLOUD Act bei Nutzung der gehosteten API/NIM-Infrastruktur. Die Gewichte werden jedoch vollständig offen unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht (inklusive Trainingsdaten-Rezepten), was unabhängige Prüfung und vollständig lokalen Betrieb ohne jede Cloud-Abhängigkeit ermöglicht und das Risiko entsprechend senkt.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Bronze
64.26
Routine
37.03
Reasoning
27.23

Rank #82

LLM Judge Avg
3.33
100 Coverage
Avg Task Duration
19.26
Real-Time
Token Rate
109.56
Output Rate
P95 Latency
45.91
Top 5 %
Total Tokens
210700
Output Volume
Cost per 1K
$0.0002
USD / 1K Requests
Benchmark Cost
$0.04
Total · 210700 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

NVIDIA Nemotron 3.5 Lightning Bestes Modell Ø Alle Modelle
Code Quality 53.16
CLI Benchmark 90.67
Logical Reasoning 74.7
UX Writing 57.01
Documentation 59.01
Content Transform. 56.15
Cultural Intelligence 66.12
Synthesis Quality 50
Tool Execution 90
ToolUse Score 70.5
Benchmark Cost $0.04

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil