NVIDIA Nemotron 3.5 Lightning 30B (Thinking)
NVIDIA Nemotron 3.5 Lightning ist ein offenes 30-Milliarden-Parameter-MoE mit 3 Milliarden aktiven Parametern pro Token (11. August 2026), destilliert aus Nemotron 3 Ultra und auf die Ausführungsschicht always-on laufender Agenten spezialisiert. Die hybride Mamba-2 + MoE + Attention-Architektur unter OpenMDW-1.1-Lizenz bietet bis zu 1 Million Tokens Kontext und bis zu 4-fache Ausgabegeschwindigkeit durch Multi-Token-Prediction und Speculative Decoding.
- Open Weights
- Workstation
- vLLM
- Text
- Instruction-Tuned
- Long Context
- Agentic Orchestrator
- Interactive
Sovereign Risk: LOW NVIDIA ist ein US-Unternehmen und unterliegt dem CLOUD Act bei Nutzung der gehosteten API/NIM-Infrastruktur. Die Gewichte werden jedoch vollständig offen unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht (inklusive Trainingsdaten-Rezepten), was unabhängige Prüfung und vollständig lokalen Betrieb ohne jede Cloud-Abhängigkeit ermöglicht und das Risiko entsprechend senkt.
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Silver
- 69.6
- Routine
- 41.83
- Reasoning
- 27.77
- LLM Judge Avg
- 3.42 / 5
- 100 Coverage
- Avg Task Duration
- 44.16s
- Interactive
- Token Rate
- 93.55tok/s
- Output Rate
- P95 Latency
- 118.47s
- Top 5 %
- Total Tokens
- 234300
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 234300 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian