Qwen 3.8 Flash-Next (NVIDIA) (Thinking)
Als offene Vorschau auf die Qwen4-Architektur bringt Alibaba mit Qwen3.8-Flash-Next ein experimentelles MoE-Modell, das NVIDIA als NVFP4-Quantisierung für lokale Inferenz aufbereitet hat. Von rund 180 Mrd. Parametern auf der Platte aktivieren pro Token nur etwa 6 Mrd., bei Text-, Bild- und Videoeingabe und 262.000 Tokens nativem Kontext. Lizenz: kombinierte NVIDIA- und Qwen-Lizenz. Wichtig: Diese Preview ist nicht die gehostete API Qwen3.8-Flash.
- Open Weights
- Server
- vLLM
- Text
- Vision
- Video
- Instruction-Tuned
- Long Context
- Interactive
Sovereign Risk: MEDIUM Das Basismodell stammt von Alibaba (CN); die NVFP4-Distribution durch NVIDIA (US) reduziert das operative Risiko etwas, führt aber wegen US-Jurisdiktion (z.B. CLOUD Act) zu ‘medium’. Zusätzliches Identitätsrisiko: Qwen3.8-Flash-Next ist explizit eine experimentelle Open-Weight-Preview der kommenden Qwen4-Architektur, getrennt von der produktiven, gehosteten ‘Qwen3.8-Flash’-API mit mehr Produktionsfeatures.[374][383][384]
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Gold
- 81.68
- Routine
- 49.6
- Reasoning
- 32.08
- LLM Judge Avg
- 4.07 / 5
- 100 Coverage
- Avg Task Duration
- 39.13s
- Interactive
- Token Rate
- 42.72tok/s
- Output Rate
- P95 Latency
- 97.8s
- Top 5 %
- Total Tokens
- 112600
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 112600 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian