Qwen 3.8 Flash-Next (NVIDIA) (Thinking)

Als offene Vorschau auf die Qwen4-Architektur bringt Alibaba mit Qwen3.8-Flash-Next ein experimentelles MoE-Modell, das NVIDIA als NVFP4-Quantisierung für lokale Inferenz aufbereitet hat. Von rund 180 Mrd. Parametern auf der Platte aktivieren pro Token nur etwa 6 Mrd., bei Text-, Bild- und Videoeingabe und 262.000 Tokens nativem Kontext. Lizenz: kombinierte NVIDIA- und Qwen-Lizenz. Wichtig: Diese Preview ist nicht die gehostete API Qwen3.8-Flash.

NVIDIA Version 3.8-Next Kommerzielle Nutzung erlaubt MoE 180 B (6 B aktiv) 262 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Das Basismodell stammt von Alibaba (CN); die NVFP4-Distribution durch NVIDIA (US) reduziert das operative Risiko etwas, führt aber wegen US-Jurisdiktion (z.B. CLOUD Act) zu ‘medium’. Zusätzliches Identitätsrisiko: Qwen3.8-Flash-Next ist explizit eine experimentelle Open-Weight-Preview der kommenden Qwen4-Architektur, getrennt von der produktiven, gehosteten ‘Qwen3.8-Flash’-API mit mehr Produktionsfeatures.[374][383][384]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Gold
81.68
Routine
49.6
Reasoning
32.08

Rank #2

LLM Judge Avg
4.07
100 Coverage
Avg Task Duration
39.13
Interactive
Token Rate
42.72
Output Rate
P95 Latency
97.8
Top 5 %
Total Tokens
112600
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 112600 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.8 Flash-Next (NVIDIA) (Thinking) Bestes Modell Ø Alle Modelle
Code Quality 82.04
CLI Benchmark 88.33
Logical Reasoning 76.62
UX Writing 73.55
Documentation 85.98
Content Transform. 85.02
Cultural Intelligence 82.36
Synthesis Quality 62.5
Tool Execution 90
ToolUse Score 82.83
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil