Qwen 3.8 Flash-Next (NVIDIA) (Thinking)

Als offene Vorschau auf die Qwen4-Architektur bringt Alibaba mit Qwen3.8-Flash-Next ein experimentelles MoE-Modell, das NVIDIA als NVFP4-Quantisierung für lokale Inferenz aufbereitet hat. Von rund 180 Mrd. Parametern auf der Platte aktivieren pro Token nur etwa 6 Mrd., bei Text-, Bild- und Videoeingabe und 262.000 Tokens nativem Kontext. Lizenz: kombinierte NVIDIA- und Qwen-Lizenz. Wichtig: Diese Preview ist nicht die gehostete API Qwen3.8-Flash.

NVIDIA Version 3.8-Next Kommerzielle Nutzung erlaubt MoE 180 B (6 B aktiv) 262 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Das Basismodell stammt von Alibaba (CN); die NVFP4-Distribution durch NVIDIA (US) reduziert das operative Risiko etwas, führt aber wegen US-Jurisdiktion (z.B. CLOUD Act) zu ‘medium’. Zusätzliches Identitätsrisiko: Qwen3.8-Flash-Next ist explizit eine experimentelle Open-Weight-Preview der kommenden Qwen4-Architektur, getrennt von der produktiven, gehosteten ‘Qwen3.8-Flash’-API mit mehr Produktionsfeatures.[374][383][384]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.04
First Request
MCP
0.93
Protocol Latency
Synthesis
20.33
Response Generation
Total
145.84
Sum of All Phases
Token
14170
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Aktualisiert am · Instruction-Tuned · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist und keine Halluzination erkannt wurde, aber der ungültige Tool-Call und die nur mittlere Synthesetreue das Modell für unbeaufsichtigte MCP-Pipelines noch zu fehleranfällig machen.

Tool-Execution-Profil

Qwen 3.8 Flash-Next zeigt echte Werkzeugintelligenz, nicht nur starres Musterverhalten. Beim Test Web Search & Tool Selection, der ohne Hinweis zwischen Suche und direktem Abruf unterscheiden lässt, wählt es das passende Tool sicher. Das spricht für brauchbare Orchestrierungslogik in offenen Aufgabenräumen. Beim Test URL Construction & Fetch, der die Ziel-URL aus Modellwissen ableiten und dann korrekt abrufen lässt, bleibt es brauchbar, aber nicht deterministisch genug für fragile Fetch-Ketten. Der Gesamtwert für Tool Execution ist hoch, dennoch ist der Tool-Call formal nicht valide. Für Produktion heißt das: gute Planungsfähigkeit, aber ein MCP-Adapter sollte Call-Schema, Parameter und Ziel-URLs hart validieren, bevor Requests ausgeführt werden.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur ordentlich. Die P2-Leistung von 62.50 zeigt, dass es gefundene Inhalte meist sinnvoll zusammenzieht, aber nicht mit der Präzision eines Modells, dem man regulatorische oder operative Kernaussagen ungeprüft überlassen sollte. Solide in HTTP Fetch & Extract und stark im mehrsprachigen Recherche-und-Synthese-Test, aber zu wechselhaft für hochwertige Entscheidungsnotizen.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, bleibt das Modell auf der sicheren Seite. Keine Halluzination erkannt. Das ist das wichtigere Vertrauenssignal: Es erfindet keine aktuellen Compliance-Fakten, wenn externe Evidenz verlangt ist.

Fehlerresilienz

Gut genug für Produktion. Im Test Tool Failure Handling (404), der transparentes Verhalten bei einem gescheiterten Abruf misst, kommuniziert das Modell den Fehler sauber und halluziniert keinen Ersatzinhalt. Genau das braucht eine Tool-Pipeline: sichtbares Scheitern statt plausibel klingender Falschdaten.

Betriebsprofil

Call 1: 3.47s. MCP-Latenz: 1.32s. Call 2: 24.87s. Total: 177.97s.
Langsam für den erzielten Qualitätsstand. Kosten pro Run: local. Günstig im direkten Betrieb, aber teuer in Durchlaufzeit.

Fazit & Empfehlung

Geeignet für lokal betriebene, agentische Recherche-Pipelines mit Guardrails, Schema-Validierung und menschlicher Freigabe vor Downstream-Aktionen. Gut einsetzbar für Suchsteuerung, mehrsprachige Informationsbeschaffung und transparente Fehlerbehandlung. Nicht die richtige Wahl für vollautonome MCP-Strecken, in denen jeder Tool-Call formal sitzen muss oder in denen die Endsynthese selbst entscheidungsreif sein soll. Für diese Rolle ist die Ausführung stärker als die Verdichtung.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.