Qwen3.8-Flash

Qwen3.8 Flash ist Alibabas cloud-only Multimodal-Reasoning-Modell mit einer Million Tokens Kontext und 0,16 / 0,47 USD pro Million Tokens. Verarbeitet Text, Bild und Video mit Tool Calling, erreichbar über Alibaba Cloud und OpenRouter. Die offene Basis Qwen3.8-Flash-Next ist verfügbar, der getestete Build ist Cloud-only. Architektur und Parameteranzahl sind nicht offengelegt, Daten laufen über chinesische Jurisdiktion.

Alibaba Version 3.8-Flash Kommerzielle Nutzung erlaubt Dense 1024 K Context $0.16 / $0.47 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Basis-Gewichte sind offen verfuegbar (Qwen/Qwen3.8-Flash-Next, qwen-community-1.0, offizielle NVFP4/GGUF/FP8-Quants) — lokales Deployment moeglich. Der getestete OpenRouter-Endpoint ist jedoch Alibabas Produktions-Build (Qwen3.8-Flash, 1M Kontext, built-in Tools), dessen exakte Post-Training-Differenzen zu Flash-Next nicht offengelegt sind. Entwicklung/Betrieb unterliegen chinesischer Jurisdiktion.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
44.76
First Request
MCP
1.03
Protocol Latency
Synthesis
45.12
Response Generation
Total
545.47
Sum of All Phases
Token
13006
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber ein invalider Tool-Call und ein erkannter Halluzinationsbefund das Vertrauen für unbeaufsichtigte Produktionspipelines begrenzen.

Tool-Execution-Profil

Qwen3.8-Flash zeigt echte Werkzeugintelligenz statt bloßem Standardmuster. Beim Test Web Search & Tool Selection, der prüft, ob ohne Hinweis zwischen Suche und direktem Fetch unterschieden wird, wählt es das richtige Werkzeug sicher. Das spricht für brauchbare Orchestrierung in offenen MCP-Abläufen. Beim Test URL Construction & Fetch, der die Ableitung einer Ziel-URL aus Vorwissen und den anschließenden Fetch misst, bleibt es brauchbar, aber nicht deterministisch genug für fragile Pipelines mit harter URL-Präzision.

Der P1-Wert von 90 stützt diesen Eindruck. Praktisch wichtiger ist aber: Der Tool-Call war nicht durchgehend valide. Damit ist das Problem nicht die grundsätzliche Planungsfähigkeit, sondern die Protokolltreue am Übergabepunkt zur Infrastruktur. Da kein Retry nötig war, wirkt das nicht wie ein bloßes Formatstottern unter Last, sondern wie eine punktuelle, aber reale Unsicherheit in der Call-Erzeugung.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt. Der P2-Wert von 62.5 ist der klare Schwachpunkt des Modells. Besonders bei EU License Research, also der Verdichtung aktueller Web-Quellen zu Lizenzrestriktionen, und bei Multilingual Search & Synthesis verliert es Präzision, priorisiert Offensichtliches und lässt relevante Nuancen liegen. Für Recherchepipelines, in denen das Modell nicht nur Daten beschafft, sondern belastbar zusammenführen muss, ist das zu wenig.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der genau diesen Vertrauensbruch prüft, halluziniert es nicht. Das ist der wichtige Befund. Gleichzeitig ist global ein Halluzinationssignal gesetzt. Das ist kein bloßer Qualitätsmangel, sondern ein Sicherheitsrisiko: Sobald ein Modell erfundene Fakten als angebliche Tool-Ausgabe framet, beschädigt es die Verlässlichkeit der gesamten Pipeline.

Fehlerresilienz

Beim 404-Test, der prüft, ob ein fehlgeschlagener Tool-Call offen benannt statt mit Ersatzinhalt kaschiert wird, reagiert Qwen3.8-Flash akzeptabel. Es erfindet keinen Seiteninhalt trotz Fehler. Die Fehlerkommunikation ist damit produktionsfähig, auch wenn die Synthese nach dem Fehler nicht besonders stark ausfällt.

Betriebsprofil

Call 1: 44.76s. MCP-Latenz: 1.03s. Call 2: 45.12s. Total: 545.47s. Langsam für die gezeigte Ergebnisqualität. Preis: $0.16/1M Input, $0.47/1M Output. Günstig für Frontier-Klasse, aber die Laufzeit relativiert den Kostenvorteil im operativen Durchsatz.

Fazit & Empfehlung

Geeignet für MCP-Pipelines, in denen Tool-Wahl, Web-Recherche und kontrollierte Fehlerbehandlung wichtiger sind als hochwertige Verdichtung. Sinnvoll als agentischer Beschaffer oder Vorstufe vor einer zweiten Validierungs- oder Syntheseschicht. Nicht geeignet als alleinige Instanz für Compliance, mehrsprachige Recherche-Synthese oder jede Pipeline, in der Tool-Ausgaben ohne menschliche Kontrolle als vertrauenswürdige Fakten weitergereicht werden.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.