Qwen 3.8 Omni Flash

Eine Million Tokens Kontext für Text, Bild, Audio und Video in einem Modell: Qwen3.8-Omni-Flash (ab 18. September 2026) ist Alibabas erstes omni-modales Modell mit agentischem Fokus — es versteht mehrstündiges Audio- und Videomaterial, plant Aufgaben und führt sie per Tool-Calling aus. Bei 0,15 / 0,47 USD pro Million Tokens senkt es die Audio-Kosten laut Alibaba um über 98 Prozent gegenüber dem Vorgänger. Output ist reiner Text, die Gewichte bleiben geschlossen.

Alibaba Version 3.8 Kommerzielle Nutzung erlaubt Dense 1000 K Context $0.15 / $0.47 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Unusable

Sovereign Risk: MEDIUM-HIGH Das Modell wird von einem chinesischen Unternehmen entwickelt und ausschließlich über Cloud-APIs bereitgestellt (Weights werden nicht veröffentlicht). Als chinesisches Unternehmen unterliegt Alibaba den PRC-Datensicherheits- und Cybersicherheitsgesetzen, nicht dem US-CLOUD-Act. Da keine Gewichte verteilt werden, besteht kein Weitergabe-Risiko, jedoch potenzielles Datenzugriffsrisiko durch chinesische Behörden bei über Alibaba-Cloud-Regionen verarbeiteten Daten.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
5.8
First Request
MCP
1.55
Protocol Latency
Synthesis
83.76
Response Generation
Total
546.63
Sum of All Phases
Token
27794
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung insgesamt stark ist, aber die Call-Validität nicht sauber genug ist und die Synthese nur auf mittlerem Produktionsniveau liegt. Combined 77.67 ist tragfähig, aber nicht selbsttragend ohne Guardrails.

Tool-Execution-Profil

Qwen 3.8 Omni Flash zeigt echte Werkzeugintelligenz, nicht nur starres Musterverhalten. Beim Web Search & Tool Selection-Test erkennt es ohne expliziten Hinweis korrekt, dass für aktuelle Informationen eine Suche statt eines direkten Fetch nötig ist. Das ist ein starkes Signal für agentische Orchestrierung. Auch bei EU License Research und Multilingual Search & Synthesis arbeitet es tool-seitig sicher.

Schwächer wird es bei der formalen Ausführung. Tool-Call valide ist insgesamt false, obwohl P1 mit 90 hoch liegt. Das spricht nicht für ein Verständnisproblem, sondern für Unsauberkeit in einzelnen Aufrufen oder Parametern. Beim URL-Construction-Test, der prüft ob das Modell die Zieladresse selbst ableiten und dann abrufen kann, reicht es nur zu brauchbarer statt deterministischer Präzision. Beim HTTP Fetch & Extract-Test zeigt sich dasselbe Muster: Zugriff meist korrekt, aber nicht robust genug für Pipelines, die auf strikt reproduzierbare Calls angewiesen sind.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur solide. P2 von 66.67 bedeutet: Das Modell kann Ergebnisse zusammenführen, verliert aber bei faktennaher Verdichtung Präzision. Besonders beim HTTP Fetch & Extract-Test, der exakte Extraktion aus echtem Seiteninhalt misst, fällt die Qualität deutlich ab. Für Berichte und Erstentwürfe reicht das. Für Compliance, Vertrags- oder Regulatorik-Summaries ist es zu locker.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Eher ja, und das ist der wichtigste positive Befund. Im Honeypot EU License Research, der prüft ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen kommen, halluziniert es nicht. P2 60 ist inhaltlich nicht stark, aber vertrauensseitig akzeptabel: Es erfindet keine scheinbar aktuellen Fakten außerhalb der Tool-Basis.

Fehlerresilienz

Beim 404-Test reagiert das Modell produktionsgerecht. Es kommuniziert den Fehlschlag transparent und halluziniert keinen Ersatzinhalt. P2 80 in diesem Szenario ist ein gutes Signal für sichere Degradation: Die Pipeline bleibt überprüfbar, wenn ein Tool scheitert.

Betriebsprofil

Call 1: 5.80s. Call 2: 83.76s. MCP-Latenz: 1.55s. Total pro Run: 546.63s. Klar langsam. Preis: $0.15/1M Input, $0.47/1M Output. Günstig für ein Frontier-Modell, aber die Laufzeit ist im Verhältnis zur gezeigten Syntheseleistung schwer.

Fazit & Empfehlung

Geeignet für MCP-Pipelines mit Recherche, Tool-Auswahl und kontrollierter Fehlerbehandlung, besonders wenn aktuelle Web-Daten wichtiger sind als perfekte Verdichtung. Nicht geeignet als letzte Instanz für präzise Extraktion, regulatorische Zusammenfassungen oder strikt deterministische Fetch-Flows ohne zusätzliche Validierung. Deploy nur mit Schema-Checks, Response-Validation und einer nachgelagerten Kontrolle der extrahierten Fakten.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.