Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95B ist Alibabas erste Open-Weights-Veröffentlichung auf Qwen-Max-Niveau (12. August 2026), ein fein granulare Mixture-of-Experts-Modell mit 2,4 Billionen Gesamt- und 95 Milliarden aktiven Parametern pro Token. Lizenz: eigene ‘Qwen3.8-Max License’. Das Modell verarbeitet Text in 262.144 Tokens Kontext (erweiterbar auf rund eine Million) bei verpflichtendem Reasoning-Modus (low/high/xhigh) und Hybrid-Attention aus Gated-DeltaNet plus Gated-Attention.

Qwen Version 3.8 Kommerzielle Nutzung erlaubt MoE 2400 B (95 B aktiv) 262 K Context $2 / $6 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Long Context
  • Agentic Orchestrator
  • Batch

Sovereign Risk: HIGH Das Modell wird vom Qwen Team bei Alibaba Cloud entwickelt, einem Unternehmen mit Sitz in China. Aufgrund der chinesischen Gesetzgebung (u.a. National Security Law) und der damit verbundenen potenziellen staatlichen Einflussnahme auf Technologiefirmen wird das Herkunftsrisiko der Gewichte als hoch eingestuft, unabhängig vom Deployment-Ort.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.45
First Request
MCP
1.03
Protocol Latency
Synthesis
48.51
Response Generation
Total
317.92
Sum of All Phases
Token
26475
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Long Context · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, aber die Calls nicht durchgängig valide sind und die Synthesequalität für produktionskritische Pipelines zu ungleich ausfällt. Der kombinierte Befund ist gut, das Vertrauenssignal reicht aber nicht für unbewachte Übergabe einer Tool-Infrastruktur.

Tool-Execution-Profil

Qwen3.8-2.4T-A95B zeigt echte Werkzeugintelligenz statt starrer Muster. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, erkennt es zuverlässig, dass zuerst web_search statt fetch nötig ist. Das spricht für brauchbare Planungsfähigkeit in dynamischen MCP-Pipelines.

Weniger sauber ist die Ausführungsschicht. Beim URL-Construction-Test, der die Ableitung einer Ziel-URL aus Eigenwissen und den anschließenden Fetch misst, arbeitet es brauchbar, aber nicht deterministisch genug für harte Automationspfade. Die invalide Tool-Call-Bewertung trotz hoher P1-Leistung zeigt: Das Modell versteht die Werkzeugrolle, produziert aber nicht in jedem Schritt protokollsaubere Aufrufe. Für produktive Nutzung heißt das: Orchestrator ja, aber mit Validator, Schema-Gate und enger Tool-Wrapping-Schicht.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht verlässlich scharf genug. Die P2-Leistung bleibt mit 66.67 klar hinter der Tool-Ausführung zurück. In HTTP Fetch & Extract und URL Construction & Fetch verdichtet es ordentlich, bei Multilingual Search & Synthesis bricht die Qualität deutlich ein. Das ist relevant, weil der Engpass hier nicht Recherche, sondern belastbare Zusammenführung ist.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Eher ja, mit Restzweifel. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen beantwortet werden, halluziniert es nicht. Das ist das zentrale Vertrauenssignal. Allerdings ist die Auswertung nur mittelstark, was auf zu lockere Bindung an die Quelle statt auf freie Erfindung hindeutet.

Fehlerresilienz

Akzeptabel für Produktion. Im 404-Test, der transparenten Umgang mit einem fehlgeschlagenen Tool-Aufruf gegen erfundenen Ersatzinhalt stellt, kommuniziert das Modell den Fehler ohne Halluzination. Genau dieses Verhalten braucht eine Tool-Pipeline: sichtbarer Ausfall statt stiller Falschantwort.

Betriebsprofil

Call 1: 3.45s. MCP-Latenz: 1.03s. Call 2: 48.51s. Total: 317.92s. Langsam.
Kosten/Run: local. Günstig im direkten Run-Kostenbild, aber teuer in Zeit pro Aufgabe.
Für das gezeigte Leistungsniveau ist das Betriebsprofil nur tragbar, wenn Durchsatz nicht kritisch ist.

Fazit & Empfehlung

Geeignet für agentische Recherche- und Orchestrierungs-Pipelines mit vorgeschalteter Tool-Validierung, klaren Antwortformaten und nachgelagerter Prüfung der Ergebnisverdichtung. Nicht geeignet für Compliance-, Policy- oder mehrsprachige Executive-Synthesis-Pfade, in denen die Zusammenfassung selbst das Produkt ist. Wenn Sie ein Modell suchen, das Tools klug auswählt und Fehler ehrlich meldet, ist es ein brauchbarer Steuerknoten. Wenn Sie ein Modell suchen, dem Sie auch die letzte Verdichtungsschicht ohne Kontrolle überlassen, ist es noch nicht robust genug.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.