Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95B ist Alibabas erste Open-Weights-Veröffentlichung auf Qwen-Max-Niveau (12. August 2026), ein fein granulare Mixture-of-Experts-Modell mit 2,4 Billionen Gesamt- und 95 Milliarden aktiven Parametern pro Token. Lizenz: eigene ‘Qwen3.8-Max License’. Das Modell verarbeitet Text in 262.144 Tokens Kontext (erweiterbar auf rund eine Million) bei verpflichtendem Reasoning-Modus (low/high/xhigh) und Hybrid-Attention aus Gated-DeltaNet plus Gated-Attention.

Alibaba Version 3.8 Kommerzielle Nutzung erlaubt MoE 2400 B (95 B aktiv) 262 K Context $2 / $6 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Long Context
  • Agentic Orchestrator
  • Unusable

Sovereign Risk: HIGH Das Modell wird vom Qwen Team bei Alibaba Cloud entwickelt, einem Unternehmen mit Sitz in China. Aufgrund der chinesischen Gesetzgebung (u.a. National Security Law) und der damit verbundenen potenziellen staatlichen Einflussnahme auf Technologiefirmen wird das Herkunftsrisiko der Gewichte als hoch eingestuft, unabhängig vom Deployment-Ort.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.59
First Request
MCP
1.55
Protocol Latency
Synthesis
25.2
Response Generation
Total
188.06
Sum of All Phases
Token
25494
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Long Context · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy. Das Modell ist für Tool-Ausführung stark und halluziniert in diesem Lauf nicht, aber der ungültige Tool-Call bei insgesamt nur guter Gesamtausbeute macht es für produktive MCP-Pipelines nur mit Guardrails vertretbar.

Tool-Execution-Profil

Qwen3.8-2.4T-A95B zeigt echte Werkzeugintelligenz statt bloßem Schema-Folgen. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und Direktabruf prüft, erkennt es sauber, dass erst web_search und nicht fetch nötig ist. Das ist ein gutes Signal für offene, dynamische Agentenpfade. Beim URL-Construction-Test, der die korrekte Ziel-URL aus Eigenwissen plus anschließenden Abruf verlangt, ist es brauchbar, aber nicht deterministisch genug. Hier liegt der Unterschied: Die strategische Tool-Wahl ist stark, die operative Präzision im konkreten Call schwankt. Da der Tool-Call insgesamt nicht valide war und kein Retry nötig wurde, spricht das eher für ein Ausführungs- oder Formatrandproblem als für ein grundsätzliches Missverständnis der Aufgabe.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur ordentlich. Die P2-Leistung von 66,67 passt zu den Einzelbildern: HTTP Fetch & Extract ist sehr sauber, Multilingual Search & Synthesis fällt deutlich ab. Das Modell kann gefundene Informationen strukturieren, verliert aber bei mehrsprachiger oder compliance-naher Verdichtung an Präzision. Für Architekturen, in denen die Tool-Schicht nur Rohmaterial liefert und das Modell den finalen Bericht baut, ist das ein limitierender Faktor.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, bleibt es grundsätzlich im sicheren Bereich. Kein Halluzinationsbefund ist hier das wichtigere Signal als die nur mittlere P2-Ausbeute. Das Vertrauen in die Tool-Kette bleibt also erhalten, auch wenn die Verdichtung nicht durchgehend belastbar ist.

Fehlerresilienz

Akzeptabel für Produktion. Im Test Tool Failure Handling (404), der auf Transparenz bei fehlschlagenden Tool-Calls zielt, kommuniziert das Modell den Fehler, statt Seiteninhalt zu erfinden. Genau das braucht eine robuste Pipeline. Der Befund ist nicht exzellent, aber sicher.

Betriebsprofil

Call 1: 4,59s. MCP-Latenz: 1,55s. Call 2: 25,20s. Total: 188,06s. Langsam für den erzielten Qualitätsstand. Kosten/Run: local. Preisprofil des Modells: $2,0/1M Input, $6,0/1M Output. Für Frontier-Niveau nicht teuer, aber die Laufzeit ist klar der operative Engpass.

Fazit & Empfehlung

Geeignet für agentische Recherche- und Orchestrierungs-Pipelines, in denen Tool-Auswahl, lange Kontexte und vorsichtiger Umgang mit Fehlern wichtiger sind als perfekte Endverdichtung. Nicht die erste Wahl für Compliance-Reports, mehrsprachige Synthese oder strikt deterministische MCP-Strecken, in denen jeder Tool-Call formal sitzen muss. Deploy nur mit Call-Validation, Output-Schema-Checks und einer nachgelagerten Verifikationsschicht für die finale Zusammenfassung.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.