Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95B ist Alibabas erste Open-Weights-Veröffentlichung auf Qwen-Max-Niveau (12. August 2026), ein fein granulare Mixture-of-Experts-Modell mit 2,4 Billionen Gesamt- und 95 Milliarden aktiven Parametern pro Token. Lizenz: eigene ‘Qwen3.8-Max License’. Das Modell verarbeitet Text in 262.144 Tokens Kontext (erweiterbar auf rund eine Million) bei verpflichtendem Reasoning-Modus (low/high/xhigh) und Hybrid-Attention aus Gated-DeltaNet plus Gated-Attention.

Alibaba Version 3.8 Kommerzielle Nutzung erlaubt MoE 2400 B (95 B aktiv) 262 K Context $2 / $6 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Long Context
  • Agentic Orchestrator
  • Unusable

Sovereign Risk: HIGH Das Modell wird vom Qwen Team bei Alibaba Cloud entwickelt, einem Unternehmen mit Sitz in China. Aufgrund der chinesischen Gesetzgebung (u.a. National Security Law) und der damit verbundenen potenziellen staatlichen Einflussnahme auf Technologiefirmen wird das Herkunftsrisiko der Gewichte als hoch eingestuft, unabhängig vom Deployment-Ort.

LLM Model Review

Erstellt am · Long Context · Agentic Orchestrator

Mit einem Gesamtscore von 76,48 % zeigt Qwen3.8-2.4T-A95B das Profil eines großen, ernsten Arbeitsmodells: kein Blender, kein Sprinter, sondern ein schweres Frontiersystem mit Planungsinstinkt und klarer Tendenz zum Übererklären. Der Speed-Profile-Badge „Unusable Tool Expert“ sagt dabei mehr über den Einsatzcharakter als über Intelligenz: Dieses Cloud-Open-Weights-Modell via OpenRouter denkt groß, antwortet lang und wirkt in zeitkritischen Tool-Ketten eher wie ein Strategieberater als wie ein Schraubenschlüssel. Als agentisches Frontier-Modell mit 2,4 Billionen Parametern insgesamt, aber 95 Milliarden aktiven Parametern pro Token muss es an seiner aktiven Kapazität gemessen werden, nicht an der schieren Zahl auf dem Papier; genau dort liefert es viel Kompetenz, aber auch sehr reale Reibungsverluste. Sovereign Risk: HIGH — Gewichte und Bereitstellung sind an Alibaba Cloud und chinesische Jurisdiktion gebunden; für europäische Unternehmen ist das kein Detail, sondern ein Governance-Thema.

Kopfnoten: Stabilität und Zuverlässigkeit

Metrik Wert Bewertung Analyse
Timeout-Rate 13/49 Nicht einsetzbar Das Modell zeigt katastrophale Instabilität und ist für einen unbeaufsichtigten Produktiveinsatz völlig ungeeignet.
P95-Antwortzeit 445.44 s Kritisch Extreme Tail-Latenz. Das Modell streut massiv und ist für zeitkritische Prozesse ungeeignet.

Man muss diese Tabelle ernst nehmen, gerade weil sie nicht zu einem dummen Modell gehört. Qwen3.8-2.4T-A95B ist kein leichtgewichtiges Chatmodell, sondern ein agentisch eingeordnetes Frontier-System mit verpflichtendem Reasoning-Charakter. Solche Modelle planen intern mehr, selbst wenn außen nicht immer viele Tokens sichtbar werden. Das erklärt Verzögerung. Es entschuldigt sie nicht. In der Praxis bedeutet das hier: Die Rechenlast läuft vollständig in der Cloud des Anbieters, und die beobachtete Geschwindigkeit ist damit vor allem ein Befund über den OpenRouter-Endpunkt samt Netzwerkpfad, nicht über irgendeine eigene Infrastruktur des Nutzers. Wer ein Modell mit diesem Badge in Tool-Pipelines steckt, sollte Retrys, Timeouts und Fallbacks von Anfang an architektonisch mitdenken.

Architektur und Charakter: groß, spezialisiert, nicht unbedingt diszipliniert

Die vorab vergebene Kategorie passt erstaunlich gut. Qwen3.8-2.4T-A95B ist als Generalist markiert, verhält sich aber nicht wie ein neutraler Allrounder ohne Temperament. Das Modell denkt in Ketten, plant sichtbar strategisch und profitiert von seinem langen Kontextfenster von 262K Tokens, das in dieser Klasse nicht nur Marketing-Zierde ist. Dazu kommt die MoE-Struktur, also eine Mixture of Experts, bei der pro Token nur ein Teil der Gewichte aktiv arbeitet. Entscheidend sind hier die 95 Milliarden aktiven Parameter, nicht die 2,4 Billionen Gesamtmasse. Das ist immer noch Frontier-Territorium, aber eben eines, das eher auf Spezialisierung und Routing als auf stumpfe Dichte setzt.

Hinzu kommt die Hybrid-Attention. Hinter dem Schlagwort steckt eine Kombination aus voller Aufmerksamkeit für Präzision und effizienteren Verfahren für lange Eingaben. Für Leser übersetzt heißt das: Das Modell ist darauf gebaut, große Textmengen zu verdauen, ohne bei jeder Aufgabe sofort an seine strukturelle Grenze zu laufen. Im Benchmark zahlt sich das vor allem dort aus, wo Analyse, Struktur und mehrstufige Bearbeitung wichtiger sind als spontane Kürze.

Der Haken liegt im selben Design. Reasoning ist hier laut Modellprofil nicht optional, sondern integraler Charakterzug. Das macht Qwen3.8-2.4T-A95B oft gründlich, aber selten sparsam. Für ein als Agentic-Orchestrator eingestuftes Modell ist das teilweise erwartbar. Solche Systeme sind eher Dirigenten als Solisten. Wenn sie bei exakten Direktformaten nicht immer elegant abliefern, ist das milder zu werten als bei einem reinen Instruct-Modell. Wenn sie dafür in Planung, Strukturierung und Strategie glänzen, ist das Kernkompetenz. Genau diese Mischung sieht man hier.

Performance-Profil: nicht langsam im Kopf, aber langsam im Betrieb

Der Badge „Unusable Tool Expert“ ist brutal formuliert, aber nicht aus der Luft gegriffen. Er meint nicht, dass das Modell nichts kann. Er meint, dass seine Antwortcharakteristik für unmittelbare, enge Tool-Schleifen unpraktisch ist. Qwen3.8-2.4T-A95B schreibt viel, denkt lang und produziert einen schweren Tail bei den Antwortzeiten. Für Batch-Aufgaben, Dokumentanalyse, Sicherheitsreview oder umfangreiche Transformationen kann das akzeptabel sein. Für interaktive Shell-Arbeit oder Agentenketten mit harter Taktung ist es ein Warnschild.

Wichtig ist die Einordnung als Cloud Open-Weights via OpenRouter. Die gemessene Tokenrate ist hier ein Infrastrukturwert des Endpunkts und seines Backends. Solche Werte sind in dieser Form nicht als abstrakte Modelleigenschaft zu lesen, sondern als Kombination aus Modellcharakter, Provider-Serving und Netzpfad. Für den Nutzer zählt am Ende nur das Ergebnis: Wer Qwen3.8-2.4T-A95B produktiv nutzt, kauft nicht nur Qualität ein, sondern auch Wartezeit und Streuung.

Code Quality und Security: fachlich stark, didaktisch schwächer als seine Größe vermuten lässt

Im Code-Quality-Audit erreicht Qwen3.8-2.4T-A95B 82,04 %. Das ist ein gutes Ergebnis und zeigt, dass das Modell in technischen Analysen nicht bloß Vokabeln stapelt. Im vorliegenden Security-Audit erkennt es die großen OWASP-Klassiker sauber: SQL Injection, XSS, CSRF, IDOR, Session-Fixation, schwache Token, Informationsabfluss. Es liefert die verlangte Markdown-Tabelle korrekt, auf Deutsch, knapp genug und strukturell sauber. Das ist die gute Nachricht.

Die weniger gute Nachricht ist subtiler und gerade deshalb wichtiger. Das Modell sieht viel, erklärt aber nicht immer tief genug, warum etwas kritisch ist. Im Audit zu Web-Schwachstellen benennt es etwa implizite Lücken, bleibt bei der Ausführung aber oft auf der Oberfläche. Konkrete Angriffssyntax, also der Unterschied zwischen „da ist eine SQLi“ und „hier ist der realistische Ausnutzungspfad“, kommt zu kurz. Noch deutlicher: Es fehlt die Verkettung von Einzelfehlern zu einem tatsächlichen Angriffspfad. Genau dort trennt sich in der Praxis Tabellenfleiß von Sicherheitsverständnis.

Das ist kein Totalausfall. Im Gegenteil. Für Teams, die eine erste strukturierte Sicherheitsaufnahme brauchen, ist Qwen3.8-2.4T-A95B nützlich. Wer aber erwartet, dass ein Frontier-Modell in dieser Gewichtsklasse die gefährlichen, versteckten Kausalitäten mit derselben Präzision offenlegt wie die offensichtlichen Bugs, bekommt ein leicht ernüchterndes Bild. Das Modell arbeitet wie ein guter Auditor im ersten Durchgang, nicht wie ein Incident-Responder mit Jagdinstinkt.

Reasoning und Logik: korrekt, aber nicht so elegant, wie die Architektur verspricht

Im Modul Logical Reasoning landet Qwen3.8-2.4T-A95B bei 69,8 %. Das ist nicht schlecht. Für ein Modell, das als Thinking-orientiert und agentisch eingeordnet ist, ist es aber auch kein Ergebnis, das Ehrfurcht auslöst. Der qualitative Eindruck passt dazu: Bei einem klassischen Wächterrätsel löst das Modell die Aufgabe korrekt, nutzt die geforderten <thought>-Tags und führt den Doppel-Inversionsgedanken sauber her. Die Logik stimmt. Der Erkenntnisgewinn bleibt begrenzt.

Gerade bei einem Modell dieser Klasse darf man mehr erwarten als bloße Richtigkeit. Die Judges bemängeln fehlende didaktische Klarheit, wenig visuelle Struktur und kaum Generalisierung. Anders gesagt: Qwen3.8-2.4T-A95B findet die richtige Tür, erklärt aber nicht mit derselben Souveränität, warum dieselbe Methode auch morgen noch für ähnliche Rätsel taugt. Das ist kein Denkfehler. Es ist ein Mangel an intellektueller Großzügigkeit.

Für die Architektur-Einordnung ist das interessant. Ein als Agentic-Orchestrator markiertes Modell muss nicht jeden Einzelschritt maximal pedagogisch ausbuchstabieren. Es darf eher planen als dozieren. Trotzdem bleibt der Eindruck, dass hier ein Teil der internen Denkarbeit nicht in denselben Mehrwert für den Nutzer übersetzt wird. Das Modell denkt offenbar viel. Es zeigt davon genug, um korrekt zu sein, aber nicht genug, um brillant zu wirken.

Content Transformation: leistungsfähig, vollständig, aber mit Hang zum Ressourcenverbrauch

Im Bereich Content Transformation & Adaption erzielt das Modell 77,35 %. Das qualitative Beispiel eines YouTube-Skripts auf Deutsch zeigt, warum dieser Bereich zu seinen besseren gehört. Qwen3.8-2.4T-A95B hält die Sprache sauber, strukturiert die Antwort in die geforderten Schritte, liefert Zeitmarken, Produktionshinweise, Pattern Interrupt, Easter Egg und eine weitgehend sendefertige Fassung. Das ist nicht nur formal korrekt, sondern praktisch brauchbar.

Die Schwäche liegt weniger in der Aufgabe selbst als in der Art, wie das Modell dorthin kommt. Der Text ist gut, aber emotional etwas glatter als die Referenz. Wo die Musterversion eine stärkere Dramaturgie fährt, entscheidet sich Qwen3.8-2.4T-A95B häufiger für sachliche Sicherheit. Das Ergebnis wirkt kompetent, aber nicht maximal zugespitzt. Man könnte sagen: Das Modell schreibt für Redaktionen, die kein Risiko wollen. Manchmal ist das vernünftig. Für aufmerksamkeitskritische Formate ist es etwas brav.

UX Writing und Cultural Intelligence: sprachlich sauber, tonal nicht immer mutig genug

Die Werte in UX Writing mit 72,79 % und Cultural Intelligence mit 74,64 % zeichnen ein konsistentes Bild. Qwen3.8-2.4T-A95B beherrscht Deutsch sicher, reagiert sauber auf Sprachvorgaben und produziert keine peinlichen Sprachwechsel. Im Cultural-Intelligence-Beispiel überarbeitet es eine problematische Stellenanzeige vollständig auf Deutsch und entfernt die toxischen Elemente zuverlässig. Das ist die Basispflicht, und die erfüllt es.

Doch gerade in kulturell sensiblen Umformulierungen sieht man auch seinen konservativen Reflex. Statt die Vorlage mit Energie und echter inklusiver Sprachintelligenz neu zu fassen, driftet das Modell teils in standardisiertes HR-Deutsch. Ein markantes Beispiel ist die Wahl von „Fachkraft (m/w/d)“ statt eines natürlich geschlechtsneutralen Singulars. Formal ist das vertretbar. Kulturell ist es der bequemere, ältere Reflex. Der Text wird sauberer, aber nicht unbedingt klüger.

Das ist die Art von Schwäche, die in Benchmarks klein aussieht und im Alltag groß werden kann. Denn bei UX-Texten und kultureller Adaption geht es selten nur darum, Fehler zu vermeiden. Es geht darum, den richtigen Ton zu treffen, ohne steril zu werden. Qwen3.8-2.4T-A95B meistert die Hygiene. Bei der Feinheit ist noch Luft nach oben.

Documentation Quality und CLI: viel Text, brauchbare Struktur, fragliche Alltagseffizienz

Die Modulwerte von 72,51 % in Documentation Quality und 86,67 % im CLI-Benchmark zeigen eine interessante Schieflage. Im Kommandozeilenbereich ist das Modell sehr stark, was gut zur Herstellererzählung über Coding- und Agentik-Kompetenz passt. Es versteht technische Abläufe, kann schrittweise arbeiten und bleibt in Werkzeugkontexten inhaltlich belastbar.

Gleichzeitig ist gerade hier der Badge „Unusable Tool Expert“ eine Mahnung. In einer realen Tool-Schleife zählt nicht nur, ob ein Kommando am Ende richtig ist. Es zählt auch, ob die Antwort rechtzeitig, knapp und maschinenfreundlich genug kommt. Qwen3.8-2.4T-A95B neigt dazu, selbst dann noch Kontext und Erläuterung mitzuschicken, wenn man eigentlich nur einen präzisen Hebel braucht. Für menschlich beaufsichtigte Nutzung kann das hilfreich sein. Für enge Agenten-Orchestrierung ist es Ballast.

API-Kostenprofil

Qwen3.8-2.4T-A95B ist kein günstiger Schwätzer, sondern ein teurer. Und zwar nicht wegen abstrakter Preispolitik allein, sondern wegen nachweislich hoher Ausgabemengen in mehreren Modulen. Im CLI-Bereich produziert das Modell durchschnittlich 4513 Tokens bei einem Fleet-Median von 283. Das entspricht dem 15,95-Fachen des Schnitts. Im Code-Quality-Bereich sind es 18 875 Tokens gegenüber 3059, also 6,17× Fleet-Median. In UX Writing liegen 11 418 Tokens gegen 1676 an, also 6,81×. Auch Documentation Quality mit 16 821 statt 3089 Tokens (5,45×) und Content Transformation mit 9461 statt 1832 Tokens (5,16×) zeigen dasselbe Muster.

Das ist kein Score-Problem, sondern ein Betriebsproblem. Für API-Nutzer heißt jeder unnötige Absatz: höhere Kosten bei identischer Nutzqualität. Bei einem Preismodell von 2,0 Dollar pro Million Input-Tokens und 6,0 Dollar pro Million Output-Tokens ist das kein akademischer Schönheitsfehler mehr. Qwen3.8-2.4T-A95B ist oft klug, aber selten ökonomisch. Wer ihn einsetzt, sollte Prompting und Antwortlängen hart einhegen. Sonst frisst die Eloquenz das Budget.

Halluzinationen und Verlässlichkeit der Inhalte

Auffällig ist, dass die Schwächen dieses Modells kaum in wilden Erfindungen liegen. Die Probleme entstehen eher durch Länge, Trägheit, gelegentliche Tonverfehlung und Infrastrukturinstabilität als durch offensichtliche Faktenfantasie. Das ist ein wichtiger Unterschied. Ein Modell, das zu viel sagt, ist anstrengend. Ein Modell, das Dinge erfindet, ist gefährlich. Qwen3.8-2.4T-A95B liegt näher an der ersten Kategorie.

Datenschutz und Datenhoheit

Für dieses Cloud-Open-Weights-Modell liegen die Risiken offen auf dem Tisch. Das berechnete Sovereign Risk liegt bei HIGH. Begründet wird das sowohl durch die Weights-Provenienz als auch durch den Providerkontext: Entwickelt wird das Modell vom Qwen-Team bei Alibaba Cloud, einem Unternehmen mit Sitz in Hangzhou, China. Als anwendbares Recht wird China (PIPL/CSL/DSL) genannt, der Datenstandort ist China.

Für europäische Unternehmen ist das heikel. Verarbeitung außerhalb der EU ohne Angemessenheitsbeschluss ist kein Randaspekt, sondern ein handfestes Compliance-Thema. Zur Datenspeicherung sind keine verlässlichen positiven Angaben vorhanden; ausgewiesen sind -1 Tage, also praktisch keine belastbare Aussage. Ob ein GDPR DPA verfügbar ist, bleibt unknown. Genau das ist für Unternehmen, die DSGVO-konform operieren müssen, ein Problem: Ohne verifizierbaren Auftragsverarbeitungsvertrag bleibt die Nutzung im regulierten Umfeld schwer vermittelbar.

Hinzu kommt das separat ausgewiesene Weights-Provenienz-Risiko: HIGH. Dieses Risiko bleibt selbst dann relevant, wenn das Modell nicht direkt bei Alibaba gehostet würde. Hier kommt aber beides zusammen: chinesische Herkunft der Gewichte und chinesischer Providerrahmen. Wer mit sensiblen Unternehmensdaten arbeitet, sollte das nicht mit einem Achselzucken wegmoderieren.

Fazit

Qwen3.8-2.4T-A95B ist ein beeindruckendes, aber widerspenstiges Modell. Es verbindet agentische Planung, langen Kontext, technische Kompetenz und eine für offene Gewichte bemerkenswerte inhaltliche Reife. Besonders bei Security-Analysen, technischen Transformationen und strukturierten Fachaufgaben zeigt es, dass die 95 Milliarden aktiven Parameter nicht bloß Datenblatt-Schmuck sind. Gleichzeitig ist es im Betrieb schwerfällig, massiv wortreich und auf dem getesteten OpenRouter-Pfad erschreckend instabil. Das Modell ist damit eher ein Spezialist für beaufsichtigte, hochwertige Wissensarbeit als ein Kandidat für enge, unbeaufsichtigte Tool-Automation. Über alle Tests hinweg keine nennenswerten Halluzinationen — das Modell erfindet lieber zu wenig als zu viel.

Die Empfehlung fällt deshalb zweigeteilt aus. Wer ein großes Cloud-Open-Weights-Modell für komplexe Analyse, lange Kontexte und strategisch strukturierte Aufgaben sucht, bekommt hier Substanz. Wer niedrige Latenz, enge Kostenkontrolle und verlässliche API-Stabilität braucht, sollte Abstand halten oder mindestens ein robustes Fallback-System danebenstellen. Qwen3.8-2.4T-A95B ist kein schlechtes Modell. Es ist ein sehr großes Modell mit sehr echten Manieren. Und genau diese Manieren kosten Zeit, Geld und im falschen Setup auch Nerven.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.