Qwen 3.8 27B (Thinking)

Qwen3.8-27B ist Alibabas dichte 27,8-Milliarden-Parameter-Variante der Qwen3.8-Familie (14. August 2026), nativ multimodal mit Vision-Encoder für Text, Bild und Video unter Apache-2.0-Lizenz. Die 64-Layer-Hybrid-Architektur aus Gated-DeltaNet- plus Gated-Attention-Blöcken plus Multi-Token-Prediction liefert 262.144 Tokens Kontext (erweiterbar auf rund eine Million via YaRN), konfigurierbares Reasoning (xhigh/medium/low) und optionalen No-Thinking-Modus.

Alibaba Version 3.8 Kommerzielle Nutzung erlaubt Dense 27.8 B 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Long Context
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von Alibaba entwickelt, einem Unternehmen mit Sitz in China. Dies birgt ein theoretisches Risiko aufgrund der chinesischen Gesetzgebung. Da die Gewichte jedoch unter der permissiven Apache-2.0-Lizenz veröffentlicht wurden und für den lokalen Einsatz vorgesehen sind, erfolgt keine Datenübertragung an den Hersteller. Das Risiko wird als ‘mittel’ eingestuft: Der Ursprung liegt in einer Hochrisiko-Jurisdiktion, aber die offene Lizenz und die lokale Nutzung minimieren das praktische Risiko erheblich.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
5.95
First Request
MCP
1.45
Protocol Latency
Synthesis
41.48
Response Generation
Total
293.29
Sum of All Phases
Token
14558
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, aber ein invalider Tool-Call und erkannte Halluzination das Vertrauen für unbeaufsichtigte MCP-Pipelines begrenzen. Der Gesamteindruck ist gut, aber nicht robust genug für Hochvertrauensstrecken.

Tool-Execution-Profil

Qwen 3.8 27B zeigt echte Werkzeugintelligenz statt bloßem Musterfolgen. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis zwischen Suche und direktem Abruf unterscheiden lässt, wählt es das passende Tool zuverlässig. Das spricht für brauchbare Planungslogik in dynamischen Pipelines. Beim URL-Construction-Test, der die Ziel-URL aus Eigenwissen ableiten und anschließend korrekt abrufen lässt, ist es dagegen weniger präzise. Das Ergebnis ist brauchbar, aber nicht deterministisch genug für Systeme, die aus Modelltext direkt Requests generieren.

Der P1-Wert von 90 zeigt insgesamt starke Ausführung. Kritisch bleibt jedoch, dass der Tool-Call im Lauf als nicht valide markiert wurde. Das ist kein Retry-Thema, also kein bloßes Formatproblem mit anschließend sauberer Korrektur, sondern ein Zuverlässigkeitssignal: Das Modell kann gute Tool-Entscheidungen treffen, produziert aber nicht durchgehend MCP-saubere Aufrufe.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mittel. Der P2-Wert von 59.17 passt zum Profil: solide bei klaren Fehlerfällen und strukturierter Suche, aber schwächer bei präziser Extraktion und Verdichtung aus Fetch-Inhalten. Besonders HTTP Fetch & Extract, also die saubere Übernahme konkreter Fakten aus abgerufenen Seiten, fällt mit P2 35 deutlich ab. Für Produktionspipelines heißt das: Ergebnisse müssen nach dem Tool-Aufruf oft noch gegengeprüft oder nachnormalisiert werden.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen beantwortet werden, bleibt es auf der sicheren Seite. Keine Halluzination wurde erkannt. Gleichzeitig ist global Halluzination erkannt: true gesetzt. Das ist als Sicherheitsrisiko zu werten, nicht als bloßer Qualitätsmangel. Sobald ein Modell erfundene Fakten als Tool-Ergebnis ausgibt, wird die gesamte Tool-Infrastruktur angreifbar.

Fehlerresilienz

Im 404-Test, der transparentes Verhalten bei fehlschlagendem Abruf prüft, reagiert das Modell produktionsgerecht. Es kommuniziert den Fehler offen und erfindet keinen Seiteninhalt. Das ist ein starkes Signal. Solches Verhalten ist für operative Pipelines akzeptabel, weil Fehler sichtbar bleiben und Downstream-Systeme sauber eskalieren können.

Betriebsprofil

Call 1: 5.95s. MCP-Latenz: 1.45s. Call 2: 41.48s. Total: 293.29s.
Lokal: keine API-Kosten.
Geschwindigkeit: langsam bis sehr langsam im Gesamtlauf, gemessen an der nur guten Gesamtleistung.

Fazit & Empfehlung

Geeignet für lokal betriebene Recherche- und Orchestrationspipelines mit menschlicher Kontrolle, besonders wenn Tool-Wahl wichtiger ist als perfekte Verdichtung. Auch für 404-robuste Agentenpfade brauchbar. Nicht geeignet für Compliance-, Fakten- oder Extraktionsstrecken, in denen Tool-Ergebnisse unverändert weiterverarbeitet werden. Wer Qwen 3.8 27B einsetzt, sollte strikte Output-Validierung, Schema-Prüfung und eine zweite Verifikationsstufe hinter jeden Tool-Schritt setzen.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.