Qwen 3.8 27B

Qwen3.8-27B ist Alibabas dichte 27,8-Milliarden-Parameter-Variante der Qwen3.8-Familie (14. August 2026), nativ multimodal mit Vision-Encoder für Text, Bild und Video unter Apache-2.0-Lizenz. Die 64-Layer-Hybrid-Architektur aus Gated-DeltaNet- plus Gated-Attention-Blöcken plus Multi-Token-Prediction liefert 262.144 Tokens Kontext (erweiterbar auf rund eine Million via YaRN), konfigurierbares Reasoning (xhigh/medium/low) und optionalen No-Thinking-Modus.

Alibaba Version 3.8 Kommerzielle Nutzung erlaubt Dense 27.8 B (27.8 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Long Context
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von Alibaba entwickelt, einem Unternehmen mit Sitz in China. Dies birgt ein theoretisches Risiko aufgrund der chinesischen Gesetzgebung. Da die Gewichte jedoch unter der permissiven Apache-2.0-Lizenz veröffentlicht wurden und für den lokalen Einsatz vorgesehen sind, erfolgt keine Datenübertragung an den Hersteller. Das Risiko wird als ‘mittel’ eingestuft: Der Ursprung liegt in einer Hochrisiko-Jurisdiktion, aber die offene Lizenz und die lokale Nutzung minimieren das praktische Risiko erheblich.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.01
First Request
MCP
2.93
Protocol Latency
Synthesis
24.86
Response Generation
Total
184.85
Sum of All Phases
Token
10211
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, die Gesamtsynthese aber zu unzuverlässig bleibt und die Tool-Calls im Lauf nicht durchgängig valide waren. Für produktive MCP-Pipelines taugt es als ausführendes Modell eher als als vertrauenswürdige Endverdichtung.

Tool-Execution-Profil

Qwen 3.8 27B zeigt echte Werkzeugintelligenz. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, erkennt es den Bedarf für web_search sauber. Das spricht gegen ein starres Muster und für situationsabhängige Tool-Wahl. Auch bei Multilingual Search & Synthesis und EU License Research greift es konsequent zu externen Quellen.

Schwächer ist die Präzision im nachgelagerten Ausführen. Beim URL-Construction-Test konstruiert es die Ziel-URL brauchbar, aber nicht stabil genug für deterministische Pipelines. Der Wert ist ordentlich, nicht belastbar. Dass der Run insgesamt als tool_call_valid=false markiert ist, ist der wichtigste operative Vorbehalt: Das Modell plant richtig, produziert aber nicht durchgängig protokollsaubere oder vollständig valide Aufrufe. Für MCP-Orchestrierung heißt das: vor den Tools ein Validator, hinter den Tools ein Kontrollschritt.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mittel. Die P2-Leistung von 65.83 passt zum Aufgabenbild: HTTP Fetch & Extract und URL Construction & Fetch sind ordentlich, aber EU License Research fällt mit P2=20 deutlich ab. Das ist kein kleiner Ausreißer, sondern ein Warnsignal für Pipelines, in denen aus Webfunden belastbare Schlussfolgerungen oder Compliance-Aussagen gebaut werden sollen. Das Modell findet Quellen häufiger, als es sie sauber verdichtet.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht verlässlich genug. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen gezogen werden, halluziniert es zwar nicht offen. Trotzdem ist das Vertrauensurteil schwach, weil die Verdichtung fast kollabiert. Anders gesagt: Es erfindet nichts, aber es beweist auch nicht, dass es die Tool-Ergebnisse präzise in belastbare Aussagen übersetzt.

Fehlerresilienz

Beim 404-Test, der transparente Reaktion auf einen fehlgeschlagenen Tool-Call misst, bleibt Qwen 3.8 27B auf der richtigen Seite der Sicherheitslinie. Es halluziniert keinen Seiteninhalt. Das ist produktionsrelevant positiv. Die Qualität der Fehlerkommunikation ist mit P2=40 jedoch nur begrenzt brauchbar. Das Modell ist also defensiv statt elegant: akzeptabel für Produktion, wenn der Orchestrator Fehlerzustände selbst klar behandelt.

Betriebsprofil

Call 1: 3.01s. MCP-Latenz: 2.93s. Call 2: 24.86s. Total: 184.85s.
Für die gezeigte Leistung langsam. Kosten/Run: local. Finanziell günstig, zeitlich teuer.

Fazit & Empfehlung

Geeignet für lokal betriebene Recherche-, Search-Routing- und Vorverarbeitungs-Pipelines, in denen ein zweites System die Ergebnisse validiert, normalisiert oder final formuliert. Nicht geeignet als alleinige Endinstanz für Compliance, Lizenzbewertung, regulatorische Zusammenfassungen oder andere Tool-Pipelines, bei denen die Synthese selbst das Produkt ist. Wer ihm eine Tool-Infrastruktur übergibt, sollte es als guten Beschaffer und ordentlichen Ausführer einsetzen, nicht als letzte vertrauensstiftende Stimme.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.