Qwen 3.6 27B (Thinking)

Qwen 3.6 27B ist Alibabas dichtes Open-Weights-Modell mit 27,8 Mrd. aktiven Parametern, das laut Hersteller das eigene MoE-Geschwistermodell 35B-A3B in Coding-, Agent- und Vision-Tests übertrifft. Veröffentlicht am 22. April 2026 unter Apache 2.0 für lokalen Betrieb, kombiniert die Architektur hybride Attention mit nativer Multi-Token-Prediction für spürbaren Durchsatz. Diese Card erfasst die NVFP4-Variante — ein Performance-Update für vLLM auf NVIDIA Blackwell: NVFP4 ist ein 4-Bit-Floating-Point-Format mit zweistufiger Mikroblock-Skalierung (E4M3 pro 16-Werte-Block plus FP32-Per-Tensor-Skala), das den Speicherbedarf gegenüber FP16 um ~3,5× und gegenüber FP8 um ~1,8× senkt bei unter 1 % Genauigkeitsverlust. Vorgängerprofil ohne NVFP4: qwen3_6-27B-pre025 (Card qwen3_6-27B-pre025–VSPK.json, Tests 2026-07-09, vLLM vor 0.25.1).

Alibaba Version 3.6 Kommerzielle Nutzung erlaubt Dense 27.8 B (27.8 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Unusable

Sovereign Risk: MEDIUM Der Entwickler Alibaba hat seinen Hauptsitz in China, was bei der Nutzung von Cloud-Diensten des Herstellers ein potenzielles Risiko im Hinblick auf die chinesische Gesetzgebung (NSL) darstellt. Da die Modellgewichte jedoch unter der Apache-2.0-Lizenz offen verfügbar sind und dieses Modell für den rein lokalen Betrieb konzipiert ist, findet keine Datenübertragung an Server des Herstellers statt. Das Risiko wird daher als ‘mittel’ eingestuft, da der Ursprung in einer Hochrisiko-Jurisdiktion liegt, die praktische Gefahr bei lokaler Nutzung aber minimiert ist.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
75.61
Routine
45.96
Reasoning
29.66

Rank #20

LLM Judge Avg
3.87
100 Coverage
Avg Task Duration
133.68
Unusable
Token Rate
25.16
Output Rate
P95 Latency
250.91
Top 5 %
Total Tokens
183400
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 183400 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.6 27B (Thinking) Bestes Modell Ø Alle Modelle
Code Quality 70.92
CLI Benchmark 93
Logical Reasoning 75.76
UX Writing 73.41
Documentation 76.39
Content Transform. 78.85
Cultural Intelligence 71.84
Synthesis Quality 49.17
Tool Execution 71.67
ToolUse Score 73.42
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil