Qwen 3.6 27B

Qwen 3.6 27B ist Alibabas dichtes Open-Weights-Modell mit 27,8 Mrd. aktiven Parametern, das laut Hersteller das eigene MoE-Geschwistermodell 35B-A3B in Coding-, Agent- und Vision-Tests übertrifft. Veröffentlicht am 22. April 2026 unter Apache 2.0 für lokalen Betrieb, kombiniert die Architektur hybride Attention mit nativer Multi-Token-Prediction für spürbaren Durchsatz. Diese Card erfasst die NVFP4-Variante — ein Performance-Update für vLLM auf NVIDIA Blackwell: NVFP4 ist ein 4-Bit-Floating-Point-Format mit zweistufiger Mikroblock-Skalierung (E4M3 pro 16-Werte-Block plus FP32-Per-Tensor-Skala), das den Speicherbedarf gegenüber FP16 um ~3,5× und gegenüber FP8 um ~1,8× senkt bei unter 1 % Genauigkeitsverlust. Vorgängerprofil ohne NVFP4: qwen3_6-27B-pre025 (Card qwen3_6-27B-pre025–VSPK.json, Tests 2026-07-09, vLLM vor 0.25.1).

Alibaba Version 3.6 Kommerzielle Nutzung erlaubt Dense 27.8 B (27.8 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Interactive

Sovereign Risk: MEDIUM Der Entwickler Alibaba hat seinen Hauptsitz in China, was bei der Nutzung von Cloud-Diensten des Herstellers ein potenzielles Risiko im Hinblick auf die chinesische Gesetzgebung (NSL) darstellt. Da die Modellgewichte jedoch unter der Apache-2.0-Lizenz offen verfügbar sind und dieses Modell für den rein lokalen Betrieb konzipiert ist, findet keine Datenübertragung an Server des Herstellers statt. Das Risiko wird daher als ‘mittel’ eingestuft, da der Ursprung in einer Hochrisiko-Jurisdiktion liegt, die praktische Gefahr bei lokaler Nutzung aber minimiert ist.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
73.53
Routine
44.04
Reasoning
29.48

Rank #37

LLM Judge Avg
3.67
100 Coverage
Avg Task Duration
38.34
Interactive
Token Rate
19.04
Output Rate
P95 Latency
103.71
Top 5 %
Total Tokens
67500
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 67500 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.6 27B Bestes Modell Ø Alle Modelle
Code Quality 70.76
CLI Benchmark 84.34
Logical Reasoning 74.41
UX Writing 72.35
Documentation 67.88
Content Transform. 77.23
Cultural Intelligence 70.64
Synthesis Quality 51.67
Tool Execution 83.33
ToolUse Score 76
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil