Qwen 3.6 27B (Thinking)
Qwen 3.6 27B ist Alibabas dichtes Open-Weights-Modell mit 27,8 Mrd. aktiven Parametern, das laut Hersteller das eigene MoE-Geschwistermodell 35B-A3B in Coding-, Agent- und Vision-Tests übertrifft. Veröffentlicht am 22. April 2026 unter Apache 2.0 für lokalen Betrieb, kombiniert die Architektur hybride Attention mit nativer Multi-Token-Prediction für spürbaren Durchsatz. Diese Card erfasst die NVFP4-Variante — ein Performance-Update für vLLM auf NVIDIA Blackwell: NVFP4 ist ein 4-Bit-Floating-Point-Format mit zweistufiger Mikroblock-Skalierung (E4M3 pro 16-Werte-Block plus FP32-Per-Tensor-Skala), das den Speicherbedarf gegenüber FP16 um ~3,5× und gegenüber FP8 um ~1,8× senkt bei unter 1 % Genauigkeitsverlust. Vorgängerprofil ohne NVFP4: qwen3_6-27B-pre025 (Card qwen3_6-27B-pre025–VSPK.json, Tests 2026-07-09, vLLM vor 0.25.1).
- Open Weights
- Workstation
- vLLM
- Text
- Vision
- Video
- Instruction-Tuned
- Unusable
Sovereign Risk: MEDIUM Der Entwickler Alibaba hat seinen Hauptsitz in China, was bei der Nutzung von Cloud-Diensten des Herstellers ein potenzielles Risiko im Hinblick auf die chinesische Gesetzgebung (NSL) darstellt. Da die Modellgewichte jedoch unter der Apache-2.0-Lizenz offen verfügbar sind und dieses Modell für den rein lokalen Betrieb konzipiert ist, findet keine Datenübertragung an Server des Herstellers statt. Das Risiko wird daher als ‘mittel’ eingestuft, da der Ursprung in einer Hochrisiko-Jurisdiktion liegt, die praktische Gefahr bei lokaler Nutzung aber minimiert ist.
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Silver
- 75.61
- Routine
- 45.96
- Reasoning
- 29.66
- LLM Judge Avg
- 3.87 / 5
- 100 Coverage
- Avg Task Duration
- 133.68s
- Unusable
- Token Rate
- 25.16tok/s
- Output Rate
- P95 Latency
- 250.91s
- Top 5 %
- Total Tokens
- 183400
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 183400 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian