Qwen 3.6 35B-A3B NVFP4 (vLLM, MoE, MTP) (Thinking)

Qwen 3.6 35B-A3B ist Alibabas MoE-Modell mit 35 Mrd. Gesamt- und rund 3 Mrd. aktiven Parametern pro Token, veröffentlicht am 22. April 2026 unter Apache 2.0 mit offenen Gewichten für lokalen Betrieb. Die hybride Attention-Architektur kombiniert klassische Aufmerksamkeit mit linearer Variante, Multi-Token-Prediction beschleunigt die Generierung spürbar.

Alibaba Version 3.6-35B-A3B-Instruct Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • VSPK
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Batch

Sovereign Risk: MEDIUM Das Modell stammt vom Qwen-Team (Alibaba), das in China ansässig ist. Die Einstufung des Risikos als ‘mittel’ statt ‘hoch’ berücksichtigt, dass es sich um ein Open-Source-Modell unter permissiver Apache-2.0-Lizenz handelt, das vollständig lokal ohne Cloud-Verbindung zu Alibaba-Servern betrieben werden kann. Bei rein lokalem Betrieb entfällt die NSL-Relevanz praktisch vollständig, ein theoretisches Restrisiko aufgrund der chinesischen Entwickler-Jurisdiktion bleibt für die Herkunftsbewertung bestehen.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
73.2
Routine
43.97
Reasoning
29.23

Rank #41

LLM Judge Avg
3.72
100 Coverage
Avg Task Duration
45.89
Batch
Token Rate
36.56
Output Rate
P95 Latency
85.34
Top 5 %
Total Tokens
193500
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 193500 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.6 35B-A3B NVFP4 (vLLM, MoE, MTP) (Thinking) Bestes Modell Ø Alle Modelle
Code Quality 76.5
CLI Benchmark 91.67
Logical Reasoning 71
UX Writing 68.35
Documentation 68.01
Content Transform. 73.71
Cultural Intelligence 77.6
Synthesis Quality 56.67
Tool Execution 83.33
ToolUse Score 68
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil