Qwen 3.6 35B-A3B NVFP4 (vLLM, MoE, MTP)

Qwen 3.6 35B-A3B ist Alibabas MoE-Modell mit 35 Mrd. Gesamt- und rund 3 Mrd. aktiven Parametern pro Token, veröffentlicht am 22. April 2026 unter Apache 2.0 mit offenen Gewichten für lokalen Betrieb. Die hybride Attention-Architektur kombiniert klassische Aufmerksamkeit mit linearer Variante, Multi-Token-Prediction beschleunigt die Generierung spürbar.

Alibaba Version 3.6-35B-A3B-Instruct Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • VSPK
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Real-Time

Sovereign Risk: MEDIUM Das Modell stammt vom Qwen-Team (Alibaba), das in China ansässig ist. Die Einstufung des Risikos als ‘mittel’ statt ‘hoch’ berücksichtigt, dass es sich um ein Open-Source-Modell unter permissiver Apache-2.0-Lizenz handelt, das vollständig lokal ohne Cloud-Verbindung zu Alibaba-Servern betrieben werden kann. Bei rein lokalem Betrieb entfällt die NSL-Relevanz praktisch vollständig, ein theoretisches Restrisiko aufgrund der chinesischen Entwickler-Jurisdiktion bleibt für die Herkunftsbewertung bestehen.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
70.29
Routine
42.34
Reasoning
27.95

Rank #63

LLM Judge Avg
3.44
100 Coverage
Avg Task Duration
13.42
Real-Time
Token Rate
79.09
Output Rate
P95 Latency
34.52
Top 5 %
Total Tokens
69700
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 69700 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.6 35B-A3B NVFP4 (vLLM, MoE, MTP) Bestes Modell Ø Alle Modelle
Code Quality 74.5
CLI Benchmark 76.12
Logical Reasoning 70.16
UX Writing 66.65
Documentation 72.81
Content Transform. 68.08
Cultural Intelligence 74.3
Synthesis Quality 45.83
Tool Execution 79.17
ToolUse Score 62.58
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil