Qwen 3.6 35B-A3B (Unsloth)

Qwen 3.6 35B-A3B ist Alibabas MoE-Modell mit 35 Mrd. Gesamt- und rund 3 Mrd. aktiven Parametern pro Token, veröffentlicht am 22. April 2026 unter Apache 2.0 mit offenen Gewichten für lokalen Betrieb. Die hybride Attention-Architektur kombiniert klassische Aufmerksamkeit mit linearer Variante, Multi-Token-Prediction beschleunigt die Generierung spürbar.

Alibaba Version 3.6 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Video
  • Instruction-Tuned
  • Real-Time

Sovereign Risk: MEDIUM Das Modell stammt vom Qwen-Team (Alibaba), das in China ansässig ist. Die Einstufung des Risikos als ‘mittel’ statt ‘hoch’ berücksichtigt, dass es sich um ein Open-Source-Modell unter permissiver Apache-2.0-Lizenz handelt, das vollständig lokal ohne Cloud-Verbindung zu Alibaba-Servern betrieben werden kann. Bei rein lokalem Betrieb entfällt die NSL-Relevanz praktisch vollständig, ein theoretisches Restrisiko aufgrund der chinesischen Entwickler-Jurisdiktion bleibt für die Herkunftsbewertung bestehen.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
70.53
Routine
43.03
Reasoning
27.5

Rank #62

LLM Judge Avg
3.67
100 Coverage
Avg Task Duration
11.72
Real-Time
Token Rate
67.54
Output Rate
P95 Latency
31.4
Top 5 %
Total Tokens
71300
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 71300 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Qwen 3.6 35B-A3B (Unsloth) Bestes Modell Ø Alle Modelle
Code Quality 64.36
CLI Benchmark 90.67
Logical Reasoning 73.24
UX Writing 65.01
Documentation 75.65
Content Transform. 77.75
Cultural Intelligence 71.44
Synthesis Quality 45.83
Tool Execution 79.17
ToolUse Score 56.21
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil