Kimi K3

Kimi K3 ist seit Juli 2026 Moonshot AIs Frontier-Flaggschiff mit 2,8 Billionen Gesamtparametern als bislang grösstes Open-Weights-Modell der Welt. Die Stable-LatentMoE-Architektur aktiviert pro Token nur 16 Milliarden Parameter aus 896 Experten, das Kontextfenster umfasst 1.000.000 Tokens für langhorizontige Agentic-Workflows. Kimi Delta Attention und Attention Residuals sollen die Skalierungseffizienz gegenüber dem Vorgängermodell deutlich verbessern.

Moonshot AI Version k3 Kommerzielle Nutzung erlaubt MoE 2800 B (16 B aktiv) 1000 K Context 02/2026 $3 / $15 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Long Context
  • Agentic Orchestrator
  • Batch

Sovereign Risk: HIGH Moonshot AI ist ein chinesisches Unternehmen und unterliegt dem chinesischen National Security Law (NSL), das staatlichen Zugriff auf Daten über in China gehostete Dienste ermöglichen kann. Das BSI hat im Februar 2025 explizit vor der Nutzung chinesischer KI-Cloud-Dienste gewarnt; diese Risikoeinschätzung gilt konservativ auch hier. Kimi K3 ist als 2.8T-Open-Weights-Modell angekündigt, dessen Gewichte ab dem 27. Juli 2026 veröffentlicht werden sollen; das operative Risiko entsteht primär aus Cloud-Nutzung unter chinesischer Jurisdiktion, nicht aus dem bloßen Vorhandensein offener Gewichte.[web:605][web:610]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
78.83
Routine
47.71
Reasoning
31.12

Rank #9

LLM Judge Avg
3.95
100 Coverage
Avg Task Duration
98.74
Batch
Token Rate
48.28
Output Rate
P95 Latency
310.8
Top 5 %
Total Tokens
219900
Output Volume
Cost per 1K
$0.015
USD / 1K Requests
Benchmark Cost
$3.3
Total · 219900 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Kimi K3 Bestes Modell Ø Alle Modelle
Code Quality 78.64
CLI Benchmark 90.67
Logical Reasoning 75.27
UX Writing 82.31
Documentation 78.33
Content Transform. 75.87
Cultural Intelligence 74.64
Synthesis Quality 73.33
Tool Execution 88.33
ToolUse Score 80.83
Benchmark Cost $3.3

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil