Kimi K3

Kimi K3 ist seit Juli 2026 Moonshot AIs Frontier-Flaggschiff mit 2,8 Billionen Gesamtparametern als bislang grösstes Open-Weights-Modell der Welt. Die Stable-LatentMoE-Architektur aktiviert pro Token nur 16 Milliarden Parameter aus 896 Experten, das Kontextfenster umfasst 1.000.000 Tokens für langhorizontige Agentic-Workflows. Kimi Delta Attention und Attention Residuals sollen die Skalierungseffizienz gegenüber dem Vorgängermodell deutlich verbessern.

Moonshot AI Version k3 Kommerzielle Nutzung erlaubt MoE 2800 B (16 B aktiv) 1000 K Context 02/2026 $3 / $15 per 1M

  • Open Weights
  • Frontier
  • OR
  • Text
  • Vision
  • Video
  • Long Context
  • Agentic Orchestrator
  • Unusable

Sovereign Risk: HIGH Moonshot AI ist ein chinesisches Unternehmen und unterliegt dem chinesischen National Security Law (NSL), das staatlichen Zugriff auf Daten über in China gehostete Dienste ermöglichen kann. Das BSI hat im Februar 2025 explizit vor der Nutzung chinesischer KI-Cloud-Dienste gewarnt; diese Risikoeinschätzung gilt konservativ auch hier. Kimi K3 ist als 2.8T-Open-Weights-Modell angekündigt, dessen Gewichte ab dem 27. Juli 2026 veröffentlicht werden sollen; das operative Risiko entsteht primär aus Cloud-Nutzung unter chinesischer Jurisdiktion, nicht aus dem bloßen Vorhandensein offener Gewichte.[web:605][web:610]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
78.04
Routine
47.08
Reasoning
30.97

Rank #3

LLM Judge Avg
3.95
100 Coverage
Avg Task Duration
124.61
Unusable
Token Rate
16.09
Output Rate
P95 Latency
331.74
Top 5 %
Total Tokens
210000
Output Volume
Cost per 1K
$0.015
USD / 1K Requests
Benchmark Cost
$3.15
Total · 210000 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Kimi K3 Bestes Modell Ø Alle Modelle
Code Quality 80.92
CLI Benchmark 93
Logical Reasoning 78.59
UX Writing 76.25
Documentation 68.98
Content Transform. 79.44
Cultural Intelligence 75.32
Synthesis Quality 73.33
Tool Execution 88.33
ToolUse Score 79.33
Benchmark Cost $3.15

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil