GLM-5.3-Flash

320 Milliarden Gesamt-, 18 Milliarden aktive Parameter und MIT-Lizenz: GLM-5.3-Flash ist die offene Mid-Tier-Variante von Z.AIs 5.3-Familie für Coding- und Agentic-Workloads, mit nativem Bild- und Video-Verständnis und einer Million Tokens Kontext. Hybride Attention hält den Inference-Footprint trotz Gesamtgröße moderat. Reasoning ist verpflichtend aktiv, Gewichte laufen lokal — das Souveränitätsrisiko der Cloud entfällt.

Zhipu AI Version 5.3-Flash Kommerzielle Nutzung erlaubt MoE 320 B (18 B aktiv) 1000 K Context $0.15 / $0.5 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Batch

Sovereign Risk: HIGH Z.AI hat seinen Sitz in China, daher unterliegen Entwicklung und mögliche Cloud-Nutzung chinesischer Jurisdiktion. Die Gewichte sind öffentlich unter MIT-Lizenz verfügbar, was lokales Deployment und unabhängige Prüfung ermöglicht und das Souveränitätsrisiko gegenüber reinem Cloud-Betrieb deutlich reduziert. Bei Cloud-Nutzung bleiben jedoch chinesische Rechts- und Plattformrisiken relevant.[web:675][web:677][web:684]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Gold
80.61
Routine
48.92
Reasoning
31.69

Rank #1

LLM Judge Avg
4.12
100 Coverage
Avg Task Duration
70.05
Batch
Token Rate
52.68
Output Rate
P95 Latency
212.53
Top 5 %
Total Tokens
212600
Output Volume
Cost per 1K
$0.0005
USD / 1K Requests
Benchmark Cost
$0.11
Total · 212600 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

GLM-5.3-Flash Bestes Modell Ø Alle Modelle
Code Quality 84.52
CLI Benchmark 91.34
Logical Reasoning 78.43
UX Writing 83.01
Documentation 71.68
Content Transform. 81.32
Cultural Intelligence 81.96
Synthesis Quality 68.33
Tool Execution 90
ToolUse Score 78
Benchmark Cost $0.11

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil