GLM-5.3-Flash
320 Milliarden Gesamt-, 18 Milliarden aktive Parameter und MIT-Lizenz: GLM-5.3-Flash ist die offene Mid-Tier-Variante von Z.AIs 5.3-Familie für Coding- und Agentic-Workloads, mit nativem Bild- und Video-Verständnis und einer Million Tokens Kontext. Hybride Attention hält den Inference-Footprint trotz Gesamtgröße moderat. Reasoning ist verpflichtend aktiv, Gewichte laufen lokal — das Souveränitätsrisiko der Cloud entfällt.
- Open Weights
- Frontier
- OpenRouter
- Text
- Vision
- Video
- Agentic Orchestrator
- Long Context
- Batch
Sovereign Risk: HIGH Z.AI hat seinen Sitz in China, daher unterliegen Entwicklung und mögliche Cloud-Nutzung chinesischer Jurisdiktion. Die Gewichte sind öffentlich unter MIT-Lizenz verfügbar, was lokales Deployment und unabhängige Prüfung ermöglicht und das Souveränitätsrisiko gegenüber reinem Cloud-Betrieb deutlich reduziert. Bei Cloud-Nutzung bleiben jedoch chinesische Rechts- und Plattformrisiken relevant.[web:675][web:677][web:684]
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Gold
- 80.61
- Routine
- 48.92
- Reasoning
- 31.69
- LLM Judge Avg
- 4.12 / 5
- 100 Coverage
- Avg Task Duration
- 70.05s
- Batch
- Token Rate
- 52.68tok/s
- Output Rate
- P95 Latency
- 212.53s
- Top 5 %
- Total Tokens
- 212600
- Output Volume
- Cost per 1K
- $0.0005
- USD / 1K Requests
- Benchmark Cost
- $0.11
- Total · 212600 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian