GLM-5.3-Flash (EXL3)
GLM-5.3-Flash ist ein multimodales Open-Weight-Modell von Z.AI. Als Mixture-of-Experts (MoE) Architektur mit 320B Gesamt- und 18B aktiven Parametern kombiniert es Effizienz mit hoher Leistung. Es unterstuetzt ein Kontextfenster von 1 Million Tokens und verarbeitet Text-, Bild- und Video-Eingaben. Das Modell ist besonders fuer komplexe Agenten- und Programmieraufgaben optimiert und unter einer permissiven MIT-Lizenz verfuegbar.
- Open Weights
- Server
- vLLM
- Text
- Vision
- Video
- Agentic Orchestrator
- Long Context
- Unusable
Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse.
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Silver
- 79
- Routine
- 48.13
- Reasoning
- 30.86
- LLM Judge Avg
- 3.93 / 5
- 100 Coverage
- Avg Task Duration
- 180.75s
- Unusable
- Token Rate
- 26.48tok/s
- Output Rate
- P95 Latency
- 537.46s
- Top 5 %
- Total Tokens
- 260200
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 260200 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian