GLM-5.3-Flash (EXL3)

GLM-5.3-Flash ist ein multimodales Open-Weight-Modell von Z.AI. Als Mixture-of-Experts (MoE) Architektur mit 320B Gesamt- und 18B aktiven Parametern kombiniert es Effizienz mit hoher Leistung. Es unterstuetzt ein Kontextfenster von 1 Million Tokens und verarbeitet Text-, Bild- und Video-Eingaben. Das Modell ist besonders fuer komplexe Agenten- und Programmieraufgaben optimiert und unter einer permissiven MIT-Lizenz verfuegbar.

Zhipu AI Version 5.3-Flash Kommerzielle Nutzung erlaubt MoE 320 B (18 B aktiv) 1000 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Unusable

Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
79
Routine
48.13
Reasoning
30.86

Rank #9

LLM Judge Avg
3.93
100 Coverage
Avg Task Duration
180.75
Unusable
Token Rate
26.48
Output Rate
P95 Latency
537.46
Top 5 %
Total Tokens
260200
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 260200 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

GLM-5.3-Flash (EXL3) Bestes Modell Ø Alle Modelle
Code Quality 80.84
CLI Benchmark 82.67
Logical Reasoning 75.64
UX Writing 77.15
Documentation 79.09
Content Transform. 80.07
Cultural Intelligence 77.84
Synthesis Quality 73.33
Tool Execution 90
ToolUse Score 80.5
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil