GLM-5.3-Flash (EXL3, TensorFold)

Diese EXL3-Quantisierung von Z.AIs GLM-5.3-Flash läuft über TensorFold, eine junge offene Inferenz-Engine mit verlustfreiem spekulativem Decoding: beschleunigte Draft-Tokens entsprechen exakt dem Ergebnis serieller Dekodierung. Das MoE aktiviert rund 18 Milliarden von 320 Milliarden Parametern pro Token, verarbeitet Text, Bild und Video, und die Gewichte stehen unter MIT-Lizenz.

Zhipu AI Version 5.3-Flash Kommerzielle Nutzung erlaubt MoE 320 B (18 B aktiv) 1000 K Context

  • Open Weights
  • Server
  • TensorFold
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse. Die TensorFold-Variante nutzt dieselben EXL3-Weights wie die vLLM-Baseline (glm-5_3-flash-exl3); das Risiko bezieht sich auf die Weights, nicht auf die Serving-Engine.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Gold
80.94
Routine
49.31
Reasoning
31.63

Rank #4

LLM Judge Avg
4.19
100 Coverage
Avg Task Duration
119.21
Batch
Token Rate
55.51
Output Rate
P95 Latency
354.98
Top 5 %
Total Tokens
345700
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 345700 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

GLM-5.3-Flash (EXL3, TensorFold) Bestes Modell Ø Alle Modelle
Code Quality 85.12
CLI Benchmark 94.34
Logical Reasoning 80.04
UX Writing 79.07
Documentation 82.49
Content Transform. 82.9
Cultural Intelligence 75.96
Synthesis Quality 73.33
Tool Execution 90
ToolUse Score 78.67
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil