GLM-5.3-Flash (EXL3, TensorFold)
Diese EXL3-Quantisierung von Z.AIs GLM-5.3-Flash läuft über TensorFold, eine junge offene Inferenz-Engine mit verlustfreiem spekulativem Decoding: beschleunigte Draft-Tokens entsprechen exakt dem Ergebnis serieller Dekodierung. Das MoE aktiviert rund 18 Milliarden von 320 Milliarden Parametern pro Token, verarbeitet Text, Bild und Video, und die Gewichte stehen unter MIT-Lizenz.
- Open Weights
- Server
- TensorFold
- Text
- Vision
- Video
- Agentic Orchestrator
- Long Context
- Batch
Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse. Die TensorFold-Variante nutzt dieselben EXL3-Weights wie die vLLM-Baseline (glm-5_3-flash-exl3); das Risiko bezieht sich auf die Weights, nicht auf die Serving-Engine.
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Gold
- 80.94
- Routine
- 49.31
- Reasoning
- 31.63
- LLM Judge Avg
- 4.19 / 5
- 100 Coverage
- Avg Task Duration
- 119.21s
- Batch
- Token Rate
- 55.51tok/s
- Output Rate
- P95 Latency
- 354.98s
- Top 5 %
- Total Tokens
- 345700
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 345700 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian