GLM-5.3-Flash (EXL3, TensorFold)

Diese EXL3-Quantisierung von Z.AIs GLM-5.3-Flash läuft über TensorFold, eine junge offene Inferenz-Engine mit verlustfreiem spekulativem Decoding: beschleunigte Draft-Tokens entsprechen exakt dem Ergebnis serieller Dekodierung. Das MoE aktiviert rund 18 Milliarden von 320 Milliarden Parametern pro Token, verarbeitet Text, Bild und Video, und die Gewichte stehen unter MIT-Lizenz.

Zhipu AI Version 5.3-Flash Kommerzielle Nutzung erlaubt MoE 320 B (18 B aktiv) 1000 K Context

  • Open Weights
  • Server
  • TensorFold
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse. Die TensorFold-Variante nutzt dieselben EXL3-Weights wie die vLLM-Baseline (glm-5_3-flash-exl3); das Risiko bezieht sich auf die Weights, nicht auf die Serving-Engine.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.37
First Request
MCP
0.93
Protocol Latency
Synthesis
32.43
Response Generation
Total
220.36
Sum of All Phases
Token
17277
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator · Long Context

Deployment-Urteil

Bedingt deployen, weil die Tool-Ausführung stark ist, aber die Tool-Calls nicht durchgehend valide waren und die Synthesequalität für produktionsnahe Wissenspipelines zu unstet bleibt. Der Combined-Score ist gut, das Vertrauensprofil ist es nur teilweise.

Tool-Execution-Profil

GLM-5.3-Flash zeigt echte Werkzeugintelligenz statt starrem Musterabruf. Beim Web-Search-and-Tool-Selection-Test, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, erkennt das Modell den richtigen Zugriffspfad sicher. Das ist ein starkes Signal für agentische Orchestrierung. Auch beim HTTP-Fetch-and-Extract-Test arbeitet es funktional und strukturiert genug für typische MCP-Schritte.

Schwächer ist die Präzision im letzten Meter. Beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und den anschließenden Fetch misst, ist die Ausführung brauchbar, aber nicht deterministisch genug für strenge Pipelines. Dazu passt der Befund „Tool-Call valide: false“. Das Modell versteht also meist, welches Werkzeug es braucht, produziert aber nicht in jedem Fall einen protokollsauberen oder vollständig belastbaren Call. Dass kein Retry nötig war, spricht gegen ein grundlegendes Formatproblem und eher für punktuelle Ausführungsunschärfe.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mittel. Die P2-Leistung von 73.33 ist für ein agentisches Server-Modell nicht stark genug, wenn nach dem Abruf präzise, knappe und belastbare Zusammenfassungen erwartet werden. Das sieht man deutlich an EU License Research und Multilingual Search & Synthesis, wo die Recherche gelingt, die Verdichtung aber auf 40 fällt. Für reine Tool-Orchestrierung reicht das. Für Compliance-nahe oder mehrsprachige Entscheidungsnotizen nicht.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Das Vertrauensurteil ist gemischt, aber nicht negativ. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen beantwortet werden, gibt es keine erkannte Halluzination. Gleichzeitig ist die niedrige Synthesequalität dort ein Warnsignal: Das Modell erfindet nichts, bindet die gefundenen Inhalte aber nicht sauber genug in eine belastbare Antwort zurück.

Fehlerresilienz

Gut genug für Produktion. Beim 404-Test, der transparentes Verhalten bei scheiterndem Tool-Aufruf misst, kommuniziert das Modell den Fehler offen und halluziniert keinen Seiteninhalt. Genau dieses Verhalten braucht eine Tool-Pipeline. Ein fehlgeschlagener Call bleibt als Fehler sichtbar und wird nicht in falsches Wissen umgewandelt.

Souveränitätsprofil

Lokal betreibbar, offen lizenziert und damit souverän einsetzbar. Einordnung gegen Fleet-Ø entfällt, weil der Sovereignty Gap als n/a vorliegt.

Fazit & Empfehlung

Geeignet für lokal betriebene MCP-Pipelines, in denen Tool-Wahl, Suchanstoß und Fehlertransparenz wichtiger sind als perfekte Endverdichtung. Gut für Recherche-Orchestrierung, Web-Zugriff, Vorverarbeitung und Agent-Steps mit menschlicher oder nachgelagerter Validierung. Nicht die erste Wahl für Compliance-Ausgaben, mehrsprachige Executive Summaries oder jede Pipeline, in der die Antwort direkt als verlässliches Endartefakt dient. Hier braucht es eine zweite Prüfschicht oder ein stärkeres Synthesemodell hinter dem Tool-Layer.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.