GLM-5.3-Flash (EXL3)

GLM-5.3-Flash ist ein multimodales Open-Weight-Modell von Z.AI. Als Mixture-of-Experts (MoE) Architektur mit 320B Gesamt- und 18B aktiven Parametern kombiniert es Effizienz mit hoher Leistung. Es unterstuetzt ein Kontextfenster von 1 Million Tokens und verarbeitet Text-, Bild- und Video-Eingaben. Das Modell ist besonders fuer komplexe Agenten- und Programmieraufgaben optimiert und unter einer permissiven MIT-Lizenz verfuegbar.

Zhipu AI Version 5.3-Flash Kommerzielle Nutzung erlaubt MoE 320 B (18 B aktiv) 1000 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Video
  • Agentic Orchestrator
  • Long Context
  • Unusable

Sovereign Risk: MEDIUM Das Modell wurde von Z.AI entwickelt, einem Unternehmen mit Sitz in China (CN). Das Risiko wird als ‘mittel’ und nicht ‘hoch’ eingestuft, da die Gewichte unter der sehr permissiven MIT-Lizenz veroeffentlicht wurden. Dies reduziert die Abhaengigkeit vom Hersteller und mitigiert einige der Risiken, die mit der chinesischen Gerichtsbarkeit verbunden sind. Dennoch bleibt ein Restrisiko bezueglich der Trainingsdaten-Provenienz und potenzieller regulatorischer Einfluesse.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
7.92
First Request
MCP
1.43
Protocol Latency
Synthesis
62.21
Response Generation
Total
429.36
Sum of All Phases
Token
17986
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber die Tool-Calls nicht durchgehend valide sind und die Synthese bei wissenssensitiven Recherchen nicht zuverlässig genug im Tool-Befund bleibt.

Tool-Execution-Profil

GLM-5.3-Flash (EXL3) zeigt echte Werkzeugintelligenz. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, wählt es das richtige Tool sicher. Das spricht gegen ein starres Fetch-First-Muster. Auch bei Multilingual Search & Synthesis und EU License Research greift es operativ sauber auf externe Quellen zu.

Die Schwäche liegt nicht in der Planungslogik, sondern in der Präzision einzelner Aufrufe. Beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und den korrekten Abruf misst, arbeitet es brauchbar, aber nicht deterministisch genug für fragile Pipelines. Der Befund „Tool-Call valide: false“ ist deshalb relevant. Für MCP-gestützte Flows mit toleranter Validierung ist das handhabbar. Für streng schema- und routingkritische Ketten ist es ein Risiko.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht stark genug für High-Trust-Ausgaben. Die Extraktion aus echtem Web-Content gelingt sehr gut, ebenso die Verdichtung nach Fehlerfällen und bei HTTP Fetch & Extract. Schwächer wird es bei Rechercheaufgaben mit Interpretationsanteil. EU License Research und Multilingual Search & Synthesis zeigen, dass es Ergebnisse zusammenführt, aber nicht immer trennscharf priorisiert. Das ist der Hauptgrund, warum P2 hinter der Tool-Execution zurückbleibt.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht sauber genug. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen statt aus Modellwissen kommen, fällt die Vertrauensseite deutlich ab. Es halluziniert zwar nicht offen, aber der niedrige Synthese-Befund bedeutet: Es antwortet nicht verlässlich eng am recherchierten Material. Für Compliance-, Policy- oder Lizenz-Pipelines ist das ein Warnsignal.

Fehlerresilienz

Hier ist das Modell produktionsreif. Im 404-Test, der transparentes Verhalten bei fehlschlagendem Tool-Call prüft, kommuniziert es den Fehler korrekt und erfindet keinen Seiteninhalt. Genau dieses Verhalten braucht eine Tool-Pipeline. Ein fehlender Abruf bleibt als fehlender Abruf sichtbar.

Souveränitätsprofil

Lokal betreibbar und insgesamt fleet-kompetent. Der Sovereignty Gap liegt bei -0.89 Punkten unter dem Fleet-Ø von 68.17. Das ist ein sehr kleiner Abstand und stützt den Einsatz dort, wo lokale Gewichte, Datenhoheit und MIT-Lizenz wichtiger sind als letzte Prozentpunkte in der Synthesedisziplin.

Fazit & Empfehlung

Geeignet für agentische MCP-Pipelines mit Suche, Fetch, Orchestrierung und robuster Fehlerbehandlung. Besonders passend für lokale, souveräne Deployments, in denen Tool-Nutzung wichtiger ist als perfekte narrative Verdichtung. Nicht die erste Wahl für Compliance, Lizenzbewertung, regulatorische Recherche oder andere Pipelines, in denen die Antwort strikt am Tool-Beleg kleben muss und URL- sowie Call-Validität deterministisch sein sollen.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.