GLM-4.7

GLM-4.7 ist das Flagship-Modell von Zhipu AI mit 355 Milliarden Gesamt- und 32 Milliarden aktiven Parametern in MoE-Architektur, optimiert für agentisches Coding, Reasoning und bilinguale Aufgaben in Chinesisch und Englisch. Das Modell unterstützt schaltbares Thinking-System und ist als Open-Weights-Variante lokal oder über Cloud-Schnittstellen einsetzbar.

Zhipu AI Version 4.7 Kommerzielle Nutzung erlaubt MoE 355 B (32 B aktiv) 128 K Context 12/2025 $0.4 / $1.75 per 1M

  • Restricted Weights
  • Frontier
  • OpenRouter
  • Text
  • Instruction-Tuned
  • Batch

Sovereign Risk: HIGH Zhipu AI / Z.AI ist ein chinesisches Unternehmen und unterliegt dem chinesischen National Security Law (NSL), das staatlichen Zugriff auf Daten ermöglichen kann. Das BSI hat im Februar 2025 explizit vor der Nutzung chinesischer KI-Cloud-Dienste gewarnt (BSI-Referenz: Warnung DeepSeek, 04.02.2025); diese Risikoeinschätzung gilt analog für alle chinesischen Cloud-KI-Anbieter, die Nutzerdaten auf chinesischen Servern verarbeiten. Bei rein lokaler Inferenz entfällt das Cloud-Act-äquivalente Risiko.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
6.91
First Request
MCP
1.15
Protocol Latency
Synthesis
41.56
Response Generation
Total
297.72
Sum of All Phases
Token
20987
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung meist tragfähig ist, aber ein invalider Tool-Call und die schwache Synthesetreue das Modell für vertrauenskritische MCP-Pipelines begrenzen.

Tool-Execution-Profil

GLM-4.7 zeigt echte Werkzeugwahl statt reinem Schema-Following. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Fetch prüft, erkennt es den Bedarf für web_search sauber und erreicht volle Tool-Ausführung. Das spricht für brauchbare Orchestrierungslogik. Beim Test URL Construction & Fetch, der die Ableitung einer Ziel-URL aus Modellwissen und den anschließenden Fetch misst, bleibt es dagegen nur solide. Die URL wird brauchbar konstruiert, aber nicht präzise genug für deterministische Pipelines. Kritisch ist der Befund, dass mindestens ein Tool-Call nicht valide war. Das ist kein kosmetischer Formatfehler, sondern ein Integrationsrisiko für MCP-Strecken, die strikte Protokolltreue verlangen.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Eher schwach. Der P2-Wert von 42.50 zeigt sich vor allem bei HTTP Fetch & Extract, wo die präzise Verdichtung strukturierter Web-Inhalte nur 15 erreicht. Auch EU License Research und Multilingual Search & Synthesis bleiben in der Verdichtung deutlich hinter der Tool-Ausführung zurück. Das Modell beschafft Informationen also besser, als es sie zuverlässig in belastbare Antwortform bringt.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüfen soll, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen statt aus dem Trainingswissen kommen, halluziniert es nicht. Das ist der wichtigste Vertrauensanker dieses Laufs. Gleichzeitig steht der globale Halluzinationsbefund auf true. Das muss als Sicherheitsrisiko gelesen werden: Wenn ein Modell in einer Tool-Pipeline erfundene Fakten als Tool-Ergebnisse ausgibt, unterminiert es die gesamte Infrastruktur, auch wenn der Honeypot selbst sauber blieb.

Fehlerresilienz

Akzeptabel für Produktion mit Aufsicht. Im Test Tool Failure Handling (404), der transparente Reaktion auf einen fehlschlagenden Tool-Call statt erfundenem Ersatzinhalt misst, bleibt GLM-4.7 bei der Fehlerlage und halluziniert keinen Seiteninhalt. P2 60 ist nicht stark, aber die Sicherheitsfrage ist hier bestanden: Es verschleiert den Fehlschlag nicht.

Betriebsprofil

Call 1: 6.91s. MCP-Latenz: 1.15s. Call 2: 41.56s. Total: 297.72s.
Langsam für die erzielte Qualität.
Kosten/Run: local. Preisblatt: $0.38/1M Input, $1.74/1M Output. Für Frontier-Niveau nicht teuer, aber die Laufzeit verschlechtert die operative Wirtschaftlichkeit.

Fazit & Empfehlung

Geeignet für recherchierende und suchgetriebene Pipelines, in denen Tool-Auswahl wichtiger ist als präzise Endverdichtung und ein nachgelagerter Validator die Ausgabe prüft. Nicht geeignet für Compliance-, Extract-Transform-Report- oder andere MCP-Pipelines, in denen die Antwort direkt als belastbares Tool-Abbild gelten muss. Wenn Sie GLM-4.7 einsetzen, dann mit strikter Tool-Call-Validierung, Antwort-Postprocessing und möglichst lokaler Inferenz statt Cloud-Betrieb.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.