Tool-Use-Review
· Agentic Orchestrator · Long Context
Tool-Use-Profil
GLM-5.3-Flash (EXL3 High) erzielt im Tool-Use-Benchmark einen Combined-Score von 70.4 (Good): P1-Execution 79.2, P2-Synthese 63.3, Fleet-Durchschnitt 68.5.
Stärkster Test: Web Search & Tool Selection (28.3). Schwächster Test: HTTP Fetch & Extract (90). Die Streuung zwischen diesen beiden Tests beträgt -61.7 Punkte.
Reliability-Status: Tool Call Valid Nein, Retry Nicht erforderlich, Halluzination Nicht erkannt.
Diese datengetriebene Auto-Review wird aus den vorhandenen Tool-Use-Benchmark-Daten zusammengestellt. Sobald eine ausführliche LLM-generierte Analyse (GPT-5.4) vorliegt, ersetzt sie diese Vorlage automatisch. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.