Tool-Use-Review
Erstellt am · Agentic Orchestrator · Long Context
Tool-Use-Profil
Claude Opus 5.5 erzielt im Tool-Use-Benchmark einen Combined-Score von 76.9 (Good): P1-Execution 90, P2-Synthese 62.5, Fleet-Durchschnitt 68.2.
Stärkster Test: Tool Failure Handling (404) (64.3). Schwächster Test: Web Search & Tool Selection (91). Die Streuung zwischen diesen beiden Tests beträgt -26.7 Punkte.
Reliability-Status: Tool Call Valid Nein, Retry Nicht erforderlich, Halluzination Erkannt.
Diese datengetriebene Auto-Review wird aus den vorhandenen Tool-Use-Benchmark-Daten zusammengestellt. Sobald eine ausführliche LLM-generierte Analyse (GPT-5.4) vorliegt, ersetzt sie diese Vorlage automatisch. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.