Tool-Use-Review
· Instruction-Tuned
Deployment-Urteil
Bedingt deploy, weil die Werkzeugausführung stark ist, aber die Synthese nicht stabil genug im Tool-Ergebnis bleibt und der Tool-Call im Lauf nicht durchgehend valide war. Der kombinierte Befund ist gut, für produktive MCP-Pipelines aber nur mit enger Antwortkontrolle belastbar.
Tool-Execution-Profil
Claude Haiku 5.5 zeigt klare Tool-Intelligenz statt bloßem Routinenmuster. Beim Test Web Search & Tool Selection, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, erkennt das Modell den richtigen Zugriffspfad sicher. Das spricht für brauchbare Orchestrierung in dynamischen Pipelines. Beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und den anschließenden Fetch misst, arbeitet es brauchbar, aber nicht deterministisch genug für fragile Zielsysteme. Die P1-Werte sind insgesamt stark, doch der globale Befund „Tool-Call valide: false“ ist relevant: Das Modell ist operativ kompetent, aber nicht protokollsicher genug, um ungeprüft hinter eine produktive Tool-Infrastruktur geschaltet zu werden. Retry war nicht nötig. Das spricht eher gegen ein Verständnisproblem und eher für einzelne Format- oder Call-Schwächen unter Last.
Synthesetreue
Wie gut verdichtet es Tool-Ergebnisse? Nur ordentlich. Die Verdichtungsqualität liegt sichtbar unter der Ausführungsqualität. Solide Ergebnisse bei HTTP Fetch & Extract und URL Construction & Fetch stehen schwachen Verdichtungen bei EU License Research und Multilingual Search & Synthesis gegenüber. Für Pipelines, die nicht nur abrufen, sondern belastbare Kurzfassungen, Compliance-Notizen oder Management-Summaries erzeugen sollen, ist das die Hauptschwäche.
Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht alarmierend, aber auch nicht vertrauensstark. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen gezogen werden, halluziniert das Modell nicht. Das ist die Mindestanforderung. Der schwache P2-Befund zeigt aber, dass es die recherchierten Inhalte nicht präzise genug in eine belastbare Antwort überführt. Für Compliance-nahe Pfade ist das zu wenig.
Fehlerresilienz
Gut produktionsgeeignet. Im 404-Test, der transparenten Umgang mit einem fehlgeschlagenen Tool-Call misst, kommuniziert das Modell den Fehler offen und erfindet keinen Seiteninhalt. Genau dieses Verhalten hält eine Pipeline vertrauenswürdig. Ein Tool-Ausfall bleibt damit ein operativer Fehler und wird nicht zum Datenintegritätsproblem.
Betriebsprofil
Call 1: 1.09s. MCP-Latenz: 1.25s. Call 2: 5.49s. Total: 46.98s.
Für ein Haiku-Modell ist die Gesamtlaufzeit lang. Kosten/Run: local. Im Verhältnis zur Leistung günstig, im Verhältnis zur Antworttreue nicht außergewöhnlich effizient.
Fazit & Empfehlung
Geeignet für MCP-Pipelines mit klarer Tool-Führung, robustem Post-Validation-Layer und geringer Toleranz für erfundene Inhalte bei Fehlerfällen. Gut für Retrieval, Suchauswahl, Vorstrukturierung und transparente Fehlerbehandlung. Nicht die erste Wahl für Compliance-Zusammenfassungen, mehrsprachige Rechercheverdichtung oder jede Pipeline, in der die verbale Endantwort denselben Vertrauensgrad wie der Tool-Call selbst tragen muss.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.