Tool-Use-Review
· Long Context · Speculative Decoding · Community-Quantisierung
Deployment-Urteil
Bedingt deploy, weil die Tool-Nutzung stark ist, aber die MCP-Calls nicht durchgängig valide sind und die Verdichtung der Tool-Ergebnisse für produktionsnahe Entscheidungen zu unpräzise bleibt.
Tool-Execution-Profil
Das Modell zeigt echte Werkzeugintelligenz. Im Test Web Search & Tool Selection, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, erkennt es den richtigen Zugriffspfad zuverlässig. Das spricht gegen starres Musterverhalten und für brauchbare Orchestrierungskompetenz. Auch EU License Research und Multilingual Search & Synthesis laufen auf P1-Niveau sauber.
Schwächer ist die Ausführung bei direkter Zieladressierung. Beim URL-Construction-Test konstruiert es die Ziel-URL brauchbar, aber nicht präzise genug für deterministische Pipelines. Dass Tool-Call valide insgesamt auf false steht, ist der eigentliche Produktionsvorbehalt: Die Planungslogik ist stark, die Protokolltreue nicht durchgehend. Für MCP-Pipelines mit striktem Schema-Parsing braucht es deshalb ein enges Call-Validation-Layer vor der Ausführung. Retry war nicht erforderlich, also liegt das Problem eher in Call-Genauigkeit als in grundlegendem Missverständnis.
Synthesetreue
Wie gut verdichtet es? Nur ordentlich. Die P2-Leistung zeigt, dass das Modell Tool-Ergebnisse verwertbar zusammenzieht, aber nicht mit der Präzision, die man für Compliance-, Recherche- oder Faktenpipelines erwarten sollte. Das sieht man konsistent an HTTP Fetch & Extract, URL Construction & Fetch und EU License Research, die jeweils auf 60 in der Verdichtung landen. Es extrahiert also genug für Arbeitsfortschritt, aber nicht genug für belastbare Endantworten ohne nachgelagerte Prüfung.
Bleibt es im Tool-Ergebnis? Überwiegend ja. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen geholt statt aus dem Training beantwortet werden, wurde keine Halluzination erkannt. Das ist das wichtigere Vertrauenssignal. Es zeigt Disziplin gegenüber externer Evidenz, auch wenn die abschließende Zusammenfassung nicht scharf genug formuliert ist.
Fehlerresilienz
Akzeptabel für Produktion. Im 404-Test, der transparenten Umgang mit fehlschlagenden Tool-Calls misst, hat das Modell keinen Ersatzinhalt erfunden. P2=80 ist hier wichtiger als Stilfragen: Es meldet den Fehler statt Seiteninhalt zu halluzinieren. Das erhält die Integrität der Pipeline.
Betriebsprofil
Call 1: 7.19s. Call 2: 63.10s. MCP-Latenz: 1.21s. Total: 429.02s.
Für ein Flash-Modell ist das insgesamt langsam. Kosten pro Run: local. Preislich günstig im Betrieb, zeitlich nur dann vertretbar, wenn lokale Ausführung und großes Kontextfenster wichtiger sind als Durchsatz.
Fazit & Empfehlung
Geeignet für lokal betriebene Agenten-Pipelines mit Recherche, Tool-Auswahl und menschlicher oder programmatischer Nachkontrolle der Endverdichtung. Nicht geeignet als unbeaufsichtigter Endentscheider in Compliance-, Policy- oder Extraktionsstrecken, in denen die Antwort direkt aus Tool-Ergebnissen belastbar formuliert werden muss. Wenn Sie ein lokales Open-Weight-Modell für MCP-Orchestrierung suchen, ist es brauchbar. Wenn Sie einem Modell die Infrastruktur ohne enge Guardrails vollständig übergeben wollen, noch nicht.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.