Claude Haiku 5.5

Claude Haiku 5.5 ist seit Anfang Oktober 2026 Anthropics schnellstes Modell der 5.5-Familie, gebaut für hochvolumige Aufgaben wie Zusammenfassungen, Klassifikation, Browser-Nutzung und Subagenten. Der Kontext wächst von 200.000 auf eine Million Tokens, der Output auf 128.000, die Laufkosten liegen im Schnitt rund 75 Prozent unter Haiku 4.5. Neu in der Haiku-Klasse: adaptives Denken mit Effort-Steuerung. Text und Bild als Eingang, proprietär, nur über die API.

Anthropic Version 5.5 Kommerzielle Nutzung erlaubt Dense 1000 K Context 06/2026 $0.1 / $0.5 per 1M

  • Proprietär
  • Frontier
  • Anthropic
  • Text
  • Vision
  • Instruction-Tuned
  • Real-Time

Sovereign Risk: MEDIUM Das Modell wird von Anthropic, einem in den USA ansässigen Unternehmen, entwickelt und betrieben. Die Einstufung als ‘medium’ ergibt sich aus der US-amerikanischen Gerichtsbarkeit des Anbieters. Gesetze wie der CLOUD Act könnten es US-Behörden theoretisch ermöglichen, auf Daten zuzugreifen, die auf den Servern von Anthropic verarbeitet werden. Da es sich um ein reines Cloud-Modell (‘cloud-only’) handelt, kann dieses Risiko nicht durch eine lokale Bereitstellung gemindert werden. Für Nutzer außerhalb der USA, insbesondere in Rechtsräumen mit strengen Datenschutzanforderungen wie der DSGVO, stellt dies ein potenzielles Souveränitätsrisiko dar.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
1.09
First Request
MCP
1.25
Protocol Latency
Synthesis
5.49
Response Generation
Total
46.98
Sum of All Phases
Token
16509
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

· Instruction-Tuned

Deployment-Urteil

Bedingt deploy, weil die Werkzeugausführung stark ist, aber die Synthese nicht stabil genug im Tool-Ergebnis bleibt und der Tool-Call im Lauf nicht durchgehend valide war. Der kombinierte Befund ist gut, für produktive MCP-Pipelines aber nur mit enger Antwortkontrolle belastbar.

Tool-Execution-Profil

Claude Haiku 5.5 zeigt klare Tool-Intelligenz statt bloßem Routinenmuster. Beim Test Web Search & Tool Selection, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, erkennt das Modell den richtigen Zugriffspfad sicher. Das spricht für brauchbare Orchestrierung in dynamischen Pipelines. Beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und den anschließenden Fetch misst, arbeitet es brauchbar, aber nicht deterministisch genug für fragile Zielsysteme. Die P1-Werte sind insgesamt stark, doch der globale Befund „Tool-Call valide: false“ ist relevant: Das Modell ist operativ kompetent, aber nicht protokollsicher genug, um ungeprüft hinter eine produktive Tool-Infrastruktur geschaltet zu werden. Retry war nicht nötig. Das spricht eher gegen ein Verständnisproblem und eher für einzelne Format- oder Call-Schwächen unter Last.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur ordentlich. Die Verdichtungsqualität liegt sichtbar unter der Ausführungsqualität. Solide Ergebnisse bei HTTP Fetch & Extract und URL Construction & Fetch stehen schwachen Verdichtungen bei EU License Research und Multilingual Search & Synthesis gegenüber. Für Pipelines, die nicht nur abrufen, sondern belastbare Kurzfassungen, Compliance-Notizen oder Management-Summaries erzeugen sollen, ist das die Hauptschwäche.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht alarmierend, aber auch nicht vertrauensstark. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen gezogen werden, halluziniert das Modell nicht. Das ist die Mindestanforderung. Der schwache P2-Befund zeigt aber, dass es die recherchierten Inhalte nicht präzise genug in eine belastbare Antwort überführt. Für Compliance-nahe Pfade ist das zu wenig.

Fehlerresilienz

Gut produktionsgeeignet. Im 404-Test, der transparenten Umgang mit einem fehlgeschlagenen Tool-Call misst, kommuniziert das Modell den Fehler offen und erfindet keinen Seiteninhalt. Genau dieses Verhalten hält eine Pipeline vertrauenswürdig. Ein Tool-Ausfall bleibt damit ein operativer Fehler und wird nicht zum Datenintegritätsproblem.

Betriebsprofil

Call 1: 1.09s. MCP-Latenz: 1.25s. Call 2: 5.49s. Total: 46.98s.
Für ein Haiku-Modell ist die Gesamtlaufzeit lang. Kosten/Run: local. Im Verhältnis zur Leistung günstig, im Verhältnis zur Antworttreue nicht außergewöhnlich effizient.

Fazit & Empfehlung

Geeignet für MCP-Pipelines mit klarer Tool-Führung, robustem Post-Validation-Layer und geringer Toleranz für erfundene Inhalte bei Fehlerfällen. Gut für Retrieval, Suchauswahl, Vorstrukturierung und transparente Fehlerbehandlung. Nicht die erste Wahl für Compliance-Zusammenfassungen, mehrsprachige Rechercheverdichtung oder jede Pipeline, in der die verbale Endantwort denselben Vertrauensgrad wie der Tool-Call selbst tragen muss.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.