Claude Opus 5.5

Claude Opus 5.5 ist Anthropics neues Frontier-Modell: Seit dem 22. September 2026 ersetzt es Opus 5 und soll laut Hersteller Fable-5.1-Leistung bei 40 Prozent geringeren typischen Workload-Kosten erreichen. Adaptives Thinking ist standardmäßig aktiv und per Effort-Stufe steuerbar, das Kontextfenster fasst eine Million Tokens mit 128.000 Output-Tokens. Die Reasoning-Klassifikator-Fehler aus Opus 5 sind behoben, nur die Metacognition-Verweigerung bleibt.

Anthropic Version 5.5 Kommerzielle Nutzung erlaubt Dense 1000 K Context 06/2026 $5 / $25 per 1M

  • Proprietär
  • Frontier
  • Anthropic
  • Text
  • Vision
  • Agentic Orchestrator
  • Long Context
  • Interactive

Sovereign Risk: TODO TODO

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.85
First Request
MCP
1.21
Protocol Latency
Synthesis
14.03
Response Generation
Total
108.54
Sum of All Phases
Token
8443
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator · Long Context

Tool-Use-Profil

Claude Opus 5.5 erzielt im Tool-Use-Benchmark einen Combined-Score von 76.9 (Good): P1-Execution 90, P2-Synthese 62.5, Fleet-Durchschnitt 68.2.

Stärkster Test: Tool Failure Handling (404) (64.3). Schwächster Test: Web Search & Tool Selection (91). Die Streuung zwischen diesen beiden Tests beträgt -26.7 Punkte.

Reliability-Status: Tool Call Valid Nein, Retry Nicht erforderlich, Halluzination Erkannt.

Diese datengetriebene Auto-Review wird aus den vorhandenen Tool-Use-Benchmark-Daten zusammengestellt. Sobald eine ausführliche LLM-generierte Analyse (GPT-5.4) vorliegt, ersetzt sie diese Vorlage automatisch. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.