Claude Opus 5

Claude Opus 5 ist Anthropics Opus-Flagship vom 24. Juli 2026, positioniert als Alltagsmodell zwischen Opus 4.8 und dem teureren Fable 5. Das Cloud-only-Modell unter US-Jurisdiktion bietet 1 Million Tokens Kontext, 128.000 Tokens Output und adaptive Reasoning-Steuerung mit fünf Effort-Stufen (low/medium/high/xhigh/max). Mid-Conversation-Tool-Wechsel ohne Cache-Verlust und Fast-Mode mit 2,5-facher Geschwindigkeit ergänzen das Angebot.

Anthropic Version 5 Kommerzielle Nutzung erlaubt Dense 1000 K Context 05/2026 $5 / $25 per 1M

  • Proprietär
  • Frontier
  • Anthropic
  • Text
  • Vision
  • Agentic Orchestrator
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Anthropic ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act. Die Modellgewichte sind proprietär und nicht verteilt; kein zusätzliches Risiko durch Gewichtsweitergabe. Datenhaltung erfolgt unter Anthropic Commercial Terms.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.39
First Request
MCP
1.37
Protocol Latency
Synthesis
16.4
Response Generation
Total
120.95
Sum of All Phases
Token
10412
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Aktualisiert am · Agentic Orchestrator · Long Context

Deployment-Urteil

Bedingt deploy, weil die Gesamtleistung gut ist und keine Halluzination erkannt wurde, aber die Tool-Calls nicht durchgängig valide waren. Für produktive MCP-Pipelines ist das tragbar, solange ein strikter Call-Validator und Fallback-Pfade davorstehen.

Tool-Execution-Profil

Claude Opus 5 zeigt echte Werkzeugintelligenz, nicht nur starres Schema-Verhalten. Beim Test Web Search & Tool Selection, der prüft ob ohne Hinweis web_search statt fetch gewählt wird, erkennt das Modell den richtigen Modus sicher. Das spricht für brauchbare Orchestrierungsfähigkeit in dynamischen Pipelines. Beim URL-Construction-Test, der korrekte URL-Ableitung und anschließendes Fetch misst, arbeitet es dagegen nur solide. Es kann die Ziel-URL oft brauchbar herleiten, aber nicht präzise genug für deterministische Flows mit enger Fehlertoleranz.

Der kritische Punkt ist nicht die Auswahl des Tools, sondern die Protokolltreue der Ausführung. Tool-Call valide: false bedeutet, dass man diesem Modell die Tool-Infrastruktur nicht unkontrolliert übergeben sollte. Positiv ist, dass kein Retry erforderlich war. Das wirkt eher wie ein Robustheitsdefizit im Call-Format oder in Einzelfällen der Parametrisierung als wie ein grundlegendes Verständnisproblem.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Gut, aber nicht durchgehend scharf. Die Verdichtung bleibt in den meisten Aufgaben brauchbar und transparent, mit klarer Stärke bei Tool Failure Handling (404) und solider Leistung bei HTTP Fetch & Extract. Der sichtbare Schwachpunkt ist Multilingual Search & Synthesis: Die Recherche über Sprachgrenzen gelingt, aber die deutsche Zusammenführung verliert Genauigkeit und Priorisierung. Für mehrsprachige Compliance-, Policy- oder Marktbeobachtungs-Pipelines ist das zu beachten.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus dem Training beantwortet werden, bleibt das Modell auf der sicheren Seite. Keine Halluzination erkannt. Das ist das zentrale Vertrauenssignal dieses Laufs.

Fehlerresilienz

Bei scheiternden Tool-Aufrufen reagiert Claude Opus 5 produktionsgerecht. Im 404-Test, der transparente Fehlerkommunikation statt erfundenem Seiteninhalt misst, halluziniert es keinen Ersatzinhalt und markiert den Fehler sauber. Das ist für produktive Tool-Pipelines akzeptabel.

Betriebsprofil

Total 120.95s. Erste Antwort 2.39s, MCP-Latenz 1.37s, zweiter Call 16.40s. Langsam für interaktive Workflows, akzeptabel für tiefe agentische Runs. Preis: $5.0/1M Input, $25.0/1M Output. Für Frontier-Niveau nicht billig, aber vertretbar, wenn die Pipeline von langem Kontext und Orchestrierung profitiert.

Fazit & Empfehlung

Geeignet für agentische Recherche-, Routing- und Long-Context-Pipelines mit Validierungsschicht, insbesondere dort, wo Tool-Wahl wichtiger ist als millimetergenaue URL-Konstruktion. Nicht die erste Wahl für streng deterministische Tool-Chains, mehrsprachige Synthese mit hoher Präzisionspflicht oder low-latency User-Flows. Wer Call-Validierung, Schema-Checks und klare Fallbacks implementiert, kann es produktiv nutzen.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.