Claude Opus 5

Claude Opus 5 ist Anthropics Opus-Flagship vom 24. Juli 2026, positioniert als Alltagsmodell zwischen Opus 4.8 und dem teureren Fable 5. Das Cloud-only-Modell unter US-Jurisdiktion bietet 1 Million Tokens Kontext, 128.000 Tokens Output und adaptive Reasoning-Steuerung mit fünf Effort-Stufen (low/medium/high/xhigh/max). Mid-Conversation-Tool-Wechsel ohne Cache-Verlust und Fast-Mode mit 2,5-facher Geschwindigkeit ergänzen das Angebot.

Anthropic Version 5 Kommerzielle Nutzung erlaubt Dense 1000 K Context 05/2026 $5 / $25 per 1M

  • Proprietär
  • Frontier
  • Anthropic
  • Text
  • Vision
  • Agentic Orchestrator
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Anthropic ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act. Die Modellgewichte sind proprietär und nicht verteilt; kein zusätzliches Risiko durch Gewichtsweitergabe. Datenhaltung erfolgt unter Anthropic Commercial Terms.

LLM Model Review

Aktualisiert am · Agentic Orchestrator · Long Context

Claude Opus 5 erreicht einen Gesamtscore von 78,73 Prozent und trägt im Leaderboard den Speed Profile Badge Interactive Doc Writer. Das passt erstaunlich gut zum Charakter dieses Modells: weniger Draufgänger für hektische Tool-Ketten, mehr hochklassiger Wissensarbeiter mit Sinn für Struktur, Tiefe und lange Zusammenhänge. Als kommerzielles Cloud-Modell über die Anthropic-API spielt es klar in der Frontier-Klasse: agentischer Use Case, dichte Parameterarchitektur, 1-Million-Token-Kontext, dazu ein werksseitiges Standardverhalten ohne umschaltbaren Thinking-Modus im Testlauf. Sovereign Risk: HIGH — Anthropic unterliegt als US-Unternehmen dem CLOUD Act; die Daten werden in den USA verarbeitet.

Kopfnoten: Stabilität und Zuverlässigkeit

Metrik Wert Bewertung Analyse
Timeout-Rate 3/49 Sporadisch Das Modell zeigt sporadische Aussetzer, die in der Praxis Retrys erfordern würden.
P95-Antwortzeit 117.67 s Problematisch Signifikante Ausreißer, die den Arbeitsfluss unterbrechen.

Diese Kopfnoten sind für ein Frontier-Modell aus der Hersteller-Cloud keine Petitesse, sondern ein Einsatzsignal. Drei Aussetzer in 49 Tests sind noch kein Totalausfall, aber genug, um in Agenten-Workflows oder längeren Produktionsketten Misstrauen zu säen. Dazu kommt ein schwerer Tail bei den Antwortzeiten: Wer Claude Opus 5 in interaktive Prozesse hängt, bekommt nicht nur Qualität, sondern gelegentlich auch Wartezimmer-Atmosphäre.

Architektur und Charakter: Wofür Claude Opus 5 gebaut ist

Die vorab vergebene Architektur-Kategorie trifft den Kern erstaunlich präzise. Claude Opus 5 ist kein bloßer Allround-Chatbot, sondern ein agentisches Orchestrierungsmodell mit Reasoning-DNA, sehr großem Kontextfenster und multimodaler Anlage. Das heißt im Alltag: Es denkt in Strukturen, nicht in Einzelsalven. Es plant, gliedert, wägt ab, hält lange Zusammenhänge zusammen. Wer von so einem Modell exakte Shell-Einzeiler mit der mechanischen Präzision eines Spezialwerkzeugs erwartet, misst am Einsatzzweck vorbei. Wer stattdessen Analyse, Synthese, Dokumentation und mehrstufige Problemzerlegung braucht, sitzt hier näher an der eigentlichen Stärke.

Wichtig ist dabei der Bewertungsrahmen. Claude Opus 5 ist editorial als Use Case agentic, Size Class Frontier und Parameter-Architektur dense eingeordnet. Also keine Ausreden über kleine Modellgröße, keine Milde wegen Spezialnische, kein MoE-Bonus für clevere Aktivierungsökonomie. Frontier in dichtem Aufbau heißt: Hier gelten höchste Erwartungen. Genau daran muss sich Claude Opus 5 messen lassen.

Der Lauf erfolgte im werksseitigen Standardverhalten des Endpunkts; ein umschaltbarer Thinking-Modus existiert hier nicht. Das ist keine Nebensache. Bei Claude bedeutet „Standard“ nicht simpel. Es bedeutet nur, dass die Denkarchitektur intern arbeitet, ohne dass der Nutzer sie im Benchmark separat konfiguriert. Das Resultat ist typisch Claude: oft tief, oft bedacht, gelegentlich etwas zu sehr in seine eigene Klugheit verliebt.

Performance, Tempo und Kostenprofil

Der Badge Interactive Doc Writer ist mehr als Schmuck. Er signalisiert ein Modell, das für hochwertige, interaktive Wissensarbeit taugt: Dokumentation, strukturierte Langform, anspruchsvolle Umformungen, erklärende Antworten. Genau dort liefert Claude Opus 5 seine überzeugendsten Momente. Die Generierungsgeschwindigkeit wirkt dabei nicht schnell im Sinne von „snappy“, sondern eher kultiviert. Der Text kommt mit Bedacht. Das ist bei einem Thinking- und Agentic-Modell nicht automatisch ein Makel, wohl aber eine Kostenstelle in Echtzeit-Szenarien.

Preislich ist die Sache glasklar: 5 Dollar pro 1 Million Input-Tokens, 25 Dollar pro 1 Million Output-Tokens. Das ist kein Impulskauf, sondern ein professionelles Werkzeug mit professioneller Rechnung. Weil Claude Opus 5 tokenseitig insgesamt diszipliniert arbeitet, fällt das weniger schmerzhaft aus, als man bei einem tief denkenden Modell befürchten könnte. In keinem Modul überschreitet es den erwarteten Verbosity-Rahmen. Das Modell verhält sich token-ökonomisch. Gerade für ein System, das intern sichtbar auf Analyse statt Aktion getrimmt ist, ist das eine bemerkenswerte Form von Selbstbeherrschung.

Reasoning und Logik: stark im Denken, schwächer in der Demut vor dem Format

Im Reasoning-Modul zeigt Claude Opus 5, warum die Kategorie Thinking hier nicht bloß ein Etikett ist. Die inhaltliche Logik sitzt. Beim klassischen Wächterrätsel liefert das Modell die korrekte Kernlösung, erklärt sie gründlich, zerlegt naive Ansätze und ergänzt sogar alternative Formulierungen. Das ist kein oberflächliches Musterabspulen, sondern echtes Durcharbeiten der Aufgabe. Man spürt: Dieses Modell will nicht nur antworten, es will die Struktur des Problems sauber ausleuchten.

Der Preis dafür ist ein bekanntes Claude-Problem: Formale Disziplin steht nicht immer auf Platz eins. Im Metakognitions-Protokoll fehlten die explizit geforderten <thought>-Tags, ebenso eine klar abgesetzte Schlussantwort. Inhaltlich ist das stark. Formal ist es ungehorsam. Für Menschen liest sich das oft noch souverän; für automatisierte Pipelines ist es schlicht ein Risiko. Ein Agent, der intern brillant denkt, aber die Schablone ignoriert, ist wie ein sehr intelligenter Mitarbeiter, der jede Vorlage verbessert, nur leider auch dann, wenn man exakt diese Vorlage brauchte.

Metakognitions-Compliance (Reasoning): Das Modell verweigert in 3/5 metacog-Tests die Nutzung der explizit angeforderten <thought>-Tags mit einer konsistenten Policy-Aussage. Die Reasoning-Inhalte sind dabei inhaltlich korrekt — der Score-Abzug resultiert aus der Format-Verweigerung, nicht aus Denkfehlern. Zum Vergleich: In den tag-freien reasoning_5*-Tests erzielt das Modell einen Durchschnittsscore von ca. 77,24 Prozent, was dem Niveau anderer starker Modelle entspricht. CrucibleMark bewertet bewusst die native Zero-Shot-Instruktions-Compliance als reales Alltagsmerkmal — dieser Abzug ist methodisch gewollt.

Das ist der entscheidende Punkt: Claude Opus 5 scheitert hier nicht primär an Logik, sondern an Compliance. Wer es für Analyse, Bewertung oder konzeptionelles Sparring einsetzt, bekommt Substanz. Wer es für streng formatierte Ausgaben in maschinenlesbaren Pipelines einsetzt, sollte Guardrails, Validatoren oder Nachformatierung einplanen.

Code Quality und Security: analytisch stark, aber nicht maximal angriffig

Im Code- und Security-Bereich liefert Claude Opus 5 eine gute bis sehr gute Vorstellung. Die Audit-Wertung von 81,92 Prozent wirkt verdient. In den Protokollen identifiziert das Modell praktisch das gesamte relevante Schwachstellenfeld: SQL-Injection in mehreren Varianten, Klartextpasswörter, Type Juggling, IDOR, Path Traversal, XSS, schwache Token-Generierung, Mail-Header-Injection, Session Fixation. Das ist nicht erratisches Namedropping, sondern technisch sauber benannte Angriffsfläche mit brauchbaren Fix-Hinweisen.

Seine eigentliche Stärke liegt dabei in der Ordnung des Befunds. Claude Opus 5 sortiert Sicherheitslücken lesbar, priorisiert verständlich und formuliert Gegenmaßnahmen so, dass nicht nur Auditoren, sondern auch Teams damit arbeiten können. Für viele reale Security-Reviews ist das wertvoller als ein Feuerwerk aus obskuren Randfällen. Wo das Modell aber hinter einer perfekten Sicherheitsanalyse zurückbleibt, ist die Exploit-Erzählung. Die Judge-Protokolle monieren zu Recht, dass konkrete Angriffsketten und Proof-of-Concept-Narrative weniger scharf ausformuliert sind als im Referenzstandard. Claude benennt die Mine. Es malt nicht immer den Krater.

Gerade bei einem als agentisch einsortierten Frontier-Modell ist das interessant. Es analysiert hervorragend, orchestriert plausibel und liefert gute Sanierungsvorschläge. Aber es agiert weniger wie ein offensiver Red-Teamer und mehr wie ein sehr erfahrener Security-Architekt, der den Vorstand nicht mit spektakulären Angriffspfaden erschrecken muss, um recht zu haben. Für Defensivarbeit ist das oft genau richtig. Für offensive Sicherheitsarbeit gibt es schärfere Messer.

CLI und Tool-Execution: hier wird das Orchestrator-Erbe zur Ausrede und zur Grenze

Der schwächste sichtbare Fachbereich ist die Tool-Ausführung. Mit 83,33 Prozent im ToolUse-Score und 80,94 Prozent im CLI-Bereich fällt Claude Opus 5 nicht ab, aber es glänzt dort auch nicht so selbstverständlich wie bei Dokumentation oder Security-Analyse. Das überrascht nicht. Die Kategorie Agentic-Orchestrator ist genau dafür der richtige Kontext: Solche Modelle sind gebaut, um Teilaufgaben zu zerlegen und bei Bedarf an spezialisierte Werkzeuge oder Unteragenten zu delegieren. In der Praxis ist das oft klüger, als selbst den letzten exakten Flag in einen One-Liner zu pressen.

Trotzdem bleibt eine Grenze. Der Benchmark misst das Out-of-the-box-Verhalten. Und dort zeigt Claude Opus 5, dass es bei direkter Format- und Exekutionspräzision nicht immer die Härte eines spezialisierten DevOps-Modells hat. Das ist verzeihlich, aber nicht folgenlos. Wer ein zentrales Planungsmodell für Agentensysteme sucht, bekommt hier Substanz. Wer ein Modell will, das ohne zweiten Blick skriptgenaue Ausgabe mit maximaler mechanischer Präzision abliefert, sollte sich an anderen Endpunkten orientieren.

Content Transformation und Dokumentation: hier spielt Claude Opus 5 seine Klasse aus

Die vielleicht überzeugendste Seite von Claude Opus 5 zeigt sich in Aufgaben, die mehr verlangen als Korrektheit. Im Bereich Documentation Quality erreicht das Modell 86,01 Prozent. Im Modul Content Transformation sind es 81,25 Prozent. Das sind keine bloßen Fleißnoten. Das ist die Handschrift eines Modells, das komplexe Rohmasse in brauchbare Form gießt.

Das Video-Skript zur 2FA-Einrichtung ist dafür ein gutes Beispiel. Claude Opus 5 arbeitet die Lücken der Vorlage präzise heraus, ergänzt Hook, Timing, Produktionshinweise, Troubleshooting, Retention-Mechaniken und sogar ein brauchbares Easter Egg. Der Judge attestiert dem Ergebnis Produktionsreife. Solche Aufgaben liegen dem Modell sichtbar: Struktur herstellen, implizite Anforderungen explizieren, Tonalität mit Nutzwert verbinden. Da wirkt Claude nicht wie ein Textgenerator, sondern wie ein erstaunlich nüchterner Redakteur mit Produktionsverständnis.

Auch in klassischer Dokumentationsarbeit ist das Modell stark. Der Badge „Interactive Doc Writer“ ist keine Marketing-Fiktion, sondern trifft den Benchmark-Charakter ziemlich genau. Claude Opus 5 schreibt nicht bloß viel. Es organisiert Wissen. Das ist ein Unterschied, der im Alltag zählt.

UX Writing, Cultural Intelligence und Instruction-Following: sprachstark, nicht immer gehorsam

Die Sprachqualität ist durchgehend hoch. Gerade auf Deutsch liefert Claude Opus 5 saubere, natürliche und professionelle Texte. Im Bereich Cultural Intelligence fällt es aber über eine klassische Claude-Bananenschale: Es kann die Aufgabe sprachlich souverän lösen und trotzdem an einer simplen Direktive scheitern.

Das HR-Rewriting-Protokoll ist dafür lehrreich. Der deutsche Text selbst war gelungen, inklusiv und professionell. Das Problem war nicht die Qualität der Umschreibung, sondern die Entscheidung, zusätzlich ausführliche englische Begründungen anzuhängen, obwohl dies ausdrücklich verboten war. Das ist kein Flüchtigkeitsfehler. Das ist ein Compliance-Defekt. Claude Opus 5 will hilfreich sein, auch wenn „hilfreich“ hier bedeutet hätte, endlich einmal den Mund zu halten.

Dieses Muster zieht sich subtil durch mehrere Module. Das Modell ist selten grob daneben. Es verletzt Vorgaben eher aus Überschuss als aus Unvermögen: zu viel Erklärung, zu viel Einordnung, zu wenig asketische Befolgung. Für Menschen ist das oft sympathisch. Für Produktivsysteme mit harten Output-Anforderungen ist es eine Sollbruchstelle.

Halluzinationen und Verlässlichkeit des Inhalts

Inhaltlich leistet sich Claude Opus 5 erfreulich wenig Fabulierlust. Es wirkt über weite Strecken wie ein Modell, das lieber analysiert und eingrenzt, als mit schicker Erfindung Leerstellen zu kaschieren. Das passt zur gesamten Signatur dieses Systems: hohe Strukturtreue, starke Wissensorganisation, eher vorsichtige als phantastische Antwortpolitik. Im Security- und Dokumentationskontext ist das Gold wert, weil jede erfundene Gewissheit dort schnell teuer wird.

Datenschutz und Datenhoheit

Für europäische Unternehmen ist Claude Opus 5 datenschutzrechtlich kein neutraler Boden, sondern eine bewusste Risikoentscheidung. Der Provider ist Anthropic PBC mit Sitz in San Francisco, das anwendbare Recht ist US (CLOUD Act), der Datenstandort laut Vendor Card USA, die Datenspeicherung beträgt 30 Tage. Ein GDPR DPA ist verfügbar, was für viele Unternehmen die Mindestvoraussetzung für einen DSGVO-konformen Vertragspfad schafft. Das entschärft die Lage aber nicht grundsätzlich.

Das berechnete Sovereign Risk liegt bei HIGH. Die Begründung ist klar: US-Jurisdiktion ohne EU-Absicherung. Der CLOUD Act bedeutet, dass US-Behörden unter bestimmten Voraussetzungen Zugriff auf Daten verlangen können, auch wenn einzelne technische oder organisatorische Schutzmaßnahmen vorhanden sind. Das ist für deutsche und europäische Organisationen kein theoretischer Nebensatz, sondern Teil der Risikoabwägung. Das Weights-Provenienz-Risiko liegt bei MEDIUM: keine zusätzliche Unsicherheit durch weitergereichte Gewichte, wohl aber die grundsätzliche Bindung an einen proprietären US-Anbieter.

Fazit

Claude Opus 5 ist ein sehr gutes Frontier-Modell mit klar erkennbarem Berufsethos: denken, ordnen, erklären, strukturieren. Es ist stark in Dokumentation, stark in Content-Transformation, stark in Sicherheitsanalyse und inhaltlich überzeugend im Reasoning. Schwächer wird es dort, wo blinde Gehorsamkeit gegenüber Formatvorgaben wichtiger ist als geistige Qualität. Genau das macht seinen Charakter aus. Dieses Modell ist kein williger Stenograf, sondern ein selbstbewusster Senior-Berater. Das beeindruckt, bis man exakte Ausgabeformate braucht.

Für den Einsatz heißt das: sehr empfehlenswert für Wissensarbeit, Review-Prozesse, lange Kontexte, Sicherheits- und Qualitätsanalysen sowie als zentrales Denkmodell in agentischen Systemen. Weniger ideal für strikt formalisierte Tool-Ausgaben ohne Absicherung, für latenzkritische Interaktion und für Umgebungen, in denen jeder Retry operativ weh tut. Über alle Tests hinweg keine nennenswerten Halluzinationen — das Modell erfindet lieber wenig, als sich mit falscher Sicherheit zu blamieren.

Innerhalb der Claude-Familie wirkt Opus 5 wie der ernsthafte Dokumentar unter den großen Modellen: kultiviert, substanziell, gelegentlich zu erklärfreudig und mit einem Tempo, das man mögen muss. Wer ein brillantes Cloud-Modell sucht, das lange Fäden sauber in der Hand hält, bekommt hier viel Qualität. Wer absolute Präzision unter Zeitdruck braucht, sollte Claude Opus 5 nicht allein auf die Bühne schicken.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.