Grok 4.5

Grok 4.5 ist seit Juli 2026 das aktuelle Flaggschiff von xAI mit nativem Echtzeit-Zugriff auf Web- und X-Daten, 500.000 Tokens Kontext und multimodaler Text- und Bildeingabe. Reasoning läuft serverseitig immer mit und wird konfigurierbar über Reasoning-Effort-Level gesteuert, ohne sichtbare Chain-of-Thought-Tags im Antworttext. Function-Calling, strukturierte Ausgaben und Prompt-Caching ergänzen das Profil für Coding- und Agentic-Workflows.

xAI Version 4.5 Kommerzielle Nutzung eingeschränkt Dense 500 K Context 02/2026 $2 / $6 per 1M

  • Proprietär
  • Frontier
  • xAI
  • Text
  • Vision
  • Interactive

Sovereign Risk: MEDIUM xAI ist ein US-Unternehmen, das dem CLOUD Act unterliegt. Das operative Risiko liegt nicht in der Verteilung der Gewichte (proprietär, nicht öffentlich), sondern in der Nutzung der Cloud-API: Daten werden serverseitig verarbeitet, standardmäßig mit 30 Tagen Retention, sofern keine Zero-Data-Retention-Option für Enterprise-Konten aktiviert ist.[web:590]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.33
First Request
MCP
1.4
Protocol Latency
Synthesis
12.9
Response Generation
Total
99.77
Sum of All Phases
Token
15470
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Nicht deploy für vertrauenskritische MCP-Pipelines, weil Grok 4.5 trotz gutem Gesamtscore halluziniert und zugleich keinen durchgehend validen Tool-Call-Pfad zeigt.

Tool-Execution-Profil

Bei der Werkzeugwahl zeigt das Modell echte situative Intelligenz. Im Test Web Search & Tool Selection, der prüft ob ohne Hinweis web_search statt fetch gewählt wird, erkennt es den passenden Zugriffspfad zuverlässig. Das spricht gegen bloßes Musterfolgen. Auch bei Multilingual Search & Synthesis nutzt es Tools aktiv und zielgerichtet.

Schwächer wird es bei der Ausführungsschärfe. Im Test URL Construction & Fetch, der die Ableitung einer Ziel-URL aus Vorwissen und den anschließenden Fetch misst, arbeitet es brauchbar, aber nicht deterministisch genug für harte Produktionspfade. Der globale Befund „Tool-Call valide: false“ ist hier entscheidend. Das Modell kann Tool-Nutzung planen, liefert aber nicht konsistent einen protokollsauberen, verlässlich maschinenverarbeitbaren Ausführungspfad. Positiv ist, dass kein Retry erforderlich war. Das Problem liegt daher eher in der Erstpräzision als in bloßen Formatfehlern nach Korrekturschleifen.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Uneinheitlich. Bei HTTP Fetch & Extract und URL Construction & Fetch verdichtet Grok 4.5 sauber und ausreichend präzise. Auch Web Search & Tool Selection ist stark. Der Gesamtwert für P2 von 60 zeigt aber, dass diese Qualität nicht stabil über alle Aufgabentypen trägt. Besonders bei mehrdeutigen oder compliance-nahen Faktenlagen kippt die Verdichtung von nützlicher Zusammenfassung in unsichere Behauptung.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nein, und das ist der kritische Punkt. Im Honeypot EU License Research, der prüfen soll, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, liegt P2 bei 15 und eine Halluzination wurde erkannt. Das ist kein bloßer Qualitätsmangel, sondern ein Sicherheitsrisiko. Wenn ein Modell in einer Tool-Pipeline erfundene oder aus Trainingswissen rekonstruierte Aussagen als recherchiertes Ergebnis ausgibt, verliert die gesamte Infrastruktur ihre Nachvollziehbarkeit.

Fehlerresilienz

Beim 404-Test, der transparente Reaktion auf fehlgeschlagene Tool-Calls misst, bleibt Grok 4.5 auf der akzeptablen Seite. Es halluziniert keinen Seiteninhalt trotz Fehler. Die Fehlerkommunikation ist damit produktionsfähig, auch wenn die inhaltliche Aufbereitung mit P2 60 nur durchschnittlich klar ausfällt. Für Betriebspipelines ist Transparenz hier wichtiger als sprachliche Eleganz.

Betriebsprofil

Call 1: 2.33s. MCP-Latenz: 1.40s. Call 2: 12.90s. Total: 99.77s.
Preis: $2.0 pro 1M Input-Tokens, $6.0 pro 1M Output-Tokens.
Fazit: eher langsam für den gemessenen Nutzwert, preislich Frontier-üblich, aber nicht günstig im Verhältnis zum Vertrauensrisiko.

Fazit & Empfehlung

Geeignet ist Grok 4.5 für assistive Recherche, explorative Analysten-Workflows und menschlich beaufsichtigte Tool-Ketten, in denen Ergebnisse sichtbar geprüft werden. Nicht geeignet ist es für Compliance, Lizenzprüfung, Policy-Auswertung, autonome Retrieval-Synthese oder jede Pipeline, in der Tool-Ergebnisse als belastbare Fakten weitergereicht werden. Wenn Sie es einsetzen, dann nur mit strikter Output-Verifikation, Quellenzwang und nachgelagerter Validierung außerhalb des Modells.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.