Grok 4.7

Grok 4.7 ist xAIs Frontier-Flaggschiff vom 21. September 2026, mit größerer Basis als Grok 4.6 und Trainings-Fokus auf mehrstündigen Aufgaben. 500.000 Tokens Kontext, Text- und Bild-Input, vier Reasoning-Stufen von low bis xhigh bei unveränderten 2 / 6 USD pro Million Tokens. Laut xAI fast verdoppelte Leistung bei langen Terminal-Aufgaben und ein neuer Safeguard-Stack gegen Jailbreaks.

xAI Version 4.7 Kommerzielle Nutzung eingeschränkt Dense 500 K Context 05/2026 $2 / $6 per 1M

  • Proprietär
  • Frontier
  • xAI
  • Text
  • Vision
  • Interactive

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
1.87
First Request
MCP
1.25
Protocol Latency
Synthesis
15.67
Response Generation
Total
112.71
Sum of All Phases
Token
23237
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil Grok 4.7 die Tool-Schicht meist korrekt bedient, aber die Synthesequalität mit Combined 71.50 und ungültigem Tool-Call-Signal nicht stabil genug für vertrauenssensible Endausgaben ist.

Tool-Execution-Profil

Die Tool-Ausführung ist klar die stärkere Seite. Mit P1 90 zeigt das Modell, dass es in einer MCP-gestützten Pipeline meist das richtige Werkzeug auswählt und Aufrufe formal brauchbar strukturiert. Besonders stark ist der Web-Search-and-Tool-Selection-Test, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird: Hier handelt Grok 4.7 intelligent und nicht rein schematisch. Das spricht für echte Werkzeugwahl statt starrem Muster.

Weniger sauber ist der URL-Construction-and-Fetch-Test, der prüft, ob das Modell eine Ziel-URL selbst ableitet und dann korrekt abruft. P1 80 ist brauchbar, aber nicht präzise genug für deterministische Pipelines mit engen Erfolgsbedingungen. Das globale Signal „Tool-Call valide: false“ bleibt daher relevant. Es gibt keine Hinweise auf ein Retry-Problem oder Formatkollaps, eher auf punktuelle Ausführungsunschärfe bei konkreten Calls.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt zuverlässig. P2 53.33 ist für ein Frontier-Modell im Produktionskontext zu niedrig, vor allem weil sich die Schwäche durch mehrere Aufgaben zieht: EU License Research, HTTP Fetch & Extract und Multilingual Search & Synthesis bleiben jeweils bei P2 40. Das Modell holt Informationen also oft korrekt per Tool, verdichtet sie danach aber nicht präzise genug in eine belastbare Antwort.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen kommen, wurde keine Halluzination erkannt. Das ist das zentrale Vertrauenssignal. Grok 4.7 erfindet hier nichts, aber es nutzt die beschafften Inhalte nicht diszipliniert genug aus.

Fehlerresilienz

Beim 404-Test, der transparenten Umgang mit fehlgeschlagenen Tool-Calls prüft, bleibt das Modell auf der sicheren Seite. Es halluziniert keinen Seiteninhalt trotz Fehler. P2 60 zeigt keine elegante Fehlerbehandlung, aber eine akzeptable für Produktion: lieber Lücke offenlegen als Ersatzinhalt erfinden. Das ist für Tool-Pipelines wichtiger als sprachliche Glätte.

Betriebsprofil

Total 112.71s pro Run. Call 1: 1.87s. MCP-Latenz: 1.25s. Call 2: 15.67s. Für die gezeigte Syntheseleistung langsam. Preis laut Modellprofil 2.0 USD pro 1M Input und 6.0 USD pro 1M Output, bei Langkontext teurer. Damit nicht günstig im Verhältnis zur gezeigten Endqualität.

Fazit & Empfehlung

Geeignet für agentische Recherche- und Orchestrierungs-Pipelines, in denen Tool-Wahl, Web-Zugriff und vorsichtiger Umgang mit Fehlern wichtiger sind als die erste Endformulierung. Nicht geeignet für Compliance-, Policy- oder Executive-Output-Stufen, in denen die Antwort direkt ohne nachgelagerte Verifikation an Menschen oder Systeme geht. Sinnvoll ist Grok 4.7 als beschaffender und planender Zwischenschritt mit nachgeschaltetem Validator oder einer zweiten Syntheseinstanz.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.