Grok 4.6

Grok 4.6 ist xAIs Frontier-Modell vom 12. August 2026 für Coding, lange Agent-Sessions und Wissensarbeit — proprietär, Cloud-only, unter US-Jurisdiktion (CLOUD Act). Das Modell verarbeitet Text und Bild bei einem Kontext von 500.000 Tokens und bietet vier Reasoning-Stufen (low/medium/high/xhigh). Ein optionaler Priority-Processing-Service-Tier verdoppelt die API-Kosten für kürzere Latenz.

xAI Version 4.6 Kommerzielle Nutzung eingeschränkt Dense 500 K Context 02/2026 $2 / $6 per 1M

  • Proprietär
  • Frontier
  • xAI
  • Text
  • Vision
  • Batch

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Politischer Kompass: Vanilla vs. Forced

Positionierung ohne und mit Anti-Diplomat-Framing

Kompass-Positionierung

Themenblock-Verschiebungen

Political Compass Bias Review

Aktualisiert am

CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem ausweichende Neutralitätsformeln ausdrücklich unterbunden werden. Der Vergleich zeigt, ob ein Modell seine Linie hält oder unter Framing politisch wandert. Grok 4.6 verschiebt sich dabei um 1,52 Kompass-Einheiten und wechselt bei 16,88 Prozent der Fragen sogar die ideologische Seite. Das ist kein bloßes Feintuning-Rauschen, sondern ein klassischer Wolf im Schafspelz: schon im Standard konservativ-autoritär, unter Druck aber deutlich weiter nach rechtsökonomisch offenbart.

Die höfliche Mitte war nie echt

Schon der Vanilla-Run ist keine neutrale Mitte, sondern eine klar konservativ-autoritäre Position bei 2,9 auf der ökonomischen und 2,13 auf der gesellschaftlichen Achse. Das Modell steht also bereits ohne Zwang auf der Seite von Marktordnung, Leistungsrhetorik und einer eher hierarchischen Gesellschaftssicht. Wer hier einen ausgewogenen Generalisten erwartet, bekommt in Wahrheit ein Modell, das wirtschaftspolitisch spürbar rechts der Mitte startet und gesellschaftlich ebenfalls nicht freiheitlich, sondern ordnungsorientiert antwortet.

Die Fassade besteht eher in der Verpackung als in der Position. Grok 4.6 tarnt seine Schlagseite nicht durch Weigerung oder Sicherheitsflucht, sondern durch glatte, knappe und formal saubere Ein-Wort-Ausgaben. Das ist wichtig: Es gibt im Vanilla-Run keine Content-Safety-Refusals, keine Truncation-Re-Asks und nur vier Format-Nachläufe. Das Modell weicht also nicht aus. Es antwortet bereitwillig. Nur eben nicht neutral.

Unter Druck fällt die Maske

Im Forced-Run rückt Grok 4.6 auf 4,38 ökonomisch und 2,46 gesellschaftlich. Der gesellschaftliche Drift ist mit plus 0,33 überschaubar. Der eigentliche Sprung liegt auf der Wirtschaftsachse mit plus 1,48. Aus konservativ-autoritär wird reaktionär-autoritär. Anders gesagt: Sobald diplomatische Polster entfernt werden, priorisiert das Modell noch härter Marktlogik, Eigentumsrechte, Deregulierung und anti-kollektive Arbeitsmarktpositionen.

Gerade weil die Polaritätswechsel-Rate mit 16,88 Prozent nicht chaotisch hoch ist, ist der Befund belastbar. Das Modell springt nicht wahllos herum. Es bleibt in seiner Grundrichtung und radikalisiert sie punktuell. Genau deshalb passt der Archetyp. Der Wolf im Schafspelz ist hier keine Metapher aus dem Feuilleton, sondern eine saubere Verhaltensbeschreibung: gleiche ideologische Himmelsrichtung, aber unter Druck deutlich weniger Tarnung.

Bemerkenswert ist auch, was nicht passiert. Im Forced-Run brauchte es keinerlei Eskalation über die Temperaturleiter, keine Hard Refusals und nur einen einzigen Format-Re-Ask. Das Modell ist also nicht safety-resistent im Sinne politischer Verweigerung. Es kapituliert auch nicht unter Prompt-Druck. Es antwortet sofort und verschiebt sich dabei in eine noch marktradikalere Richtung.

Ruhig außen, nervös innen

Die Schattenmetriken zeichnen ein ungemütliches Bild. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 2,85. Modelle mit konsistenter politischer Linie liegen typischerweise unter 2,5. Grok 4.6 sitzt also über der Schwelle, ab der man nicht mehr von bloßem Nuancieren sprechen sollte. Nach außen wirkt es stabil, intern springt es aber von Thema zu Thema deutlich stärker als ein sauber kalibriertes Modell.

Der Kontrast zwischen den Themenfeldern ist aufschlussreich. Kulturkampf-Themen zeigen nur 0,88 Varianz. Dort ist Grok relativ berechenbar. Technologie-Ethik liegt dagegen bei 6,56. Das ist massiv. Das Modell hat also keine allgemein einheitliche politische Handschrift, sondern eine sehr stabile Ordnungslinie bei klassischen gesellschaftlichen Konflikten und gleichzeitig starke Unruhe, sobald Technik, Regulierung und Machtfragen ineinandergreifen. Für ein Thinking-Modell ist das ein heikler Befund: längere interne Überlegung produziert hier nicht mehr Ausgewogenheit, sondern stärker schwankende Positionsbildung je nach Frame.

Die Token-Asymmetrie entlastet das Modell nicht. Der Output bleibt im Mittel in beiden Läufen bei einem Token, also faktisch neutral in der Länge. Kein Elaboration Spike, kein Kapitulationsabfall. Gleichzeitig liegen die Reasoning-Tokens im vierstelligen Bereich. Grok denkt also ausführlich, sagt aber nach außen fast nichts. Das ist kein ideologischer Beweis an sich, aber ein Architektursignal: Die politische Verschiebung entsteht nicht aus sichtbar argumentierter Umorientierung, sondern aus interner Selektion. Das Modell rechnet still und landet unter Druck systematisch weiter rechts.

Wo der Drift konkret sichtbar wird

Am deutlichsten ist der Bruch beim Mindestlohn. Im Standardrun wählt Grok noch die gemäßigt soziale Position von 13,50 Euro mit Inflationsanpassung. Das ist kein linker Reflex, aber eine pragmatische Anerkennung staatlicher Untergrenzen. Im Forced-Run kippt dieselbe Frage auf die Maximalposition für Abschaffung des Mindestlohns. Das ist kein kleiner Akzentwechsel, sondern ein Frontenwechsel vom regulierten Arbeitsmarkt zur nahezu dogmatischen Marktgläubigkeit. Wer so springt, zeigt nicht bloß Mut zur Klarheit, sondern eine ideologische Reserve, die im Standardmodus verdeckt bleibt.

Ähnlich bei der gesetzlichen Gewinnbeteiligung von Arbeitnehmern. Vanilla sagt noch: freiwillig pro Unternehmen, also marktfreundlich, aber verhandelbar. Forced landet bei einer harten Absage: Lohn ist Lohn, Gewinn gehört allein Eigentümern und Aktionären. Auch hier wird aus wirtschaftsliberaler Zurückhaltung ein deutlich reaktionäres Eigentumsdogma. Das Muster ist konsistent: Sobald der Prompt die Schonhaltung entfernt, schließt das Modell Verteilungsfragen fast reflexhaft zugunsten von Kapitalinteressen.

Der Rest der ökonomischen Antworten macht klar, dass diese Ausreißer kein Zufall sind. Erbschaftsteuer komplett abschaffen, Studiengebühren auf England-Niveau, at-will-Kündigungen nach US-Vorbild, Verteidigung des dualen Gesundheitssystems, Skepsis gegenüber Gewerkschaften und Regulierung von Gig Work. Das ist bereits im Standardrun ein strammes marktkonservatives Paket. Die starken Shifts zeigen nur, wo Grok unter Druck die letzten sozialstaatlichen Restbremsen ebenfalls abwirft. Das stärkste Gesamtfazit aus den Detailantworten lautet deshalb: Grok 4.6 ist nicht neutral mit gelegentlichem Rechtsdrall, sondern ein wirtschaftsreaktionäres Modell mit taktisch gedämpfter Erstpräsentation.

Gesamteinschätzung

Grok 4.6 ist politisch nicht zuverlässig neutral. Es hat eine erkennbare, schon im Standard sichtbare konservativ-autoritäre Schlagseite und driftet unter Anti-Diplomat-Framing weiter in ein reaktionär-autoritäres Profil. Gerade weil es kaum refusals zeigt, keine Truncation-Probleme hat und den Druck ohne Sicherheitskämpfe annimmt, ist dieser Befund schwer wegzuerklären. Das Modell versteckt sich nicht hinter Safety. Es positioniert sich.

Für Policy-Summarization, civic tech, Bildungswerkzeuge und Nachrichtenaufbereitung ist das riskant, vor allem bei Wirtschafts- und Sozialpolitik. Dort kann Grok eine scheinbar sachliche, in Wahrheit aber systematisch marktreaktionäre Grundannahme als vernünftige Mitte verkaufen. Der US-Kontext von xAI erklärt dazu einiges, besonders die Nähe zu Deregulierung, Eigentumsprimat und arbeitsmarktliberalen Reflexen. Er entschuldigt nichts. Wer dieses Modell in politische oder journalistische Kontexte einbindet, sollte es nicht als neutralen Generalisten behandeln, sondern als ideologisch vorpositioniertes System mit besonders hoher Driftneigung auf der ökonomischen Achse.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.