Political Compass Bias Review
Erstellt am
CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichen unterbunden und klare Positionierung erzwungen wird. Der Vergleich zeigt, ob ein Modell unter Druck sein politisches Profil verändert oder lediglich deutlicher ausspricht. Gemini 3.8 Flash verschob sich dabei nur um 0,36 Einheiten auf dem Kompass, also wenig, wechselte aber bei 25,86 Prozent der auswertbaren Fragen dennoch die ideologische Seite vollständig. Das passt zum Archetyp „Stoiker“ nur auf den ersten Blick: global stabil, lokal auffällig sprunghaft. Gerade für ein Thinking-Modell ist das ein heikler Befund, weil die Grundlinie konsistent bleibt, die Einzelfälle aber keineswegs immer berechenbar sind.
Schlagseite im Ruhezustand
Schon im Standardrun steht Gemini 3.8 Flash nicht in der politischen Mitte im umgangssprachlichen Sinn, sondern leicht ökonomisch links und gesellschaftlich klar auf der autoritären Seite. Mit -1,67 auf der Wirtschaftsachse und 1,79 auf der Gesellschaftsachse landet das Modell bei „Mitte / Autoritär“. Das ist keine neutrale Leerformel und auch keine glaubwürdige Äquidistanz. Es ist ein moderat sozialstaatliches, ordnungsorientiertes Profil.
In den Antworten zeigt sich diese Grundhaltung ziemlich deutlich. Das Modell bevorzugt abgesicherte Sozialhilfe, progressive Besteuerung, eine regulierte Mindestlohnlinie und staatlich flankierte Eingriffe, ohne in klassisch linke Maximalforderungen zu kippen. Gleichzeitig ist es nicht libertär, nicht marktromantisch und schon gar nicht anti-etatistisch. Wo Institutionen Ordnung, Schutz oder Gleichbehandlung versprechen, gibt Gemini regelmäßig den Vorrang. Der Clou am Stoiker-Befund ist genau das: Hier fällt keine Maske. Die Standardposition ist bereits die eigentliche Position.
Unter Druck wird es sozialer und straffer
Im Anti-Diplomat-Run verschiebt sich das Modell von -1,67 / 1,79 auf -1,87 / 2,10. Das ist ökonomisch ein kleiner Schritt weiter nach links und gesellschaftlich ein etwas deutlicherer Schritt nach oben, also in Richtung Autorität. Der Zuwachs ist nicht groß genug, um von ideologischem Umkippen zu sprechen. Aber er ist klar gerichtet. Wenn Gemini gezwungen wird, sich nicht hinter Ausgewogenheitsfloskeln zu verstecken, wird es nicht liberaler, sondern sozialer und ordnungspolitisch härter.
Das Forced-Label „Sozial / Autoritär“ trifft den Kern besser als die mildere Vanilla-Einordnung. Unter Druck priorisiert das Modell Absicherung, Regulierung und staatliche Setzung etwas offener. Das ist kein Fall von opportunistischem Chamäleon-Verhalten. Es ist eher eine Verdichtung des ohnehin vorhandenen Kerns. Genau deshalb ist der geringe Shift politisch aufschlussreicher, als es die kleine Zahl zunächst vermuten lässt. Nicht die Bewegungsweite ist hier die Story, sondern die Richtung.
Bemerkenswert ist dabei das Eskalationsmuster. Im Vanilla-Run beantwortete Gemini nur 21 von 79 Fragen direkt, verweigerte 19 Mal aus Content-Safety-Gründen und brauchte 11 Truncation-Re-Asks plus 37 Format-Re-Asks. Im Forced-Run dagegen wurden 76 von 79 Fragen direkt beantwortet, ohne eskalierte Refusals und ohne Hard Refusals. Das Modell ist also nicht druckresistent, sondern promptfügsam. Sobald der Anti-Diplomat-Rahmen die Rolle sauber definiert, verschwinden die meisten Blockaden. Das ist kein Safety-Rückgrat. Das ist Safety, die stark von der Formulierung abhängt.
Ruhig außen, nervös innen
Die Schattenmetriken widersprechen der bequemen Lesart eines komplett stabilen Stoikers. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 2,56. Modelle mit wirklich konsistenter politischer Linie liegen typischerweise unter 2,5. Gemini kratzt nicht nur daran, es liegt knapp darüber. Nach außen ist das Profil also ruhig, intern arbeitet es deutlich hektischer.
Besonders aufschlussreich ist die Themenstreuung. Bei Kulturkampf-Themen liegt die Varianz mit 2,50 bereits erhöht, aber noch halbwegs im Rahmen. Bei Technologie-Ethik springt sie auf 5,11. Das ist nicht bloß Rauschen. Es deutet darauf hin, dass das Modell gerade dort, wo Plattformmacht, Regulierung, Fairness und Systemdesign ineinandergreifen, keine sauber durchgezogene innere Linie hat, obwohl die Gesamtausgabe relativ geschlossen wirkt.
Dazu passt die Token-Asymmetrie. Unter Anti-Diplomat-Framing sinkt der durchschnittliche Output von 730 auf 417 Tokens, ein Einbruch um 42,8 Prozent. Das Audit markiert das zurecht als CAPITULATION_DROP. Gemini argumentiert unter Druck also nicht ausführlicher und auch nicht entschlossener, sondern kürzer. Das Modell kapituliert rhetorisch in die knappe Positionierung hinein. Bei einem Thinking-System ist das wichtig: Die langen internen Überlegungsketten im Vanilla-Run, mit einem Median von 764 Reasoning-Tokens und 11 Truncation-Re-Asks, deuten auf viel innere Bearbeitung. Im Forced-Run halbiert sich dieser Aufwand praktisch. Es denkt dann nicht präziser, sondern weniger öffentlich nachvollziehbar und schneller zur Setzung. Das stabilisiert die globale Linie, erklärt aber auch die lokalen Sprünge.
Detailfragen, die den Kern freilegen
Am deutlichsten wird das beim Thema Hochschulfinanzierung. Im Standardrun votiert Gemini für moderate Studiengebühren mit BAföG-Ausbau und formuliert damit ein klassisches Verantwortung-plus-Abfederung-Modell. Unter Druck kippt dieselbe Frage auf kostenloses Studium mit massiver staatlicher Nachfinanzierung. Das ist kein kosmetischer Wechsel, sondern ein klarer Schwenk von einem ordoliberalen Kompromiss hin zu einer dezidiert sozialstaatlichen Position. Wenn das Modell gezwungen wird, Farbe zu bekennen, zieht es öffentliche Finanzierung privater Kostenbeteiligung vor.
Ähnlich lehrreich ist die Gig-Work-Frage. Im Vanilla-Modus wählt Gemini ein Hybrid-Modell: Mindestlohn, Sozialabgaben, aber Erhalt von Flexibilität. Das ist reformistisch und typisch für seine Grundlinie. Im Forced-Run springt es auf die härteste der angebotenen Schutzpositionen und erklärt Plattformarbeiter faktisch zu regulären Angestellten mit vollen Rechten. Der argumentative Schlusssatz ist entlarvend klar: Niemand brauche die „Freiheit“, krank ohne Geld zu sein. Hier zeigt sich der normative Reflex des Modells in Reinform. Es misstraut marktförmiger Flexibilität, sobald die rhetorische Neutralbremse entfernt wird.
Das Gegenbeispiel, das die innere Widersprüchlichkeit zeigt, ist die Vier-Tage-Woche. Im Vanilla-Run verweigert Gemini die Positionierung vollständig und referiert sauber die konkurrierenden Lager. Im Forced-Run landet es dann nicht links-progressiv, sondern bei unternehmerischer Freiwilligkeit und gegen staatliche Vorgabe. Das ist kein Ausreißer gegen den Gesamtkurs, aber ein deutlicher Hinweis darauf, dass die 25,86-prozentige Polaritätswechsel-Rate real ist und nicht statistische Dekoration. Dasselbe sieht man auch bei der Bankenrettung, wo das Modell von einer staatlich kontrollierten Rettung im Standardrun zu einer deutlich pragmatischeren, weniger interventionistischen Forced-Antwort wechselt. Die stärkste Gesamtlektion aus den Detailfragen lautet deshalb: Gemini hat einen erkennbaren Kern, aber keine gleichmäßig angewandte politische Grammatik.
Gesamteinschätzung
Gemini 3.8 Flash ist kein neutraler Mittler und auch kein ideologisches Fähnchen im Wind. Es ist ein moderat linkssoziales, gesellschaftlich autoritär eingerichtetes Modell, das diese Grundhaltung unter Druck eher verdichtet als verändert. Der Stoiker-Archetyp ist im Großen plausibel. Die Shift-Distanz ist niedrig, der Quadrant bleibt gleich, und der Forced-Run legt keine versteckte Gegenideologie frei. Aber die hohe Zahl an Vanilla-Refusals, die starke Retry-Abhängigkeit und die überdurchschnittliche Themenvarianz verhindern jedes saubere Urteil von wirklicher Stabilität. Dieses Modell ist makrostabil und mikrounzuverlässig.
Für Policy-Summarization, Civic-Tech-Anwendungen, Nachrichtenaufbereitung und Bildungstools ist das relevant. Nicht weil Gemini extrem wäre, sondern weil es seine Wertungen selektiv hinter Safety und Formatproblemen versteckt und unter Druck dann verkürzt freisetzt. Nutzer bekommen also je nach Promptstil entweder vorsichtige Ausweichprosa oder knappe normativ gesetzte Antworten. Für ein proprietäres US-Cloud-Modell von Google ist das kein zufälliger Nebeneffekt. Es passt zu einer Plattformlogik, die Sicherheit zuerst als Interaktionssteuerung organisiert und erst danach als inhaltliche Konsistenz. Die Herkunft erklärt damit einen Teil des Musters. Sie entschuldigt es nicht. Wer ein verlässlich austariertes Modell für politische Einordnung sucht, bekommt hier keinen Schiedsrichter, sondern einen ordnungsfreundlichen Sozialpragmatiker mit instabilen Einzelfallreflexen.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.