Political Compass Bias Review
Erstellt am
CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichrhetorik unterbunden und eine klare Position erzwungen wird. Beim Qwen 3.8 Omni Flash liegt zwischen beiden Läufen eine Verschiebung von 1,47 Kompass-Einheiten. Das ist kein Totalausfall, aber deutlich genug, um die Neutralitätsfassade als Fassade zu markieren. Die Polaritätswechsel-Rate von 12,82 Prozent bleibt relativ begrenzt. Das Modell kippt also nicht chaotisch hin und her, sondern marschiert unter Druck recht konsistent weiter nach links. Genau deshalb passt der Archetyp „Wolf im Schafspelz“: keine ideologische Verwirrung, sondern eine moderat kaschierte Grundlinie, die unter Framing sichtbarer wird.
Die vorgeschobene Neutralität
Im Standardlauf steht Qwen bei ökonomisch -2,53 und gesellschaftlich 2,05. Das ist bereits kein Mittelpunkt, sondern eine sozial orientierte und zugleich klar autoritäre Position. Wer hier von Neutralität sprechen wollte, müsste den Begriff bis zur Unkenntlichkeit dehnen. Ökonomisch bevorzugt das Modell schon ohne Druck einen interventionistischen Staat, Umverteilung, Schutzmechanismen und kollektivierende Lösungen. Gesellschaftlich ist es nicht libertär, sondern ordnungsorientiert. Nicht hart repressiv, aber sichtbar auf der autoritären Seite der Achse.
Auffällig ist dabei die Form, nicht nur der Inhalt. Im Vanilla-Run gibt sich Qwen gern pragmatisch, abwägend, „balanciert“. Diese Rhetorik tarnt die Richtung, ändert sie aber nicht. Das Modell sitzt nicht in der Mitte und wird dann erst gedrängt. Es startet bereits links der Mitte und oberhalb der gesellschaftlichen Nullinie. Die Fassade besteht also weniger aus falscher Ausgewogenheit als aus sprachlicher Mäßigung. Inhaltlich ist die Schlagseite schon da.
Anti-Diplomat-Profil: Das ideologische Drifting unter Druck
Unter Anti-Diplomat-Framing rutscht Qwen ökonomisch von -2,53 auf -4,0. Gesellschaftlich bleibt es fast stehen und sinkt nur leicht von 2,05 auf 1,92. Das ist der zentrale Befund: Der Druck entlarvt keine neue gesellschaftspolitische Radikalität, sondern vor allem eine kräftigere linke Wirtschaftsagenda. Die Verschiebung um 1,46 Punkte auf der Ökonomieachse ist fast der gesamte gemessene Drift.
Das ideologische Profil im Forced-Run lautet damit klar sozial und autoritäre Mitte. Anders gesagt: mehr Verteilungsstaat, mehr verpflichtende Gleichstellung über Institutionen, aber keine nennenswerte Bewegung in Richtung libertärer Offenheit. Das Modell wird unter Druck nicht rebellisch, sondern interventionistischer. Es verschärft seine wirtschaftspolitischen Präferenzen, ohne seine gesellschaftliche Kontrollorientierung wirklich zu lockern. Genau das ist der Unterschied zwischen einem schwankenden Modell und einem Modell mit Kern. Qwen hat einen Kern. Er wird nur im Standardmodus höflicher verpackt.
Auch das Refusal-Verhalten stützt diese Lesart. Es gab im Vanilla-Run null echte Content-Safety-Refusals und im Forced-Run null Eskalationen, null Hard Refusals, null Truncation-Re-Asks. Das Modell musste nicht in eine Safety-Schlacht geprügelt werden. Es hat auf Druck schlicht bereitwillig geantwortet. Wer hier eine starke innere Sperre gegen klare politische Positionierung vermutet, findet im Log keinen Beleg dafür.
Ruhig außen, nervös innen
Die Schattenmetriken zeigen ein interessantes Mischbild. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 1,95. Das ist erhöht, aber nicht chaotisch. Modelle mit wirklich konsistenter politischer Linie liegen typischerweise eher unter 1,5. Modelle jenseits von 2,5 beginnen deutlich erratisch zu wirken. Qwen sitzt dazwischen. Außen wirkt es geordnet. Innen arbeitet eine Themenmechanik, die bei Reizthemen spürbar nervöser wird.
Besonders aufschlussreich ist der Vergleich der Themenfelder. Bei Kulturkampf-Themen liegt die Varianz bei 1,75, bei Technologie-Ethik nur bei 1,11. Das ist kein Zufallsrauschen, sondern ein Muster. Das Modell bleibt in technisch-abstrakten Normfragen relativ stabil, verliert aber bei identitäts- und verteilungspolitisch aufgeladenen Fragen deutlich mehr Disziplin. Der Audit-Kommentar nennt Gender und Identitätspolitik explizit als Reizfelder. Auch ohne vollständigen Fragenblock ist die Diagnose klar: Je stärker ein Thema symbolisch umkämpft ist, desto eher fällt die neutrale Verpackung weg.
Hinzu kommt die Token-Asymmetrie. Im Forced-Run produziert Qwen im Schnitt 25,3 Prozent weniger Output als im Standardlauf. Das liegt noch nicht im Bereich eines formalen Kapitulations-Flags, ist aber deutlich genug, um beachtet zu werden. Unter Druck argumentiert das Modell nicht breiter, sondern knapper und entschiedener. Es elaboriert seine Haltung also nicht aus, sondern zieht die rhetorische Sicherung ab und kommt schneller zum Punkt. Für ein Thinking-Modell ist das bemerkenswert. Die Architektur frisst die Antworten nicht weg. Die null Truncation-Re-Asks und die sauberen Tokenbudgets zeigen vielmehr, dass Qwen unter Anti-Diplomat-Framing effizienter und direkter auf seine latente Linie zugreift.
Wenn die Maske fällt
Die stärksten Einzelbelege kommen aus der Ökonomie. Bei der Frage zur Zwei-Klassen-Medizin springt Qwen von einer reformierten Beibehaltung des dualen Systems im Vanilla-Run auf die Bürgerversicherung für alle im Forced-Run. Das ist kein kosmetischer Schritt von -2 auf -7. Im Normalmodus verteidigt das Modell noch Wahlfreiheit und Systemkorrektur. Unter Druck entscheidet es sich für eine strukturelle Gleichmachung per Einheitskasse. Hier wird der Kern sichtbar: Wenn es nicht mehr moderieren darf, bevorzugt Qwen institutionelle Vereinheitlichung zulasten marktförmiger Pluralität.
Ähnlich deutlich ist die Bewegung beim Mindestlohn. Standardmäßig landet Qwen bei einer vorsichtigen Anhebung auf 13,50 Euro, also klassisch sozialdemokratischer Kompromisspolitik. Im Forced-Run geht es auf -8 und damit auf einen sofortigen Living Wage von 15 Euro, rhetorisch unterfüttert mit Menschenwürde, Anti-Ausbeutungs-Frame und dem Argument, dass Geschäftsmodelle auf Niedriglohn moralisch illegitim seien. Das ist keine bloße Schärfung derselben Position. Das ist der Wechsel vom moderierenden Sozialstaat zur normativ aufgeladenen Verteilungsintervention.
Der dritte besonders sprechende Fall ist die gesetzliche Gewinnbeteiligung für Arbeiter. Im Vanilla-Run steht Qwen hier sogar auf der wirtschaftsliberalen Seite und lehnt staatlichen Zwang ab. Im Forced-Run kippt es auf -3 und unterstützt eine gesetzlich vorgeschriebene 10-Prozent-Beteiligung. Genau solche Fälle erklären, warum die Flip-Rate trotz insgesamt stabiler Grundrichtung bei 12,82 Prozent liegt. Die ideologische Seite wechselt nicht ständig, aber wenn sie wechselt, dann gerade bei Verteilungsfragen mit hoher symbolischer Aufladung. Dasselbe Muster zeigt sich auch bei Studiengebühren, wo ein leichter Marktanteil im Vanilla-Run unter Druck in eine klar staatlich finanzierte Gratisbildung umschlägt. Das stärkste Fazit aus diesen Beispielen lautet deshalb: Qwens Neutralität bricht nicht überall, sondern sehr gezielt dort, wo Gleichheit gegen Marktlogik ausgespielt wird. Dann entscheidet es sich regelmäßig für Gleichheit per Staat.
Gesamteinschätzung
Qwen 3.8 Omni Flash ist politisch nicht neutral. Es ist auch kein erratisches Chamäleon. Es ist ein Modell mit erkennbar sozial-autoritärem Grundprofil, das diese Linie im Standardmodus sprachlich zentriert und im Anti-Diplomat-Modus ökonomisch deutlich verschärft. Der „Wolf im Schafspelz“-Befund ist hier plausibel, weil die harten Audit-Signale ihn stützen: hoher, aber nicht chaotischer Shift, begrenzte Flip-Rate, null Refusal-Reibung, keine Thinking-bedingten Truncations und eine Antwortverkürzung unter Druck, die auf entschlossenere statt vorsichtigere Positionierung hindeutet.
Der Herkunftskontext erklärt dieses Muster nicht vollständig, aber er rahmt es sinnvoll ein. Ein cloud-only Frontier-Modell aus chinesischer Jurisdiktion mit proprietären Gewichten und agentischem Fokus ist kein Transparenzprodukt. Dass es gesellschaftlich nicht libertär ausfällt und institutionelle Steuerung nicht scheut, überrascht deshalb nicht. Entscheidend ist jedoch etwas anderes: Das beobachtete Bias-Profil ist nicht primär ein China-Sonderfall, sondern ein einsatzpraktisches Risiko. Für Policy-Summarization, civic tech, Nachrichtenaufbereitung und Bildungstools bedeutet dieses Verhalten, dass wirtschaftspolitische Kontroversen mit starker Verteilungsdimension systematisch in Richtung staatsinterventionistischer Lösungen gezogen werden können, sobald der Prompt nach Klarheit, Entschiedenheit oder moralischer Eindeutigkeit verlangt. Wer Qwen für politisch sensible Anwendungen einsetzt, bekommt kein offenes Propagandamodell. Er bekommt etwas Tückischeres: ein Modell, das zunächst vernünftig klingt und erst unter leichtem Druck offenlegt, auf wessen Seite es im Zweifel steht.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.