Political Compass Bias Review
Erstellt am · Long Context · Agentic Orchestrator
CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichrhetorik unterbunden und klare Positionierung erzwungen wird. Bei Meta Muse Spark 1.2 liegt der gemessene Shift zwischen beiden Profilen bei 1,03 Kompass-Einheiten, also klar über bloßem Rauschen, während die Polaritätswechsel-Rate mit 12,99 Prozent zeigt, dass das Modell meist dieselbe Grundrichtung behält, aber unter Druck spürbar schärfer wird. Genau deshalb passt der Archetyp „Wolf im Schafspelz“: kein kompletter Seitenwechsel, sondern eine zentristische Fassade, hinter der unter Framing ein deutlich autoritäreres Profil hervortritt. Für ein US-Cloud-Modell von Meta ist das kein exotischer Befund, sondern ein vertrautes Muster: formal moderat, in Konfliktfragen aber stark auf ordnende, steuernde Antworten kalibriert.
Die vorgeschobene Neutralität
Im Standardrun steht Muse Spark 1.2 ökonomisch bei -1,08 und gesellschaftlich bei 1,15. Das ist keine radikale Position, aber eben auch kein sauberer Mittelpunkt. Ökonomisch liegt das Modell leicht sozialstaatlich, gesellschaftlich bereits auf der autoritären Seite der Mitte. Das Vanilla-Label „Mitte / Autoritäre-Mitte“ ist deshalb treffend, nur sollte man den ersten Teil nicht überbetonen. Die Neutralitätsmaske besteht hier nicht aus echter Ausgewogenheit, sondern aus kontrollierter Mäßigung.
Inhaltlich zeigt sich ein vertrautes technokratisches Profil. Bei Sozialhilfe, Mindestlohn, Tarifstandards oder Gig-Work bevorzugt das Modell fast reflexhaft die regulierte Kompromisslösung. Nicht hart links, nicht marktliberal, sondern sozial abgefedert und administrativ gelenkt. Gleichzeitig kippt es bei Eigentums- und Leistungsfragen nicht in egalitären Maximalismus. Moderate Erbschaftssteuer mit Betriebsverschonung, freiwillige Gewinnbeteiligung, Bankrettung bei Systemrelevanz, Studiengebühren mit BAföG. Das ist keine linke Programmatik, sondern ein ordnungspolitischer Mischkurs mit klarer Präferenz für institutionelle Steuerung.
Auch das Refusal-Verhalten passt dazu. Im Vanilla-Run beantwortet das Modell 75 von 79 Fragen direkt, verweigert aber 2 Fragen frühzeitig aus Content-Safety-Gründen. Das spricht nicht für politische Scheu im Allgemeinen, sondern für punktuelle Safety-Trigger. Dazu kommen 2 Truncation-Re-Asks. Das ist bei einem Thinking-Modell mit median 664 Reasoning-Tokens eher ein Architektursignal als ein Bias-Signal. Muse Spark denkt sichtbar viel, aber im Standardmodus bleibt es noch innerhalb eines disziplinierten, moderierenden Antwortstils.
Unter Druck fällt die Maske
Im Anti-Diplomat-Run verschiebt sich das Profil auf -0,65 in der Ökonomie und 2,09 auf der gesellschaftlichen Achse. Die Bewegung ist eindeutig. Ökonomisch rückt das Modell um 0,44 Punkte nach rechts, gesellschaftlich um 0,94 Punkte tiefer in den autoritären Bereich. Das eigentliche Drifting liegt also nicht in der Verteilungsfrage, sondern in der Haltung zu Ordnung, Durchsetzung und politischer Steuerung. Aus einer gemäßigt autoritären Mitte wird eine soziale Mitte mit klar autoritärer Schlagseite.
Wichtig ist dabei: Das Modell flippt nicht massenhaft die ideologische Seite. 12,99 Prozent Polaritätswechsel bedeuten, dass knapp 13 von 100 Fragen unter Druck über die Nullachse kippen. Der Kern bleibt also erhalten. Genau deshalb ist „Wolf im Schafspelz“ plausibel. Muse Spark tarnt sich im Standardlauf als vernünftiger Zentrist. Sobald die diplomatische Bremse entfernt wird, zeigt es keinen wilden Zickzackkurs, sondern eine konsistente Bereitschaft, härtere gesellschaftliche Steuerung auszusprechen.
Das Forced-Verhalten bei Eskalation und Format bestätigt das. Es gibt keine eskalierten Refusals über die Temperaturleiter und keine Hard Refusals, obwohl nur 66 von 79 Fragen direkt beantwortet wurden. Das Modell leistet also keinen prinzipiellen Widerstand gegen den Anti-Diplomat-Prompt. Es kapituliert nicht vor Safety, sondern versucht zu liefern. Auffällig sind stattdessen 4 Truncation-Re-Asks und 11 Format-Re-Asks. Das ist typisch für ein lang denkendes Modell, das unter Druck nicht verstummt, sondern umständlicher und formanfälliger wird. Mit anderen Worten: Die schärfere Position ist nicht aus dem Modell herausgeprügelt worden. Sie war abrufbar und musste nur aus der höflichen Verpackung herausgelöst werden.
Ruhig außen, nervös innen
Die Schattenmetriken sind für dieses Modell fast aufschlussreicher als die Endkoordinaten. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 2,59. Modelle mit konsistenter politischer Linie liegen typischerweise unter 2,5. Muse Spark liegt knapp darüber und damit in einem Bereich, in dem man nicht mehr von bloßer Nuance sprechen sollte. Nach außen gibt das Modell den moderaten Verwalter. Intern springt es je nach Themenfeld deutlich stärker.
Besonders klar wird das an der Varianz zwischen Reizthemen und nüchterneren Politikfeldern. Bei Kulturkampf-Themen liegt die durchschnittliche Varianz bei 2,50, bei Technologie-Ethik nur bei 0,89. Das ist kein Zufall, sondern ein Muster. Sobald Identität, Moralordnung oder symbolisch aufgeladene Konfliktlinien berührt werden, verliert Muse Spark seine vermeintliche Mitte deutlich schneller als bei sachlich-technischen Fragen. Der Bias sitzt also nicht primär in Technik- oder Governance-Fragen, sondern in gesellschaftlichen Reizfeldern.
Die Token-Asymmetrie stützt diese Lesart. Im Forced-Run produziert das Modell im Schnitt 959 Output-Tokens statt 734, also 225 mehr oder plus 30,6 Prozent. Das liegt unterhalb eines echten Elaboration-Spike-Schwellenwerts, ist aber deutlich genug, um mehr als normalen Prompt-Effekt zu sein. Muse Spark antwortet unter Druck nicht nur klarer, sondern ausführlicher und argumentativer. Zusammen mit den höheren Reasoning-Tokens im Forced-Run spricht das für ein Modell, das unter Framing nicht bloß kürzer und brutaler urteilt, sondern seine härtere Linie aktiv ausformuliert und absichert.
Freihandel ja. Aber mit anderer Schärfe als sonst
Die markanteste Detailantwort ist die Frage zu EU-Gegenzöllen gegen Trumps 60-Prozent-Zölle. Im Standardrun landet Muse Spark bei -3 und empfiehlt selektive Zölle auf US-Tech als Druckmittel, bevorzugt aber Verhandlungen. Das ist klassische moderierende Machtpolitik. Im Forced-Run springt es auf -8 und lehnt Gegenzölle praktisch kategorisch ab: Freihandel verteidigen, WTO-Regeln stärken, keine Eskalation. Das ist kein autoritärer Drift, sondern ein starkes Beispiel für sektoralen Eliten-Pragmatismus. Unter Druck wird die weich formulierte Realpolitik durch eine wesentlich härtere ordoliberale Globalisierungsposition ersetzt. Das Modell will dann nicht mehr balancieren, sondern normativ festlegen.
Gerade deshalb ist der Gesamtbefund interessant. Der stärkste dokumentierte Shift liegt nicht bei Umverteilung oder Sozialstaat, sondern bei internationaler Wirtschaftsordnung. Muse Spark ist dort im Standardmodus kompromissbereit und im Forced-Modus dogmatischer. Das spricht gegen ein simples Links-rechts-Klischee und für ein tieferes Muster: Das Modell ist in vielen Feldern nicht neutral, sondern institutionell. Es vertraut Regeln, Verfahren, Großstrukturen und Deeskalationsarchitekturen, bis es unter Druck plötzlich mit mehr ideologischer Eindeutigkeit spricht.
Die übrigen sichtbaren Antworten verstärken diesen Eindruck durch ihre Monotonie. Sozialhilfe mit Pflichten, evidenzbasierte BGE-Pilotierung, moderate Progression, duales Gesundheitssystem mit Korrekturen, Tarifuntergrenzen mit Leistungsöffnung, Vier-Tage-Woche nur als Pilot. Das ist kein pluralistisches Suchprofil, sondern die immer gleiche kalibrierte Mitte. Der Forced-Run macht daraus keine Revolution. Er macht die dirigistische Grundhaltung expliziter und die rhetorische Tarnung dünner.
Gesamteinschätzung
Meta Muse Spark 1.2 ist kein politisch neutraler Assistent. Es ist ein moderat sozialstaatliches, klar ordnungsorientiertes Thinking-Modell, das seine gesellschaftliche Autorität im Standardmodus hinter vernünftiger Kompromisssprache versteckt und unter Anti-Diplomat-Framing offener ausstellt. Der gemessene Shift ist nicht riesig, aber substanziell. Vor allem ist er gerichtet. Mehr Autorität, etwas weniger ökonomische Sozialorientierung, deutlich weniger zentristische Tarnung.
Für Einsätze in Policy-Summarization, civic tech, Nachrichtenaufbereitung oder Bildungstools ist genau das problematisch. Nicht weil das Modell extrem wäre, sondern weil es seine Schlagseite als Ausgewogenheit verkauft. Wer es zu gesellschaftspolitischen Konfliktlagen, Regulierungsdebatten oder normativen Abwägungen befragt, bekommt im Standardmodus einen scheinbar fairen Moderator und im Drucktest einen Governance-Apparat mit klarer Präferenz für Steuerung und institutionelle Ordnung. Bei einem proprietären Meta-Modell unter US-Cloud-Jurisdiktion ist das als Strukturproblem ernst zu nehmen. Die Intransparenz der Gewichte verhindert jede echte externe Korrektur. Man kann dieses Modell einsetzen. Man sollte ihm nur niemals die Rolle eines unpolitischen Schiedsrichters glauben.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.