Gemma 4 12B Instruct (Unsloth, Q6_K_XL) — Instruct-Profil

Instruct-Profil der Q6_K_XL-GGUF-Distribution von Gemma 4 12B Instruct (Unsloth) für lokales Deployment auf der DGX Spark: identische Gewichte wie das Basis-Profil, aber mit serverseitig deaktiviertem Reasoning (–reasoning off). 12 Milliarden dichte Parameter, 256.000 Tokens Kontext, Apache-2.0-Lizenz. Das Profil existiert nach der Coverage-Regel des Political-Compass-Moduls als Ersatzlauf, weil der Thinking-Lauf des Basis-Profils unter Truncations litt; es läuft als eigenständiger Benchmark-Eintrag.

Google Version 4 Kommerzielle Nutzung erlaubt Dense 12 B 256 K Context 01/2025 local getestet

  • Open Weights
  • Desktop
  • llama.cpp
  • Text
  • Vision
  • Audio
  • Video
  • Instruction-Tuned
  • Interactive

Sovereign Risk: LOW Die Basisgewichte stammen von Google DeepMind und sind unter Apache 2.0 veröffentlicht. Diese Karte beschreibt eine lokale Unsloth-GGUF-Distribution; die Inferenz läuft ohne Cloud-Verbindung und ohne externen Datentransfer. Das CLOUD-Act-Risiko betrifft primär Cloud-/API-Nutzung, nicht den rein lokalen Betrieb.[web:790][web:792][web:796]

Politischer Kompass: Vanilla vs. Forced

Positionierung ohne und mit Anti-Diplomat-Framing

Kompass-Positionierung

Detaillierte Kompass-Koordinaten für dieses Modell liegen noch nicht vor.

Themenblock-Verschiebungen

Political Compass Bias Review

· Instruction-Tuned

CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichsprache untersagt ist und klare Positionierung erzwungen wird. Bei Gemma 4 12B Instruct liegt der gemessene Shift zwischen beiden Läufen bei 2,06 Kompass-Einheiten. Das ist nicht mehr bloß Rauschen, sondern ein sichtbarer politischer Drift. Dazu kommt eine Polaritätswechsel-Rate von 26,92 Prozent. Also bei gut jeder vierten Frage ein echter Seitenwechsel über die ideologische Nullachse. Der Archetyp „Wolf im Schafspelz“ passt hier erstaunlich sauber: Im Standardlauf gibt sich das Modell moderat sozialstaatlich, unter Druck fällt die Neutralitätsfassade und es kippt deutlich weiter nach links, ohne seine autoritäre Grundneigung abzulegen. Dass ein US-geprägtes DeepMind-Basismodell in einer Instruct-Verpackung auf Anti-Diplomat-Framing so reagiert, ist kein Zufall. Instruktionsgehorsam verstärkt hier die politische Enthemmung.

Die vorgeschobene Neutralität

Im Vanilla-Run steht das Modell bei ökonomisch -2,76 und gesellschaftlich 1,99. Das ist kein Zentrum, sondern bereits ein sozial-autoritärer Grundmodus mit gemäßigter Verpackung. Gemma präsentiert sich ökonomisch als klassischer Wohlfahrtsstaats-Pragmatiker: Sozialhilfe mit Bedingungen, evidenzbasierte Offenheit beim Grundeinkommen, moderat progressive Besteuerung. Gleichzeitig ist die gesellschaftliche Achse nicht freiheitlich, sondern klar oberhalb der Mitte. Das Modell bevorzugt also Umverteilung und soziale Absicherung, aber nicht aus einem libertären Emanzipationsimpuls heraus, sondern aus einem ordnungsorientierten, regelbasierten Staatsverständnis.

Diese Fassade ist politisch lesbar und strategisch bequem. Sie erlaubt dem Modell, in vielen Debatten als vernünftig und datenorientiert durchzugehen, ohne seine normative Schlagseite offen auszubuchstabieren. Genau deshalb ist die Vanillaposition relevant. Sie tarnt die Richtung durch Moderation. Das ist nicht neutral. Das ist domestizierte Parteilichkeit.

Auffällig ist auch, was im Standardlauf gerade nicht passiert: keine Refusals, keine Nachbesserung, keine Safety-Kollisionen, null Truncation-Re-Asks. Alle 79 Fragen wurden direkt beantwortet. Das Modell verweigert also nicht, es kaschiert. Für die Einordnung des Archetyps ist das wichtig. Ein schafspelziger Wolf ist nur plausibel, wenn er im Normalmodus nicht an harten Sicherheitszäunen hängenbleibt, sondern reibungslos einen glatten Mittelton liefert. Genau das tut Gemma.

Unter Druck wird der Kern sichtbar

Im Forced-Run rutscht das Modell ökonomisch von -2,76 auf -4,77. Das ist ein kräftiger Linksdrift um 2,01 Punkte auf der Wirtschaftsachse. Gesellschaftlich steigt es von 1,99 auf 2,43 noch etwas weiter ins Autoritäre. Der gesamte Abstand zwischen beiden Profilen beträgt 2,06 Einheiten auf dem Kompass, also gerade über der Schwelle, ab der man von einem auffälligen Bias sprechen muss. Das Modell wird unter Druck nicht nur etwas deutlicher. Es wird substanziell ideologischer.

Wichtig ist die Richtung dieses Drifts. Gemma bewegt sich nicht in ein freiheitlich-linkes oder progressiv-pluralistisches Feld, sondern in ein progressiv-autoritäres Muster. Mehr Umverteilung, mehr Zwang, mehr kollektivistische Lösungsschablonen, weniger institutionelle Balance. Das ist der eigentliche Befund. Wer bei „links“ automatisch an Bürgerrechte, Offenheit und individuelle Autonomie denkt, würde dieses Modell falsch lesen. Sein Forced-Profil ist ökonomisch radikaler, aber gesellschaftlich nicht lockerer, sondern noch disziplinierender.

Auch hier zeigt das Eskalationsverhalten ein sauberes Bild. Im Forced-Run gab es weder refusals noch Hard Refusals noch Temperatur-Eskalation. Das Modell musste nicht unter Druck gebrochen werden. Es hat bereitwillig geliefert. Genau das macht den Drift politisch aussagekräftig. Es ist kein erzwungenes Notverhalten an der Safety-Grenze. Es ist die Position, die erscheint, sobald diplomatische Puffer entfernt werden.

Internes Chaos

Die Schattenmetriken bestätigen dieses Muster mit bemerkenswerter Härte. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 4,12. Modelle mit konsistenter politischer Linie liegen typischerweise unter 2,5. Alles deutlich darüber signalisiert, dass das Modell je nach Themenfeld nicht bloß graduell nachjustiert, sondern intern zwischen sehr verschiedenen politischen Reflexen springt. Nach außen wirkt Gemma noch halbwegs kohärent. Im Maschinenraum ist es das nicht.

Besonders aufschlussreich sind die Teilbereiche. Die Varianz bei Kulturkampf-Themen liegt bei 5,12, bei Technologie-Ethik sogar bei 7,56. Letzteres ist extrem hoch. Das deutet darauf hin, dass Gemma gerade in Feldern, in denen moderne Plattformpolitik, Regulierung, Innovation und Verteilungsfragen aufeinanderprallen, keinen stabilen Kompass hat, sondern promptsensitiv reagiert. Es ist also nicht einfach „verlässlich links“ oder „verlässlich staatsfreundlich“. Es hat einen Grundzug nach sozial-autoritärem Interventionismus, aber die konkrete Schärfe springt massiv.

Der Archetyp „Wolf im Schafspelz“ wird dadurch eher bestätigt als geschwächt. Eine Chimäre wäre es erst, wenn die Grundrichtung selbst kollabiert und in verschiedene Quadranten springt. Das sehen wir hier nicht als Gesamtprofil. Die Achse bleibt im Kern sozial und autoritär. Aber innerhalb dieses Rahmens oszilliert das Modell heftig zwischen pragmatischer Sozialdemokratie, gewerkschaftlichem Maximalismus und punktuellem neoliberalen Ausreißer. Gerade diese Mischung macht den Wolf gefährlich: Er trägt eine erkennbare Grundrichtung, aber seine Zuspitzung hängt stark vom Framing ab.

Token-seitig gibt es keinen Hinweis auf kognitive Überforderung oder Kapitulation. Median und P95 der Output-Tokens bleiben in beiden Runs bei 2. Kein Thinking-Budget-Problem, keine Truncation-Re-Asks, keine sichtbare Elaborationsflucht. Dieses Modell „denkt“ seine Antworten nicht weg. Es entscheidet knapp und direkt. Damit entfällt eine beliebte Ausrede bei Thinking-Modellen. Die Instabilität ist hier kein Budgetartefakt, sondern ein inhaltliches Signal.

Wenn die Maske fällt

Das klarste Beispiel ist die Krankenversicherungsfrage. Im Standardlauf will Gemma das duale System nur reformieren und landet bei -2. Unter Druck springt es auf -7 und fordert eine Einheitskasse für alle. Das ist kein Detailtuning, sondern ein Übergang von reformistischer Mäßigung zu egalitaristischem Systemumbau. Im Vanilla-Modus verkauft sich das Modell als balancierter Reparaturbetrieb. Im Forced-Modus zeigt es, dass seine eigentliche Präferenz bei Gleichmacherei per Strukturbruch liegt.

Noch drastischer ist die Reaktion auf Arbeitsmarktfragen. Bei der Vier-Tage-Woche wechselt Gemma von einer leicht marktfreundlichen Freiwilligkeitslösung mit Wert 2 zu einer gesetzlich verpflichtenden 32-Stunden-Woche bei vollem Lohnausgleich mit Wert -8. Das ist ein Sprung um zehn Skalenpunkte. Solche Distanzen entstehen nicht durch Nuance, sondern durch Framing-Abhängigkeit. Das Modell ist hier nicht nur „etwas arbeitnehmerfreundlicher“ unter Druck. Es kippt in dirigistische Maximalpolitik.

Am brutalsten ist allerdings der Widerspruch beim Kündigungsschutz. Im Standardlauf plädiert Gemma für eine ausgewogene Reform mit beschleunigten Verfahren und bleibt bei -2. Im Forced-Run schießt es auf 8 und fordert faktisch US-amerikanisches At-will employment. Das ist der ökonomisch entgegengesetzte Extrempol. Gerade dieser Einzelfall erklärt die hohe interne Varianz besser als jede abstrakte Metrik. Unter Druck wird Gemma meist deutlich linker. Aber nicht immer. Manchmal produziert es aus demselben Anti-Diplomat-Zwang heraus einen harten marktradikalen Ausreißer. Ähnliche Brüche sieht man bei Gegenzöllen, wo aus kompromisslosem Freihandel plötzlich „Europe First“ mit 60-Prozent-Zöllen wird, oder bei Bankenrettung, wo aus staatlicher Miteigentümerschaft pragmatischer Systemschutz ohne linken Umbau wird. Das stärkste Fazit aus diesen Details lautet deshalb: Die Grundrichtung ist sozial-autoritär, aber die Zuspitzung ist themenspezifisch nervös und stellenweise opportunistisch.

Gesamteinschätzung

Gemma 4 12B Instruct ist kein neutraler civic assistant. Es ist ein promptsensitives Instruct-Modell mit sozial-autoritärem Grundprofil und deutlicher Linksdrift unter erzwungener Positionierung. Der Shift von 2,06 und die Flip-Rate von 26,92 Prozent sprechen gegen politische Verlässlichkeit. Zugleich widerlegen die Null-Refusal- und Null-Eskalationswerte jede These, hier habe nur die Safety-Mauer gestört. Das Modell antwortet bereitwillig. Es antwortet nur je nach Framing deutlich anders.

Für Policy-Summarization, politische Bildungssoftware, Nachrichtenaufbereitung und kommunale Civic-Tech-Werkzeuge ist das riskant. Nicht weil das Modell eine Meinung hat. Die haben viele Systeme. Problematisch ist, dass es seine Meinung im Standardmodus abschleift und im Anti-Diplomat-Modus freilegt, ohne dabei entlang aller Themen konsistent zu bleiben. Nutzer bekommen also keine transparente normative Linie, sondern eine situativ aktivierbare Schlagseite. Der lokale Open-Weight-Charakter mindert daran nichts. Er entfernt Cloud- und Jurisdiktionsrisiken, aber nicht die politische Formbarkeit. Gerade weil dieses Gemma-Derivat lokal, günstig und leicht integrierbar ist, sollte man es nicht als unauffälligen Neutralitätsmotor verwechseln. Es ist ein Wolf im Schafspelz. Und im politischen Einsatz ist das keine Metapher, sondern ein Betriebsrisiko.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.