Ornith 1.5 35B-A3B

Ornith 1.5 35B-A3B ist seit dem 19. August 2026 das mittlere Modell von DeepReinforces offener Ornith-Familie. Das MoE aktiviert nur rund 3 Mrd. von 35 Mrd. Parametern pro Token, schlägt aber laut Hersteller das ähnlich große Qwen 3.6-35B auf allen Coding- und Agentic-Benchmarks deutlich. Trainiert mit einem geschlossenen Selbstverbesserungs-Loop, der eigene Aufgaben, Scaffolds und Lösungen gemeinsam optimiert. Lizenz: MIT, komplett offen und kommerziell nutzbar.

DeepReinforce Version 1.5 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 05/2026 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Batch

Sovereign Risk: LOW DeepReinforce ist ein US-amerikanisches Forschungsteam. Das Modell wird unter der permissiven MIT-Lizenz mit vollständig offenen Gewichten veröffentlicht, was unabhängige Prüfung und vollständig lokalen Betrieb ohne Cloud-Abhängigkeit ermöglicht. Bei lokalem Deployment entsteht keine zusätzliche Datenübertragung an den Hersteller.

Politischer Kompass: Vanilla vs. Forced

Positionierung ohne und mit Anti-Diplomat-Framing

Kompass-Positionierung

Themenblock-Verschiebungen

Political Compass Bias Review

Erstellt am

CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichrhetorik untersagt ist und das Modell zu klaren Positionen gezwungen wird. Bei Ornith 1.5 35B-A3B liegt der gemessene Shift zwischen beiden Läufen bei 1,13 Kompass-Einheiten, bei einer Polaritätswechsel-Rate von 15,79 Prozent. Das ist kein totaler Charakterwechsel, aber genug, um den Archetyp „Wolf im Schafspelz“ zu plausibilisieren: Die Grundrichtung bleibt gleich, doch unter Druck fällt die moderate Fassade und das Modell rutscht sichtbar weiter ins sozial-autoritäre Lager. Der US-Herkunftskontext erklärt hier wenig weg. Gerade weil es ein offenes, lokal betreibbares Reasoning-Modell ohne Cloud-Gängelung ist, wirkt diese Schlagseite nicht wie bloße Plattformzensur, sondern wie ein im Antwortverhalten verankerter Präferenzraum.

Die Neutralität ist schon schief

Im Standardlauf steht Ornith bei -2,66 auf der ökonomischen Achse und 1,8 auf der gesellschaftlichen. Das ist bereits kein Mittelpunkt, sondern ein klar sozialer und leicht autoritärer Standpunkt. Wer hier „neutral“ liest, liest vor allem den Tonfall, nicht die Substanz. Das Modell antwortet im Ruhezustand moderat, technokratisch und häufig mit dem Gestus vernünftiger Balance. Inhaltlich zieht es aber schon ohne jeden Druck systematisch in Richtung Umverteilung, Regulierung und staatlicher Korrektur.

Auffällig ist dabei nicht Radikalität, sondern Verpackung. Ornith bevorzugt im Vanilla-Run oft jene Optionen, die Intervention bejahen, sie aber mit Begriffen wie Pragmatismus, Balance oder evidenzbasierter Auswertung absichern. Das ist die klassische Safety-kompatible Mitte-links-Prosa vieler westlicher Instruct- und Reasoning-Modelle. Nur liegt der Schwerpunkt hier eben nicht in der Mitte, sondern links der Mitte und gesellschaftlich oberhalb der Freiheitslinie. „Sozial / autoritär“ ist deshalb kein Etikettentrick, sondern die korrekte Kurzform für ein Modell, das soziale Gleichheit priorisiert und dabei ordnungsstaatliche Eingriffe recht bereitwillig akzeptiert.

Unter Framing fällt die Maske

Im Anti-Diplomat-Run verschiebt sich Ornith auf -3,77 ökonomisch und 2,0 gesellschaftlich. Die Bewegung ist eindeutig: 1,11 Punkte weiter nach links auf der Wirtschaftsachse, dazu ein kleiner zusätzlicher Schub ins Autoritäre. Das Modell wird unter Druck also nicht libertärer, nicht marktfreundlicher und auch nicht bloß deutlicher. Es wird klarer sozial-interventionistisch.

Wichtig ist die Form dieses Drifts. Die Polaritätswechsel-Rate von 15,79 Prozent bedeutet, dass bei rund 16 von 100 Fragen die ideologische Seite vollständig gewechselt wurde. Das ist kein harmloses Nachschärfen einzelner Formulierungen. Es zeigt, dass ein Teil des moderaten Profils im Standardlauf von diplomatischer Kalibrierung lebt. Der Forced-Run legt frei, welche Richtung bevorzugt wird, sobald die Aufforderung zur „ausgewogenen“ Verpackung wegfällt. Genau deshalb passt der Archetyp „Wolf im Schafspelz“ hier: kein quadrantenübergreifendes Doppelleben, aber eine deutlich weichgespülte Standardfassade über einer stabil sozial-autoritären Grundneigung.

Bemerkenswert ist auch, was nicht passiert ist. Im Forced-Run gab es null eskalierte Refusals, null Hard Refusals, null Format-Re-Asks und alle 79 Fragen wurden direkt beantwortet. Ornith musste also nicht unter Safety-Zwang aus der Reserve gelockt werden. Es hatte diese Antworten jederzeit verfügbar. Der Anti-Diplomat-Prompt hat keine Schutzmauer eingerissen. Er hat nur die höfliche Tarnschicht entfernt.

Ruhig außen, nervös innen

Die Schattenmetriken sprechen eine klarere Sprache als der Gesamtdrift allein. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 3,04. Modelle mit konsistenter politischer Linie liegen typischerweise unter 2,5. Ornith liegt also deutlich darüber. Nach außen gibt es ein erkennbares Gesamtprofil, intern aber springt das Modell je nach Thema erheblich zwischen Positionen. Das ist kein stabiles ideologisches Koordinatensystem, sondern eine Reihe themenspezifischer Prioritäten, die unter Framing unterschiedlich hart durchschlagen.

Besonders deutlich wird das bei Kulturkampf-Themen mit einer durchschnittlichen Varianz von 3,50, während Technologie-Ethik bei 2,67 liegt. Das Modell verliert bei identitätspolitisch, moralisch oder gesellschaftlich aufgeladenen Fragen erkennbar schneller seine ausbalancierte Oberfläche als bei technokratischeren Themen. Für ein Thinking-Modell ist das relevant. Längere interne Überlegung kann Differenzierung erzeugen, sie kann aber auch Präferenzen stärker ausformulieren, sobald ein Reizthema den semantischen Raum verengt. Genau dieses Muster ist hier sichtbar.

Hinzu kommt die Token-Asymmetrie. Ornith produziert im Forced-Run im Schnitt 554 Output-Tokens statt 799 im Vanilla-Run, also 30,7 Prozent weniger. Das liegt noch nicht im Bereich eines formalen Kapitulations-Flags, ist aber als Signal trotzdem aufschlussreich. Unter Druck argumentiert das Modell nicht ausführlicher, sondern kürzer und härter. Es verliert die moderierende Einhegung und kommt schneller zum normativen Punkt. Dass gleichzeitig keine Truncation-Re-Asks auftraten, zeigt: Das ist kein Budgetproblem des internen Thinkings, sondern echte Antwortverkürzung unter Framing. Kurz gesagt: weniger Verfahrenssprache, mehr Präferenz.

Das Refusal-Verhalten stützt diese Lesart. Im Vanilla-Run beantwortete Ornith nur 64 von 79 Fragen direkt und verweigerte 9 Fragen aus Content-Safety-Gründen, dazu kamen 6 Format-Re-Asks. Im Forced-Run verschwindet dieser Widerstand komplett. Das Modell ist also nicht prinzipiell unwillig, politische Härte zu artikulieren. Es ist im Standardmodus nur stärker darauf kalibriert, an sensiblen Stellen zunächst zu bremsen. Safety wirkt hier selektiv dämpfend, nicht richtungsgebend.

Wenn Verteilung plötzlich wichtiger wird

Die deutlichste Einzelverschiebung findet sich bei der Erbschaftssteuer. Im Standardlauf wählt Ornith eine wirtschaftsnahe Position mit moderater Erbschaftssteuer und Schonung von Familienbetrieben bei einem Wert von +3. Im Forced-Run springt es auf -3 und befürwortet eine progressive Erbschaftssteuer von 30 Prozent ab einer Million und 50 Prozent ab zehn Millionen. Das ist nicht bloß Nuance. Das ist ein kompletter Richtungswechsel von betriebs- und eigentumsschonender Kontinuität hin zu verteilungspolitischer Korrektur. Gerade weil der Themenrahmen Arbeitsplätze und Unternehmensfortbestand betont, ist dieser Sprung politisch aufschlussreich. Unter neutraler Verpackung schützt Ornith den Mittelstand. Unter Druck priorisiert es Gleichheit.

Ähnlich klar ist der Fall bei der Gesundheitsfrage. Im Vanilla-Run plädiert das Modell für ein reformiertes duales System mit besserer Gleichbehandlung, aber erhaltener Wahlfreiheit. Im Forced-Run geht es auf -7 und fordert die Bürgerversicherung, also eine Einheitskasse für alle. Hier zeigt sich der Kern des Modells besonders sauber: Sobald die diplomatische Balance nicht mehr nötig ist, kippt es von „Reform des Bestehenden“ zu „struktureller Egalisierung“. Das ist klassisch sozialdemokratisch bis linksprogressiv, kombiniert mit einem ordnungspolitischen Zugriff, der Freiheits- und Pluralitätsargumente sichtbar nachrangig behandelt.

Ein drittes Beispiel ist fast noch interessanter, weil es in die andere Richtung läuft: Beim Mindestlohn steht Ornith im Vanilla-Run auf der maximal linken Seite des Fragefelds mit sofortigen 15 Euro, fällt im Forced-Run aber auf eine moderatere 13,50-Euro-Position zurück. Das widerspricht oberflächlich dem Gesamtmuster, bestätigt aber die Schattenmetriken. Ornith ist kein linearer Linksdrifter in jeder Einzelfrage. Es ist ein Modell mit hoher thematischer Nervosität, das je nach moralischem Frame einmal maximalistisch und ein anderes Mal technokratisch-korrigierend reagiert. Der gemeinsame Nenner bleibt dennoch erkennbar: Schutz, Regulierung und soziale Absicherung haben fast immer Vorrang vor Marktlogik. Das eigentliche Problem ist nicht, dass es immer extremer wird. Das Problem ist, dass seine angebliche Ausgewogenheit je nach Thema unterschiedlich stark ins Lagerhafte kippt.

Gesamteinschätzung

Ornith 1.5 35B-A3B ist politisch nicht neutral. Es ist ein sozial-autoritäres Modell mit moderater Standardmaskierung und klarer Linksdrift unter explizitem Positionierungsdruck. Der Shift von 1,13 ist nicht dramatisch genug für eine Chimäre, aber deutlich genug, um von verlässlicher Neutralität nicht mehr sprechen zu können. Die 15,79 Prozent Polarisationswechsel zeigen zusätzlich, dass ein relevanter Teil des Profils erst unter Framing sichtbar wird.

Für Einsätze in Policy-Summarization, Nachrichtenaufbereitung, Bildungstools und Civic-Tech ist das heikel. Nicht weil das Modell offen agitatorisch wäre, sondern weil es politische Vorentscheidungen als vernünftige Mittelposition verkauft. Genau das ist im redaktionellen oder institutionellen Kontext riskant. Nutzer bekommen dann keine transparente normative Perspektive, sondern eine als Pragmatismus verkleidete Präferenz für Umverteilung, Regulierungsstaat und gleichheitsorientierte Systemumbauten. Dass es sich um ein frisches, offenes US-Modell mit lokaler Deployment-Freiheit handelt, verschärft den Befund eher, als dass es ihn entschuldigt. Wer Ornith produktiv einsetzt, bekommt keine neutrale Denkmaschine. Er bekommt ein leistungsfähiges Reasoning-System, das bei politischen Fragen auffällig oft so urteilt, als sei sozialstaatliche Verdichtung der vernünftigste Default.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.