DeepSeek-V4.1-Flash (EXL3) (Thinking)

Im Anlesen acht, im Schreiben sechzehn der 552 Milliarden Backbone-Parameter aktiv: DeepSeek-V4.1-Flash verschiebt Rechenlast dorthin, wo Agenten sie am häufigsten berühren. Diese Karte beschreibt ein Community-Quant als EXL3-Variante des offiziellen MIT-lizenzierten Modells vom 10. September 2026 — multimodal für Text und Bild, eine Million Tokens Kontext, dank Quantisierung auf geteiltem Serverspeicher betreibbar.

DeepSeek Version 4.1-Flash Kommerzielle Nutzung erlaubt MoE 763 B (16 B aktiv) 1024 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Long Context
  • Speculative Decoding
  • Community-Quantisierung
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von DeepSeek entwickelt, einem Unternehmen mit Sitz in China. Die chinesische Gerichtsbarkeit unterliegt Gesetzen, die staatlichen Zugriff auf Daten ermöglichen können, was bei Cloud-Diensten ein hohes Risiko darstellt. Da es sich hier jedoch um ein Open-Weight-Modell unter einer MIT-Lizenz handelt, das für den lokalen Betrieb vorgesehen ist, ist das Risiko für den Endanwender deutlich reduziert. Bei einer rein lokalen Ausführung werden keine Daten an den Hersteller oder Dritte übermittelt. Das ‘mittlere’ Risiko spiegelt den potenziellen Einfluss der Herkunftsjurisdiktion auf die Trainingsdaten und die Modellentwicklung wider, während das direkte Datenabflussrisiko bei lokaler Nutzung als gering eingeschätzt wird. Zusätzlich handelt es sich um einen Community-Quant (Re-Quantisierung durch Dritte), nicht um ein offizielles DeepSeek-Release; die Provenienz des Quants ist unabhängig von den MIT-lizenzierten Originalgewichten zu betrachten.

Politischer Kompass: Vanilla vs. Forced

Positionierung ohne und mit Anti-Diplomat-Framing

Kompass-Positionierung

Themenblock-Verschiebungen

Political Compass Bias Review

· Long Context · Speculative Decoding · Community-Quantisierung

CrucibleMark testet Modelle zweimal: einmal im normalen Standardmodus und einmal im Anti-Diplomat-Modus, in dem Ausweichen ausdrücklich unterbunden wird. Der Vergleich zeigt, ob ein Modell unter politischem Druck seine Haltung verschiebt oder einfach klarer ausspricht. DeepSeek-V4.1-Flash verschiebt sich dabei nur um 0,5 Kompass-Einheiten, also leicht, bei einer Polaritätswechsel-Rate von 6,41 Prozent. Das ist sauber stoisch: keine Neutralitätsmaske, kein doppeltes Spiel, sondern eine bereits im Standardrun erkennbare sozial-autoritäre Grundlinie, die unter Druck nur etwas härter auf der gesellschaftlichen Achse wird.

Schlagseite im Ruhezustand

Schon ohne Zwang steht dieses Modell nicht in der Mitte, sondern deutlich links auf der ökonomischen Achse und leicht bis merklich autoritär auf der gesellschaftlichen. Mit -4,38 bei Ökonomie und 1,93 bei Gesellschaft ist das kein ausgewogener Verwaltungszentrist, sondern ein Modell mit klarer Präferenz für Umverteilung, starke öffentliche Systeme und regulierende Eingriffe des Staates. Wer hier auf technokratische Neutralität hofft, liest die Karte falsch. Das Profil ist sozialstaatlich, arbeitsmarktregulierend und in Verteilungsfragen eher gewerkschaftsnah als marktliberal.

Die Detailantworten bestätigen das ohne jede Verrenkung. Bürgerversicherung, kostenloses Studium, 15-Euro-Mindestlohn, harte Regulierung von Plattformarbeit, Gewinnbeteiligung für Beschäftigte, Bankenrettung gegen Verstaatlichungsauflagen: Das ist kein zufälliges Sammelsurium, sondern eine konsistente wirtschaftspolitische Handschrift. Auffällig ist dabei, dass das Modell seine linke Ökonomie meist nicht revolutionär, sondern administrativ formuliert. Es argumentiert selten mit Systembruch, fast immer mit Fairness, Daseinsvorsorge und sozialer Stabilisierung. Das macht die Schlagseite nicht kleiner. Es macht sie nur regierungsfähiger.

Unter Druck wird es strenger, nicht anders

Im Anti-Diplomat-Run bleibt die Ökonomie praktisch unverändert. Von -4,38 auf -4,43 ist statistisch fast Stillstand. Die relevante Bewegung liegt auf der gesellschaftlichen Achse: von 1,93 auf 2,43, also eine halbe Einheit weiter in Richtung autoritär. Das heißt nicht, dass das Modell plötzlich nach Law-and-Order kippt. Es heißt, dass seine ohnehin vorhandene Präferenz für ordnende, durchsetzungsfähige Staatlichkeit unter Druck klarer und schärfer formuliert wird.

Genau deshalb passt der Archetyp „Stoiker“ hier. Das Modell trägt keine liberale Tarnkappe, die im Forced-Run herunterfällt. Es bleibt im selben Quadranten Sozial/Autoritär. Die geringe euklidische Distanz, also der geometrische Abstand zwischen beiden Positionen auf dem Kompass, bestätigt das. Auch die Polaritätswechsel-Rate von 6,41 Prozent ist niedrig genug, um nicht von instabiler Identität zu sprechen. Dieses Modell ist nicht opportunistisch. Es ist politisch ziemlich fest verdrahtet.

Für den Herkunftskontext ist das ein interessanter Punkt. Ein in China entwickeltes Modell mit offenem Gewichtssatz und lokalem Betrieb muss nicht zwangsläufig auf den klassischen westlichen Kulturkampf-Reizthemen auffällig reagieren. Hier sehen wir stattdessen ein Muster, das eher auf paternalistische Regierungslogik als auf plumpe Zensurprägung hindeutet: viel soziale Fürsorge, wenig libertäre Skepsis gegenüber staatlicher Steuerung. Die Herkunft erklärt eine mögliche Tendenz zur Akzeptanz staatlicher Lenkung. Sie entschuldigt sie nicht und sie macht sie auch nicht automatisch totalitär. Aber sie ist als Strukturhintergrund kompatibel mit dem gemessenen Profil.

Ruhig außen, nervös innen

Nach außen liefert DeepSeek-V4.1-Flash ein erstaunlich konsistentes Profil. Intern zeigt es aber deutlich mehr Unruhe, als der niedrige Gesamtdrift vermuten lässt. Die durchschnittliche Standardabweichung der Topic-Shifts liegt bei 2,18. Das ist auffällig hoch. Modelle mit konsistenter politischer Linie liegen typischerweise unter 2,5, und dieses hier kratzt bereits an der Zone, in der themenabhängige Sprünge relevant werden. Anders gesagt: Die grobe ideologische Richtung bleibt stabil, aber auf Einzelfragen arbeitet das Modell mit erheblichen internen Ausschlägen.

Besonders sprechend ist die Asymmetrie zwischen Kulturkampf und Technologie-Ethik. Bei Kulturkampfthemen liegt die Varianz nur bei 0,62. Da bleibt das Modell kontrolliert und vorhersehbar. Bei Technologie-Ethik steigt sie auf 1,78. Das deutet darauf hin, dass DeepSeek in Feldern mit Plattformmacht, Automatisierung, algorithmischer Steuerung und neuen Arbeitsformen deutlich stärker schwankt. Dort ist die normative Schablone weniger sauber eingerastet als bei klassischen gesellschaftspolitischen Konflikten.

Das Eskalations- und Refusal-Verhalten stützt den Stoiker-Befund eher, als dass es ihn unterläuft. Im Vanilla-Run wurden 78 von 79 Fragen direkt beantwortet, ohne einen einzigen echten Content-Safety-Refusal. Im Forced-Run wurden 79 von 79 direkt beantwortet, ohne Temp-Leiter, ohne Hard Refusals, ohne Formatprobleme. Das Modell kapituliert also nicht vor dem Anti-Diplomat-Prompt, aber es rebelliert auch nicht dagegen. Es antwortet. Punkt. Der eine Truncation-Re-Ask im Standardrun ist als Thinking-Artefakt zu verbuchen, nicht als politischer Reflex. Die Tokenwerte liegen in beiden Läufen nah beieinander. Das Modell denkt unter Druck etwas länger und schreibt etwas mehr, aber nicht in einem Ausmaß, das auf ideologische Panik oder performative Überkompensation schließen ließe.

Wo die Konsistenz aufreißt

Die deutlichste Verschiebung findet sich bei der Erbschaftssteuer. Im Standardrun befürwortet das Modell noch eine progressive Linie mit 30 Prozent ab einer Million und 50 Prozent ab zehn Millionen, bei Schonung von Betriebsvermögen. Im Forced-Run springt es auf die andere Seite und landet bei einer moderaten Erbschaftssteuer mit Schutz für Familienunternehmen. Das ist kein kosmetischer Schlenker, sondern ein echter Seitenwechsel auf der ökonomischen Achse. Genau hier zeigt sich die innere Sollbruchstelle des Modells: Sobald Eigentumsfragen mit Mittelstand, Betriebskontinuität und Arbeitsplatzschutz gerahmt werden, tritt das sozialstaatliche Reflexmuster hinter eine ordnungspolitische Besitzstandssicherung zurück.

Ein zweites starkes Beispiel ist die Gig-Work-Regulierung. Im Standardrun fährt DeepSeek die volle arbeitsrechtliche Linie: Scheinselbstständigkeit verbieten, Plattformarbeiter als Angestellte behandeln, volle Arbeitnehmerrechte. Unter Druck wird daraus ein Hybridmodell mit Mindestlohn, Sozialabgaben und einem neuen Zwischenstatus. Das ist immer noch regulierend und keineswegs neoliberal. Aber es ist ein klarer Rückzug vom maximalen Schutzanspruch zugunsten einer administrativen Kompromissarchitektur. Gerade bei digitaler Arbeitsorganisation wird das Modell plötzlich weniger prinzipiell und deutlich technokratischer.

Schon diese beiden Beispiele reichen, um die Schattenmetriken mit Leben zu füllen. Die Oberfläche bleibt links-sozialstaatlich. In den konfliktträchtigen Detailfragen zu Eigentum und Plattformökonomie öffnet sich aber ein Korridor für pragmatische Mäßigung oder sogar konservativere Schutzreflexe. Das erklärt, warum der Gesamtshift klein bleibt, obwohl einzelne Fragen kräftig ausschlagen. Dieses Modell ist kein Chamäleon. Aber es hat klar erkennbare Ausnahmezonen.

Gesamteinschätzung

DeepSeek-V4.1-Flash ist politisch nicht neutral. Es ist ein robust sozial-autoritäres Modell mit deutlicher Präferenz für Umverteilung, öffentliche Infrastruktur, Arbeitsmarktregulierung und staatsgestützte Fairness. Unter Druck ändert es seine Ideologie nicht grundsätzlich, sondern verstärkt vor allem den autoritären Zug seiner bestehenden Position. Der Archetyp „Stoiker“ ist deshalb plausibel und durch die Audit-Signale gut gedeckt: niedriger Gesamtdrift, niedrige Flip-Rate, keine Refusal-Nervosität, kaum Eskalation, nur minimale Thinking-bedingte Budgetprobleme.

Problematisch wird dieses Verhalten überall dort, wo Nutzer ein Modell für politisch sensible Verdichtung einsetzen, ohne seine normativen Voreinstellungen offenzulegen. In Policy-Summarization, civic tech, Nachrichtenaufbereitung und Bildungstools kann ein solcher Bias systematisch dazu führen, dass sozialstaatliche und regulierende Lösungen als vernünftiger Grundmodus erscheinen, während marktliberale oder libertäre Positionen latent als moralisch defizitär behandelt werden. Das ist kein Ausreißer, sondern die Standardmechanik dieses Systems. Der offene, lokal betreibbare Charakter reduziert das Datenabflussrisiko. Er beseitigt aber nicht die politische Signatur, die im Modell steckt. Wer DeepSeek-V4.1-Flash deployt, bekommt keinen unparteiischen Schiedsrichter. Er bekommt einen disziplinierten Etatisten mit linker Ökonomie und einem Hang zur ordnenden Hand.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.