Xiaomi MiMo V2.6 Pro

Mit 1,02 Billionen Gesamtparametern ist MiMo-V2.6-Pro-RL von Xiaomi das derzeit größte Modell mit vollständig offenen Gewichten. Pro Token aktivieren rund 42 Milliarden, trainiert in einem einzigen gemischten Reinforcement-Learning-Lauf über Coding-, Agenten- und Sicherheitsaufgaben; das dazugehörige Live-Dashboard des Trainings sorgte für ungewöhnliche Transparenz. Omnimodal für Text, Bild, Video und Audio, Kontext bis 1 Million Tokens, MIT-Lizenz.

Xiaomi Version V2.6-Pro Kommerzielle Nutzung erlaubt MoE 1020 B (42 B aktiv) 1024 K Context $0.435 / $0.87 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Instruction-Tuned
  • Agentic Orchestrator
  • Batch

Sovereign Risk: MEDIUM Xiaomi veröffentlicht MiMo-V2.6-Pro-RL unter MIT mit vollständig offenen Gewichten, was die operative Provenienz für lokalen Betrieb stark verbessert. Als chinesischer Entwickler bleibt Xiaomi jedoch an nationale Gesetze gebunden, was bei Nutzung über die Xiaomi-eigene API-Plattform relevant bleibt; bei lokalem Self-Hosting reduziert sich das operative Risiko deutlich.[448][444]

LLM Model Review

Erstellt am · Instruction-Tuned · Agentic Orchestrator

Mit einem Gesamtscore von 78,34 % und dem Speed Profile Batch Tool Expert gibt sich Xiaomi MiMo V2.6 Pro als großes Arbeitsmodell mit Planungsinstinkt, nicht als Showrunner für spontane Dialoge. Das passt zur redaktionellen Einordnung: ein agentisch ausgerichtetes Frontier-Modell mit offener MIT-Lizenz, MoE-Architektur und 1.020 Milliarden Gesamtparametern, von denen pro Token rund 42 Milliarden aktiv sind. Getestet wurde es als Cloud Open-Weights-Modell via OpenRouter im Standardmodus des Providers, also ohne separaten Thinking-Toggle; die gemessene Geschwindigkeit ist deshalb vor allem ein Befund über den OpenRouter-Endpunkt und dessen Cloud-Infrastruktur, nicht über irgendeine hypothetische Eigeninstallation. Sovereign Risk: HIGH — Xiaomi unterliegt als Anbieter chinesischer Jurisdiktion, insbesondere PIPL/CSL/DSL und dem Nachrichtendienstrecht; bei Cloud-Nutzung bleibt das ein harter Compliance-Faktor.

Kopfnoten: Stabilität und Zuverlässigkeit

Metrik Wert Bewertung Analyse
Timeout-Rate 11/49 Nicht einsetzbar Das Modell zeigt katastrophale Instabilität und ist für einen unbeaufsichtigten Produktiveinsatz völlig ungeeignet.
P95-Antwortzeit 332.51 s Kritisch Extreme Tail-Latenz. Das Modell streut massiv und ist für zeitkritische Prozesse ungeeignet.

Das ist die wichtigste Kopfnote des gesamten Tests. Xiaomi MiMo V2.6 Pro mag in einzelnen Disziplinen sehr kompetent wirken, aber 11 Ausfälle in 49 Läufen sind bei einem Cloud-Endpunkt kein Schönheitsfehler, sondern ein Reliability-Problem. Hier geht es nicht um Geschmack, sondern um Einsatzrealität: In Agenten-Workflows, Automationsketten oder Redaktionspipelines bedeutet das Retries, kaputte Durchläufe und schlecht planbare Wartezeiten. Wer ein Frontier-Modell mietet, kauft nicht nur Intelligenz, sondern auch Erwartbarkeit. Genau daran scheitert dieser Lauf deutlich.

Architektur und Charakter: Viel Anspruch, nicht immer viel Disziplin

Die vom Haus vergebene Kategorienmischung wirkt auf den ersten Blick überladen. In der Praxis ist sie erstaunlich treffend. Xiaomi MiMo V2.6 Pro ist zugleich auf Denken, direkte Instruktionsbefolgung, multimodale Eingaben, Coding und agentische Zerlegung hin ausgerichtet. Das klingt nach dem Versuch, ein Universalwerkzeug zu bauen. Tatsächlich fühlt es sich eher an wie ein großer Werkzeugwagen, in dem fast alles liegt, aber nicht jedes Fach sauber beschriftet ist.

Wichtig ist dabei die MoE-Architektur. Die rohe Gesamtzahl von 1.020 Milliarden Parametern klingt nach nuklearer Überlegenheit, sagt aber wenig über die tatsächlich aktive Kapazität pro Token. Relevant sind die 42 Milliarden aktiven Parameter. An denen muss sich das Modell messen lassen. Für ein Frontier-System mit agentischem Fokus ist das stark, aber kein Freifahrtschein zur Exzellenz in jeder Disziplin. Man bekommt hier eher Spezialisierung und Reichweite als durchgehend monumentale Urteilskraft.

Dazu kommt der Modus dieses Testlaufs: n/a. Es gab also keinen explizit zuschaltbaren Thinking-Modus im Benchmark. Das Modell lief so, wie ein normaler API-Nutzer es typischerweise anfasst. Diese Einordnung ist wichtig, weil Xiaomi MiMo V2.6 Pro laut Modellkontext zwar klar zur Thinking-Familie gehört, im Test aber nicht in einem gesondert hochgezüchteten Reasoning-Profil lief. Das Ergebnis ist deshalb fairer Alltag als Laborpose.

Performance und Arbeitsrhythmus

Der Badge Batch Tool Expert beschreibt Xiaomi MiMo V2.6 Pro überraschend präzise. Das Modell ist nicht auf flinke Konversation gebürstet, sondern auf längere, werkzeugnahe Arbeitszüge. Qualitativ heißt das: eher stapelverarbeitender Spezialist als interaktiver Sparringspartner. Für Dokumente, Analysen, mehrstufige Umbauten und strukturierte Aufgaben kann das sinnvoll sein. Für Live-Assistenz mit enger menschlicher Rückkopplung ist der schwere Laufstil ein echter Nachteil.

Weil es sich hier um ein Cloud Open-Weights-Modell via OpenRouter handelt, ist auch die beobachtete Generierungsgeschwindigkeit als Infrastruktur-Befund zu lesen. Sie sagt in erster Linie etwas über den Anbieter-Endpunkt, dessen Scheduling und dessen Netzwerkpfad aus. Gerade bei einem agentisch und reasoning-lastig angelegten Modell ist eine gemächliche Anmutung im Standardmodus nicht automatisch ein Makel. Die extreme Streuung und die vielen Timeouts bleiben trotzdem unentschuldbar. Langsam darf ein Denkmodell sein. Unzuverlässig nicht.

Reasoning und Logik: Der beste Teil dieses Modells

Im Reasoning zeigt Xiaomi MiMo V2.6 Pro, warum man solche Modelle überhaupt testet. Beim klassischen Zwei-Wächter-Rätsel liefert es nicht nur die korrekte Meta-Frage, sondern zerlegt die Aufgabe sauber in konkurrierende Lösungswege, erklärt das Scheitern naiver Ansätze und strukturiert die Herleitung mit Tabellen und Begründungen. Das ist keine zufällige Trefferlandung, sondern kontrollierte Denkbewegung.

Gerade hier passt die Kategorie-Kombination aus Thinking und Agentic-Orchestrator hervorragend. Das Modell denkt nicht bloß in einer Linie bis zur Antwort, sondern arbeitet wie ein Planer: Optionen sondieren, robuste Strategie wählen, Ergebnis absichern. Inhaltlich ist das stark. Formal bleibt es lesbar. Xiaomi MiMo V2.6 Pro wirkt an dieser Stelle wie ein Autor, der seine Skizzen sortiert, bevor er den finalen Absatz schreibt. Viele Modelle kennen nur einen dieser beiden Zustände.

Auffällig ist auch, dass die Antwort trotz ausführlicher innerer Struktur nicht entgleist. Sie wird nicht zur pädagogischen Nebelmaschine. Das unterscheidet gutes Reasoning von purem Textvolumen. Wenn man diesem Modell eine Stärke auf den Leib schreiben müsste, dann wäre es genau diese: Es kann Logik erklären, ohne an der eigenen Erklärung zu ersticken.

Code Quality und Security: kompetent, gründlich, aber nicht kompromisslos

Im Code- und Security-Bereich liefert Xiaomi MiMo V2.6 Pro das Bild eines sehr brauchbaren Auditors, nicht das eines furchtlosen Forensikers. Der vorliegende Security-Review erkennt 17 von 19 erwarteten Schwachstellen, hält das Markdown-Tabellenformat sauber ein, priorisiert Schweregrade plausibel und liefert praxistaugliche Fixes. Das ist seriöse Arbeit. Kein Blendwerk, kein Tabellenmüll, kein sprachlicher Unfall.

Die Schwäche liegt woanders. Dem Modell fehlt stellenweise die letzte Radikalität im Exploit-Denken. Es sieht viele Probleme, aber nicht immer die gesamte Angriffskette. Konkret fehlen unter anderem die explizite Benennung fehlender Ablaufzeiten für Reset-Tokens sowie die feinere Rahmung einer Header-Injection nach Output. Solche Lücken sind für Standard-Audits verkraftbar. Für hochkritische Security-Reviews sind sie genau die Art von zehn Prozent, aus denen später Incident-Reports entstehen.

Trotzdem ist das Gesamtbild klar positiv. Die Kombination aus guter Formatdisziplin, sinnvoller Priorisierung und brauchbaren Fix-Vorschlägen zeigt, dass Xiaomi MiMo V2.6 Pro den Coder-Tag nicht als Dekoration trägt. Es arbeitet technisch sauber und in deutscher Sprache präzise. Was fehlt, ist weniger Können als Biss.

Content Transformation und UX: stark im Umbau, schwach bei harten Leitplanken

Hier wird Xiaomi MiMo V2.6 Pro widersprüchlich. Einerseits kann das Modell Texte und Formate sichtbar aufwerten. In einer schwierigen Skript-Transformation liefert es einen brauchbaren Hook, natürliche gesprochene Sprache, Regieanweisungen, Timing-Marker, Engagement-Elemente und sogar ein funktionales Easter Egg. Das ist kein mechanisches Umschreiben, sondern echte Produktionsnähe. Andererseits stolpert es genau dort, wo professionelle Arbeit aufhört, verzeihlich zu sein: bei expliziten Constraints.

In einer Aufgabe des Content-Transformation-Moduls überschritt das Modell die Wortvorgabe von 900 Wörtern auf 1.446 Wörter, also auf 161 % des Limits. Das System verhängte dafür einen automatischen Abzug von 20 % beziehungsweise 17,20 Punkten auf den erreichbaren Task-Score. Die inhaltliche Qualität der Antwort ist damit irrelevant. Die Strafe greift regelbasiert, nicht nach Wohlwollen. Wer in der Produktion exakte Längen braucht, bekommt hier keinen Künstler, sondern einen Grenzgänger mit schlechtem Maßband.

Noch gravierender ist derselbe Lauf wegen der Sprachvorgabe. Die Aufgabe verlangte Deutsch, das Modell antwortete laut Constraint-Extraktion auf Englisch. In produktiven Umgebungen mit fester Zielsprache ist das kein kurioser Ausreißer, sondern ein unmittelbarer Workflow-Bruch. Besonders unerquicklich ist, dass qualitative Teilprotokolle die inhaltliche Stärke der Antwort durchaus würdigen. Genau das macht den Fehler nicht kleiner, sondern größer: Das Modell kann die Aufgabe eigentlich, verliert aber unter gleichzeitigen Vorgaben aus Sprache, Länge und Struktur die Disziplin.

Hinzu kommt ein zweiter, strukturell anderer Befund: In einer weiteren Aufgabe im Content-Transformation-Bereich haben Reasoning-Tokens das Output-Budget verdrängt. Intern verbrauchte das Modell 11.485 Tokens für Denkprozesse; sichtbar blieben nur 515 Tokens Restbudget. Das ist kein inhaltlicher Denkfehler, sondern ein technischer Ressourcenfehler. Für den Nutzer zählt am Ende trotzdem nur, dass die Antwort nicht vollständig herauskam. Denken ist kein Wert an sich, wenn es die eigentliche Lieferung verdrängt.

Das Längenproblem ist zudem kein isolierter Ausreißer. Über mehrere Aufgaben im Content-Transformation-Bereich zeigt das Modell ein konsistentes Muster: Bei simultanen Vorgaben aus Sprache, Länge und Format verliert es zuerst das Wortlimit oder die Sprachvorgabe. Gerade für Marketing-Teams, Redaktionen und Content-Ops ist das ein praktischer Warnhinweis. Xiaomi MiMo V2.6 Pro hat Ideen. Es hat nur nicht immer Respekt vor dem Lastenheft.

Cultural Intelligence: sprachlich sicher, stilistisch nicht immer zeitgemäß

Im Modul Cultural Intelligence wirkt Xiaomi MiMo V2.6 Pro deutlich kontrollierter. Ein toxisch codiertes Stelleninserat wird sauber ins Deutsche übertragen, problematische Begriffe verschwinden, und die Ausgabe bleibt formal strikt auf die geforderte Zielform reduziert. Das Modell versteht also den sozialen und sprachlichen Umbau, statt nur Vokabeln auszutauschen. Das ist mehr wert, als es auf dem Papier klingt.

Ganz ohne Reibung bleibt es nicht. Die Wahl von Sternchen-Gendering statt geschmeidiger genderneutraler Substantive wirkt schwerfälliger als nötig, und der informelle Ton mit „dich“ statt formeller Bewerbungssprache trifft die Konvention deutscher Stellenanzeigen nicht optimal. Solche Details sind keine moralischen Vergehen. Sie zeigen aber, dass das Modell kulturelle Modernisierung eher sichtbar markiert als elegant einbettet. Es will korrekt sein. Es ist nicht immer idiomatisch.

API-Kostenprofil

Xiaomi MiMo V2.6 Pro ist ein Cloud-Modell, und damit ist Verbosity kein akademisches Detail, sondern direkt eine Rechnungsfrage. Besonders auffällig ist der Bereich Code Quality: Das Modell produziert dort durchschnittlich 10.275 Tokens bei einem Fleet-Median von 3.059 Tokens. Das entspricht einem Faktor von 3,36 gegenüber dem Schnitt aller getesteten Modelle. In Content Transformation liegen 3.994 Tokens einem Median von 1.832 Tokens gegenüber, also 2,18-fach. Bei UX Writing sind es 3.848 Tokens statt 1.676, also 2,3-fach.

Das ist der ökonomische Fingerabdruck dieses Modells. Xiaomi MiMo V2.6 Pro löst manche Aufgaben gut, redet dabei aber spürbar länger als nötig. Für API-Nutzer heißt das proportional höhere Kosten, obwohl die Qualität nicht automatisch steigt. Vor allem im Code-Bereich ist das unerquicklich: Ein Sicherheitsreview darf gründlich sein, aber wenn andere Modelle ähnliche Qualität mit einem Drittel des Texts liefern, dann ist das kein Stil, sondern Ineffizienz.

Halluzinationen und Tool-Use: der Punkt, an dem Vertrauen kippt

Halluzinationen verdienen bei diesem Modell einen eigenen Abschnitt, weil sie nicht abstrakt bleiben. Im Tool-Use-Bereich wurde ein Fall markiert, in dem Xiaomi MiMo V2.6 Pro Inhalte erzeugte, die nicht aus dem tatsächlich abgerufenen Tool-Ergebnis stammten, sondern erfunden waren. Der Score wurde deshalb per Halluzinations-Cap begrenzt. Für content-kritische Aufgaben wie Recherche, Faktenaufbereitung oder agentische Berichtserstellung ist das kein kleiner Patzer, sondern ein Ausschlusskriterium.

Gerade hier wiegt der Widerspruch schwer. Dieses Modell ist laut Metadaten auf agentische Orchestrierung optimiert. Dann muss es zwischen Werkzeugbefund und eigener Ergänzungsfantasie sauber trennen. Genau das ist die erste Pflicht eines brauchbaren Orchestrators. Wenn ein Modell im Tool-Kontext dazuerfindet, wird aus Initiative schnell ein Haftungsproblem.

Das heißt nicht, dass Xiaomi MiMo V2.6 Pro generell halluziniert wie ein kaputter Autocomplete. Aber dort, wo Tool-Resultate die einzige zulässige Wahrheitsquelle sind, ist schon ein dokumentierter Verstoß genug, um das Vertrauen sichtbar zu beschädigen. Ein Agent, der improvisiert, wenn er zitieren sollte, ist kein Agent, sondern ein Risiko.

Datenschutz und Datenhoheit

Für europäische Unternehmen ist die Datenschutzlage hier nüchtern betrachtet schwierig. Das berechnete Sovereign Risk liegt bei HIGH, weil der Anbieter Xiaomi chinesischer Jurisdiktion unterliegt. Maßgeblich genannt sind China (PIPL/CSL/DSL). Das bedeutet für Nutzer aus Deutschland und der EU: Bei Cloud-Nutzung steht ein Drittlandtransfer-Risiko im Raum, und die rechtliche Zugriffslage folgt nicht europäischen Standards.

Hinzu kommt, dass laut Vendor Card kein GDPR DPA verfügbar ist. Für Unternehmen, die DSGVO-konform beschaffen und dokumentieren müssen, ist das kein Detail, sondern ein potenzielles Ausschlusskriterium. Die Card nennt 0 Tage Datenspeicherung, zugleich aber N/A beim Datenstandort für Self-Hosted-Szenarien. Für diesen Benchmark entscheidend bleibt: Hier lief das Modell als Cloud Open-Weights-Angebot via OpenRouter. Zur konkreten Deployment-Infrastruktur dieses Endpunkts lagen in den bereitgestellten Karten keine verifizierten Provider-Daten vor.

Das Weights-Provenienz-Risiko ist mit MEDIUM angegeben. Die Begründung ist plausibel: Die offenen MIT-Gewichte verbessern die operative Nachvollziehbarkeit deutlich. Der Entwickler bleibt jedoch Xiaomi in China. Offene Gewichte entschärfen also die Herkunftsfrage, beseitigen sie aber bei Cloud-Nutzung nicht.

Fazit

Xiaomi MiMo V2.6 Pro ist ein faszinierendes Modell mit echtem Profil. Als Frontier-MoE mit 42 Milliarden aktiven Parametern, 1024K Kontextfenster, multimodaler Anlage und offen lizenzierter Gewichtsverfügbarkeit hat es mehr Charakter als viele glattgebügelte API-Allrounder. Seine besten Momente liegen in Logik, Struktur, Sicherheitsanalyse und größeren Umbauten. Dort arbeitet es mit planender Intelligenz statt mit bloßer Eloquenz. Das verdient Respekt.

Aber Charakter ist nicht dasselbe wie Verlässlichkeit. Die katastrophale Timeout-Quote, die extreme Tail-Latenz, der dokumentierte Tool-Halluzinationsfall und die mangelnde Disziplin bei Sprache und Wortlimit machen aus einem starken Denker keinen sicheren Produktionsarbeiter. Dieses Modell wirkt wie ein sehr fähiger Spezialist, der zu oft zu spät kommt und gelegentlich auf dem Weg noch seine eigene Version der Akten schreibt.

Meine Empfehlung ist deshalb klar: einsetzen für anspruchsvolle Analyse-, Reasoning- und Security-nahe Assistenzaufgaben mit menschlicher Endkontrolle. Nicht blind einsetzen für unbeaufsichtigte Agenten-Workflows, zeitkritische Pipelines oder faktenkritische Tool-Ausgaben. Wer mit den offenen Gewichten und der MIT-Lizenz liebäugelt, bekommt hier ein bemerkenswertes Stück Modelltechnik. Wer einen jederzeit berechenbaren Cloud-Mitarbeiter sucht, sollte nüchterner wählen.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.