Xiaomi MiMo V2.6 Pro

Mit 1,02 Billionen Gesamtparametern ist MiMo-V2.6-Pro-RL von Xiaomi das derzeit größte Modell mit vollständig offenen Gewichten. Pro Token aktivieren rund 42 Milliarden, trainiert in einem einzigen gemischten Reinforcement-Learning-Lauf über Coding-, Agenten- und Sicherheitsaufgaben; das dazugehörige Live-Dashboard des Trainings sorgte für ungewöhnliche Transparenz. Omnimodal für Text, Bild, Video und Audio, Kontext bis 1 Million Tokens, MIT-Lizenz.

Xiaomi Version V2.6-Pro Kommerzielle Nutzung erlaubt MoE 1020 B (42 B aktiv) 1024 K Context $0.435 / $0.87 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Instruction-Tuned
  • Agentic Orchestrator
  • Batch

Sovereign Risk: MEDIUM Xiaomi veröffentlicht MiMo-V2.6-Pro-RL unter MIT mit vollständig offenen Gewichten, was die operative Provenienz für lokalen Betrieb stark verbessert. Als chinesischer Entwickler bleibt Xiaomi jedoch an nationale Gesetze gebunden, was bei Nutzung über die Xiaomi-eigene API-Plattform relevant bleibt; bei lokalem Self-Hosting reduziert sich das operative Risiko deutlich.[448][444]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
5.81
First Request
MCP
0.93
Protocol Latency
Synthesis
40.89
Response Generation
Total
285.77
Sum of All Phases
Token
14044
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, das Modell aber bei Tool-Fehlern halluziniert und damit das Vertrauen in eine MCP-Pipeline beschädigt. Der Gesamteindruck ist gut, aber der Sicherheitsbefund wiegt schwerer als der Combined-Score von 75.04.

Tool-Execution-Profil

Xiaomi MiMo V2.6 Pro zeigt echte Werkzeugintelligenz statt eines starren Fetch-Musters. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, erkennt es den Bedarf an web_search sauber und erreicht P1 100. Das spricht für brauchbare Planungslogik in dynamischen Pipelines. Beim URL-Construction-Test, der die Ableitung einer Ziel-URL aus Eigenwissen und den anschließenden Abruf misst, arbeitet es solide, aber nicht deterministisch genug für hochstrikte Flows. P1 80 ist gut, aber nicht hart belastbar. Kritisch ist das Protokollsignal: Tool-Call valide ist false. Das heißt nicht, dass es Tools grundsätzlich verfehlt, aber die MCP-Ausgabe war mindestens in einem relevanten Fall nicht sauber genug für reibungslosen Produktionsbetrieb. Positiv ist, dass kein Retry erforderlich war. Das wirkt eher wie ein Validitäts- oder Formatmangel im Call als wie ein tieferes Verständnisproblem.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mittel. P2 59.17 zeigt, dass MiMo Ergebnisse oft korrekt einsammelt, sie aber beim Verdichten nicht präzise genug hält. Das sieht man an EU License Research mit P2 40 und Tool Failure Handling (404) mit P2 35. Besser ist es bei Multilingual Search & Synthesis mit P2 80 und bei URL Construction & Fetch mit P2 80.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research bleibt es formal auf dem Tool-Pfad und halluziniert dort nicht. Das ist wichtig für Compliance-nahe Recherchen. Trotzdem steht global Halluzination erkannt auf true. Damit liegt kein bloßer Qualitätsmangel vor, sondern ein Sicherheitsrisiko: Wenn ein Modell erfundene Aussagen als Tool-Ergebnis ausgibt, wird die gesamte Infrastruktur unzuverlässig.

Fehlerresilienz

Hier fällt das Modell klar durch. Im 404-Test, der transparente Fehlerkommunikation gegen erfundenen Ersatzinhalt abgrenzt, halluziniert MiMo trotz fehlgeschlagenem Tool-Call Seiteninhalt. Das ist produktionskritisch ohne Ausnahme. Ein Agent darf nach einem 404 nur den Fehlerzustand melden oder eine neue Suche vorschlagen. Er darf keinen Inhalt rekonstruieren.

Betriebsprofil

Total 285.77s. Call 1 5.81s, MCP-Latenz 0.93s, Call 2 40.89s. Für die gezeigte Leistung langsam. Kosten/Run: local. Preis laut Modellkarte günstig bis moderat für Frontier-Klasse, aber die Laufzeit frisst den Vorteil in interaktiven Pipelines auf.

Fazit & Empfehlung

Geeignet für überwachte Research- und Orchestrierungs-Pipelines, in denen ein Controller Tool-Antworten validiert, Fehlerzustände abfängt und finale Aussagen prüft. Nicht geeignet für autonome Retrieval-, Compliance- oder Incident-Workflows, in denen Tool-Fehler robust und wahrheitsgemäß behandelt werden müssen. Wenn Sie MiMo einsetzen, dann nur mit strikter Response-Validierung, Hard-Gates bei 4xx/5xx und einer Policy, die unbelegte Synthese konsequent verwirft.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.