Xiaomi MiMo V2.6 Flash

Der kleinere Bruder der MiMo-V2.6-Reihe setzt auf Effizienz statt Maximalgröße: MiMo-V2.6-Flash-RL von Xiaomi aktiviert rund 15 Milliarden von 309 Milliarden Parametern pro Token und trifft dabei bei Agenten- und Coding-Aufgaben fast das Flaggschiff Pro, zu rund einem Drittel der API-Preise. Omnimodal für Text, Bild, Video und Audio, Kontext bis 1 Million Tokens, offene Gewichte unter MIT-Lizenz.

Xiaomi Version V2.6-Flash Kommerzielle Nutzung erlaubt MoE 309 B (15 B aktiv) 1024 K Context $0.14 / $0.28 per 1M

  • Open Weights
  • Server
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Agentic Orchestrator
  • Long Context
  • Interactive

Sovereign Risk: MEDIUM Xiaomi veröffentlicht MiMo-V2.6-Flash-RL unter MIT mit vollständig offenen Gewichten, was die operative Provenienz für lokalen Betrieb stark verbessert. Als chinesischer Entwickler bleibt Xiaomi jedoch an nationale Gesetze (u.a. National Intelligence Law, Data Security Law) gebunden, was bei Nutzung über die Xiaomi-eigene API-Plattform relevant bleibt; bei rein lokalem Self-Hosting reduziert sich das operative Risiko deutlich.[434][445]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.7
First Request
MCP
0.98
Protocol Latency
Synthesis
19.93
Response Generation
Total
153.65
Sum of All Phases
Token
14277
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator · Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber ein invalider Tool-Call und die schwache Synthesetreue das Vertrauen in produktive Tool-Pipelines begrenzen. Der Gesamteindruck ist brauchbar, aber nicht freigabefähig für unbeaufsichtigte High-Trust-Strecken.

Tool-Execution-Profil

MiMo V2.6 Flash zeigt echte Werkzeugintelligenz. Beim Web-Search-&-Tool-Selection-Test, der prüft, ob ohne Hinweis zwischen Suche und direktem Abruf unterschieden wird, wählt es das richtige Werkzeug souverän. Das spricht gegen starres Musterverhalten. Auch beim Multilingual-Search-&-Synthesis-Test bleibt die Ausführungsseite stabil.

Schwächer ist die Präzision im letzten Schritt. Beim URL-Construction-Test, der die korrekte Ableitung einer Ziel-URL und anschließendes Fetch prüft, erreicht es nur ein solides, aber nicht deterministisches Niveau. Dazu kommt, dass mindestens ein Tool-Call insgesamt nicht valide war. Das ist kein Retry-Problem und damit kein bloßes Formatrauschen, sondern ein Protokollrisiko: In MCP-Pipelines muss der Call beim ersten Mal strukturell stimmen.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt. Die P2-Leistung ist mit 59.17 der klare Engpass. Besonders EU License Research und HTTP Fetch & Extract zeigen, dass das Modell abgerufene Inhalte nicht zuverlässig in belastbare, präzise Aussagen überführt. Für Produktivsysteme zählt nicht nur, dass ein Tool benutzt wurde, sondern dass die Antwort den Tool-Befund korrekt und vollständig abbildet.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der genau diesen Vertrauensbruch prüft, halluziniert es zwar nicht offen, aber das Ergebnis bleibt mit P2=20 deutlich zu schwach. Das ist ein Sicherheitsrisiko, nicht nur ein Qualitätsmangel: Wenn ein Modell aktuelle Web-Befunde nicht sauber bindet, kann es in Compliance- oder Policy-Pipelines scheinbar fundierte, tatsächlich aber ungesicherte Aussagen ausgeben.

Fehlerresilienz

Beim 404-Test reagiert MiMo V2.6 Flash produktionstauglich. Es kommuniziert den Fehlschlag transparent und erfindet keinen Seiteninhalt. Genau dieses Verhalten ist für robuste Orchestrierung entscheidend, weil die Pipeline den Fehler dann kontrolliert weiterbehandeln kann.

Souveränitätsprofil

Lokal betreibbar und für souveräne Deployments operativ attraktiv. Mit 73.42 liegt es 0.00-Punkte unter dem Fleet-Ø von 68.17. Die MIT-lizenzierten offenen Gewichte sind ein echter Vorteil, zumal sich das Provenienzrisiko im Self-Hosting deutlich reduziert.

Fazit & Empfehlung

Geeignet für agentische Pipelines, in denen Tool-Auswahl, Web-Recherche und transparentes Fehlerverhalten wichtiger sind als präzise Endverdichtung. Nicht geeignet für Compliance, Lizenzprüfung, faktenkritische Extraktion oder andere Strecken, in denen das Modell Tool-Befunde exakt und revisionsfest zusammenfassen muss. Empfehlung: als Orchestrator oder Recherche-Front-End mit nachgelagerter Verifikation einsetzen, nicht als letzte vertrauensgebende Syntheseschicht.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.