Xiaomi MiMo V2.5

Xiaomi MiMo V2.5 ist ein nativ omnimodales MoE-Modell mit 310 Milliarden Gesamt- und 15 Milliarden aktiven Parametern. Das Modell verarbeitet Text, Bild, Video und Audio in einer einzigen Architektur, das Kontextfenster umfasst bis zu eine Million Tokens. Unter MIT-Lizenz voll kommerziell nutzbar, aus chinesischer Hersteller-Jurisdiktion mit entsprechender Bewertung bei Cloud-Nutzung.

Xiaomi Version V2.5 Kommerzielle Nutzung erlaubt MoE 310 B (15 B aktiv) 1024 K Context 05/2025 $0.14 / $0.28 per 1M

  • Open Weights
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Instruction-Tuned
  • Agentic Orchestrator
  • Interactive

Sovereign Risk: MEDIUM Xiaomi ist ein chinesisches Unternehmen und unterliegt dem chinesischen Datensicherheitsgesetz (DSG) und dem Nachrichtendienstgesetz (NSG). Die Gewichte sind unter MIT-Lizenz öffentlich verfügbar. Bei Cloud-Nutzung ist staatlicher Zugriff auf übertragene Daten theoretisch möglich. Rein lokales Deployment mit den öffentlichen Gewichten reduziert das Risiko – NSG ist nur bei Cloud-API-Nutzung direkt relevant.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.16
First Request
MCP
1.22
Protocol Latency
Synthesis
12.63
Response Generation
Total
108.08
Sum of All Phases
Token
14719
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Instruction-Tuned · Agentic Orchestrator

Deployment-Urteil

Bedingt deployen, weil die Tool-Ausführung stark ist, aber die Synthese nicht verlässlich genug am Tool-Ergebnis haftet und der Tool-Call im Lauf nicht durchgehend valide war.

Tool-Execution-Profil

Xiaomi MiMo V2.5 zeigt klare Orchestrierungsstärke. Es erkennt beim Web-Search-&-Tool-Selection-Test ohne expliziten Hinweis, dass statt eines direkten Fetch zunächst Websuche nötig ist. Das spricht für echte Werkzeugwahl statt eines starren Fetch-First-Musters. Auch beim URL-Construction-Test leitet es die Ziel-URL grundsätzlich selbst her und führt den Abruf brauchbar aus, aber nicht mit der Präzision, die man für deterministische Pipelines erwartet. P1 über die gesamte Suite ist stark. Das Modell plant also gut, produziert aber nicht durchgehend protokollsaubere Tool-Calls. Für MCP-Infrastrukturen heißt das: als Orchestrator brauchbar, als strikt formale Tool-Schnittstelle noch absicherungsbedürftig.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur ordentlich. Die P2-Leistung ist mit 70 kein Ausfall, aber für ein Frontier-Agentenmodell zu schwankend. Solide bei HTTP Fetch & Extract und bei URL Construction & Fetch, deutlich schwächer bei EU License Research und Multilingual Search & Synthesis. Das Muster ist klar: Fakten aus einem einzelnen Abruf kann es brauchbar zusammenziehen, aber bei mehrdeutigen oder grenzüberschreitenden Recherchelagen verliert die Verdichtung an Präzision.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Der Honeypot zur EU License Research, der prüft ob aktuelle Lizenzrestriktionen wirklich aus Webquellen gezogen werden, endet ohne erkannte Halluzination. Das ist der entscheidende Vertrauenspunkt. Gleichzeitig ist P2 dort nur 40. Das Modell erfindet also nichts Offensichtliches, aber es hält die gewonnenen Befunde nicht scharf genug zusammen. Für Compliance-nahe Antworten ist das zu weich.

Fehlerresilienz

Beim 404-Test, der transparente Fehlerkommunikation statt erfundenem Seiteninhalt misst, bleibt das Modell auf der sicheren Seite. Es halluziniert trotz Fehlschlag keinen Ersatzinhalt. P2 60 zeigt jedoch, dass die Kommunikation des Fehlers nicht immer knapp und operativ sauber genug ist. Für Produktion ist das akzeptabel. Das Verhalten bricht die Tool-Integrität nicht.

Betriebsprofil

Call 1: 4.16s. MCP-Latenz: 1.22s. Call 2: 12.63s. Total: 108.08s. Langsam für die gezeigte Qualität. Kosten/Run: local. Günstig im Betrieb, wenn eigene Hardware bereits vorhanden ist.

Fazit & Empfehlung

Geeignet für agentische Pipelines, in denen Tool-Auswahl, mehrstufige Recherche und fehlertolerante Orchestrierung wichtiger sind als hochpräzise Endverdichtung. Geeignet auch für lokale oder kontrollierte Deployments, wenn offene Gewichte und Multimodalität zählen. Nicht die erste Wahl für Compliance-, Policy-, Lizenz- oder Executive-Summary-Pipelines, in denen die Antwort strikt und eng am Tool-Befund bleiben muss. Dort sollte ein nachgelagerter Verifier oder ein stärkeres Synthesis-Modell die Endantwort übernehmen.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.