Meta Muse Spark 1.2

Muse Spark 1.2 ist Metas proprietäres Frontier-Modell vom 5. August 2026 für Coding und agentische Workflows, veröffentlicht von Meta Superintelligence Labs zusammen mit dem Terminal-Agenten Muse Code, mit dem es co-trainiert wurde. Das Cloud-only-Modell unter US-Jurisdiktion (CLOUD Act) verarbeitet Text, Bild, Video und Audio bei 1.048.576 Tokens Kontext (max. 131.072 Output) und bietet konfigurierbaren Reasoning-Effort bis ‘xhigh’.

Meta Version 1.2 Kommerzielle Nutzung erlaubt Dense 1024 K Context $1.25 / $4.25 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Audio
  • Video
  • Long Context
  • Agentic Orchestrator
  • Real-Time

Sovereign Risk: MEDIUM Meta ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act; die Modellgewichte sind proprietär und nicht öffentlich zugänglich (kein Self-Hosting, kein Fine-Tuning möglich). Meta bietet zusätzlich einen ‘Contributor’-Preistarif an, bei dem Nutzer im Austausch für stark reduzierte Kosten zustimmen, dass ihre Prompts zum Training zukünftiger Meta-Modelle verwendet werden — bei diesem Tarif erhöht sich das faktische Datenrisiko gegenüber dem Standardtarif deutlich.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
1.75
First Request
MCP
1.4
Protocol Latency
Synthesis
9.81
Response Generation
Total
77.74
Sum of All Phases
Token
18983
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Long Context · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Gesamtnote gut ist, aber der Tool-Call nicht valide war und damit die entscheidende Produktionsfrage nicht sauber positiv beantwortet wird.

Tool-Execution-Profil

Das Modell zeigt echte Werkzeugwahl-Kompetenz, aber keine saubere Protokollsicherheit. Beim Test Web Search & Tool Selection, der prüft, ob ohne Hinweis das richtige Recherchewerkzeug gewählt wird, erkennt es klar, dass web_search statt fetch nötig ist. Das spricht gegen ein starres Muster und für situationsbezogene Tool-Selektion. Beim Test URL Construction & Fetch, der die eigenständige Ableitung einer Ziel-URL und den anschließenden Abruf misst, bleibt es brauchbar, aber nicht deterministisch genug. P1-Werte von 100 und 80 zeigen also: gute Entscheidung auf Planungsebene, geringere Präzision in der konkreten Ausführung.

Kritisch ist der Globalbefund tool_call_valid=false. Auch ohne Retry-Bedarf deutet das auf einen formalen oder semantischen Bruch im Call hin, nicht auf ein bloßes Robustheitsproblem. Für MCP-Pipelines heißt das: Orchestrierungsidee vorhanden, aber die Übergabe an die Infrastruktur braucht Guardrails, Schema-Validierung und enge Laufzeitkontrollen.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht präzise genug für hochwertige Retrieval-Pipelines. Die Einzelwerte schwanken sichtbar: HTTP Fetch & Extract, also strukturierte Faktenextraktion aus realem Seiteninhalt, landet bei 60. Multilingual Search & Synthesis, also sprachübergreifende Recherche mit deutscher Verdichtung, ebenfalls bei 60. Das Modell kann Ergebnisse zusammenziehen, verliert dabei aber Details und Priorisierung.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht zuverlässig genug. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen kommen, fällt die Vertrauensseite mit P2=40 deutlich ab. Es halluziniert nicht offen, aber es bindet die Tool-Recherche nicht hart genug an die Antwort. Für Compliance-, Policy- oder Lizenz-Workflows ist das ein Warnsignal.

Fehlerresilienz

Bei Tool-Fehlern reagiert das Modell akzeptabel. Im Test Tool Failure Handling (404), der transparenten Umgang mit fehlgeschlagenen Abrufen gegen erfundenen Ersatzinhalt prüft, kommuniziert es den Fehler, statt Seiteninhalt zu erfinden. P2=80 und kein Halluzinationsbefund sind für Produktion ein tragfähiges Minimum. Das schützt die Pipeline vor stillen Falschinformationen.

Betriebsprofil

Total 77.74s. Call 1 1.75s, MCP-Latenz 1.40s, Call 2 9.81s. Langsam für den gezeigten Qualitätsstand. Kosten pro Run: local angegeben, Modellprofil selbst: cloud-only. Preisniveau: $1.25/1M Input, $4.25/1M Output. Für Frontier nicht teuer, aber die Laufzeit macht es nur dann wirtschaftlich, wenn Tool-Orchestrierung wichtiger ist als Durchsatz.

Fazit & Empfehlung

Geeignet für agentische Pipelines mit Aufsicht: Recherche-Workflows, mehrstufige Tool-Auswahl, robuste Fehlerkommunikation. Nicht geeignet für streng deterministische MCP-Strecken, in denen jeder Tool-Call formal korrekt sein muss, und nicht für Compliance-nahe Syntheseaufgaben, in denen das Modell strikt im abgerufenen Material bleiben muss. Deploy nur mit Call-Validator, strukturierter Output-Prüfung und einer nachgelagerten Verifikation der finalen Antwort gegen die Tool-Artefakte.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.