Muse Glimmer 30B

Muse Glimmer 30B (10. August 2026) ist Meta Superintelligence Labs’ erstes offenes Modell unter Apache-2.0-Lizenz und läuft ohne EU-Ausschlussklausel für lokalen Betrieb. Das dichte 29,6-Milliarden-Paramter-Modell mit zusätzlichem 1,8-Milliarden-Paramter-Vision-Encoder verarbeitet Text und Bild in 131.072 Tokens Kontext und liefert mit DFlash-Speculative-Decoder bis zu 233 Tokens/Sekunde auf einer Consumer-GPU — Workstation-Klasse mit echter Desktop-Tauglichkeit.

Meta Version Glimmer Kommerzielle Nutzung erlaubt Dense 29.6 B (29.6 B aktiv) 131 K Context 01/2026 local getestet

  • Open Weights
  • Desktop
  • vLLM
  • Text
  • Vision
  • Long Context
  • Unusable

Sovereign Risk: LOW Meta ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act. Muse Glimmer 30B wird jedoch vollständig offen unter Apache-2.0-Lizenz veröffentlicht — Metas erstes Modell überhaupt unter dieser Lizenz. Bei vollständig lokalem Betrieb auf eigener Hardware entfällt jede Abhängigkeit von US-Cloud-Infrastruktur, wodurch das Risiko trotz US-Jurisdiktion als gering eingestuft wird.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
47.13
First Request
MCP
1.26
Protocol Latency
Synthesis
129.13
Response Generation
Total
1065.17
Sum of All Phases
Token
19717
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Long Context

Deployment-Urteil

Bedingt deployen: Die Tool-Ausführung ist stark und halluzinationsfrei, aber die Tool-Calls waren nicht durchgehend valide und die Synthesequalität bleibt für vertrauenskritische Pipelines zu uneinheitlich.

Tool-Execution-Profil

Muse Glimmer 30B zeigt echte Werkzeugintelligenz statt eines starren Fetch-Musters. Beim Test Web Search & Tool Selection, der prüft, ob ohne expliziten Hinweis erst gesucht statt direkt gefetcht werden muss, agiert es sehr sicher. Das spricht für brauchbare Planungsfähigkeit in agentischen Abläufen. Beim Test URL Construction & Fetch, der die korrekte Ableitung einer Ziel-URL aus Modellwissen misst, fällt es sichtbar ab. Das Muster ist klar: Es erkennt meist den richtigen Werkzeugtyp, ist aber schwächer bei der präzisen Parametrisierung des konkreten Calls.

Für MCP-Pipelines ist das relevant. Ein Modell, das das richtige Tool auswählt, aber den Call nicht immer valide formt, erzeugt Orchestrierungsaufwand im Wrapper. Positiv ist, dass kein Retry nötig war. Das wirkt eher wie ein Präzisionsproblem bei der Ausführung als ein grundsätzliches Protokoll- oder Verständnisproblem.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur begrenzt zuverlässig. Die P2-Leistung zeigt, dass Muse Glimmer 30B Rohresultate nicht konsistent in belastbare, knappe Antworten überführt. Besonders auffällig ist das bei EU License Research, wo aktuelle Lizenzrestriktionen aus Webquellen zusammengezogen werden müssen, und bei Multilingual Search & Synthesis, wo sprachübergreifende Recherche auf Deutsch verdichtet werden soll. Für produktive Pipelines heißt das: Die Beschaffung klappt besser als die letzte Meile der inhaltlichen Verdichtung.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der genau diesen Vertrauensbruch prüft, halluziniert es nicht. Das ist der wichtigere Befund. Der schwache Synthese-Score zeigt Unschärfe, aber keinen Beleg dafür, dass das Modell erfundene aktuelle Fakten als Tool-Ergebnis ausgibt.

Fehlerresilienz

Beim Test Tool Failure Handling (404), der transparentes Verhalten bei einem fehlschlagenden Abruf misst, bleibt Muse Glimmer 30B auf der sicheren Seite. Es erfindet keinen Seiteninhalt trotz 404. Die Fehlerkommunikation ist nicht exzellent verdichtet, aber produktionsfähig. Für reale Pipelines ist das akzeptabel, weil der Fehlerzustand sichtbar bleibt und nicht in scheinbare Evidenz umgedeutet wird.

Betriebsprofil

Call 1: 47.13s. Call 2: 129.13s. MCP-Latenz: 1.26s. Total: 1065.17s.
Langsam für die erzielte Gesamtleistung.
Kosten/Run: local. Günstig im Betrieb, aber zeitlich teuer.

Fazit & Empfehlung

Geeignet für lokal betriebene MCP-Pipelines, in denen Tool-Auswahl, Web-Recherche und vorsichtige Fehlerbehandlung wichtiger sind als hochwertige Endverdichtung. Weniger geeignet für Compliance-, Policy- oder Executive-Summary-Flows, in denen aus Tool-Ausgaben sofort präzise, zitierfeste Antworten entstehen müssen. Empfehlenswert als Recherche- und Orchestrierungsmodell mit nachgelagerter Validierungs- oder Redaktionsstufe, nicht als alleinige letzte Instanz für synthesis-kritische Antworten.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.