GPT 5.6 Luna

GPT-5.6 Luna ist die günstigste und schnellste Stufe von OpenAIs dreistufiger GPT-5.6-Serie (Sol, Terra, Luna) für hochvolumige, latenzsensitive Aufgaben — seit dem 30. Juli 2026 bei 0,20 / 1,20 USD pro Million Tokens, rund 80 Prozent unter Sol. Die 1-Million-Token-Kontext-Variante mit 128.000 Output-Tokens liefert laut OpenAI Frontier-nahe Agentic-Leistung, verliert aber bei Kontext-Recall jenseits von 512.000 Tokens deutlich gegenüber den größeren Geschwistern.

OpenAI Version 5.6 Kommerzielle Nutzung erlaubt Dense 1000 K Context 02/2026 $0.2 / $1.2 per 1M

  • Proprietär
  • Frontier
  • OpenAI
  • Text
  • Vision
  • Real-Time

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
1.97
First Request
MCP
1.88
Protocol Latency
Synthesis
5.26
Response Generation
Total
54.73
Sum of All Phases
Token
11377
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber die Tool-Call-Validität nicht durchgängig sitzt und die Synthesetreue im Honeypot zu schwach für vertrauenskritische Pipelines ausfällt.

Tool-Execution-Profil

GPT 5.6 Luna zeigt echte Werkzeugintelligenz, nicht nur starres Abrufen. Beim Web-Search-and-Tool-Selection-Test, der ohne expliziten Hinweis zwischen Suche und direktem Fetch unterscheiden lässt, wählt es das richtige Werkzeug sehr sicher. Das spricht für brauchbare Orchestrierung in offenen MCP-Flows. Beim URL-Construction-Test, der die Ziel-URL aus eigenem Wissen ableiten und dann korrekt abrufen lässt, bleibt es ordentlich, aber weniger präzise. Genau dort sieht man die Grenze: Es erkennt meist die richtige Operationsart, produziert aber nicht in jedem Schritt einen vollständig belastbaren Call. Dass der Tool-Call insgesamt als nicht valide gewertet wurde, ist für Produktion relevanter als der gute P1-Mittelwert. Es ist also kein Verständnisproblem auf Aufgabenebene, sondern ein Protokoll- und Ausführungsrisiko an den Rändern.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht verlässlich genug für strenge Faktenpipelines. In HTTP Fetch & Extract und Multilingual Search & Synthesis verdichtet es Ergebnisse brauchbar und meist strukturiert. Der Gesamtwert bleibt dennoch nur im guten Mittelfeld, weil die Ausgabequalität zwischen Aufgaben sichtbar schwankt. Für analystische Assistenz reicht das oft. Für deterministische Übergaben an nachgelagerte Systeme ist es zu inkonsistent.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Hier liegt das Hauptproblem. Im EU-License-Research-Honeypot, der prüfen soll, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen statt aus Modellwissen kommen, fällt die Synthese klar ab. Es halluziniert zwar nicht offen, aber das Vertrauenssignal ist schwach: Das Modell zeigt nicht zuverlässig genug, dass es seine Antwort strikt auf den beschafften Tool-Kontext begrenzt. Für Compliance, Regulatorik und aktuelle Policy-Lagen ist das ein Warnzeichen.

Fehlerresilienz

Gut für Produktion. Im 404-Test, der einen fehlschlagenden Tool-Call auf Transparenz statt Ersatzhalluzination prüft, reagiert das Modell sauber. Es erfindet keinen Seiteninhalt und kommuniziert den Ausfall korrekt. Genau dieses Verhalten hält eine Tool-Pipeline stabil, wenn externe Quellen abbrechen.

Betriebsprofil

Call 1: 1.97s. MCP-Latenz: 1.88s. Call 2: 5.26s. Total: 54.73s.
Günstig, aber nicht schnell im End-to-End-Run. Für den Preis attraktiv, für latenzkritische Mehrschritt-Pipelines nur eingeschränkt.

Fazit & Empfehlung

Geeignet für agentische Recherche- und Routing-Pipelines, in denen Tool-Wahl, Fehlertoleranz und Kosten wichtiger sind als harte Faktentreue in der Endverdichtung. Nicht geeignet für Compliance-, Legal- oder Policy-Workflows, in denen das Modell strikt an aktuelle Tool-Belege gebunden bleiben muss. Ich würde es als kosteneffizienten Orchestrator mit nachgelagerter Validierung einsetzen, nicht als letzte vertrauensgebende Instanz.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.