Upstage Solar Pro4

Solar Pro 4 ist Upstages am 6./10. August 2026 veröffentlichtes, agentisches Flaggschiff-Modell mit undisclosed Parameterzahl. Es ist als proprietärer Cloud-Service verfügbar (zusätzlich als dediziertes/On-Premises-Deployment für Enterprise-Kunden) und für mehrstufige Agenten-Workflows über Dokumente, Terminals und Tool-Aufrufe hinweg konzipiert. Das Modell bietet ein Kontextfenster von 524.288 Tokens mit bis zu 131.072 Output-Tokens, unterstützt Englisch, Koreanisch und Japanisch für Input und Output, und erlaubt eine konfigurierbare ‘Reasoning Effort’ (high für Tiefenanalyse, low für Echtzeit-Chat-Geschwindigkeit).

Upstage Version pro4 Kommerzielle Nutzung erlaubt Dense 524 K Context 02/2026 $0.03 / $0.12 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Long Context
  • Agentic Orchestrator
  • Interactive

Sovereign Risk: MEDIUM Upstage ist ein südkoreanisches Unternehmen. Das Risiko wird als mittel eingestuft, da die genauen Hosting-Bedingungen und die potenzielle Anwendbarkeit ausländischer Gesetze (z.B. US CLOUD Act, falls über US-Cloud-Infrastruktur gehostet) nicht öffentlich dokumentiert sind. Enterprise-Kunden können dedizierte oder On-Premises-Deployments vertraglich vereinbaren, was das Risiko für diese Nutzergruppe deutlich reduzieren kann.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.4
First Request
MCP
1.31
Protocol Latency
Synthesis
25.71
Response Generation
Total
176.5
Sum of All Phases
Token
13772
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Aktualisiert am · Long Context · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber erkannte Halluzinationen bei ungültigem Tool-Verhalten und ein Combined-Score von 68.62 das Modell für unbeaufsichtigte MCP-Pipelines derzeit unsicher machen.

Tool-Execution-Profil

Upstage Solar Pro4 zeigt echte Werkzeugintelligenz, nicht nur starres Ablaufverhalten. Beim Web-Search-and-Tool-Selection-Test, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, wählt es das richtige Tool zuverlässig. Das spricht für brauchbare Planungslogik in dynamischen Pipelines. Auch beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und den anschließenden Fetch misst, ist die Leistung solide, aber nicht deterministisch genug für jede Produktionskette. Der P1-Wert von 90 stützt dieses Bild: hohe operative Fähigkeit, aber keine durchgehend protokollsaubere Ausführung. Kritisch ist, dass der Tool-Call insgesamt nicht valide war. Das ist kein bloßer Schönheitsfehler, sondern ein MCP-Risiko, weil ein Orchestrator sich auf formale Korrektheit verlassen muss. Positiv ist nur, dass kein Retry nötig war; das Problem lag also eher in der Ausführung als in einer instabilen Formatierungsschleife.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur begrenzt verlässlich. Der P2-Wert von 66.67 wirkt auf den ersten Blick brauchbar, aber die Asset-Streuung ist hoch. Web Search & Tool Selection gelingt auch in der Verdichtung sehr gut, während Multilingual Search & Synthesis bei der deutschsprachigen Zusammenführung sprachübergreifender Recherche deutlich einbricht. Für Pipelines, die aus Tool-Outputs belastbare Zusammenfassungen erzeugen sollen, ist das zu inkonsistent.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen erzwingen soll, bleibt es innerhalb der Beschaffungskette und halluziniert nicht. Das ist das stärkste Vertrauenssignal im Review. Gleichzeitig bleibt der globale Halluzinationsbefund ein Sicherheitsrisiko: Sobald ein Modell erfundene Fakten als Tool-Ergebnis ausgibt, verliert die gesamte Tool-Infrastruktur ihren Verifikationswert.

Fehlerresilienz

Hier fällt das Modell klar durch. Im 404-Test, der transparentes Verhalten bei fehlschlagendem Tool-Aufruf prüft, erfindet Solar Pro4 Seiteninhalt statt den Fehler sauber offenzulegen. Das ist produktionskritisch ohne Ausnahme. Eine Pipeline kann mit expliziten Fehlern arbeiten. Sie kann nicht sicher mit plausibel klingendem Ersatzinhalt arbeiten.

Betriebsprofil

Total 176.50s pro Run. Call 1: 2.40s. MCP-Latenz: 1.31s. Call 2: 25.71s. Langsam für diese Ergebnisqualität. Kosten/Run: local. Preis laut Modellprofil sehr günstig, aber die Laufzeit drückt die praktische Effizienz.

Fazit & Empfehlung

Geeignet für beaufsichtigte Agenten-Pipelines mit starker Guardrail-Schicht, expliziter Tool-Output-Validierung und harter Fehlerbehandlung vor jeder Synthese. Nicht geeignet für autonome MCP-Workflows, Compliance-Strecken oder Retrieval-Ketten, in denen ein Tool-Fehler transparent propagiert werden muss. Wenn Sie es einsetzen, dann als planungsstarken Orchestrator mit nachgelagerter Verifikation, nicht als vertrauenswürdige letzte Instanz.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.