LLM Model Review
Aktualisiert am · Long Context · Agentic Orchestrator
Mit einem Gesamtscore von 75.42% zeigt Upstage Solar Pro4 ziemlich genau den Charakter, den seine Metadaten versprechen: ein agentisch gedachtes Frontier-Modell, dense aufgebaut, mit langem Atem und klarer Tool-Ausrichtung, aber ohne den makellosen Durchzug, den man in dieser Klasse erwarten darf. Der Lauf erfolgte im werksseitigen Standardverhalten des Endpunkts; ein umschaltbarer Thinking-Modus existiert hier im Test nicht, obwohl das Modell grundsätzlich einen konfigurierbaren Reasoning-Effort kennt. Dazu kommt der Badge Interactive Tool Expert: Solar Pro4 ist also nicht als Textkanone für Batch-Jobs gedacht, sondern als interaktiver Arbeitsmotor für Tool- und Agenten-Workflows. Sovereign Risk: MEDIUM — Upstage sitzt in Südkorea, doch Datenstandort, Rechtsrahmen und mögliche Abhängigkeiten von ausländischer Cloud-Infrastruktur sind öffentlich nicht sauber verifiziert.
Kopfnoten: Stabilität und Zuverlässigkeit
| Metrik | Wert | Bewertung | Analyse |
|---|---|---|---|
| Timeout-Rate | 2/49 | Sporadisch | Das Modell zeigt sporadische Aussetzer, die in der Praxis Retrys erfordern würden. Bei einem Cloud Open-Weights-Endpunkt via OpenRouter ist das kein abstrakter Messwert, sondern ein konkretes Reliability-Risiko durch API-Instabilität, Endpunktlast oder Netzwerkstreuung. |
| P95-Antwortzeit | 95.33 s | Problematisch | Signifikante Ausreißer, die den Arbeitsfluss unterbrechen. Für ein interaktives Modell ist das eine unschöne Kopfnote, auch wenn ein Agentic-Orchestrator intern mehr Planung betreiben kann als die sichtbare Antwortmenge vermuten lässt. |
Architektur und Positionierung
Upstage Solar Pro4 ist als Agentic / Orchestration-Modell eingeordnet. Das ist wichtig, weil es den Maßstab verschiebt. Ein solches Modell soll nicht jeden Teilschritt wie ein pedantischer Fachidiot selbst ausbuchstabieren, sondern Aufgaben strukturieren, Werkzeuge einsetzen und mehrstufige Abläufe zusammenhalten. Genau deshalb sollte man leichte Schwächen bei streng schematischen Direktformaten milder lesen als bei einem reinen Instruct-Modell. Umgekehrt gelten bei Planung, Werkzeugnutzung und strategischer Analyse höhere Erwartungen. Wer sich als Orchestrator verkauft, muss im Verkehr der Subsysteme souverän wirken.
Dazu passt die zweite Säule der Einordnung: Frontier. Hier gibt es keinen Welpenschutz. Modelle dieser Klasse müssen mit den besten Cloud-Systemen mithalten, nicht nur im Einzelfall glänzen. Und drittens ist Solar Pro4 dense. Es gibt also keine Ausrede über geringe aktive Parameter wie bei MoE-Systemen. Was da ist, arbeitet immer mit. Entsprechend streng fällt das Urteil aus: 75.42% sind ordentlich, aber nicht majestätisch. Für ein Flaggschiff ist das eher ein belastbarer Auftritt als ein Machtbeweis.
Der Kontext von 524.288 Tokens und der Trainings-Cutoff 2026-02 verleihen dem Modell auf dem Papier Reichweite und Frische. Gerade für dokumentenlastige Agenten-Workflows ist das relevant. Im Benchmark sieht man davon vor allem eine Haltung: Solar Pro4 antwortet selten hektisch, meist strukturiert, oft brauchbar. Aber große Fenster und moderne Daten ersetzen keine letzte Präzision. Das Modell ist eher ein guter Einsatzleiter als der brillanteste Spezialist im Raum.
Performance-Profil: interaktiv, aber nicht nervös
Der Speed-Profile-Badge Interactive Tool Expert beschreibt Solar Pro4 treffend. Dieses Modell will im Dialog arbeiten, auf Werkzeuge reagieren, Zwischenschritte koordinieren. Es ist kein Sprintmodell mit dem Temperament einer Suchmaschine, sondern eher ein Werkzeugführer mit Funkgerät. Die Geschwindigkeit ist qualitativ moderat. Gerade für einen Agentic-Orchestrator ist das nicht automatisch ein Makel, denn solche Modelle investieren oft mehr interne Planung in Antworten, als die sichtbare Textmenge nahelegt.
Wichtig für die Einordnung: Solar Pro4 lief hier als Cloud Open-Weights-Modell via OpenRouter. Die gemessene Ausgabe-Geschwindigkeit ist daher immer auch ein Infrastrukturwert des Anbieters samt Netzpfad, Queue-Verhalten und Endpunkt-Implementierung. Sie ist kein reines Charaktermerkmal der Gewichte. Gerade bei OpenRouter muss man Geschwindigkeit deshalb als Produkt aus Modell und Cloud-Bereitstellung lesen. Wer nur auf rohe Reaktionsfreude schaut, liest die halbe Wahrheit.
Positiv ist die Token-Ökonomie. Kein Modul überschreitet den erwartbaren Verbosity-Rahmen. Im Gegenteil: Solar Pro4 verhält sich insgesamt token-ökonomisch, bleibt im Schnitt nah am Fleet-Median oder darunter und verschwendet seine Antwortlänge nicht in geschwätzigen Leerlauf. Das ist bei einem kommerziell angebotenen Cloud-Endpunkt mehr als Kosmetik. Es bedeutet kalkulierbarere Kosten.
Reasoning und Logik: gründlich, aber nicht immer elegant
Im Logikbereich liefert Solar Pro4 74.85%. Das ist kein Spitzensturm, aber ein belastbares Niveau. Das qualitative Protokoll zum klassischen Zwei-Wächter-Rätsel zeigt die Kernstärke sehr sauber: Das Modell löst die Aufgabe korrekt, erklärt den doppelten Umweg logisch nachvollziehbar und arbeitet sogar Varianten der Fragestellung durch. Die Antwort war vollständig auf Deutsch, formal sauber und inhaltlich richtig. Das Urteil des Judges ist plausibel: in der Sache stark, in der Präsentation etwas zu prose-lastig.
Genau hier zeigt sich der Charakter des Modells. Solar Pro4 denkt sichtbar gründlich, aber nicht immer mit der klarsten Schneide. Es baut nummerierte Erklärblöcke, testet Alternativen und sichert seine Logik ab. Das ist für reale Arbeit oft nützlicher als ein blendend aufgeräumtes Schaubild. Gleichzeitig fehlt manchmal jene editorische Disziplin, die aus einer korrekten Lösung eine sofort überprüfbare macht. Anders gesagt: Solar Pro4 hat den Stoff verstanden, aber nicht immer die beste Tafelanschrift gewählt.
Man muss hier fair bleiben. Als konfigurierbares Reasoning-Modell ohne Thinking-Toggle im konkreten Endpunktlauf war Solar Pro4 im Standardverhalten unterwegs. Dass es trotzdem vergleichsweise tiefe Reasoning-Passagen liefert, spricht eher für die Architektur als gegen sie. Für Nutzer heißt das: gute analytische Substanz, aber nicht zwingend die knappste Präsentation. In einem Agenten-Setup ist das akzeptabel. In Mensch-zu-Mensch-Interaktion kann es bisweilen zäher wirken als nötig.
Tool-Use und agentische Tauglichkeit: stark im Zugriff, wacklig bei Faktentreue
Der Tool-Execution-Wert von 90.0 ist auf den ersten Blick genau das, was man von einem agentischen Flaggschiff sehen will. Solar Pro4 kann mit Werkzeugen offenbar umgehen, und zwar nicht nur formal, sondern mit einer gewissen operativen Sicherheit. Das passt zur Produktpositionierung und zur Architektur-Einstufung. Wer Dokumente, Terminal-Schritte und Tool-Aufrufe in einen Ablauf gießen will, bekommt hier keinen orientierungslosen Chatbot, sondern ein Modell, das den Werkzeugkasten kennt.
Dann kommt der Haken. Im Tool-Use-Bereich liegt der Gesamtwert bei 70.54%, und dort steht auch der schwerste qualitative Makel dieses Laufs. In einer Aufgabe im Tool-Use-Bereich halluzinierte das Modell Inhalte, die nicht aus dem abgerufenen Tool-Ergebnis stammten. Der Score wurde durch ein Halluzinations-Cap begrenzt. Das ist kein kleiner Schönheitsfehler und auch kein bloßes Formatproblem. Für content-kritische Recherche- oder Reporting-Aufgaben ist so etwas ein disqualifizierendes Signal.
Gerade bei einem Agentic-Orchestrator trifft dieser Befund empfindlich. Denn die Grundidee solcher Modelle lautet: plane, rufe Werkzeuge auf, halte dich an deren Resultate. Wenn dann im entscheidenden Moment Material dazuerfunden wird, kippt der Nutzen vom Navigator zum fabulierten Lagebericht. Anders gesagt: Das Modell greift zum richtigen Instrument, aber notiert mitunter Töne, die nie gespielt wurden. Für Terminal- oder Prozesssteuerung mag das noch beherrschbar sein. Für faktenkritische Synthese ist es brandgefährlich.
Code Quality und Security: gute Trefferquote, mäßige Risikokommunikation
Mit 74.36% in Code Quality ist Solar Pro4 im technischen Kern solide. Das qualitative Security-Protokoll zeigt ein Modell, das Schwachstellen in einem PHP-artigen Beispielcode zuverlässig identifiziert, sauber in Markdown tabelliert und technisch vernünftige Fixes nennt. SQL Injection, Klartextpasswörter, XSS, IDOR, Session-Probleme, Header Injection und weitere implizite Lücken werden erkannt. Das ist handwerklich gut und für ein General-DevSecOps-Szenario brauchbar.
Die Schwäche liegt nicht im Erkennen, sondern im Verdichten. Das Judge-Protokoll beschreibt es treffend: taktisch kompetent, strategisch schwächer. Solar Pro4 listet viele Einzelprobleme, kommuniziert aber die Angriffsketten und die Gesamtrisikolage nicht scharf genug. Für Entwickler, die nur wissen wollen, wo es brennt und welches Pflaster draufmuss, reicht das. Für Stakeholder, die priorisieren und Freigaben verantworten, fehlt der rote Faden. Security ist nicht nur Bug-Zählen, sondern Risikokommunikation. Genau dort verliert das Modell Schärfe.
Immerhin bleibt die Ausgabe formal sauber. Die verlangte Tabelle wurde korrekt geliefert, die Kürze in den Zellen eingehalten, die Sprache stimmt. Das ist nicht trivial. Viele Modelle zerreden sich gerade in Security-Tasks. Solar Pro4 tut das nicht. Es ist eher der Auditor, der sauber annotiert, aber die Vorstandsvorlage nicht fertig schreibt.
CLI und operative Technik: sehr überzeugend
Der CLI-Benchmark ist mit 89.9% einer der stärksten Bereiche des Modells. Das passt ausgezeichnet zur Einordnung als Tool- und Agentenmodell. Solar Pro4 scheint in operativen, terminalnahen Aufgaben deutlich wohler zu sein als in rhetorischer Feinarbeit. Dort zählt weniger literarische Eleganz als strukturelle Korrektheit, Sequenzdenken und die Fähigkeit, Arbeitsabläufe praktisch herunterzubrechen. Genau das liegt ihm.
Für Leser, die KI nicht als Plauderpartner, sondern als Arbeitskraft für DevOps-nahe Prozesse suchen, ist das wahrscheinlich die wichtigste Nachricht des gesamten Reports. Solar Pro4 ist dort am stärksten, wo eine Aufgabe nach Handgriffen riecht. Es muss nicht immer den schönsten Satz bauen, solange der Befehl sitzt und die Reihenfolge stimmt. In diesem Feld sitzt sie.
UX Writing, Content Transformation und kulturelle Feinabstimmung
Im UX-Writing steht Solar Pro4 bei 76.07%, in Content Transformation bei 78.73%, in Cultural Intelligence bei 72.92%. Das ergibt zusammengenommen ein Bild mit Licht und Schatten. Das Modell ist sprachlich brauchbar, oft professionell und auffallend diszipliniert in der Aufgabenbefolgung. Aber es ist nicht die Sorte System, die aus einem guten Text automatisch einen erinnerungswürdigen macht.
Das kulturelle Umschreiben einer toxischen Stellenanzeige gelang dem Modell sachlich gut: genderneutrale Formulierungen, Entfernung toxischer Begriffe, respektvoller Ton, explizite Work-Life-Balance. Das ist nicht wenig. Die Kritik des Judges zielte auf etwas Feineres: weniger idiomatische Eleganz, weniger motivierende Energie, etwas bürokratischere Wortwahl. Genau das ist der Unterschied zwischen korrekt und wirklich gut. Solar Pro4 macht daraus einen professionellen Text. Der Golden Standard macht daraus einen Text, den man lieber veröffentlichen würde.
Im Content-Transformation-Modul wird dieser Charakter fast exemplarisch sichtbar. Das Modell erzeugte ein produktionstaugliches deutsches Videoskript zu 2FA mit Timestamps, Regieanweisungen, B-Roll, Musik-Cues, Pattern Interrupt und Easter Egg. Das ist in der Fläche beeindruckend. Es erfüllt die meisten Vorgaben, klingt conversational und wirkt direkt einsetzbar. Der Judge moniert vor allem Stilfragen: die Analyse vorab ist weniger instruktiv als sie sein könnte, das Easter Egg sitzt dramaturgisch etwas ungeschickt in der Mitte statt am Ende. Das ist keine Blamage. Aber man spürt: Solar Pro4 baut funktionale Medienprodukte besser als brillante.
Documentation Quality: ordentlich, nicht überragend
Mit 73.22% in Documentation Quality liefert Solar Pro4 einen respektablen, aber nicht herausragenden Wert. Das passt zum Gesamtbild. Große Zusammenhänge, lange Kontexte und strukturierte Ausgaben liegen dem Modell grundsätzlich. Doch die letzte Stufe dokumentarischer Exzellenz besteht aus Klarheit, Priorisierung und dem Instinkt, welchen Teil ein Leser sofort sehen muss. Gerade da bleibt Solar Pro4 bisweilen auf der Seite des Fleißigen statt des Souveränen.
Für Handbücher, technische Zusammenfassungen und strukturierte Aufbereitung ist das immer noch gut genug. Wer jedoch Dokumentation als strategisches Kommunikationsmittel versteht, nicht nur als Ablageform, wird an einigen Stellen noch nachschärfen wollen.
Halluzinationen
Der Halluzinationsbefund verdient einen eigenen Abschnitt, weil er eben nicht diffus, sondern konkret ist. Die bereits erwähnte Tool-Use-Verfehlung zeigt eine klare Grenze des Modells: Wenn Solar Pro4 aus einem Werkzeugresultat berichten soll, hält es sich nicht in jedem Fall strikt an den Befund. Es ergänzt, wo es nur referieren dürfte. Für ein Modell, das sich über Agentik und Tool-Nutzung definiert, ist das keine akademische Fußnote, sondern ein Vertrauensproblem.
Der Rest des Benchmarks wirkt in dieser Hinsicht deutlich kontrollierter. Gerade in Code, CLI und strukturierten Sprachaufgaben erfindet Solar Pro4 nicht wild herum. Aber die eine dokumentierte Halluzination reicht aus, um jede pauschale Entwarnung zu verbieten. In produktiven Agenten-Setups sollte deshalb eine Verifikationsschicht obligatorisch sein: Tool-Outputs gegen Ausgabe spiegeln, Quellen mitschleifen, notfalls postvalidieren. Vertrauen ist gut. Bei Solar Pro4 ist Diffing besser.
Datenschutz und Datenhoheit
Upstage Solar Pro4 ist ein proprietärer Cloud-Dienst. Für diesen Benchmark lief das Modell als Cloud Open-Weights-Endpunkt via OpenRouter, die Rechenlast lag also vollständig beim Anbieter. Datenschutzrechtlich ist die Lage damit nicht hoffnungslos, aber unscharf. Der ausgewiesene Sovereign Risk liegt bei MEDIUM. Begründung: Upstage ist ein südkoreanisches Unternehmen, zugleich sind Hosting-Bedingungen, Datenverarbeitungsketten und mögliche Abhängigkeiten von ausländischer Infrastruktur öffentlich nicht ausreichend dokumentiert.
Beim Provider sind anwendbares Recht und Datenstandort als Unknown geführt. Auch zur Datenspeicherung gibt es keine verifizierte Angabe. Für europäische Unternehmen ist das kein theoretischer Makel, sondern eine Compliance-Frage. Wenn nicht klar ist, wo Daten liegen, unter welcher Jurisdiktion sie verarbeitet werden und welche Transfermechanismen gelten, bleibt DSGVO-Konformität ohne Vertrag schwer belegbar. Besonders relevant: Eine öffentliche Aussage zu GDPR DPA liegt ebenfalls nicht verifiziert vor. Für Unternehmen mit belastbaren Datenschutzpflichten ist das ein Hemmnis, bis vertraglich nachgezogen wird.
Das Weights-Provenienz-Risiko ist ebenfalls mit MEDIUM bewertet. Nicht weil Upstage per se verdächtig wäre, sondern weil Deployment-Situation und rechtliche Einbettung nicht transparent genug dokumentiert sind. Die gute Nachricht: Für Enterprise-Kunden sind dedizierte oder vertraglich enger kontrollierte Deployments möglich. Die schlechte Nachricht: Wer den Standard-Cloudpfad nutzt, muss mit offenen Fragen leben, nicht mit belastbaren Garantien.
Fazit
Upstage Solar Pro4 ist ein ernst zu nehmendes Agentenmodell mit klarer Werkzeugorientierung, großem Kontextfenster und einem fairen Preisbild von $0.03 pro 1M Input-Tokens und $0.12 pro 1M Output-Tokens im hier genannten Tarif. Es ist stark in CLI, stark in operativer Struktur, gut in Security-Erkennung und ordentlich in Reasoning. Sprachlich arbeitet es professionell, aber nicht immer idiomatisch glänzend. Es ist weniger Virtuose als Vorarbeiter, und das ist keineswegs ein Schimpfwort.
Die Kehrseite ist ebenso klar. Für ein Frontier-Modell bleiben die sporadischen API-Aussetzer und die problematische Tail-Latenz ein realer Reibungsverlust. Schwerer wiegt die dokumentierte Halluzination im Tool-Use-Bereich. Gerade dort, wo dieses Modell seine Daseinsberechtigung reklamiert, darf es sich keine erfundenen Tool-Befunde leisten. Wer Solar Pro4 für Agenten-Workflows einsetzt, sollte es deshalb für Terminal-, Dokumenten- und Strukturarbeit nutzen, aber bei faktenkritischer Recherche und berichtender Synthese eine harte Validierung davor- oder dahinterklemmen.
Unterm Strich ist Solar Pro4 kein Blender und kein Totalausfall, sondern ein fähiger Spezialist mit produktionsreifer Grundhaltung und einer klaren Vertrauensgrenze. Für interaktive Tool-Workflows, DevOps-nahe Assistenz und mehrstufige Aufgabenplanung ist es eine ernsthafte Option. Für alles, was aus Tool-Ergebnissen belastbare Wahrheit destillieren soll, gilt: erst prüfen, dann publizieren. Genau an dieser Stelle entscheidet sich, ob ein guter Agent nützlich bleibt oder gefährlich wird.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.