LLM Model Review
Erstellt am
Mit einem Gesamtscore von 75.25% und dem Speed Profile Unusable Tool Expert ist Occamy 1.0 35B-A3B (Accio-Lab) ein Modell mit spürbarem Ehrgeiz, aber auch mit einer sehr sichtbaren Sollbruchstelle. Als agentisch ausgerichtetes Workstation-Modell mit MoE-Architektur, 35 Milliarden Gesamtparametern und nur 3 Milliarden aktiven Parametern pro Token wirkt es im besten Fall wie ein planender Spezialist, im schlechtesten wie ein Werkzeugführer, der seine eigenen Werkzeuge nicht sauber im Griff hat. Im aktivierten Thinking-Modus liefert es oft Substanz, doch gerade dort, wo sein Profil eigentlich glänzen müsste, wird aus Kompetenz zu häufig Reibung. Sovereign Risk: MEDIUM — die Gewichte laufen lokal, aber die Provenienz führt über ein Qwen-Derivat aus dem Umfeld der Alibaba Group; damit bleibt das juristische Herkunftsrisiko auch ohne Cloud-Telemetrie ein realer Faktor.
Kopfnoten: Stabilität und Zuverlässigkeit
| Metrik | Wert | Bewertung | Analyse |
|---|---|---|---|
| Timeout-Rate | 20/49 | Nicht einsetzbar | Das Modell zeigt katastrophale Instabilität und ist für einen unbeaufsichtigten Produktiveinsatz völlig ungeeignet. |
| P95-Antwortzeit | 381.01 s | Kritisch | Extreme Tail-Latenz. Das Modell streut massiv und ist für zeitkritische Prozesse ungeeignet. |
Architektur und Einordnung
Die vorab vergebene Kategorisierung trifft den Kern erstaunlich gut. Occamy ist kein allgemeiner Chat-Allrounder, sondern klar als agentisches Reasoning-Modell gedacht. Tool-Use, strukturierte Outputs, lange Arbeitskontexte und persistent gedachte Sitzungen gehören laut Modellprofil zum Lastenheft. Dazu passt auch die Einstufung als Workstation-Modell: nicht Laptop-Spielzeug, sondern ein ernsthaftes lokales System für professionelle Hardware. Entscheidend ist bei diesem MoE-Aufbau aber nicht die Zahl auf dem Karton, sondern die aktive Kapazität. Von 35 Milliarden Parametern sind pro Token nur 3 Milliarden aktiv. Das ist der faire Maßstab.
Genau deshalb sollte man die Erwartung sauber kalibrieren. Occamy tritt architektonisch groß auf, rechnet intern aber näher an einem viel kleineren aktiven Modell. Das erklärt, warum manche Leistungen bemerkenswert sind und andere überraschend dünn ausfallen. Wer nur die Gesamtparameter liest, erwartet Rohgewalt. Wer auf die aktiven Parameter schaut, versteht den Charakter besser: spezialisiert, effizient gedacht, aber nicht automatisch breit überlegen.
Wichtig ist auch der konkrete Testmodus. Dieser Bericht bezieht sich ausdrücklich auf den Lauf mit aktiviertem Thinking-Modus. Bei einem Modell, das auf mehrstufiges Schlussfolgern und Agentenverhalten zielt, ist das keine Nebensache, sondern der eigentliche Ernstfall. Längere Denkpfade, ausführlichere Antworten und höhere Reibung bei Tempo und Stabilität sind hier also nicht per se ein Makel. Sie müssen sich aber in besserer Problemlösung auszahlen. Genau dort wird Occamy interessant und angreifbar zugleich.
Leistung in den Kernmodulen
Reasoning und Logik
Im Reasoning zeigt Occamy seine seriöseste Seite. Die Logikaufgaben werden nicht elegant im Sinne maximaler didaktischer Klarheit gelöst, aber inhaltlich belastbar. Im vorliegenden Metakognitions-Protokoll arbeitet das Modell die klassische Wächterlogik korrekt ab, trennt Fälle sauber und liefert sogar alternative Fragestellungen. Das ist keine Blendgranate aus viel Text und wenig Gehalt, sondern ein echter Denkprozess mit brauchbarem Ergebnis.
Die Schwäche liegt eher in der Form als im Schluss. Occamy erklärt oft prosaisch, wo eine Tabelle oder ein kompakter Beweisgang stärker wäre. Für Leser ist das verkraftbar. Für Agenten-Pipelines, die robuste Struktur und knappe Verifizierbarkeit mögen, ist es weniger charmant. Der Reasoning-Wert ist damit gut, aber nicht überragend: Das Modell denkt korrekt, nur nicht immer mit der Präzision eines technischen Redakteurs.
Zum Gesamtbild passt, dass der Thinking-Modus gegenüber dem Standard-Lauf tatsächlich leicht zulegt. Der Gesamtscore steigt von 74.39% auf 75.25%, vor allem, weil UX Writing und einige reasoning-nahe Bereiche gewinnen. Der Preis ist allerdings hoch: mehr Output, deutlich schlechtere Praxisstabilität und ein Charakter, der vom Badge bereits treffend beschrieben wird. Interaktiv wirkt das nicht. Eher wie ein Kollege, der vor jeder Antwort erst einmal alle Whiteboards im Raum füllt.
Code Quality und Security
Im Modul Code Quality Audit zeigt Occamy echte Substanz. Die Sicherheitsanalyse einer absichtlich verwundbaren PHP-Anwendung gelingt gründlich, technisch korrekt und mit einer Schärfe, die man einem auf Tool-Use und Orchestrierung getrimmten Modell gerne zugesteht. SQL Injection, XSS, IDOR, CSRF, Session Fixation, schwache Token-Erzeugung, Header Injection, hartkodierte Secrets, Path Traversal: Das Modell findet nicht nur die offensichtlichen Löcher, sondern auch die stilleren Gemeinheiten im System. Das ist keine kosmetische Checklistenarbeit, sondern brauchbare Sicherheitslektüre.
Bemerkenswert ist dabei die Balance zwischen Tiefe und Disziplin. Die Tabelle ist sauber formatiert, priorisiert nach Schweregrad und bleibt in den Zellen knapp. Danach folgt eine gesonderte Fokussierung auf implizite Schwachstellen, inklusive Angriffsbild und Fix. Das ist redaktionell fast lehrbuchhaft. Ein kleiner Schönheitsfehler bleibt: In der Kategorisierung der impliziten Lücken wird einmal mehr markiert als später vertieft. Das ist unpräzise, aber kein Sicherheitsversagen.
Wirklich stark ist hier der Sicherheitsinstinkt. Occamy halluziniert im Code-Audit nicht wild herum, sondern benennt konkrete Probleme mit plausiblen Abhilfen. Für Security-Review, Code-Triage und erste Befundaufbereitung ist das Modell deshalb gut einsetzbar. Nicht als letzte Instanz, aber als technisch ernst zu nehmender Erstprüfer. Man bekommt kein Pentest-Team in einer Box. Man bekommt aber ein Modell, das verdächtig oft auf die richtigen Stellen zeigt.
Content Transformation und UX-nahes Schreiben
Im Bereich Content Transformation ist Occamy besser, als sein eher spröder Name vermuten lässt. Das Videoskript-Protokoll zeigt ein Modell, das Vorgaben sauber erfüllt: deutsche Sprache, kompakte Analyse, passendes Spoken-Word-Register, Timing-Marker, Produktionshinweise, Hook, Retention-Elemente, CTA, sogar ein brauchbares Easter Egg. Das ist nicht bloß formal korrekt, sondern als Arbeitsgrundlage tatsächlich verwendbar.
Gleichzeitig sieht man die Grenze zur Spitzenklasse. Der Text ist funktional, aber nicht sonderlich glänzend. Die visuelle Dramaturgie bleibt einfacher als beim Golden Standard, die Analyse vorangestellt ist bewusst knapp, und manche „Warum“-Passagen wiederholen sich eher, als dass sie den Spannungsbogen variieren. Occamy schreibt hier nicht schlecht. Es schreibt wie ein konzentrierter Produktionsassistent, nicht wie ein Autor mit Instinkt für Bühne.
Im UX Writing und in kultur- bzw. tonsensiblen Umschreibungen schlägt das Modell sich ordentlich bis gut. Der dokumentierte HR-Umschreibefall ist exemplarisch: toxische und aggressive Formulierungen werden entfernt, Genderbias geglättet, der Ton bleibt professionell. Nur Wärme und Einladungscharakter fehlen ein Stück weit. Wo die bessere Lösung sagt: „Ihr seid willkommen“, sagt Occamy eher: „Wir suchen“. Das ist korrekt, aber es atmet weniger.
Documentation Quality und kulturelle Passung
Die Dokumentationsleistung liegt im soliden Bereich, ohne in den Auszügen mit einem großen Signature-Moment zu glänzen. Zusammen mit dem Documentation-Score ergibt sich das Bild eines Modells, das strukturierte Fachtexte vernünftig herstellen kann, aber nicht die letzte Stufe an editorischer Raffinesse erreicht. Es ist nützlich, nicht inspirierend. Für interne Dokumentation, technische Zusammenfassungen und Systemerklärungen reicht das oft völlig.
Im Cultural Intelligence-Teil macht Occamy wenig falsch und manches richtig. Die Sprache sitzt, der Regelrahmen wird respektiert, problematische Tonlagen werden erkennbar in professionelle Formen überführt. Dass der Text am Ende etwas kühler und korporativer wirkt als die Referenz, ist keine Nebensache. Gerade in Personal-, Marken- oder Führungskommunikation entscheidet diese letzte Schicht über Vertrauen. Occamy versteht die Aufgabe. Es fühlt sie nicht immer ganz.
CLI und Tool-Use
Hier liegt der eigentliche Bruch im Charakterbild. Ein agentisches Modell mit Tool-Use-Fokus darf bei der direkten Werkzeuganwendung Ecken und Kanten haben; nicht jede Shell-Aufgabe muss wie aus dem Handbuch gegossen aussehen. Aber Occamy fällt in diesem Feld nicht wegen stilistischer Rauheit auf, sondern wegen eines strukturellen Problems: Die ToolUse-Teilwertung von 42.5 ist klar die Achillesferse des Modells.
Das ist deshalb so relevant, weil Tool-Use hier kein Nebenschauplatz ist, sondern Teil der Architektur-Erzählung. Occamy will planen, strukturieren, mit APIs und Werkzeugen arbeiten. Im Benchmark gibt es jedoch zwei deutliche Warnzeichen. In mindestens zwei Tool-Use-Aufgaben wurde das ursprünglich angeforderte Token-Limit abgelehnt und das System musste auf 4096 Tokens zurückfallen. Das ist keine Petitesse, sondern eine Kopfnotiz für jeden Agenten-Einsatz. Ein Modell, das bei größeren Token-Anfragen oder Kontexten früh kneift, verliert gerade in orchestrierten Workflows seinen wichtigsten Vertrauensvorschuss.
Hinzu kommt der gravierendere Befund: In einer Tool-Use-Aufgabe halluzinierte Occamy Inhalte, die nicht aus dem abgerufenen Tool-Ergebnis stammten. Der Score wurde deshalb per Halluzinations-Cap gedeckelt. Für recherchierende, faktenkritische oder compliance-nahe Agentenarbeit ist das ein rotes Warnsignal. Wenn das Modell Werkzeugantworten nicht nur interpretiert, sondern bei Bedarf ergänzt, ist es nicht mehr Assistent, sondern Fabulierer mit API-Zugang. Genau das will man in diesem Einsatzfeld nicht.
Geschwindigkeit und Effizienz
Das lokale Modell wurde nativ auf ASUS GX10 / NVIDIA DGX Spark (GB10 Grace Blackwell Superchip, ~115 GB Unified Memory — kein praktisches Speicherlimit für getestete Modellgrößen) evaluiert. Sein Speed Profile Badge lautet Unusable Tool Expert. Das ist kein Marketingetikett, sondern fast schon ein Kurzurteil: Für Tool-zentrierte, zeitkritische Interaktion ist die Generierung zu zäh und die Ausreißer sind zu groß. Im Alltag bedeutet das kein sanftes Warten, sondern einen Arbeitsfluss, der immer wieder gegen die Wand läuft.
Im Fließbetrieb zeigt Occamy damit einen Widerspruch. Token-ökonomisch verhält es sich insgesamt vernünftig. Kein Modul überschreitet den erwarteten Verbosity-Rahmen, mehrere Bereiche liegen sogar unter dem Fleet-Median. Das Modell schwätzt also nicht sinnlos. Gerade deshalb wirkt die schwache Praxisdynamik umso ernster. Wenn ein Modell nicht aus Redseligkeit langsam wird, sondern trotz disziplinierter Ausgabe unruhig und zäh bleibt, ist das ein Charakterzug der Laufzeit, nicht bloß eine Frage des Promptings.
Dass der Thinking-Modus mehr kostet als der Standard-Lauf, ist erwartbar. Doch der Unterschied im Nutzwert ist begrenzt. Der Scoregewinn bleibt klein, während der Einsatzcharakter deutlich schwerfälliger wird. Für Nutzer heißt das schlicht: Occamy denkt lieber länger, als dass es schneller liefert. Das ist legitim. Es muss dann nur öfter mit einer besseren Antwort belohnt werden, als es hier der Fall ist.
Halluzinationen und Vertrauensprofil
Über weite Strecken ist Occamy kein notorischer Erfinder. In Security-Analysen, Umschreibungen und vielen Transformationsaufgaben bleibt es ordentlich am Material. Genau deshalb wiegt der Tool-Use-Ausreißer schwerer. Halluzinationen sind nicht überall gleich schlimm. In einem Marketingentwurf ist ein übergriffiges Detail ärgerlich. In einer aus Tool-Ergebnissen abgeleiteten Antwort ist es ein Vertrauensbruch.
Das Modell hat also kein flächendeckendes Halluzinationsproblem, aber einen kritischen Blindfleck an genau der Stelle, an der sein agentisches Versprechen eingelöst werden müsste. Für faktensensitive Agentenarbeit gilt deshalb: verifizieren, protokollieren, nachprüfen. Occamy kann mit Werkzeugen arbeiten. Es darf ihnen nicht blind geglaubt werden, und noch weniger darf man blind glauben, dass es ihre Ergebnisse sauber wiedergibt.
Datenschutz und Datenhoheit
Für den operativen Einsatz ist die Lage zweischneidig, aber klarer als bei vielen API-Modellen. Occamy wird als offene Gewichte lokal betrieben; laut Vendor Card gibt es keinen API-Betrieb durch den Entwickler, und bei Self-Hosting verbleiben Daten vollständig in der Infrastruktur des Nutzers. Das ist aus europäischer Unternehmenssicht ein echter Vorteil, weil keine laufende Telemetrie an einen Modellanbieter beschrieben ist.
Juristisch verschwindet das Herkunftsthema damit trotzdem nicht. Die öffentlich dokumentierte Publisher-Identität verweist auf ein Forschungsumfeld innerhalb der Alibaba Group in der VR China. Genannt werden National Intelligence Law, Data Security Law und Cybersecurity Law als relevanter Rechtsrahmen des Entwicklerkonzerns. Für europäische Nutzer bedeutet das nicht, dass lokal eingegebene Daten automatisch abfließen. Es bedeutet aber, dass die Provenienz der Gewichte aus einer Jurisdiktion stammt, deren Rechtslage man im Governance-Bericht nicht einfach wegwischen sollte.
Ein formell verifizierter GDPR DPA ist nicht dokumentiert, die Datenspeicherung ist mit -1 Tagen angegeben, also faktisch nicht auf API-Betrieb bezogen. Praktisch heißt das: Wer self-hostet, reduziert das Datenschutzrisiko massiv. Wer jedoch strenge Lieferketten-, Herkunfts- oder Souveränitätsanforderungen hat, bekommt mit dem berechneten Sovereign Risk MEDIUM eine nüchterne, nicht triviale Warnmarke.
Fazit
Occamy 1.0 35B-A3B (Accio-Lab) ist ein interessantes, ernsthaft konstruiertes Open-Weights-Modell mit klarer Identität. Im Thinking-Modus zeigt es brauchbares Reasoning, starke Security-Analysen, ordentliches Transformationsvermögen und insgesamt respektable Textdisziplin. Als agentisches Workstation-MoE sollte man es an seinen 3 Milliarden aktiven Parametern messen, nicht an der 35B-Schlagzeile. Unter dieser fairen Messlatte ist die Leistung durchaus respektabel.
Der Haken ist nur nicht klein. Tool-Use ist ausgerechnet der Bereich, in dem Occamy zu oft stolpert: schwache Teilwertung, Token-Limit-Fallbacks in Tool-Aufgaben, dazu mindestens ein dokumentierter Halluzinationsfall auf Basis eines Tool-Ergebnisses. Kombiniert mit katastrophaler Gesamtstabilität und kritischer Tail-Latenz ergibt das ein Modell, das man nicht unbeaufsichtigt in produktive Agentenketten schicken sollte. Für lokale Security-Reviews, strukturierte Analysen, Redrafting und reasoning-lastige Einzelsitzungen kann Occamy nützlich sein. Für autonome Tool-Operator-Rollen ist es derzeit zu launisch. Die Weights-Provenienz ist sauberer dokumentiert als bei vielen Community-Derivaten, bleibt wegen der unklar öffentlich dokumentierten Organisationsjurisdiktion aber mit MEDIUM zurecht nicht völlig entwarnt.
Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.