Occamy 1.0 35B-A3B (Accio-Lab)

Occamy 1.0 von Accio-Lab ist ein Agentic-Derivat des Qwen3.6-35B-A3B-Checkpoints, konzentriert auf langhorizontige Co-Work-Sessions mit Tools, strukturierten APIs und persistentem Zustandstracking. Die NVFP4-Quantisierung ist selektiv: nur die gerouteten Experten sind quantisiert, während Aufmerksamkeit, Router, Embeddings und Output-Head in BF16 bleiben. Das 35-Milliarden-Parameter-MoE aktiviert pro Token nur 3 Milliarden Parameter und unterstützt 262.000 Tokens Kontext. Apache-2.0-Lizenz und dokumentierte Provenienz mit Rezept-, Daten- und Validierungs-Artefakten.

Accio-Lab Version 1.0 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Interactive

Sovereign Risk: MEDIUM Occamy 1.0 NVFP4 is a community derivative of Qwen/Qwen3.6-35B-A3B, with a published provenance trail including the quantization recipe, data-provenance file, and validation artifacts. The upstream base is Apache 2.0, the checkpoint runs locally, and the NVFP4 export is limited to routed experts, but Accio-Lab’s organizational jurisdiction is not publicly documented, so the provenance risk remains medium.[file:1]

LLM Model Review

Erstellt am

Mit einem Gesamtscore von 74,39% zeigt Occamy 1.0 35B-A3B (Accio-Lab) ein klares Profil: kein universeller Schönschreiber, sondern ein agentisch zugeschnittenes Workstation-Modell mit offenem Gewichtssatz, 35 Milliarden Gesamtparametern und nur 3 Milliarden aktiven Parametern pro Token. Genau diese MoE-Architektur ist hier der Maßstab. Man sollte also keine rohe Frontier-Wucht erwarten, sondern effiziente Spezialisierung. Der getestete Lauf fand im Modus Standard statt, obwohl die Architektur klar auf Reasoning und Thinking ausgelegt ist. Das erklärt den direkten, weniger ausschweifenden Ton vieler Antworten. Sovereign Risk: MEDIUM — die Gewichts-Provenienz ist für das lokale Checkpoint ungewöhnlich gut dokumentiert, aber Accio-Labs organisatorische Jurisdiktion ist öffentlich nicht sauber verifiziert.

Kopfnoten: Stabilität und Zuverlässigkeit

Metrik Wert Bewertung Analyse
Timeout-Rate 0/49 Stabil Das Modell lief im Test absolut stabil und zuverlässig.
P95-Antwortzeit 66.3 s Problematisch Signifikante Ausreißer, die den Arbeitsfluss unterbrechen.

Architektur und Charakter: was Occamy sein will

Occamy 1.0 35B-A3B (Accio-Lab) ist kein normaler Allround-Chatbot mit etwas Tool-Glitzer obendrauf. Die Metadaten passen erstaunlich gut zum Verhalten im Benchmark. Als agentic eingestuft, ist das Modell sichtbar auf mehrstufige Aufgaben, strukturierte Ausgaben und Werkzeug-Kontexte hin trainiert. Als Workstation-Modell darf es mehr leisten als kompakte Desktop-Gewichte. Und als MoE zählt eben nicht die große Zahl auf dem Karton, sondern die aktive Kapazität von 3 Milliarden Parametern pro Token. Das ist eher chirurgisches Arbeiten als brachiale Rechenmasse.

Die Folge sieht man im Profil: starke Strukturtreue, meist gute Aufgabenzerlegung, ordentliche technische Nüchternheit. Weniger sichtbar sind Glanzmomente im Stil oder in der sprachlichen Eleganz. Occamy schreibt selten schlecht, aber oft funktional. Es klingt wie ein System, das eine Aufgabe erledigen will, nicht wie eins, das sich für den Text bewundert sehen möchte. Für produktive Tool-Ketten ist das oft die richtige Priorität.

Der zweite wichtige Punkt ist der tatsächliche Testmodus. Dieser Bericht bewertet den Standard-Lauf mit deaktiviertem Thinking. Für ein Modell mit Thinking- und Reasoning-DNA ist das keine Nebensache. Man testet hier gewissermaßen die Straßenversion statt die Rennstrecke. Die Antworten fallen kompakter aus, sichtbare Gedankengänge treten zurück, und genau deshalb muss man manche Schwäche vorsichtig einordnen. Dass Occamy im Thinking-Lauf desselben Benchmarks höher ausfällt, ist kein Zufall, sondern fast eine Charakterbestätigung.

Geschwindigkeit: kein Sprinter, eher Schichtleiter

Das Speed-Profil lautet Interactive DevOps Expert. Das klingt nach zackiger, interaktiver Arbeit im technischen Alltag, und in der Praxis trifft das nur mit Einschränkungen zu. Occamy generiert auf dem Testsystem ordentlich, aber nicht druckvoll. Die Durchsatzwerte wirken für ein lokales Workstation-MoE nicht alarmierend, doch der lange Tail passt nicht zu echter Echtzeit-Souveränität. Anders gesagt: Für konzentrierte Sessions ist das Modell brauchbar, für hektische Ping-Pong-Interaktion fehlt ihm die Leichtfüßigkeit.

Das ist nicht völlig untypisch für agentische und reasoning-nahe Modelle. Auch im Standard-Modus schleppen solche Systeme oft mehr innere Planung mit, als die sichtbare Kürze ihrer Antworten vermuten lässt. Wer Occamy als stillen Co-Piloten für strukturierte DevOps- oder Tool-Aufgaben einsetzt, bekommt ein brauchbares Arbeitstempo. Wer eine sofort reagierende Konsole erwartet, merkt schnell, dass hier eher ein überlegter Vorarbeiter spricht als ein nervöser Terminal-Akrobat.

Reasoning und Logik: sauber gedacht, ohne Theater

Im Reasoning-Modul gehört Occamy zu den erfreulich nüchternen Systemen. Das Modell löst klassische Logikaufgaben korrekt, nachvollziehbar und ohne jene falsche Mystik, mit der manche Reasoning-Modelle ihre Unsicherheit kaschieren. Beim Zwei-Wächter-Rätsel arbeitet es die Szenarien systematisch durch, erklärt die doppelte Inversion korrekt und landet präzise bei der richtigen Strategie. Inhaltlich ist das stark. Stilistisch hätte die Antwort knapper und eleganter sein können, aber hier gilt: lieber redundant richtig als glänzend falsch.

Interessant ist, dass der Standard-Lauf bereits diese analytische Stabilität zeigt. Das bestätigt, dass die Thinking/Reasoning-Klassifikation nicht nur Marketingtapete ist. Selbst ohne aktivierten Thinking-Modus bleibt ein reasoning-fähiger Kern sichtbar. Occamy argumentiert nicht spektakulär, sondern belastbar. Gerade für agentische Systeme ist das wertvoll, weil Planungsfehler in Multi-Step-Workflows teurer sind als etwas längere Erklärungen.

Code Quality und Security: kompetent, aber nicht forensisch

In Code- und Security-nahen Aufgaben zeigt Occamy seine vielleicht praktischste Seite. Es erkennt viele klassische Schwachstellen zuverlässig, strukturiert die Befunde sauber in Tabellen und liefert passende Fixes. SQL-Injection, Klartextpasswörter, XSS, Session-Fixation, CSRF, schwache Token-Generierung oder unsichere Cookie-Grenzen werden korrekt angesprochen. Das ist keine kleine Leistung. Viele Modelle liefern hier hübsche Überschriften und leere Kalorien. Occamy arbeitet.

Gerade im Security-Teil zeigt sich aber auch die Grenze seiner aktiven Kapazität. Der Judge protokolliert eine Lücke von mehreren nicht identifizierten Schwachstellen gegenüber dem Referenzniveau. Besonders kritisch ist nicht das Übersehen exotischer Randfälle, sondern das Unterbewerten zweier heikler Themen: Path Traversal und IDOR wurden zu niedrig eingestuft, obwohl der praktische Eskalationspfad klar in Richtung kritischer Systemübernahme weist. Das ist kein Totalausfall, aber eben auch nicht die Präzision, die man für ernsthafte Audits ohne Zweitprüfung akzeptieren sollte.

Die Qualität der Fixes ist in der Regel brauchbar. Prepared Statements, password_hash(), password_verify(), hash_equals() oder realpath-basierte Absicherung sind kein Blendwerk, sondern funktionale Reparaturvorschläge. Was fehlt, ist die zweite Ebene: Exploit-Ketten, Angriffspfad-Synthese, Priorisierung nach realer Ausnutzbarkeit. Occamy sieht viele einzelne Löcher. Den gesamten Einbruch rekonstruiert es nicht immer mit der nötigen Schärfe. Für Secure Coding Reviews ist das gut. Für offensive oder tief forensische Sicherheitsarbeit reicht es allein nicht.

Content Transformation: stark in der Ausführung, schwächer bei harten Limits

Im Modul Content Transformation liefert Occamy teils beeindruckend verwertbare Ergebnisse. Das gilt besonders dort, wo ein technischer oder semi-redaktioneller Umbau gefordert ist. Ein gutes Beispiel ist das deutsche Video-Skript zur Zwei-Faktor-Authentifizierung. Hier arbeitet das Modell strukturiert, mit funktionierenden Zeitmarken, klaren Sprecherpassagen, Produktionselementen und einem ungewöhnlich ausgearbeiteten Easter Egg. Das ist nicht nur formal vollständig, sondern editorisch tatsächlich nutzbar. Die Antwort klingt nicht nach Schulaufsatz, sondern nach brauchbarem Produktionsmaterial.

Die Schwächen liegen weniger in der Substanz als in der Disziplin. Das Modell neigt in diesem Modul dazu, ein gutes Gerüst noch ein Stück weiter auszubauen, obwohl die Aufgabe bereits erfüllt wäre. Genau das kostet Punkte, wenn harte Grenzen gesetzt sind.

In einer Aufgabe im Content-Transformation-Bereich überschritt das Modell die explizite Wortvorgabe von 250 Wörtern um 22%. Das System verhängte einen automatischen Abzug von 20% beziehungsweise 11,80 Punkten. Die inhaltliche Qualität der Antwort ist damit irrelevant. Die Strafe greift unabhängig davon.

Dieser Befund ist wichtig, weil er zum agentischen Charakter des Modells passt. Occamy versucht eher, die Aufgabe vollständig und hilfreich zu lösen, als pedantisch an der Wortkante zu stoppen. Das ist menschlich fast sympathisch, maschinell aber ein Problem. In Agenten-Frameworks, Formularpipelines oder Publishing-Systemen gilt ein Limit nicht als freundliche Empfehlung, sondern als Vertrag.

Documentation, UX und Cultural Intelligence: ordentlich, selten elegant

Die Dokumentationsqualität liegt auf einem guten, aber nicht glänzenden Niveau. Occamy strukturiert sauber, erklärt meist verständlich und hält sich an geforderte Formen. Es produziert keine peinlichen Textlawinen und verliert sich nur selten in Selbstwiederholung. Gerade für ein lokales Modell ist das eine Stärke, weil es im Alltag weniger Nachschnitt verlangt als viele offene Gewichte derselben Klasse.

Bei UX Writing und Mikrotexten wirkt das Modell funktional statt feinmotorisch. Es trifft den Zweck, aber nicht immer den Ton. Wo knappe, zugespitzte, emotional präzise Sprache gefragt wäre, bleibt Occamy eher auf der sicheren Mittelspur. Das ist nicht falsch. Es ist nur nicht das Modell, das einer Oberfläche plötzlich Persönlichkeit gibt.

Im Bereich Cultural Intelligence ist das Bild ähnlich. Positiv fällt auf, dass Occamy problematische, exkludierende oder veraltete Formulierungen zuverlässig erkennt und in brauchbare deutsche Alternativen überführt. Bei einer HR-nahen Umschreibung entfernt es toxische Signale, ergänzt Inklusivität und bleibt vollständig in deutscher Sprache. Der Haken liegt im Feinschliff. Es löst die Aufgabe, aber nicht mit jener kulturellen oder sprachlichen Souveränität, die aus einer korrekten Formulierung eine moderne, wirklich gute macht. Occamy weiß, was vermieden werden muss. Es weiß nicht immer, wie man daraus die beste Form macht.

Tool-Use und agentische Eignung: glaubwürdig, aber nicht makellos

Für ein agentisches Modell zählt nicht nur, ob es schöne Antworten schreibt. Wichtiger ist, ob es strukturierte Ausgaben, Werkzeugnähe und längere Arbeitsabläufe beherrscht. In dieser Hinsicht liefert Occamy ein glaubwürdiges Profil. Die Modellkarte verspricht Fokus auf Tool-Use, APIs, State-Tracking und längere Co-Work-Sessions. Der Benchmark widerspricht dem nicht. Man sieht ein System, das Aufgaben organisiert, strukturierte Formate ernst nimmt und technisch zweckmäßig denkt.

Gleichzeitig ist der ToolUse-Score kein Ruhmesblatt. Das deutet darauf hin, dass Occamy zwar nach Agent riecht, aber im direkten Werkzeugvollzug nicht immer die Präzision eines spezialisierten Tool-Executors erreicht. Das muss man fair lesen: Agentische Modelle werden oft dafür gebaut, Aufgaben zu planen und Subtasks in Form zu bringen, nicht jeden exakten Einzelschritt als One-Shot perfekt zu exekutieren. Dennoch bleibt festzuhalten, dass der Anspruch an ein Tool-Use-Modell hoch ist. Wer es in echte Agentenketten hängt, sollte Calls, Strukturen und Abbruchpfade sorgfältig absichern.

Token-Ökonomie: erfreulich erwachsen

Occamy verhält sich token-ökonomisch — kein Modul übersteigt den erwarteten Verbosity-Rahmen. Das ist bei einem lokalen Modell mehr als nur eine Stilfrage. Weniger Ausgabetokens bedeuten hier in der Regel auch kürzere Wartezeiten und weniger Reibung im Arbeitsfluss. Besonders positiv ist, dass selbst umfangreichere Aufgaben in Code Quality, Content Transformation und UX nicht in sinnlose Ausschmückung kippen.

Diese Effizienz macht den zuvor erwähnten Wortlimit-Verstoß umso interessanter. Er war kein Symptom einer generellen Geschwätzigkeit, sondern ein punktueller Kontrollverlust bei einer klaren harten Grenze. Das ist fast die bessere Nachricht, weil es auf Prompt- und Steuerungsebene eher beherrschbar wirkt als ein grundsätzlich schwammiges Modellverhalten.

Datenschutz und Datenhoheit

Entfällt als eigener Risikoblock, weil Occamy 1.0 35B-A3B (Accio-Lab) hier als lokales Open-Weights-Modell betrieben wird. Relevant ist stattdessen die Provenienz der Gewichte: Sie ist für ein Community-Derivat ungewöhnlich gut dokumentiert, bleibt wegen der nicht öffentlich klar verifizierten organisatorischen Jurisdiktion von Accio-Lab aber ein Fall für informierte Vorsicht statt blindes Vertrauen.

Fazit

Occamy 1.0 35B-A3B (Accio-Lab) ist ein lokales Modell, evaluiert nativ auf dem ASUS GX10 / NVIDIA DGX Spark (GB10 Grace Blackwell Superchip, ~115 GB Unified Memory — kein praktisches Speicherlimit für getestete Modellgrößen), und genau in diesem Kontext ergibt es Sinn: als ernstzunehmender agentischer Workstation-Kandidat mit offenem Gewichtssatz, sauberer MoE-Effizienz und vernünftiger technischer Disziplin. Es ist stark bei Logik, strukturierten Analysen, Security-Basics und produktionsnaher Umformung von Inhalten. Schwächer wird es dort, wo absolute Präzision bei Schweregrad-Einstufungen, knallharte Constraint-Treue oder stilistische Finesse verlangt sind. Der Standard-Lauf erreicht 74,39%; der Thinking-Lauf desselben Modells liegt sichtbar höher und passt noch besser zur eigenen Architektur. Wer Occamy nutzt, sollte also wissen, dass hier der gedrosselte Alltagsmodus getestet wurde, nicht die voll entfaltete Reasoning-Variante. Über alle Tests hinweg keine nennenswerten Halluzinationen — das Modell erfindet lieber wenig, als sich mit großem Gestus zu blamieren.

Die Empfehlung fällt deshalb differenziert, aber klar aus. Für lokale Assistenz in DevOps-nahen Workflows, strukturierte Content-Arbeit, technische Redaktionsaufgaben und als Baustein in agentischen Ketten ist Occamy eine ernsthafte Option. Für High-Stakes-Security-Audits, streng formatierte Publishing-Pipelines ohne Nachkontrolle oder Aufgaben, bei denen jedes Wortlimit juristisch zählt, braucht es engere Leitplanken. Occamy ist kein Blender. Es ist ein arbeitswilliges System mit Substanz. Aber man sollte ihm die Werkbank geben, nicht gleich den Chefsessel.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.