Occamy 1.0 35B-A3B (Accio-Lab)

Occamy 1.0 von Accio-Lab ist ein Agentic-Derivat des Qwen3.6-35B-A3B-Checkpoints, konzentriert auf langhorizontige Co-Work-Sessions mit Tools, strukturierten APIs und persistentem Zustandstracking. Die NVFP4-Quantisierung ist selektiv: nur die gerouteten Experten sind quantisiert, während Aufmerksamkeit, Router, Embeddings und Output-Head in BF16 bleiben. Das 35-Milliarden-Parameter-MoE aktiviert pro Token nur 3 Milliarden Parameter und unterstützt 262.000 Tokens Kontext. Apache-2.0-Lizenz und dokumentierte Provenienz mit Rezept-, Daten- und Validierungs-Artefakten.

Accio-Lab Version 1.0 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Interactive

Sovereign Risk: MEDIUM Occamy 1.0 NVFP4 is a community derivative of Qwen/Qwen3.6-35B-A3B, with a published provenance trail including the quantization recipe, data-provenance file, and validation artifacts. The upstream base is Apache 2.0, the checkpoint runs locally, and the NVFP4 export is limited to routed experts, but Accio-Lab’s organizational jurisdiction is not publicly documented, so the provenance risk remains medium.[file:1]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.04
First Request
MCP
1.2
Protocol Latency
Synthesis
11.85
Response Generation
Total
96.52
Sum of All Phases
Token
10126
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Ausführung von Tools meist tragfähig ist, aber die Tool-Call-Validität nicht durchgängig sitzt und die Gesamtsynthese für autonome MCP-Pipelines nicht stabil genug verdichtet.

Tool-Execution-Profil

Occamy 1.0 35B-A3B zeigt brauchbare operative Tool-Nutzung, aber keine verlässliche Werkzeugintelligenz. Das starke Signal kommt aus klar geführten Abrufpfaden: Beim Test zu HTTP Fetch & Extract extrahiert es strukturierte Fakten sauber, und beim URL-Construction-Test, der die Ableitung einer Ziel-URL aus Vorwissen prüft, arbeitet es mit solider Präzision. Auch die mehrsprachige Recherche startet operativ stark.

Der Schwachpunkt liegt bei der Auswahl des richtigen Werkzeugs ohne Hint. Beim Test Web Search & Tool Selection, der prüft, ob statt fetch zuerst web_search nötig ist, fällt es deutlich ab. Das spricht gegen flexible Tool-Planung und eher für ein Muster: Wenn eine URL oder ein direkter Abrufpfad plausibel erscheint, folgt das Modell diesem Pfad, statt den Informationsbedarf erst korrekt zu klassifizieren. Für MCP-Orchestrierung heißt das: in eng gerahmten Flows brauchbar, in offenen Recherchepfaden mit mehreren möglichen Tools riskant. Dass der Tool-Call nicht durchgängig valide war, verschärft genau diesen Punkt.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt. Die P2-Leistung zeigt ein konsistentes Muster: Solide bei direkten Extraktionsaufgaben, aber schwach, sobald mehrere Quellen, Sprachwechsel oder implizite Schlussfolgerungen zusammengeführt werden müssen. Besonders auffällig ist die Diskrepanz zwischen perfekter operativer Ausführung bei Multilingual Search & Synthesis und deutlich schwächerer Verdichtung auf Deutsch. Das Modell findet Material, komprimiert es aber nicht präzise genug für belastbare Entscheidungsoutputs.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Eher ja, und das ist der wichtigste positive Befund. Beim Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, halluziniert Occamy nicht. Das Vertrauensfundament ist damit vorhanden: Es erfindet keine Compliance-Fakten, auch wenn die Zusammenfassung nur mittelstark ausfällt.

Fehlerresilienz

Bei Tool-Fehlern reagiert das Modell produktionsfähig. Im 404-Test, der transparentes Fehlermanagement statt erfundenem Seiteninhalt misst, kommuniziert es den Fehlschlag sauber und halluziniert keinen Ersatzinhalt. Das ist für produktive Pipelines akzeptabel. Ein System kann mit klaren Fehlern umgehen; es kann nicht mit erfundenen Ergebnissen umgehen.

Souveränitätsprofil

Lokal betreibbar und trotz local_sovereign-Setup knapp fleet-kompetitiv. Mit 68.71 Combined liegt es 0.68 Punkte über dem Fleet-Ø von 68.03.

Fazit & Empfehlung

Geeignet für lokale, souveräne Pipelines mit vorstrukturierten Tool-Pfaden, klaren Fetch-Schritten und menschlicher Nachkontrolle auf der Ergebnisebene. Nicht geeignet als autonomer Recherche-Orchestrator, der selbst entscheiden muss, ob gesucht, abgerufen oder umgeplant werden soll. Wenn Sie Tool-Auswahl und Call-Schema hart vorgeben, kann Occamy ein nützlicher lokaler Worker sein. Wenn das Modell die Infrastruktur eigenständig navigieren soll, bleibt das Risiko zu hoch.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.