Occamy 1.0 35B-A3B (Accio-Lab) (Thinking)

Occamy 1.0 von Accio-Lab ist ein Agentic-Derivat des Qwen3.6-35B-A3B-Checkpoints, konzentriert auf langhorizontige Co-Work-Sessions mit Tools, strukturierten APIs und persistentem Zustandstracking. Die NVFP4-Quantisierung ist selektiv: nur die gerouteten Experten sind quantisiert, während Aufmerksamkeit, Router, Embeddings und Output-Head in BF16 bleiben. Das 35-Milliarden-Parameter-MoE aktiviert pro Token nur 3 Milliarden Parameter und unterstützt 262.000 Tokens Kontext. Apache-2.0-Lizenz und dokumentierte Provenienz mit Rezept-, Daten- und Validierungs-Artefakten.

Accio-Lab Version 1.0 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 12/2025 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Vision
  • Unusable

Sovereign Risk: MEDIUM Occamy 1.0 NVFP4 is a community derivative of Qwen/Qwen3.6-35B-A3B, with a published provenance trail including the quantization recipe, data-provenance file, and validation artifacts. The upstream base is Apache 2.0, the checkpoint runs locally, and the NVFP4 export is limited to routed experts, but Accio-Lab’s organizational jurisdiction is not publicly documented, so the provenance risk remains medium.[file:1]

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
4.02
First Request
MCP
1.32
Protocol Latency
Synthesis
136.43
Response Generation
Total
850.61
Sum of All Phases
Token
10986
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber die Tool-Calls nicht durchgehend valide sind und die Synthese bei einem Halluzinationsbefund nicht zuverlässig genug für unbeaufsichtigte Produktionspipelines bleibt.

Tool-Execution-Profil

Occamy zeigt klare Werkzeugintelligenz statt bloßem Schema-F. Beim Web Search & Tool Selection-Test, der prüft ob ohne Hinweis web_search statt fetch gewählt wird, trifft es die richtige Entscheidung konsistent. Das spricht für brauchbare Planungslogik in MCP-gestützten Abläufen. Auch EU License Research läuft auf P1-Seite sauber, was wichtig ist, weil das Modell dort aktiv aktuelle Web-Quellen einholen muss.

Schwächer wird es bei Präzisionsarbeit nach der Entscheidung. Beim URL-Construction-Test, der die korrekte Ziel-URL aus Eigenwissen und den anschließenden Fetch prüft, ist die Ausführung nur ordentlich, nicht deterministisch. Genau dort liegt das Produktionsrisiko: Das Modell weiß oft, welches Tool gebraucht wird, aber der konkrete Call ist nicht stabil genug. Der Befund „Tool-Call valide: false“ ist deshalb schwerer als der gute P1-Gesamteindruck. Immerhin war kein Retry nötig. Das wirkt eher wie ein Ausführungs- und Präzisionsproblem als wie ein Protokollverständnisfehler.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur eingeschränkt belastbar. Die P2-Leistung ist mit 42.50 der klare Schwachpunkt. Besonders auffällig ist Multilingual Search & Synthesis: Das Modell findet Informationen über Sprachgrenzen hinweg, verdichtet sie aber unpräzise und verliert Relevanz. Auch bei URL Construction & Fetch bricht die Qualität in der Zusammenführung der abgerufenen Inhalte deutlich ein. Für Pipelines, die exakte Extraktion, Compliance-Zitate oder verlässliche Ergebnisverdichtung brauchen, ist das zu schwach.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research bleibt es formal im sicheren Bereich: keine Halluzination, also kein Ausweichen auf altes Trainingswissen trotz aktueller Lizenzfrage. Das ist der wichtigste Vertrauensanker. Der globale Halluzinationsbefund bleibt trotzdem ein Sicherheitsrisiko. Sobald ein Modell erfundene Fakten als Tool-Ergebnis ausgeben kann, beschädigt es das Vertrauen in die gesamte Tool-Infrastruktur.

Fehlerresilienz

Bei Tool Failure Handling (404), das transparente Reaktion auf einen fehlgeschlagenen Abruf prüft, verhält sich Occamy produktionsgerecht. Es halluziniert keinen Seiteninhalt und kommuniziert den Fehlschlag nachvollziehbar. Genau dieses Verhalten ist in robusten Pipelines akzeptabel, weil der Orchestrator dann sauber eskalieren oder neu planen kann.

Souveränitätsprofil

Lokal betreibbar, open-weight und damit für souveräne Deployments attraktiv. Combined 70.00, also 1.83 Punkte über dem Fleet-Ø von 68.17. Die Kompetenz ist damit fleet-tauglich, aber nicht ohne Guardrails.

Fazit & Empfehlung

Geeignet für lokale, souveräne Agenten-Pipelines mit starker externer Validierung, klaren Tool-Schemas und nachgelagerter Ergebnisprüfung. Gut einsetzbar für Recherche-Orchestrierung, Such- und Fetch-Ketten sowie fehlertolerante Assistenzabläufe. Nicht geeignet für High-Trust-Pipelines ohne menschliche oder programmatische Kontrolle, insbesondere bei Compliance, mehrsprachiger Verdichtung und allen Workflows, in denen die Synthese selbst als verlässliches Endprodukt gelten muss.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.