Ornith 1.0 35B

Was die FP8-Block-Quantisierung Ornith-1.0-35B-FP8 leistet: ein Open-Weight-MoE mit nur etwa 3 von 35 Milliarden aktiven Parametern pro Token läuft auf einer einzelnen GPU und bringt 262.144 Tokens Kontext, natives Thinking und Tool-Calling mit. DeepReinforce hat das Modell so trainiert, dass es seine eigene Agent-Vorgehensweise mitlernt statt mit einem festen Regelwerk zu arbeiten. MIT-Lizenz, kommerzielle Nutzung und Fine-Tuning ohne Auflagen.

DeepReinforce Version 1.0 Kommerzielle Nutzung erlaubt MoE 35 B (3 B aktiv) 262 K Context 05/2026 local getestet

  • Open Weights
  • Workstation
  • vLLM
  • Text
  • Batch

Sovereign Risk: LOW DeepReinforce ist eine US-basierte RL-Forschungsorganisation. Das Modell ist unter MIT-Lizenz ohne regionale Einschränkungen auf Hugging Face verfügbar (79.608 Downloads/Monat). Linienbaum: Qwen3.5-35B-A3B (hybride MoE-Basis, Alibaba Cloud) + Gemma 4 → DeepReinforce Ornith-1.0-35B (RL-Post-Training) → offizielle FP8-Block-Quantisierung (E4M3) desselben Autors. Kein chinesisches NSL-Risiko, kein US-CLOUD-Act-Risiko bei lokalem Betrieb, da reines Open-Weight-Modell ohne Cloud-API-Zwang.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
75.79
Routine
46.56
Reasoning
29.23

Rank #19

LLM Judge Avg
3.92
100 Coverage
Avg Task Duration
79.56
Batch
Token Rate
35.53
Output Rate
P95 Latency
161.52
Top 5 %
Total Tokens
176500
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 176500 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Ornith 1.0 35B Bestes Modell Ø Alle Modelle
Code Quality 76.92
CLI Benchmark 90.67
Logical Reasoning 73.96
UX Writing 77.15
Documentation 78.65
Content Transform. 71.79
Cultural Intelligence 81.44
Synthesis Quality 62.5
Tool Execution 80.83
ToolUse Score 63.21
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil