Gemma 4 26B-A4B Q5_K_M (ARA-Abliterated)

Diese ARA-Abliterated-Variante entfernt die Sicherheitsfilter von Googles Gemma 4 26B-A4B MoE und bringt das Modell als Q5-GGUF auf Workstation-Hardware. Die Architektur bleibt mit 25 Milliarden Gesamt- und rund 4 Milliarden aktiven Parametern pro Token effizient; 256.000 Tokens Kontext, Apache-2.0-Lizenz. Thinking-Status und multimodale Fähigkeiten sind in der Variante noch nicht sauber verifiziert — für Forschung und Red-Teaming gedacht, nicht als Endkonsumenten-Assistant.

Google Version 4 Kommerzielle Nutzung erlaubt MoE 25.2 B (4 B aktiv) 256 K Context 01/2025 local getestet

  • Open Weights
  • Workstation
  • llama.cpp
  • Text
  • Instruction-Tuned
  • Uncensored
  • Interactive

Sovereign Risk: MEDIUM Die Basisgewichte stammen von Google DeepMind und sind unter Apache 2.0 veröffentlicht. Diese Karte beschreibt jedoch eine Community-Abliteration durch ARA-APEX, also eine modifizierte Derivat-Variante mit entfernten Sicherheitsfiltern und zusätzlicher Quantisierung. Der rein lokale Betrieb vermeidet Cloud-Risiken, aber die fehlende offizielle Dokumentation der Modifikation und die uncensored Abliteration erhöhen das Provenance-Risiko gegenüber der unveränderten Basis.[web:809][web:812][web:821]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
73.35
Routine
44.56
Reasoning
28.79

Rank #39

LLM Judge Avg
3.6
100 Coverage
Avg Task Duration
24.32
Interactive
Token Rate
53.49
Output Rate
P95 Latency
64.96
Top 5 %
Total Tokens
72400
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 72400 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemma 4 26B-A4B Q5_K_M (ARA-Abliterated) Bestes Modell Ø Alle Modelle
Code Quality 74.9
CLI Benchmark 90
Logical Reasoning 68.16
UX Writing 67.35
Documentation 68.44
Content Transform. 72.33
Cultural Intelligence 77.6
Synthesis Quality 63.33
Tool Execution 90
ToolUse Score 76.33
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil