Gemma 4 12B Instruct (Unsloth, Q6_K_XL) — Instruct-Profil

Instruct-Profil der Q6_K_XL-GGUF-Distribution von Gemma 4 12B Instruct (Unsloth) für lokales Deployment auf der DGX Spark: identische Gewichte wie das Basis-Profil, aber mit serverseitig deaktiviertem Reasoning (–reasoning off). 12 Milliarden dichte Parameter, 256.000 Tokens Kontext, Apache-2.0-Lizenz. Das Profil existiert nach der Coverage-Regel des Political-Compass-Moduls als Ersatzlauf, weil der Thinking-Lauf des Basis-Profils unter Truncations litt; es läuft als eigenständiger Benchmark-Eintrag.

Google Version 4 Kommerzielle Nutzung erlaubt Dense 12 B (12 B aktiv) 256 K Context 01/2025 local getestet

  • Open Weights
  • Desktop
  • llama.cpp
  • Text
  • Vision
  • Audio
  • Video
  • Instruction-Tuned
  • Interactive

Sovereign Risk: LOW Die Basisgewichte stammen von Google DeepMind und sind unter Apache 2.0 veröffentlicht. Diese Karte beschreibt eine lokale Unsloth-GGUF-Distribution; die Inferenz läuft ohne Cloud-Verbindung und ohne externen Datentransfer. Das CLOUD-Act-Risiko betrifft primär Cloud-/API-Nutzung, nicht den rein lokalen Betrieb.[web:790][web:792][web:796]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
72.9
Routine
44.26
Reasoning
28.64

Rank #48

LLM Judge Avg
3.74
100 Coverage
Avg Task Duration
43.16
Interactive
Token Rate
13.35
Output Rate
P95 Latency
96
Top 5 %
Total Tokens
57400
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 57400 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemma 4 12B Instruct (Unsloth, Q6_K_XL) — Instruct-Profil Bestes Modell Ø Alle Modelle
Code Quality 79.2
CLI Benchmark 92.22
Logical Reasoning 65.41
UX Writing 68.45
Documentation 62.41
Content Transform. 71.97
Cultural Intelligence 78
Synthesis Quality 60
Tool Execution 90
ToolUse Score 75.17
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil