Gemma 4 12B Instruct (Unsloth, Q6_K_XL)

Eine Q6_K_XL-GGUF-Distribution von Gemma 4 12B Instruct für lokales Deployment: 12 Milliarden dichte Parameter, encoder-freie Unified-Multimodal-Architektur mit Text-, Bild-, Audio- und Video-Input. Apache-2.0-Lizenz, 256.000 Tokens Kontext, kompakter als Q4-Varianten bei moderatem Mehrspeicher. Audio- und Video-Unterstützung hängen lokal vom passenden Multimodal-Projektor ab.

Google Version 4 Kommerzielle Nutzung erlaubt Dense 12 B (12 B aktiv) 256 K Context 01/2025 local getestet

  • Open Weights
  • Desktop
  • llama.cpp
  • Text
  • Vision
  • Audio
  • Video
  • Instruction-Tuned
  • Batch

Sovereign Risk: LOW Die Basisgewichte stammen von Google DeepMind und sind unter Apache 2.0 veröffentlicht. Diese Karte beschreibt eine lokale Unsloth-GGUF-Distribution; die Inferenz läuft ohne Cloud-Verbindung und ohne externen Datentransfer. Das CLOUD-Act-Risiko betrifft primär Cloud-/API-Nutzung, nicht den rein lokalen Betrieb.[web:790][web:792][web:796]

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
72.66
Routine
44.13
Reasoning
28.53

Rank #52

LLM Judge Avg
3.69
100 Coverage
Avg Task Duration
113.84
Batch
Token Rate
16.61
Output Rate
P95 Latency
245.24
Top 5 %
Total Tokens
123500
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 123500 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemma 4 12B Instruct (Unsloth, Q6_K_XL) Bestes Modell Ø Alle Modelle
Code Quality 74.8
CLI Benchmark 85.56
Logical Reasoning 67.65
UX Writing 71.75
Documentation 63.89
Content Transform. 75.21
Cultural Intelligence 77.6
Synthesis Quality 56.67
Tool Execution 88.33
ToolUse Score 71.29
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil