Gemma 4 31B Instruct

Gemma 4 31B Instruct ist Googles größtes Dense-Modell mit 30,7 Milliarden Parametern über 60 Layer und hybrider Attention aus lokalem Sliding-Window plus globaler Aufmerksamkeit. Anders als die Gemma-4-MoE-Variante aktiviert dieses Modell alle Parameter pro Token. Multimodalität für Text und Bilder, 256.000 Tokens Kontext, natives Function-Calling und konfigurierbarer Thinking-Modus runden das Profil ab. Echte Apache-2.0-Lizenz.

Google Version 4 Kommerzielle Nutzung erlaubt Dense 30.7 B (30.7 B aktiv) 256 K Context 01/2025 local getestet

  • Open Weights
  • Workstation
  • VSPK
  • Text
  • Vision
  • Instruction-Tuned
  • Batch

Sovereign Risk: MEDIUM Google DeepMind ist ein US-Unternehmen, daher besteht bei Cloud-/API-Nutzung (Google Cloud, Vertex AI, OpenRouter) US-CLOUD-Act-Exposition. Gemma 4 wurde als erste Gemma-Generation unter echter Apache-2.0-Lizenz veröffentlicht (kein restriktives Gemma-Terms-of-Use mehr), was uneingeschränktes Fine-Tuning und kommerzielle Nutzung erlaubt. Bei rein lokalem Betrieb über llama.cpp/GGUF/NVFP4 entfällt die CLOUD-Act-Relevanz vollständig, da keine Datenübertragung an Google erfolgt. Offizielle Weights direkt auf Hugging Face verfügbar.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
75.15
Routine
45.52
Reasoning
29.63

Rank #17

LLM Judge Avg
3.81
100 Coverage
Avg Task Duration
52.56
Batch
Token Rate
16.86
Output Rate
P95 Latency
134.95
Top 5 %
Total Tokens
54200
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 54200 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemma 4 31B Instruct Bestes Modell Ø Alle Modelle
Code Quality 73.7
CLI Benchmark 86.67
Logical Reasoning 75
UX Writing 72.45
Documentation 71.66
Content Transform. 78.87
Cultural Intelligence 79.16
Synthesis Quality 49.17
Tool Execution 90
ToolUse Score 69.42
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil