Gemma 4 E4B

Was die meisten Edge-Modelle nicht können: Text, Bild, Audio und Video in einem einzigen Gewichtspaket verarbeiten, ohne separate Multimodal-Projektor-Datei. Gemma 4 E4B nutzt Per-Layer-Embeddings für 4,5 Milliarden effektive Parameter und läuft mit rund 5 Gigabyte VRAM auf Edge-Hardware. Konfigurierbare Thinking-Modi und 128.000-Token-Kontext unter Apache-2.0-Lizenz runden das Profil ab.

Google Version 4 Kommerzielle Nutzung erlaubt Dense 4.5 B (4.5 B aktiv) 128 K Context 01/2025 local getestet

  • Open Weights
  • Edge
  • M4APL
  • Text
  • Vision
  • Audio
  • Video
  • Instruction-Tuned
  • Interactive

Sovereign Risk: LOW Google DeepMind ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act, der primär bei API-/Cloud-Nutzung relevant ist, nicht bei lokal betriebenen Gewichten. Bei ausschliesslich lokaler Inferenz ohne Cloud-Verbindung ist das Risikoszenario minimal.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
71.89
Routine
43.16
Reasoning
28.73

Rank #53

LLM Judge Avg
3.56
100 Coverage
Avg Task Duration
25.35
Interactive
Token Rate
48.21
Output Rate
P95 Latency
54.27
Top 5 %
Total Tokens
97900
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 97900 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemma 4 E4B Bestes Modell Ø Alle Modelle
Code Quality 71
CLI Benchmark 81.12
Logical Reasoning 70.89
UX Writing 70.65
Documentation 64.71
Content Transform. 72.58
Cultural Intelligence 75.6
Synthesis Quality 56.67
Tool Execution 90
ToolUse Score 73.17
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil