Gemini 3.5 Flash Lite

Mit 350 Output-Tokens pro Sekunde ist Gemini 3.5 Flash-Lite das schnellste Modell von Googles 3.5-Serie, seit dem 21. Juli 2026 allgemein verfügbar. Es zielt auf hochvolumige, latenzsensitive Workloads: Übersetzung, Klassifikation und leichte agentische Aufgaben bei 0,30 / 2,50 USD pro Million Tokens. Eine Million Tokens Kontext, multimodaler Input aus Text, Bild, Video und Audio, native Tool-Unterstützung. Harte Reasoning-Aufgaben sind nicht seine Domäne.

Google Version 3.5 Kommerzielle Nutzung erlaubt Dense 1049 K Context $0.3 / $2.5 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Real-Time

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
72.52
Routine
43.48
Reasoning
29.04

Rank #66

LLM Judge Avg
3.7
100 Coverage
Avg Task Duration
3.05
Real-Time
Token Rate
163.86
Output Rate
P95 Latency
6.04
Top 5 %
Total Tokens
56500
Output Volume
Cost per 1K
$0.0025
USD / 1K Requests
Benchmark Cost
$0.14
Total · 56500 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

Gemini 3.5 Flash Lite Bestes Modell Ø Alle Modelle
Code Quality 66.12
CLI Benchmark 84.34
Logical Reasoning 77.01
UX Writing 69.13
Documentation 66.18
Content Transform. 74.89
Cultural Intelligence 74.52
Synthesis Quality 60
Tool Execution 88.33
ToolUse Score 73.88
Benchmark Cost $0.14

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil