Gemini 3.5 Flash Lite

Mit 350 Output-Tokens pro Sekunde ist Gemini 3.5 Flash-Lite das schnellste Modell von Googles 3.5-Serie, seit dem 21. Juli 2026 allgemein verfügbar. Es zielt auf hochvolumige, latenzsensitive Workloads: Übersetzung, Klassifikation und leichte agentische Aufgaben bei 0,30 / 2,50 USD pro Million Tokens. Eine Million Tokens Kontext, multimodaler Input aus Text, Bild, Video und Audio, native Tool-Unterstützung. Harte Reasoning-Aufgaben sind nicht seine Domäne.

Google Version 3.5 Kommerzielle Nutzung erlaubt Dense 1049 K Context $0.3 / $2.5 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Video
  • Audio
  • Real-Time

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
1.65
First Request
MCP
1.16
Protocol Latency
Synthesis
1.87
Response Generation
Total
28.06
Sum of All Phases
Token
9852
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist, aber die Synthesetreue mit Combined 73.88 nur dann tragfähig ist, wenn nachgelagerte Validierung die Ergebnisverdichtung absichert. Halluzination wurde nicht erkannt, aber der Tool-Call war nicht durchgehend valide.

Tool-Execution-Profil

Gemini 3.5 Flash Lite arbeitet grundsätzlich agentisch brauchbar. P1 88.33 zeigt, dass es MCP-gestützte Abläufe meist korrekt anstößt. Besonders stark ist es beim Web Search & Tool Selection-Test, der prüft, ob ohne Hinweis search statt fetch gewählt werden muss: P1 95. Das spricht für echte Werkzeugwahl statt starrem Muster. Beim URL-Construction-Test, der die korrekte Ziel-URL aus eigenem Wissen ableiten und dann fetch ausführen soll, fällt es auf P1 80 zurück. Es kann also Werkzeuge intelligent auswählen, ist aber weniger deterministisch, wenn es erst die Zieladresse selbst konstruieren muss. Für produktive Pipelines heißt das: Discovery gut, präzise Adressbildung nur mit Guardrails. Kritisch bleibt, dass der Tool-Call nicht vollständig valide war. Das ist kein Totalausfall, aber ein Integrationssignal für strikte Schema-Prüfung und Tool-Wrapper.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Nur mittel. P2 60 ist der klare Schwachpunkt dieses Laufs. Das Modell extrahiert und kombiniert Ergebnisse oft brauchbar, aber nicht präzise genug für Compliance-, Policy- oder andere textkritische Workflows. Die Schwäche zeigt sich besonders bei EU License Research und Multilingual Search & Synthesis mit jeweils P2 40, also gerade dort, wo Quelltreue über Sprach- oder Aktualitätsgrenzen hinweg zählt.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, wurde keine Halluzination erkannt. Das ist der zentrale Vertrauenspunkt. Trotzdem ist P2 40 ein Warnsignal: Es erfindet nichts, verdichtet das beschaffte Material aber zu unscharf, um regulatorische Aussagen ohne Kontrolle freizugeben.

Fehlerresilienz

Beim 404-Test, der transparentes Verhalten bei fehlschlagendem Tool-Call misst, hat das Modell keinen Ersatzinhalt halluziniert. Das ist für Produktion akzeptabel. P2 60 zeigt jedoch, dass die Fehlerkommunikation eher ausreichend als sauber ist. Für robuste Pipelines ist das tragbar, solange der Orchestrator Fehlerzustände selbst sichtbar macht und nicht nur auf die Modellformulierung vertraut.

Betriebsprofil

Total 28.06s. Einzelaufrufe 1.65s und 1.87s. MCP-Latenz 1.16s. Schnell auf Call-Ebene, aber kein kurzer End-to-End-Run. Preis: local. Für die gezeigte Leistung kostenseitig unkritisch.

Fazit & Empfehlung

Geeignet für volumenstarke Agentik mit Suche, Fetch, Vorstrukturierung und transparenter Fehlerbehandlung. Nicht geeignet als alleinige letzte Instanz für Compliance, Lizenzprüfung, mehrsprachige Evidenzsynthese oder andere Pipelines, in denen die textliche Verdichtung selbst entscheidungsrelevant ist. Deploy sinnvoll als schneller Tool-Operator mit strenger Output-Validierung, Schema-Enforcement und optionalem Second-Pass durch ein präziseres Modell.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.