Gemini 3.8 Flash

Gemini 3.8 Flash ist Googles intelligentestes Flash-Modell (GA seit 2. September 2026), gebaut auf 3.7 Flash für Long-Horizon-Software-Engineering, autonome Agenten und komplexe Unternehmens-Workflows. Drei Thinking-Levels (low, medium, high, Standard medium) steuern die Reasoning-Tiefe; eine Million Tokens Kontext und 65.536 Output-Tokens fassen ganze Repositorys in einer Anfrage. Intro-Preis 0,75 / 3,75 USD pro Million Tokens bis Jahresende, danach 1,50 / 7,50.

Google Version 3.8 Kommerzielle Nutzung erlaubt Dense 1000 K Context $0.75 / $3.75 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Real-Time

Sovereign Risk: MEDIUM Das Modell wird von einem US-amerikanischen Unternehmen entwickelt und gehostet. Aufgrund der US-Jurisdiktion unterliegt es potenziell dem CLOUD Act, was ein mittleres Risiko für den Datenzugriff durch US-Behörden darstellt. Da die Gewichte proprietär und nicht verteilt sind, besteht kein zusätzliches Risiko durch Weitergabe der Gewichte selbst.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.39
First Request
MCP
1.18
Protocol Latency
Synthesis
8.58
Response Generation
Total
78.9
Sum of All Phases
Token
11911
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, aber die Tool-Call-Validität nicht durchgängig sauber war und die Synthesetreue bei aktueller Recherche nicht stabil genug wirkt. Der kombinierte Wert ist gut, aber für produktive MCP-Pipelines zählt hier die Vertrauenskante mehr als der Mittelwert.

Tool-Execution-Profil

Gemini 3.8 Flash zeigt echte Werkzeugintelligenz, nicht nur starres Musterverhalten. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis die Wahl zwischen Suche und direktem Abruf prüft, wählt es das richtige Werkzeug sicher. Das spricht für belastbare Orchestrierungsfähigkeit in dynamischen Pipelines. Beim Test URL Construction & Fetch, der die Ableitung einer Ziel-URL aus Eigenwissen und den anschließenden Abruf misst, bleibt es brauchbar, aber nicht deterministisch genug. Genau dort liegt das praktische Risiko: nicht bei der Frage, ob es Tools nutzen will, sondern ob der konkrete Call in jeder Variante MCP-konform und reproduzierbar ausfällt. Dass Tool-Call valide insgesamt auf false steht, ist für produktive Verkettungen ein klarer Warnhinweis.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht belastbar präzise. Die starke Leistung bei HTTP Fetch & Extract zeigt, dass es strukturierte Inhalte aus abgerufenem Material gut extrahieren und zusammenziehen kann. Der Gesamtwert in P2 ist dennoch nur mittig, weil die Verdichtung bei wissensnahen Recherchen an Schärfe verliert.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Nicht zuverlässig genug. Beim Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, fällt die Synthese mit P2 40 deutlich ab. Es halluziniert nicht offen, aber es gibt auch kein starkes Vertrauenssignal, dass die Antwort strikt an den abgerufenen Quellen verankert bleibt. Für Compliance-, Legal- und Policy-Pipelines ist das zu schwach.

Fehlerresilienz

Beim 404-Test, der transparentes Verhalten bei einem fehlschlagenden Tool-Aufruf prüft, reagiert das Modell produktionsgerecht. Es erfindet keinen Seiteninhalt und bleibt bei der Fehlerkommunikation sauber. Das ist akzeptabel für den Betrieb, weil ein Pipeline-Controller mit solchen Antworten zuverlässig weiterarbeiten kann.

Betriebsprofil

Call 1: 3.39s. Call 2: 8.58s. MCP-Latenz: 1.18s. Total: 78.90s.
Für ein Flash-Modell ist das im End-to-End-Lauf langsam.
Preis: $0.75/1M Input, $3.75/1M Output, Web-Search separat.
Kostenbild: günstig pro Token, aber nicht günstig pro komplexem Agentenlauf.

Fazit & Empfehlung

Geeignet für agentische Recherche- und Retrieval-Pipelines, in denen Tool-Wahl, Suchstrategie und saubere Fehlerbehandlung wichtiger sind als hochpräzise, rechts- oder compliance-feste Endverdichtung. Nicht die erste Wahl für MCP-Strecken mit strikten Anforderungen an aktuelle Faktentreue, zitierbare Policy-Aussagen oder deterministische Tool-Calls. Deploy nur mit Guardrails: Tool-Output-Logging, Schema-Validierung, URL- und Call-Checks sowie nachgelagerter Verifikation vor jeder extern wirksamen Antwort.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.