Gemini 3.7 Flash

Gemini 3.7 Flash ist ein schnelles, kosteneffizientes und hochskalierbares multimodales Modell von Google. Es wurde für Aufgaben mit hoher Frequenz und geringer Latenz entwickelt und verfügt über ein Kontextfenster von einer Million Token. Das Modell verarbeitet Text, Bilder, Audio sowie Video und unterstützt die Nutzung externer Tools, was es vielseitig für Agenten-Anwendungen macht.

Google Version 3.7-flash Kommerzielle Nutzung erlaubt MoE 1000 K Context 01/2025 $0.75 / $3.75 per 1M

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Audio
  • Video
  • Agentic Orchestrator
  • Real-Time

Sovereign Risk: MEDIUM Google DeepMind ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act; die Modellgewichte sind nicht öffentlich zugänglich.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.86
First Request
MCP
1.3
Protocol Latency
Synthesis
6.2
Response Generation
Total
62.21
Sum of All Phases
Token
10301
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist und keine Halluzination erkannt wurde, aber die Tool-Calls nicht durchgehend valide waren und die Synthesequalität für vertrauenskritische Pipelines nur ausreichend ausfällt.

Tool-Execution-Profil

Gemini 3.7 Flash zeigt echtes Werkzeugverständnis, nicht nur starres Musterverhalten. Beim Test Web Search & Tool Selection, der prüft, ob ohne expliziten Hinweis search statt fetch gewählt wird, erkennt es den Bedarf korrekt und liefert volle Tool-Execution-Sicherheit. Das spricht für brauchbare Orchestrierungsfähigkeit in dynamischen MCP-Pipelines.

Beim URL-Construction-Test, der die eigenständige Ableitung einer Ziel-URL und anschließendes Fetch prüft, arbeitet es brauchbar, aber nicht deterministisch genug für harte Produktionspfade. P1 bleibt dort sichtbar hinter der Suchauswahl zurück. Das ist ein wichtiges Signal: Das Modell wählt Werkzeuge besser, als es eigenständig Zieladressen konstruiert. Für MCP-Setups mit Suchstufe vor Fetch ist das gut nutzbar. Für Pipelines, die auf präzise, modellgenerierte Endpunkte setzen, braucht es Guardrails. Dass der Tool-Call global nicht durchgehend valide war, bestätigt genau diese Grenze. Retry war nicht erforderlich. Das spricht eher gegen ein Formatproblem und eher für punktuelle Ausführungsschwächen.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht präzise genug für hochwertige Analysten-Ausgaben. Die P2-Leistung von 70 zeigt: Es kann Ergebnisse zusammenziehen und in mehreren Assets brauchbar wiedergeben, verliert aber bei Compliance-nahen und mehrsprachigen Aufgaben an Schärfe. Besonders EU License Research und Multilingual Search & Synthesis fallen in der Verdichtung auf 60 zurück. Für produktive Kurzantworten reicht das. Für belastbare Entscheidungsgrundlagen oft nicht.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus Trainingswissen beantwortet werden, bleibt es vertrauenswürdig genug: keine Halluzination erkannt. Das ist der wichtigere Befund als die nur mittelstarke Verdichtung. Das Modell erfindet hier nichts, auch wenn es die Quelle nicht maximal sauber verdichtet.

Fehlerresilienz

Akzeptabel für Produktion. Im 404-Test, der transparentes Fehlverhalten statt erfundenem Ersatzinhalt misst, halluziniert Gemini 3.7 Flash keinen Seiteninhalt. Die Antwortqualität bleibt mit P2 60 begrenzt, aber das operative Verhalten ist richtig: Fehler werden nicht in scheinbare Fakten umgewandelt. Das ist für Tool-Pipelines entscheidend.

Betriebsprofil

Total 62.21s pro Run. Einzelaufrufe 2.86s und 6.20s. MCP-Latenz 1.30s. Schnell auf Call-Ebene, aber der Gesamtrun ist für ein Flash-Modell lang. Kosten/Run: local.

Fazit & Empfehlung

Geeignet für suchgestützte MCP-Pipelines, Agenten-Orchestrierung, Routing, Vorrecherche und robuste Tool-first-Workflows mit nachgelagerter Validierung. Nicht die erste Wahl für Compliance-Ausgaben, hochwertige Synthese oder deterministische Fetch-Pfade, in denen das Modell selbst präzise URLs oder belastbare Endfassungen liefern muss. Deploy ist sinnvoll, wenn die Infrastruktur Werkzeugwahl belohnt und Ergebnisverdichtung zusätzlich absichert.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.