Gemini 3.7 Flash

Gemini 3.7 Flash ist ein schnelles, kosteneffizientes und hochskalierbares multimodales Modell von Google. Es wurde für Aufgaben mit hoher Frequenz und geringer Latenz entwickelt und verfügt über ein Kontextfenster von einer Million Token. Das Modell verarbeitet Text, Bilder, Audio sowie Video und unterstützt die Nutzung externer Tools, was es vielseitig für Agenten-Anwendungen macht.

Google Version 3.7-flash Kommerzielle Nutzung erlaubt MoE 1000 K Context 01/2025

  • Proprietär
  • Frontier
  • OpenRouter
  • Text
  • Vision
  • Audio
  • Video
  • Agentic Orchestrator
  • Real-Time

Sovereign Risk: MEDIUM Google DeepMind ist ein US-amerikanisches Unternehmen und unterliegt dem CLOUD Act; die Modellgewichte sind nicht öffentlich zugänglich.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
2.08
First Request
MCP
1.07
Protocol Latency
Synthesis
5.44
Response Generation
Total
51.49
Sum of All Phases
Token
11096
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

Erstellt am · Agentic Orchestrator

Deployment-Urteil

Bedingt deploy, weil die Tool-Ausführung stark ist und keine Halluzination erkannt wurde, aber die Tool-Calls nicht durchgängig valide waren und die Synthese für produktionskritische Auswertung zu ungleichmäßig bleibt.

Tool-Execution-Profil

Das Modell zeigt echte Werkzeugwahl statt blindem Standardmuster. Beim Test Web Search & Tool Selection, der ohne expliziten Hinweis prüft, ob web_search statt fetch nötig ist, wählt es das richtige Werkzeug konsequent. Das spricht für brauchbare Orchestrierungsintelligenz in dynamischen MCP-Pipelines. Auch bei Multilingual Search & Synthesis und EU License Research ruft es externe Quellen aktiv ab, statt vorschnell aus Vorwissen zu antworten.

Die Schwäche liegt nicht in der Entscheidung für Tools, sondern in der operativen Präzision einzelner Calls. Beim URL-Construction-Test, der korrekte Ziel-URL plus anschließenden Fetch verlangt, war die Ausführung nur brauchbar, nicht deterministisch genug. Das passt zum Befund tool_call_valid=false: Das Modell versteht die Pipeline, arbeitet aber nicht auf jedem Schritt protokollsicher. Für produktive Systeme heißt das: gute Kandidatur als Agenten-Front-End, aber nur mit Guardrails, Schema-Validierung und enger Tool-Call-Kontrolle.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht belastbar auf hohem Präzisionsniveau. Die P2-Leistung von 70 zeigt: Es fasst Treffer verwertbar zusammen, verliert dabei jedoch Struktur und Genauigkeit, sobald mehrere Quellen oder mehrsprachige Inputs verdichtet werden müssen. Das sieht man auch daran, dass mehrere Recherche-Assets bei starker Tool-Nutzung nur auf mittlere Synthesequalität kommen.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Hier ist das Signal besser. Beim Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen wirklich aus Web-Quellen geholt werden, wurde keine Halluzination erkannt. Das Vertrauensurteil ist daher positiv, aber nicht maximal: Es bleibt grundsätzlich an den eingeholten Quellen, verdichtet diese jedoch nicht immer mit der Präzision, die für Compliance- oder Policy-Pipelines nötig wäre.

Fehlerresilienz

Akzeptabel für Produktion. Beim 404-Test, der prüft, ob ein Modell bei Tool-Fehlern transparent bleibt statt Seiteninhalt zu erfinden, kommuniziert Gemini 3.7 Flash den Fehlschlag ohne halluzinierten Ersatzinhalt. Das ist ein harter positiver Befund. Fehler werden als Fehler behandelt, nicht überdeckt.

Betriebsprofil

Total 51.49s pro Run. Einzelaufrufe 2.08s und 5.44s. MCP-Latenz 1.07s. Schnell auf Call-Ebene, aber als End-to-End-Run nicht kurz. Kosten/Run: local.

Fazit & Empfehlung

Geeignet für MCP-gestützte Recherche-, Routing- und Agentenpipelines, in denen Tool-Wahl wichtiger ist als hochwertige Endverdichtung. Weniger geeignet für Compliance, regulatorische Zusammenfassungen oder andere Workflows, in denen die Antwort selbst als belastbares Endprodukt dienen muss. Deploy nur mit strikter Tool-Call-Validierung, Antwortschema und nachgelagerter Prüfung der Synthese.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.