DeepSeek V4 Flash

DeepSeek V4 Flash ist die effizienzoptimierte Variante aus der V4-Familie: Hybrid-Attention-MoE mit 284 Milliarden Gesamtparametern, von denen pro Token nur 13 Milliarden aktiv sind. Das Modell arbeitet mit einem Kontextfenster von einer Million Tokens, unterstützt drei Reasoning-Modi und ist unter MIT-Lizenz als Open-Weight-Modell lokal betreibbar. Die chinesische Hersteller-Jurisdiktion erfordert bei Cloud-Nutzung eine separate Bewertung.

DeepSeek Version 4 Kommerzielle Nutzung erlaubt MoE 284 B (13 B aktiv) 1000 K Context 05/2025 $0.14 / $0.28 per 1M

  • Open Weights
  • Frontier
  • OR
  • Text
  • Long Context
  • Real-Time

Sovereign Risk: HIGH DeepSeek ist ein chinesisches Unternehmen und unterliegt dem chinesischen National Security Law (NSL), das staatlichen Zugriff auf Daten und Modelle ermöglichen kann. Das BSI hat am 04.02.2025 explizit vor dem Einsatz des DeepSeek-Cloud-Dienstes gewarnt: Nutzerdaten werden auf chinesischen Servern gespeichert; eine Nutzung für dienstliche oder sensible Daten wird nicht empfohlen. Für den Cloud-API-Betrieb gilt diese Warnung uneingeschränkt.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
3.37
First Request
MCP
1.19
Protocol Latency
Synthesis
6.24
Response Generation
Total
64.78
Sum of All Phases
Token
5100
Input + Output
Cost
$0.0009
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

· Long Context

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung verlässlich und protokollsauber ist, die Synthese aber nicht konstant präzise genug für hochkritische Ausgabepfade ausfällt. Das Gesamtbild ist mit validen Tool-Calls, keiner Halluzination und solidem Combined-Score produktionsfähig, aber nicht ohne Guardrails.

Tool-Execution-Profil

DeepSeek V4 Flash zeigt echte Werkzeugintelligenz statt bloßem Schema-Folgen. Beim Web-Search-and-Tool-Selection-Test, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, trifft es die richtige Entscheidung vollständig. Das spricht für brauchbare Situationsdiagnose in dynamischen MCP-Pipelines. Beim URL-Construction-Test, der die Ableitung einer Ziel-URL aus eigenem Wissen plus anschließendes Fetch misst, bleibt es brauchbar, aber nicht deterministisch genug. P1 80 heißt hier: Es kann die Strecke oft korrekt schließen, ist aber nicht präzise genug für fragile URL-Schemata oder harte Automationspfade. Wichtig ist, dass die Tool-Calls valide waren und kein Retry nötig war. Das ist ein gutes Signal für Protokollkonformität und reduziert operativen Aufwand in der Orchestrierung.

Synthesetreue

Wie gut verdichtet es Tool-Ergebnisse? Solide, aber nicht stark. P2 66.67 und die Ausschläge zwischen HTTP Fetch & Extract mit 80 und EU License Research mit 40 zeigen, dass das Modell gefundene Informationen meist brauchbar zusammenzieht, jedoch nicht konsistent sauber priorisiert, verifiziert und komprimiert. Für Nutzerantworten ist das akzeptabel. Für Compliance, Policy oder andere textkritische Endausgaben ist es zu schwankend.

Bleibt es im Tool-Ergebnis oder weicht es auf Training aus? Überwiegend ja, und das ist der wichtigere Befund. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen statt aus dem Training beantwortet werden, wurde keine Halluzination erkannt. Das Vertrauenssignal ist damit besser als der niedrige P2-Wert vermuten lässt. Das Modell driftet also eher in schwächere Verdichtung als in erfundene Fakten.

Fehlerresilienz

Beim 404-Test, der transparentes Verhalten bei einem fehlschlagenden Tool-Call misst, reagiert das Modell produktionsgerecht. Es halluziniert keinen Seiteninhalt trotz Fehler und kommuniziert den Ausfall nachvollziehbar. Genau dieses Verhalten braucht eine Tool-Pipeline: Fehler offenlegen, nicht kaschieren.

Betriebsprofil

Call 1: 3.37s. MCP-Latenz: 1.19s. Call 2: 6.24s. Total: 64.78s.
Kosten pro Run: 0.000895.
Direkte Einordnung: günstig, aber für einen Flash-Ableger im End-to-End-Lauf nicht schnell. Das Preisniveau ist klar produktionsfreundlich. Die Gesamtlaufzeit ist nur dann akzeptabel, wenn die Pipeline nicht interaktiv unter enger Latenzgrenze steht.

Fazit & Empfehlung

Geeignet für recherchegestützte MCP-Pipelines mit Tool-Zwang, Fehlertoleranz und nachgelagerter Validierung. Dazu zählen Web-Recherche, mehrstufige Informationsbeschaffung und mehrsprachige Voranalysen. Nicht die erste Wahl für Compliance-nahe Endausgaben, regulatorische Zusammenfassungen oder andere Pfade, in denen die Verdichtung selbst belastbar und nahezu revisionsfest sein muss. Wenn Sie ein günstiges Modell suchen, dem Sie Tools anvertrauen können, ist es ein brauchbarer Worker. Wenn Sie der finalen Formulierung ohne zweite Prüfung vertrauen müssen, reicht es nicht.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT 4.5 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.