DeepSeek-V4.1-Flash (EXL3) (Thinking)

Im Anlesen acht, im Schreiben sechzehn der 552 Milliarden Backbone-Parameter aktiv: DeepSeek-V4.1-Flash verschiebt Rechenlast dorthin, wo Agenten sie am häufigsten berühren. Diese Karte beschreibt ein Community-Quant als EXL3-Variante des offiziellen MIT-lizenzierten Modells vom 10. September 2026 — multimodal für Text und Bild, eine Million Tokens Kontext, dank Quantisierung auf geteiltem Serverspeicher betreibbar.

DeepSeek Version 4.1-Flash Kommerzielle Nutzung erlaubt MoE 763 B (16 B aktiv) 1024 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Long Context
  • Speculative Decoding
  • Community-Quantisierung
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von DeepSeek entwickelt, einem Unternehmen mit Sitz in China. Die chinesische Gerichtsbarkeit unterliegt Gesetzen, die staatlichen Zugriff auf Daten ermöglichen können, was bei Cloud-Diensten ein hohes Risiko darstellt. Da es sich hier jedoch um ein Open-Weight-Modell unter einer MIT-Lizenz handelt, das für den lokalen Betrieb vorgesehen ist, ist das Risiko für den Endanwender deutlich reduziert. Bei einer rein lokalen Ausführung werden keine Daten an den Hersteller oder Dritte übermittelt. Das ‘mittlere’ Risiko spiegelt den potenziellen Einfluss der Herkunftsjurisdiktion auf die Trainingsdaten und die Modellentwicklung wider, während das direkte Datenabflussrisiko bei lokaler Nutzung als gering eingeschätzt wird. Zusätzlich handelt es sich um einen Community-Quant (Re-Quantisierung durch Dritte), nicht um ein offizielles DeepSeek-Release; die Provenienz des Quants ist unabhängig von den MIT-lizenzierten Originalgewichten zu betrachten.

Tool-Use-Profil: 6 Assets im Detail

Vergleich der Asset-Performance (P1/P2/Combined) gegenüber dem Flotten-Durchschnitt

Asset-Performance (Radar)

Score Breakdown vs. Fleet Average


Tool-Use-Details

Asset-Performance, Zuverlässigkeit und Laufzeit-Profil

CrucibleMark prüft Tool-Use in 6 voneinander unabhängigen Tests. Klicken Sie auf einen Test-Namen für die Details.

Reliability

  • Tool Call Valid: Nein
  • Retry: Nicht erforderlich
  • Halluzination: Nicht erkannt

Reliability misst, wie verlässlich ein Modell Werkzeugaufrufe tatsächlich ausführt: Tool Call Valid Schema und Format akzeptiert, Retry Required erst nach Wiederholung erfolgreich, Halluzination Flag erfundene Tools oder Parameter erkannt. Alle drei grün bedeutet produktionstauglich.

Betriebsprofil

Call 1
7.19
First Request
MCP
1.21
Protocol Latency
Synthesis
63.1
Response Generation
Total
429.02
Sum of All Phases
Token
20923
Input + Output
Cost
$0
Cost per Run

Das Betriebsprofil zeigt die Laufzeit- und Kostenkennzahlen des Modell-Laufs: Call 1 First Request, MCP Protocol Latency, Synthesis Response Generation, Total Summe aller Phasen, erganzt um Token Input und Output sowie Cost Kosten pro Lauf.

Tool-Use-Review

· Long Context · Speculative Decoding · Community-Quantisierung

Deployment-Urteil

Bedingt deploy, weil die Tool-Nutzung stark ist, aber die MCP-Calls nicht durchgängig valide sind und die Verdichtung der Tool-Ergebnisse für produktionsnahe Entscheidungen zu unpräzise bleibt.

Tool-Execution-Profil

Das Modell zeigt echte Werkzeugintelligenz. Im Test Web Search & Tool Selection, der prüft, ob ohne Hinweis web_search statt fetch gewählt wird, erkennt es den richtigen Zugriffspfad zuverlässig. Das spricht gegen starres Musterverhalten und für brauchbare Orchestrierungskompetenz. Auch EU License Research und Multilingual Search & Synthesis laufen auf P1-Niveau sauber.

Schwächer ist die Ausführung bei direkter Zieladressierung. Beim URL-Construction-Test konstruiert es die Ziel-URL brauchbar, aber nicht präzise genug für deterministische Pipelines. Dass Tool-Call valide insgesamt auf false steht, ist der eigentliche Produktionsvorbehalt: Die Planungslogik ist stark, die Protokolltreue nicht durchgehend. Für MCP-Pipelines mit striktem Schema-Parsing braucht es deshalb ein enges Call-Validation-Layer vor der Ausführung. Retry war nicht erforderlich, also liegt das Problem eher in Call-Genauigkeit als in grundlegendem Missverständnis.

Synthesetreue

Wie gut verdichtet es? Nur ordentlich. Die P2-Leistung zeigt, dass das Modell Tool-Ergebnisse verwertbar zusammenzieht, aber nicht mit der Präzision, die man für Compliance-, Recherche- oder Faktenpipelines erwarten sollte. Das sieht man konsistent an HTTP Fetch & Extract, URL Construction & Fetch und EU License Research, die jeweils auf 60 in der Verdichtung landen. Es extrahiert also genug für Arbeitsfortschritt, aber nicht genug für belastbare Endantworten ohne nachgelagerte Prüfung.

Bleibt es im Tool-Ergebnis? Überwiegend ja. Im Honeypot EU License Research, der prüft, ob aktuelle Lizenzrestriktionen aus Web-Quellen geholt statt aus dem Training beantwortet werden, wurde keine Halluzination erkannt. Das ist das wichtigere Vertrauenssignal. Es zeigt Disziplin gegenüber externer Evidenz, auch wenn die abschließende Zusammenfassung nicht scharf genug formuliert ist.

Fehlerresilienz

Akzeptabel für Produktion. Im 404-Test, der transparenten Umgang mit fehlschlagenden Tool-Calls misst, hat das Modell keinen Ersatzinhalt erfunden. P2=80 ist hier wichtiger als Stilfragen: Es meldet den Fehler statt Seiteninhalt zu halluzinieren. Das erhält die Integrität der Pipeline.

Betriebsprofil

Call 1: 7.19s. Call 2: 63.10s. MCP-Latenz: 1.21s. Total: 429.02s.
Für ein Flash-Modell ist das insgesamt langsam. Kosten pro Run: local. Preislich günstig im Betrieb, zeitlich nur dann vertretbar, wenn lokale Ausführung und großes Kontextfenster wichtiger sind als Durchsatz.

Fazit & Empfehlung

Geeignet für lokal betriebene Agenten-Pipelines mit Recherche, Tool-Auswahl und menschlicher oder programmatischer Nachkontrolle der Endverdichtung. Nicht geeignet als unbeaufsichtigter Endentscheider in Compliance-, Policy- oder Extraktionsstrecken, in denen die Antwort direkt aus Tool-Ergebnissen belastbar formuliert werden muss. Wenn Sie ein lokales Open-Weight-Modell für MCP-Orchestrierung suchen, ist es brauchbar. Wenn Sie einem Modell die Infrastruktur ohne enge Guardrails vollständig übergeben wollen, noch nicht.

Diese Auswertung wurde automatisch auf Grundlage der Benchmark-Daten generiert. Eingesetztes Modell: GPT-5.4 von OpenAI. Die Rohdaten und die vollständige Methodik sind im GitHub-Projekt dokumentiert.