DeepSeek-V4.1-Flash (EXL3) (Thinking)

Im Anlesen acht, im Schreiben sechzehn der 552 Milliarden Backbone-Parameter aktiv: DeepSeek-V4.1-Flash verschiebt Rechenlast dorthin, wo Agenten sie am häufigsten berühren. Diese Karte beschreibt ein Community-Quant als EXL3-Variante des offiziellen MIT-lizenzierten Modells vom 10. September 2026 — multimodal für Text und Bild, eine Million Tokens Kontext, dank Quantisierung auf geteiltem Serverspeicher betreibbar.

DeepSeek Version 4.1-Flash Kommerzielle Nutzung erlaubt MoE 763 B (16 B aktiv) 1024 K Context local getestet

  • Open Weights
  • Server
  • vLLM
  • Text
  • Vision
  • Long Context
  • Speculative Decoding
  • Community-Quantisierung
  • Batch

Sovereign Risk: MEDIUM Das Modell wurde von DeepSeek entwickelt, einem Unternehmen mit Sitz in China. Die chinesische Gerichtsbarkeit unterliegt Gesetzen, die staatlichen Zugriff auf Daten ermöglichen können, was bei Cloud-Diensten ein hohes Risiko darstellt. Da es sich hier jedoch um ein Open-Weight-Modell unter einer MIT-Lizenz handelt, das für den lokalen Betrieb vorgesehen ist, ist das Risiko für den Endanwender deutlich reduziert. Bei einer rein lokalen Ausführung werden keine Daten an den Hersteller oder Dritte übermittelt. Das ‘mittlere’ Risiko spiegelt den potenziellen Einfluss der Herkunftsjurisdiktion auf die Trainingsdaten und die Modellentwicklung wider, während das direkte Datenabflussrisiko bei lokaler Nutzung als gering eingeschätzt wird. Zusätzlich handelt es sich um einen Community-Quant (Re-Quantisierung durch Dritte), nicht um ein offizielles DeepSeek-Release; die Provenienz des Quants ist unabhängig von den MIT-lizenzierten Originalgewichten zu betrachten.

Schlüsselmetriken

Score · Latenz · Kosten · Qualität

Total Score Silver
74.51
Routine
45.23
Reasoning
29.28

Rank #42

LLM Judge Avg
3.65
100 Coverage
Avg Task Duration
98.95
Batch
Token Rate
30.46
Output Rate
P95 Latency
225.57
Top 5 %
Total Tokens
174700
Output Volume
Cost per 1K
$0
USD / 1K Requests
Benchmark Cost
$0
Total · 174700 tok

Benchmark-Module

10 Module · gewichtet · vs. Modellmedian & Spitzenreiter

DeepSeek-V4.1-Flash (EXL3) (Thinking) Bestes Modell Ø Alle Modelle
Code Quality 78.24
CLI Benchmark 78
Logical Reasoning 68.13
UX Writing 65.99
Documentation 72.62
Content Transform. 79.56
Cultural Intelligence 77.44
Synthesis Quality 66.67
Tool Execution 90
ToolUse Score 77.83
Benchmark Cost $0

Token-Effizienz & Latenz

Verbrauch pro Modul vs. Modellmedian

Token-Verbrauch pro Modul

Performance-Profil