DeepSeek-V4.1-Flash (EXL3) (Thinking)
Im Anlesen acht, im Schreiben sechzehn der 552 Milliarden Backbone-Parameter aktiv: DeepSeek-V4.1-Flash verschiebt Rechenlast dorthin, wo Agenten sie am häufigsten berühren. Diese Karte beschreibt ein Community-Quant als EXL3-Variante des offiziellen MIT-lizenzierten Modells vom 10. September 2026 — multimodal für Text und Bild, eine Million Tokens Kontext, dank Quantisierung auf geteiltem Serverspeicher betreibbar.
- Open Weights
- Server
- vLLM
- Text
- Vision
- Long Context
- Speculative Decoding
- Community-Quantisierung
- Batch
Sovereign Risk: MEDIUM Das Modell wurde von DeepSeek entwickelt, einem Unternehmen mit Sitz in China. Die chinesische Gerichtsbarkeit unterliegt Gesetzen, die staatlichen Zugriff auf Daten ermöglichen können, was bei Cloud-Diensten ein hohes Risiko darstellt. Da es sich hier jedoch um ein Open-Weight-Modell unter einer MIT-Lizenz handelt, das für den lokalen Betrieb vorgesehen ist, ist das Risiko für den Endanwender deutlich reduziert. Bei einer rein lokalen Ausführung werden keine Daten an den Hersteller oder Dritte übermittelt. Das ‘mittlere’ Risiko spiegelt den potenziellen Einfluss der Herkunftsjurisdiktion auf die Trainingsdaten und die Modellentwicklung wider, während das direkte Datenabflussrisiko bei lokaler Nutzung als gering eingeschätzt wird. Zusätzlich handelt es sich um einen Community-Quant (Re-Quantisierung durch Dritte), nicht um ein offizielles DeepSeek-Release; die Provenienz des Quants ist unabhängig von den MIT-lizenzierten Originalgewichten zu betrachten.
Schlüsselmetriken
Score · Latenz · Kosten · Qualität
- Total Score Silver
- 74.51
- Routine
- 45.23
- Reasoning
- 29.28
- LLM Judge Avg
- 3.65 / 5
- 100 Coverage
- Avg Task Duration
- 98.95s
- Batch
- Token Rate
- 30.46tok/s
- Output Rate
- P95 Latency
- 225.57s
- Top 5 %
- Total Tokens
- 174700
- Output Volume
- Cost per 1K
- $0
- USD / 1K Requests
- Benchmark Cost
- $0
- Total · 174700 tok
Benchmark-Module
10 Module · gewichtet · vs. Modellmedian & Spitzenreiter
Token-Effizienz & Latenz
Verbrauch pro Modul vs. Modellmedian