DeepSeek-V4: So lokal ausführen
Führen Sie DeepSeek-V4-Flash lokal auf Ihrem eigenen Gerät aus!
DeepSeek-V4 ist DeepSeeks neue offene Modellreihe, einschließlich DeepSeek-V4-Pro mit 1,6T Parametern (49B aktiv) und DeepSeek-V4-Flash mit 284B Parametern (13B aktiv). Die Modelle glänzen beim Programmieren, bei agentischen Workflows und beim Chatten mit einem 1M-Kontext Fenster. In dieser Anleitung zeigen wir Ihnen, wie Sie DeepSeek-V4-Flash lokal ausführen: DeepSeek-V4-Flash GGUF
Für verlustfreies DeepSeek verwenden Sie Q8 (UD-Q8_K_XL), was nur 7 GB größer als Q4 (UD-Q4_K_XL) ist. Das verlustfreie 8-Bit-GGUF ist 162 GB und 3-Bit ist 103 GB und kann auf einem 110-GB-RAM Gerät ausgeführt werden. DeepSeek-V4-Flash erreicht 86,2 % auf MMLU-Pro, 88,1 % auf GPQA Diamond und 56,9 % auf Terminal Bench 2.0.
7. Juli: DeepSeek-V4 ist jetzt bereit zum Ausführen! Wir haben außerdem die DeepSeek-V4-Chat-Jinja-Vorlage verbessert und über 4000 Konversationen getestet, um dem offiziellen Baseline-Niveau zu entsprechen.
VerwendungshandbuchAnleitungen zum Ausführen
🦙 llama.cpp-Fehlerbehebungen für die DeepSeek-V4-Implementierung
llama.cpp fügte DeepSeek-V4-Unterstützung in 24162 - wir bemerkten, dass bei der Verwendung eines beliebigen GGUF von einem beliebigen AnbieterMehrturn-Konversationen im Vergleich zur Hugging-Face-Baseline von DS4 nicht gut funktionierten, wenn die KV-Cache-Quantisierung verwendet wurde --cache-type-k/v q8_0 - sie wurde inzwischen behoben und seit dem 7. Juli 2026 in llama.cpp zusammengeführt mit 25202
Konkret führte das Aufrufen von DeepSeek-Quants vor dem Fix dazu, dass overlayotin kinetic academyléléléléulif und nach dem PR "Die Hauptstadt von Frankreich ist Paris." was korrekt ist.
💬 Verbesserungen an der DeepSeek-V4-Chat-Vorlage
Wir haben außerdem die DeepSeek-V4-Chat-Jinja-Vorlage verbessert und über 4000 Konversationen getestet, um dem Goldstandard (offizielles DS4) zu entsprechen.
Wir haben reasoning_effort hinzugefügt, und Sie können max, high auswählen, genau wie beim offiziellen DeepSeek-V4. Wir stellen den korrekten System-Prompt gemäß DS4 voran und haben dem Stil von gpt-oss gefolgt.
Und für Werkzeugaufrufe, reasoning_content wurde für DS4 beibehalten, aber die Jinja-Chat-Vorlage würde sie ausschließen. Wir haben sie wieder hinzugefügt.
Denken deaktivieren, Reasoning-Aufwand ändern
DeepSeek-V4 verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Aufwände, bei denen reasoning_effort kann "high", "max" oder deaktiviert sein.
Um das Denken zu deaktivieren, verwenden Sie --chat-template-kwargs '{"enable_thinking":false}'. Wenn Sie auf Windows Powershell sind, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"
Sie können jetzt auch --reasoning on oder --reasoning off in llama.cpp verwenden!
Für die Anpassung des Reasoning-Aufwands oder um Reasoning zu deaktivieren, verwenden Sie die folgenden Beispiele:
📊 Quantisierungsanalyse
Unsere UD-Q8_K_XL Quant ist vollständig verlustfrei. DeepSeek-V4-Flash ist quantisierungsbewusst trainiert: Der offizielle Checkpoint speichert seine gerouteten Experten (96 % des Modells) nativ in MXFP4 und alles andere in FP8 oder BF16. GGUFs MXFP4 ist genau dieses Format, daher packen wir die Experten bitgenau neu, und FP8 dequantisiert ohne Rundung nach BF16. Wir haben jeden Tensor mit den offiziellen DeepSeek-Gewichten verglichen: Alle 1.328 sind bitidentisch, und es bleibt bei der Inferenz verlustfrei (KL-Divergenz ~0, 100 % Übereinstimmung des Top-Tokens).
Nicht-Unsloth DeepSeek-V4-Flash-GGUFs wurden ohne diese Pfade konvertiert und weichen daher von den offiziellen Gewichten ab. UD-Q4_K_XL behält dieselben bitgenauen Experten bei und quantisiert nur die Nicht-Experten-Tensoren (4 % des Modells) auf Q8_0, sodass es in Größe und Qualität direkt neben Q8 liegt.


Gemessen an den offiziellen Gewichten liegen beide Unsloth-Quants an der Qualitäts-/Größen-Grenze. UD-Q8_K_XL ist der einzige verlustfreie Punkt. UD-Q4_K_XL entspricht anderen gemeinschaftlichen MXFP4-Formaten und ist genauer als die Q4_K-Expertenkonvertierungen, die größer sind und dennoch bei 0,029 KLD landen.

Die nach Layern aufgeschlüsselte Fehlerverteilung zeigt warum. Wenn die nativen MXFP4-Experten beibehalten werden, ergibt sich in jedem Layer 0 % Gewichtsfehler. Konvertierungen, die die Experten auf Q4_K oder IQ2_XXS neu quantisieren, runden fast jedes Gewicht: 5 % für Q4_K, über 30 % für IQ2_XXS.

Wir haben außerdem festgestellt, dass die Verwendung von Q8_0 und F16 für einige Tensoren nicht verlustfrei ist, und es wird noch schlechter, da DeepSeek QAT angewendet hat, damit MXFP4 / FP8 gut funktionieren, sodass wir sie direkt in BF16 belassen mussten. Verwenden Sie daher UD-Q8_K_XL für einen wirklich verlustfreien Quant, und UD-Q4_K_XL wandelt einige der BF16-Elemente nach Q8_0 herunter.
Für vollständige Benchmark-Tabellen von GGUF-Benchmarks siehe hier.
⚙️ Gebrauchsanleitung
DeepSeek-V4-Flash ist kleiner und schneller als DeepSeek-V4-Pro, mit 284B Parametern (13B aktiv) und einem 1M-Kontextfenster. Das Modell hat 3 Modi, Nicht denken, Denken Hoch und Denken Max.
Es wird empfohlen, UD-IQ3_XXS zu verwenden, 103 GB für beste Ergebnisse. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht enthält, versuchen Sie, mindestens 110-GB-RAM zu haben, um das Modell auszuführen.
Der UD-Q8_K_XL Quant ist DeepSeek-V4-Flash in vollständiger ursprünglicher Präzision. Er hat eine Größe von 162 GB, und es ist am besten, mindestens 169 GB verfügbaren RAM/VRAM bereitzuhalten.
Tabelle: Hardwareanforderungen für die Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher)
92 GB
102 GB
110–135 GB
162 GB
169 GB
Für beste Leistung stellen Sie sicher, dass Ihr insgesamt verfügbarer Speicher, einschließlich VRAM und Systemspeicher, die Größe der quantisierten Modelldatei mit einem komfortablen Puffer überschreitet.
Empfohlene Einstellungen
DeepSeek empfiehlt diese Parameter für beste Leistung: temperature=1.0, top-p=1.0
Think High ist standardmäßig aktiviert. Wenn deaktiviert, können Sie es über Folgendes aktivieren: --chat-template-kwargs '{"enable_thinking":true}' oder es über das UI-Dropdown in Unsloth Studioumschalten. Siehe auch DeepSeek-V4
temperature = 1.0
top-p = 1.0
Maximales Kontextfenster:
1,048,576Für Think Max setzen Sie den Kontext auf mindestens 384K Tokens.
DeepSeek-V4-Flash-Tutorials ausführen:
Für dieses Tutorial verwenden wir den 3-Bit-Quant UD-IQ3_XXS, da er auf ein Gerät mit 128 GB RAM passt. Ersetzen Sie UD-IQ3_XXS mit UD-Q8_K_XL (ursprüngliche Qualität) oder einen anderen Quant, wenn Ihre Maschine genug Speicher hat. Sie können DeepSeek-V4-Flash jetzt in Unsloth Studio.
🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung
🦥 Unsloth Studio-Anleitung
DeepSeek-V4-Flash kann jetzt ausgeführt und trainiert werden in Unsloth Studio, unserer neuen Open-Source-Web-UI für lokale KI. Unsloth Studio ermöglicht es Ihnen, Modelle lokal auszuführen auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller bei 70 % weniger VRAM

DeepSeek-V4-Flash suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden. Gehen Sie dann zum Studio-Chat Tab und suchen Sie in der Suchleiste nach DeepSeek-V4-Flash und laden Sie Ihr gewünschtes Modell und den gewünschten Quant herunter.

DeepSeek-V4-Flash ausführen
Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Da Think High ist standardmäßig aktiviert, können Sie im rechten Dropdown zu Nicht denken oder Think Max wechseln. Sie können außerdem die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Sie können jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wählen Sie zuerst den gewünschten Quantisierungs-Typ, z. B. IQ3_XXS. Verwenden Sie auch export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp dass an einem bestimmten Ort gespeichert wird. Beachten Sie, dass dieser Downloadprozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den untenstehenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 32768 für die Kontextlänge, --n-gpu-layers 2 für das GPU-Offloading, auf wie viele Layer. Versuchen Sie, dies anzupassen, wenn Ihrer GPU der Speicher ausgeht. Entfernen Sie es auch, wenn Sie nur CPU-Inferenz haben.
📊 Benchmarks
GGUF-Benchmarks
Siehe unten eine Tabelle zum Vergleich der Benchmarks für Quants von Unsloth und anderen Anbietern. Referenz = offizielle Gewichte. Perplexität und KL-Divergenz über wikitext-2 bei ctx 512 auf 4x B200.

Offiziell (Referenz)
156.4
4.5319
0
0%
100%
100%
Unsloth UD-Q8_K_XL
161.9
4.5319
~0 (verlustfrei)
0.000%
100.000%
100.000%
Unsloth UD-Q4_K_XL
155.1
4.5335
0.0102
3.40%
96.28%
97.46%
bartowski MXFP4
156.0
4.5351
0.0105
3.42%
96.18%
97.57%
antirez Q4KExperts-F16 (imatrix)
164.6
4.5743
0.0291
5.87%
93.95%
0.51%
antirez Q4KExperts-F16
164.6
4.5726
0.0290
5.89%
93.94%
0.93%
antirez mixed L37-42-Q4K (imatrix)
97.6
5.8169
0.3605
21.15%
79.74%
0.41%
antirez IQ2XXS (imatrix)
86.7
6.0808
0.4079
22.23%
78.15%
0.39%
antirez IQ2XXS
86.7
6.1518
0.4207
22.74%
77.92%
0.47%
Offizielle Benchmarks
Siehe weiter unten Benchmarks in Tabellenform:

Wissen & Reasoning
MMLU-Pro (EM)
83.0
86.4
86.2
82.9
87.1
87.5
SimpleQA-Verified (Pass@1)
23.1
28.9
34.1
45.0
46.2
57.9
Chinese-SimpleQA (Pass@1)
71.5
73.2
78.9
75.8
77.7
84.4
GPQA Diamond (Pass@1)
71.2
87.4
88.1
72.9
89.1
90.1
HLE (Pass@1)
8.1
29.4
34.8
7.7
34.5
37.7
LiveCodeBench (Pass@1)
55.2
88.4
91.6
56.8
89.8
93.5
Codeforces (Bewertung)
-
2816
3052
-
2919
3206
HMMT 2026 Feb (Pass@1)
40.8
91.9
94.8
31.7
94.0
95.2
IMOAnswerBench (Pass@1)
41.9
85.1
88.4
35.3
88.0
89.8
Apex (Pass@1)
1.0
19.1
33.0
0.4
27.4
38.3
Apex-Kurzliste (Pass@1)
9.3
72.1
85.7
9.2
85.5
90.2
Langer Kontext
MRCR 1M (MMR)
37.5
76.9
78.7
44.7
83.3
83.5
CorpusQA 1M (ACC)
15.5
59.3
60.5
35.6
56.5
62.0
Agentisch
Terminal Bench 2.0 (Acc)
49.1
56.6
56.9
59.1
63.3
67.9
SWE Verified (Gelöst)
73.7
78.6
79.0
73.6
79.4
80.6
SWE Pro (Gelöst)
49.1
52.3
52.6
52.1
54.4
55.4
SWE Multilingual (Gelöst)
69.7
70.2
73.3
69.8
74.1
76.2
BrowseComp (Pass@1)
-
53.5
73.2
-
80.4
83.4
HLE mit Tools (Pass@1)
-
40.3
45.1
-
44.7
48.2
MCPAtlas (Pass@1)
64.0
67.4
69.0
69.4
74.2
73.6
GDPval-AA (Elo)
-
-
1395
-
-
1554
Toolathlon (Pass@1)
40.7
43.5
47.8
46.3
49.0
51.8
Zuletzt aktualisiert
War das hilfreich?

