For the complete documentation index, see llms.txt. This page is also available as Markdown.

DeepSeek-V4: So lokal ausführen

Führen Sie DeepSeek-V4-Flash lokal auf Ihrem eigenen Gerät aus!

DeepSeek-V4 ist DeepSeeks neue offene Modellreihe, einschließlich DeepSeek-V4-Pro mit 1,6T Parametern (49B aktiv) und DeepSeek-V4-Flash mit 284B Parametern (13B aktiv). Die Modelle glänzen beim Programmieren, bei agentischen Workflows und beim Chatten mit einem 1M-Kontext Fenster. In dieser Anleitung zeigen wir Ihnen, wie Sie DeepSeek-V4-Flash lokal ausführen: DeepSeek-V4-Flash GGUF

Für verlustfreies DeepSeek verwenden Sie Q8 (UD-Q8_K_XL), was nur 7 GB größer als Q4 (UD-Q4_K_XL) ist. Das verlustfreie 8-Bit-GGUF ist 162 GB und 3-Bit ist 103 GB und kann auf einem 110-GB-RAM Gerät ausgeführt werden. DeepSeek-V4-Flash erreicht 86,2 % auf MMLU-Pro, 88,1 % auf GPQA Diamond und 56,9 % auf Terminal Bench 2.0.

VerwendungshandbuchAnleitungen zum Ausführen

🦙 llama.cpp-Fehlerbehebungen für die DeepSeek-V4-Implementierung

llama.cpp fügte DeepSeek-V4-Unterstützung in 24162 - wir bemerkten, dass bei der Verwendung eines beliebigen GGUF von einem beliebigen AnbieterMehrturn-Konversationen im Vergleich zur Hugging-Face-Baseline von DS4 nicht gut funktionierten, wenn die KV-Cache-Quantisierung verwendet wurde --cache-type-k/v q8_0 - sie wurde inzwischen behoben und seit dem 7. Juli 2026 in llama.cpp zusammengeführt mit 25202

Konkret führte das Aufrufen von DeepSeek-Quants vor dem Fix dazu, dass overlayotin kinetic academyléléléléulif und nach dem PR "Die Hauptstadt von Frankreich ist Paris." was korrekt ist.

Engine
Punktzahl
Berechnung
Werkzeugauswahl
Parallele Werkzeuge
Werkzeuge mit mehreren Durchläufen
Verschachtelte Werkzeuge

Offizieller Code

15/15

3

3

3

3

3

Beliebiger Anbieter

4/15

1

2

0

0

1

Nach 25202

15/15

3

2

3

3

3

💬 Verbesserungen an der DeepSeek-V4-Chat-Vorlage

Wir haben außerdem die DeepSeek-V4-Chat-Jinja-Vorlage verbessert und über 4000 Konversationen getestet, um dem Goldstandard (offizielles DS4) zu entsprechen.

Wir haben reasoning_effort hinzugefügt, und Sie können max, high auswählen, genau wie beim offiziellen DeepSeek-V4. Wir stellen den korrekten System-Prompt gemäß DS4 voran und haben dem Stil von gpt-oss gefolgt.

Und für Werkzeugaufrufe, reasoning_content wurde für DS4 beibehalten, aber die Jinja-Chat-Vorlage würde sie ausschließen. Wir haben sie wieder hinzugefügt.

Denken deaktivieren, Reasoning-Aufwand ändern

DeepSeek-V4 verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Aufwände, bei denen reasoning_effort kann "high", "max" oder deaktiviert sein.

Um das Denken zu deaktivieren, verwenden Sie --chat-template-kwargs '{"enable_thinking":false}'. Wenn Sie auf Windows Powershell sind, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"

Sie können jetzt auch --reasoning on oder --reasoning off in llama.cpp verwenden!

Für die Anpassung des Reasoning-Aufwands oder um Reasoning zu deaktivieren, verwenden Sie die folgenden Beispiele:

📊 Quantisierungsanalyse

Unsere UD-Q8_K_XL Quant ist vollständig verlustfrei. DeepSeek-V4-Flash ist quantisierungsbewusst trainiert: Der offizielle Checkpoint speichert seine gerouteten Experten (96 % des Modells) nativ in MXFP4 und alles andere in FP8 oder BF16. GGUFs MXFP4 ist genau dieses Format, daher packen wir die Experten bitgenau neu, und FP8 dequantisiert ohne Rundung nach BF16. Wir haben jeden Tensor mit den offiziellen DeepSeek-Gewichten verglichen: Alle 1.328 sind bitidentisch, und es bleibt bei der Inferenz verlustfrei (KL-Divergenz ~0, 100 % Übereinstimmung des Top-Tokens).

Nicht-Unsloth DeepSeek-V4-Flash-GGUFs wurden ohne diese Pfade konvertiert und weichen daher von den offiziellen Gewichten ab. UD-Q4_K_XL behält dieselben bitgenauen Experten bei und quantisiert nur die Nicht-Experten-Tensoren (4 % des Modells) auf Q8_0, sodass es in Größe und Qualität direkt neben Q8 liegt.

Gemessen an den offiziellen Gewichten liegen beide Unsloth-Quants an der Qualitäts-/Größen-Grenze. UD-Q8_K_XL ist der einzige verlustfreie Punkt. UD-Q4_K_XL entspricht anderen gemeinschaftlichen MXFP4-Formaten und ist genauer als die Q4_K-Expertenkonvertierungen, die größer sind und dennoch bei 0,029 KLD landen.

Die nach Layern aufgeschlüsselte Fehlerverteilung zeigt warum. Wenn die nativen MXFP4-Experten beibehalten werden, ergibt sich in jedem Layer 0 % Gewichtsfehler. Konvertierungen, die die Experten auf Q4_K oder IQ2_XXS neu quantisieren, runden fast jedes Gewicht: 5 % für Q4_K, über 30 % für IQ2_XXS.

Unser MXFP4 hat auf allen 8,4 Mio. Gewichten exakt null Fehler, während Q4_K, ein anderes 4-Bit-Gitter, jedes einzelne runden muss (5,2 % RMSE).

Wir haben außerdem festgestellt, dass die Verwendung von Q8_0 und F16 für einige Tensoren nicht verlustfrei ist, und es wird noch schlechter, da DeepSeek QAT angewendet hat, damit MXFP4 / FP8 gut funktionieren, sodass wir sie direkt in BF16 belassen mussten. Verwenden Sie daher UD-Q8_K_XL für einen wirklich verlustfreien Quant, und UD-Q4_K_XL wandelt einige der BF16-Elemente nach Q8_0 herunter.

Für vollständige Benchmark-Tabellen von GGUF-Benchmarks siehe hier.

⚙️ Gebrauchsanleitung

DeepSeek-V4-Flash ist kleiner und schneller als DeepSeek-V4-Pro, mit 284B Parametern (13B aktiv) und einem 1M-Kontextfenster. Das Modell hat 3 Modi, Nicht denken, Denken Hoch und Denken Max.

Es wird empfohlen, UD-IQ3_XXS zu verwenden, 103 GB für beste Ergebnisse. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht enthält, versuchen Sie, mindestens 110-GB-RAM zu haben, um das Modell auszuführen.

Der UD-Q8_K_XL Quant ist DeepSeek-V4-Flash in vollständiger ursprünglicher Präzision. Er hat eine Größe von 162 GB, und es ist am besten, mindestens 169 GB verfügbaren RAM/VRAM bereitzuhalten.

Tabelle: Hardwareanforderungen für die Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher)

1-Bit
2-Bit
3-Bit
4-Bit (nahezu verlustfrei)
Q8_K_XL (verlustfrei)

92 GB

102 GB

110–135 GB

162 GB

169 GB

Empfohlene Einstellungen

DeepSeek empfiehlt diese Parameter für beste Leistung: temperature=1.0, top-p=1.0

Think High ist standardmäßig aktiviert. Wenn deaktiviert, können Sie es über Folgendes aktivieren: --chat-template-kwargs '{"enable_thinking":true}' oder es über das UI-Dropdown in Unsloth Studioumschalten. Siehe auch DeepSeek-V4

temperature = 1.0

top-p = 1.0

  • Maximales Kontextfenster: 1,048,576

  • Für Think Max setzen Sie den Kontext auf mindestens 384K Tokens.

DeepSeek-V4-Flash-Tutorials ausführen:

Für dieses Tutorial verwenden wir den 3-Bit-Quant UD-IQ3_XXS, da er auf ein Gerät mit 128 GB RAM passt. Ersetzen Sie UD-IQ3_XXS mit UD-Q8_K_XL (ursprüngliche Qualität) oder einen anderen Quant, wenn Ihre Maschine genug Speicher hat. Sie können DeepSeek-V4-Flash jetzt in Unsloth Studio.

🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung

🦥 Unsloth Studio-Anleitung

DeepSeek-V4-Flash kann jetzt ausgeführt und trainiert werden in Unsloth Studio, unserer neuen Open-Source-Web-UI für lokale KI. Unsloth Studio ermöglicht es Ihnen, Modelle lokal auszuführen auf MacOS, Windows, Linux und:

1

Unsloth installieren

Stellen Sie sicher, dass Sie die neueste Version verwenden. Führen Sie in Ihrem Terminal aus:

MacOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://127.0.0.1:8888 (oder Ihre spezifische URL) in Ihrem Browser.

3

DeepSeek-V4-Flash suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden. Gehen Sie dann zum Studio-Chat Tab und suchen Sie in der Suchleiste nach DeepSeek-V4-Flash und laden Sie Ihr gewünschtes Modell und den gewünschten Quant herunter.

4

DeepSeek-V4-Flash ausführen

Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Da Think High ist standardmäßig aktiviert, können Sie im rechten Dropdown zu Nicht denken oder Think Max wechseln. Sie können außerdem die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Sie können jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wählen Sie zuerst den gewünschten Quantisierungs-Typ, z. B. IQ3_XXS. Verwenden Sie auch export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp dass an einem bestimmten Ort gespeichert wird. Beachten Sie, dass dieser Downloadprozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.

3

Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den untenstehenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 32768 für die Kontextlänge, --n-gpu-layers 2 für das GPU-Offloading, auf wie viele Layer. Versuchen Sie, dies anzupassen, wenn Ihrer GPU der Speicher ausgeht. Entfernen Sie es auch, wenn Sie nur CPU-Inferenz haben.

📊 Benchmarks

GGUF-Benchmarks

Siehe unten eine Tabelle zum Vergleich der Benchmarks für Quants von Unsloth und anderen Anbietern. Referenz = offizielle Gewichte. Perplexität und KL-Divergenz über wikitext-2 bei ctx 512 auf 4x B200.

Quant
Größe (GB)
PPL
Mittlere KLD
RMS delta-p
Gleiches Top-Token
Bitgenaue Gewichte

Offiziell (Referenz)

156.4

4.5319

0

0%

100%

100%

Unsloth UD-Q8_K_XL

161.9

4.5319

~0 (verlustfrei)

0.000%

100.000%

100.000%

Unsloth UD-Q4_K_XL

155.1

4.5335

0.0102

3.40%

96.28%

97.46%

bartowski MXFP4

156.0

4.5351

0.0105

3.42%

96.18%

97.57%

antirez Q4KExperts-F16 (imatrix)

164.6

4.5743

0.0291

5.87%

93.95%

0.51%

antirez Q4KExperts-F16

164.6

4.5726

0.0290

5.89%

93.94%

0.93%

antirez mixed L37-42-Q4K (imatrix)

97.6

5.8169

0.3605

21.15%

79.74%

0.41%

antirez IQ2XXS (imatrix)

86.7

6.0808

0.4079

22.23%

78.15%

0.39%

antirez IQ2XXS

86.7

6.1518

0.4207

22.74%

77.92%

0.47%

Offizielle Benchmarks

Siehe weiter unten Benchmarks in Tabellenform:

Benchmark (Metrik)
V4-Flash Nicht denken
V4-Flash Hoch
V4-Flash Max
V4-Pro Nicht denken
V4-Pro Hoch
V4-Pro Max

Wissen & Reasoning

MMLU-Pro (EM)

83.0

86.4

86.2

82.9

87.1

87.5

SimpleQA-Verified (Pass@1)

23.1

28.9

34.1

45.0

46.2

57.9

Chinese-SimpleQA (Pass@1)

71.5

73.2

78.9

75.8

77.7

84.4

GPQA Diamond (Pass@1)

71.2

87.4

88.1

72.9

89.1

90.1

HLE (Pass@1)

8.1

29.4

34.8

7.7

34.5

37.7

LiveCodeBench (Pass@1)

55.2

88.4

91.6

56.8

89.8

93.5

Codeforces (Bewertung)

-

2816

3052

-

2919

3206

HMMT 2026 Feb (Pass@1)

40.8

91.9

94.8

31.7

94.0

95.2

IMOAnswerBench (Pass@1)

41.9

85.1

88.4

35.3

88.0

89.8

Apex (Pass@1)

1.0

19.1

33.0

0.4

27.4

38.3

Apex-Kurzliste (Pass@1)

9.3

72.1

85.7

9.2

85.5

90.2

Langer Kontext

MRCR 1M (MMR)

37.5

76.9

78.7

44.7

83.3

83.5

CorpusQA 1M (ACC)

15.5

59.3

60.5

35.6

56.5

62.0

Agentisch

Terminal Bench 2.0 (Acc)

49.1

56.6

56.9

59.1

63.3

67.9

SWE Verified (Gelöst)

73.7

78.6

79.0

73.6

79.4

80.6

SWE Pro (Gelöst)

49.1

52.3

52.6

52.1

54.4

55.4

SWE Multilingual (Gelöst)

69.7

70.2

73.3

69.8

74.1

76.2

BrowseComp (Pass@1)

-

53.5

73.2

-

80.4

83.4

HLE mit Tools (Pass@1)

-

40.3

45.1

-

44.7

48.2

MCPAtlas (Pass@1)

64.0

67.4

69.0

69.4

74.2

73.6

GDPval-AA (Elo)

-

-

1395

-

-

1554

Toolathlon (Pass@1)

40.7

43.5

47.8

46.3

49.0

51.8

Zuletzt aktualisiert

War das hilfreich?