> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/deepseek-v4.md).

# DeepSeek-V4: So führst du es lokal aus

Führe DeepSeek-V4-Pro-0813 und DeepSeek-V4-Flash-0731 lokal auf deinem eigenen Gerät aus!

DeepSeek-V4, DeepSeek-V4-Flash-Vision-Exp, V4-**Pro-0813**, und V4-**Flash-0731** sind neue Open-Weight-Modelle - die Flash-Variante hat 284B Parameter (13B aktiv), während V4-Pro 1,6T (49B aktiv) hat. **V4-Pro-0813**, veröffentlicht am **13. Aug.**, erreicht die Leistung von Claude-4.8-Opus, während **V4-Flash-0731**, veröffentlicht am **31. Juli**, die beste Leistung in seiner Größenklasse liefert und **V4-Pro übertrifft** (Vorschau). Entwickelt für Coding-, agentische und Chat-Workflows mit einem **1M-Kontextfenster**, zeigt diese Anleitung, wie man DeepSeek-V4-Flash-0731 lokal mit Unsloth Dynamic GGUFs und [Unsloth Desktop](/docs/de/desktop.md).

Für **verlustfrei** DeepSeek, verwende Q8 (`UD-Q8_K_XL`), was nur **7 GB größer** als Q4 (`UD-Q4_K_XL`). Die verlustfreie 8-Bit-GGUF ist **162 GB** und 3-Bit ist **103 GB** das auf einem **110 GB RAM** Gerä&#x74;**.** DeepSeek-V4-Flash-0731 erreicht 82,7 % auf Terminal Bench 2.1, 54,4 % auf DeepSWE und 54,2 % auf NL2Repo. [DSpark](#dspark-speculative-decoding) ist auch für GGUFs aktiviert und ermöglicht bis zu **2x schnellere Dekodiergeschwindigkeit**!

{% hint style="success" %}
**31. Aug.:** DeepSeek-Flash-Vision-Exp ist jetzt verfügbar!

**13. Aug.:** DeepSeek-**V4-Pro-0813** wurde veröffentlicht und [Quants sind jetzt](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) zum Ausführen verfügbar.
{% endhint %}

{% hint style="success" %}
**6. Aug.: DSpark ist für DeepSeek-V4-Flash-0731 aktiviert - für 1,5x bis 1,9x schnellere Inferenz! DSpark ist automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

Wir haben auch die [DeepSeek-V4-Chat-Jinja-Template](#deepseek-v4-chat-template-improvements) verbessert und über 4000 Unterhaltungen getestet, um mit der offiziellen Baseline übereinzustimmen.
{% endhint %}

| [DeepSeek-V4-Pro-0813-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) | [DeepSeek-V4-Flash-**0731**-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF) | [DeepSeek-V4-Flash-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF) |
| ------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------- |

<a href="/docs/de/modelle/deepseek-v4.md#usage-guide" class="button primary">Nutzungsanleitung</a><a href="/docs/de/modelle/deepseek-v4.md#run-deepseek-v4-flash-tutorials" class="button primary">Tutorials zum Ausführen</a>

### 📊 Quantisierungsanalyse

Unsere `UD-Q8_K_XL` Quant ist vollständig verlustfrei. DeepSeek-V4-Flash ist [quantisierungsbewusst trainiert](/docs/de/blog/quantization-aware-training-qat.md): Der offizielle Checkpoint speichert seine gerouteten Experten (96 % des Modells) nativ in MXFP4 und alles andere in FP8 oder BF16. Das MXFP4 von GGUF ist genau dieses Format, also packen wir die Experten bitgenau neu, und FP8 dequantisiert ohne Rundung zu BF16. Wir haben jedes Tensor gegen die offiziellen DeepSeek-Gewichte geprüft: alle 1.328 sind bitidentisch, und es bleibt bei der Inferenz verlustfrei (KL-Divergenz \~0, 100 % Übereinstimmung beim Top-Token).

**Nicht**-Unsloth DeepSeek-V4-Flash-GGUFs wurden ohne diese Pfade konvertiert und weichen daher von den offiziellen Gewichten ab. `UD-Q4_K_XL` behält die gleichen bitgenauen Experten bei und quantisiert nur die Nicht-Experten-Tensoren (4 % des Modells) auf Q8\_0, sodass es größen- und qualitätsmäßig direkt neben Q8 liegt.

<div align="left"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FXjXSVsiH2ZIKlJ7iZPDx%2Fkldddd.webp?alt=media&amp;token=e1db5fca-b2b4-411e-8956-29127ef6bfe0" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHoYuIu6dNNuLrM4nmdbi%2Fpareto.png?alt=media&amp;token=1c7a44bb-13c3-4fc4-8d57-fb350ffe3c14" alt="" width="563"><figcaption></figcaption></figure></div>

Gemessen an den offiziellen Gewichten liegen beide Unsloth-Quants an der Qualitäts-/Größen-Grenze. UD-Q8\_K\_XL ist der einzige verlustfreie Punkt. UD-Q4\_K\_XL entspricht anderen Community-MXFP4-Formaten und ist genauer als die Q4\_K-Experten-Konvertierungen, die größer sind und dennoch bei 0,029 KLD landen.

<div align="left"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FxW5lIQID1dIRlVajHSWm%2Fper_layer.png?alt=media&amp;token=94dd4abc-e7ef-4aa8-8d2f-de8c98a69166" alt="" width="563"><figcaption></figcaption></figure></div>

Die Fehleraufteilung nach Schicht zeigt, warum. Die nativen MXFP4-Experten beizubehalten bedeutet 0 % Gewichtsfehler in jeder Schicht. Konvertierungen, die die Experten zu Q4\_K oder IQ2\_XXS neu quantisieren, runden fast jedes Gewicht: 5 % für Q4\_K, über 30 % für IQ2\_XXS.

<div align="left"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FINDS7DqyP9TUAs4Bj9rS%2Fwhy_lossless.png?alt=media&amp;token=efdb261b-f969-42b8-89ec-bc25e8bbdaf3" alt="" width="563"><figcaption><p>Unser MXFP4 hat exakt null Fehler bei allen 8,4 Mio. Gewichten, während Q4_K, ein anderes 4-Bit-Gitter, jedes einzelne runden muss (5,2 % RMSE).</p></figcaption></figure></div>

Wir haben auch festgestellt, dass die Verwendung von Q8\_0 und F16 für einige Tensoren nicht verlustfrei ist, und es wird noch schlechter, da QAT von DeepSeek angewendet wurde, um MXFP4 / FP8 gut funktionieren zu lassen, also mussten wir sie direkt in BF16 belassen. Verwende also UD-Q8\_K\_XL für eine wirklich verlustfreie Quant, und UD-Q4\_K\_XL stuft einige der BF16-Elemente auf Q8\_0 herab.

Für vollständige Benchmark-Tabellen von [GGUF-Benchmarks siehe hier](#gguf-benchmarks).

### :speech\_balloon: Verbesserungen am DeepSeek-V4-Chat-Template

Wir haben außerdem das DeepSeek-V4-Chat-Jinja-Template verbessert und über 4000 Unterhaltungen getestet, damit es mit der goldenen Baseline (offizielles DS4) übereinstimmt

Wir haben `reasoning_effort` hinzugefügt, und Sie können auswählen `max, high` genau wie beim offiziellen DeepSeek-V4. Wir stellen den korrekten System-Prompt gemäß DS4 voran und folgen dem Stil von gpt-oss.

Und für Tool-Aufrufe, `reasoning_content` wurde für DS4 beibehalten, aber das Jinja-Chat-Template würde sie ausschließen. Wir haben es wieder hinzugefügt.

#### **Deaktivieren von Thinking, Ändern des Reasoning-Aufwands**

DeepSeek-V4 verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Aufwände, bei denen `reasoning_effort` kann „high“, „max“ oder deaktiviert sein.

Um Thinking zu deaktivieren, verwende `--chat-template-kwargs '{"enable_thinking":false}'`. Wenn Sie unter **Windows** PowerShell verwenden, nutzen Sie: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Sie können auch `--reasoning on` oder `--reasoning off` jetzt auch in llama.cpp verwenden!

Für die Anpassung des Reasoning-Aufwands oder um Reasoning zu deaktivieren, verwende die folgenden Beispiele:

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### ⚙️ Nutzungsanleitung

DeepSeek-V4-Flash ist kleiner und schneller als DeepSeek-V4-Pro, mit **284B** Parametern (13B aktiv), und einem **1M-Kontextfenster**. Das Modell hat 3 Modi, **Ohne Denken**, **Denken** **Hoch** und **Denken** **Max**.&#x20;

Es wird empfohlen, `UD-IQ3_XXS` das **103 GB** für beste Ergebnisse. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht enthält, versuche, mindestens **110 GB RAM** zum Ausführen des Modells zu haben.

Die `UD-Q8_K_XL` Quant ist DeepSeek-V4-Flash in voller ursprünglicher Präzision. Sie hat eine Größe von 162 GB und es ist am besten, mindestens 169 GB verfügbaren RAM/VRAM zur Verfügung zu haben.

**Tabelle: Hardwareanforderungen für die Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

<table><thead><tr><th>Format</th><th width="129.8004150390625">1-Bit</th><th width="130.85650634765625">2-Bit</th><th width="140.26702880859375">3-Bit</th><th>4-Bit (nahezu verlustfrei)</th><th>Q8_K_XL (verlustfrei)</th></tr></thead><tbody><tr><td>Standard</td><td>92 GB</td><td>102 GB</td><td>110-135 GB</td><td>162 GB</td><td>169 GB</td></tr><tr><td>DSpark</td><td>102 GB</td><td>112 GB</td><td>120-145 GB</td><td>172 GB</td><td>179 GB</td></tr></tbody></table>

{% hint style="info" %}
**DSpark verwendet mehr VRAM als Standard**, also plane **\~10 GB** zusätzlichen RAM/VRAM-Spielraum ein.
{% endhint %}

{% hint style="success" %}
Für beste Leistung stellen Sie sicher, dass Ihr gesamter verfügbarer Speicher einschließlich VRAM und Systemspeicher die Dateigröße des quantisierten Modells mit bequemem Abstand übersteigt.
{% endhint %}

### Empfohlene Einstellungen

DeepSeek empfiehlt diese Parameter für beste Leistung: `temperature = 1.0`, `top-p = 1.0`. Für **DeepSeek-V4-Flash-0731** und agentische Szenarien, `wird stattdessen top-p = 0,95 empfohlen und` für andere Aufgaben. `top-p = 1.0` Think High ist standardmäßig aktiviert.

**Wenn deaktiviert, können Sie es über aktivieren:** --chat-template-kwargs '{"enable\_thinking":true}' `oder schalten Sie es über das UI-Dropdown in` . Siehe auch [Unsloth](#unsloth-studio-guide)(nur agentisch) [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column width="50%" %}

| DeepSeek-V4-Flash-0731                                                             |
| ---------------------------------------------------------------------------------- |
| `temperature = 1.0`                                                                |
| `top-p = 1.0`                                                                      |
| `wird stattdessen top-p = 0,95 empfohlen und` Älteres DeepSeek-V4-Flash und V4-Pro |
| {% endcolumn %}                                                                    |

{% column width="50%" %}

| Maximale Kontextfenstergröße: |
| ----------------------------- |
| `temperature = 1.0`           |
| `top-p = 1.0`                 |
| {% endcolumn %}               |
| {% endcolumns %}              |

* **Für Think Max stellen Sie den Kontext auf mindestens** `1,048,576`
* 384K Token ein **384K Token**.

## Tutorials zum Ausführen von DeepSeek-V4-Flash:

Für dieses Tutorial verwenden wir die 3-Bit-Quant `UD-IQ3_XXS`, da sie auf ein 128GB-RAM-Gerät passt. Ersetzen Sie `UD-IQ3_XXS` mit `UD-Q8_K_XL` (ursprüngliche Qualität) oder einer anderen Quant, wenn Ihr Rechner genug Speicher hat. Sie können DeepSeek-V4-Flash-0731 jetzt in [Unsloth Desktop](#run-in-unsloth-studio) . **DSpark wird automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

<a href="/docs/de/modelle/deepseek-v4.md#unsloth-studio-guide" class="button primary">🦥 Unsloth-Anleitung</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Anleitung</a><a href="/docs/de/modelle/deepseek-v4.md#dspark-speculative-decoding" class="button secondary">⚡DSpark-Anleitung</a>

### 🦥 Unsloth-Anleitung

DeepSeek-V4-Flash-0731 kann jetzt ausgeführt und trainiert werden in [Unsloth](/docs/de/neu/studio.md), unserer neuen Open-Source-UI für lokale KI. Unsloth Desktop ermöglicht es Ihnen, Modelle lokal auf **MacOS**, **Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameterabstimmung (Temp, Top-p usw.)
* Schnelle CPU- + GPU-Inferenz via llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FCwcXvmLERJSUNF6iNTiY%2Fdeepseek-v4-flash-0731-unsloth-studio.png?alt=media&amp;token=6fdc0216-d21e-42e7-bb57-8e1abf6e7f4f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn Sie lieber manuell installieren möchten:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### DeepSeek-V4-Flash suchen und herunterladen

Gehe zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder Model Hub und suche in der Suchleiste nach DeepSeek-V4-Flash und lade das gewünschte Modell und die gewünschte Quant herunter.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FGEc90VxPAgTHulQe9zB0%2FScreenshot%202026-07-31%20at%208.01.35%E2%80%AFAM.png?alt=media&amp;token=2931411d-8f75-4bfe-918a-73fcafe918f9" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### DeepSeek-V4-Flash-0731 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Da **Think High standardmäßig aktiviert ist**, können Sie das rechte Dropdown öffnen, um auf Ohne Denken oder Think Max umzuschalten. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. **DSpark wird automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

Für weitere Informationen können Sie unsere [Unsloth-Inferenzanleitung](/docs/de/neu/studio/chat.md).

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FlvJqDRKlWdAVkn3HXJZA%2F1000024247.png?alt=media&amp;token=e84fd31d-7720-40d5-aba1-ba65ac34ce97" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### DeepSeek-V4 mit der Unsloth-API bereitstellen

Sie können den `unsloth run` Befehl verwenden und DeepSeek über eine API bereitstellen mit `llama-server` Runtime-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Informationen finden Sie in unserer [API-Dokumentation](/docs/de/grundlagen/api.md) oder [unsloth start](/docs/de/integrationen/unsloth-start.md).

```bash
unsloth run --model unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S
```

{% endstep %}

{% step %}

#### Unsloth ist jetzt bereit

Sie können mit DeepSeek über Unsloth Desktop auch viele andere Dinge tun, wie z. B.:

* **Tools verbinden:** [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [Websuche](/docs/de/neu/studio/chat.md#advanced-web-search), [MCP](/docs/de/grundlagen/mcp.md) und mehr
* **Modelle trainieren:** Text, Diffusion, [Embedding](/docs/de/grundlagen/embedding-finetuning.md)und mehr
* **Medien generieren:** Erstellen und trainieren [Bilder](/docs/de/grundlagen/diffusion-image.md), Video, [TTS](/docs/de/grundlagen/text-to-speech-tts-fine-tuning.md) lokal
  {% endstep %}
  {% endstepper %}

### 🦙 Llama.cpp-Anleitung

{% stepper %}
{% step %}
Erhalten Sie die neueste `llama.cpp` **auf** [**hier auf GitHub**](https://github.com/ggml-org/llama.cpp). Sie können auch die folgenden Build-Anweisungen befolgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Sie können jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wählen Sie zuerst den gewünschten Quantisierungstyp wie `IQ3_XXS`. Verwenden Sie auch `export LLAMA_CACHE="folder"` um `llama.cpp` zu erzwingen, an einem bestimmten Ort zu speichern. Beachten Sie, dass dieser Downloadprozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Downloadprozess im nächsten Abschnitt zu verwenden.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endstep %}

{% step %}
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell mit dem folgenden Code herunterladen (nach Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*UD-IQ3_S*" # Verwenden Sie "*UD-IQ4_XS*" für 4-Bit
```

{% endstep %}

{% step %}
Sie können `--threads 32` für die Anzahl der CPU-Threads, `--ctx-size 32768` für die Kontextlänge, `--n-gpu-layers 2` für GPU-Auslagerung bei wie vielen Schichten. Versuchen Sie, es anzupassen, wenn Ihrer GPU der Speicher ausgeht. Entfernen Sie es außerdem, wenn Sie nur CPU-Inferenz haben.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_S/DeepSeek-V4-Flash-0731-UD-IQ3_S-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

## :zap:DSpark - Spekulatives Decoding

DeepSeek-V4-Flash-0731 hat natives DSpark, was bis zu **2x schnellere Dekodiergeschwindigkeit**! DSpark ist ein neuer Algorithmus von DeepSeek, der naives MTP übertrifft, und wurde in diesem [Paper](https://arxiv.org/abs/2607.05147). DSpark ermöglicht es DeepSeek-V4-Flash, zu erreichen **120 Token/s** auf einer B200-GPU im Vergleich zur ursprünglichen 60 Token/s-Basislinie. **DSpark wird automatisch aktiviert in der** [**Unsloth**](#unsloth-studio-guide) **lokalen UI.**

Llama.cpp integrierte DSpark im Rahmen von [PR 25784](https://github.com/ggml-org/llama.cpp/pull/25784) mit weiteren Verbesserungen für Multi-GPU und mehr. Wir zeigen die Verwendung von `--spec-draft-n-max 3` als gute Voreinstellung, die eine 1,9x schnellere Inferenzgeschwindigkeit ermöglicht. Größere Werte scheinen langsamer zu sein.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FRV0T1cVPpCnacNnywAsL%2Fimage.png?alt=media&amp;token=b570026f-4577-4a45-936f-98a650d644ac" alt=""><figcaption></figcaption></figure>

Lade sowohl den Drafter als auch das GGUF herunter - wir haben 2 Q8\_0 und die verlustfreie BF16-Version erstellt. Beachte, dass DSpark etwa 10 GB mehr Speicher benötigt, sodass 128-GB-Maschinen IQ3\_XXS und Q8\_0 benötigen werden

{% code overflow="wrap" %}

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*dspark-DeepSeek-V4-Flash-0731-Q8_0*" \\
    --include "*UD-IQ3_XXS*" # Verwenden Sie "*UD-IQ4_XS*" für 4-Bit
```

{% endcode %}

Dann lade es via llama-cli oder llama-server:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf \
    -md unsloth/DeepSeek-V4-Flash-0731-GGUF/dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01 \
    --spec-type draft-dspark \
    --spec-draft-n-max 3 \
    -ngl 99 -ngld 99
```

{% endcode %}

Benchmarks aus dem ursprünglichen DSpark-Paper sowie, die auch zeigen, wie es sich gegen MTP schlägt:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FNXmTkimQGD9JzAq4OtK9%2Fimage.png?alt=media&amp;token=bab3816c-e3cd-4bd8-a234-6226520f45f6" alt=""><figcaption></figcaption></figure>

## 📊 Benchmarks

### GGUF-Benchmarks

Siehe unten eine Tabelle, die Benchmarks für Quants von Unsloth und anderen Anbietern vergleicht. Referenz = offizielle Gewichte. Perplexity und KL-Divergenz über wikitext-2 bei ctx 512 auf 4x B200.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FXjXSVsiH2ZIKlJ7iZPDx%2Fkldddd.webp?alt=media&amp;token=e1db5fca-b2b4-411e-8956-29127ef6bfe0" alt="" width="563"><figcaption></figcaption></figure>

| Quant                                 | Größe (GB) | PPL    | Mittlere KLD          | RMS-Delta-p | Gleiches Top-Token | Bit-genaue Gewichte |
| ------------------------------------- | ---------- | ------ | --------------------- | ----------- | ------------------ | ------------------- |
| Offiziell (Referenz)                  | 156.4      | 4.5319 | 0                     | 0%          | 100%               | 100%                |
| **Unsloth UD-Q8\_K\_XL**              | 161.9      | 4.5319 | **\~0 (verlustfrei)** | 0.000%      | 100.000%           | **100.000%**        |
| **Unsloth UD-Q4\_K\_XL**              | 155.1      | 4.5335 | 0.0102                | 3.40%       | 96.28%             | 97.46%              |
| bartowski MXFP4                       | 156.0      | 4.5351 | 0.0105                | 3.42%       | 96.18%             | 97.57%              |
| antirez Q4KExperts-F16 (imatrix)      | 164.6      | 4.5743 | 0.0291                | 5.87%       | 93.95%             | 0.51%               |
| antirez Q4KExperts-F16                | 164.6      | 4.5726 | 0.0290                | 5.89%       | 93.94%             | 0.93%               |
| antirez gemischt L37-42-Q4K (imatrix) | 97.6       | 5.8169 | 0.3605                | 21.15%      | 79.74%             | 0.41%               |
| antirez IQ2XXS (imatrix)              | 86.7       | 6.0808 | 0.4079                | 22.23%      | 78.15%             | 0.39%               |
| antirez IQ2XXS                        | 86.7       | 6.1518 | 0.4207                | 22.74%      | 77.92%             | 0.47%               |

### Offizielle Benchmarks

DeepSeek-V4-Flash-0731 übertrifft DeepSeek-V4-Pro (Preview) in den untenstehenden Benchmarks trotz deutlich weniger aktivierter Parameter und bleibt mit führenden proprietären Modellen konkurrenzfähig.

| Benchmark                   | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash (Preview) | DeepSeek-V4-Pro (Preview) | GLM-5.2 | Opus-4.8 |
| --------------------------- | :--------------------: | :-------------------------: | :-----------------------: | :-----: | :------: |
| Terminal Bench 2.1          |          82.7          |             61.8            |            72.1           |   81.0  |   85.0   |
| NL2Repo                     |          54.2          |             39.4            |            38.5           |   48.9  |   69.7   |
| Cybergym                    |          76.7          |             38.7            |            52.7           |    -    |   83.1   |
| DeepSWE                     |          54.4          |             7.3             |            12.8           |   46.2  |   58.0   |
| Toolathlon-Verified         |          70.3          |             49.7            |            55.9           |   59.9  |   76.2   |
| Der letzte Test der Agenten |          25.2          |             15.8            |            16.5           |   23.8  |   25.7   |
| AutomationBench öffentlich  |          25.1          |             10.8            |            12.8           |   12.9  |   27.2   |
| DSBench-Vollstack †         |          68.7          |             37.0            |            41.8           |   61.8  |   71.6   |
| DSBench-Hart †              |          59.6          |             25.8            |            31.1           |   54.5  |   71.7   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
