> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/deepseek-v4.md).

# DeepSeek-V4: So führst du es lokal aus

DeepSeek-V4, DeepSeek-V4-**Pro-0813**, und DeepSeek-V4-**Flash-0731** sind neue Open-Weight-Modelle - die Flash-Variante hat 284B Parameter (13B aktiv), während V4-Pro 1,6T (49B aktiv) hat. **V4-Pro-0813**, veröffentlicht am **13. Aug**, erreicht die Leistung von Claude-4.8-Opus, während **V4-Flash-0731**, veröffentlicht am **31. Juli**, die beste Leistung in seiner Größenklasse liefert und **V4-Pro übertrifft** (Vorschau). Entwickelt für Coding-, agentische und Chat-Workflows mit einem **1M Kontextfenster**, zeigt dieser Leitfaden, wie man DeepSeek-V4-Flash-0731 lokal mit Unsloth Dynamic GGUFs und [Unsloth Desktop](/docs/de/desktop.md).

Für **verlustfreie** DeepSeek, verwende Q8 (`UD-Q8_K_XL`), das nur **7 GB größer** ist als Q4 (`UD-Q4_K_XL`). Das verlustfreie 8-Bit-GGUF ist **162 GB** und 3-Bit ist **103 GB** und auf einem **110 GB RAM** Gerät ausgeführt werden kan&#x6E;**.** DeepSeek-V4-Flash-0731 erzielt 82,7 % auf Terminal Bench 2.1, 54,4 % auf DeepSWE und 54,2 % auf NL2Repo. [DSpark](#dspark-speculative-decoding) ist auch für GGUFs aktiviert und ermöglicht bis zu **2x schnellere Dekodiergeschwindigkeit**!

{% hint style="success" %}
**13. Aug:** DeepSeek-**V4-Pro-0813** wurde veröffentlicht und [Quants sind jetzt](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) verfügbar zum Ausführen.
{% endhint %}

{% hint style="success" %}
**6. Aug.: DSpark ist für DeepSeek-V4-Flash-0731 aktiviert - und ermöglicht 1,5x bis 1,9x schnellere Inferenz! DSpark wird automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

Wir haben auch die [DeepSeek-V4-Chat-Jinja-Vorlage](#deepseek-v4-chat-template-improvements)verbessert und über 4000 Konversationen getestet, um mit der offiziellen Baseline übereinzustimmen.
{% endhint %}

| [DeepSeek-V4-Pro-0813-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) | [DeepSeek-V4-Flash-**0731**-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF) | [DeepSeek-V4-Flash-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF) |
| ------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------- |

<a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#usage-guide" class="button primary">Nutzungsleitfaden</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#run-deepseek-v4-flash-tutorials" class="button primary">Ausführungs-Tutorials</a>

### 📊 Quantisierungsanalyse

Unsere `UD-Q8_K_XL` Quant ist vollständig verlustfrei. DeepSeek-V4-Flash ist [quantisierungsbewusst trainiert](/docs/de/blog/quantization-aware-training-qat.md): Der offizielle Checkpoint speichert seine gerouteten Experten (96 % des Modells) nativ in MXFP4 und alles andere in FP8 oder BF16. GGUFs MXFP4 ist genau dieses Format, daher packen wir die Experten bitgenau neu und FP8 dequantisiert zu BF16 ohne Rundung. Wir haben jeden Tensor mit den offiziellen DeepSeek-Gewichten verglichen: alle 1.328 sind bitidentisch, und es bleibt bei der Inferenz verlustfrei (KL-Divergenz \~0, 100 % Übereinstimmung des Top-Tokens).

**Nicht**-Unsloth DeepSeek-V4-Flash-GGUFs wurden ohne diese Pfade konvertiert und weichen daher von den offiziellen Gewichten ab. `UD-Q4_K_XL` behält dieselben bitgenauen Experten bei und quantisiert nur die Nicht-Experten-Tensoren (4 % des Modells) auf Q8\_0, sodass es in Größe und Qualität direkt neben Q8 liegt.

<div align="left"><figure><img src="/files/063f5e34f94560c36fe5d301197820a343206c37" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="/files/195a4b97b03b7b778e3c6d33198d6d7853a81f3b" alt="" width="563"><figcaption></figcaption></figure></div>

Gemessen an den offiziellen Gewichten liegen beide Unsloth-Quants an der Qualitäts-/Größen-Frontier. UD-Q8\_K\_XL ist der einzige verlustfreie Punkt. UD-Q4\_K\_XL entspricht anderen Community-MXFP4-Formaten und ist genauer als die Q4\_K-Experts-Konvertierungen, die größer sind und dennoch bei 0,029 KLD landen.

<div align="left"><figure><img src="/files/d21be7de139f60968a9e60198bac8277df07302a" alt="" width="563"><figcaption></figcaption></figure></div>

Die Fehleraufteilung nach Schicht zeigt warum. Wenn die nativen MXFP4-Experten beibehalten werden, liegt der Gewichtsfehler in jeder Schicht bei 0 %. Konvertierungen, die die Experten erneut auf Q4\_K oder IQ2\_XXS quantisieren, runden fast jedes Gewicht: 5 % für Q4\_K, über 30 % für IQ2\_XXS.

<div align="left"><figure><img src="/files/e1a6971f06b09e7bd88684d03aa944cd69fbefdf" alt="" width="563"><figcaption><p>Unser MXFP4 hat bei allen 8,4 Mio. Gewichten genau null Fehler, während Q4_K, ein anderes 4-Bit-Raster, jedes einzelne runden muss (5,2 % RMSE).</p></figcaption></figure></div>

Wir haben auch festgestellt, dass die Verwendung von Q8\_0 und F16 für einige Tensoren nicht verlustfrei ist, und es wird noch schlimmer, da QAT von DeepSeek angewendet wurde, damit MXFP4 / FP8 gut funktionieren, daher mussten wir sie direkt in BF16 belassen. Verwende also UD-Q8\_K\_XL für eine wirklich verlustfreie Quantisierung, und UD-Q4\_K\_XL wandelt einige der BF16-Elemente auf Q8\_0 herunter.

Für vollständige Benchmark-Tabellen von [GGUF Benchmarks, siehe hier](#gguf-benchmarks).

### :speech\_balloon: Verbesserungen der DeepSeek-V4-Chat-Vorlage

Wir haben auch die DeepSeek-V4-Chat-Jinja-Vorlage verbessert und über 4000 Konversationen getestet, um mit der goldenen Baseline (offizielles DS4) übereinzustimmen

Wir haben `reasoning_effort` hinzugefügt und du kannst `max, high` auswählen, genau wie beim offiziellen DeepSeek-V4. Wir fügen den korrekten System-Prompt gemäß DS4 voran und folgen dem Stil von gpt-oss.

Und für Tool-Calls, `reasoning_content` wurde für DS4 beibehalten, aber die Jinja-Chat-Vorlage würde sie ausschließen. Wir haben es wieder hinzugefügt.

#### **Denken deaktivieren, Reasoning-Effort ändern**

DeepSeek-V4 verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Efforts, wobei `reasoning_effort` „high“, „max“ oder deaktiviert sein kann.

Um das Denken zu deaktivieren, verwende `--chat-template-kwargs '{"enable_thinking":false}'`. Wenn du unter **Windows** Powershell bist, verwende: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Du kannst auch `--reasoning on` oder `--reasoning off` jetzt auch in llama.cpp verwenden!

Für die Anpassung des Reasoning-Efforts und/oder zum Deaktivieren von Reasoning, verwende die folgenden Beispiele:

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### ⚙️ Nutzungsleitfaden

DeepSeek-V4-Flash ist kleiner und schneller als DeepSeek-V4-Pro, mit **284B** Parametern (13B aktiv), und einem **1M Kontextfenster**. Das Modell hat 3 Modi, **Nicht denken**, **Denken** **Hoch** und **Denken** **Max**.&#x20;

Es wird empfohlen, `UD-IQ3_XXS` zu verwenden, das **103 GB** für die besten Ergebnisse ist. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht umfasst, versuche, mindestens **110 GB RAM** zu haben, um das Modell auszuführen.

Die `UD-Q8_K_XL` Quant ist DeepSeek-V4-Flash in voller ursprünglicher Präzision. Sie hat eine Größe von 162 GB und es ist am besten, mindestens 169 GB verfügbaren RAM/VRAM zu haben.

**Tabelle: Hardwareanforderungen für Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

<table><thead><tr><th>Format</th><th width="129.8004150390625">2-Bit</th><th width="130.85650634765625">1-Bit</th><th width="140.26702880859375">3-Bit</th><th>4-Bit (nahezu verlustfrei)</th><th>Q8_K_XL (verlustfrei)</th></tr></thead><tbody><tr><td>Standard</td><td>92 GB</td><td>102 GB</td><td>110-135 GB</td><td>162 GB</td><td>169 GB</td></tr><tr><td>DSpark</td><td>102 GB</td><td>112 GB</td><td>120-145 GB</td><td>172 GB</td><td>179 GB</td></tr></tbody></table>

{% hint style="info" %}
**DSpark verwendet mehr VRAM als Standard**, also plane **\~10 GB** zusätzlichen RAM/VRAM-Spielraum ein.
{% endhint %}

{% hint style="success" %}
Für beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher, einschließlich VRAM und Systemspeicher, die Größe der quantisierten Modelldatei mit einem komfortablen Puffer übersteigt.
{% endhint %}

### Empfohlene Einstellungen

DeepSeek empfiehlt diese Parameter für die beste Leistung: `temperature = 1.0`, `top-p = 1.0`. Für **DeepSeek-V4-Flash-0731** und agentische Szenarien `wird stattdessen top-p = 0.95` empfohlen und `top-p = 1.0` für andere Aufgaben.

**Think High ist standardmäßig aktiviert.** Wenn deaktiviert, kannst du es hier aktivieren: `--chat-template-kwargs '{"enable_thinking":true}'` oder über das UI-Dropdown in [Unsloth](#unsloth-studio-guide). Siehe auch [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column width="50%" %}

| DeepSeek-V4-Flash-0731                          |
| ----------------------------------------------- |
| `temperature = 1.0`                             |
| `top-p = 1.0`                                   |
| `wird stattdessen top-p = 0.95` (nur agentisch) |
| {% endcolumn %}                                 |

{% column width="50%" %}

| Altes DeepSeek-V4-Flash und V4-Pro |
| ---------------------------------- |
| `temperature = 1.0`                |
| `top-p = 1.0`                      |
| {% endcolumn %}                    |
| {% endcolumns %}                   |

* **Maximales Kontextfenster:** `1,048,576`
* Für Think Max setze den Kontext auf mindestens **384K Tokens**.

## DeepSeek-V4-Flash-Tutorials ausführen:

Für dieses Tutorial verwenden wir die 3-Bit-Quantisierung `UD-IQ3_XXS`, da sie auf ein Gerät mit 128 GB RAM passt. Ersetze `UD-IQ3_XXS` mit `UD-Q8_K_XL` (ursprüngliche Qualität) oder eine andere Quantisierung, wenn deine Maschine genügend Speicher hat. Du kannst DeepSeek-V4-Flash-0731 jetzt in [Unsloth Desktop](#run-in-unsloth-studio) . **DSpark wird automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

<a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#unsloth-studio-guide" class="button primary">🦥 Unsloth-Leitfaden</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Leitfaden</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#dspark-speculative-decoding" class="button secondary">⚡DSpark-Leitfaden</a>

### 🦥 Unsloth-Leitfaden

DeepSeek-V4-Flash-0731 kann jetzt ausgeführt und trainiert werden in [Unsloth](/docs/de/neu/studio.md), unserer neuen Open-Source-UI für lokale KI. Unsloth Desktop ermöglicht es dir, Modelle lokal auf **MacOS**, **Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameterabstimmung (Temp, Top-p usw.)
* Schnelle CPU- + GPU-Inferenz via llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="/files/d012b0a6c8fc17d9b1c9452433c13be53eb96768" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Läuft auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du lieber manuell installierst:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### DeepSeek-V4-Flash suchen und herunterladen

Gehe zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder Model Hub und suche in der Suchleiste nach DeepSeek-V4-Flash und lade dein gewünschtes Modell und die gewünschte Quantisierung herunter.

<figure><img src="/files/a81399c8aeaae5d5cb4cd1f2804feab13e08eab6" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### DeepSeek-V4-Flash-0731 ausführen

Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Da **Think High standardmäßig aktiviert ist**, kannst du im rechten Dropdown zu Nicht denken oder Think Max wechseln. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten. **DSpark wird automatisch aktiviert in** [**Unsloth**](#unsloth-studio-guide)**.**

Für weitere Informationen kannst du unseren [Unsloth-Inferenzleitfaden](/docs/de/neu/studio/chat.md).

<figure><img src="/files/269d1d01f856c34aa6a4faadce9d3b23f0a6f68b" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-Leitfaden

{% stepper %}
{% step %}
Erhalte die neueste `llama.cpp` **auf** [**GitHub hier**](https://github.com/ggml-org/llama.cpp). Du kannst auch den folgenden Build-Anweisungen folgen. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine GPU hast oder nur CPU-Inferenz möchtest. **Für Apple Mac / Metal-Geräte**, setze `-DGGML_CUDA=OFF` dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Du kannst jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wähle zuerst den gewünschten Quantisierungstyp wie `IQ3_XXS`. Verwende auch `export LLAMA_CACHE="folder"` um `llama.cpp` zu zwingen, an einem bestimmten Ort zu speichern. Beachte, dass dieser Downloadvorgang sehr langsam sein könnte, daher ist es wahrscheinlich am besten, den manuellen Downloadprozess im nächsten Abschnitt zu verwenden.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endstep %}

{% step %}
Wenn du das Modell manuell herunterladen möchtest, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Debugging für Hugging Face Hub, XET](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*UD-IQ3_S*" # Verwende "*UD-IQ4_XS*" für 4-Bit
```

{% endstep %}

{% step %}
Du kannst `--threads 32` für die Anzahl der CPU-Threads bearbeiten, `--ctx-size 32768` für die Kontextlänge, `--n-gpu-layers 2` für GPU-Offloading, wie viele Schichten. Versuche, es anzupassen, wenn dein GPU-Speicher knapp wird. Entferne es auch, wenn du nur CPU-Inferenz hast.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_S/DeepSeek-V4-Flash-0731-UD-IQ3_S-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

## :zap:DSpark - Spekulatives Dekodieren

DeepSeek-V4-Flash-0731 hat natives DSpark, das bis zu **2x schnellere Dekodiergeschwindigkeit**ermöglicht! DSpark ist ein neuer Algorithmus von DeepSeek, der naiver MTP überlegen ist und in diesem [Papier](https://arxiv.org/abs/2607.05147)eingeführt wurde. DSpark ermöglicht es DeepSeek-V4-Flash, **120 Tokens/s** auf einer B200-GPU zu erreichen, verglichen mit der ursprünglichen Baseline von 60 Tokens/s. **DSpark ist automatisch aktiviert in der** [**Unsloth**](#unsloth-studio-guide) **lokalen UI.**

Llama.cpp hat DSpark als Teil von integriert [PR 25784](https://github.com/ggml-org/llama.cpp/pull/25784) mit weiteren Verbesserungen für Multi-GPU und mehr. Wir zeigen die Verwendung von `--spec-draft-n-max 3` als gute Standardeinstellung, was 1,9x schnellere Inferenzgeschwindigkeit ermöglicht. Höhere Werte scheinen langsamer zu sein.

<figure><img src="/files/1ef9299b485a1178a55d5a5b5be15578bfc20a26" alt=""><figcaption></figcaption></figure>

Lade sowohl den Drafter als auch das GGUF herunter - wir haben 2 Q8\_0 und die verlustfreie BF16-Version erstellt. Beachte, dass DSpark etwa 10 GB mehr Speicher benötigt, also brauchen 128-GB-Maschinen IQ3\_XXS und Q8\_0

{% code overflow="wrap" %}

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*dspark-DeepSeek-V4-Flash-0731-Q8_0*" \\
    --include "*UD-IQ3_XXS*" # Verwende "*UD-IQ4_XS*" für 4-Bit
```

{% endcode %}

Dann lade es über llama-cli oder llama-server:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf \\
    -md unsloth/DeepSeek-V4-Flash-0731-GGUF/dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01 \\
    --spec-type draft-dspark \\
    --spec-draft-n-max 3 \\
    -ngl 99 -ngld 99
```

{% endcode %}

Benchmarks aus dem ursprünglichen DSpark-Paper, die auch zeigen, wie es sich gegen MTP schlägt:

<figure><img src="/files/31378eddd0eb40a987f32efa852f3d45ac897b1f" alt=""><figcaption></figcaption></figure>

## 📊 Benchmarks

### GGUF Benchmarks

Siehe unten eine Tabelle, die Benchmarks für Quants von Unsloth und anderen Anbietern vergleicht. Referenz = offizielle Gewichte. Perplexity und KL-Divergenz über wikitext-2 bei ctx 512 auf 4x B200.

<figure><img src="/files/063f5e34f94560c36fe5d301197820a343206c37" alt="" width="563"><figcaption></figcaption></figure>

| Quant                                 | Größe (GB) | PPL    | Mittlere KLD          | RMS delta-p | Gleiches Top-Token | Bitgenaue Gewichte |
| ------------------------------------- | ---------- | ------ | --------------------- | ----------- | ------------------ | ------------------ |
| Offiziell (Referenz)                  | 156.4      | 4.5319 | 0                     | 0%          | 100%               | 100%               |
| **Unsloth UD-Q8\_K\_XL**              | 161.9      | 4.5319 | **\~0 (verlustfrei)** | 0.000%      | 100.000%           | **100.000%**       |
| **Unsloth UD-Q4\_K\_XL**              | 155.1      | 4.5335 | 0.0102                | 3.40%       | 96.28%             | 97.46%             |
| bartowski MXFP4                       | 156.0      | 4.5351 | 0.0105                | 3.42%       | 96.18%             | 97.57%             |
| antirez Q4KExperts-F16 (imatrix)      | 164.6      | 4.5743 | 0.0291                | 5.87%       | 93.95%             | 0.51%              |
| antirez Q4KExperts-F16                | 164.6      | 4.5726 | 0.0290                | 5.89%       | 93.94%             | 0.93%              |
| antirez gemischt L37-42-Q4K (imatrix) | 97.6       | 5.8169 | 0.3605                | 21.15%      | 79.74%             | 0.41%              |
| antirez IQ2XXS (imatrix)              | 86.7       | 6.0808 | 0.4079                | 22.23%      | 78.15%             | 0.39%              |
| antirez IQ2XXS                        | 86.7       | 6.1518 | 0.4207                | 22.74%      | 77.92%             | 0.47%              |

### Offizielle Benchmarks

DeepSeek-V4-Flash-0731 übertrifft DeepSeek-V4-Pro (Vorschau) in den untenstehenden Benchmarks, obwohl es deutlich weniger aktivierte Parameter verwendet, und bleibt mit führenden proprietären Modellen wettbewerbsfähig.

| Benchmark                  | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash (Vorschau) | DeepSeek-V4-Pro (Vorschau) | GLM-5.2 | Opus-4.8 |
| -------------------------- | :--------------------: | :--------------------------: | :------------------------: | :-----: | :------: |
| Terminal Bench 2.1         |          82.7          |             61.8             |            72.1            |   81.0  |   85.0   |
| NL2Repo                    |          54.2          |             39.4             |            38.5            |   48.9  |   69.7   |
| Cybergym                   |          76.7          |             38.7             |            52.7            |    -    |   83.1   |
| DeepSWE                    |          54.4          |              7.3             |            12.8            |   46.2  |   58.0   |
| Toolathlon-Verified        |          70.3          |             49.7             |            55.9            |   59.9  |   76.2   |
| Letzte Prüfung der Agenten |          25.2          |             15.8             |            16.5            |   23.8  |   25.7   |
| AutomationBench Public     |          25.1          |             10.8             |            12.8            |   12.9  |   27.2   |
| DSBench-FullStack †        |          68.7          |             37.0             |            41.8            |   61.8  |   71.6   |
| DSBench-Hart †             |          59.6          |             25.8             |            31.1            |   54.5  |   71.7   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
