> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/deepseek-v4.md).

# DeepSeek-V4: Wie man es lokal ausführt

DeepSeek-V4 ist DeepSeeks neue offene Modellreihe, einschließlich **DeepSeek-V4-Pro** mit **1.6T** Parametern (49B aktiv) und **DeepSeek-V4-Flash** mit **284B** Parametern (13B aktiv). Die Modelle überzeugen beim Programmieren, agentischen Workflows und Chatten mit einem **1M-Kontext** Fenster. In dieser Anleitung zeigen wir Ihnen, wie Sie DeepSeek-V4-Flash lokal ausführen: [DeepSeek-V4-Flash GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)

Für **verlustfrei** DeepSeek verwenden Sie Q8 (`UD-Q8_K_XL`), was nur **7 GB größer** als Q4 (`UD-Q4_K_XL`). Das verlustfreie 8-Bit-GGUF ist **162 GB** und 3-Bit ist **103 GB** das auf einem **110 GB RAM** Gerä&#x74;**.** DeepSeek-V4-Flash erreicht 86,2 % auf MMLU-Pro, 88,1 % auf GPQA Diamond und 56,9 % auf Terminal Bench 2.0.

{% hint style="success" %}
**7. Juli:** DeepSeek-V4 ist jetzt einsatzbereit! Wir haben auch die [DeepSeek-V4-Chat-Jinja-Vorlage](#deepseek-v4-chat-template-improvements)verbessert und über 4000 Unterhaltungen getestet, um mit der offiziellen Baseline gleichwertig zu sein.
{% endhint %}

<a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#usage-guide" class="button primary">Anleitung</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#run-deepseek-v4-flash-tutorials" class="button primary">Ausführungstutorials</a>

### :llama: Korrekturen für die DeepSeek-V4-Implementierung in llama.cpp

llama.cpp hat DeepSeek-V4-Unterstützung hinzugefügt in [24162](https://github.com/ggml-org/llama.cpp/pull/24162) - uns ist aufgefallen, dass bei der Verwendung eines beliebigen GGUF von **jedem Anbieter**, mehrstufige Unterhaltungen im Vergleich zur Hugging-Face-Baseline von DS4 bei Verwendung der KV-Cache-Quantisierung nicht gut funktionieren würden `--cache-type k/v q8_0` - das wurde inzwischen behoben und seit dem 7. Juli 2026 in llama.cpp zusammengeführt mit [25202](https://github.com/ggml-org/llama.cpp/pull/25202)

Vor der Korrektur würde das Aufrufen von DeepSeek-Quants insbesondere dazu führen, dass `overlayotin kinetic academyléléléléulif` und nach dem PR „Die Hauptstadt Frankreichs ist Paris.“ was korrekt ist.

<table><thead><tr><th>Engine</th><th width="91.54998779296875">Punktzahl</th><th width="122.60003662109375">Berechnung</th><th width="114.5">Werkzeugauswahl</th><th width="97.4000244140625">Parallele Tools</th><th width="112.699951171875">Multi-Turn-Tools</th><th>Verschachtelte Tools</th></tr></thead><tbody><tr><td>Offizieller Code</td><td><strong>15/15</strong></td><td>3</td><td>3</td><td>3</td><td>3</td><td>3</td></tr><tr><td>Beliebiger Anbieter</td><td><strong>4/15</strong></td><td>1</td><td>2</td><td>0</td><td>0</td><td>1</td></tr><tr><td><strong>Danach</strong> <a href="https://github.com/ggml-org/llama.cpp/pull/25202">25202</a></td><td><strong>15/15</strong></td><td>3</td><td>2</td><td>3</td><td>3</td><td>3</td></tr></tbody></table>

### :speech\_balloon: Verbesserungen der DeepSeek-V4-Chat-Vorlage

Wir haben auch die DeepSeek-V4-Chat-Jinja-Vorlage verbessert und über 4000 Unterhaltungen getestet, um dem Goldstandard (offizielles DS4) zu entsprechen

Wir haben hinzugefügt `reasoning_effort` und Sie können auswählen `max, high` genau wie beim offiziellen DeepSeek-V4. Wir stellen den korrekten System-Prompt gemäß DS4 voran und folgen dem Stil von gpt-oss.

Und für Tool-Aufrufe, `reasoning_content` wurde für DS4 beibehalten, aber die Jinja-Chat-Vorlage würde sie ausschließen. Wir haben sie wieder hinzugefügt.

**Denken deaktivieren, Reasoning-Aufwand ändern**

DeepSeek-V4 verwendet standardmäßig Reasoning. Es unterstützt außerdem Reasoning-Aufwände, bei denen `reasoning_effort` kann „high“, „max“ oder deaktiviert sein.

Um das Denken zu deaktivieren, verwenden Sie `--chat-template-kwargs '{"enable_thinking":false}'`. Wenn Sie auf **Windows** PowerShell verwenden, nutzen Sie: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Sie können auch `--reasoning on` oder `--reasoning off` jetzt ebenfalls in llama.cpp verwenden!

Für die Anpassung des Reasoning-Aufwands und/oder zum Deaktivieren des Reasonings verwenden Sie die folgenden Beispiele:

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### 📊 Quantisierungsanalyse

Unser `UD-Q8_K_XL` Quant ist vollständig verlustfrei. DeepSeek-V4-Flash ist [quantisierungsbewusst trainiert](/docs/de/blog/quantization-aware-training-qat.md): Der offizielle Checkpoint speichert seine gerouteten Experten (96 % des Modells) nativ in MXFP4 und alles andere in FP8 oder BF16. GGUFs MXFP4 ist genau dieses Format, daher packen wir die Experten bitgenau neu, und FP8 wird ohne Rundung in BF16 dequantisiert. Wir haben jeden Tensor mit den offiziellen DeepSeek-Gewichten verglichen: Alle 1.328 sind bitidentisch, und es bleibt bei der Inferenz verlustfrei (KL-Divergenz \~0, 100 % Übereinstimmung des Top-Tokens).

**Nicht**-Unsloth DeepSeek-V4-Flash-GGUFs wurden ohne diese Pfade konvertiert und weichen daher von den offiziellen Gewichten ab. `UD-Q4_K_XL` behält dieselben bitgenauen Experten bei und quantisiert nur die Nicht-Experten-Tensoren (4 % des Modells) auf Q8\_0, sodass es in Größe und Qualität direkt neben Q8 liegt.

<div align="left"><figure><img src="/files/063f5e34f94560c36fe5d301197820a343206c37" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="/files/195a4b97b03b7b778e3c6d33198d6d7853a81f3b" alt="" width="563"><figcaption></figcaption></figure></div>

Gemessen an den offiziellen Gewichten liegen beide Unsloth-Quants an der Qualitäts-/Größen-Frontier. UD-Q8\_K\_XL ist der einzige verlustfreie Punkt. UD-Q4\_K\_XL entspricht anderen Community-MXFP4-Formaten und ist genauer als die Q4\_K-Experten-Konvertierungen, die größer sind und dennoch bei 0,029 KLD landen.

<div align="left"><figure><img src="/files/d21be7de139f60968a9e60198bac8277df07302a" alt="" width="563"><figcaption></figcaption></figure></div>

Die nach Schichten aufgeschlüsselte Fehlerverteilung zeigt, warum. Wenn die nativen MXFP4-Experten beibehalten werden, bedeutet das 0 % Gewichtsfehler auf jeder Schicht. Konvertierungen, die die Experten auf Q4\_K oder IQ2\_XXS neu quantisieren, runden fast jedes Gewicht: 5 % für Q4\_K, über 30 % für IQ2\_XXS.

<div align="left"><figure><img src="/files/e1a6971f06b09e7bd88684d03aa944cd69fbefdf" alt="" width="563"><figcaption><p>Unser MXFP4 hat bei allen 8,4 Mio. Gewichten genau null Fehler, während Q4_K, ein anderes 4-Bit-Gitter, jedes einzelne runden muss (5,2 % RMSE).</p></figcaption></figure></div>

Wir haben auch festgestellt, dass die Verwendung von Q8\_0 und F16 für einige Tensoren nicht verlustfrei ist, und es wird noch schlimmer, da DeepSeek QAT angewendet hat, damit MXFP4 / FP8 gut funktionieren, sodass wir sie direkt in BF16 belassen mussten. Verwenden Sie also UD-Q8\_K\_XL für ein wirklich verlustfreies Quant, und UD-Q4\_K\_XL wandelt einige der BF16-Elemente auf Q8\_0 herunter.

Für vollständige Benchmark-Tabellen von [GGUF-Benchmarks, siehe hier](#gguf-benchmarks).

#### ⚙️ Gebrauchsanleitung

DeepSeek-V4-Flash ist kleiner und schneller als DeepSeek-V4-Pro, mit **284B** Parametern (13B aktiv) und einem **1M-Kontextfenster**. Das Modell hat 3 Modi, **Ohne Denken**, **Denken** **Hoch** und **Denken** **Max**.&#x20;

Es wird empfohlen, `UD-IQ3_XXS` zu verwenden, **103 GB** was **110 GB RAM** für beste Ergebnisse. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht enthält, versuchen Sie, mindestens

Das `UD-Q8_K_XL` Quant ist DeepSeek-V4-Flash in voller Originalpräzision. Es hat eine Größe von 162 GB, und idealerweise sollten mindestens 169 GB verfügbarer RAM/VRAM vorhanden sein.

**Tabelle: Hardwareanforderungen für die Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

<table><thead><tr><th width="129.8004150390625">1-Bit</th><th width="130.85650634765625">2-Bit</th><th width="140.26702880859375">3-Bit</th><th>4-Bit (nahezu verlustfrei)</th><th>Q8_K_XL (verlustfrei)</th></tr></thead><tbody><tr><td>92 GB</td><td>102 GB</td><td>110-135 GB</td><td>162 GB</td><td>169 GB</td></tr></tbody></table>

{% hint style="success" %}
Für die beste Leistung stellen Sie sicher, dass Ihr insgesamt verfügbarer Speicher, einschließlich VRAM und System-RAM, die Dateigröße des quantisierten Modells mit einem bequemen Puffer übersteigt.
{% endhint %}

#### Empfohlene Einstellungen

DeepSeek empfiehlt diese Parameter für die beste Leistung: `temperature=1.0`, `top-p=1.0`

**Think High ist standardmäßig aktiviert.** Wenn deaktiviert, können Sie es folgendermaßen aktivieren: `--chat-template-kwargs '{"enable_thinking":true}'` oder es über das UI-Dropdown in [Unsloth Studio](#unsloth-studio-guide)umschalten. Siehe auch [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column %}

| `temperature = 1.0` |
| ------------------- |
| `top-p = 1.0`       |
| {% endcolumn %}     |

{% column %}

* **Maximales Kontextfenster:** `1,048,576`
* Für Think Max stellen Sie den Kontext mindestens auf **384K Tokens**.
  {% endcolumn %}
  {% endcolumns %}

## Tutorials zum Ausführen von DeepSeek-V4-Flash:

Für dieses Tutorial verwenden wir das 3-Bit-Quant `UD-IQ3_XXS`, da es auf ein Gerät mit 128 GB RAM passt. Ersetzen Sie `UD-IQ3_XXS` mit `UD-Q8_K_XL` (Originalqualität) oder ein anderes Quant, wenn Ihr Rechner über genügend Speicher verfügt. Sie können DeepSeek-V4-Flash jetzt in [Unsloth Studio](#run-in-unsloth-studio).

<a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#unsloth-studio-guide" class="button primary">🦥 Unsloth-Studio-Anleitung</a><a href="/pages/57db3350b759d3dda1134db7bb3461c7a42ecabf#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Anleitung</a>

### 🦥 Unsloth-Studio-Anleitung

DeepSeek-V4-Flash kann jetzt in ausgeführt und trainiert werden [Unsloth Studio](/docs/de/neu/studio.md), unserer neuen Open-Source-Weboberfläche für lokale KI. Mit Unsloth Studio können Sie Modelle lokal auf **macOS**, **Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](/docs/de/neu/studio.md#model-arena) Parameterabstimmung (temp, top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/14f449fb919ee3a1821aea142737982f1e903e14" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Stellen Sie sicher, dass Sie die neueste Version verwenden. Führen Sie in Ihrem Terminal aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**macOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Dann öffnen Sie `http://127.0.0.1:8888` (oder Ihre spezifische URL) in Ihrem Browser.
{% endstep %}

{% step %}

#### DeepSeek-V4-Flash suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden. Gehen Sie dann zum [Unsloth Chat](/docs/de/neu/studio/chat.md) Tab und suchen Sie in der Suchleiste nach DeepSeek-V4-Flash und laden Sie das gewünschte Modell und Quant herunter.

<figure><img src="/files/0ecf3be35b7735aed8feb3f97b69cbd14af7ccb7" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### DeepSeek-V4-Flash ausführen

Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Da **Think High standardmäßig aktiviert ist**, können Sie im rechten Dropdown zwischen Ohne Denken oder Think Max umschalten. Sie können auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere [Inferenzanleitung für Unsloth Studio](/docs/de/neu/studio/chat.md).

<figure><img src="/files/d0fc7fb63bbb9a1d9e04b7d7ee876fcebd7515e6" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-Anleitung

{% stepper %}
{% step %}
Holen Sie sich die neueste `llama.cpp` **auf** [**GitHub hier**](https://github.com/ggml-org/llama.cpp). Sie können auch den untenstehenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz wünschen. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Sie können jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wählen Sie zunächst den gewünschten Quantisierungstyp aus, zum Beispiel `IQ3_XXS`. Verwenden Sie außerdem `export LLAMA_CACHE="folder"` um zu erzwingen `llama.cpp` dass es an einem bestimmten Speicherort gespeichert wird. Beachten Sie, dass dieser Download-Vorgang sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/DeepSeek-V4-Flash-GGUF:UD-IQ3_XXS \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

{% endstep %}

{% step %}
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-GGUF \\
    --include "*UD-IQ3_XXS*" # Verwenden Sie "*UD-IQ4_XS*" für 4-Bit
```

{% endstep %}

{% step %}
Sie können `--threads 32` für die Anzahl der CPU-Threads, `--ctx-size 32768` für die Kontextlänge, `--n-gpu-layers 2` für das GPU-Offloading, auf wie vielen Layern. Probieren Sie es anzupassen, wenn Ihrer GPU der Speicher ausgeht. Entfernen Sie es außerdem, wenn Sie nur CPU-Inferenz haben.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-GGUF/blob/main/UD-IQ3_XXS/DeepSeek-V4-Flash-UD-IQ3_XXS-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

### GGUF-Benchmarks

Siehe unten für eine Tabelle, die Benchmarks für Quants von Unsloth und anderen Anbietern vergleicht. Referenz = offizielle Gewichte. Perplexity und KL-Divergenz über wikitext-2 bei ctx 512 auf 4x B200.

<figure><img src="/files/063f5e34f94560c36fe5d301197820a343206c37" alt="" width="563"><figcaption></figcaption></figure>

| Quant                                 | Größe (GB) | PPL    | Mittlere KLD          | RMS Δp | Gleiches Top-Token | Bitgenaue Gewichte |
| ------------------------------------- | ---------- | ------ | --------------------- | ------ | ------------------ | ------------------ |
| Offiziell (Referenz)                  | 156.4      | 4.5319 | 0                     | 0%     | 100%               | 100%               |
| **Unsloth UD-Q8\_K\_XL**              | 161.9      | 4.5319 | **\~0 (verlustfrei)** | 0.000% | 100.000%           | **100.000%**       |
| **Unsloth UD-Q4\_K\_XL**              | 155.1      | 4.5335 | 0.0102                | 3.40%  | 96.28%             | 97.46%             |
| bartowski MXFP4                       | 156.0      | 4.5351 | 0.0105                | 3.42%  | 96.18%             | 97.57%             |
| antirez Q4KExperts-F16 (imatrix)      | 164.6      | 4.5743 | 0.0291                | 5.87%  | 93.95%             | 0.51%              |
| antirez Q4KExperts-F16                | 164.6      | 4.5726 | 0.0290                | 5.89%  | 93.94%             | 0.93%              |
| antirez gemischt L37-42-Q4K (imatrix) | 97.6       | 5.8169 | 0.3605                | 21.15% | 79.74%             | 0.41%              |
| antirez IQ2XXS (imatrix)              | 86.7       | 6.0808 | 0.4079                | 22.23% | 78.15%             | 0.39%              |
| antirez IQ2XXS                        | 86.7       | 6.1518 | 0.4207                | 22.74% | 77.92%             | 0.47%              |

### Offizielle Benchmarks

Weiter unten finden Sie Benchmarks in Tabellenform:

<figure><img src="/files/1715c02376796124994d5a3d135193143ee7d815" alt="" width="563"><figcaption></figcaption></figure>

| Benchmark (Metrik)          | V4-Flash Ohne Denken | V4-Flash Hoch | V4-Flash Max | V4-Pro Ohne Denken | V4-Pro Hoch | V4-Pro Max |
| --------------------------- | :------------------: | :-----------: | :----------: | :----------------: | :---------: | :--------: |
| **Wissen & Schlussfolgern** |                      |               |              |                    |             |            |
| MMLU-Pro (EM)               |         83.0         |      86.4     |     86.2     |        82.9        |     87.1    |  **87.5**  |
| SimpleQA-Verified (Pass\@1) |         23.1         |      28.9     |     34.1     |        45.0        |     46.2    |  **57.9**  |
| Chinese-SimpleQA (Pass\@1)  |         71.5         |      73.2     |     78.9     |        75.8        |     77.7    |  **84.4**  |
| GPQA Diamond (Pass\@1)      |         71.2         |      87.4     |     88.1     |        72.9        |     89.1    |  **90.1**  |
| HLE (Pass\@1)               |          8.1         |      29.4     |     34.8     |         7.7        |     34.5    |  **37.7**  |
| LiveCodeBench (Pass\@1)     |         55.2         |      88.4     |     91.6     |        56.8        |     89.8    |  **93.5**  |
| Codeforces (Rating)         |           -          |      2816     |     3052     |          -         |     2919    |  **3206**  |
| HMMT 2026 Feb (Pass\@1)     |         40.8         |      91.9     |     94.8     |        31.7        |     94.0    |  **95.2**  |
| IMOAnswerBench (Pass\@1)    |         41.9         |      85.1     |     88.4     |        35.3        |     88.0    |  **89.8**  |
| Apex (Pass\@1)              |          1.0         |      19.1     |     33.0     |         0.4        |     27.4    |  **38.3**  |
| Apex Shortlist (Pass\@1)    |          9.3         |      72.1     |     85.7     |         9.2        |     85.5    |  **90.2**  |
| **Langer Kontext**          |                      |               |              |                    |             |            |
| MRCR 1M (MMR)               |         37.5         |      76.9     |     78.7     |        44.7        |     83.3    |  **83.5**  |
| CorpusQA 1M (ACC)           |         15.5         |      59.3     |     60.5     |        35.6        |     56.5    |  **62.0**  |
| **Agentisch**               |                      |               |              |                    |             |            |
| Terminal Bench 2.0 (Acc)    |         49.1         |      56.6     |     56.9     |        59.1        |     63.3    |  **67.9**  |
| SWE Verified (gelöst)       |         73.7         |      78.6     |     79.0     |        73.6        |     79.4    |  **80.6**  |
| SWE Pro (gelöst)            |         49.1         |      52.3     |     52.6     |        52.1        |     54.4    |  **55.4**  |
| SWE Multilingual (gelöst)   |         69.7         |      70.2     |     73.3     |        69.8        |     74.1    |  **76.2**  |
| BrowseComp (Pass\@1)        |           -          |      53.5     |     73.2     |          -         |     80.4    |  **83.4**  |
| HLE mit Tools (Pass\@1)     |           -          |      40.3     |     45.1     |          -         |     44.7    |  **48.2**  |
| MCPAtlas (Pass\@1)          |         64.0         |      67.4     |     69.0     |        69.4        |   **74.2**  |    73.6    |
| GDPval-AA (Elo)             |           -          |       -       |     1395     |          -         |      -      |  **1554**  |
| Toolathlon (Pass\@1)        |         40.7         |      43.5     |     47.8     |        46.3        |     49.0    |  **51.8**  |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
