> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/deepseek-v4.md).

# DeepSeek-V4 : comment exécuter localement

DeepSeek-V4, DeepSeek-V4-**Pro-0813**, et DeepSeek-V4-**Flash-0731** sont de nouveaux modèles à poids ouverts - la variante Flash possède 284B paramètres (13B actifs), tandis que V4-Pro en a 1.6T (49B actifs). **V4-Pro-0813**, sorti le **13 août**, égalise les performances de Claude-4.8-Opus, tandis que **V4-Flash-0731**, sorti le **31 juillet**, offre les meilleures performances de sa catégorie de taille et **surpasse V4-Pro** (Aperçu). Conçu pour les workflows de codage, agentiques et de chat avec une **fenêtre de contexte de 1M**, ce guide montre comment exécuter DeepSeek-V4-Flash-0731 localement à l'aide des GGUF dynamiques d'Unsloth et [Unsloth Desktop](/docs/fr/desktop.md).

Pour **sans perte** DeepSeek, utilisez Q8 (`UD-Q8_K_XL`), qui n'est que **7 Go plus volumineux** que Q4 (`UD-Q4_K_XL`). Le GGUF 8 bits sans perte fait **162 Go** et le 3 bits fait **103 Go** qui peut s'exécuter sur un **appareil avec 110 Go de RAM** apparei&#x6C;**.** DeepSeek-V4-Flash-0731 obtient 82,7 % sur Terminal Bench 2.1, 54,4 % sur DeepSWE et 54,2 % sur NL2Repo. [DSpark](#dspark-speculative-decoding) est également activé pour les GGUF, permettant jusqu'à **une vitesse de décodage 2x plus rapide**!

{% hint style="success" %}
**13 août :** DeepSeek-**V4-Pro-0813** a été publié et [les quants sont maintenant](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) disponibles à l'exécution.
{% endhint %}

{% hint style="success" %}
**6 août : DSpark est activé pour DeepSeek-V4-Flash-0731 - permettant une inférence 1,5x à 1,9x plus rapide ! DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

Nous avons également amélioré le [modèle Jinja de chat DeepSeek-V4](#deepseek-v4-chat-template-improvements), et l'avons testé sur plus de 4000 conversations pour qu'il soit équivalent à la base de référence officielle.
{% endhint %}

| [DeepSeek-V4-Pro-0813-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) | [DeepSeek-V4-Flash-**0731**-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF) | [DeepSeek-V4-Flash-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF) |
| ------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------- |

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#usage-guide" class="button primary">Guide d'utilisation</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#run-deepseek-v4-flash-tutorials" class="button primary">Tutoriels d'exécution</a>

### 📊 Analyse de la quantification

Notre `UD-Q8_K_XL` quantification est entièrement sans perte. DeepSeek-V4-Flash est [entraîné en tenant compte de la quantification](/docs/fr/blog/quantization-aware-training-qat.md): le point de contrôle officiel stocke ses experts routés (96 % du modèle) nativement en MXFP4 et tout le reste en FP8 ou BF16. Le MXFP4 de GGUF correspond exactement à ce format, donc nous réempaquetons les experts bit pour bit, et FP8 se déquantifie en BF16 sans arrondi. Nous avons vérifié chaque tenseur par rapport aux poids officiels de DeepSeek : les 1 328 sont tous identiques bit à bit, et cela reste sans perte à l'inférence (divergence KL \~0, accord à 100 % sur le top token).

**Non**-Unsloth Les GGUF DeepSeek-V4-Flash ont été convertis sans ces chemins, s'écartant ainsi des poids officiels. `UD-Q4_K_XL` conserve les mêmes experts identiques au bit près et ne quantifie que les tenseurs non experts (4 % du modèle) en Q8\_0, ce qui le place juste à côté de Q8 en taille et en qualité.

<div align="left"><figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="/files/934b2d29cd71dcecf4b5a805b57dab9d76810006" alt="" width="563"><figcaption></figcaption></figure></div>

Mesurées par rapport aux poids officiels, les deux quantifications Unsloth se situent sur la frontière qualité/taille. UD-Q8\_K\_XL est le seul point sans perte. UD-Q4\_K\_XL correspond aux autres formats MXFP4 communautaires et est plus précis que les conversions Q4\_K-experts, qui sont plus volumineuses mais atteignent 0,029 KLD.

<div align="left"><figure><img src="/files/943eddf7524374cdc6cc3d6df0496feda89a0a0c" alt="" width="563"><figcaption></figcaption></figure></div>

La répartition des erreurs par couche montre pourquoi. Conserver les experts MXFP4 natifs signifie 0 % d'erreur de poids à chaque couche. Les conversions qui re-quantifient les experts en Q4\_K ou IQ2\_XXS arrondissent presque chaque poids : 5 % pour Q4\_K, plus de 30 % pour IQ2\_XXS.

<div align="left"><figure><img src="/files/7f5f60767e049257740aad15bf25e35260e84d00" alt="" width="563"><figcaption><p>Notre MXFP4 présente exactement zéro erreur sur les 8,4 M de poids, tandis que Q4_K, une grille 4 bits différente, doit arrondir chacun d'eux (5,2 % RMSE).</p></figcaption></figure></div>

Nous avons également constaté que l'utilisation de Q8\_0 et F16 pour certains tenseurs n'est pas sans perte, et cela empire puisque le QAT a été appliqué par DeepSeek pour faire fonctionner correctement MXFP4 / FP8, nous avons donc dû les laisser directement en BF16. Utilisez donc UD-Q8\_K\_XL pour une véritable quantification sans perte, et UD-Q4\_K\_XL rétrograde certains éléments BF16 en Q8\_0.

Pour les tableaux complets des [Benchmarks GGUF, voir ici](#gguf-benchmarks).

### :speech\_balloon: Améliorations du modèle de chat DeepSeek V4

Nous avons également amélioré le modèle Jinja de chat DeepSeek-V4, et l'avons testé sur plus de 4000 conversations pour qu'il soit équivalent à la référence dorée (DS4 officiel)

Nous avons ajouté `reasoning_effort` et vous pouvez choisir `max, high` tout comme le DeepSeek-V4 officiel. Nous préfixons l'invite système correcte conformément à DS4, et avons suivi le style de gpt-oss.

Et pour les appels d'outils, `reasoning_content` a été conservé pour DS4, mais le modèle de chat Jinja les exclurait. Nous l'avons réajouté.

#### **Désactiver la réflexion, modifier l'effort de raisonnement**

DeepSeek-V4 utilise le raisonnement par défaut. Il prend également en charge des niveaux d'effort de raisonnement où `reasoning_effort` peut être "high", "max" ou désactivé.

Pour désactiver la réflexion, utilisez `--chat-template-kwargs '{"enable_thinking":false}'`. Si vous êtes sur **Windows** PowerShell, utilisez : `--chat-template-kwargs "{\"enable_thinking\":false}"`

Vous pouvez également utiliser `--reasoning on` ou `--reasoning off` dans llama.cpp également désormais !

Pour personnaliser l'effort de raisonnement ou désactiver le raisonnement, utilisez les exemples ci-dessous :

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### ⚙️ Guide d'utilisation

DeepSeek-V4-Flash est plus petit et plus rapide que DeepSeek-V4-Pro, avec **284B** paramètres (13B actifs), et une **fenêtre de contexte de 1M**. Le modèle a 3 modes, **Sans réflexion**, **Réfléchir** **Élevé** et **Réfléchir** **Max**.&#x20;

Il est recommandé d'utiliser `UD-IQ3_XXS` qui est **103 Go** pour obtenir les meilleurs résultats. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation du contexte, essayez d'avoir au moins **appareil avec 110 Go de RAM** pour exécuter le modèle.

Le `UD-Q8_K_XL` quantification est DeepSeek-V4-Flash en précision d'origine complète. Sa taille est de 162 Go et il vaut mieux disposer d'au moins 169 Go de RAM/VRAM disponibles.

**Tableau : Exigences matérielles pour l'inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th>Format</th><th width="129.8004150390625">1 bit</th><th width="130.85650634765625">2 bits</th><th width="140.26702880859375">3 bits</th><th>4 bits (quasi sans perte)</th><th>Q8_K_XL (sans perte)</th></tr></thead><tbody><tr><td>Standard</td><td>92 Go</td><td>102 Go</td><td>110-135 Go</td><td>162 Go</td><td>169 Go</td></tr><tr><td>DSpark</td><td>102 Go</td><td>112 Go</td><td>120-145 Go</td><td>172 Go</td><td>179 Go</td></tr></tbody></table>

{% hint style="info" %}
**DSpark utilise plus de VRAM que le standard**, prévoyez donc **\~10 Go** de marge supplémentaire en RAM/VRAM.
{% endhint %}

{% hint style="success" %}
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse confortablement la taille du fichier du modèle quantifié.
{% endhint %}

### Paramètres recommandés

DeepSeek recommande ces paramètres pour obtenir les meilleures performances : `temperature = 1.0`, `top-p = 1.0`. Pour **DeepSeek-V4-Flash-0731** et les scénarios agentiques, `top-p = 0.95` est suggéré à la place et `top-p = 1.0` pour les autres tâches.

**Think High est activé par défaut.** S'il est désactivé, vous pouvez l'activer via : `--chat-template-kwargs '{"enable_thinking":true}'` ou le basculer via le menu déroulant de l'interface dans [Unsloth](#unsloth-studio-guide). Voir aussi [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column width="50%" %}

| DeepSeek-V4-Flash-0731                |
| ------------------------------------- |
| `temperature = 1.0`                   |
| `top-p = 1.0`                         |
| `top-p = 0.95` (agentique uniquement) |
| {% endcolumn %}                       |

{% column width="50%" %}

| Ancien DeepSeek-V4-Flash et V4-Pro |
| ---------------------------------- |
| `temperature = 1.0`                |
| `top-p = 1.0`                      |
| {% endcolumn %}                    |
| {% endcolumns %}                   |

* **Fenêtre de contexte maximale :** `1,048,576`
* Pour Think Max, réglez le contexte à au moins **384K tokens**.

## Exécuter les tutoriels DeepSeek-V4-Flash :

Pour ce tutoriel, nous utiliserons la quantification 3 bits `UD-IQ3_XXS`, car elle tient sur un appareil avec 128 Go de RAM. Remplacez `UD-IQ3_XXS` par `UD-Q8_K_XL` (qualité d'origine) ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter DeepSeek-V4-Flash-0731 dans [Unsloth Desktop](#run-in-unsloth-studio) . **DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#unsloth-studio-guide" class="button primary">🦥 Guide Unsloth</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#llama.cpp-guide" class="button primary">🦙 Guide Llama.cpp</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#dspark-speculative-decoding" class="button secondary">⚡ Guide DSpark</a>

### 🦥 Guide Unsloth

DeepSeek-V4-Flash-0731 peut désormais être exécuté et entraîné dans [Unsloth](/docs/fr/nouveau/studio.md), notre nouvelle interface open source pour l'IA locale. Unsloth Desktop vous permet d'exécuter des modèles localement sur **macOS**, **Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="/files/4837c1f844f07374269455a78616d275ac88d8c9" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

La façon la plus simple de commencer est de télécharger [l'application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez installer manuellement :

macOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

PowerShell Windows :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Rechercher et télécharger DeepSeek-V4-Flash

Allez à [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou Model hub et recherchez DeepSeek-V4-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="/files/ad27ffd4d64b9a8503f44568bd8e5b532349910f" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter DeepSeek-V4-Flash-0731

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth, cependant vous pouvez toujours les modifier manuellement. Comme **Think High est activé par défaut**, vous pouvez utiliser le menu déroulant de droite pour le basculer en Sans réflexion ou Think Max. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d'autres paramètres. **DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth](/docs/fr/nouveau/studio/chat.md).

<figure><img src="/files/9c7d8cccf6f7d67cec55b668b56f6a3c46868e55" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Guide Llama.cpp

{% stepper %}
{% step %}
Obtenez la dernière version de `llama.cpp` **sur** [**GitHub ici**](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. D'abord, sélectionnez le type de quantification souhaité comme `IQ3_XXS`. Utilisez également `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` à enregistrer dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, donc il vaut probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements se bloquent, voir : [Dépannage de Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*UD-IQ3_S*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endstep %}

{% step %}
Vous pouvez modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 32768` pour la longueur du contexte, `--n-gpu-layers 2` pour le déchargement GPU du nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le également si vous n'avez qu'une inférence CPU.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_S/DeepSeek-V4-Flash-0731-UD-IQ3_S-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

## :zap:DSpark - Décodage spéculatif

DeepSeek-V4-Flash-0731 dispose de DSpark natif, ce qui permet **une vitesse de décodage 2x plus rapide**! DSpark est un nouvel algorithme de DeepSeek, supérieur au MTP naïf, et a été introduit dans cet [article](https://arxiv.org/abs/2607.05147). DSpark permet à DeepSeek-V4-Flash d'atteindre **120 tokens/s** sur un GPU B200, contre la base initiale de 60 tokens/s. **DSpark est automatiquement activé dans l** [**Unsloth**](#unsloth-studio-guide) **interface locale.**

Llama.cpp a intégré DSpark dans le cadre de [PR 25784](https://github.com/ggml-org/llama.cpp/pull/25784) avec d'autres améliorations pour le multi-GPU et plus encore. Nous montrons l'utilisation de `--spec-draft-n-max 3` comme bon réglage par défaut, permettant une vitesse d'inférence 1,9x plus rapide. Les valeurs plus élevées semblent être plus lentes.

<figure><img src="/files/5e4316d3aa3dda08ef3efde043678f6b976d9bb9" alt=""><figcaption></figcaption></figure>

Téléchargez à la fois le drafter et le GGUF - nous en avons créé deux en Q8\_0 et un en BF16 sans perte. Notez que DSpark nécessitera \~10 Go de mémoire supplémentaire, donc les machines de 128 Go auront besoin de IQ3\_XXS et Q8\_0

{% code overflow="wrap" %}

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \\
    --include "*dspark-DeepSeek-V4-Flash-0731-Q8_0*" \\
    --include "*UD-IQ3_XXS*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endcode %}

Chargez ensuite via llama-cli ou llama-server :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf \\
    -md unsloth/DeepSeek-V4-Flash-0731-GGUF/dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.01 \\
    --spec-type draft-dspark \\
    --spec-draft-n-max 3 \\
    -ngl 99 -ngld 99
```

{% endcode %}

Benchmarks tirés de l'article original sur DSpark montrant également ses performances face à MTP :

<figure><img src="/files/44837da657621ec40b551f51967a4bcbc91b2d9f" alt=""><figcaption></figcaption></figure>

## 📊 Benchmarks

### Benchmarks GGUF

Voir ci-dessous un tableau comparant les benchmarks des quants d'Unsloth et d'autres fournisseurs. Référence = poids officiels. Perplexité et divergence KL sur wikitext-2 à ctx 512 sur 4x B200.

<figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure>

| Quant                              | Taille (Go) | PPL    | KLD moyen            | delta-p RMS | Même top token | Poids identiques au bit près |
| ---------------------------------- | ----------- | ------ | -------------------- | ----------- | -------------- | ---------------------------- |
| Officiel (référence)               | 156.4       | 4.5319 | 0                    | 0%          | 100%           | 100%                         |
| **Unsloth UD-Q8\_K\_XL**           | 161.9       | 4.5319 | **\~0 (sans perte)** | 0.000%      | 100.000%       | **100.000%**                 |
| **Unsloth UD-Q4\_K\_XL**           | 155.1       | 4.5335 | 0.0102               | 3.40%       | 96.28%         | 97.46%                       |
| bartowski MXFP4                    | 156.0       | 4.5351 | 0.0105               | 3.42%       | 96.18%         | 97.57%                       |
| antirez Q4KExperts-F16 (imatrix)   | 164.6       | 4.5743 | 0.0291               | 5.87%       | 93.95%         | 0.51%                        |
| antirez Q4KExperts-F16             | 164.6       | 4.5726 | 0.0290               | 5.89%       | 93.94%         | 0.93%                        |
| antirez mixed L37-42-Q4K (imatrix) | 97.6        | 5.8169 | 0.3605               | 21.15%      | 79.74%         | 0.41%                        |
| antirez IQ2XXS (imatrix)           | 86.7        | 6.0808 | 0.4079               | 22.23%      | 78.15%         | 0.39%                        |
| antirez IQ2XXS                     | 86.7        | 6.1518 | 0.4207               | 22.74%      | 77.92%         | 0.47%                        |

### Benchmarks officiels

DeepSeek-V4-Flash-0731 surpasse DeepSeek-V4-Pro (Aperçu) sur les benchmarks ci-dessous malgré un nombre bien moindre de paramètres activés, et reste compétitif face aux principaux modèles propriétaires.

| Benchmark              | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash (Aperçu) | DeepSeek-V4-Pro (Aperçu) | GLM-5.2 | Opus-4.8 |
| ---------------------- | :--------------------: | :------------------------: | :----------------------: | :-----: | :------: |
| Terminal Bench 2.1     |          82.7          |            61.8            |           72.1           |   81.0  |   85.0   |
| NL2Repo                |          54.2          |            39.4            |           38.5           |   48.9  |   69.7   |
| Cybergym               |          76.7          |            38.7            |           52.7           |    -    |   83.1   |
| DeepSWE                |          54.4          |             7.3            |           12.8           |   46.2  |   58.0   |
| Toolathlon-Verified    |          70.3          |            49.7            |           55.9           |   59.9  |   76.2   |
| Agents' Last Exam      |          25.2          |            15.8            |           16.5           |   23.8  |   25.7   |
| AutomationBench Public |          25.1          |            10.8            |           12.8           |   12.9  |   27.2   |
| DSBench-FullStack †    |          68.7          |            37.0            |           41.8           |   61.8  |   71.6   |
| DSBench-Hard †         |          59.6          |            25.8            |           31.1           |   54.5  |   71.7   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
