> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/deepseek-v4.md).

# DeepSeek-V4 : comment l'exécuter localement

DeepSeek-V4, DeepSeek-V4-**Pro-0813**, et DeepSeek-V4-**Flash-0731** sont de nouveaux modèles à poids ouverts : la variante Flash compte 284B paramètres (13B actifs), tandis que V4-Pro en compte 1.6T (49B actifs). **V4-Pro-0813**, publié le **13 août**, atteint les performances de Claude-4.8-Opus, tandis que **V4-Flash-0731**, publié le **31 juillet**, offre les meilleures performances de sa catégorie de taille et **surpasse V4-Pro** (Aperçu). Conçu pour les flux de travail de codage, agentiques et de chat avec une **fenêtre de contexte de 1M**, ce guide montre comment exécuter DeepSeek-V4-Flash-0731 localement à l’aide des GGUF dynamiques d’Unsloth et de [Unsloth Desktop](/docs/fr/desktop.md).

Pour **sans perte** DeepSeek, utilisez Q8 (`UD-Q8_K_XL`), qui est seulement **7 Go plus grand** que Q4 (`UD-Q4_K_XL`). Le GGUF 8 bits sans perte fait **162 Go** et le 3 bits fait **103 Go** qui peut fonctionner sur un **110 Go de RAM** apparei&#x6C;**.** DeepSeek-V4-Flash-0731 obtient 82,7 % sur Terminal Bench 2.1, 54,4 % sur DeepSWE et 54,2 % sur NL2Repo. [DSpark](#dspark-speculative-decoding) est également activé pour les GGUF, permettant jusqu’à **une vitesse de décodage 2x plus rapide**!

{% hint style="success" %}
**13 août :** DeepSeek-**V4-Pro-0813** a été publié et les [quants sont désormais](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) disponibles à l’exécution.
{% endhint %}

{% hint style="success" %}
**6 août : DSpark est activé pour DeepSeek-V4-Flash-0731, permettant une inférence 1,5x à 1,9x plus rapide ! DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

Nous avons également amélioré le [modèle jinja de chat DeepSeek-V4](#deepseek-v4-chat-template-improvements), et testé plus de 4 000 conversations afin d’assurer l’équivalence avec la référence officielle.
{% endhint %}

| [DeepSeek-V4-Pro-0813-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) | [DeepSeek-V4-Flash-**0731**-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF) | [DeepSeek-V4-Flash-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF) |
| ------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------- |

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#usage-guide" class="button primary">Guide d’utilisation</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#run-deepseek-v4-flash-tutorials" class="button primary">Tutoriels d’exécution</a>

### 📊 Analyse de quantification

Notre `UD-Q8_K_XL` quant est entièrement sans perte. DeepSeek-V4-Flash est [entraîné en tenant compte de la quantification](/docs/fr/blog/quantization-aware-training-qat.md): le point de contrôle officiel stocke nativement ses experts routés (96 % du modèle) en MXFP4 et tout le reste en FP8 ou BF16. Le MXFP4 de GGUF correspond exactement à ce format ; nous reconditionnons donc les experts bit à bit, et FP8 se déquantifie en BF16 sans arrondi. Nous avons vérifié chaque tenseur par rapport aux poids officiels de DeepSeek : les 1 328 sont identiques bit à bit, et cela reste sans perte à l’inférence (divergence KL \~0, concordance du top-token à 100 %).

**Non**-Unsloth Les GGUF DeepSeek-V4-Flash ont été convertis sans ces chemins, s’écartant ainsi des poids officiels. `UD-Q4_K_XL` conserve les mêmes experts exacts bit à bit et ne quantifie que les tenseurs non experts (4 % du modèle) en Q8\_0 ; il se place donc juste à côté de Q8 en taille et en qualité.

<div align="left"><figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="/files/934b2d29cd71dcecf4b5a805b57dab9d76810006" alt="" width="563"><figcaption></figcaption></figure></div>

Mesurés par rapport aux poids officiels, les deux quants Unsloth se situent sur la frontière qualité/taille. UD-Q8\_K\_XL est le seul point sans perte. UD-Q4\_K\_XL correspond aux autres formats communautaires MXFP4 et est plus précis que les conversions d’experts Q4\_K, qui sont plus volumineuses tout en atteignant 0,029 KLD.

<div align="left"><figure><img src="/files/943eddf7524374cdc6cc3d6df0496feda89a0a0c" alt="" width="563"><figcaption></figcaption></figure></div>

La répartition des erreurs par couche montre pourquoi. Conserver les experts MXFP4 natifs signifie 0 % d’erreur de poids à chaque couche. Les conversions qui re-quantifient les experts en Q4\_K ou IQ2\_XXS arrondissent presque chaque poids : 5 % pour Q4\_K, plus de 30 % pour IQ2\_XXS.

<div align="left"><figure><img src="/files/7f5f60767e049257740aad15bf25e35260e84d00" alt="" width="563"><figcaption><p>Notre MXFP4 présente exactement zéro erreur sur l’ensemble des 8,4 M de poids, tandis que Q4_K, une grille 4 bits différente, doit tous les arrondir (5,2 % RMSE).</p></figcaption></figure></div>

Nous avons également constaté que l’utilisation de Q8\_0 et F16 pour certains tenseurs n’est pas sans perte, et que cela s’aggrave puisque DeepSeek a appliqué QAT pour faire fonctionner correctement MXFP4 / FP8 ; nous avons donc dû les laisser directement en BF16. Utilisez donc UD-Q8\_K\_XL pour une véritable quantification sans perte, et UD-Q4\_K\_XL abaisse certains éléments BF16 vers Q8\_0.

Pour les tableaux de référence complets de [Références GGUF, voir ici](#gguf-benchmarks).

### :speech\_balloon: Améliorations du modèle de chat DeepSeek V4

Nous avons également amélioré le modèle jinja de chat DeepSeek-V4, et testé plus de 4 000 conversations afin d’assurer l’équivalence avec la référence de référence (DS4 officiel)

Nous avons ajouté `reasoning_effort` et vous pouvez sélectionner `max, high` comme avec DeepSeek-V4 officiel. Nous préfixons l’invite système correcte conformément à DS4 et avons suivi le style de gpt-oss.

Et pour les appels d’outils, `reasoning_content` était conservé pour DS4, mais le modèle de chat jinja l’excluait. Nous l’avons réajouté.

#### **Désactiver la réflexion, modifier l’effort de raisonnement**

DeepSeek-V4 utilise le raisonnement par défaut. Il prend également en charge les efforts de raisonnement pour lesquels `reasoning_effort` peut être « high », « max » ou désactivé.

Pour désactiver la réflexion, utilisez `--chat-template-kwargs '{"enable_thinking":false}'`. Si vous êtes sous **Windows** PowerShell, utilisez : `--chat-template-kwargs "{\"enable_thinking\":false}"`

Vous pouvez également utiliser `--reasoning on` ou `--reasoning off` dans llama.cpp également désormais !

Pour personnaliser l’effort de raisonnement et/ou désactiver le raisonnement, utilisez les exemples ci-dessous :

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### ⚙️ Guide d’utilisation

DeepSeek-V4-Flash est plus petit et plus rapide que DeepSeek-V4-Pro, avec **284B** paramètres (13B actifs), et un **fenêtre de contexte de 1M**. Le modèle possède 3 modes, **Sans réflexion**, **Réflexion** **Élevé** et **Réflexion** **Maximum**.&#x20;

Il est recommandé d’utiliser `UD-IQ3_XXS` qui est **103 Go** pour de meilleurs résultats. Comme la taille du fichier n’inclut pas le cache KV ni l’allocation de contexte, essayez d’avoir au moins **110 Go de RAM** pour exécuter le modèle.

Le `UD-Q8_K_XL` quant est DeepSeek-V4-Flash à pleine précision d’origine. Sa taille est de 162 Go et il est préférable d’avoir au moins 169 Go de RAM/VRAM disponible.

**Tableau : exigences matérielles pour l’inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th>Format</th><th width="129.8004150390625">1 bit</th><th width="130.85650634765625">2 bits</th><th width="140.26702880859375">3 bits</th><th>4 bits (presque sans perte)</th><th>Q8_K_XL (sans perte)</th></tr></thead><tbody><tr><td>Standard</td><td>92 Go</td><td>102 Go</td><td>110-135 Go</td><td>162 Go</td><td>169 Go</td></tr><tr><td>DSpark</td><td>102 Go</td><td>112 Go</td><td>120-145 Go</td><td>172 Go</td><td>179 Go</td></tr></tbody></table>

{% hint style="info" %}
**DSpark utilise davantage de VRAM que le mode standard**, prévoyez donc **\~10 Go** de marge RAM/VRAM supplémentaire.
{% endhint %}

{% hint style="success" %}
Pour des performances optimales, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier de modèle quantifié.
{% endhint %}

### Paramètres recommandés

DeepSeek recommande ces paramètres pour des performances optimales : `temperature = 1.0`, `top-p = 1.0`. Pour **DeepSeek-V4-Flash-0731** et les scénarios agentiques, `top-p = 0.95` est suggéré à la place et `top-p = 1.0` pour les autres tâches.

**Think High est activé par défaut.** S’il est désactivé, vous pouvez l’activer via : `--chat-template-kwargs '{"enable_thinking":true}'` ou le basculer via le menu déroulant de l’interface dans [Unsloth](#unsloth-studio-guide). Voir également [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column width="50%" %}

| DeepSeek-V4-Flash-0731                |
| ------------------------------------- |
| `temperature = 1.0`                   |
| `top-p = 1.0`                         |
| `top-p = 0.95` (agentique uniquement) |
| {% endcolumn %}                       |

{% column width="50%" %}

| Ancien DeepSeek-V4-Flash et V4-Pro |
| ---------------------------------- |
| `temperature = 1.0`                |
| `top-p = 1.0`                      |
| {% endcolumn %}                    |
| {% endcolumns %}                   |

* **Fenêtre de contexte maximale :** `1,048,576`
* Pour Think Max, définissez le contexte sur au moins **384K tokens**.

## Exécuter les tutoriels DeepSeek-V4-Flash :

Pour ce tutoriel, nous utiliserons le quant 3 bits `UD-IQ3_XXS`, car il tient sur un appareil avec 128 Go de RAM. Remplacez `UD-IQ3_XXS` par `UD-Q8_K_XL` (qualité d’origine) ou un autre quant si votre machine dispose de suffisamment de mémoire. Vous pouvez désormais exécuter DeepSeek-V4-Flash-0731 dans [Unsloth Desktop](#run-in-unsloth-studio) . **DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#unsloth-studio-guide" class="button primary">🦥 Guide Unsloth</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#llama.cpp-guide" class="button primary">🦙 Guide Llama.cpp</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#dspark-speculative-decoding" class="button secondary">⚡Guide DSpark</a>

### 🦥 Guide Unsloth

DeepSeek-V4-Flash-0731 peut désormais être exécuté et entraîné dans [Unsloth](/docs/fr/nouveau/studio.md), notre nouvelle interface open source pour l’IA locale. Unsloth Desktop vous permet d’exécuter des modèles localement sur **MacOS**, **Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d’outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence CPU + GPU rapide via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapidement avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="/files/4837c1f844f07374269455a78616d275ac88d8c9" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

La manière la plus simple de commencer est de télécharger l’ [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sous [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez installer manuellement :

MacOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Rechercher et télécharger DeepSeek-V4-Flash

Accédez à [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou au hub de modèles, recherchez DeepSeek-V4-Flash dans la barre de recherche et téléchargez le modèle et le quant souhaités.

<figure><img src="/files/ad27ffd4d64b9a8503f44568bd8e5b532349910f" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter DeepSeek-V4-Flash-0731

Les paramètres d’inférence devraient être réglés automatiquement lors de l’utilisation d’Unsloth ; toutefois, vous pouvez toujours les modifier manuellement. Puisque **Think High est activé par défaut**, vous pouvez utiliser le menu déroulant à droite pour le basculer vers Sans réflexion ou Think Max. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres. **DSpark est automatiquement activé dans** [**Unsloth**](#unsloth-studio-guide)**.**

Pour plus d’informations, vous pouvez consulter notre [guide d’inférence Unsloth](/docs/fr/nouveau/studio/chat.md).

<figure><img src="/files/9c7d8cccf6f7d67cec55b668b56f6a3c46868e55" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Servir DeepSeek-V4 avec l’API Unsloth

Vous pouvez utiliser la `unsloth run` commande et servir DeepSeek via une API en utilisant les `llama-server` indicateurs d’exécution, y compris le dimensionnement du contexte, les couches GPU, les threads, l’échantillonnage, le réseau et la configuration des outils. Pour plus d’informations, consultez notre [documentation API](/docs/fr/bases/api.md) ou [unsloth start](/docs/fr/integrations/unsloth-start.md).

```bash
unsloth run --model unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S
```

{% endstep %}

{% step %}

#### Unsloth est maintenant prêt

Vous pouvez également faire bien d’autres choses avec DeepSeek via Unsloth Desktop, telles que :

* **Connecter des outils :** [Claude Code](/docs/fr/bases/claude-code.md), [Codex](/docs/fr/bases/codex.md), [recherche web](/docs/fr/nouveau/studio/chat.md#advanced-web-search), [MCP](/docs/fr/bases/mcp.md) et plus encore
* **Entraîner des modèles :** Affiner du texte, de la diffusion, [embedding](/docs/fr/bases/embedding-finetuning.md), et plus encore
* **Générer des médias :** Créer et entraîner [des images](/docs/fr/bases/diffusion-image.md), des vidéos, [TTS](/docs/fr/bases/text-to-speech-tts-fine-tuning.md) localement
  {% endstep %}
  {% endstepper %}

### 🦙 Guide Llama.cpp

{% stepper %}
{% step %}
Obtenez la dernière version de `llama.cpp` **sur** [**GitHub ici**](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` en `-DGGML_CUDA=OFF` si vous n’avez pas de GPU ou souhaitez uniquement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d’habitude : la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Vous pouvez désormais utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. Commencez par sélectionner le type de quantification souhaité, tel que `IQ3_XXS`. Utilisez également `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` à enregistrer dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent ; il est donc probablement préférable d’utiliser le processus de téléchargement manuel de la section suivante.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, vous pouvez le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements se bloquent, consultez : [Débogage de Hugging Face Hub et XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --include "*UD-IQ3_S*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endstep %}

{% step %}
Vous pouvez modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 32768` pour la longueur du contexte, `--n-gpu-layers 2` pour le déchargement sur GPU du nombre de couches. Essayez de l’ajuster si votre GPU n’a plus de mémoire. Supprimez-le également si vous utilisez uniquement l’inférence CPU.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_S/DeepSeek-V4-Flash-0731-UD-IQ3_S-00001-of-00004.gguf \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

## :zap:DSpark - Décodage spéculatif

DeepSeek-V4-Flash-0731 dispose de DSpark natif, qui permet jusqu’à **une vitesse de décodage 2x plus rapide**! DSpark est un nouvel algorithme de DeepSeek supérieur au MTP naïf, introduit dans cet [article](https://arxiv.org/abs/2607.05147). DSpark permet à DeepSeek-V4-Flash d’atteindre **120 tokens/s** sur un GPU B200, contre la référence initiale de 60 tokens/s. **DSpark est automatiquement activé dans l’** [**Unsloth**](#unsloth-studio-guide) **interface locale.**

Llama.cpp a intégré DSpark dans le cadre de [PR 25784](https://github.com/ggml-org/llama.cpp/pull/25784) avec des améliorations supplémentaires pour le multi-GPU et plus encore. Nous indiquons l’utilisation de `--spec-draft-n-max 3` comme bonne valeur par défaut, permettant une inférence 1,9x plus rapide. Des valeurs plus élevées semblent plus lentes.

<figure><img src="/files/5e4316d3aa3dda08ef3efde043678f6b976d9bb9" alt=""><figcaption></figcaption></figure>

Téléchargez à la fois le brouillon et le GGUF : nous avons créé 2 Q8\_0 et celui sans perte BF16. Notez que DSpark nécessitera environ 10 Go de mémoire supplémentaire ; les machines de 128 Go auront donc besoin d’IQ3\_XXS et Q8\_0

{% code overflow="wrap" %}

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --include "*dspark-DeepSeek-V4-Flash-0731-Q8_0*" \
    --include "*UD-IQ3_XXS*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endcode %}

Chargez-le ensuite via llama-cli ou llama-server :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf \
    -md unsloth/DeepSeek-V4-Flash-0731-GGUF/dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01 \
    --spec-type draft-dspark \
    --spec-draft-n-max 3 \
    -ngl 99 -ngld 99
```

{% endcode %}

Références de l’article original DSpark montrant également ses performances face à MTP :

<figure><img src="/files/44837da657621ec40b551f51967a4bcbc91b2d9f" alt=""><figcaption></figcaption></figure>

## 📊 Tests de performance

### Tests de performance GGUF

Voir ci-dessous un tableau comparant les benchmarks des quantifications d’Unsloth et d’autres fournisseurs. Référence = poids officiels. Perplexité et divergence KL sur wikitext-2 avec ctx 512 sur 4x B200.

<figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure>

| Quantification                     | Taille (Go) | PPL    | KLD moyen            | RMS delta-p | Même token principal | Poids identiques au bit près |
| ---------------------------------- | ----------- | ------ | -------------------- | ----------- | -------------------- | ---------------------------- |
| Officiel (référence)               | 156.4       | 4.5319 | 0                    | 0%          | 100%                 | 100%                         |
| **Unsloth UD-Q8\_K\_XL**           | 161.9       | 4.5319 | **\~0 (sans perte)** | 0.000%      | 100.000%             | **100.000%**                 |
| **Unsloth UD-Q4\_K\_XL**           | 155.1       | 4.5335 | 0.0102               | 3.40%       | 96.28%               | 97.46%                       |
| bartowski MXFP4                    | 156.0       | 4.5351 | 0.0105               | 3.42%       | 96.18%               | 97.57%                       |
| antirez Q4KExperts-F16 (imatrix)   | 164.6       | 4.5743 | 0.0291               | 5.87%       | 93.95%               | 0.51%                        |
| antirez Q4KExperts-F16             | 164.6       | 4.5726 | 0.0290               | 5.89%       | 93.94%               | 0.93%                        |
| antirez mixed L37-42-Q4K (imatrix) | 97.6        | 5.8169 | 0.3605               | 21.15%      | 79.74%               | 0.41%                        |
| antirez IQ2XXS (imatrix)           | 86.7        | 6.0808 | 0.4079               | 22.23%      | 78.15%               | 0.39%                        |
| antirez IQ2XXS                     | 86.7        | 6.1518 | 0.4207               | 22.74%      | 77.92%               | 0.47%                        |

### Benchmarks officiels

DeepSeek-V4-Flash-0731 surpasse DeepSeek-V4-Pro (aperçu) sur les benchmarks ci-dessous malgré l’utilisation de beaucoup moins de paramètres activés, et reste compétitif face aux principaux modèles propriétaires.

| Benchmark                 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash (aperçu) | DeepSeek-V4-Pro (aperçu) | GLM-5.2 | Opus-4.8 |
| ------------------------- | :--------------------: | :------------------------: | :----------------------: | :-----: | :------: |
| Terminal Bench 2.1        |          82.7          |            61.8            |           72.1           |   81.0  |   85.0   |
| NL2Repo                   |          54.2          |            39.4            |           38.5           |   48.9  |   69.7   |
| Cybergym                  |          76.7          |            38.7            |           52.7           |    -    |   83.1   |
| DeepSWE                   |          54.4          |             7.3            |           12.8           |   46.2  |   58.0   |
| Toolathlon-Verified       |          70.3          |            49.7            |           55.9           |   59.9  |   76.2   |
| Dernier examen des agents |          25.2          |            15.8            |           16.5           |   23.8  |   25.7   |
| AutomationBench public    |          25.1          |            10.8            |           12.8           |   12.9  |   27.2   |
| DSBench-FullStack †       |          68.7          |            37.0            |           41.8           |   61.8  |   71.6   |
| DSBench-Hard †            |          59.6          |            25.8            |           31.1           |   54.5  |   71.7   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
