> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/deepseek-v4.md).

# DeepSeek-V4 : comment l'exécuter localement

DeepSeek-V4 est la nouvelle famille de modèles ouverts de DeepSeek, comprenant **DeepSeek-V4-Pro** avec **1.6T** paramètres (49B actifs) et **DeepSeek-V4-Flash** avec **284B** paramètres (13B actifs). Les modèles excellent en codage, en workflows agentiques et en chat avec une **fenêtre de contexte de 1M** . Dans ce guide, nous allons vous montrer comment exécuter DeepSeek-V4-Flash localement : [DeepSeek-V4-Flash GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF)

Pour **sans perte** DeepSeek, utilisez Q8 (`UD-Q8_K_XL`), qui n'est que **7 Go de plus** que Q4 (`UD-Q4_K_XL`). Le GGUF 8 bits sans perte est **162 Go** et le 3 bits est **103 Go** qui peut fonctionner sur un **appareil avec 110 Go de RAM** apparei&#x6C;**.** DeepSeek-V4-Flash obtient 86,2 % sur MMLU-Pro, 88,1 % sur GPQA Diamond, et 56,9 % sur Terminal Bench 2.0.

{% hint style="success" %}
**7 juillet :** DeepSeek-V4 est maintenant prêt à être exécuté ! Nous avons également amélioré le [modèle jinja de chat DeepSeek-V4](#deepseek-v4-chat-template-improvements), et avons testé plus de 4000 conversations pour être équivalent au point de référence officiel.
{% endhint %}

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#usage-guide" class="button primary">Guide d'utilisation</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#run-deepseek-v4-flash-tutorials" class="button primary">Tutoriels d'exécution</a>

### :llama: corrections d'implémentation DeepSeek V4 dans llama.cpp

llama.cpp a ajouté la prise en charge de DeepSeek V4 dans [24162](https://github.com/ggml-org/llama.cpp/pull/24162) - nous avons remarqué que lorsque l'on utilisait n'importe quel GGUF de **n'importe quel fournisseur**, les conversations à plusieurs tours ne fonctionnaient pas bien par rapport au baseline Hugging Face de DS4 lors de l'utilisation de la quantification du cache KV `--cache-type k/v q8_0` - cela a depuis été corrigé et fusionné dans llama.cpp depuis le 7 juillet 2026 avec [25202](https://github.com/ggml-org/llama.cpp/pull/25202)

Plus précisément, avant la correction, appeler des quantifications DeepSeek provoquerait `overlayotin kinetic academyléléléléulif` et après la PR « La capitale de la France est Paris. », ce qui est correct.

<table><thead><tr><th>Moteur</th><th width="91.54998779296875">Score</th><th width="122.60003662109375">Calcul</th><th width="114.5">Sélection d'outil</th><th width="97.4000244140625">Outils parallèles</th><th width="112.699951171875">Outils multi-tours</th><th>Outils imbriqués</th></tr></thead><tbody><tr><td>Code officiel</td><td><strong>15/15</strong></td><td>3</td><td>3</td><td>3</td><td>3</td><td>3</td></tr><tr><td>N'importe quel fournisseur</td><td><strong>4/15</strong></td><td>1</td><td>2</td><td>0</td><td>0</td><td>1</td></tr><tr><td><strong>Après</strong> <a href="https://github.com/ggml-org/llama.cpp/pull/25202">25202</a></td><td><strong>15/15</strong></td><td>3</td><td>2</td><td>3</td><td>3</td><td>3</td></tr></tbody></table>

### :speech\_balloon: Améliorations du modèle de chat DeepSeek V4

Nous avons également amélioré le modèle jinja de chat DeepSeek-V4, et avons testé plus de 4000 conversations pour qu'il soit équivalent au baseline de référence en or (DS4 officiel)

Nous avons ajouté `reasoning_effort` et vous pouvez sélectionner `max, high` tout comme le DeepSeek-V4 officiel. Nous préfixons le prompt système correct conformément à DS4, et avons suivi le style de gpt-oss.

Et pour les appels d'outils, `reasoning_content` était conservé pour DS4, mais le modèle de chat jinja les exclurait. Nous l'avons réintégré.

**Désactiver la réflexion, modifier l'effort de raisonnement**

DeepSeek-V4 utilise le raisonnement par défaut. Il prend également en charge des efforts de raisonnement où `reasoning_effort` peut être « high », « max » ou désactivé.

Pour désactiver la réflexion, utilisez `--chat-template-kwargs '{"enable_thinking":false}'`. Si vous êtes sur **Windows** Powershell, utilisez : `--chat-template-kwargs "{\"enable_thinking\":false}"`

Vous pouvez aussi utiliser `--reasoning on` ou `--reasoning off` dans llama.cpp désormais aussi !

Pour personnaliser l'effort de raisonnement ou désactiver le raisonnement, utilisez les exemples ci-dessous :

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### 📊 Analyse de quantification

Notre `UD-Q8_K_XL` quantification est totalement sans perte. DeepSeek-V4-Flash est [entraîné en tenant compte de la quantification](/docs/fr/blog/quantization-aware-training-qat.md): le checkpoint officiel stocke ses experts routés (96 % du modèle) nativement en MXFP4 et tout le reste en FP8 ou BF16. Le MXFP4 de GGUF correspond exactement à ce format, donc nous réemballons les experts bit à bit, et le FP8 se déquantifie en BF16 sans arrondi. Nous avons vérifié chaque tenseur par rapport aux poids officiels de DeepSeek : les 1 328 sont tous identiques bit à bit, et cela reste sans perte à l'inférence (divergence KL \~0, 100 % d'accord sur le jeton de tête).

**Non**-Unsloth Les GGUF DeepSeek-V4-Flash ont été convertis sans ces chemins, ce qui les fait s'écarter des poids officiels. `UD-Q4_K_XL` conserve les mêmes experts identiques bit à bit et quantifie uniquement les tenseurs non experts (4 % du modèle) en Q8\_0, donc il se situe juste à côté de Q8 en taille et en qualité.

<div align="left"><figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="/files/934b2d29cd71dcecf4b5a805b57dab9d76810006" alt="" width="563"><figcaption></figcaption></figure></div>

Mesurés par rapport aux poids officiels, les deux quantifications Unsloth se trouvent sur la frontière qualité/taille. UD-Q8\_K\_XL est le seul point sans perte. UD-Q4\_K\_XL correspond aux autres formats MXFP4 de la communauté et est plus précis que les conversions Q4\_K-experts, qui sont plus volumineuses mais atteignent 0,029 KLD.

<div align="left"><figure><img src="/files/943eddf7524374cdc6cc3d6df0496feda89a0a0c" alt="" width="563"><figcaption></figcaption></figure></div>

La répartition des erreurs par couche explique pourquoi. Conserver les experts MXFP4 natifs signifie 0 % d'erreur de poids à chaque couche. Les conversions qui re-quantifient les experts en Q4\_K ou IQ2\_XXS arrondissent presque chaque poids : 5 % pour Q4\_K, plus de 30 % pour IQ2\_XXS.

<div align="left"><figure><img src="/files/7f5f60767e049257740aad15bf25e35260e84d00" alt="" width="563"><figcaption><p>Notre MXFP4 a exactement zéro erreur sur les 8,4 M de poids, tandis que Q4_K, une autre grille 4 bits, doit arrondir chacun d'eux (5,2 % RMSE).</p></figcaption></figure></div>

Nous avons également constaté que l'utilisation de Q8\_0 et F16 pour certains tenseurs n'est pas sans perte, et cela empire puisque le QAT a été appliqué par DeepSeek pour que MXFP4 / FP8 fonctionne bien, nous avons donc dû les laisser directement en BF16. Utilisez donc UD-Q8\_K\_XL pour une vraie quantification sans perte, et UD-Q4\_K\_XL rétrograde certains éléments BF16 en Q8\_0.

Pour les tableaux complets de benchmarks de [GGUF Benchmarks, voir ici](#gguf-benchmarks).

#### ⚙️ Guide d'utilisation

DeepSeek-V4-Flash est plus petit et plus rapide que DeepSeek-V4-Pro, avec **284B** paramètres (13B actifs), et une **fenêtre de contexte de 1M**. Le modèle dispose de 3 modes, **Sans réflexion**, **Réflexion** **Élevé** et **Réflexion** **Max**.&#x20;

Il est recommandé d'utiliser `UD-IQ3_XXS` qui est **103 Go** pour de meilleurs résultats. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation de contexte, essayez d'avoir au moins **appareil avec 110 Go de RAM** pour exécuter le modèle.

La `UD-Q8_K_XL` quantification correspond à DeepSeek-V4-Flash en pleine précision d'origine. Sa taille est de 162 Go et il est préférable d'avoir au moins 169 Go de RAM/VRAM disponibles.

**Tableau : exigences matérielles pour l'inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th width="129.8004150390625">1 bit</th><th width="130.85650634765625">2 bits</th><th width="140.26702880859375">3 bits</th><th>4 bits (presque sans perte)</th><th>Q8_K_XL (sans perte)</th></tr></thead><tbody><tr><td>92 Go</td><td>102 Go</td><td>110-135 Go</td><td>162 Go</td><td>169 Go</td></tr></tbody></table>

{% hint style="success" %}
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse confortablement la taille du fichier modèle quantifié.
{% endhint %}

#### Paramètres recommandés

DeepSeek recommande ces paramètres pour de meilleures performances : `temperature=1.0`, `top-p=1.0`

**Think High est activé par défaut.** Si c'est désactivé, vous pouvez l'activer via : `--chat-template-kwargs '{"enable_thinking":true}'` ou l'activer/désactiver via la liste déroulante de l'interface dans [Unsloth Studio](#unsloth-studio-guide). Voir aussi [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column %}

| `temperature = 1.0` |
| ------------------- |
| `top-p = 1.0`       |
| {% endcolumn %}     |

{% column %}

* **Fenêtre de contexte maximale :** `1,048,576`
* Pour Think Max, réglez le contexte à au moins **384K tokens**.
  {% endcolumn %}
  {% endcolumns %}

## Tutoriels pour exécuter DeepSeek-V4-Flash :

Pour ce tutoriel, nous utiliserons la quantification 3 bits `UD-IQ3_XXS`, car elle tient sur un appareil avec 128 Go de RAM. Remplacez `UD-IQ3_XXS` avec `UD-Q8_K_XL` (qualité d'origine) ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter DeepSeek-V4-Flash dans [Unsloth Studio](#run-in-unsloth-studio).

<a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#unsloth-studio-guide" class="button primary">🦥 Guide Unsloth Studio</a><a href="/pages/ce872989f38581a2eb254c401a2aafc0ab693291#llama.cpp-guide" class="button primary">🦙 Guide llama.cpp</a>

### 🦥 Guide Unsloth Studio

DeepSeek-V4-Flash peut désormais être exécuté et entraîné dans [Unsloth Studio](/docs/fr/nouveau/studio.md), notre nouvelle interface web open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur **MacOS**, **Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via llama.cpp
* [Entraîner des LLMs](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/0b35bb8c7a160ec3ded9bd749d07088aabf3393d" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Assurez-vous d'utiliser la dernière version. Exécutez dans votre terminal :

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL et Windows :**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Puis ouvrez `http://127.0.0.1:8888` (ou votre URL spécifique) dans votre navigateur.
{% endstep %}

{% step %}

#### Rechercher et télécharger DeepSeek-V4-Flash

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter. Ensuite, allez dans l'onglet [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) et recherchez DeepSeek-V4-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="/files/9414b501aeeeea5b4e84a9c34c8e53cb8d061faf" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter DeepSeek-V4-Flash

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio ; cependant, vous pouvez toujours les modifier manuellement. Comme **Think High est activé par défaut**, vous pouvez aller dans la liste déroulante de droite pour le basculer vers Sans réflexion ou Think Max. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).

<figure><img src="/files/cb40f0febe9a3ba462b7ebbb2c67036bc9068421" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Guide llama.cpp

{% stepper %}
{% step %}
Obtenez la dernière version de `llama.cpp` **sur** [**GitHub ici**](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` en `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. Tout d'abord, sélectionnez le type de quantification que vous souhaitez, comme `IQ3_XXS`. Utilisez aussi `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` l'enregistrement dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/DeepSeek-V4-Flash-GGUF:UD-IQ3_XXS \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.0
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements restent bloqués, voir : [Hugging Face Hub, débogage XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-GGUF \
    --local-dir unsloth/DeepSeek-V4-Flash-GGUF \
    --include "*UD-IQ3_XXS*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endstep %}

{% step %}
Vous pouvez modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 32768` pour la longueur du contexte, `--n-gpu-layers 2` pour le déchargement GPU sur le nombre de couches. Essayez d'ajuster ce paramètre si votre GPU manque de mémoire. Supprimez-le aussi si vous n'avez qu'une inférence CPU.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/DeepSeek-V4-Flash-GGUF/blob/main/UD-IQ3_XXS/DeepSeek-V4-Flash-UD-IQ3_XXS-00001-of-00004.gguf \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

### Benchmarks GGUF

Voir ci-dessous un tableau comparant les benchmarks des quantifications d'Unsloth et d'autres fournisseurs. Référence = poids officiels. Perplexité et divergence KL sur wikitext-2 au ctx 512 sur 4x B200.

<figure><img src="/files/3699c388a69333cf72a2d02ea4353385837e6c7d" alt="" width="563"><figcaption></figcaption></figure>

| Quantification                     | Taille (Go) | PPL    | KLD moyen            | Delta-p RMS | Même jeton de tête | Poids identiques bit à bit |
| ---------------------------------- | ----------- | ------ | -------------------- | ----------- | ------------------ | -------------------------- |
| Officiel (référence)               | 156.4       | 4.5319 | 0                    | 0%          | 100%               | 100%                       |
| **Unsloth UD-Q8\_K\_XL**           | 161.9       | 4.5319 | **\~0 (sans perte)** | 0.000%      | 100.000%           | **100.000%**               |
| **Unsloth UD-Q4\_K\_XL**           | 155.1       | 4.5335 | 0.0102               | 3.40%       | 96.28%             | 97.46%                     |
| bartowski MXFP4                    | 156.0       | 4.5351 | 0.0105               | 3.42%       | 96.18%             | 97.57%                     |
| antirez Q4KExperts-F16 (imatrix)   | 164.6       | 4.5743 | 0.0291               | 5.87%       | 93.95%             | 0.51%                      |
| antirez Q4KExperts-F16             | 164.6       | 4.5726 | 0.0290               | 5.89%       | 93.94%             | 0.93%                      |
| antirez mixed L37-42-Q4K (imatrix) | 97.6        | 5.8169 | 0.3605               | 21.15%      | 79.74%             | 0.41%                      |
| antirez IQ2XXS (imatrix)           | 86.7        | 6.0808 | 0.4079               | 22.23%      | 78.15%             | 0.39%                      |
| antirez IQ2XXS                     | 86.7        | 6.1518 | 0.4207               | 22.74%      | 77.92%             | 0.47%                      |

### Benchmarks officiels

Voir plus bas pour les benchmarks au format tableau :

<figure><img src="/files/ea3ae6a765b79f2b357758866fc239163dbe70a2" alt="" width="563"><figcaption></figcaption></figure>

| Benchmark (métrique)              | V4-Flash Sans réflexion | V4-Flash Élevé | V4-Flash Max | V4-Pro Sans réflexion | V4-Pro Élevé | V4-Pro Max |
| --------------------------------- | :---------------------: | :------------: | :----------: | :-------------------: | :----------: | :--------: |
| **Connaissances et raisonnement** |                         |                |              |                       |              |            |
| MMLU-Pro (EM)                     |           83.0          |      86.4      |     86.2     |          82.9         |     87.1     |  **87.5**  |
| SimpleQA-Verified (Pass\@1)       |           23.1          |      28.9      |     34.1     |          45.0         |     46.2     |  **57.9**  |
| Chinese-SimpleQA (Pass\@1)        |           71.5          |      73.2      |     78.9     |          75.8         |     77.7     |  **84.4**  |
| GPQA Diamond (Pass\@1)            |           71.2          |      87.4      |     88.1     |          72.9         |     89.1     |  **90.1**  |
| HLE (Pass\@1)                     |           8.1           |      29.4      |     34.8     |          7.7          |     34.5     |  **37.7**  |
| LiveCodeBench (Pass\@1)           |           55.2          |      88.4      |     91.6     |          56.8         |     89.8     |  **93.5**  |
| Codeforces (classement)           |            -            |      2816      |     3052     |           -           |     2919     |  **3206**  |
| HMMT 2026 Feb (Pass\@1)           |           40.8          |      91.9      |     94.8     |          31.7         |     94.0     |  **95.2**  |
| IMOAnswerBench (Pass\@1)          |           41.9          |      85.1      |     88.4     |          35.3         |     88.0     |  **89.8**  |
| Apex (Pass\@1)                    |           1.0           |      19.1      |     33.0     |          0.4          |     27.4     |  **38.3**  |
| Apex Shortlist (Pass\@1)          |           9.3           |      72.1      |     85.7     |          9.2          |     85.5     |  **90.2**  |
| **Contexte long**                 |                         |                |              |                       |              |            |
| MRCR 1M (MMR)                     |           37.5          |      76.9      |     78.7     |          44.7         |     83.3     |  **83.5**  |
| CorpusQA 1M (ACC)                 |           15.5          |      59.3      |     60.5     |          35.6         |     56.5     |  **62.0**  |
| **Agentique**                     |                         |                |              |                       |              |            |
| Terminal Bench 2.0 (Acc)          |           49.1          |      56.6      |     56.9     |          59.1         |     63.3     |  **67.9**  |
| SWE Verified (Résolu)             |           73.7          |      78.6      |     79.0     |          73.6         |     79.4     |  **80.6**  |
| SWE Pro (Résolu)                  |           49.1          |      52.3      |     52.6     |          52.1         |     54.4     |  **55.4**  |
| SWE Multilingual (Résolu)         |           69.7          |      70.2      |     73.3     |          69.8         |     74.1     |  **76.2**  |
| BrowseComp (Pass\@1)              |            -            |      53.5      |     73.2     |           -           |     80.4     |  **83.4**  |
| HLE avec outils (Pass\@1)         |            -            |      40.3      |     45.1     |           -           |     44.7     |  **48.2**  |
| MCPAtlas (Pass\@1)                |           64.0          |      67.4      |     69.0     |          69.4         |   **74.2**   |    73.6    |
| GDPval-AA (Elo)                   |            -            |        -       |     1395     |           -           |       -      |  **1554**  |
| Toolathlon (Pass\@1)              |           40.7          |      43.5      |     47.8     |          46.3         |     49.0     |  **51.8**  |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
