> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/qwen3.8.md).

# Qwen3.8 - Comment exécuter localement

Qwen3.8 est la nouvelle famille de modèles de Qwen, comprenant Qwen3.8-**27B**, Qwen3.8-**2.4T-A95B** et Qwen3.8-**Max**. Qwen3.8-27B a **vision** et des capacités de raisonnement, une **fenêtre de contexte de 256K** et s’exécute localement sur **17 Go de RAM/VRAM** configurations. Qwen3.8 excelle dans le codage agentique, les tâches de vision et de chat, et peut désormais s’exécuter via les GGUF Unsloth, NVFP4 et [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop). Qwen3.8-2.4T-A95B est un modèle de 2,4T paramètres (95B actifs) rivalisant avec GPT-5.6 Sol.

**Mise à jour du 19 août :** Les GGUF de Qwen3.8-27B utilisent désormais [Unsloth Dynamic V3.0](/docs/fr/bases/dynamic-3.0-ggufs.md) pour 10 % de précision en plus à taille égale, surpassant largement les autres.

{% columns %}
{% column %} <a href="/pages/901b8ef66232f3df49c12342d74d59aa06381de8#run-qwen3.8-guide" class="button primary">Guide pour exécuter Qwen3.8</a><a href="https://unsloth.ai/download" class="button primary">Télécharger Unsloth</a>

Merci à Qwen pour l’accès dès le premier jour. Les quantifications Unsloth incluent aussi :

* **Prise en charge du rôle développeur** pour des outils agentiques comme Codex
* [MTP activé](/docs/fr/modeles/mtp.md) pour une inférence rapide
* **Appel d’outils :** Analyse améliorée des objets imbriqués pour faire mieux réussir les outils

Le Qwen3.8-2.4T-A95B en précision complète nécessite 4,9 To de stockage et 1 bit [Unsloth](https://github.com/unslothai/unsloth) Les GGUF dynamiques prennent **397 Go (91 % plus petit)**, et l’IQ1\_S plus grand prend 508 Go.
{% endcolumn %}

{% column %}

<figure><img src="/files/f5ecc7024f10c3256c61c0b6368bf4929351d675" alt=""><figcaption><p>Qwen3.8-27B dynamique 4 bits dans Unsloth Desktop</p></figcaption></figure>

Quantifications Unsloth :

* [Qwen3.8-**27B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
  {% endcolumn %}
  {% endcolumns %}

### :gear: Guide d’utilisation

#### Configuration requise pour Qwen3.8-27B :

Qwen3.8-**27B** Les quantifications 4 bits fonctionnent sur 16 à 19 Go de VRAM, comme une RTX 5080, une 4090 ou un Mac avec 24 Go de RAM.\
**Tableau : configuration matérielle requise** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th>1 bit</th><th>2 bits</th><th>3 bits</th><th>4 bits</th><th width="128">6 bits</th><th>8 bits</th><th>BF16</th></tr></thead><tbody><tr><td>7-8 Go</td><td>9-11 Go</td><td>12-14 Go</td><td>16-19 Go</td><td>23-26 Go</td><td>31 Go</td><td>56 Go</td></tr></tbody></table>

#### Qwen3.8-**2,4T** Configuration requise :

* [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

| Dynamique 1 bit XXXS | Dynamique 1 bit standard | Dynamique 2 bits | Q8\_0  | BF16 (sans perte) |
| -------------------- | ------------------------ | ---------------- | ------ | ----------------- |
| 397 Go               | 508 Go                   | 657 Go           | 2,6 To | 4,9 To            |

### Paramètres recommandés

#### Qwen3.8-**Paramètres 27B :**

Qwen3.8-27B est un **modèle de réflexion hybride** avec des paramètres par défaut différents pour les modes de réflexion et sans réflexion. « Extra high » est activé par défaut, donc si vous voulez des traces de réflexion plus courtes, vous pouvez [ajuster l’effort de réflexion](#thinking--preserve-thinking):

| Paramètre            | Mode de réflexion | Mode Instruct (sans réflexion) |
| -------------------- | ----------------- | ------------------------------ |
| `température`        | 1.0               | 0.7                            |
| `top_p`              | 0.95              | 0.80                           |
| `top_k`              | 20                | 20                             |
| `min_p`              | 0.0               | 0.0                            |
| `presence_penalty`   | 0.0               | 1.5                            |
| `repetition_penalty` | 1.0               | 1.0                            |

* **Fenêtre de contexte maximale :** `262,144` (peut être étendue à 1M via YaRN)
* Mode de réflexion : `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
* Mode Instruct (ou sans réflexion) : `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`

#### Qwen3.8-**Paramètres 2,4T :**

Qwen3.8-2.4T est **uniquement en mode réflexion**, tandis que Qwen3.8-Max est hybride.

| Par défaut              |
| ----------------------- |
| temperature = 1.0       |
| top\_p = 0.95           |
| top\_k = 20             |
| min\_p = 0.0            |
| presence\_penalty = 0.0 |

* Longueur de contexte = jusqu’à `1,010,000`
* `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`

Si le modèle tient en mémoire, vous obtiendrez une génération d’environ 20 jetons/s avec des B200 et un débit >120 jetons/s. La meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.

### 💡 Réflexion + Réflexion préservée

{% columns %}
{% column %}
Qwen3.8 dispose de **Réflexion préservée** qui conserve la trace de réflexion de la conversation précédente. Cela augmente le nombre de jetons que vous utilisez, mais peut améliorer la précision dans les conversations prolongées. [Unsloth](#run-qwen3.8-in-unsloth-desktop) dispose des interrupteurs « Think » et « Réflexion préservée » pour Qwen3.8 (voir à droite) :
{% endcolumn %}

{% column %}

<figure><img src="/files/dd9ac4d043bcc4b2f9e768300183d4e1acee848f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Qwen3.8-27B est livré avec la prise en charge de `reasoning_effort`, qui peut être utilisé pour ajuster la profondeur de raisonnement et contrôler le coût. Ces interrupteurs sont automatiquement activés dans Unsloth :

* `xhigh` (par défaut) : pour les tâches complexes exigeant une analyse approfondie
* `medium`: équilibre entre précision et vitesse
* `low`: raisonnement efficace optimisé pour la vitesse et le coût
* none

{% hint style="warning" %}
Pour modifier[ l’effort de réflexion / raisonnement](#how-to-enable-or-disable-reasoning-and-thinking) dans `unsloth run` ou `llama-server`, utilisez `--chat-template-kwargs '{"reasoning_effort":"medium"}'`

Si vous êtes sous **Windows** PowerShell, utilisez : `--chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"`

Modifiez `medium` au niveau de raisonnement souhaité.
{% endhint %}

## Guide pour exécuter Qwen3.8

Vous pouvez désormais exécuter Qwen3.8 dans llama.cpp et Unsloth Desktop. Pour le grand modèle Qwen3.8-2.T, nous utiliserons la quantification IQ1\_XXXS de 397 Go (nommée Q1\_0) pour obtenir les meilleurs résultats en termes d’accessibilité et de précision et elle nécessitera au moins 450 Go de RAM. N’hésitez pas à changer le type de quantification. `IQ1_XXXS` quantification (nommée Q1\_0) pour les meilleurs résultats en termes d’accessibilité et de précision, et elle nécessitera au moins 450 Go de RAM. N’hésitez pas à changer le type de quantification.

* Hugging Face : [Qwen3.8-**GGUF**](https://huggingface.co/unsloth/Qwen3.8-GGUF) • [Qwen3.8-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-NVFP4)
* ModelScope : [Qwen3.8-**GGUF**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-**NVFP4**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-NVFP4)
* **2.4T-A95B :** [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

<a href="/pages/901b8ef66232f3df49c12342d74d59aa06381de8#run-qwen3.8-in-unsloth-desktop" class="button primary">Exécuter dans Unsloth Desktop</a><a href="/pages/901b8ef66232f3df49c12342d74d59aa06381de8#run-qwen3.8-in-llama.cpp" class="button secondary">Exécuter dans llama.cpp</a><a href="/pages/901b8ef66232f3df49c12342d74d59aa06381de8#run-qwen3.8-in-llama.cpp" class="button secondary">Guide NVFP4</a>

### 🦥 Exécuter Qwen3.8 dans Unsloth Desktop

Qwen3.8 peut s’exécuter dans [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop), une application d’interface utilisateur open source pour l’IA locale. **Unsloth décharge automatiquement vers la RAM et détecte les configurations multi-GPU**. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur **macOS, Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d’outils](/docs/fr/nouveau/studio/chat.md#auto-healing-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/desktop.md#code-execution) (Python, Bash)
* [Inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via MLX et llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="/files/41fee5ed39cb0d26cb672cb6d7aaf86cf7e47717" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Le moyen le plus simple pour commencer est de télécharger l’ [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez installer manuellement :

macOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Rechercher et télécharger Qwen3.8

Allez à [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou sur le hub de modèles et recherchez Qwen3.8 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="/files/77dfbfa805c8163f9bc6a0418c0a775f6e7cab2d" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter Qwen3.8

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre [guide d’inférence Unsloth](/docs/fr/nouveau/studio/chat.md).

Par exemple, utiliser Unsloth Desktop avec le Qwen3.8 de 397 Go (-91 % plus petit) permet d’activer les modes de réflexion, de permettre le canvas en ligne, la recherche web et l’exécution de code, et bien plus encore.

<figure><img src="/files/d3e934991978ea5d2e42ecffc222bb4ea4b9b394" alt="" width="563"><figcaption><p>Qwen3.8 2,4T en quantification 1 bit dynamique de 397 Go, 91 % plus petit, dans Unsloth Desktop</p></figcaption></figure>
{% endstep %}

{% step %}

#### Servir Qwen3.8 avec l’API Unsloth

Vous pouvez utiliser `unsloth run` la commande et servir Qwen3.8 via une API en utilisant `llama-server` des indicateurs d’exécution, notamment le dimensionnement du contexte, les couches GPU, le threading, l’échantillonnage, le réseau et la configuration des outils. Pour plus d’informations, consultez notre [documentation API](/docs/fr/bases/api.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0 \\
    --chat-template-kwargs '{"reasoning_effort":"medium"}'
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth est maintenant prêt

Vous pouvez aussi faire beaucoup d’autres choses avec Qwen3.8 via Unsloth Desktop, comme :

* **Connecter des outils :** [Claude Code](/docs/fr/bases/claude-code.md), [Codex](/docs/fr/bases/codex.md), [recherche web](/docs/fr/nouveau/studio/chat.md#advanced-web-search), [MCP](/docs/fr/bases/mcp.md) et plus encore
* **Entraîner des modèles :** Ajuster finement du texte, de la diffusion, [des embeddings](/docs/fr/bases/embedding-finetuning.md), et plus encore
* **Générer des médias :** Créer et entraîner [des images](/docs/fr/bases/diffusion-image.md), des vidéos, [TTS](/docs/fr/bases/text-to-speech-tts-fine-tuning.md) localement

<figure><img src="/files/6a308c80d88d1e38d35d627b21ddc35bec5fdbb5" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Nouveaux types de données 1 bit pour Qwen3.8-2.4T-A95B

Nous avons étendu IQ1\_S dans llama.cpp, qui est à 1,5625 bits par poids, à 1,1875 bpw en réduisant le nombre d’entrées dans le codebook — nous avons constaté que cela fonctionne bien pour les grands modèles et peut toujours conserver beaucoup de précision — nous avons aussi constaté que ces nouveaux types de données conviennent bien à la quantification après entraînement (PTQ) sans nécessiter de QAT ou de QAD (entraînement / distillation aware de la quantification). [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

En raison de problèmes de nommage, nous avons utilisé TQ2\_0, TQ1\_0 et Q1\_0, sinon cela n’apparaîtra pas dans le dépôt HF.

<table><thead><tr><th>Type de données</th><th width="147.60000610351562">Dénomination</th><th width="114.39996337890625" align="right">BPW</th><th width="106.20001220703125" align="right"># entrées</th><th width="113.413330078125" align="right">Bits d’index</th><th width="106.4000244140625" align="right">Bloc</th></tr></thead><tbody><tr><td>IQ1_S</td><td>IQ1_S</td><td align="right"><strong>1.5625</strong></td><td align="right">2048</td><td align="right">11</td><td align="right">50 B</td></tr><tr><td>UD-IQ1_XS</td><td>TQ2_0</td><td align="right">1.4375</td><td align="right">1024</td><td align="right">10</td><td align="right">46 B</td></tr><tr><td>UD-IQ1_XXS</td><td>TQ1_0</td><td align="right">1.3125</td><td align="right">512</td><td align="right">9</td><td align="right">42 B</td></tr><tr><td>UD-IQ1_XXXS</td><td>Q1_0</td><td align="right"><strong>1.1875</strong></td><td align="right">256</td><td align="right">8</td><td align="right">38 B</td></tr></tbody></table>

Nous effectuons encore des benchmarks pour les nouveaux types de données, mais pour d’autres grands modèles, nous obtenons **de bons résultats sans aucun QAT / QAD**:

| Type de données |     GiB |      PPL |      KLD |  top-p |
| --------------- | ------: | -------: | -------: | -----: |
| IQ1\_S          | 553.204 | 2.578876 | 0.564553 | 78.882 |
| UD-IQ1\_XS      | 513.583 | 2.931261 | 0.690161 | 75.726 |
| UD-IQ1\_XXS     | 473.961 | 3.540383 | 0.876007 | 71.284 |
| UD-IQ1\_XXXS    | 434.340 | 4.488796 | 1.109944 | 66.257 |

### :llama: Exécuter Qwen3.8 dans llama.cpp

{% stepper %}
{% step %}
Nous devons utiliser ici la branche spécifique IQ1\_XXXS [ici](https://github.com/unslothai/llama.cpp/pull/61). Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d’habitude - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Si vous voulez simplement exécuter le `IQ1_S` standard et les autres quantifications, alors compilez llama.cpp normalement :

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Téléchargez le modèle via (après avoir installé `pip install huggingface_hub`). Vous pouvez choisir `Q1_0` pour `IQ1_XXXS` ou d’autres versions quantifiées comme `Q8_0` . Si les téléchargements se bloquent, voir : [Dépannage de Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

**Qwen3.8-27B :**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \\
    --local-dir unsloth/Qwen3.8-27B-GGUF \\
    --include "*UD-Q4_K_XL*" # Utilisez "*UD-Q3_K_XL*" pour 3 bits
```

**Qwen3.8-2.4T :**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --include "*Q1_0*" # Utilisez "*IQ2_XXS*" pour 2 bits
```

{% endstep %}

{% step %}
Pour exécuter le modèle dans llama-cli, suivez les extraits de code ci-dessous :\
N’oubliez pas de [modifier les paramètres](#recommended-settings) selon votre cas d’utilisation.

**Qwen3.8-27B :**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}

**Qwen3.8-2.4T :**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}

{% step %}
Pour exécuter le UD-IQ1\_S général, vous pouvez faire :

**Qwen3.8-2.4T :**

{% code overflow="wrap" %}

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGFF \\
    --include "*IQ1_S*" # Utilisez "*IQ2_XXS*" pour 2 bits
```

{% endcode %}
{% endstep %}

{% step %}
Puis pour l’exécuter :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-IQ1_S/Qwen3.8-2.4T-A95B-UD-IQ1_S-00001-of-00012.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

### ⚡️NVFP4

Comme Qwen3.6, nous publions aussi de nouvelles [quantifications dynamiques NVFP4 de Qwen3.8](/docs/fr/bases/nvfp4.md)-27B qui s’exécutent **\~1,5× plus rapide** que les checkpoints BF16, avec **de meilleures performances** et des tailles de fichiers comparables. Exécutez Qwen3.8-27B NVFP4 **1,5x plus rapide** sur **24 Go de VRAM.** Nous avons également ajouté **la calibration du cache KV FP8** pour des longueurs de contexte 2× plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir [#dgx-spark-with-nvfp4-quants](#dgx-spark-with-nvfp4-quants "mention")), les GPU B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien ! Vous pouvez exécuter les quants NVFP4 dans [vLLM](#vllm) pour l’instant seulement (SGLang n’est pas pris en charge).

* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4) quant

<table><thead><tr><th width="90" align="right">lot</th><th width="114.5999755859375" align="right">tok/s total BF16</th><th width="122.60003662109375" align="right">tok/s total NVFP4</th><th width="122" align="right">accélération</th><th width="137.4000244140625" align="right">BF16 par utilisateur</th><th align="right">NVFP4 par utilisateur</th></tr></thead><tbody><tr><td align="right">1</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td><td align="right">1,49x</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td></tr><tr><td align="right">8</td><td align="right">649.4</td><td align="right"><strong>938.8</strong></td><td align="right">1,45x</td><td align="right">81.2</td><td align="right"><strong>117.3</strong></td></tr><tr><td align="right">32</td><td align="right">1983.0</td><td align="right"><strong>2787.0</strong></td><td align="right">1,41x</td><td align="right">62.0</td><td align="right"><strong>87.1</strong></td></tr><tr><td align="right">64</td><td align="right">3048.5</td><td align="right"><strong>4407.2</strong></td><td align="right">1,45x</td><td align="right">47.6</td><td align="right"><strong>68.9</strong></td></tr></tbody></table>

Voir ci-dessous les benchmarks précédents réalisés pour Qwen3.6, comparant également d’autres implémentations NVFP4 qui utilisent des activations 16 bits à nos activations NVFP4 :

<figure><img src="/files/6cab20b335b1ed16dbd30891fdeab4340f29737d" alt="" width="563"><figcaption></figcaption></figure>

Tous les benchmarks utilisent 1× B200 avec une concurrence de 128. Une concurrence plus élevée peut porter le 35B à 17 561 tokens/s.&#x20;

Pour les benchmarks de précision, nous avons exécuté KLD et l’accord Top-1 % sur le code, le chat et de nombreux domaines. NVFP4 offre de manière constante une récupération de précision de 92 % à 97 % par rapport au BF16

| corpus            |   moyenne KLD | accord top-1 |
| ----------------- | ------------: | -----------: |
| zh                |       0.01628 |       93.55% |
| code              |       0.02600 |       96.68% |
| refgen            |       0.03993 |       94.46% |
| chat              |       0.05818 |       92.15% |
| ja / ko / ru / es | 0.0124-0.0155 |       94-95% |

Pour les benchmarks de précision pour Qwen 3.6, nous avons mené MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 - nous montrons que nos quants plus rapides font de même sur tous :

<figure><img src="/files/9621db18863d348297c1afba456da75abb3a4560" alt=""><figcaption></figcaption></figure>

Pour plus d’informations, vous pouvez lire notre [article de blog sur les quants NVFP4 dynamiques](/docs/fr/bases/nvfp4.md).

Pour exécuter les quants NVFP4, voir ci-dessous les commandes pour exécuter Qwen3.8-27B dans [vLLM](/docs/fr/bases/inference-and-deployment/vllm-guide.md) ou [SGLang](/docs/fr/bases/inference-and-deployment/sglang-guide.md):

#### **vLLM :**

Pour installer vLLM dans un environnement virtuel séparé :

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \\
    --torch-backend=auto
```

{% endcode %}

Ensuite, pour servir la variante 27B :

```shell
vllm serve unsloth/Qwen3.8-27B-NVFP4
```

Pour activer le MTP / décodage spéculatif (décodage plus rapide mais avec un débit légèrement inférieur), utilisez :

```bash
vllm serve unsloth/Qwen3.8-27B-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Si vous rencontrez des problèmes avec Torchcodec, assurez-vous d’effectuer ce qui suit puis relancez vllm.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang :**

**SGLang n’est pas encore pris en charge, car nous quantifions le lm\_head en FP8.**

vLLM a un `CompressedTensorsW8A8Fp8` noyau qui prend cela en charge, tandis que SGLang ne peut pas charger le lm\_head FP8.

### :exploding\_head:Analyse de la quantification

Les quants NVFP4 sont 1,5x plus rapides que le BF16 et conservent une précision top-1 % de 92 à 97 %.

Nous avons utilisé [Dynamic 3.0 GGUFs](/docs/fr/bases/dynamic-3.0-ggufs.md) pour rendre Qwen3.8-27B bien meilleur !

Graphique de précision top-1 % tel qu’affiché dans UD-3 pour Qwen3.8-27B :

<figure><img src="/files/5ad5001ccc582cd182c64db684a4981187e322e0" alt=""><figcaption></figcaption></figure>

Et la KLD moyenne pour Qwen3.8 :

<figure><img src="/files/8ec96d1c50d82e1d2bba01d82b1bd02b0a3ba266" alt=""><figcaption></figcaption></figure>

### 📊 Évaluations

#### Qwen3.8-**27B**

Voir plus bas les benchmarks sous forme de tableau :

<div><figure><img src="/files/e2366de7c93db1b3430b299647f6ba4ec1c23f94" alt=""><figcaption></figcaption></figure> <figure><img src="/files/537b9020e76c7a13ccdc88e8882d137f48221eb5" alt=""><figcaption></figcaption></figure></div>

#### Performances textuelles

| Benchmark                                              | Qwen3.8-27B                  | Qwen3.6-27B          | Qwen3.7-Plus         | Muse Glimmer-30B | Opus4.6 Max |
| ------------------------------------------------------ | ---------------------------- | -------------------- | -------------------- | ---------------- | ----------- |
| **Codage**                                             |                              |                      |                      |                  |             |
| Codage terminal agentiqueTerminal Bench 2.1 (Terminus) | 73.0                         | 63.4                 | 64.0                 | 51.7             | **78.2**    |
| Codage agentiqueSWE-bench Pro                          | **61.7**                     | 53.5                 | 57.6                 | 51.2             | 53.4        |
| Génération de code au niveau du dépôtNL2Repo-Bench     | 42.3                         | 36.2                 | 41.1                 | --               | **47.6**    |
| Codage agentiqueDeepSWE 1.1                            | **42.2**                     | 13.3                 | 14.2                 | --               | --          |
| Ingénierie logicielleQwenSWEBench                      | **79.0**                     | 49.3                 | 59.2                 | --               | 63.8        |
| **Agent**                                              |                              |                      |                      |                  |             |
| Travail de bureau à long horizonCoWorkBench            | **70.7**                     | 61.0                 | 65.1                 | --               | 68.2        |
| Tâches professionnellesJobBench                        | **33.4**                     | 21.8                 | 27.6                 | --               | --          |
| Tâches agentiques de pointeAgents' Last Exam           | Pass\@1**20.4**Score**42.9** | Pass\@110.6Score27.3 | Pass\@113.2Score33.6 | --               | --          |
| Général                                                |                              |                      |                      |                  |             |
| Suivi d’instructionsIFBench                            | **79.5**                     | 69.1                 | 79.1                 | 77.0             | 62.5        |
| Raisonnement scientifiqueGPQA Diamond                  | 89.2                         | 87.8                 | 90.3                 | 83.5             | **91.3**    |
| Raisonnement multidisciplinaireHLE                     | 30.8                         | 24.0                 | 34.7                 | 22.0             | **40.0**    |
| Codage compétitifLiveCodeBench v6                      | **90.3**                     | 83.9                 | 89.6                 | --               | 88.8        |

#### Qwen3.8-**2.4T-A95B**

<figure><img src="/files/c9577e27e6072148adf74e2b6dcb49f0cf913e13" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/qwen3.8.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
