> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/glm-5.3-flash.md).

# GLM-5.3-Flash : comment l'exécuter localement

Exécutez le nouveau modèle GLM-5.3-Flash, alias ox-alpha, de Z.ai.

GLM-5.3-Flash, également connu sous le nom de **`ox-alpha`**, est le nouveau modèle ouvert multimodal de Z.ai de 320B paramètres (18B actifs) qui **surpasse** [GLM-5.2](/docs/fr/modeles/glm-5.2.md). GLM-5.3-Flash est la version plus petite de [GLM-5.3](/docs/fr/modeles/glm-5.3.md) et rivalise avec **Claude Opus 4.8** sur les benchmarks de codage et agentiques. Vous pouvez désormais exécuter le modèle 1-bit localement sur 102 Go de RAM/VRAM ou le 3-bit sur des configurations de 128 Go via llama.cpp ou [Unsloth](https://github.com/unslothai/unsloth). Merci à Z.ai pour l'accès dès le jour zéro.

Unsloth dynamique **1-bit** (93 Go) GGUFs conservent **71 % de la précision du top 1 %** tout en étant **85 % plus petit** par rapport au BF16 (642 Go). Le 3-bit dynamique est 76 % plus petit et conserve 87 % de précision.

​​<a href="/pages/06d49b8f3f4ee83dbcb34659a633be6c79ae0a23#run-glm-5.3-flash-ox-alpha-locally" class="button primary">Guide d'exécution de GLM-5.3-Flash</a><a href="https://unsloth.ai/download" class="button secondary">Télécharger Unsloth</a>

{% hint style="success" %}
**4 sept. :** GLM-5.3-Flash s'exécute désormais avec [**une inférence 3,3x plus rapide**](#faster-inference-and-mtp-support)**!**
{% endhint %}

{% columns %}
{% column width="50%" %}
GLM-5.3-Flash a été entraîné sur 30 T de jetons et repose sur un modèle de base nouvellement entraîné. Son architecture hybride d'attention clairsemée et linéaire réduit les coûts de service sur les longs contextes sans sacrifier la précision.

Vous pouvez désormais exécuter le modèle directement dans [Unsloth Desktop](#run-glm-5.3-flash-in-unsloth).
{% endcolumn %}

{% column width="50%" %}

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FqPVJA6BHcCJIkQQrDvpD%2FScreenshot%202026-08-27%20at%207.38.11%E2%80%AFAM.png?alt=media&amp;token=576a6810-3f32-4e4c-a0d8-8a84cb733a52" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

### :gear: Guide d'utilisation

#### Exigences de GLM-5.3-Flash :

La plus petite quantification 1-bit fonctionne avec 100 Go de RAM, tandis que la 3-bit fonctionne sur des appareils de 128 Go comme un Mac ou un NVIDIA DGX Spark.\
**Tableau : exigences matérielles** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

| 1-bit  | 2-bit  | 3-bit      | 4-bit      | 8-bit  | BF16   |
| ------ | ------ | ---------- | ---------- | ------ | ------ |
| 100 Go | 115 Go | 128-150 Go | 162-210 Go | 350 Go | 650 Go |

### Paramètres recommandés

GLM-5.3-Flash a **3 modes de réflexion** : Bas, Élevé et Max. Utilisez la réflexion Max pour les tâches compliquées. Dans [Unsloth](#run-glm-5.2-in-unsloth-studio), vous pouvez facilement sélectionner la réflexion Bas, Élevé ou Max à l'aide d'un interrupteur dans la zone de chat.

Utilisez ces paramètres pour la plupart des cas d'utilisation :

| Paramètres par défaut (la plupart des tâches) | DeepSWE              |
| --------------------------------------------- | -------------------- |
| `temperature` = 1.0                           | `temperature` = 0.95 |
| `top_p` = 0.95                                | `top_p` = 1.0        |

* **Fenêtre de contexte maximale :** `1,048,576`.

#### Modification de l'effort de raisonnement

GLM-5.3-Flash utilise Max reasoning par défaut. Il prend également en charge des efforts de raisonnement où `reasoning_effort` peut être « low », « high » ou « max ».

### Inférence plus rapide et prise en charge de MTP

Au 4 sept., nous avons ajouté plusieurs améliorations et optimisations à notre [PR llama.cpp](https://github.com/ggml-org/llama.cpp/pull/27754). Nous avons implémenté un chemin de décodage plus rapide, plus la prise en charge MTP en bonus, permettant jusqu'à **une inférence 3,3× plus rapide** sur de longues longueurs de contexte !

Tout fonctionne immédiatement dans [Unsloth Desktop](#run-glm-5.3-flash-in-unsloth), il suffit de mettre à jour vers la dernière version si nécessaire. Aucun module supplémentaire ni fichier MTP n'est requis. Vous pouvez également suivre notre [llama.cpp](#run-glm-5.3-flash-in-llama.cpp) guide.

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FRKSzhmcluWnoNwUxFS40%2Fimage.png?alt=media&amp;token=872cd9b0-e968-4a0d-977c-5315d0ca3e49" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F2tUYioUQhnyCv1pJTfld%2Fimage.png?alt=media&amp;token=b8bfd0de-22c8-4f30-8bfd-36656ae3c16e" alt=""><figcaption></figcaption></figure></div>

En utilisant GLM-5.3-Flash UD-IQ1\_S sur 1xB200 et en ignorant d'abord MTP, on obtient :

| Test         | tok/s de base | tok/s optimisé |
| ------------ | ------------: | -------------: |
| pp512        |       1121.80 |         1122.0 |
| tg32         |         62.79 |          63.10 |
| tg32 @ 4096  |         53.52 |          59.50 |
| tg32 @ 16384 |         41.02 |          57.99 |
| tg32 @ 65536 |         20.66 |          48.99 |

Ensuite, une fois MTP ajouté, nous observons des gains encore plus importants, surtout pour les contextes plus longs. Cependant, nous devrions nous arrêter autour de n=2, car davantage de jetons brouillons rendent l'inférence plus lente.

| prompt | MTP désactivé |  n=2 |  n=3 |  n=5 |
| ------ | ------------: | ---: | ---: | ---: |
| 4096   |          58.6 | 86.5 | 80.2 | 63.7 |
| 16K    |          55.0 |      | 77.2 |      |

Pour les longueurs de contexte plus courtes, nous observons toujours des accélérations, bien qu'elles atteignent jusqu'à 1,6x plus rapide.

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FmX36IJYj83OgfeQbCjh5%2Fimage.png?alt=media&amp;token=56e0ea43-df0b-47c4-8551-849921ef3913" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FCebn6JiIDQpQMSOz8nIX%2Fimage.png?alt=media&amp;token=1f76ea17-4970-45ae-b92e-3abce29628d7" alt=""><figcaption></figcaption></figure></div>

### 📈 Analyse de quantification

Nous avons quantifié GLM-5.3-Flash jusqu'à UD-IQ1\_S 1bit (93.09GB) et il conserve 71 % de la précision du top 1 % tout en étant 85 % plus petit par rapport au BF16 (641.64GB)

UD-Q2\_K\_XL dynamique 2-bit fait 109 Go, est 83 % plus petit et conserve 78 % de précision.\
UD-IQ3\_XXS dynamique 3-bit fait 120 Go, est 81 % plus petit et conserve 82 % de précision.\
UD-Q4\_K\_XL dynamique 4-bit fait 200 Go, est 69 % plus petit et conserve 93 % de précision.

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHB3bFxI8Cm3IOw3CRzvR%2Fglm53_flash_dynamic_ggufs_top1_accuracy_new_data.png?alt=media&amp;token=49882cca-1643-4e81-ad64-9d53c75ab93a" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FthGU2pMvyHLSsnOal90W%2Fglm53_flash_dynamic_ggufs_kld_benchmarks_new_data.png?alt=media&amp;token=204f70ee-cae2-4a63-b958-d4ec515f4ce3" alt=""><figcaption></figcaption></figure></div>

| Quant        | taille | précision top-1 | KLD moyenne | KLD 99,9 % |
| ------------ | ------ | --------------- | ----------- | ---------- |
| UD-IQ1\_S    | 93.09  | 70.89%          | 0.669714    | 9.1658     |
| UD-IQ1\_M    | 97.58  | 73.06%          | 0.572413    | 8.5069     |
| UD-IQ2\_XXS  | 101.84 | 76.30%          | 0.450148    | 7.5764     |
| UD-Q2\_K\_XL | 108.72 | 78.34%          | 0.380134    | 6.8412     |
| UD-IQ3\_XXS  | 120.37 | 81.63%          | 0.283772    | 5.9611     |
| UD-Q3\_K\_XL | 147.54 | 86.25%          | 0.159697    | 4.0281     |
| UD-IQ4\_XS   | 156.82 | 88.18%          | 0.116652    | 3.1014     |
| UD-Q4\_K\_XL | 199.71 | 92.22%          | 0.049294    | 1.4894     |
| UD-Q5\_K\_XL | 240.31 | 94.35%          | 0.027052    | 0.8696     |
| UD-Q6\_K\_XL | 291.83 | 95.23%          | 0.019007    | 0.6267     |

## Exécutez GLM-5.3-Flash (Ox-Alpha) localement

Vous pouvez désormais exécuter GLM-5.3-Flash (Ox-Alpha) dans Unsloth Desktop et llama.cpp avec notre [PR spécifique](https://github.com/ggml-org/llama.cpp/pull/27754). Nous utilisons la 3-bit `UD-IQ3_XXS` dans nos démonstrations car elle tient sur des appareils de 128 Go. N'hésitez pas à changer le type de quantification.

* Hugging Face : [GLM-5.3-Flash-GGUF](https://huggingface.co/unsloth/GLM-5.3-Flash-GGUF)

<a href="/pages/06d49b8f3f4ee83dbcb34659a633be6c79ae0a23#run-glm-5.3-flash-in-unsloth" class="button primary">Exécuter dans Unsloth Desktop</a><a href="/pages/06d49b8f3f4ee83dbcb34659a633be6c79ae0a23#run-glm-5.3-flash-in-llama.cpp" class="button secondary">Exécuter dans llama.cpp</a>

### 🦥 Exécuter GLM-5.3-Flash dans Unsloth

GLM-5.3-Flash peut désormais s'exécuter dans [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop), une application d'interface utilisateur open source pour l'IA locale. **Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU**. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur **MacOS, Windows**, Linux et :

{% columns %}
{% column %}

* Recherchez, téléchargez, [exécutez des GGUF](/docs/fr/nouveau/studio.md#run-models-locally), des modèles MLX et safetensor
* [**Auto-réparation** appel d'outils](/docs/fr/nouveau/studio/chat.md#auto-healing-tool-calling) + **recherche web**
* [**exécution de code**](/docs/fr/desktop.md#code-execution) (Python, Bash)
* [inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence CPU + GPU rapide via MLX et llama.cpp
* [Entraînez des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6IXaXdTVyvbrnjehlxys%2Fkimik3.gif?alt=media&amp;token=31e1213b-d7da-46e9-bc7f-3a8c402513fc" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Le moyen le plus simple de commencer est de télécharger l' [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez installer manuellement :

MacOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Recherchez et téléchargez GLM-5.3-Flash

Allez dans [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou le hub de modèles et recherchez GLM-5.3-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FvOQkVli16S26FygKi2gw%2FScreenshot%202026-08-27%20at%204.18.11%E2%80%AFAM.png?alt=media&amp;token=df7914de-597e-43b9-8147-d568ccca0a51" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter GLM-5.3-Flash

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth](/docs/fr/nouveau/studio/chat.md). Exécution 1-bit ci-dessous :

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FwmOvZRaD61XCmMDBlHOD%2FScreenshot%202026-08-27%20at%207.08.52%E2%80%AFAM.png?alt=media&amp;token=4980f172-4323-43a0-9338-fe0e2ca749b6" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Servir GLM-5.3-Flash avec l'API Unsloth

Vous pouvez utiliser `unsloth run` la commande et servir GLM-5.3-Flash via une API en utilisant `llama-server` des options d'exécution, notamment la taille du contexte, les couches GPU, le multithreading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, voir nos [docs API](/docs/fr/notions-de-base/api.md) ou [unsloth start](/docs/fr/integrations/unsloth-start.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth est maintenant prêt

Vous pouvez également faire bien d'autres choses avec GLM-5.3-Flash via Unsloth Desktop, comme :

* **Connecter des outils :** [Claude Code](/docs/fr/notions-de-base/claude-code.md), [Codex](/docs/fr/notions-de-base/codex.md), [recherche web](/docs/fr/nouveau/studio/chat.md#advanced-web-search), [MCP](/docs/fr/notions-de-base/mcp.md) et plus encore
* **Entraîner des modèles :** Ajuster du texte, de la diffusion, [embedding](/docs/fr/notions-de-base/embedding-finetuning.md), et plus encore
* **Générer des médias :** Créer et entraîner [images](/docs/fr/notions-de-base/diffusion-image.md), vidéo, [TTS](/docs/fr/notions-de-base/text-to-speech-tts-fine-tuning.md) localement

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FNYiWxq5OX7NdPoqxp2Hu%2FScreenshot%202026-08-27%20at%2011.59.01%E2%80%AFPM.png?alt=media&amp;token=d9311caa-6935-47b3-a767-5c48e92b7c25" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### :llama: Exécuter GLM-5.3-Flash dans llama.cpp

{% stepper %}
{% step %}
Nous devons utiliser notre PR spécifique de llama.cpp [ici](https://github.com/unslothai/llama.cpp/pull/61). Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou souhaitez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez normalement - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone --branch glm5next/upstream https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Pour exécuter le modèle, vous pouvez faire :

{% code overflow="wrap" %}

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/GLM-5.3-Flash-GGUF \
    --local-dir unsloth/GLM-5.3-Flash-GGUF \
    --include "*UD-IQ3_XXS*" # Utilisez "*IQ2_XXS*" pour le 2-bit
```

{% endcode %}
{% endstep %}

{% step %}
Puis pour l'exécuter :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/GLM-5.3-Flash-GGUF/UD-IQ3_XXS/GLM-5.3-Flash-UD-IQ3_XXS-00001-of-00004.gguf \
    --temp 1.0 \
    --top-p 0.95 \
    --chat-template-kwargs '{"reasoning_effort":"max"}'
```

{% endcode %}

Remplacez `UD-IQ3_XXS` par la quantification de votre choix, comme `IQ2_XXS` pour le 2-bit une fois téléversé.
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FfxF1H1wdQe3vKBepuhdA%2Fimage.png?alt=media&amp;token=b6e590cc-fafb-43b3-8e8b-0b318200cbcb" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FUy73TYPneV9NarmiUgJZ%2Fimage.png?alt=media&amp;token=8b344785-cb9b-4c61-bf55-4fdc77be1d0a" alt=""><figcaption></figcaption></figure></div>

| Benchmark                                     | GLM-5.3-Flash | GLM-5.2 | DeepSeek-V4-Vision-Exp | Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
| --------------------------------------------- | ------------- | ------- | ---------------------- | -------- | ------------- | ---------------- |
| Codage                                        |               |         |                        |          |               |                  |
| Terminal Bench 2.1                            | 84.3          | 81.0    | 83.9                   | 85.0     | 87.4          | 85.8             |
| <p>DeepSWE</p><p>v1.1</p>                     | 63.4          | 46.2    | 59.3                   | 58.0     | 69.6          | 65.3             |
| NL2Repo                                       | 56.3          | 48.9    | 57.7                   | 69.7     | -             | -                |
| Agentique                                     |               |         |                        |          |               |                  |
| Toolathlon Verified                           | 78.4          | 59.9    | 75.9                   | 76.2     | 74.9          | -                |
| <p>AutomationBench</p><p>v1.0.6</p>           | 48.8          | 26.2    | 38.8                   | 41.0     | 37.2          | 52.3             |
| Dernier examen des agents                     | 26.3          | 20.4    | 27.3                   | 27.0     | 28.0          | -                |
| HLE avec outils                               | 55.3          | 54.7    | 55.1                   | 57.9     | -             | -                |
| GDPval-AA v2                                  | 1773          | 1504    | 1675                   | 1582     | 1571          | 1527             |
| Vision                                        |               |         |                        |          |               |                  |
| OfficeQA Pro                                  | 62.4          | -       | 57.9                   | 48.9     | -             | -                |
| <p>Raisonnement CharXiv</p><p>avec outils</p> | 89.4          | -       | 80.4                   | 89.9     | 88.0          | 88.7             |
| <p>Chartography</p><p>avec outils</p>         | 78.0          | -       | 64.3                   | 75.0     | 68.0          | 65.0             |
| BabyVision                                    | 53.4          | -       | 35.1                   | 46.8     | 61.6          | 70.9             |
| MVbench                                       | 77.8          | -       | 69.4                   | 67.1     | 75.0          | 82.2             |
| MMVU                                          | 80.5          | -       | 72.7                   | 67.4     | 75.8          | 82.3             |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/glm-5.3-flash.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
