> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/glm-5.3.md).

# GLM-5.3 - Comment l’exécuter localement

Exécutez le nouveau modèle GLM-5.3 de Z.ai.

GLM-5.3 est le nouveau modèle de Z.ai avec 744B paramètres (40B actifs). En août 2026, GLM-5.3 est le **modèle ouvert le plus puissant** à ce jour, atteignant l'état de l'art sur Terminal Bench 3.0 et Agents' Last Exam. GLM-5.3 utilise le même modèle de base que [GLM-5.2](/docs/fr/modeles/glm-5.2.md), chaque amélioration provenant de l'entraînement postérieur. Le modèle a une **fenêtre de contexte de 1M** et peut désormais s'exécuter localement via [Unsloth Dynamic](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) GGUFs avec llama.cpp ou [Unsloth Desktop](#run-glm-5.3-in-unsloth).

<a href="/docs/fr/modeles/glm-5.3-flash.md" class="button primary">Guide GLM-5.3-Flash</a><a href="/pages/a93c8765635f787d190a8d3f7b3fa2422c8f9353#run-glm-5.3-tutorials" class="button secondary">Guide GLM-5.3</a>

{% hint style="info" %}
Si vous souhaitez exécuter [**GLM-5.3-Flash**](/docs/fr/modeles/glm-5.3-flash.md), veuillez lire notre [article spécifique](/docs/fr/modeles/glm-5.3-flash.md) à ce sujet.
{% endhint %}

Le GGUF dynamique 1 bit atteint **\~76%** une précision top-1 tout en étant **85 % plus petit**. Le dynamique 2 bits atteint **\~81%** une précision tout en étant **83 % plus petit**. Comme GLM-5.3 a la même taille et la même architecture que GLM-5.2, la plupart des exigences / paramètres sont les mêmes. Merci à Z.ai pour l'accès Unsloth dès le premier jour. [**GLM-5.3-GGUF**](https://huggingface.co/unsloth/GLM-5.3-GGUF)

### **⚙️ Guide d'utilisation**

La quantification dynamique 2 bits `UD-IQ2_M` utilise **239GB** d'espace disque fonctionne bien sur **256GB RAM** des appareils comme deux NVIDIA DGX Sparks ou un Mac Studio.

La **1 bit** quantification tiendra dans 223GB de RAM et le 8 bits nécessite 810GB de RAM.

**Tableau : exigences matérielles d'inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

| 1 bit | 2 bits | 3 bits    | 4 bits    | 6 bits | 8 bits |
| ----- | ------ | --------- | --------- | ------ | ------ |
| 223GB | 245GB  | 290-360GB | 372-475GB | 570GB  | 810GB  |

Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FJsaB5Sn5JEJXD40RU06i%2Fglm53_unsloth_dynamic_ggufs_top1_accuracy_updated.png?alt=media&amp;token=ef24f54e-c3a7-461e-aa02-ccb8f654fede" alt=""><figcaption></figcaption></figure>

#### Paramètres recommandés

GLM-5.3 a **3 modes de réflexion**: **Faible**, **Élevé**, et **Max**. Utilisez Max Thinking pour les tâches de codage complexes. Dans [Unsloth Desktop](/docs/fr/desktop.md) vous pouvez facilement basculer entre Low, High et Max Thinking via une interface.

Utilisez ces paramètres pour la plupart des cas d'utilisation :

| Paramètres par défaut (la plupart des tâches) | Tâches agentiques longues |
| --------------------------------------------- | ------------------------- |
| `temperature` = 1.0                           | `temperature` = 1.0       |
| `top_p` = 0.95                                | `top_p` = 1.0             |

La **fenêtre de contexte maximale** est `1,048,576`.

GLM-5.3 utilise le raisonnement maximal par défaut et la réflexion ne peut pas être désactivée. `reasoning_effort` peut être `faible`, `élevé`, ou `max`.

`clear_thinking` est faux par défaut et ils recommandent true.

Pour personnaliser l'effort de raisonnement (remplacez 'low' par 'high' ou 'max') :

```bash
--chat-template-kwargs '{"reasoning_effort":"low"}'
```

Pour les conversations à plusieurs tours, utilisez `clear_thinking=true` pour supprimer le raisonnement des tours précédents (recommandé pour ce modèle) :

```bash
--chat-template-kwargs '{"reasoning_effort":"max","clear_thinking":true}'
```

### Corrections du modèle de chat

Nous avons constaté que GLM utilise une `.{id}.` notation intéressante pour les modèles de chat, mais de nombreux moteurs ne la prennent pas en charge. Nous l'avons modifiée en `[id]` afin d'utiliser la syntaxe d'indexation des listes Python. Voir cette [modification de commit](https://huggingface.co/unsloth/GLM-5.3/commit/05cd131f7ab554f983b81c6be97916450b0ff8d2) pour plus de détails.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F3d64OwoEjqpJ5fHum860%2Fimage.png?alt=media&amp;token=784da534-c703-4246-886d-bd058cf345f1" alt="" width="563"><figcaption></figcaption></figure>

## Lancer les tutoriels GLM-5.3 :

Vous pouvez désormais exécuter GLM-5.3 dans [llama.cpp](https://unsloth.ai/docs/models/glm-5.3#run-glm-5.3-in-llama.cpp) et [Unsloth Desktop](#run-glm-5.3-flash-in-unsloth). Nous utiliserons la quantification 239GB pour le meilleur équilibre entre accessibilité et précision. [`UD-IQ2_M`](https://huggingface.co/unsloth/GLM-5.3-GGUF/tree/main/UD-IQ2_M) quantification pour le meilleur équilibre entre accessibilité et précision.

### 🦥 Exécuter GLM-5.3 dans Unsloth

GLM-5.3 peut désormais s'exécuter dans [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop), une application d'interface utilisateur open source pour l'IA locale. **Unsloth décharge automatiquement vers la RAM et détecte les configurations multi-GPU**. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur **macOS, Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally), des modèles MLX et safetensor
* [**Auto-réparation** appel d'outils](/docs/fr/nouveau/studio/chat.md#auto-healing-tool-calling) + **recherche web**
* [**exécution de code**](/docs/fr/desktop.md#code-execution) (Python, Bash)
* [inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide sur CPU + GPU via MLX et llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FYVcpYHcS7vpnYcZUiwpO%2Fglm52%20example.png?alt=media&amp;token=d218ed4e-5102-48a6-943a-7d6b7a10446f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

La façon la plus simple de commencer est de télécharger l' [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez l'installation manuelle :

macOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

PowerShell Windows :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Recherchez et téléchargez GLM-5.3

Accédez à [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou au hub de modèles et recherchez GLM-5.3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fpcug1oswnDUemsv08ffL%2FScreenshot%202026-08-28%20at%209.45.17%E2%80%AFAM.png?alt=media&amp;token=716b05f9-b0e9-4433-a592-6f9fdcec13a3" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter GLM-5.3

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth](/docs/fr/nouveau/studio/chat.md).
{% endstep %}

{% step %}

#### Servir GLM-5.3 avec l'API Unsloth

Vous pouvez utiliser `unsloth run` et servir GLM-5.3 via une API en utilisant `llama-server` les options d'exécution, notamment le dimensionnement du contexte, les couches GPU, le threading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, consultez notre [documentation API](/docs/fr/notions-de-base/api.md) ou [unsloth start](/docs/fr/integrations/unsloth-start.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/GLM-5.3-GGUF:UD-IQ2_M
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth est maintenant prêt

Vous pouvez aussi faire beaucoup d'autres choses avec GLM-5.3 via Unsloth Desktop, comme :

* **Connecter des outils :** [Claude Code](/docs/fr/notions-de-base/claude-code.md), [Codex](/docs/fr/notions-de-base/codex.md), [recherche web](/docs/fr/nouveau/studio/chat.md#advanced-web-search), [MCP](/docs/fr/notions-de-base/mcp.md) et plus encore
* **Entraîner des modèles :** Ajuster finement du texte, de la diffusion, [des embeddings](/docs/fr/notions-de-base/embedding-finetuning.md), et plus encore
* **Générer des médias :** Créer et entraîner [des images](/docs/fr/notions-de-base/diffusion-image.md), de la vidéo, [TTS](/docs/fr/notions-de-base/text-to-speech-tts-fine-tuning.md) localement

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FhxlaXPPPrWDFXhdkSdck%2FScreenshot%202026-08-27%20at%2011.59.01%E2%80%AFPM.png?alt=media&amp;token=a2ef8037-b657-473d-83e6-a5f5f22208ff" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Exécuter GLM-5.3 dans llama.cpp

Pour ce guide, nous exécuterons le `UD-IQ2_M` quantification qui nécessitera au moins 245GB de RAM. N'hésitez pas à changer le type de quantification. Pour ces tutoriels, nous utiliserons [llama.cpp](https://https/github.com/ggml-org/llama.cpp) pour une inférence locale rapide. GGUF : [**GLM-5.3-GGUF**](https://huggingface.co/unsloth/GLM-5.3-GGUF)&#x20;

{% stepper %}
{% step %}
Obtenez la dernière `llama.cpp` **sur** [**GitHub ici**](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez normalement - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. D'abord, sélectionnez le type de quantification souhaité, par exemple `UD-IQ2_M`. Utilisez aussi `export LLAMA_CACHE="unsloth/GLM-5.3-GGUF"` pour forcer `llama.cpp` à enregistrer vers un emplacement spécifique. **Notez que ce processus de téléchargement peut être très lent**, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/GLM-5.3-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/GLM-5.3-GGUF:UD-IQ2_M \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement **(beaucoup plus rapide !)**, nous pouvons télécharger le modèle via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements se bloquent, voir : [Hugging Face Hub, débogage XET](/docs/fr/notions-de-base/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/GLM-5.3-GGUF \\
    --local-dir unsloth/GLM-5.3-GGUF \\
    --include "*UD-IQ2_M*" # Utilisez "*UD-Q8_K_XL*" pour une précision presque complète
```

Si vous souhaitez utiliser le dynamique 1 bit, faites alors :

{% code overflow="wrap" expandable="true" %}

```bash
hf download unsloth/GLM-5.3-GGUF \\
    --local-dir unsloth/GLM-5.3-GGUF \\
    --include "*UD-IQ1_S*"
```

{% endcode %}
{% endstep %}

{% step %}
Exécutez ensuite le modèle en mode conversation. Utilisez `unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf` pour 2 bits ou `unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf`  pour 1 bit.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}

{% step %}
Comme pour GLM-5.2, lorsque vous lancez llama-cli, vous verrez :

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FUalNNvFxH613C9kcM3r4%2Fimage.png?alt=media&amp;token=f376e93d-26af-472f-8ea3-0968b57b004c" alt="" width="375"><figcaption></figcaption></figure>

Puis, après l'invite, nous avons créé un petit jeu Snake sympa en utilisant `UD-IQ1_S` donc 1 bit, et cela a très bien fonctionné avec GLM-5.3 !

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FDmysmr1aSotb5nIbLou5%2Fglm53-ezgif.com-video-to-gif-converter.gif?alt=media&amp;token=dff4c0a8-cf4f-43e8-99a0-40430ab8153b" alt="" width="395"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

#### 📐 Contexte long via quantification du cache KV

Pour utiliser un long contexte dans llama.cpp, utilisez la quantification du cache KV pour réduire l'utilisation mémoire.

Actuellement, les types KV cache suivants sont pris en charge : `f32`, `f16`, `bf16`, `q8_0`, `q4_0`, `q4_1`, `iq4_nl`, `q5_0`, et `q5_1`. Par défaut `f16` est utilisé. `q4_1` utilise environ 5 bits par poids, permettant environ **des longueurs de contexte 3,2x plus longues**.

```bash
./llama.cpp/llama-cli \\
    --model unsloth/GLM-5.3-GGUF/UD-IQ2_M-/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01 \\
    --cache-type-k q4_1 \\
    --cache-type-v q4_1 \\
    --jinja \\
    --chat-template-kwargs '{"reasoning_effort":"max"}'
```

### Analyse de quantification

Nous avons également exécuté KLD sur les quantifications que nous avons téléversées et cela montre que Q4\_K\_XL et Q5\_K\_XL sont très proches de la base de référence, donc visez celles-ci.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1ClHNDXzzv9r4bLywjEJ%2Fglm53_unsloth_dynamic_ggufs_kld_benchmarks_updated.png?alt=media&amp;token=9e4677e8-df89-4718-acf2-5c14aad393c9" alt=""><figcaption></figcaption></figure>

| quantification |    Go | top-1 % | KLD moyen | KLD à 99,9 % |    PPL |
| -------------- | ----: | ------: | --------: | -----------: | -----: |
| UD-IQ1\_S      | 216.7 |   72.56 |  0.687991 |        9.104 | 4.6130 |
| UD-IQ1\_M      | 228.5 |   75.64 |  0.565455 |        8.595 | 4.1410 |
| UD-IQ2\_M      | 238.6 |   78.53 |  0.453992 |        7.717 | 3.7433 |
| UD-Q2\_K\_XL   | 253.9 |   80.93 |  0.374219 |        7.076 | 3.5048 |
| UD-IQ3\_XXS    | 281.7 |   84.15 |  0.272796 |        6.252 | 3.2482 |
| UD-Q3\_K\_XL   | 343.0 |   88.86 |  0.141406 |        4.127 | 2.9107 |
| UD-IQ4\_XS     | 365.3 |   90.59 |  0.101496 |        3.177 | 2.8460 |
| UD-Q4\_K\_XL   | 467.3 |   94.29 |  0.036922 |        1.309 | 2.7006 |
| UD-Q5\_K\_XL   | 562.5 |   95.82 |  0.019728 |        0.786 | 2.6842 |
| UD-Q6\_K\_XL   | 684.4 |   96.59 |  0.013257 |        0.534 | 2.6771 |

### 📊 Benchmarks

Vous pouvez consulter les principales améliorations des benchmarks de GLM-5.3 dans le tableau ci-dessous :

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fm0D8JgqiMhFBvxu1IBfm%2Fglm53bench.jpg?alt=media&amp;token=fe3e5fdf-c5e8-45a2-8a7a-941fdcd5ec6b" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Ftqb0wwb4uhbrmjB3bOAr%2Fglmcodingper.png?alt=media&amp;token=fc306ac0-a542-4675-b361-ccac23b691a8" alt=""><figcaption></figcaption></figure></div>

| Benchmark                                | GLM-5.3   | GLM-5.2 | Kimi K3 | <p>DeepSeek-V4</p><p>Pro-0813</p> | Qwen3.8-Max | Opus 4.8 | <p>Fable 5</p><p>(avec repli)</p> | GPT-5.6 Sol |
| ---------------------------------------- | --------- | ------- | ------- | --------------------------------- | ----------- | -------- | --------------------------------- | ----------- |
| Codage                                   |           |         |         |                                   |             |          |                                   |             |
| Terminal Bench 2.1                       | 88.2      | 81.0    | 88.3    | 87.9                              | 86.6        | 85.0     | 88.0                              | 88.8        |
| Terminal Bench 3.0                       | 28.3      | 4.6     | 17.4    | -                                 | -           | 21.1     | 33.7                              | 34.6        |
| <p>DeepSWE</p><p>v1.1</p>                | 66.9      | 46.2    | 67.5    | 62.7                              | 56.6        | 58.0     | 69.7                              | 72.7        |
| NL2Repo                                  | 58.0      | 48.9    | 58.0    | 61.1                              | 55.9        | 69.7     | -                                 | -           |
| <p>ProgramBench</p><p>Presque résolu</p> | 19.0      | 9.5     | 17.5    | -                                 | 10.5        | 15.5     | 33.0                              | 23.0        |
| FrontierSWE                              | 78.1      | 67.5    | -       | -                                 | -           | 66.5     | 88.2                              | -           |
| <p>SWE-Marathon</p><p>v1.1</p>           | 42.5      | 19.4    | 48.1    | -                                 | -           | 48.8     | 33.1                              | 42.5        |
| PostTrainBench                           | 39.8      | 31.7    | 32.0    | -                                 | -           | 32.9     | 41.8                              | 36.2        |
| Cyber                                    |           |         |         |                                   |             |          |                                   |             |
| CyberGym                                 | 84.5      | 77.2    | 80.0    | 83.3                              | 78.5        | 78.1     | 83.8                              | 83.6        |
| <p>ExploitGym</p><p>2h / 6h</p>          | 105 / 130 | 29 / 39 | 36 / 70 | -                                 | 14 / 26     | 80 / 120 | 181 / 247                         | 216 / 293   |
| ExploitBench                             | 54.4      | 24.4    | 32.2    | -                                 | 28.8        | 40.0     | 78.0                              | 76.5        |
| Agentique                                |           |         |         |                                   |             |          |                                   |             |
| Toolathlon vérifié                       | 73.0      | 59.9    | 76.5    | 74.1                              | 72.5        | 76.2     | 74.7                              | 74.9        |
| <p>AutomationBench</p><p>v1.0.6</p>      | 48.2      | 26.2    | 46.7    | 43.2                              | 39.8        | 41.0     | 46.2                              | 45.8        |
| <p>Agents' Last Exam</p><p>ALE-CLI</p>   | 28.5      | 23.8    | 27.6    | 25.7                              | 27.0        | 25.7     | 23.8                              | 28.6        |
| HLE avec outils                          | 62.5      | 54.7    | 59.8    | 60.0                              | 56.2        | 57.9     | 63.9                              | 64.5        |
| GDPval-AA v2                             | 1769      | 1508    | 1682    | 1590                              | 1739        | 1588     | 1743                              | 1730        |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/glm-5.3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
