GLM-5.3 - Comment l’exécuter localement
Exécutez le nouveau modèle GLM-5.3 de Z.ai.
GLM-5.3 est le nouveau modèle de Z.ai avec 744B paramètres (40B actifs). En août 2026, GLM-5.3 est le modèle ouvert le plus puissant à ce jour, atteignant l'état de l'art sur Terminal Bench 3.0 et Agents' Last Exam. GLM-5.3 utilise le même modèle de base que GLM-5.2, chaque amélioration provenant de l'entraînement postérieur. Le modèle a une fenêtre de contexte de 1M et peut désormais s'exécuter localement via Unsloth Dynamic GGUFs avec llama.cpp ou Unsloth Desktop.
Le GGUF dynamique 1 bit atteint ~76% une précision top-1 tout en étant 85 % plus petit. Le dynamique 2 bits atteint ~81% une précision tout en étant 83 % plus petit. Comme GLM-5.3 a la même taille et la même architecture que GLM-5.2, la plupart des exigences / paramètres sont les mêmes. Merci à Z.ai pour l'accès Unsloth dès le premier jour. GLM-5.3-GGUF
⚙️ Guide d'utilisation
La quantification dynamique 2 bits UD-IQ2_M utilise 239GB d'espace disque fonctionne bien sur 256GB RAM des appareils comme deux NVIDIA DGX Sparks ou un Mac Studio.
La 1 bit quantification tiendra dans 223GB de RAM et le 8 bits nécessite 810GB de RAM.
Tableau : exigences matérielles d'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
223GB
245GB
290-360GB
372-475GB
570GB
810GB
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.

Paramètres recommandés
GLM-5.3 a 3 modes de réflexion: Faible, Élevé, et Max. Utilisez Max Thinking pour les tâches de codage complexes. Dans Unsloth Desktop vous pouvez facilement basculer entre Low, High et Max Thinking via une interface.
Utilisez ces paramètres pour la plupart des cas d'utilisation :
temperature = 1.0
temperature = 1.0
top_p = 0.95
top_p = 1.0
La fenêtre de contexte maximale est 1,048,576.
GLM-5.3 utilise le raisonnement maximal par défaut et la réflexion ne peut pas être désactivée. reasoning_effort peut être faible, élevé, ou max.
clear_thinking est faux par défaut et ils recommandent true.
Pour personnaliser l'effort de raisonnement (remplacez 'low' par 'high' ou 'max') :
Pour les conversations à plusieurs tours, utilisez clear_thinking=true pour supprimer le raisonnement des tours précédents (recommandé pour ce modèle) :
Corrections du modèle de chat
Nous avons constaté que GLM utilise une .{id}. notation intéressante pour les modèles de chat, mais de nombreux moteurs ne la prennent pas en charge. Nous l'avons modifiée en [id] afin d'utiliser la syntaxe d'indexation des listes Python. Voir cette modification de commit pour plus de détails.

Lancer les tutoriels GLM-5.3 :
Vous pouvez désormais exécuter GLM-5.3 dans llama.cpp et Unsloth Desktop. Nous utiliserons la quantification 239GB pour le meilleur équilibre entre accessibilité et précision. UD-IQ2_M quantification pour le meilleur équilibre entre accessibilité et précision.
🦥 Exécuter GLM-5.3 dans Unsloth
GLM-5.3 peut désormais s'exécuter dans Unsloth Desktop, une application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF, des modèles MLX et safetensor
Auto-réparation appel d'outils + recherche web
exécution de code (Python, Bash)
inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via MLX et llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
La façon la plus simple de commencer est de télécharger l' application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez l'installation manuelle :
macOS, Linux, WSL :
PowerShell Windows :
Recherchez et téléchargez GLM-5.3
Accédez à Unsloth Chat ou au hub de modèles et recherchez GLM-5.3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter GLM-5.3
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.
Servir GLM-5.3 avec l'API Unsloth
Vous pouvez utiliser unsloth run et servir GLM-5.3 via une API en utilisant llama-server les options d'exécution, notamment le dimensionnement du contexte, les couches GPU, le threading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, consultez notre documentation API ou unsloth start.
Unsloth est maintenant prêt
Vous pouvez aussi faire beaucoup d'autres choses avec GLM-5.3 via Unsloth Desktop, comme :
Connecter des outils : , , , et plus encore
Entraîner des modèles : Ajuster finement du texte, de la diffusion, des embeddings, et plus encore
Générer des médias : Créer et entraîner , de la vidéo, localement

🦙 Exécuter GLM-5.3 dans llama.cpp
Pour ce guide, nous exécuterons le UD-IQ2_M quantification qui nécessitera au moins 245GB de RAM. N'hésitez pas à changer le type de quantification. Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide. GGUF : GLM-5.3-GGUF
Obtenez la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.
Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, par exemple UD-IQ2_M. Utilisez aussi export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" pour forcer llama.cpp à enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.
Si vous souhaitez télécharger le modèle manuellement (beaucoup plus rapide !), nous pouvons télécharger le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub et XET
Si vous souhaitez utiliser le dynamique 1 bit, faites alors :
Exécutez ensuite le modèle en mode conversation. Utilisez unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf pour 2 bits ou unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf pour 1 bit.
Comme pour GLM-5.2, lorsque vous lancez llama-cli, vous verrez :

Puis, après l'invite, nous avons créé un petit jeu Snake sympa en utilisant UD-IQ1_S donc 1 bit, et cela a très bien fonctionné avec GLM-5.3 !

📐 Contexte long via quantification du cache KV
Pour utiliser un long contexte dans llama.cpp, utilisez la quantification du cache KV pour réduire l'utilisation mémoire.
Actuellement, les types KV cache suivants sont pris en charge : f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, et q5_1. Par défaut f16 est utilisé. q4_1 utilise environ 5 bits par poids, permettant environ des longueurs de contexte 3,2x plus longues.
Analyse de quantification
Nous avons également exécuté KLD sur les quantifications que nous avons téléversées et cela montre que Q4_K_XL et Q5_K_XL sont très proches de la base de référence, donc visez celles-ci.

UD-IQ1_S
216.7
72.56
0.687991
9.104
4.6130
UD-IQ1_M
228.5
75.64
0.565455
8.595
4.1410
UD-IQ2_M
238.6
78.53
0.453992
7.717
3.7433
UD-Q2_K_XL
253.9
80.93
0.374219
7.076
3.5048
UD-IQ3_XXS
281.7
84.15
0.272796
6.252
3.2482
UD-Q3_K_XL
343.0
88.86
0.141406
4.127
2.9107
UD-IQ4_XS
365.3
90.59
0.101496
3.177
2.8460
UD-Q4_K_XL
467.3
94.29
0.036922
1.309
2.7006
UD-Q5_K_XL
562.5
95.82
0.019728
0.786
2.6842
UD-Q6_K_XL
684.4
96.59
0.013257
0.534
2.6771
📊 Benchmarks
Vous pouvez consulter les principales améliorations des benchmarks de GLM-5.3 dans le tableau ci-dessous :


Benchmark
GLM-5.3
GLM-5.2
Kimi K3
DeepSeek-V4
Pro-0813
Qwen3.8-Max
Opus 4.8
Fable 5
(avec repli)
GPT-5.6 Sol
Codage
Terminal Bench 2.1
88.2
81.0
88.3
87.9
86.6
85.0
88.0
88.8
Terminal Bench 3.0
28.3
4.6
17.4
-
-
21.1
33.7
34.6
DeepSWE
v1.1
66.9
46.2
67.5
62.7
56.6
58.0
69.7
72.7
NL2Repo
58.0
48.9
58.0
61.1
55.9
69.7
-
-
ProgramBench
Presque résolu
19.0
9.5
17.5
-
10.5
15.5
33.0
23.0
FrontierSWE
78.1
67.5
-
-
-
66.5
88.2
-
SWE-Marathon
v1.1
42.5
19.4
48.1
-
-
48.8
33.1
42.5
PostTrainBench
39.8
31.7
32.0
-
-
32.9
41.8
36.2
Cyber
CyberGym
84.5
77.2
80.0
83.3
78.5
78.1
83.8
83.6
ExploitGym
2h / 6h
105 / 130
29 / 39
36 / 70
-
14 / 26
80 / 120
181 / 247
216 / 293
ExploitBench
54.4
24.4
32.2
-
28.8
40.0
78.0
76.5
Agentique
Toolathlon vérifié
73.0
59.9
76.5
74.1
72.5
76.2
74.7
74.9
AutomationBench
v1.0.6
48.2
26.2
46.7
43.2
39.8
41.0
46.2
45.8
Agents' Last Exam
ALE-CLI
28.5
23.8
27.6
25.7
27.0
25.7
23.8
28.6
HLE avec outils
62.5
54.7
59.8
60.0
56.2
57.9
63.9
64.5
GDPval-AA v2
1769
1508
1682
1590
1739
1588
1743
1730
Mis à jour
Ce contenu vous a-t-il été utile ?

