For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3 - Comment l’exécuter localement

Exécutez le nouveau modèle GLM-5.3 de Z.ai.

GLM-5.3 est le nouveau modèle de Z.ai avec 744B paramètres (40B actifs). En août 2026, GLM-5.3 est le modèle ouvert le plus puissant à ce jour, atteignant l'état de l'art sur Terminal Bench 3.0 et Agents' Last Exam. GLM-5.3 utilise le même modèle de base que GLM-5.2, chaque amélioration provenant de l'entraînement postérieur. Le modèle a une fenêtre de contexte de 1M et peut désormais s'exécuter localement via Unsloth Dynamic GGUFs avec llama.cpp ou Unsloth Desktop.

Guide GLM-5.3-FlashGuide GLM-5.3

Si vous souhaitez exécuter GLM-5.3-Flash, veuillez lire notre article spécifique à ce sujet.

Le GGUF dynamique 1 bit atteint ~76% une précision top-1 tout en étant 85 % plus petit. Le dynamique 2 bits atteint ~81% une précision tout en étant 83 % plus petit. Comme GLM-5.3 a la même taille et la même architecture que GLM-5.2, la plupart des exigences / paramètres sont les mêmes. Merci à Z.ai pour l'accès Unsloth dès le premier jour. GLM-5.3-GGUF

⚙️ Guide d'utilisation

La quantification dynamique 2 bits UD-IQ2_M utilise 239GB d'espace disque fonctionne bien sur 256GB RAM des appareils comme deux NVIDIA DGX Sparks ou un Mac Studio.

La 1 bit quantification tiendra dans 223GB de RAM et le 8 bits nécessite 810GB de RAM.

Tableau : exigences matérielles d'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

1 bit
2 bits
3 bits
4 bits
6 bits
8 bits

223GB

245GB

290-360GB

372-475GB

570GB

810GB

Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.

Paramètres recommandés

GLM-5.3 a 3 modes de réflexion: Faible, Élevé, et Max. Utilisez Max Thinking pour les tâches de codage complexes. Dans Unsloth Desktop vous pouvez facilement basculer entre Low, High et Max Thinking via une interface.

Utilisez ces paramètres pour la plupart des cas d'utilisation :

Paramètres par défaut (la plupart des tâches)
Tâches agentiques longues

temperature = 1.0

temperature = 1.0

top_p = 0.95

top_p = 1.0

La fenêtre de contexte maximale est 1,048,576.

GLM-5.3 utilise le raisonnement maximal par défaut et la réflexion ne peut pas être désactivée. reasoning_effort peut être faible, élevé, ou max.

clear_thinking est faux par défaut et ils recommandent true.

Pour personnaliser l'effort de raisonnement (remplacez 'low' par 'high' ou 'max') :

Pour les conversations à plusieurs tours, utilisez clear_thinking=true pour supprimer le raisonnement des tours précédents (recommandé pour ce modèle) :

Corrections du modèle de chat

Nous avons constaté que GLM utilise une .{id}. notation intéressante pour les modèles de chat, mais de nombreux moteurs ne la prennent pas en charge. Nous l'avons modifiée en [id] afin d'utiliser la syntaxe d'indexation des listes Python. Voir cette modification de commit pour plus de détails.

Lancer les tutoriels GLM-5.3 :

Vous pouvez désormais exécuter GLM-5.3 dans llama.cpp et Unsloth Desktop. Nous utiliserons la quantification 239GB pour le meilleur équilibre entre accessibilité et précision. UD-IQ2_M quantification pour le meilleur équilibre entre accessibilité et précision.

🦥 Exécuter GLM-5.3 dans Unsloth

GLM-5.3 peut désormais s'exécuter dans Unsloth Desktop, une application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :

1

Installer Unsloth

La façon la plus simple de commencer est de télécharger l' application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez l'installation manuelle :

macOS, Linux, WSL :

PowerShell Windows :

2

Recherchez et téléchargez GLM-5.3

Accédez à Unsloth Chat ou au hub de modèles et recherchez GLM-5.3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter GLM-5.3

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

4

Servir GLM-5.3 avec l'API Unsloth

Vous pouvez utiliser unsloth run et servir GLM-5.3 via une API en utilisant llama-server les options d'exécution, notamment le dimensionnement du contexte, les couches GPU, le threading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, consultez notre documentation API ou unsloth start.

5

Unsloth est maintenant prêt

Vous pouvez aussi faire beaucoup d'autres choses avec GLM-5.3 via Unsloth Desktop, comme :

🦙 Exécuter GLM-5.3 dans llama.cpp

Pour ce guide, nous exécuterons le UD-IQ2_M quantification qui nécessitera au moins 245GB de RAM. N'hésitez pas à changer le type de quantification. Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide. GGUF : GLM-5.3-GGUF

1

Obtenez la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.

2

Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, par exemple UD-IQ2_M. Utilisez aussi export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" pour forcer llama.cpp à enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.

3

Si vous souhaitez télécharger le modèle manuellement (beaucoup plus rapide !), nous pouvons télécharger le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub et XET

Si vous souhaitez utiliser le dynamique 1 bit, faites alors :

4

Exécutez ensuite le modèle en mode conversation. Utilisez unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf pour 2 bits ou unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf pour 1 bit.

5

Comme pour GLM-5.2, lorsque vous lancez llama-cli, vous verrez :

Puis, après l'invite, nous avons créé un petit jeu Snake sympa en utilisant UD-IQ1_S donc 1 bit, et cela a très bien fonctionné avec GLM-5.3 !

📐 Contexte long via quantification du cache KV

Pour utiliser un long contexte dans llama.cpp, utilisez la quantification du cache KV pour réduire l'utilisation mémoire.

Actuellement, les types KV cache suivants sont pris en charge : f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, et q5_1. Par défaut f16 est utilisé. q4_1 utilise environ 5 bits par poids, permettant environ des longueurs de contexte 3,2x plus longues.

Analyse de quantification

Nous avons également exécuté KLD sur les quantifications que nous avons téléversées et cela montre que Q4_K_XL et Q5_K_XL sont très proches de la base de référence, donc visez celles-ci.

quantification
Go
top-1 %
KLD moyen
KLD à 99,9 %
PPL

UD-IQ1_S

216.7

72.56

0.687991

9.104

4.6130

UD-IQ1_M

228.5

75.64

0.565455

8.595

4.1410

UD-IQ2_M

238.6

78.53

0.453992

7.717

3.7433

UD-Q2_K_XL

253.9

80.93

0.374219

7.076

3.5048

UD-IQ3_XXS

281.7

84.15

0.272796

6.252

3.2482

UD-Q3_K_XL

343.0

88.86

0.141406

4.127

2.9107

UD-IQ4_XS

365.3

90.59

0.101496

3.177

2.8460

UD-Q4_K_XL

467.3

94.29

0.036922

1.309

2.7006

UD-Q5_K_XL

562.5

95.82

0.019728

0.786

2.6842

UD-Q6_K_XL

684.4

96.59

0.013257

0.534

2.6771

📊 Benchmarks

Vous pouvez consulter les principales améliorations des benchmarks de GLM-5.3 dans le tableau ci-dessous :

Benchmark

GLM-5.3

GLM-5.2

Kimi K3

DeepSeek-V4

Pro-0813

Qwen3.8-Max

Opus 4.8

Fable 5

(avec repli)

GPT-5.6 Sol

Codage

Terminal Bench 2.1

88.2

81.0

88.3

87.9

86.6

85.0

88.0

88.8

Terminal Bench 3.0

28.3

4.6

17.4

-

-

21.1

33.7

34.6

DeepSWE

v1.1

66.9

46.2

67.5

62.7

56.6

58.0

69.7

72.7

NL2Repo

58.0

48.9

58.0

61.1

55.9

69.7

-

-

ProgramBench

Presque résolu

19.0

9.5

17.5

-

10.5

15.5

33.0

23.0

FrontierSWE

78.1

67.5

-

-

-

66.5

88.2

-

SWE-Marathon

v1.1

42.5

19.4

48.1

-

-

48.8

33.1

42.5

PostTrainBench

39.8

31.7

32.0

-

-

32.9

41.8

36.2

Cyber

CyberGym

84.5

77.2

80.0

83.3

78.5

78.1

83.8

83.6

ExploitGym

2h / 6h

105 / 130

29 / 39

36 / 70

-

14 / 26

80 / 120

181 / 247

216 / 293

ExploitBench

54.4

24.4

32.2

-

28.8

40.0

78.0

76.5

Agentique

Toolathlon vérifié

73.0

59.9

76.5

74.1

72.5

76.2

74.7

74.9

AutomationBench

v1.0.6

48.2

26.2

46.7

43.2

39.8

41.0

46.2

45.8

Agents' Last Exam

ALE-CLI

28.5

23.8

27.6

25.7

27.0

25.7

23.8

28.6

HLE avec outils

62.5

54.7

59.8

60.0

56.2

57.9

63.9

64.5

GDPval-AA v2

1769

1508

1682

1590

1739

1588

1743

1730

Mis à jour

Ce contenu vous a-t-il été utile ?