GLM-5.3-Flash : comment l'exécuter localement
Exécutez le nouveau modèle GLM-5.3-Flash, alias ox-alpha, de Z.ai.
GLM-5.3-Flash, également connu sous le nom de ox-alpha, est le nouveau modèle ouvert multimodal de Z.ai de 320B paramètres (18B actifs) qui surpasse GLM-5.2. GLM-5.3-Flash est la version plus petite de GLM-5.3 et rivalise avec Claude Opus 4.8 sur les benchmarks de codage et agentiques. Vous pouvez désormais exécuter le modèle 1-bit localement sur 102 Go de RAM/VRAM ou le 3-bit sur des configurations de 128 Go via llama.cpp ou Unsloth. Merci à Z.ai pour l'accès dès le jour zéro.
Unsloth dynamique 1-bit (93 Go) GGUFs conservent 71 % de la précision du top 1 % tout en étant 85 % plus petit par rapport au BF16 (642 Go). Le 3-bit dynamique est 76 % plus petit et conserve 87 % de précision.
4 sept. : GLM-5.3-Flash s'exécute désormais avec une inférence 3,3x plus rapide!
GLM-5.3-Flash a été entraîné sur 30 T de jetons et repose sur un modèle de base nouvellement entraîné. Son architecture hybride d'attention clairsemée et linéaire réduit les coûts de service sur les longs contextes sans sacrifier la précision.
Vous pouvez désormais exécuter le modèle directement dans Unsloth Desktop.

⚙️ Guide d'utilisation
Exigences de GLM-5.3-Flash :
La plus petite quantification 1-bit fonctionne avec 100 Go de RAM, tandis que la 3-bit fonctionne sur des appareils de 128 Go comme un Mac ou un NVIDIA DGX Spark. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
100 Go
115 Go
128-150 Go
162-210 Go
350 Go
650 Go
Paramètres recommandés
GLM-5.3-Flash a 3 modes de réflexion : Bas, Élevé et Max. Utilisez la réflexion Max pour les tâches compliquées. Dans Unsloth, vous pouvez facilement sélectionner la réflexion Bas, Élevé ou Max à l'aide d'un interrupteur dans la zone de chat.
Utilisez ces paramètres pour la plupart des cas d'utilisation :
temperature = 1.0
temperature = 0.95
top_p = 0.95
top_p = 1.0
Fenêtre de contexte maximale :
1,048,576.
Modification de l'effort de raisonnement
GLM-5.3-Flash utilise Max reasoning par défaut. Il prend également en charge des efforts de raisonnement où reasoning_effort peut être « low », « high » ou « max ».
Inférence plus rapide et prise en charge de MTP
Au 4 sept., nous avons ajouté plusieurs améliorations et optimisations à notre PR llama.cpp. Nous avons implémenté un chemin de décodage plus rapide, plus la prise en charge MTP en bonus, permettant jusqu'à une inférence 3,3× plus rapide sur de longues longueurs de contexte !
Tout fonctionne immédiatement dans Unsloth Desktop, il suffit de mettre à jour vers la dernière version si nécessaire. Aucun module supplémentaire ni fichier MTP n'est requis. Vous pouvez également suivre notre llama.cpp guide.


En utilisant GLM-5.3-Flash UD-IQ1_S sur 1xB200 et en ignorant d'abord MTP, on obtient :
pp512
1121.80
1122.0
tg32
62.79
63.10
tg32 @ 4096
53.52
59.50
tg32 @ 16384
41.02
57.99
tg32 @ 65536
20.66
48.99
Ensuite, une fois MTP ajouté, nous observons des gains encore plus importants, surtout pour les contextes plus longs. Cependant, nous devrions nous arrêter autour de n=2, car davantage de jetons brouillons rendent l'inférence plus lente.
4096
58.6
86.5
80.2
63.7
16K
55.0
77.2
Pour les longueurs de contexte plus courtes, nous observons toujours des accélérations, bien qu'elles atteignent jusqu'à 1,6x plus rapide.


📈 Analyse de quantification
Nous avons quantifié GLM-5.3-Flash jusqu'à UD-IQ1_S 1bit (93.09GB) et il conserve 71 % de la précision du top 1 % tout en étant 85 % plus petit par rapport au BF16 (641.64GB)
UD-Q2_K_XL dynamique 2-bit fait 109 Go, est 83 % plus petit et conserve 78 % de précision. UD-IQ3_XXS dynamique 3-bit fait 120 Go, est 81 % plus petit et conserve 82 % de précision. UD-Q4_K_XL dynamique 4-bit fait 200 Go, est 69 % plus petit et conserve 93 % de précision.


UD-IQ1_S
93.09
70.89%
0.669714
9.1658
UD-IQ1_M
97.58
73.06%
0.572413
8.5069
UD-IQ2_XXS
101.84
76.30%
0.450148
7.5764
UD-Q2_K_XL
108.72
78.34%
0.380134
6.8412
UD-IQ3_XXS
120.37
81.63%
0.283772
5.9611
UD-Q3_K_XL
147.54
86.25%
0.159697
4.0281
UD-IQ4_XS
156.82
88.18%
0.116652
3.1014
UD-Q4_K_XL
199.71
92.22%
0.049294
1.4894
UD-Q5_K_XL
240.31
94.35%
0.027052
0.8696
UD-Q6_K_XL
291.83
95.23%
0.019007
0.6267
Exécutez GLM-5.3-Flash (Ox-Alpha) localement
Vous pouvez désormais exécuter GLM-5.3-Flash (Ox-Alpha) dans Unsloth Desktop et llama.cpp avec notre PR spécifique. Nous utilisons la 3-bit UD-IQ3_XXS dans nos démonstrations car elle tient sur des appareils de 128 Go. N'hésitez pas à changer le type de quantification.
Hugging Face : GLM-5.3-Flash-GGUF
🦥 Exécuter GLM-5.3-Flash dans Unsloth
GLM-5.3-Flash peut désormais s'exécuter dans Unsloth Desktop, une application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :
Recherchez, téléchargez, exécutez des GGUF, des modèles MLX et safetensor
Auto-réparation appel d'outils + recherche web
exécution de code (Python, Bash)
inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence CPU + GPU rapide via MLX et llama.cpp
Entraînez des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
Le moyen le plus simple de commencer est de télécharger l' application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez installer manuellement :
MacOS, Linux, WSL :
Windows PowerShell :
Recherchez et téléchargez GLM-5.3-Flash
Allez dans Unsloth Chat ou le hub de modèles et recherchez GLM-5.3-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter GLM-5.3-Flash
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth. Exécution 1-bit ci-dessous :

Servir GLM-5.3-Flash avec l'API Unsloth
Vous pouvez utiliser unsloth run la commande et servir GLM-5.3-Flash via une API en utilisant llama-server des options d'exécution, notamment la taille du contexte, les couches GPU, le multithreading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, voir nos docs API ou unsloth start.
Unsloth est maintenant prêt
Vous pouvez également faire bien d'autres choses avec GLM-5.3-Flash via Unsloth Desktop, comme :
Connecter des outils : Claude Code, Codex, recherche web, MCP et plus encore
Entraîner des modèles : Ajuster du texte, de la diffusion, embedding, et plus encore

🦙 Exécuter GLM-5.3-Flash dans llama.cpp
Nous devons utiliser notre PR spécifique de llama.cpp ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.
Pour exécuter le modèle, vous pouvez faire :
Puis pour l'exécuter :
Remplacez UD-IQ3_XXS par la quantification de votre choix, comme IQ2_XXS pour le 2-bit une fois téléversé.
📊 Benchmarks


Benchmark
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Codage
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE
v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
Agentique
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench
v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Dernier examen des agents
26.3
20.4
27.3
27.0
28.0
-
HLE avec outils
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
Vision
OfficeQA Pro
62.4
-
57.9
48.9
-
-
Raisonnement CharXiv
avec outils
89.4
-
80.4
89.9
88.0
88.7
Chartography
avec outils
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Mis à jour
Ce contenu vous a-t-il été utile ?

