For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3-Flash : comment l'exécuter localement

Exécutez le nouveau modèle GLM-5.3-Flash, alias ox-alpha, de Z.ai.

GLM-5.3-Flash, également connu sous le nom de ox-alpha, est le nouveau modèle ouvert multimodal de Z.ai de 320B paramètres (18B actifs) qui surpasse GLM-5.2. GLM-5.3-Flash est la version plus petite de GLM-5.3 et rivalise avec Claude Opus 4.8 sur les benchmarks de codage et agentiques. Vous pouvez désormais exécuter le modèle 1-bit localement sur 102 Go de RAM/VRAM ou le 3-bit sur des configurations de 128 Go via llama.cpp ou Unsloth. Merci à Z.ai pour l'accès dès le jour zéro.

Unsloth dynamique 1-bit (93 Go) GGUFs conservent 71 % de la précision du top 1 % tout en étant 85 % plus petit par rapport au BF16 (642 Go). Le 3-bit dynamique est 76 % plus petit et conserve 87 % de précision.

​​Guide d'exécution de GLM-5.3-FlashTélécharger Unsloth

GLM-5.3-Flash a été entraîné sur 30 T de jetons et repose sur un modèle de base nouvellement entraîné. Son architecture hybride d'attention clairsemée et linéaire réduit les coûts de service sur les longs contextes sans sacrifier la précision.

Vous pouvez désormais exécuter le modèle directement dans Unsloth Desktop.

⚙️ Guide d'utilisation

Exigences de GLM-5.3-Flash :

La plus petite quantification 1-bit fonctionne avec 100 Go de RAM, tandis que la 3-bit fonctionne sur des appareils de 128 Go comme un Mac ou un NVIDIA DGX Spark. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

1-bit
2-bit
3-bit
4-bit
8-bit
BF16

100 Go

115 Go

128-150 Go

162-210 Go

350 Go

650 Go

Paramètres recommandés

GLM-5.3-Flash a 3 modes de réflexion : Bas, Élevé et Max. Utilisez la réflexion Max pour les tâches compliquées. Dans Unsloth, vous pouvez facilement sélectionner la réflexion Bas, Élevé ou Max à l'aide d'un interrupteur dans la zone de chat.

Utilisez ces paramètres pour la plupart des cas d'utilisation :

Paramètres par défaut (la plupart des tâches)
DeepSWE

temperature = 1.0

temperature = 0.95

top_p = 0.95

top_p = 1.0

  • Fenêtre de contexte maximale : 1,048,576.

Modification de l'effort de raisonnement

GLM-5.3-Flash utilise Max reasoning par défaut. Il prend également en charge des efforts de raisonnement où reasoning_effort peut être « low », « high » ou « max ».

Inférence plus rapide et prise en charge de MTP

Au 4 sept., nous avons ajouté plusieurs améliorations et optimisations à notre PR llama.cpp. Nous avons implémenté un chemin de décodage plus rapide, plus la prise en charge MTP en bonus, permettant jusqu'à une inférence 3,3× plus rapide sur de longues longueurs de contexte !

Tout fonctionne immédiatement dans Unsloth Desktop, il suffit de mettre à jour vers la dernière version si nécessaire. Aucun module supplémentaire ni fichier MTP n'est requis. Vous pouvez également suivre notre llama.cpp guide.

En utilisant GLM-5.3-Flash UD-IQ1_S sur 1xB200 et en ignorant d'abord MTP, on obtient :

Test
tok/s de base
tok/s optimisé

pp512

1121.80

1122.0

tg32

62.79

63.10

tg32 @ 4096

53.52

59.50

tg32 @ 16384

41.02

57.99

tg32 @ 65536

20.66

48.99

Ensuite, une fois MTP ajouté, nous observons des gains encore plus importants, surtout pour les contextes plus longs. Cependant, nous devrions nous arrêter autour de n=2, car davantage de jetons brouillons rendent l'inférence plus lente.

prompt
MTP désactivé
n=2
n=3
n=5

4096

58.6

86.5

80.2

63.7

16K

55.0

77.2

Pour les longueurs de contexte plus courtes, nous observons toujours des accélérations, bien qu'elles atteignent jusqu'à 1,6x plus rapide.

📈 Analyse de quantification

Nous avons quantifié GLM-5.3-Flash jusqu'à UD-IQ1_S 1bit (93.09GB) et il conserve 71 % de la précision du top 1 % tout en étant 85 % plus petit par rapport au BF16 (641.64GB)

UD-Q2_K_XL dynamique 2-bit fait 109 Go, est 83 % plus petit et conserve 78 % de précision. UD-IQ3_XXS dynamique 3-bit fait 120 Go, est 81 % plus petit et conserve 82 % de précision. UD-Q4_K_XL dynamique 4-bit fait 200 Go, est 69 % plus petit et conserve 93 % de précision.

Quant
taille
précision top-1
KLD moyenne
KLD 99,9 %

UD-IQ1_S

93.09

70.89%

0.669714

9.1658

UD-IQ1_M

97.58

73.06%

0.572413

8.5069

UD-IQ2_XXS

101.84

76.30%

0.450148

7.5764

UD-Q2_K_XL

108.72

78.34%

0.380134

6.8412

UD-IQ3_XXS

120.37

81.63%

0.283772

5.9611

UD-Q3_K_XL

147.54

86.25%

0.159697

4.0281

UD-IQ4_XS

156.82

88.18%

0.116652

3.1014

UD-Q4_K_XL

199.71

92.22%

0.049294

1.4894

UD-Q5_K_XL

240.31

94.35%

0.027052

0.8696

UD-Q6_K_XL

291.83

95.23%

0.019007

0.6267

Exécutez GLM-5.3-Flash (Ox-Alpha) localement

Vous pouvez désormais exécuter GLM-5.3-Flash (Ox-Alpha) dans Unsloth Desktop et llama.cpp avec notre PR spécifique. Nous utilisons la 3-bit UD-IQ3_XXS dans nos démonstrations car elle tient sur des appareils de 128 Go. N'hésitez pas à changer le type de quantification.

Exécuter dans Unsloth DesktopExécuter dans llama.cpp

🦥 Exécuter GLM-5.3-Flash dans Unsloth

GLM-5.3-Flash peut désormais s'exécuter dans Unsloth Desktop, une application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Le moyen le plus simple de commencer est de télécharger l' application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez installer manuellement :

MacOS, Linux, WSL :

Windows PowerShell :

2

Recherchez et téléchargez GLM-5.3-Flash

Allez dans Unsloth Chat ou le hub de modèles et recherchez GLM-5.3-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter GLM-5.3-Flash

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth. Exécution 1-bit ci-dessous :

4

Servir GLM-5.3-Flash avec l'API Unsloth

Vous pouvez utiliser unsloth run la commande et servir GLM-5.3-Flash via une API en utilisant llama-server des options d'exécution, notamment la taille du contexte, les couches GPU, le multithreading, l'échantillonnage, le réseau et la configuration des outils. Pour plus d'infos, voir nos docs API ou unsloth start.

5

Unsloth est maintenant prêt

Vous pouvez également faire bien d'autres choses avec GLM-5.3-Flash via Unsloth Desktop, comme :

🦙 Exécuter GLM-5.3-Flash dans llama.cpp

1

Nous devons utiliser notre PR spécifique de llama.cpp ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.

2

Pour exécuter le modèle, vous pouvez faire :

3

Puis pour l'exécuter :

Remplacez UD-IQ3_XXS par la quantification de votre choix, comme IQ2_XXS pour le 2-bit une fois téléversé.

📊 Benchmarks

Benchmark

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Codage

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE

v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

Agentique

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench

v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Dernier examen des agents

26.3

20.4

27.3

27.0

28.0

-

HLE avec outils

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

Vision

OfficeQA Pro

62.4

-

57.9

48.9

-

-

Raisonnement CharXiv

avec outils

89.4

-

80.4

89.9

88.0

88.7

Chartography

avec outils

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Mis à jour

Ce contenu vous a-t-il été utile ?