For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-4.7-Flash : comment exécuter en local

Exécutez et fine-tunez GLM-4.7-Flash localement sur votre appareil !

GLM-4.7-Flash est le nouveau modèle de raisonnement MoE 30B de Z.ai, conçu pour le déploiement local, offrant les meilleures performances de sa catégorie pour le codage, les workflows agentiques et le chat. Il utilise environ 3,6 milliards de paramètres, prend en charge un contexte de 200K et domine les benchmarks SWE-Bench, GPQA ainsi que ceux de raisonnement/chat.

GLM-4.7-Flash fonctionne avec 24 Go de RAM/VRAM/mémoire unifiée (32 Go pour la précision complète), et vous pouvez désormais effectuer un fine-tuning avec Unsloth. Pour exécuter GLM 4.7 Flash avec vLLM, voir GLM-4.7-Flash

Tutoriel d’exécutionFine-tuning

GLM-4.7-Flash GGUF à exécuter : unsloth/GLM-4.7-Flash-GGUF

⚙️ Guide d’utilisation

Pour de meilleures performances, assurez-vous que votre mémoire totale disponible (VRAM + RAM système) dépasse la taille du fichier du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut toujours fonctionner via un déchargement vers SSD/HDD, mais l'inférence sera plus lente.

Après avoir parlé avec l’équipe de Z.ai, elle recommande d’utiliser ses paramètres d’échantillonnage GLM-4.7 :

Paramètres par défaut (la plupart des tâches)
Terminal Bench, SWE Bench Verified

température = 1.0

température = 0.7

top_p = 0.95

top_p = 1.0

repeat penalty = désactivée ou 1.0

repeat penalty = désactivée ou 1.0

  • Pour un usage général : --temp 1.0 --top-p 0.95

  • Pour l’appel d’outils : --temp 0.7 --top-p 1.0

  • Si vous utilisez llama.cpp, définissez --min-p 0.01 car la valeur par défaut de llama.cpp est 0.05

  • Parfois, vous devrez expérimenter pour voir quels nombres fonctionnent le mieux pour votre cas d’usage.

  • Fenêtre de contexte maximale : 202,752

🖥️ Exécuter GLM-4.7-Flash

Selon votre cas d’utilisation, vous devrez utiliser différents paramètres. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à un nombre de bits inférieur.

Comme ce guide utilise du 4 bits, vous aurez besoin d’environ 18 Go de RAM/mémoire unifiée. Nous recommandons d’utiliser au moins une précision 4 bits pour de meilleures performances.

🦥 Guide Unsloth Studio

GLM-4.7-Flash peut être exécuté et fine-tuné dans Unsloth Studio, notre nouvelle interface web open source pour l’IA locale. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Exécutez dans votre terminal :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Puis ouvrez http://localhost:8888 dans votre navigateur.

3

Rechercher et télécharger GLM-4.7-Flash

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Vous verrez ensuite un bref assistant de configuration pour choisir un modèle, un jeu de données et des paramètres de base. Vous pouvez le passer à tout moment.

Ensuite, allez dans l’onglet Studio Chat onglet et recherchez GLM-4.7-Flash dans la barre de recherche et téléchargez le modèle et la quantification souhaités.

4

Exécuter GLM-4.7-Flash

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

Tutoriel Llama.cpp (GGUF) :

Instructions pour l’exécution dans llama.cpp (notez que nous utiliserons du 4 bits pour convenir à la plupart des appareils) :

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Vous pouvez le récupérer directement depuis Hugging Face. Vous pouvez augmenter le contexte jusqu’à 200K selon la capacité de votre RAM/VRAM.

Vous pouvez aussi essayer les paramètres d’échantillonnage GLM-4.7 recommandés par Z.ai :

  • Pour un usage général : --temp 1.0 --top-p 0.95

  • Pour l’appel d’outils : --temp 0.7 --top-p 1.0

  • N’oubliez pas de désactiver la pénalité de répétition !

Suivez ceci pour les cas d'utilisation de instruction générale :

Suivez ceci pour les cas d'utilisation de appel d'outils :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d’autres versions quantifiées. Si les téléchargements restent bloqués, voir Débogage de Hugging Face Hub, XET

4

Puis exécutez le modèle en mode conversation :

Aussi, ajustez la fenêtre de contexte si nécessaire, jusqu’à 202752

Réduction des répétitions et des boucles

Cela signifie que vous pouvez désormais utiliser les paramètres recommandés par Z.ai et obtenir d’excellents résultats :

  • Pour un usage général : --temp 1.0 --top-p 0.95

  • Pour l’appel d’outils : --temp 0.7 --top-p 1.0

  • Si vous utilisez llama.cpp, définissez --min-p 0.01 car la valeur par défaut de llama.cpp est 0.05

  • N’oubliez pas de désactiver la pénalité de répétition ! Ou définissez --repeat-penalty 1.0

Nous avons ajouté "scoring_func": "sigmoid" en config.json pour le modèle principal - voir.

🐦Exemple Flappy Bird avec UD-Q4_K_XL

À titre d’exemple, nous avons effectué la longue conversation suivante en utilisant UD-Q4_K_XL via ./llama.cpp/llama-cli --model unsloth/GLM-4.7-Flash-GGUF/GLM-4.7-Flash-UD-Q4_K_XL.gguf --fit on --temp 1.0 --top-p 0.95 --min-p 0.01 :

qui a rendu le jeu Flappy Bird suivant au format HTML :

Jeu Flappy Bird en HTML (extensible)

Et nous avons pris quelques captures d’écran (le 4 bits fonctionne) :

🦥 Fine-tuning de GLM-4.7-Flash

Unsloth prend désormais en charge le fine-tuning de GLM-4.7-Flash, cependant vous devrez utiliser transformers v5. Le modèle 30B ne tient pas sur un GPU Colab gratuit ; toutefois, vous pouvez utiliser notre notebook. Le fine-tuning LoRA 16 bits de GLM-4.7-Flash utilisera environ 60 Go de VRAM:

Lors du fine-tuning des MoE, il n’est probablement pas judicieux de fine-tuner la couche routeur, nous l’avons donc désactivée par défaut. Si vous souhaitez préserver ses capacités de raisonnement (optionnel), vous pouvez utiliser un mélange de réponses directes et d’exemples de chaîne de pensée. Utilisez au moins 75 % de raisonnement et 25 % sans raisonnement dans votre jeu de données pour que le modèle conserve ses capacités de raisonnement.

🦙 Hébergement et déploiement de Llama-server

Pour déployer GLM-4.7-Flash en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux, déployez le modèle via :

Puis dans un nouveau terminal, après avoir fait pip install openai, faites :

Qui affichera

💻 GLM-4.7-Flash dans vLLM

Vous pouvez maintenant utiliser notre nouvelle quantification dynamique FP8 du modèle pour une inférence rapide et premium. Installez d’abord vLLM depuis nightly :

Puis servez la version FP8 dynamique d’Unsloth du modèle. Nous avons activé FP8 pour réduire de 50 % l’utilisation mémoire du cache KV, et sur 4 GPU. Si vous avez 1 GPU, utilisez CUDA_VISIBLE_DEVICES='0' et définissez --tensor-parallel-size 1 ou supprimez cet argument. Pour désactiver FP8, supprimez --quantization fp8 --kv-cache-dtype fp8

Vous pouvez ensuite appeler le modèle servi via l'API OpenAI :

Décodage spéculatif vLLM pour GLM-4.7-Flash

Nous avons constaté que l’utilisation du module MTP (multi token prediction) de GLM 4.7 Flash fait chuter le débit de génération de 13 000 tokens sur 1 B200 à 1 300 tokens ! (10x plus lent) Sur Hopper, cela devrait heureusement aller.

Seulement 1 300 tokens / s de débit sur 1xB200 (130 tokens / s de décodage par utilisateur)

Et 13 000 tokens / s de débit sur 1xB200 (toujours 130 tokens / s de décodage par utilisateur)

🔨Appel d’outils avec GLM-4.7-Flash

Voir Tool Calling Guide pour plus de détails sur la façon de faire des appels d'outils. Dans un nouveau terminal (si vous utilisez tmux, utilisez CTRL+B+D), nous créons quelques outils comme l'addition de 2 nombres, l'exécution de code Python, l'exécution de fonctions Linux et bien plus encore :

Nous utilisons ensuite les fonctions ci-dessous (copiez-collez puis exécutez) qui analyseront automatiquement les appels de fonction et appelleront l'endpoint OpenAI pour n'importe quel modèle :

Après avoir lancé GLM-4.7-Flash via llama-server comme dans GLM-4.7-Flash ou voir Tool Calling Guide pour plus de détails, nous pouvons ensuite effectuer quelques appels d'outils :

Appel d'outil pour les opérations mathématiques avec GLM 4.7

Appel d’outil pour exécuter le code Python généré pour GLM-4.7-Flash

Benchmarks

GLM-4.7-Flash est le modèle 30B le plus performant sur tous les benchmarks sauf AIME 25.

Benchmark
GLM-4.7-Flash
Qwen3-30B-A3B-Thinking-2507
GPT-OSS-20B

AIME 25

91.6

85.0

91.7

GPQA

75.2

73.4

71.5

LCB v6

64.0

66.0

61.0

HLE

14.4

9.8

10.9

SWE-bench Verified

59.2

22.0

34.0

τ²-Bench

79.5

49.0

47.7

BrowseComp

42.8

2.29

28.3

Mis à jour

Ce contenu vous a-t-il été utile ?