GLM-4.7-Flash : comment exécuter en local
Exécutez et fine-tunez GLM-4.7-Flash localement sur votre appareil !
GLM-4.7-Flash est le nouveau modèle de raisonnement MoE 30B de Z.ai, conçu pour le déploiement local, offrant les meilleures performances de sa catégorie pour le codage, les workflows agentiques et le chat. Il utilise environ 3,6 milliards de paramètres, prend en charge un contexte de 200K et domine les benchmarks SWE-Bench, GPQA ainsi que ceux de raisonnement/chat.
GLM-4.7-Flash fonctionne avec 24 Go de RAM/VRAM/mémoire unifiée (32 Go pour la précision complète), et vous pouvez désormais effectuer un fine-tuning avec Unsloth. Pour exécuter GLM 4.7 Flash avec vLLM, voir GLM-4.7-Flash
Mise à jour du 21 janv. : llama.cpp correction d’un bug spécifiant le mauvais scoring_func: "softmax" (devait être "sigmoid"). Cela provoquait des boucles et de mauvais résultats. Nous avons mis à jour les GGUF - veuillez retélécharger le modèle pour obtenir de bien meilleurs résultats.
Vous pouvez désormais utiliser les paramètres recommandés par Z.ai et obtenir d’excellents résultats :
Pour un usage général :
--temp 1.0 --top-p 0.95Pour l’appel d’outils :
--temp 0.7 --top-p 1.0Pénalité de répétition : Désactivez-la, ou définissez
--repeat-penalty 1.0
21 janv. : une inférence plus rapide est désormais disponible, car la correction FA pour CUDA a maintenant été fusionnée.
Tutoriel d’exécutionFine-tuning
GLM-4.7-Flash GGUF à exécuter : unsloth/GLM-4.7-Flash-GGUF
⚙️ Guide d’utilisation
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible (VRAM + RAM système) dépasse la taille du fichier du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut toujours fonctionner via un déchargement vers SSD/HDD, mais l'inférence sera plus lente.
Après avoir parlé avec l’équipe de Z.ai, elle recommande d’utiliser ses paramètres d’échantillonnage GLM-4.7 :
température = 1.0
température = 0.7
top_p = 0.95
top_p = 1.0
repeat penalty = désactivée ou 1.0
repeat penalty = désactivée ou 1.0
Pour un usage général :
--temp 1.0 --top-p 0.95Pour l’appel d’outils :
--temp 0.7 --top-p 1.0Si vous utilisez llama.cpp, définissez
--min-p 0.01car la valeur par défaut de llama.cpp est 0.05Parfois, vous devrez expérimenter pour voir quels nombres fonctionnent le mieux pour votre cas d’usage.
Pour l’instant, nous ne recommandons pas d’exécuter ce GGUF avec Ollama en raison de possibles problèmes de compatibilité du template de chat. Le GGUF fonctionne bien sur llama.cpp (ou des backends comme LM Studio, Jan).
N’oubliez pas de désactiver la pénalité de répétition ! Ou définissez --repeat-penalty 1.0
Fenêtre de contexte maximale :
202,752
🖥️ Exécuter GLM-4.7-Flash
Selon votre cas d’utilisation, vous devrez utiliser différents paramètres. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à un nombre de bits inférieur.
Comme ce guide utilise du 4 bits, vous aurez besoin d’environ 18 Go de RAM/mémoire unifiée. Nous recommandons d’utiliser au moins une précision 4 bits pour de meilleures performances.
Pour l’instant, nous ne recommandons pas d’exécuter ce GGUF avec Ollama en raison de possibles problèmes de compatibilité du template de chat. Le GGUF fonctionne bien sur llama.cpp (ou des backends comme LM Studio, Jan).
N’oubliez pas de désactiver la pénalité de répétition ! Ou définissez --repeat-penalty 1.0
🦥 Guide Unsloth Studio
GLM-4.7-Flash peut être exécuté et fine-tuné dans Unsloth Studio, notre nouvelle interface web open source pour l’IA locale. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide CPU + GPU via llama.cpp
Entraîner des LLM 2x plus vite avec 70 % de VRAM en moins

Installer Unsloth
Exécutez dans votre terminal :
MacOS, Linux, WSL :
Windows PowerShell :
L’installation sera rapide et prendra environ 1 à 2 min.
Lancer Unsloth
MacOS, Linux, WSL et Windows :
Puis ouvrez http://localhost:8888 dans votre navigateur.
Rechercher et télécharger GLM-4.7-Flash
Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Vous verrez ensuite un bref assistant de configuration pour choisir un modèle, un jeu de données et des paramètres de base. Vous pouvez le passer à tout moment.
Ensuite, allez dans l’onglet Studio Chat onglet et recherchez GLM-4.7-Flash dans la barre de recherche et téléchargez le modèle et la quantification souhaités.

Exécuter GLM-4.7-Flash
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

Tutoriel Llama.cpp (GGUF) :
Instructions pour l’exécution dans llama.cpp (notez que nous utiliserons du 4 bits pour convenir à la plupart des appareils) :
Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Vous pouvez le récupérer directement depuis Hugging Face. Vous pouvez augmenter le contexte jusqu’à 200K selon la capacité de votre RAM/VRAM.
Vous pouvez aussi essayer les paramètres d’échantillonnage GLM-4.7 recommandés par Z.ai :
Pour un usage général :
--temp 1.0 --top-p 0.95Pour l’appel d’outils :
--temp 0.7 --top-p 1.0N’oubliez pas de désactiver la pénalité de répétition !
Suivez ceci pour les cas d'utilisation de instruction générale :
Suivez ceci pour les cas d'utilisation de appel d'outils :
Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d’autres versions quantifiées. Si les téléchargements restent bloqués, voir Débogage de Hugging Face Hub, XET
Puis exécutez le modèle en mode conversation :
Aussi, ajustez la fenêtre de contexte si nécessaire, jusqu’à 202752
➿Réduction des répétitions et des boucles
MISE À JOUR DU 21 JANV. : llama.cpp a corrigé un bug spécifiant le mauvais "scoring_func": "softmax" qui provoquait des boucles et de mauvais résultats (devait être sigmoid). Nous avons mis à jour les GGUF. Veuillez retélécharger le modèle pour de bien meilleurs résultats.
Cela signifie que vous pouvez désormais utiliser les paramètres recommandés par Z.ai et obtenir d’excellents résultats :
Pour un usage général :
--temp 1.0 --top-p 0.95Pour l’appel d’outils :
--temp 0.7 --top-p 1.0Si vous utilisez llama.cpp, définissez
--min-p 0.01car la valeur par défaut de llama.cpp est 0.05N’oubliez pas de désactiver la pénalité de répétition ! Ou définissez
--repeat-penalty 1.0
Nous avons ajouté "scoring_func": "sigmoid" en config.json pour le modèle principal - voir.
Pour l’instant, nous ne recommandons pas d’exécuter ce GGUF avec Ollama en raison de possibles problèmes de compatibilité du template de chat. Le GGUF fonctionne bien sur llama.cpp (ou des backends comme LM Studio, Jan).
🐦Exemple Flappy Bird avec UD-Q4_K_XL
À titre d’exemple, nous avons effectué la longue conversation suivante en utilisant UD-Q4_K_XL via ./llama.cpp/llama-cli --model unsloth/GLM-4.7-Flash-GGUF/GLM-4.7-Flash-UD-Q4_K_XL.gguf --fit on --temp 1.0 --top-p 0.95 --min-p 0.01 :
qui a rendu le jeu Flappy Bird suivant au format HTML :
Et nous avons pris quelques captures d’écran (le 4 bits fonctionne) :


🦥 Fine-tuning de GLM-4.7-Flash
Unsloth prend désormais en charge le fine-tuning de GLM-4.7-Flash, cependant vous devrez utiliser transformers v5. Le modèle 30B ne tient pas sur un GPU Colab gratuit ; toutefois, vous pouvez utiliser notre notebook. Le fine-tuning LoRA 16 bits de GLM-4.7-Flash utilisera environ 60 Go de VRAM:
Vous pouvez parfois rencontrer des problèmes de mémoire insuffisante avec une VRAM A100 de 40 Go. Vous devrez utiliser une VRAM H100/A100 de 80 Go pour des exécutions plus fluides.
Lors du fine-tuning des MoE, il n’est probablement pas judicieux de fine-tuner la couche routeur, nous l’avons donc désactivée par défaut. Si vous souhaitez préserver ses capacités de raisonnement (optionnel), vous pouvez utiliser un mélange de réponses directes et d’exemples de chaîne de pensée. Utilisez au moins 75 % de raisonnement et 25 % sans raisonnement dans votre jeu de données pour que le modèle conserve ses capacités de raisonnement.
🦙 Hébergement et déploiement de Llama-server
Pour déployer GLM-4.7-Flash en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux, déployez le modèle via :
Puis dans un nouveau terminal, après avoir fait pip install openai, faites :
Qui affichera
💻 GLM-4.7-Flash dans vLLM
Vous pouvez maintenant utiliser notre nouvelle quantification dynamique FP8 du modèle pour une inférence rapide et premium. Installez d’abord vLLM depuis nightly :
Puis servez la version FP8 dynamique d’Unsloth du modèle. Nous avons activé FP8 pour réduire de 50 % l’utilisation mémoire du cache KV, et sur 4 GPU. Si vous avez 1 GPU, utilisez CUDA_VISIBLE_DEVICES='0' et définissez --tensor-parallel-size 1 ou supprimez cet argument. Pour désactiver FP8, supprimez --quantization fp8 --kv-cache-dtype fp8
Vous pouvez ensuite appeler le modèle servi via l'API OpenAI :
⭐ Décodage spéculatif vLLM pour GLM-4.7-Flash
Nous avons constaté que l’utilisation du module MTP (multi token prediction) de GLM 4.7 Flash fait chuter le débit de génération de 13 000 tokens sur 1 B200 à 1 300 tokens ! (10x plus lent) Sur Hopper, cela devrait heureusement aller.
Seulement 1 300 tokens / s de débit sur 1xB200 (130 tokens / s de décodage par utilisateur)

Et 13 000 tokens / s de débit sur 1xB200 (toujours 130 tokens / s de décodage par utilisateur)

🔨Appel d’outils avec GLM-4.7-Flash
Voir Tool Calling Guide pour plus de détails sur la façon de faire des appels d'outils. Dans un nouveau terminal (si vous utilisez tmux, utilisez CTRL+B+D), nous créons quelques outils comme l'addition de 2 nombres, l'exécution de code Python, l'exécution de fonctions Linux et bien plus encore :
Nous utilisons ensuite les fonctions ci-dessous (copiez-collez puis exécutez) qui analyseront automatiquement les appels de fonction et appelleront l'endpoint OpenAI pour n'importe quel modèle :
Après avoir lancé GLM-4.7-Flash via llama-server comme dans GLM-4.7-Flash ou voir Tool Calling Guide pour plus de détails, nous pouvons ensuite effectuer quelques appels d'outils :
Appel d'outil pour les opérations mathématiques avec GLM 4.7

Appel d’outil pour exécuter le code Python généré pour GLM-4.7-Flash

Benchmarks
GLM-4.7-Flash est le modèle 30B le plus performant sur tous les benchmarks sauf AIME 25.

AIME 25
91.6
85.0
91.7
GPQA
75.2
73.4
71.5
LCB v6
64.0
66.0
61.0
HLE
14.4
9.8
10.9
SWE-bench Verified
59.2
22.0
34.0
τ²-Bench
79.5
49.0
47.7
BrowseComp
42.8
2.29
28.3
Mis à jour
Ce contenu vous a-t-il été utile ?

