For the complete documentation index, see llms.txt. This page is also available as Markdown.

🪽Comment exécuter des modèles MTP : guide de prédiction multi-token

MTP, ou Multi-Token Prediction, accélère l’inférence en permettant à un modèle de prédire plusieurs jetons à venir à la fois au lieu d’en générer un par étape. Cela permet une inférence plus rapide sans perte de précision et est particulièrement efficace sur les GPU. Dans ce guide, vous apprendrez à utiliser des modèles MTP comme Gemma 4 ou Qwen3.6 sur votre appareil local.

MTP prédit plusieurs jetons futurs, que le modèle principal vérifie en parallèle. Cela réduit les passes avant de génération, accélérant la sortie tout en préservant la qualité, car seuls les jetons vérifiés sont conservés.

Lors de l’exécution de des GGUF, MTP peut rendre la génération ~1,4× à 2,2× plus rapide. Les modèles denses comme Gemma-4-31B en tirent le plus grand bénéfice, atteignant >1,4× d’accélération par rapport à l’original. Les gains sont plus faibles sur les appareils dont la bande passante mémoire est plus limitée, comme les anciens Mac. Vous pouvez exécuter les modèles MTP directement dans l’interface d’Unsloth Studio ou llama.cpp.

MTP utilise plus de mémoire que le standard, prévoyez donc environ 2 Go supplémentaires de marge en RAM/VRAM.

Gemma 4 MTPQwen3.6 MTP

Nous avons constaté --spec-draft-n-max 2 est le meilleur point de départ cependant, ne supposez pas 2 est optimal, car les performances dépendent du matériel. Essayez n’importe quelle valeur de 1 à 6 et utilisez celle qui est la plus rapide pour votre système. Unsloth Studio définit automatiquement les réglages MTP idéaux optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) — vous pouvez toujours les modifier plus tard.

Gemma 4 MTP

Google DeepMind a entraîné MTP séparément des Gemma 4 modèles originaux, y compris pour les variantes QAT. Contrairement à Qwen, Google a publié des variantes MTP spécifiques sous le nom assistant . Pour de meilleurs résultats, nous ne téléversons que 3 options de précision : 8 bits et 16 bits (BF16, F16). Pour QAT, nous avons appliqué le processus intelligent de récupération en 4 bits comme nous l’avons fait pour les quants Gemma 4 QAT, et donc les quants MTP sont également dérivés intelligemment en 4 bits.

Nous avons téléversé mtp- des GGUF préfixés dans chaque dépôt, vous n’avez donc besoin d’utiliser que les GGUF originaux Gemma 4 réguliers, aucun dépôt séparé n’est nécessaire. Vous pouvez accéder à Gemma aux modèles MTP ici et ils peuvent maintenant s’exécuter dans Unsloth. Nous avons benchmarké Gemma 4 QAT avec MTP, et il s’exécute 1,5× à 2,2× plus vite :

Tableau : exigences matérielles MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

variante Gemma 4
4 bits
8 bits
BF16 / FP16

E2B

5 Go

6–9 Go

11 Go

E4B

6,5–7 Go

10–13 Go

17 Go

12B Unified

8–9 Go

14–15 Go

26 Go

26B A4B

17–18 Go

29–31 Go

53 Go

31B

18–21 Go

35–39 Go

63 Go

Pour exécuter les modèles Gemma 4 MTP, suivez les étapes soit pour Unsloth Studio ou llama.cpp.

🦥 Exécuter dans Unsloth Studio🦙 Exécuter dans llama.cpp

donc ce qui suit fonctionne (cela utilise celui en 8 bits)

Qwen3.6 MTP

Qwen a directement entraîné MTP à l’intérieur des Qwen3.6 et Qwen3.5 modèles. Cela permet à Qwen3.6 27B MTP d’atteindre 160 jetons/s et à Qwen3.6 35B-A3B d’atteindre 240 jetons/s sur un GPU RTX 6000. Téléversements GGUF :

Tableau : exigences matérielles MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

Qwen3.6
3 bits
4 bits
6 bits
8 bits
BF16

27B

16 Go

19 Go

25 Go

31 Go

56 Go

35B-A3B

18 Go

24 Go

31 Go

39 Go

71 Go

Ci-dessous se trouvent des graphiques du débit d’inférence pour MTP par rapport à sans MTP :

Nous avons également téléversé des GGUF MTP pour la Qwen3.5 famille de modèles notamment : 0,8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B et 397B-A17B. Llama.cpp améliore continuellement les performances MTP, alors attendez-vous à ce qu’elles s’accélèrent avec le temps !

Pour exécuter les modèles Qwen MTP, suivez les étapes soit pour Unsloth Studio ou llama.cpp.

🦥 Guide MTP d’Unsloth Studio

Unsloth Studio définit automatiquement les réglages MTP idéaux optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) — vous pouvez toujours les modifier plus tard.

1

Installez Unsloth

Exécutez dans votre terminal :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

3

Recherchez et téléchargez le modèle souhaité

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Ensuite, allez dans l’onglet Unsloth Chat et recherchez Qwen3.6 MTP ou Gemma 4 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécutez votre modèle MTP

Paramètres d’inférence, MTP et spéculatifs de décodage doivent être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également modifier le décodage spéculatif, la longueur du contexte, le modèle de chat et d’autres paramètres dans la barre latérale droite.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence d’Unsloth Studio. Ci-dessous, le GGUF MTP Qwen3.6 2 bits a effectué plus de 10 appels d’outils, recherché 10 sites et exécuté du code Python :

🦙 Guide MTP de Llama.cpp

1

Installez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude — la prise en charge Metal est activée par défaut.

2

Si vous souhaitez utiliser llama.cpp directement pour charger les modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer vers un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l’une des commandes pour les modèles spécifiques :

Gemma 4Qwen3.6

Gemma 4 MTP :

N’oubliez pas de modifier le nom du modèle pour la taille de modèle Gemma 4 souhaitée, comme Gemma-4-26B-A4B, etc., car les instructions ci-dessous concernent Gemma-4-12B. Notez que nous avons fourni un mtp- GGUF préfixé, donc le -hf commande ci-dessous devrait télécharger automatiquement et utiliser MTP.

Mode réflexion :

Veuillez voir le nouveau Réflexion préservée.

Mode sans réflexion:

Qwen3.6 MTP :

N’oubliez pas de modifier le nom du modèle pour la variante Qwen3.6 souhaitée, comme Qwen3.6-35B-A3B ou Qwen3.5, etc., car les instructions ci-dessous concernent Qwen3.6-27B :

Mode réflexion (Tâches générales):

Pour les tâches de codage précises, changez : temperature=0.6

Veuillez voir le nouveau Réflexion préservée.

Mode sans réflexion (Tâches générales) :

3

Téléchargement manuel des quants

Si vous souhaitez télécharger manuellement les quants et les quants MTP, vous pouvez aussi le faire ! Téléchargez le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub hf_transfer). Vous pouvez choisir Q4_K_M ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET

Gemma 4 MTP :

Qwen3.6 MTP :

4

Puis exécutez le modèle en mode conversation :

Gemma 4 MTP :

Et vous verrez ce qui suit — ignorez également les messages d’erreur

Qwen3.6 MTP :

5

Déploiement avec Llama-server

Pour déployer Gemma-4 sur llama-server, utilisez :

Mis à jour

Ce contenu vous a-t-il été utile ?