🪽Comment exécuter des modèles MTP : guide de prédiction multi-token
MTP, ou Multi-Token Prediction, accélère l’inférence en permettant à un modèle de prédire plusieurs jetons à venir à la fois au lieu d’en générer un par étape. Cela permet une inférence plus rapide sans perte de précision et est particulièrement efficace sur les GPU. Dans ce guide, vous apprendrez à utiliser des modèles MTP comme Gemma 4 ou Qwen3.6 sur votre appareil local.
MTP prédit plusieurs jetons futurs, que le modèle principal vérifie en parallèle. Cela réduit les passes avant de génération, accélérant la sortie tout en préservant la qualité, car seuls les jetons vérifiés sont conservés.
Lors de l’exécution de des GGUF, MTP peut rendre la génération ~1,4× à 2,2× plus rapide. Les modèles denses comme Gemma-4-31B en tirent le plus grand bénéfice, atteignant >1,4× d’accélération par rapport à l’original. Les gains sont plus faibles sur les appareils dont la bande passante mémoire est plus limitée, comme les anciens Mac. Vous pouvez exécuter les modèles MTP directement dans l’interface d’Unsloth Studio ou llama.cpp.
MTP utilise plus de mémoire que le standard, prévoyez donc environ 2 Go supplémentaires de marge en RAM/VRAM.
Nous avons constaté --spec-draft-n-max 2 est le meilleur point de départ cependant, ne supposez pas 2 est optimal, car les performances dépendent du matériel. Essayez n’importe quelle valeur de 1 à 6 et utilisez celle qui est la plus rapide pour votre système. Unsloth Studio définit automatiquement les réglages MTP idéaux optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) — vous pouvez toujours les modifier plus tard.
Gemma 4 MTP
Google DeepMind a entraîné MTP séparément des Gemma 4 modèles originaux, y compris pour les variantes QAT. Contrairement à Qwen, Google a publié des variantes MTP spécifiques sous le nom assistant . Pour de meilleurs résultats, nous ne téléversons que 3 options de précision : 8 bits et 16 bits (BF16, F16). Pour QAT, nous avons appliqué le processus intelligent de récupération en 4 bits comme nous l’avons fait pour les quants Gemma 4 QAT, et donc les quants MTP sont également dérivés intelligemment en 4 bits.
Nous avons téléversé mtp- des GGUF préfixés dans chaque dépôt, vous n’avez donc besoin d’utiliser que les GGUF originaux Gemma 4 réguliers, aucun dépôt séparé n’est nécessaire. Vous pouvez accéder à Gemma aux modèles MTP ici et ils peuvent maintenant s’exécuter dans Unsloth. Nous avons benchmarké Gemma 4 QAT avec MTP, et il s’exécute 1,5× à 2,2× plus vite :

Tableau : exigences matérielles MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
E2B
5 Go
6–9 Go
11 Go
E4B
6,5–7 Go
10–13 Go
17 Go
12B Unified
8–9 Go
14–15 Go
26 Go
26B A4B
17–18 Go
29–31 Go
53 Go
31B
18–21 Go
35–39 Go
63 Go
Gemma 4 MTP est automatiquement activé dans Unsloth Studio. Vous n’avez qu’à télécharger les GGUF originaux Gemma 4 réguliers. Nous avons mis à jour les fichiers GGUF de Gemma 4 pour inclure un fichier MTP supplémentaire dans un dossier séparé au sein du package GGUF, il n’est donc pas nécessaire de télécharger un GGUF assistant Gemma 4 séparé.
Le seul modèle qui nécessite encore un GGUF MTP séparé est Qwen3.6.
Pour exécuter les modèles Gemma 4 MTP, suivez les étapes soit pour Unsloth Studio ou llama.cpp.
🦥 Exécuter dans Unsloth Studio🦙 Exécuter dans llama.cpp
donc ce qui suit fonctionne (cela utilise celui en 8 bits)
Qwen3.6 MTP
Qwen a directement entraîné MTP à l’intérieur des Qwen3.6 et Qwen3.5 modèles. Cela permet à Qwen3.6 27B MTP d’atteindre 160 jetons/s et à Qwen3.6 35B-A3B d’atteindre 240 jetons/s sur un GPU RTX 6000. Téléversements GGUF :
Tableau : exigences matérielles MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
27B
16 Go
19 Go
25 Go
31 Go
56 Go
35B-A3B
18 Go
24 Go
31 Go
39 Go
71 Go
Ci-dessous se trouvent des graphiques du débit d’inférence pour MTP par rapport à sans MTP :


Nous avons également téléversé des GGUF MTP pour la Qwen3.5 famille de modèles notamment : 0,8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B et 397B-A17B. Llama.cpp améliore continuellement les performances MTP, alors attendez-vous à ce qu’elles s’accélèrent avec le temps !
Pour exécuter les modèles Qwen MTP, suivez les étapes soit pour Unsloth Studio ou llama.cpp.
🦥 Guide MTP d’Unsloth Studio
Unsloth Studio définit automatiquement les réglages MTP idéaux optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) — vous pouvez toujours les modifier plus tard.
Recherchez et téléchargez le modèle souhaité
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Ensuite, allez dans l’onglet Unsloth Chat et recherchez Qwen3.6 MTP ou Gemma 4 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.
Gemma 4 MTP est automatiquement activé dans Unsloth. Vous n’avez qu’à télécharger le GGUF Gemma 4 original régulier. Nous avons mis à jour les fichiers GGUF de Gemma 4 pour inclure un fichier MTP supplémentaire dans un dossier séparé au sein du package GGUF, il n’est donc pas nécessaire de télécharger un GGUF assistant Gemma 4 séparé.
Le seul modèle qui nécessite encore un GGUF MTP séparé est Qwen3.6.


Exécutez votre modèle MTP
Paramètres d’inférence, MTP et spéculatifs de décodage doivent être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également modifier le décodage spéculatif, la longueur du contexte, le modèle de chat et d’autres paramètres dans la barre latérale droite.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence d’Unsloth Studio. Ci-dessous, le GGUF MTP Qwen3.6 2 bits a effectué plus de 10 appels d’outils, recherché 10 sites et exécuté du code Python :

🦙 Guide MTP de Llama.cpp
Installez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude — la prise en charge Metal est activée par défaut.
Si vous souhaitez utiliser llama.cpp directement pour charger les modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer vers un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.
Suivez l’une des commandes pour les modèles spécifiques :
Gemma 4 MTP :
N’oubliez pas de modifier le nom du modèle pour la taille de modèle Gemma 4 souhaitée, comme Gemma-4-26B-A4B, etc., car les instructions ci-dessous concernent Gemma-4-12B. Notez que nous avons fourni un mtp- GGUF préfixé, donc le -hf commande ci-dessous devrait télécharger automatiquement et utiliser MTP.
Mode réflexion :
Veuillez voir le nouveau Réflexion préservée.
Mode sans réflexion:
Qwen3.6 MTP :
N’oubliez pas de modifier le nom du modèle pour la variante Qwen3.6 souhaitée, comme Qwen3.6-35B-A3B ou Qwen3.5, etc., car les instructions ci-dessous concernent Qwen3.6-27B :
Mode réflexion (Tâches générales):
Pour les tâches de codage précises, changez : temperature=0.6
Veuillez voir le nouveau Réflexion préservée.
Mode sans réflexion (Tâches générales) :
Téléchargement manuel des quants
Si vous souhaitez télécharger manuellement les quants et les quants MTP, vous pouvez aussi le faire ! Téléchargez le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub hf_transfer). Vous pouvez choisir Q4_K_M ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET
Gemma 4 MTP :
Qwen3.6 MTP :
Mis à jour
Ce contenu vous a-t-il été utile ?


