MiniMax M3 - comment l’exécuter localement
Exécutez le LLM MiniMax M3 localement sur votre propre appareil !
MiniMax M3 est un nouveau ~428B (23B actifs) modèle ouvert pour le codage, les flux de travail agentiques, les tâches de coworking et le chat multimodal. Le modèle multimodal prend en charge les entrées texte, image et vidéo, ainsi qu'une fenêtre de contexte de 1M fenêtre. Les poids bf16 non quantifiés sont d'environ855 Go et le GGUF 1 bit réduit cela à seulement 128 Go (-85 %): MiniMax-M3 GGUF
Le modèle offre des performances comparables à Gemini 3.1 Pro, avec un score de 59 % sur SWE-Bench Pro, 66 % sur Terminal-Bench 2.1, 34,8 % sur SWE-fficiency et 28,8 % sur KernelBench Hard. Merci à MiniMax pour l'accès dès le jour zéro.
Les GGUF MiniMax-M3 sont actuellement expérimentaux. MiniMax-M3 est intrinsèquement multimodal, mais le GGUF expérimental actuel est texte uniquement et ne prend pas en charge MiniMax Sparse Attention.

⚙️ Guide d'utilisation
La plus petite quantification GGUF, UD-IQ1_M, utilise 128 Go d'espace disque. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation de contexte, essayez d'avoir au moins 133 Go de RAM pour exécuter le modèle. Il est recommandé d'utiliser UD-IQ3_XXS qui est 159 Go pour de meilleurs résultats.
La 4 bits UD-IQ4_XS la quantification est 208 Go, tandis que UD-Q4_K_XL est 265 Go. Ceux-ci conviennent mieux aux systèmes de 256 Go et plus ou de classe 512 Go, aux serveurs multi-GPU, ou aux systèmes disposant de RAM CPU plus un déchargement GPU.
Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
133 Go
148 Go
164-200 Go
213-270 Go
325 Go
460-470 Go
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.
Paramètres recommandés
MiniMax recommande les paramètres suivants pour de meilleures performances : temperature=1.0, top_p=0.95, top_k=40.
temperature = 1.0
top_p = 0.95
top_k = 40
Fenêtre de contexte maximale :
1,048,576Prompt système par défaut :
Vous êtes un assistant utile. Votre nom est MiniMax-M3 et vous avez été créé par MiniMax.Lancez les tutoriels MiniMax-M3 :
Pour ce tutoriel, nous utiliserons la plus petite quantification actuelle, UD-IQ1_M, car MiniMax-M3 est volumineux. Remplacez UD-IQ1_M par UD-IQ4_XS, UD-Q4_K_XL ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter MiniMax-M3 dans Unsloth.
Guide Unsloth
Télécharger Unsloth
Télécharger Unsloth
https://unsloth.ai/download
https://unsloth.ai/download
Guide Unsloth
Télécharger Unsloth
https://unsloth.ai/download
Vous pouvez maintenant exécuter MiniMax M3 via Unsloth ✨. Assurez-vous d'utiliser > v0.1.463-beta ou 2026.6.6.
MiniMax M3 fonctionne dans Unsloth sur MacOS, Windows et Linux. Vous pouvez :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
Assurez-vous d'utiliser le dernier v0.1.463-beta ou 2026.6.6. Exécutez dans votre terminal :
macOS, Linux, WSL :
Windows PowerShell :
Recherchez et téléchargez MiniMax M3
Puis allez dans l’onglet Unsloth Chat onglet et recherchez MiniMax M3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

🦙 Guide Llama.cpp
Obtenez le PR SPÉCIFIQUE llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Vous pouvez désormais utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, comme Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.
Remarque : MiniMax Sparse Attention n'est pas encore pris en charge, donc l'inférence revient à l'attention dense.
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET
Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --ctx-size 32768 pour la longueur du contexte, --n-gpu-layers 2 pour le déchargement GPU sur le nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous n'utilisez que l'inférence CPU. N'oubliez pas que MSA n'est pas encore pris en charge, donc gardez --ctx-size modeste — une attention dense sur des contextes très longs utilisera beaucoup de mémoire.
📊 Benchmarks


Mis à jour
Ce contenu vous a-t-il été utile ?

