For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiniMax M3 - comment l’exécuter localement

Exécutez le LLM MiniMax M3 localement sur votre propre appareil !

MiniMax M3 est un nouveau ~428B (23B actifs) modèle ouvert pour le codage, les flux de travail agentiques, les tâches de coworking et le chat multimodal. Le modèle multimodal prend en charge les entrées texte, image et vidéo, ainsi qu'une fenêtre de contexte de 1M fenêtre. Les poids bf16 non quantifiés sont d'environ855 Go et le GGUF 1 bit réduit cela à seulement 128 Go (-85 %): MiniMax-M3 GGUF

Le modèle offre des performances comparables à Gemini 3.1 Pro, avec un score de 59 % sur SWE-Bench Pro, 66 % sur Terminal-Bench 2.1, 34,8 % sur SWE-fficiency et 28,8 % sur KernelBench Hard. Merci à MiniMax pour l'accès dès le jour zéro.

Les GGUF MiniMax-M3 sont actuellement expérimentaux. MiniMax-M3 est intrinsèquement multimodal, mais le GGUF expérimental actuel est texte uniquement et ne prend pas en charge MiniMax Sparse Attention.

⚙️ Guide d'utilisation

La plus petite quantification GGUF, UD-IQ1_M, utilise 128 Go d'espace disque. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation de contexte, essayez d'avoir au moins 133 Go de RAM pour exécuter le modèle. Il est recommandé d'utiliser UD-IQ3_XXS qui est 159 Go pour de meilleurs résultats.

La 4 bits UD-IQ4_XS la quantification est 208 Go, tandis que UD-Q4_K_XL est 265 Go. Ceux-ci conviennent mieux aux systèmes de 256 Go et plus ou de classe 512 Go, aux serveurs multi-GPU, ou aux systèmes disposant de RAM CPU plus un déchargement GPU.

Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

1 bit
2 bits
3 bits
4 bits
5 bits
8 bits

133 Go

148 Go

164-200 Go

213-270 Go

325 Go

460-470 Go

Paramètres recommandés

MiniMax recommande les paramètres suivants pour de meilleures performances : temperature=1.0, top_p=0.95, top_k=40.

temperature = 1.0

top_p = 0.95

top_k = 40

  • Fenêtre de contexte maximale : 1,048,576

  • Prompt système par défaut :

Vous êtes un assistant utile. Votre nom est MiniMax-M3 et vous avez été créé par MiniMax.

Lancez les tutoriels MiniMax-M3 :

Pour ce tutoriel, nous utiliserons la plus petite quantification actuelle, UD-IQ1_M, car MiniMax-M3 est volumineux. Remplacez UD-IQ1_M par UD-IQ4_XS, UD-Q4_K_XL ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter MiniMax-M3 dans Unsloth.

Guide Unsloth

Télécharger Unsloth

Télécharger Unsloth

https://unsloth.ai/download

https://unsloth.ai/download

Guide Unsloth

Télécharger Unsloth

https://unsloth.ai/download

MiniMax M3 fonctionne dans Unsloth sur MacOS, Windows et Linux. Vous pouvez :

1

Installer Unsloth

Assurez-vous d'utiliser le dernier v0.1.463-beta ou 2026.6.6. Exécutez dans votre terminal :

macOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

3

Recherchez et téléchargez MiniMax M3

Puis allez dans l’onglet Unsloth Chat onglet et recherchez MiniMax M3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécutez MiniMax M3

🦙 Guide Llama.cpp

1

Obtenez le PR SPÉCIFIQUE llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Vous pouvez désormais utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, comme Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.

Remarque : MiniMax Sparse Attention n'est pas encore pris en charge, donc l'inférence revient à l'attention dense.

3

Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET

4

Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --ctx-size 32768 pour la longueur du contexte, --n-gpu-layers 2 pour le déchargement GPU sur le nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous n'utilisez que l'inférence CPU. N'oubliez pas que MSA n'est pas encore pris en charge, donc gardez --ctx-size modeste — une attention dense sur des contextes très longs utilisera beaucoup de mémoire.

📊 Benchmarks

Mis à jour

Ce contenu vous a-t-il été utile ?