> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/minimax-m3.md).

# MiniMax M3 - Comment exécuter localement

MiniMax M3 est un nouveau **\~428B (23B actifs)** modèle ouvert pour le codage, les flux de travail agentiques, les tâches de coworking et le chat multimodal. Le modèle multimodal prend en charge les entrées texte, image et vidéo, ainsi qu'une **fenêtre de contexte de 1M** **fenêtre**. Les poids bf16 non quantifiés sont d'environ**855 Go** et le GGUF 1 bit réduit cela à seulement **128 Go (-85 %)**: [**MiniMax-M3 GGUF**](https://huggingface.co/unsloth/MiniMax-M3-GGUF)

Le modèle offre des performances comparables à Gemini 3.1 Pro, avec un score de 59 % sur SWE-Bench Pro, 66 % sur Terminal-Bench 2.1, 34,8 % sur SWE-fficiency et 28,8 % sur KernelBench Hard. Merci à MiniMax pour l'accès dès le jour zéro.

{% columns %}
{% column width="50%" %}
{% hint style="info" %}
Les GGUF MiniMax-M3 sont actuellement expérimentaux. MiniMax-M3 est intrinsèquement multimodal, mais le GGUF expérimental actuel est **texte uniquement** et ne prend pas en charge MiniMax Sparse Attention.
{% endhint %}
{% endcolumn %}

{% column width="50%" %}

<figure><img src="/files/22ce194b253631c6f57a9debf00d7e3922256e72" alt="" width="375"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### :gear: Guide d'utilisation

La plus petite quantification GGUF, `UD-IQ1_M`, utilise **128 Go** d'espace disque. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation de contexte, essayez d'avoir au moins **133 Go de RAM** pour exécuter le modèle. Il est recommandé d'utiliser `UD-IQ3_XXS` qui est **159 Go** pour de meilleurs résultats.

La **4 bits** `UD-IQ4_XS` la quantification est **208 Go**, tandis que `UD-Q4_K_XL` est **265 Go**. Ceux-ci conviennent mieux aux systèmes de 256 Go et plus ou de classe 512 Go, aux serveurs multi-GPU, ou aux systèmes disposant de RAM CPU plus un déchargement GPU.

**Tableau : exigences matérielles pour l'inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th>1 bit</th><th>2 bits</th><th width="128">3 bits</th><th>4 bits</th><th>5 bits</th><th>8 bits</th></tr></thead><tbody><tr><td>133 Go</td><td>148 Go</td><td>164-200 Go</td><td>213-270 Go</td><td>325 Go</td><td>460-470 Go</td></tr></tbody></table>

{% hint style="success" %}
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.
{% endhint %}

#### Paramètres recommandés

MiniMax recommande les paramètres suivants pour de meilleures performances : `temperature=1.0`, `top_p=0.95`, `top_k=40`.

{% columns %}
{% column %}

| `temperature = 1.0` |
| ------------------- |
| `top_p = 0.95`      |
| `top_k = 40`        |
| {% endcolumn %}     |

{% column %}

* **Fenêtre de contexte maximale :** `1,048,576`
* Prompt système par défaut :

{% code overflow="wrap" %}

```
Vous êtes un assistant utile. Votre nom est MiniMax-M3 et vous avez été créé par MiniMax.
```

{% endcode %}
{% endcolumn %}
{% endcolumns %}

## Lancez les tutoriels MiniMax-M3 :

Pour ce tutoriel, nous utiliserons la plus petite quantification actuelle, UD-IQ1\_M, car MiniMax-M3 est volumineux. Remplacez UD-IQ1\_M par UD-IQ4\_XS, UD-Q4\_K\_XL ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter MiniMax-M3 dans Unsloth.

Guide Unsloth

#### Télécharger Unsloth

#### Télécharger Unsloth

<https://unsloth.ai/download>

<https://unsloth.ai/download>

### Guide Unsloth

#### Télécharger Unsloth

<https://unsloth.ai/download>

{% hint style="success" %}
Vous pouvez maintenant exécuter MiniMax M3 via [Unsloth](#unsloth-studio-guide) ✨. Assurez-vous d'utiliser > [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.6`.
{% endhint %}

MiniMax M3 fonctionne dans Unsloth sur MacOS, Windows et Linux. Vous pouvez :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide sur CPU + GPU via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/608ef824be87e674df7b205a47c03ae2281fb5dc" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Assurez-vous d'utiliser le dernier [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.6`. Exécutez dans votre terminal :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL et Windows :**
{% endstep %}

{% step %}

#### Recherchez et téléchargez MiniMax M3

Puis allez dans l’onglet [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet et recherchez MiniMax M3 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="/files/3ac3ddb12aa9db8a5f776dc48bc5336388a0f637" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécutez MiniMax M3

<div data-with-frame="true"><figure><img src="/files/22ce194b253631c6f57a9debf00d7e3922256e72" alt=""><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Guide Llama.cpp

{% stepper %}
{% step %}
Obtenez le PR SPÉCIFIQUE `llama.cpp` sur [**GitHub ici**](https://github.com/ggml-org/llama.cpp/pull/24523). Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git fetch origin pull/24523/head:minimax-m3
git checkout minimax-m3
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j --target llama-cli llama-server
```

{% endstep %}

{% step %}
Vous pouvez désormais utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. D'abord, sélectionnez le type de quantification souhaité, comme `Q2_K_XL`. Utilisez aussi `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/MiniMax-M3-GGUF"
./build/bin/llama-cli \
    -hf unsloth/MiniMax-M3-GGUF:UD-IQ1_M \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 40
```

{% hint style="info" %}
Remarque : MiniMax Sparse Attention n'est pas encore pris en charge, donc l'inférence revient à l'attention dense.
{% endhint %}
{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements se bloquent, voir : [Dépannage de Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/MiniMax-M3-GGUF \
    --local-dir unsloth/MiniMax-M3-GGUF \
    --include "*UD-IQ1_M*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endstep %}

{% step %}
Vous pouvez modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 32768` pour la longueur du contexte, `--n-gpu-layers 2` pour le déchargement GPU sur le nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous n'utilisez que l'inférence CPU. N'oubliez pas que MSA n'est pas encore pris en charge, donc gardez `--ctx-size` modeste — une attention dense sur des contextes très longs utilisera beaucoup de mémoire.

{% code overflow="wrap" %}

```bash
./build/bin/llama-cli \
    --model unsloth/MiniMax-M3-GGUF/UD-IQ1_M/MiniMax-M3-UD-IQ1_M-00001-of-00004.gguf \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 40
```

{% endcode %}
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

<figure><img src="/files/e5b19dda3124f70aca5e73dd2bfa1fef664cbf4d" alt=""><figcaption></figcaption></figure>

<figure><img src="/files/d6d8bb4fd3936536a2c88c982cd9888c779aa478" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
