> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/minimax-m3.md).

# MiniMax M3 - Comment l'exécuter localement

MiniMax M3 est un nouveau **\~428B (23B active)** modèle ouvert pour le codage, les flux de travail agentiques, les tâches collaboratives et le chat multimodal. Le modèle multimodal prend en charge les entrées texte, image et vidéo, et un **fenêtre de contexte de 1M** **fenêtre**. Les poids bf16 non quantifiés sont d’environ**855GB** et le GGUF 1 bit réduit cela à seulement **128GB (-85%)**: [**MiniMax-M3 GGUF**](https://huggingface.co/unsloth/MiniMax-M3-GGUF)

Le modèle obtient des performances comparables à celles de Gemini 3.1 Pro - avec un score de 59 % sur SWE-Bench Pro, 66 % sur Terminal-Bench 2.1, 34,8 % sur SWE-fficiency et 28,8 % sur KernelBench Hard. Merci à MiniMax pour l'accès dès le premier jour.

{% columns %}
{% column width="50%" %}
Vous pouvez désormais exécuter MiniMax M3 directement dans [Unsloth Studio](#unsloth-studio-guide). Exemple de MiniMax M3 en 5 bits exécuté localement sur un seul M3 Ultra 512 Go via Unsloth Studio :

{% hint style="info" %}
Les GGUF MiniMax-M3 sont actuellement expérimentaux. MiniMax-M3 est nativement multimodal, mais le GGUF expérimental actuel est **texte uniquement** et ne prend pas en charge MiniMax Sparse Attention.
{% endhint %}
{% endcolumn %}

{% column width="50%" %}

<figure><img src="/files/22ce194b253631c6f57a9debf00d7e3922256e72" alt="" width="375"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### :gear: Guide d'utilisation

La plus petite quantification GGUF, `UD-IQ1_M`, utilise **128GB** d'espace disque. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation du contexte, essayez d'avoir au moins **133 Go de RAM** pour exécuter le modèle. Il est recommandé d'utiliser `UD-IQ3_XXS` qui est **159 Go** pour de meilleurs résultats.

Le **4 bits** `UD-IQ4_XS` la quantification est **208GB**, tandis que `UD-Q4_K_XL` est **265GB**. Ceux-ci conviennent mieux aux systèmes de 256 Go ou plus, aux serveurs multi-GPU ou aux systèmes avec RAM CPU et déchargement sur GPU.

**Tableau : exigences matérielles pour l'inférence** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

<table><thead><tr><th>1 bit</th><th>2 bits</th><th width="128">3 bits</th><th>4 bits</th><th>5 bits</th><th>8 bits</th></tr></thead><tbody><tr><td>133 Go</td><td>148 Go</td><td>164-200 Go</td><td>213-270 Go</td><td>325 Go</td><td>460-470 Go</td></tr></tbody></table>

{% hint style="success" %}
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse confortablement la taille du fichier modèle quantifié.
{% endhint %}

#### Paramètres recommandés

MiniMax recommande les paramètres suivants pour des performances optimales : `temperature=1.0`, `top_p=0.95`, `top_k=40`.

{% columns %}
{% column %}

| `temperature = 1.0` |
| ------------------- |
| `top_p = 0,95`      |
| `top_k = 40`        |
| {% endcolumn %}     |

{% column %}

* **Fenêtre de contexte maximale :** `1,048,576`
* Invite système par défaut :

{% code overflow="wrap" %}

```
Vous êtes un assistant utile. Votre nom est MiniMax-M3 et vous avez été créé par MiniMax.
```

{% endcode %}
{% endcolumn %}
{% endcolumns %}

## Tutoriels pour exécuter MiniMax-M3 :

Pour ce tutoriel, nous utiliserons la plus petite quantification actuelle, `UD-IQ1_M`, car MiniMax-M3 est volumineux. Remplacez `UD-IQ1_M` avec `UD-IQ4_XS`, `UD-Q4_K_XL`, ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez désormais exécuter MiniMax-M3 dans [Unsloth Studio](#run-in-unsloth-studio).

<a href="/pages/ea7b276c92e2e5c4a9c6d2ce402ed36497ba66b2#unsloth-studio-guide" class="button primary">🦥 Guide Unsloth Studio</a><a href="/pages/ea7b276c92e2e5c4a9c6d2ce402ed36497ba66b2#llama.cpp-guide" class="button primary">🦙 Guide llama.cpp</a>

### 🦥 Guide Unsloth Studio

{% hint style="success" %}
Vous pouvez désormais exécuter MiniMax M3 via [Unsloth Studio](#unsloth-studio-guide) ✨. Assurez-vous d'utiliser > [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.6`.
{% endhint %}

MiniMax M3 peut désormais être exécuté et entraîné dans [Unsloth Studio](/docs/fr/nouveau/studio.md), notre nouvelle interface web open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur **macOS**, **Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/608ef824be87e674df7b205a47c03ae2281fb5dc" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Assurez-vous d'utiliser la dernière [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.6`. Exécutez dans votre terminal :

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL et Windows :**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Puis ouvrez `http://127.0.0.1:8888` (ou votre URL spécifique) dans votre navigateur.
{% endstep %}

{% step %}

#### Recherchez et téléchargez MiniMax M3

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter.

Puis allez dans l’ [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet, puis recherchez MiniMax M3 dans la barre de recherche et téléchargez le modèle et la quantification de votre choix.

<figure><img src="/files/3ac3ddb12aa9db8a5f776dc48bc5336388a0f637" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécutez MiniMax M3

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/22ce194b253631c6f57a9debf00d7e3922256e72" alt=""><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Guide llama.cpp

{% stepper %}
{% step %}
Obtenez la `llama.cpp` PR spécifique sur [**GitHub ici**](https://github.com/ggml-org/llama.cpp/pull/24523). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git fetch origin pull/24523/head:minimax-m3
git checkout minimax-m3
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j --target llama-cli llama-server
```

{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. Tout d'abord, sélectionnez le type de quantification que vous souhaitez, comme `Q2_K_XL`. Utilisez aussi `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` l'enregistrement dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/MiniMax-M3-GGUF"
./build/bin/llama-cli \\
    -hf unsloth/MiniMax-M3-GGUF:UD-IQ1_M \\
    --temp 1.0 \
    --top-p 0.95 \\
    --top-k 40
```

{% hint style="info" %}
Remarque : MiniMax Sparse Attention n'est pas encore pris en charge, donc l'inférence revient à l'attention dense.
{% endhint %}
{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements restent bloqués, voir : [Hugging Face Hub, débogage XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/MiniMax-M3-GGUF \\
    --local-dir unsloth/MiniMax-M3-GGUF \\
    --include "*UD-IQ1_M*" # Utilisez "*UD-IQ4_XS*" pour 4 bits
```

{% endstep %}

{% step %}
Vous pouvez modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 32768` pour la longueur du contexte, `--n-gpu-layers 2` pour le déchargement sur GPU selon le nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous faites une inférence uniquement sur CPU. N'oubliez pas que MSA n'est pas encore pris en charge, donc gardez `--ctx-size` modeste - l'attention dense sur des contextes très longs utilisera beaucoup de mémoire.

{% code overflow="wrap" %}

```bash
./build/bin/llama-cli \\
    --model unsloth/MiniMax-M3-GGUF/UD-IQ1_M/MiniMax-M3-UD-IQ1_M-00001-of-00004.gguf \\
    --temp 1.0 \
    --top-p 0.95 \\
    --top-k 40
```

{% endcode %}
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

<figure><img src="/files/e5b19dda3124f70aca5e73dd2bfa1fef664cbf4d" alt=""><figcaption></figcaption></figure>

<figure><img src="/files/d6d8bb4fd3936536a2c88c982cd9888c779aa478" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
