> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/mistral-3.5.md).

# Mistral 3.5 - Comment l'exécuter localement

Mistral lance Mistral-Medium-3.5-128B, son nouveau modèle dense multimodal de raisonnement hybride à 128B de paramètres. Il prend en charge les entrées texte et image, les sorties texte, une fenêtre de contexte de 256K et excelle dans le raisonnement, le codage, les longs contextes, l'utilisation d'outils, les workflows agentiques et la compréhension multimodale de documents/images.

Mistral Medium 3.5 offre des performances très compétitives pour des modèles 5 fois plus grands que lui. Exécutez-le localement avec environ 64 Go de RAM. GGUF : [Mistral-Medium-3.5-128B-GGUF](https://huggingface.co/unsloth/Mistral-Medium-3.5-128B-GGUF)

{% hint style="success" %}
**Mise à jour du 1er mai 2026 :** Nous avons travaillé avec Mistral pour corriger l'inférence de Mistral Medium 3.5 affectant certaines implémentations, et avons publié des GGUF mis à jour avec le correctif (**PAS lié à Unsloth** ou à nos quants). Le problème était causé par une particularité d'analyse YaRN affectant plusieurs implémentations, notamment `transformers` et `llama.cpp`. En changeant `mscale_all_dim` de `1` à `0` cela a été résolu. Nous avons également corrigé `mmproj` dont les fichiers n'étaient pas générés correctement.

<mark style="background-color:$success;">**Mistral a maintenant poussé nos correctifs vers son dépôt officiel !**</mark>
{% endhint %}

### Guide d'utilisation

{% hint style="info" %}
La vision pour les GGUF est prise en charge pour le moment. Le support viendra plus tard.
{% endhint %}

Tableau : exigences matérielles recommandées pour Mistral Medium 3.5. Les unités correspondent à la mémoire totale : RAM + VRAM, ou mémoire unifiée.

| Mistral 3.5     | 3 bits | 4 bits | 8 bits     |
| --------------- | ------ | ------ | ---------- |
| Medium 3.5 128B | 64 Go  | 80 Go  | 128-170 Go |

{% hint style="info" %}
Votre mémoire totale disponible doit au minimum dépasser la taille du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut toujours fonctionner avec un déchargement partiel vers la RAM/le disque, mais la génération sera plus lente. Vous aurez également besoin de plus de mémoire pour les longs contextes, les lots plus importants, les exécutions d'agents très gourmandes en outils et les invites d'image.
{% endhint %}

#### Paramètres recommandés

Utilisez les paramètres de raisonnement recommandés par Mistral :

* `reasoning_effort="none"` → réponses instantanées rapides, chat, extraction et instructions simples.
* `reasoning_effort="high"` → mode de raisonnement, recommandé pour les invites complexes, le codage, la recherche, les mathématiques et l'utilisation agentique.

Valeurs d'échantillonnage recommandées par défaut :

* Utilisez `temperature = 0.7` pour `reasoning_effort="high"`.
* Utilisez `temperature = 0.0` à `0.7` pour `reasoning_effort="none"`, selon la tâche.
* Laissez les pénalités de répétition et de présence désactivées ou à `1.0` sauf si vous voyez des boucles.
* Longueur maximale du contexte de `262,144`

#### **Mode de raisonnement**

Mistral Medium 3.5 prend en charge le mode d'instructions instantané et le mode de raisonnement avec une option 'high'.

Pour activer le raisonnement élevé pour llama.cpp / llama-server :

```bash
--chat-template-kwargs '{"reasoning_effort":"high"}'
```

Pour désactiver le raisonnement :

```bash
--chat-template-kwargs '{"reasoning_effort":"none"}'
```

Si vous êtes sur Windows PowerShell, utilisez :

```powershell
--chat-template-kwargs "{\"reasoning_effort\":\"none\"}"
```

## Tutoriels pour exécuter Mistral 3.5

Comme Mistral Medium 3.5 est un modèle dense de 128B, le point de départ recommandé est les GGUF dynamiques en 4 bits pour l'inférence locale. GGUF : `unsloth/Mistral-Medium-3.5-128B-GGUF`

<a href="/pages/03ac7ba539b700d61c2734f1aa85e9cf4f8abfc4#unsloth-studio-guide" class="button primary">Exécuter dans Unsloth Studio</a><a href="/pages/03ac7ba539b700d61c2734f1aa85e9cf4f8abfc4#llama.cpp-guide" class="button secondary">Exécuter dans llama.cpp</a>

{% hint style="warning" %}
Actuellement, aucun GGUF multimodal/vision ne fonctionne dans **Ollama** en raison de fichiers de vision séparés. Utilisez des backends compatibles avec llama.cpp. `mmproj` fichiers de vision.

N'utilisez PAS **CUDA 13.2** car vous pourriez obtenir des sorties incohérentes. NVIDIA travaille sur un correctif.
{% endhint %}

### 🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons [Unsloth Studio](/docs/fr/nouveau/studio.md), qui est notre nouvelle interface Web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir **audio**, image et texte localement sur **Mac, Windows**, et Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* **Comparer** les modèles **côte à côte**
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9d149ac4b773a56a635d40ab8347ea2896781ae6" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), construit le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

{% hint style="info" %}
**Utilisateurs WSL :** vous serez invité à saisir votre `sudo` mot de passe pour installer les dépendances de compilation (`cmake`, `git`, `libcurl4-openssl-dev`).
{% endhint %}
{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL :**

```bash
source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888
```

**Windows PowerShell :**

```bash
& .\unsloth_studio\Scripts\unsloth.exe studio -H 0.0.0.0 -p 8888
```

<div data-with-frame="true"><figure><img src="/files/fa3d706136ff9e7c9e614db9bb2d851ed981df1b" alt="" width="375"><figcaption></figcaption></figure></div>

**Puis ouvrez `http://localhost:8888` dans votre navigateur.**
{% endstep %}

{% step %}

#### Recherchez et téléchargez Mistral Medium 3.5

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l' [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet et recherchez Mistral 3.5 dans la barre de recherche, puis téléchargez le modèle et la quant souhaités.
{% endstep %}

{% step %}

#### Exécuter Mistral 3.5

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le template de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).
{% endstep %}
{% endstepper %}

### 🦙 Guide llama.cpp

Pour ce guide, nous utiliserons Unsloth Dynamic 4 bits pour Mistral Medium 3.5. Voir : `unsloth/Mistral-Medium-3.5-128B-GGUF`.

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU ou une machine à mémoire unifiée à grande capacité.

**1. Compiler llama.cpp**

Obtenez la dernière `llama.cpp` sur GitHub. Changez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez `-DGGML_CUDA=OFF`; la prise en charge Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

**2. Exécuter directement depuis Hugging Face**

```bash
export LLAMA_CACHE="unsloth/Mistral-Medium-3.5-128B-GGUF"

./llama.cpp/llama-cli \\
    -hf unsloth/Mistral-Medium-3.5-128B-GGUF:UD-Q4_K_XL \\
    --temp 0.7 \\
    --chat-template-kwargs '{"reasoning_effort":"none"}'
```

Pour le mode de raisonnement élevé :

```bash
./llama.cpp/llama-cli \\
    -hf unsloth/Mistral-Medium-3.5-128B-GGUF:UD-Q4_K_XL \\
    --temp 0.7 \\
    --chat-template-kwargs '{"reasoning_effort":"high"}'
```

**3. Télécharger le modèle manuellement**

Après installation de `huggingface_hub` et `hf_transfer`:

```bash
pip install huggingface_hub hf_transfer

hf download unsloth/Mistral-Medium-3.5-128B-GGUF \\
    --local-dir unsloth/Mistral-Medium-3.5-128B-GGUF \\
    --include "*UD-Q4_K_XL*" \\
    --include "*mmproj*"
```

Si les téléchargements se bloquent, définissez :

```bash
export HF_HUB_ENABLE_HF_TRANSFER=1
```

**4. Exécuter le GGUF local**

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Mistral-Medium-3.5-128B-GGUF/Mistral-Medium-3.5-128B-UD-Q4_K_XL.gguf \\
    --temp 0.7 \\
    --chat-template-kwargs '{"reasoning_effort":"none"}'
```

Si un GGUF de projecteur multimodal est inclus, utilisez :

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Mistral-Medium-3.5-128B-GGUF/Mistral-Medium-3.5-128B-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/Mistral-Medium-3.5-128B-GGUF/mmproj-BF16.gguf \\
    --temp 0.7 \\
    --chat-template-kwargs '{"reasoning_effort":"none"}'
```

#### Déploiement de llama-server

Pour déployer Mistral Medium 3.5 sur llama-server, utilisez :

```bash
./llama.cpp/llama-server \\
    -hf unsloth/Mistral-Medium-3.5-128B-GGUF:UD-Q4_K_XL \\
    --alias "mistral-medium-3.5" \\
    --host 0.0.0.0 \\
    --port 8001 \\
    --temp 0.7 \\
    --chat-template-kwargs '{"reasoning_effort":"none"}'
```

Pour le mode de raisonnement :

```bash
--chat-template-kwargs '{"reasoning_effort":"high"}'
```

Si vous êtes sur Windows PowerShell, utilisez :

```powershell
--chat-template-kwargs "{\"reasoning_effort\":\"high\"}"
```

Vous pouvez interroger llama-server avec une requête compatible OpenAI :

```bash
curl http://localhost:8001/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "mistral-medium-3.5",
    "messages": [
      {"role": "user", "content": "Expliquez la principale différence entre le mode instantané et le mode de raisonnement."}
    ],
    "temperature": 0.7
  }'
```

### Bonnes pratiques Mistral 3.5

#### Exemples de prompts

**Prompt de raisonnement simple**

```
Système :
Vous êtes un assistant de raisonnement précis. Résolvez soigneusement et présentez uniquement la réponse finale et une courte explication.

Utilisateur :
Un train part à 8 h 15 et arrive à 11 h 47. Quelle a été la durée du trajet ?
```

Utilisez `reasoning_effort="high"` pour ce style de prompt.

**Prompt OCR / document**

Pour l'OCR et l'extraction de documents, placez l'image en premier et demandez une sortie structurée.

```
[image d'abord]
Extrayez tout le texte de ce reçu. Retournez merchant, date, line_items et total en JSON.
```

**Prompt de comparaison multimodale**

```
[image 1]
[image 2]
Comparez ces deux captures d'écran et dites-moi laquelle est la plus susceptible de dérouter un nouvel utilisateur. Donnez 3 raisons concrètes.
```

**Prompt d'agent de codage**

```
Vous êtes un agent de codage travaillant dans un dépôt.
Inspectez d'abord les fichiers pertinents, puis proposez un correctif minimal.
Renvoyez la réponse finale avec : summary, files changed, tests run et risks.
```

Utilisez `reasoning_effort="high"` et les appels d'outils pour explorer la base de code.

**Prompt JSON / appel de fonction**

```
Utilisez les outils fournis chaque fois qu'un calcul ou une recherche est nécessaire.
Renvoyez uniquement du JSON valide. N'incluez aucun texte en dehors de l'objet JSON.
```

### Tests de référence

<div><figure><img src="/files/0b2acd518a19d2b28b22c9aa8fb9c9953f2feda9" alt=""><figcaption></figcaption></figure> <figure><img src="/files/81b21655d2d7032c49ba3f3cbea7be127226cf0b" alt=""><figcaption></figcaption></figure></div>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/mistral-3.5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
