For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral 3.5 - comment exécuter en local

Guide pour les modèles Mistral 3.5, à exécuter ou fine-tuner localement sur votre appareil

Mistral lance Mistral-Medium-3.5-128B, leur nouveau modèle dense multimodal de raisonnement hybride à 128B de paramètres. Il prend en charge les entrées texte et image, la sortie texte, une fenêtre de contexte de 256K et excelle dans le raisonnement, le codage, les longs contextes, l’utilisation d’outils, les flux de travail agentiques et la compréhension multimodale de documents/images.

Mistral Medium 3.5 offre des performances hautement compétitives pour des modèles 5 fois plus grands. Exécution locale sur ~64 Go de RAM. GGUF : Mistral-Medium-3.5-128B-GGUF

Guide d’utilisation

La vision pour les GGUF est désormais prise en charge pour le moment. Le support viendra plus tard.

Tableau : exigences matérielles recommandées pour Mistral Medium 3.5. Les unités sont la mémoire totale : RAM + VRAM, ou mémoire unifiée.

Mistral 3.5
3 bits
4 bits
8 bits

Medium 3.5 128B

64 Go

80 Go

128-170 Go

Votre mémoire totale disponible doit au moins dépasser la taille du modèle quantifié que vous téléchargez. Si ce n’est pas le cas, llama.cpp peut quand même fonctionner avec un déchargement partiel en RAM/disque, mais la génération sera plus lente. Vous aurez également besoin de plus de mémoire pour les longs contextes, les lots plus importants, les exécutions agentiques gourmandes en outils et les invites d’image.

Paramètres recommandés

Utilisez les paramètres de raisonnement recommandés par Mistral :

  • reasoning_effort="none" → réponses instantanées rapides, chat, extraction et instructions simples.

  • reasoning_effort="high" → mode raisonnement, recommandé pour les invites complexes, le codage, la recherche, les maths et l’utilisation agentique.

Paramètres d’échantillonnage recommandés :

  • Utilisez temperature = 0.7 pour reasoning_effort="high".

  • Utilisez temperature = 0.0 à 0.7 pour reasoning_effort="none", selon la tâche.

  • Laissez les pénalités de répétition et de présence désactivées ou à 1.0 sauf si vous observez des boucles.

  • Longueur maximale de contexte de 262,144

Mode raisonnement

Mistral Medium 3.5 prend en charge le mode instruct instantané et le mode raisonnement avec une option 'high'.

Pour activer le raisonnement élevé pour llama.cpp / llama-server :

Pour désactiver le raisonnement :

Si vous êtes sur Windows PowerShell, utilisez :

Tutoriels pour exécuter Mistral 3.5

Comme Mistral Medium 3.5 est un modèle dense de 128B, le point de départ recommandé pour l’inférence locale est le GGUF dynamique 4 bits. GGUF : unsloth/Mistral-Medium-3.5-128B-GGUF

Exécuter dans Unsloth StudioExécuter dans llama.cpp

🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons Unsloth Studio, notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir audio, des images et du texte localement sur Mac, Windows, et Linux, et :

1

Installer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

2

Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

Utilisateurs WSL : il vous sera demandé votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).

3

Lancer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

Puis ouvrez http://localhost:8888 dans votre navigateur.

4

Rechercher et télécharger Mistral Medium 3.5

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Allez ensuite dans l’onglet Studio Chat et recherchez Mistral 3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

5

Exécuter Mistral 3.5

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

🦙 Guide Llama.cpp

Pour ce guide, nous utiliserons Unsloth Dynamic 4 bits pour Mistral Medium 3.5. Voir : unsloth/Mistral-Medium-3.5-128B-GGUF.

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, en particulier si vous avez un CPU ou une machine à mémoire unifiée de grande capacité.

1. Compiler llama.cpp

Obtenez la dernière llama.cpp sur GitHub. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF; la prise en charge Metal est activée par défaut.

2. Exécuter directement depuis Hugging Face

Pour le mode raisonnement élevé :

3. Télécharger le modèle manuellement

Après l’installation de huggingface_hub et hf_transfer:

Si les téléchargements se bloquent, définissez :

4. Exécuter le GGUF local

Si un GGUF de projecteur multimodal est inclus, utilisez :

Déploiement de llama-server

Pour déployer Mistral Medium 3.5 sur llama-server, utilisez :

Pour le mode raisonnement :

Si vous êtes sur Windows PowerShell, utilisez :

Vous pouvez interroger llama-server avec une requête compatible OpenAI :

Bonnes pratiques Mistral 3.5

Exemples de prompts

Prompt de raisonnement simple

Utilisez reasoning_effort="high" pour ce style de prompt.

Prompt OCR / document

Pour l’OCR et l’extraction de documents, mettez l’image en premier et demandez une sortie structurée.

Prompt de comparaison multimodale

Prompt d’agent de codage

Utilisez reasoning_effort="high" et appel d’outils pour l’exploration de la base de code.

Prompt JSON / appel de fonction

Benchmarks

Mis à jour

Ce contenu vous a-t-il été utile ?