Mistral 3.5 - comment exécuter en local
Guide pour les modèles Mistral 3.5, à exécuter ou fine-tuner localement sur votre appareil
Mistral lance Mistral-Medium-3.5-128B, leur nouveau modèle dense multimodal de raisonnement hybride à 128B de paramètres. Il prend en charge les entrées texte et image, la sortie texte, une fenêtre de contexte de 256K et excelle dans le raisonnement, le codage, les longs contextes, l’utilisation d’outils, les flux de travail agentiques et la compréhension multimodale de documents/images.
Mistral Medium 3.5 offre des performances hautement compétitives pour des modèles 5 fois plus grands. Exécution locale sur ~64 Go de RAM. GGUF : Mistral-Medium-3.5-128B-GGUF
Mise à jour du 1er mai 2026 : Nous avons travaillé avec Mistral pour corriger l’inférence de Mistral Medium 3.5 affectant certaines implémentations, et avons publié des GGUF mis à jour avec le correctif (PAS lié à Unsloth ou à nos quantifications). Le problème était causé par une particularité d’analyse de YaRN affectant plusieurs implémentations, notamment transformers et llama.cpp. En modifiant mscale_all_dim de 1 à 0 cela a été résolu. Nous avons aussi corrigé le fait que les fichiers mmproj n’étaient pas générés correctement.
Mistral a maintenant intégré nos correctifs dans son dépôt officiel !
Guide d’utilisation
La vision pour les GGUF est désormais prise en charge pour le moment. Le support viendra plus tard.
Tableau : exigences matérielles recommandées pour Mistral Medium 3.5. Les unités sont la mémoire totale : RAM + VRAM, ou mémoire unifiée.
Medium 3.5 128B
64 Go
80 Go
128-170 Go
Votre mémoire totale disponible doit au moins dépasser la taille du modèle quantifié que vous téléchargez. Si ce n’est pas le cas, llama.cpp peut quand même fonctionner avec un déchargement partiel en RAM/disque, mais la génération sera plus lente. Vous aurez également besoin de plus de mémoire pour les longs contextes, les lots plus importants, les exécutions agentiques gourmandes en outils et les invites d’image.
Paramètres recommandés
Utilisez les paramètres de raisonnement recommandés par Mistral :
reasoning_effort="none"→ réponses instantanées rapides, chat, extraction et instructions simples.reasoning_effort="high"→ mode raisonnement, recommandé pour les invites complexes, le codage, la recherche, les maths et l’utilisation agentique.
Paramètres d’échantillonnage recommandés :
Utilisez
temperature = 0.7pourreasoning_effort="high".Utilisez
temperature = 0.0à0.7pourreasoning_effort="none", selon la tâche.Laissez les pénalités de répétition et de présence désactivées ou à
1.0sauf si vous observez des boucles.Longueur maximale de contexte de
262,144
Mode raisonnement
Mistral Medium 3.5 prend en charge le mode instruct instantané et le mode raisonnement avec une option 'high'.
Pour activer le raisonnement élevé pour llama.cpp / llama-server :
Pour désactiver le raisonnement :
Si vous êtes sur Windows PowerShell, utilisez :
Tutoriels pour exécuter Mistral 3.5
Comme Mistral Medium 3.5 est un modèle dense de 128B, le point de départ recommandé pour l’inférence locale est le GGUF dynamique 4 bits. GGUF : unsloth/Mistral-Medium-3.5-128B-GGUF
Exécuter dans Unsloth StudioExécuter dans llama.cpp
Actuellement, aucun GGUF multimodal/vision ne fonctionne dans Ollama en raison de fichiers mmproj de vision séparés. Utilisez des backends compatibles avec llama.cpp.
N’utilisez PAS CUDA 13.2 car vous pourriez obtenir des sorties incohérentes. NVIDIA travaille sur un correctif.
🦥 Guide Unsloth Studio
Pour ce tutoriel, nous utiliserons Unsloth Studio, notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir audio, des images et du texte localement sur Mac, Windows, et Linux, et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Comparer les modèles côte à côte
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Entraîner des LLM 2x plus vite avec 70 % de VRAM en moins

Configurer Unsloth Studio (une seule fois)
La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.
Utilisateurs WSL : il vous sera demandé votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).
Rechercher et télécharger Mistral Medium 3.5
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Allez ensuite dans l’onglet Studio Chat et recherchez Mistral 3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.
Exécuter Mistral 3.5
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.
🦙 Guide Llama.cpp
Pour ce guide, nous utiliserons Unsloth Dynamic 4 bits pour Mistral Medium 3.5. Voir : unsloth/Mistral-Medium-3.5-128B-GGUF.
Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, en particulier si vous avez un CPU ou une machine à mémoire unifiée de grande capacité.
1. Compiler llama.cpp
Obtenez la dernière llama.cpp sur GitHub. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF; la prise en charge Metal est activée par défaut.
2. Exécuter directement depuis Hugging Face
Pour le mode raisonnement élevé :
3. Télécharger le modèle manuellement
Après l’installation de huggingface_hub et hf_transfer:
Si les téléchargements se bloquent, définissez :
4. Exécuter le GGUF local
Si un GGUF de projecteur multimodal est inclus, utilisez :
Déploiement de llama-server
Pour déployer Mistral Medium 3.5 sur llama-server, utilisez :
Pour le mode raisonnement :
Si vous êtes sur Windows PowerShell, utilisez :
Vous pouvez interroger llama-server avec une requête compatible OpenAI :
Bonnes pratiques Mistral 3.5
Exemples de prompts
Prompt de raisonnement simple
Utilisez reasoning_effort="high" pour ce style de prompt.
Prompt OCR / document
Pour l’OCR et l’extraction de documents, mettez l’image en premier et demandez une sortie structurée.
Prompt de comparaison multimodale
Prompt d’agent de codage
Utilisez reasoning_effort="high" et appel d’outils pour l’exploration de la base de code.
Prompt JSON / appel de fonction
Benchmarks


Mis à jour
Ce contenu vous a-t-il été utile ?


