For the complete documentation index, see llms.txt. This page is also available as Markdown.

📙Devstral : comment exécuter et fine-tuner

Exécutez et fine-tunez Mistral Devstral 1.1, y compris Small-2507 et 2505.

Devstral-Small-2507 (Devstral 1.1) est le nouveau LLM agentique de Mistral pour l’ingénierie logicielle. Il excelle dans l’appel d’outils, l’exploration de bases de code et l’alimentation d’agents de codage. Mistral AI a publié la version originale 2505 en mai 2025.

Affiné à partir de Mistral-Small-3.1, Devstral prend en charge une fenêtre de contexte de 128k. Devstral Small 1.1 a de meilleures performances, atteignant un score de 53,6 % sur SWE-bench vérifié, ce qui en fait (10 juillet 2025) le modèle ouvert n°1 sur le benchmark.

Les GGUF Unsloth Devstral 1.1 contiennent des prise en charge de l’appel d’outils et corrections du modèle de chat. Devstral 1.1 fonctionne toujours bien avec OpenHands, mais généralise désormais mieux à d’autres invites et environnements de codage.

En mode texte uniquement, l’encodeur de vision de Devstral a été retiré avant l’affinage. Nous avons ajouté une prise en charge Vision optionnelle pour le modèle.

Tous les envois Devstral utilisent notre Dynamic 2.0 méthodologie Unsloth, offrant les meilleures performances sur les benchmarks 5-shot MMLU et KL Divergence. Cela signifie que vous pouvez exécuter et affiner des LLM Mistral quantifiés avec une perte d’exactitude minimale !

Devstral - Unsloth Dynamic quants :

🖥️ Exécution de Devstral

⚙️ Paramètres recommandés officiels

Selon Mistral AI, voici les paramètres recommandés pour l’inférence :

  • Température de 0,0 à 0,15

  • Min_P de 0,01 (optionnel, mais 0,01 fonctionne bien, la valeur par défaut de llama.cpp est 0,1)

  • Utilisez --jinja pour activer le prompt système.

Un prompt système est recommandé, et dérive du prompt système d’OpenHands. Le prompt système complet est fourni ici.

🦙 Tutoriel : comment exécuter Devstral dans Ollama

  1. Installer ollama si vous ne l’avez pas déjà fait !

  1. Exécutez le modèle avec notre quantification dynamique. Notez que vous pouvez appeler ollama serve &dans un autre terminal si cela échoue ! Nous incluons tous les paramètres suggérés (température, etc.) dans params dans notre envoi Hugging Face !

  2. De plus, Devstral prend en charge des longueurs de contexte de 128K, il est donc préférable d’activer la quantification du cache KV. Nous utilisons une quantification 8 bits qui économise 50 % d’utilisation mémoire. Vous pouvez aussi essayer "q4_0"

📖 Tutoriel : comment exécuter Devstral dans llama.cpp

  1. Obtenez le dernier llama.cpp par défaut. Seule votre machine peut atteindre le serveur. GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude - la prise en charge Metal est activée par défaut.

  1. Si vous voulez utiliser llama.cpp directement pour charger des modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez également télécharger via Hugging Face (point 3). C’est similaire à ollama run

  1. OU télécharger le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q4_K_M, ou d’autres versions quantifiées (comme BF16 en précision complète).

  1. Exécutez le modèle.

  2. Modifiez --threads -1 pour le nombre maximal de threads CPU, --ctx-size 131072 pour la longueur du contexte (Devstral prend en charge une longueur de contexte de 128K !), --n-gpu-layers 99 pour le déchargement GPU sur le nombre de couches. Essayez de l’ajuster si votre GPU manque de mémoire. Supprimez-le également si vous n’avez qu’une inférence CPU. Nous utilisons aussi une quantification 8 bits pour le cache K afin de réduire l’utilisation mémoire.

  3. En mode conversation :

  1. Pour le mode non conversationnel afin de tester notre invite Flappy Bird :

👀Prise en charge expérimentale de la vision

Xuan-Son de Hugging Face a montré dans leur dépôt GGUF qu’il est en réalité possible de « greffer » l’encodeur de vision de Mistral 3.1 Instruct sur Devstral 2507. Nous avons également téléversé nos fichiers mmproj, ce qui vous permet d’utiliser ce qui suit :

Par exemple :

Code d’instruction et de sortie
Code rendu

🦥 Affinage de Devstral avec Unsloth

Tout comme les modèles Mistral standard, y compris Mistral Small 3.1, Unsloth prend en charge l’affinage de Devstral. L’entraînement est 2 fois plus rapide, utilise 70 % de VRAM en moins et prend en charge des longueurs de contexte 8 fois plus longues. Devstral tient confortablement dans un GPU L4 de 24 Go de VRAM.

Malheureusement, Devstral dépasse légèrement les limites de mémoire d’une VRAM de 16 Go, donc l’affiner gratuitement sur Google Colab n’est pas possible pour le moment. Cependant, vous pouvez affiner le modèle gratuitement en utilisant notre notebook Kaggle, qui offre l’accès à deux GPU. Il suffit de modifier le nom du modèle Magistral du notebook pour le modèle Devstral.

Si vous avez une ancienne version d’Unsloth et/ou si vous affineez localement, installez la dernière version d’Unsloth :

Mis à jour

Ce contenu vous a-t-il été utile ?