For the complete documentation index, see llms.txt. This page is also available as Markdown.

🐱Ministral 3 - guide d'exécution

Guide pour les modèles Mistral Ministral 3, à exécuter ou fine-tuner localement sur votre appareil

Mistral lance Ministral 3, ses nouveaux modèles multimodaux en variantes Base, Instruct et Reasoning, disponibles en 3B, 8B, et 14B tailles. Ils offrent des performances de pointe pour leur taille et sont affinés pour les cas d’usage d’instructions et de chat. Les modèles multimodaux prennent en charge contexte de 256K les fenêtres, plusieurs langues, l’appel de fonctions natif et la sortie JSON.

Le modèle complet Ministral-3-Instruct-2512 non quantifié de 14B tient dans 24 Go de RAM/VRAM. Vous pouvez désormais exécuter, affiner et faire du RL sur tous les modèles Ministral 3 avec Unsloth :

Exécuter les tutoriels Ministral 3Affinage de Ministral 3

Nous avons également téléversé Mistral Large 3 GGUF ici. Pour tous les téléversements Ministral 3 (BnB, FP8), voir ici.

GGUF de Ministral-3-Instruct :
GGUF de Ministral-3-Reasoning :

3B8B14B

3B8B14B

⚙️ Guide d’utilisation

Pour obtenir des performances optimales pour Instruct, Mistral recommande d’utiliser des températures plus basses telles que temperature = 0.15 ou 0.1

Pour Reasoning, Mistral recommande température = 0.7 et top_p = 0.95.

Instruct :
Reasoning :

Température = 0,15 ou 0.1

Température = 0.7

Top_P = par défaut

Top_P = 0.95

Longueur de sortie adéquate: Utilisez une longueur de sortie de 32,768 tokens pour la plupart des requêtes pour la variante reasoning, et 16,384 pour la variante instruct. Vous pouvez augmenter la taille maximale de sortie pour le modèle reasoning si nécessaire.

La longueur maximale du contexte que Ministral 3 peut atteindre est 262,144

Le format du modèle de conversation se trouve lorsque nous utilisons ce qui suit :

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True
)

Ministral Reasoning template de chat :

Ministral Instruct template de chat :

📖 Exécuter les tutoriels Ministral 3

Voici des guides pour les Reasoning et Instruct variantes du modèle.

Instruct : Ministral-3-Instruct-2512

Pour obtenir des performances optimales pour Instruct, Mistral recommande d’utiliser des températures plus basses telles que temperature = 0.15 ou 0.1

Llama.cpp : Exécuter le tutoriel Ministral-3-14B-Instruct

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Vous pouvez le récupérer directement depuis Hugging Face via :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir UD_Q4_K_XL ou d’autres versions quantifiées.

Reasoning : Ministral-3-Reasoning-2512

Pour obtenir des performances optimales pour Reasoning, Mistral recommande d’utiliser température = 0.7 et top_p = 0.95.

Llama.cpp : Exécuter le tutoriel Ministral-3-14B-Reasoning

1

Obtenez la dernière version llama.cpp sur GitHub. Vous pouvez également utiliser les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU.

2

Vous pouvez le récupérer directement depuis Hugging Face via :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir UD_Q4_K_XL ou d’autres versions quantifiées.

🛠️ Affinage de Ministral 3

Unsloth prend désormais en charge l’affinage de tous les modèles Ministral 3, y compris la prise en charge de la vision. Pour entraîner, vous devez utiliser la dernière version de 🤗Hugging Face transformers v5 et unsloth qui inclut notre récente très long contexte prise en charge. Le grand modèle Ministral 3 de 14B devrait tenir sur un GPU Colab gratuit.

Nous avons créé des notebooks Unsloth gratuits pour affiner Ministral 3. Modifiez le nom pour utiliser le modèle souhaité.

Notebook d’affinage de Ministral Vision

Notebook GRPO RL de Ministral Sudoku

Apprentissage par renforcement (GRPO)

Unsloth prend désormais également en charge le RL et le GRPO pour les modèles Mistral. Comme d’habitude, ils bénéficient de toutes les améliorations d’Unsloth et, demain, nous allons bientôt publier un notebook spécialement destiné à résoudre automatiquement le Sudoku.

Pour utiliser la dernière version d’Unsloth et de transformers v5, mettez à jour via :

L’objectif est de générer automatiquement des stratégies pour résoudre le Sudoku !

Pour les graphiques de récompense pour Ministral, nous obtenons ce qui suit. On voit que cela fonctionne bien !

Mis à jour

Ce contenu vous a-t-il été utile ?