For the complete documentation index, see llms.txt. This page is also available as Markdown.

Phi-4 Reasoning : comment exécuter et fine-tuner

Apprenez à exécuter et fine-tuner localement les modèles de raisonnement Phi-4 avec Unsloth + nos quantifications dynamiques 2.0

Les nouveaux modèles de raisonnement Phi-4 de Microsoft sont désormais pris en charge dans Unsloth. La variante « plus » affiche des performances comparables à celles de o1-mini, o3-mini et Sonnet 3.7 d’OpenAI. Les modèles de raisonnement « plus » et standard comptent 14B paramètres, tandis que le « mini » en a 4B. Tous les téléchargements de raisonnement Phi-4 utilisent notre Unsloth Dynamic 2.0 méthodologie.

Raisonnement Phi-4 - téléchargements Unsloth Dynamic 2.0 :

Dynamic 2.0 GGUF (à exécuter)
Safetensor 4 bits dynamique (pour finetuner/déployer)

🖥️ Exécution du raisonnement Phi-4

⚙️ Paramètres officiels recommandés

Selon Microsoft, voici les paramètres recommandés pour l’inférence :

  • Température = 0,8

  • Top_P = 0.95

Modèles de chat Phi-4 reasoning

Veuillez vous assurer d’utiliser le bon modèle de chat, car la variante « mini » en a un différent.

Phi-4-mini :

<|system|>Votre nom est Phi, un expert en mathématiques IA développé par Microsoft.<|end|><|user|>Comment résoudre 3*x^2+4*x+5=1 ?<|end|><|assistant|>

Phi-4-reasoning et Phi-4-reasoning-plus :

Ce format est utilisé pour la conversation générale et les instructions :

Oui, le format du modèle de chat/prompt est aussi long que cela !

🦙 Ollama : tutoriel pour exécuter le raisonnement Phi-4

  1. Installez ollama si vous ne l’avez pas déjà fait !

  1. Exécutez le modèle ! Notez que vous pouvez appeler ollama servedans un autre terminal si cela échoue. Nous incluons toutes nos corrections et les paramètres suggérés (température, etc.) dans params dans notre dépôt sur Hugging Face.

📖 Llama.cpp : tutoriel pour exécuter le raisonnement Phi-4

  1. Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

  1. Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q4_K_M, ou d’autres versions quantifiées.

  1. Exécutez le modèle en mode conversationnel dans llama.cpp. Vous devez utiliser --jinja dans llama.cpp pour activer le raisonnement pour les modèles. Cela n’est toutefois pas nécessaire si vous utilisez la variante « mini ».

🦥 Fine-tuning de Phi-4 avec Unsloth

Fine-tuning de Phi-4 pour les modèles sont également désormais pris en charge dans Unsloth. Pour fine-tuner gratuitement sur Google Colab, il suffit de modifier le model_name de 'unsloth/Phi-4' à 'unsloth/Phi-4-mini-reasoning', etc.

Mis à jour

Ce contenu vous a-t-il été utile ?