For the complete documentation index, see llms.txt. This page is also available as Markdown.

Phi-4 Reasoning: Ausführen und feinabstimmen

Lerne, Phi-4-Reasoning-Modelle lokal mit Unsloth + unseren Dynamic-2.0-Quants auszuführen und feinabzustimmen

Microsofts neue Phi-4-Reasoning-Modelle werden jetzt in Unsloth unterstützt. Die Variante „plus“ erreicht eine Leistung auf dem Niveau von OpenAIs o1-mini, o3-mini und Sonnet 3.7. Die „plus“- und Standard-Reasoning-Modelle haben 14B Parameter, während das „mini“ 4B Parameter hat. Alle Phi-4-Reasoning-Uploads verwenden unsere Unsloth Dynamic 2.0 Methodik.

Phi-4 Reasoning - Unsloth Dynamic 2.0 Uploads:

Dynamic 2.0 GGUF (zum Ausführen)
Dynamisches 4-Bit-Safetensor (zum Finetunen/Deployen)

🖥️ Ausführen von Phi-4 Reasoning

⚙️ Offizielle empfohlene Einstellungen

Laut Microsoft sind dies die empfohlenen Einstellungen für die Inferenz:

  • Temperatur = 0,8

  • Top_P = 0,95

Phi-4 Reasoning Chat-Vorlagen

Bitte stellen Sie sicher, dass Sie die richtige Chat-Vorlage verwenden, da die Variante „mini“ eine andere hat.

Phi-4-mini:

<|system|>Dein Name ist Phi, ein von Microsoft entwickelter KI-Mathematikexperte.<|end|><|user|>Wie löst man 3*x^2+4*x+5=1?<|end|><|assistant|>

Phi-4-reasoning und Phi-4-reasoning-plus:

Dieses Format wird für allgemeine Gespräche und Anweisungen verwendet:

Ja, das Chat-Vorlagen-/Prompt-Format ist so lang!

🦙 Ollama: Phi-4 Reasoning Tutorial ausführen

  1. Installieren Sie ollama falls Sie das noch nicht getan haben!

  1. Führen Sie das Modell aus! Beachten Sie, dass Sie ollama servein einem anderen Terminal aus, falls es fehlschlägt. Wir enthalten alle unsere Fehlerbehebungen und empfohlenen Parameter (Temperatur usw.) in params in unserem Hugging-Face-Upload.

📖 Llama.cpp: Phi-4 Reasoning Tutorial ausführen

  1. Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

  1. Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst Q4_K_M oder andere quantisierte Versionen wählen.

  1. Führe das Modell im Konversationsmodus in llama.cpp aus. Du musst --jinja in llama.cpp, um Reasoning für die Modelle zu aktivieren. Dies ist jedoch nicht erforderlich, wenn du die Variante „mini“ verwendest.

🦥 Phi-4 mit Unsloth feinabstimmen

Phi-4 Feinabstimmung für die Modelle wird jetzt ebenfalls in Unsloth unterstützt. Um kostenlos auf Google Colab feinabzustimmen, ändere einfach den model_name von 'unsloth/Phi-4' zu 'unsloth/Phi-4-mini-reasoning' usw.

Zuletzt aktualisiert

War das hilfreich?