For the complete documentation index, see llms.txt. This page is also available as Markdown.

Phi-4 推理:如何运行与微调

学习使用 Unsloth + 我们的 Dynamic 2.0 量化在本地运行和微调 Phi-4 推理模型

微软新的 Phi-4 推理模型现在已在 Unsloth 中支持。‘plus’ 版本的表现可与 OpenAI 的 o1-mini、o3-mini 和 Sonnet 3.7 相媲美。‘plus’ 和标准推理模型参数量均为 14B,而 ‘mini’ 的参数量为 4B。 所有 Phi-4 推理上传都使用我们的 Unsloth Dynamic 2.0 方法。

Phi-4 推理 - Unsloth Dynamic 2.0 上传:

Dynamic 2.0 GGUF(用于运行)
动态 4 位 Safetensor(用于微调/部署)

🖥️ 运行 Phi-4 推理

⚙️ 官方推荐设置

根据微软的说法,这些是推理时推荐的设置:

  • 温度 = 0.8

  • Top_P = 0.95

Phi-4 推理聊天模板

请确保使用正确的聊天模板,因为 ‘mini’ 版本使用的是不同的模板。

Phi-4-mini:

<|system|>你的名字是 Phi,一款由微软开发的 AI 数学专家。<|end|><|user|>如何求解 3*x^2+4*x+5=1?<|end|><|assistant|>

Phi-4-reasoning 和 Phi-4-reasoning-plus:

此格式用于一般对话和指令:

是的,聊天模板/提示格式就是这么长!

🦙 Ollama:运行 Phi-4 推理教程

  1. 安装 ollama 如果你还没有的话!

  1. 运行模型!注意,如果失败,你可以在另一个终端中调用 ollama serve如果失败,请在另一个终端中运行。我们在 params 我们的 Hugging Face 上传中包含了所有修复和建议参数(如 temperature 等)。

📖 Llama.cpp:运行 Phi-4 推理教程

  1. 获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。

  1. 通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer )。你可以选择 Q4_K_M,或其他量化版本。

  1. 在 llama.cpp 中以对话模式运行模型。你必须使用 --jinja 在 llama.cpp 中启用模型推理。不过如果你使用的是 ‘mini’ 版本,则不需要这样做。

🦥 使用 Unsloth 对 Phi-4 进行微调

Phi-4 微调 这些模型现在也已在 Unsloth 中支持。若要在 Google Colab 上免费微调,只需将 model_name 从 'unsloth/Phi-4' 改为 'unsloth/Phi-4-mini-reasoning' 等。

最后更新于

这有帮助吗?