了解如何保存你微调后的模型,以便在你喜欢的推理引擎中运行它。
你也可以使用以下方式运行你的微调模型 Unsloth 的 2 倍更快推理.
Unsloth Studio 聊天
llama.cpp - 保存为 GGUF
Unsloth API 端点
vLLM
Ollama
连接到提供商
SGLang
故障排除
llama-server 和 OpenAI 端点
NVFP4
最后更新于 2个月前
这有帮助吗?