For the complete documentation index, see llms.txt. This page is also available as Markdown.

将 llama.cpp 连接到 Unsloth:使用 llama-server 运行 GGUF

Llama.cpp 是一个开源推理引擎,用于在本地硬件上高效运行 GGUF 模型,并且 Unsloth 可让你轻松将这些模型直接运行到一个开源的 UI 聊天界面中。通过启动本地 llama-server,你可以从你的机器或 Hugging Face 提供一个 GGUF 模型,将其连接到 Unsloth,并像使用其他外部聊天模型一样使用它。

本指南将逐步介绍如何安装 llama.cpp、启动 llama-server、将其连接到 Unsloth、启用你的模型,以及配置提示缓存、上下文长度、API 密钥、FA 和聊天模板。

设置

1

安装 llama.cpp

先安装 llama.cpp,这样你就可以运行 llama-server 命令。

请使用以下官方安装选项之一:

安装完成后,在终端中检查 llama-server 是否可用:

llama-server --help

2

选择一个 GGUF 模型

llama-server 可以加载本地 .gguf 文件,或从 Hugging Face 下载 GGUF 模型。

若要直接提供一个 Hugging Face GGUF 仓库,请使用仓库名和量化名称:

llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL

如果你想加载本地模型,也可以按照以下步骤操作。

开始 llama-server 使用你想要提供服务的模型:

这会在以下地址暴露一个 API 端点: http://localhost:8080/v1

如果要要求 API 密钥,请添加:

3

将 Llama.cpp 连接到 Unsloth

打开 设置 → 连接,然后点击 添加连接。选择 llama.cpp,然后输入你的服务器详细信息:

如果你没有用 --api-key启动 llama-server,则将 API 密钥字段留空。输入你的服务器基础 URL,例如 http://localhost:8080/v1 点击 加载模型 以获取可用的模型 ID;如果你的服务器未公开 /models.

然后,在你点击 添加连接 之后,你启用的模型现在会出现在 已连接 中的 选择模型 下拉菜单里。

4

准备聊天

保存连接后,你的 llama.cpp 模型将出现在模型下拉菜单的 连接 中。选择它即可开始通过你的 llama-server.

提示缓存

当请求复用相同的长前缀时,提示缓存可以降低延迟和成本。请在 Unsloth 侧边栏中使用 提示缓存 设置来控制受支持连接的缓存行为。

对于 llama.cpp,提示缓存默认启用,并且可以在启动时通过以下方式禁用: llama-server

常见的 llama-server 参数

上面的示例只使用了必需的连接设置。你可以根据模型和硬件添加更多 llama-server 参数。

常见选项包括:

有关服务器参数的完整列表,请参阅官方 llama.cpp server README.

最后更新于

这有帮助吗?