将 vLLM 连接到 Unsloth 以进行本地聊天推理
最后更新于
这有帮助吗?
了解如何连接 vLLM 到 Unsloth 使用 vLLM 的 兼容 OpenAI 的 API 这样你就可以在一个开源 UI 聊天界面中本地托管模型并与之聊天。本指南将带你完成安装 vLLM、启动本地 vLLM 服务器、配置 API 基础 URL、加载可用的模型 ID,以及选择你托管的 vLLM 模型。
到最后,你通过 vLLM 提供服务的模型将与本地模型一起显示,让你能够以一种快速且灵活的方式在 UI 聊天界面中运行外部 LLM 推理。
先安装 vLLM,这样你就可以运行 vllm serve 命令。请按照官方 vLLM 安装指南 为你的平台和硬件进行安装。
安装后,请在终端中检查 vLLM 是否可用: vllm --help
上面的示例使用了核心服务设置。你可以根据模型和硬件添加更多 vllm serve 参数。
常见选项包括:
vllm serve unsloth/gemma-4-26B-A4B-it \
--dtype auto \
--host 0.0.0.0 \
--port 8000 \
--api-key token-abc123 \
--max-model-len 8192 \
--gpu-memory-utilization 0.9如需查看完整的 vLLM 服务器参数列表,请参阅官方 vLLM 兼容 OpenAI 的服务器 文档。
最后更新于
这有帮助吗?
这有帮助吗?

