如何使用 Claude Code 运行本地 LLM
在本地设备上使用 Claude Code 搭配开源模型的指南。
这份分步指南将向你展示如何完全在本地将开源 LLM 和 API 连接到 Claude Code,并附带截图。可使用任何开源模型运行,例如 Qwen3.6、DeepSeek 和 Gemma。
在本教程中,我们将使用开放模型: Gemma 4 和 Qwen3.5 它们是很强的智能体与编码模型(可在 24GB 内存/统一内存设备上运行)。
对于推理,我们将使用 Unsloth Desktop 和 llama.cpp ,它可让你在 macOS、Linux 和 Windows 上运行/提供 LLM 服务。你也可以使用任何其他模型。对于模型量化,我们使用 Unsloth 动态 GGUF 来运行任何量化后的 LLM,同时保持准确性。

Claude Code 设置
在设置本地 LLM 之前,我们需要先安装 Claude Code。Claude Code 是一个基于终端的编码智能体,它能理解你的代码库,并使用自然语言处理复杂的 Git 工作流。
🕵️修复 Claude Code 中推理速度慢 90% 的问题
Claude Code 最近会前置并添加一个 Claude Code Attribution 标头,这 会使 KV Cache 失效,导致在本地模型上推理慢 90%。.
该 attribution 是一行前置到 系统提示词开头 (x-anthropic-billing-header: cc_version=...; cch=...;)其值每次请求都会变化,因此整个提示前缀每一轮都会错过 KV cache。
最简单的修复方式是在启动 Claude Code 时直接禁用它,这样就无需编辑文件:
claude --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0","CLAUDE_CODE_ENABLE_TELEMETRY":"0"}}' --model unsloth/gemma-4-26B-A4B-it-GGUF要将其永久生效,请将 CLAUDE_CODE_ATTRIBUTION_HEADER 设为 0 并放入 "env" 中设置 ~/.claude/settings.json中。例如执行: cat > ~/.claude/settings.json 然后添加下面的内容(粘贴后按 ENTER 再按 CTRL+D 保存)。如果你已有一个之前的 ~/.claude/settings.json 文件,只需将 "CLAUDE_CODE_ATTRIBUTION_HEADER" : "0" 添加到 "env" 部分,并保持设置文件其余部分不变。
📖 快速入门教程

🦥 Unsloth 教程
在本教程中,我们将通过使用 Unsloth,经由 UI 将本地模型托管/连接到 Claude Code。Unsloth 可在 Windows、WSL、Linux 和 macOS 上运行。

下载 Unsloth
最简单的入门方式是安装 Unsloth Desktop 应用。它支持 macOS、Linux、 Windows, NVIDIA, AMD、Intel 和 CPU 配置。
或者,如果你更喜欢手动安装:
MacOS、Linux、WSL:
Windows PowerShell:
Unsloth 现在已准备就绪
要开始聊天,请输入消息并按 Enter。
连接工具: Claude Code, Codex、网页搜索、 MCP 等等
训练模型: 微调文本、扩散模型、嵌入模型等
生成媒体: 在本地创建和训练图像、视频、TTS

模型加载 + API 指南
⚙️ 连接 Claude Code
现在我们已经为 Claude Code 设置好了本地 LLM,接下来配置 Claude Code 以配合你的工具使用。你可以轻松连接到 unsloth start 轻松连接,或 手动.
⚡ 使用以下方式运行 Claude Code: unsloth start
要直接使用某个模型启动 Claude,请运行:
如果没有设置采样参数/标志,Unsloth 会自动为该模型选择最佳/推荐设置,包括上下文长度、温度等。
在 Unsloth Studio 中加载模型后,打开你的项目文件夹并运行:

Unsloth 会为这次启动设置本地端点、API 密钥、模型和上下文长度。你常规的 Claude Code 配置不会受影响。
Claude Code 已经会将对话保存在其正常的会话存储中,因此 --persist 并不是必需的。继续你最近的会话:
查看完整 unsloth start 从命令行加载模型、远程 Unsloth 服务器以及高级选项的参考说明。
本指南其余部分将介绍手动 llama.cpp 设置。
🔌 手动连接
如果你更喜欢手动设置,可以先配置以下环境变量。这些变量默认不会在会话之间持久保存。
配置: 设置本地 API URL:
从 Unsloth Studio → Settings → API 复制你的密钥(或者在启动时从控制台复制, unsloth run,此处会打印为 sk-unsloth-...),然后设置它。
还要设置一个空的 ANTHROPIC_API_KEY ,这样 Claude Code 就不会提示输入云端密钥:
可选:将当前在 Unsloth 中加载的模型名称设为默认值。
请使用完整的模型 ID,且要与 GET http://localhost:8888/v1/models 中显示的一致(也就是你传给 claude --model).
配置: 在 Powershell 中设置本地 API URL:
从 Unsloth Studio → Settings → API复制你的密钥,然后设置:
可选: 使用当前在 Unsloth 中加载的模型名称并将其设为默认值。
启动 Claude Code
使用当前在 Unsloth 中加载的模型启动 Claude Code。
我们将使用 gemma-4-26B-A4B-it-GGUF,但你可以使用任何与 Unsloth 兼容的模型。
Claude Code 应该会打开并显示所选模型。

先查看 Claude Code ,以修复因 KV Cache 失效导致的开源模型慢 90% 的问题。
尝试这个提示词来研究并排序高质量的 SFT 数据集:
在你提交提示词后,智能体会搜索网络、评估结果并撰写最终报告。这可能需要几分钟。
某些工作流可能需要你批准操作或回答后续提示。

完成后,生成的 sft_report.md 会看起来类似这样。

如果你看到 无法连接到 API(ConnectionRefused) ,请记得取消设置 ANTHROPIC_BASE_URL 通过 unset ANTHROPIC_BASE_URL
如果你发现开源模型慢了 90%, 先看这里 以修复 KV cache 被失效的问题。
可选:缩减系统提示词
Claude Code 最初是为 Anthropic 托管模型设计的,因此默认系统提示词很大。在本地模型上,你可以在启动时添加两个参数来裁剪它,以获得更快的响应并更好地复用 KV-cache:
可选:调整 Unsloth 服务器参数
Claude Code 使用的是在 Unsloth 中运行的模型。你可以在启动服务器时自定义其行为。
使用 --disable-tools 在驱动 Claude Code(或任何外部编码智能体)时。默认情况下,Unsloth Studio 会运行自己的服务器端工具,这会吞掉智能体的工具调用,因此 Claude Code 会给出回答,但永远不会编辑文件。 --disable-tools 切换为透传模式,因此会使用 Claude Code 自己的 Write/Edit/Bash 工具。
使用 --reasoning off 用于关闭思考,或 --reasoning on 用于对支持推理的模型开启思考。
这会在 0.0.0.0:8888上启动服务器,允许本地网络中的其他设备连接。
使用 -p 以更改服务器运行的端口。使用 -H 0.0.0.0 如果你希望手机、笔记本或你网络中的其他设备连接。
有关更高级的运行时配置,请参阅主要的 API 调优 部分。
🦙 Llama.cpp 教程
开始前,首先需要完成你要使用的特定模型的设置。我们使用 llama.cpp 它是一个开源框架,可在你的 Mac、Linux、Windows 等设备上运行 LLM。Llama.cpp 包含 llama-server ,它允许你高效地提供和部署 LLM 服务。模型将运行在 8001 端口,所有智能体工具都会通过一个兼容 OpenAI 的单一端点路由。
Qwen3.5 教程
我们将使用 Qwen3.5-35B-A3B 以及用于快速准确编码任务的特定设置。如果你的 VRAM 不足,并且想要一个 更聪明的 模型, Qwen3.5-27B 是个不错的选择,但它会慢约 2 倍;或者你也可以使用其他 Qwen3.5 变体,例如 9B、4B 或 2B。
下载并在本地使用模型
通过以下方式下载模型 huggingface_hub 在 Python 中(在通过以下方式安装后 pip install huggingface_hub hf_transfer)。我们使用 UD-Q4_K_XL 量化,以获得最佳尺寸/准确度平衡。你可以在我们的 此处的合集中找到所有 Unsloth GGUF 上传。如果下载卡住,请参见 Hugging Face Hub、XET 调试

我们使用了 unsloth/Qwen3.5-35B-A3B-GGUF ,但你也可以使用另一个变体,例如 27B,或使用其他模型,例如 unsloth/Qwen3-Coder-Next-GGUF.

启动 Llama-server
要为智能体工作负载部署 Qwen3.5,我们使用 llama-server. 我们应用 Qwen 推荐的采样参数 用于思考模式: temp 0.6, top_p 0.95 , top-k 20。请记住,如果你使用非思考模式或其他任务,这些数值会变化。
在新终端中运行此命令(使用 tmux 或打开一个新终端)。下面的内容应该 非常适合 24GB GPU(RTX 4090)(占用 23GB) --fit on 也会自动卸载,但如果你看到性能不佳,请降低 --ctx-size .
你也可以为 Qwen3.5 禁用思考,这可以提升智能体编码任务的性能。要在 llama.cpp 中禁用思考,请将以下内容添加到 llama-server 命令中:
--chat-template-kwargs "{\"enable_thinking\": false}"

使用 llama-server 启动 Claude Code
我们使用了 unsloth/GLM-4.7-Flash-GGUF ,但你可以使用任何类似的内容,例如 unsloth/Qwen3.6-27B-GGUF.
先查看 Claude Code ,以修复因 KV Cache 失效导致的开源模型慢 90% 的问题。
进入你的项目文件夹(mkdir project ; cd project)并运行:
要使用 Qwen3.6-35B-A3B,只需将其改为:

如果你想让 Claude Code 在没有任何审批的情况下执行命令,请执行 (警告:这会让 Claude Code 在没有任何审批的情况下按它喜欢的方式执行和运行代码!)
试试这个提示,安装并运行一个简单的 Unsloth 微调:

等待片刻后,Unsloth 将通过 uv 安装到 venv 中,并加载完成:

最后你将看到一个使用 Unsloth 成功微调的模型!

如果你看到 无法连接到 API(ConnectionRefused) ,请记得取消设置 ANTHROPIC_BASE_URL 通过 unset ANTHROPIC_BASE_URL
如果你发现开源模型慢了 90%, 先看这里 以修复 KV cache 被失效的问题。
最后更新于
这有帮助吗?







