🌘Kimi K2.7 Code - 如何在本地运行
在你自己的本地设备上运行 Kimi K2.7 Code 的分步指南。
Kimi K2.7 Code 是 Moonshot AI 的代理式编程模型,建立在 K2.6 之上,以在使用约 30% 更少思考 token 的同时提升任务完成率。这个 1T 参数(32B 激活)的 MoE 模型仅支持思考、视觉和 256K 上下文。它在视觉、编码、代理式、长上下文和聊天任务上提供 SOTA 的开放性能。完整精度需要 605GB 磁盘空间;Unsloth 动态 2-bit 需要 325GB(-48%). 运行 Kimi-K2.7-Code-GGUF 通过 Unsloth Studio 或 llama.cpp。
Unsloth 动态 量化 会将重要层提升为 8-bit,而 1-bit 需要 310GB+ VRAM/RAM 配置. 对于 无损 Kimi K2.6,请使用 Q8(UD-Q8_K_XL),它仅比 大 10GB 比 Q4(UD-Q4_K_XL)。你可以通过 Mac Studio 或 DGX Station.
表:硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
310 GB
325-350GB
385-470 GB
605 GB
📊 量化分析
类似于 Kimi-K2.6, UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 int4,而对其他一切使用 BF16,并且 Q8_K_XL 遵循这一点。因此,我们对 Kimi-K2.6 转换使用相同的 Dynamic 方法。 UD-Q4_K_XL 类似,只是其余张量被 Q8_0,因此它接近完整精度,需要 600GB RAM/VRAM。 UD-Q8_K_XL 是真正“无损”的。
磁盘空间
339 GB
584 GB
595 GB
困惑度
~2.4131
~1.8420
~1.8419
我们遵循了 jukofyork的发现,即 const float d = max / -7; 而不是默认的 const float d = max / -8; 在量化过程中仅对 MoE 层进行。这一针对 INT4 原生 MoE 的双射补丁使得 Q4_0 量化类型将绝对误差从 1.8% 降低到接近 0%(epsilon)。例如下面是 Kimi-K2.7-Code 的直方图,你可以看到 -8 完全未被使用:

注意,我们也必须将其他层保持在 BF16 中,而不是聪明地使用“Q4_0”。下面我们展示两者相对于 BF16 基线的误差图。 UD-Q8-K_XL 在将 Q4_0 转换为 BF16 时,确实是“无损”的,只存在一些机器 epsilon 级差异。因此,由于使用了 Q8_0,Q4_K_XL 确实存在一些量化误差,而 Q8_K_XL 几乎无损,除 BF16 舍入外。

对于 Q4_K_XL,我们也绘制了其各张量相对于 BF16 的 Q8_0 误差。总体而言,Q8_K_XL(近乎无损)与 Q4_K_XL 之间存在一些误差,但不多。

⚙️ 使用指南
Kimi K2.7 Code 是 仅思考,并且 preserve_thinking 始终启用。不支持即时模式。
temperature = 1.0
top_p = 0.95
建议上下文长度 =
98,304(最多262,144)
如果模型能装入,在使用 B200 时你将获得 >100 tokens/s。我们建议 UD-Q2_K_XL (345GB)作为性能/质量平衡的理想大小。最佳经验法则:RAM+VRAM ≈ 量化大小;否则它仍然可以运行,只是由于卸载会更慢。
Kimi K2.7-Code 的聊天模板
运行 tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},]) 得到:
如果我们还输入了在 Tool Calling Guide,则我们会看到如下内容:
运行 Kimi K2.7 Code 指南
🦥 在 Unsloth Studio 中运行 Kimi-K2.7-Code
Kimi K2.7 Code 可以运行在 Unsloth Studio,这是一个用于本地 AI 的开源网页界面。 Unsloth Studio 会自动卸载到 RAM,并检测多 GPU 配置。使用 Unsloth Studio,你可以在本地运行模型,支持 MacOS、Windows、Linux 以及:
搜索、下载、 运行 GGUF 模型 和 safetensor 模型
自我修复的 工具调用 + 网页搜索
代码执行 (Python、Bash)
自动推理 参数调优(temp、top-p 等)
通过 llama.cpp 实现快速 CPU + GPU 推理
训练 LLM 速度快 2 倍,VRAM 减少 70%

安装并启动 Unsloth
要安装,请在终端中运行:
MacOS、Linux、WSL:
Windows PowerShell:
启动 Unsloth
MacOS、Linux、WSL 和 Windows:
然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中。
搜索并下载 Kimi K2.7-Code
Unsloth Studio 会自动卸载到 RAM 并检测多 GPU 配置。首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。
然后前往 Studio Chat 选项卡并搜索 Kimi-K2.7 Code ,在搜索栏中下载你想要的模型和量化版本。确保你有足够的算力来运行该模型。

运行 Kimi-K2.7-Code
在使用 Unsloth Studio 时,推理参数应自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth Studio 推理指南.

🦙 在 llama.cpp 中运行 Kimi K2.7 Code
在本指南中,我们将运行 UD-Q2_K_XL 该量化版本至少需要 345GB RAM。你可以自由更改量化类型。GGUF: Kimi-K2.7-Code-GGUF
对于这些教程,我们将使用 llama.cpp 进行快速本地推理,尤其是在你有 CPU 的情况下。
获取最新的 llama.cpp 在 GitHub 这里。你也可以按照下面的构建说明进行。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF ,然后照常继续——Metal 支持默认开启。
让我们先获取一张图像! 你也可以上传图像。我们将使用 https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png,这只是我们的迷你 logo,用来展示微调是如何使用 Unsloth 制作的:


你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 Q2_K_XL。同时使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 将其保存到特定位置。请注意,这个下载过程可能非常慢,所以最好使用下一节中的手动下载流程。
如果你想手动下载模型,我们可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住,请参见: Hugging Face Hub、XET 调试
然后在对话模式下运行模型:
然后你会看到如下内容:

然后使用 /image 将两张图像都加载进去,并询问“这是什么图像”:

然后你会得到类似下面的结果:

关于第二张树懒图片:

你会得到:

📊 基准测试
你可以在下方以表格格式查看基准测试:

编码
Kimi Code Bench v2
62.0
50.9
69.0
67.4
Program Bench
53.6
48.3
69.1
63.8
MLS Bench Lite
35.1
26.7
35.5
42.8
代理式
Kimi Claw 24/7 Bench
46.9
42.9
52.8
50.4
MCP Atlas
76.0
69.4
79.4
81.3
MCP Mark Verified
81.1
72.8
92.9
76.4
最后更新于
这有帮助吗?

