For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌘Kimi K2.7 Code - 如何在本地运行

在你自己的本地设备上运行 Kimi K2.7 Code 的分步指南。

Kimi K2.7 Code 是 Moonshot AI 的代理式编程模型,建立在 K2.6 之上,以在使用约 30% 更少思考 token 的同时提升任务完成率。这个 1T 参数(32B 激活)的 MoE 模型仅支持思考、视觉和 256K 上下文。它在视觉、编码、代理式、长上下文和聊天任务上提供 SOTA 的开放性能。完整精度需要 605GB 磁盘空间;Unsloth 动态 2-bit 需要 325GB(-48%). 运行 Kimi-K2.7-Code-GGUF 通过 Unsloth Studio 或 llama.cpp。

Unsloth 动态 量化 会将重要层提升为 8-bit,而 1-bit 需要 310GB+ VRAM/RAM 配置. 对于 无损 Kimi K2.6,请使用 Q8(UD-Q8_K_XL),它仅比 大 10GB 比 Q4(UD-Q4_K_XL)。你可以通过 Mac Studio 或 DGX Station.

表:硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)

动态 1-bit
动态 2-bit
动态 Q3
Q8(无损)

310 GB

325-350GB

385-470 GB

605 GB

📊 量化分析

类似于 Kimi-K2.6, UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 int4,而对其他一切使用 BF16,并且 Q8_K_XL 遵循这一点。因此,我们对 Kimi-K2.6 转换使用相同的 Dynamic 方法。 UD-Q4_K_XL 类似,只是其余张量被 Q8_0,因此它接近完整精度,需要 600GB RAM/VRAM。 UD-Q8_K_XL 是真正“无损”的。

测量
UD-Q2_K_XL
UD-Q4_K_XL
UD-Q8_K_XL(无损)

磁盘空间

339 GB

584 GB

595 GB

困惑度

~2.4131

~1.8420

~1.8419

我们遵循了 jukofyork的发现,即 const float d = max / -7; 而不是默认的 const float d = max / -8; 在量化过程中仅对 MoE 层进行。这一针对 INT4 原生 MoE 的双射补丁使得 Q4_0 量化类型将绝对误差从 1.8% 降低到接近 0%(epsilon)。例如下面是 Kimi-K2.7-Code 的直方图,你可以看到 -8 完全未被使用:

注意,我们也必须将其他层保持在 BF16 中,而不是聪明地使用“Q4_0”。下面我们展示两者相对于 BF16 基线的误差图。 UD-Q8-K_XL 在将 Q4_0 转换为 BF16 时,确实是“无损”的,只存在一些机器 epsilon 级差异。因此,由于使用了 Q8_0,Q4_K_XL 确实存在一些量化误差,而 Q8_K_XL 几乎无损,除 BF16 舍入外。

对于 Q4_K_XL,我们也绘制了其各张量相对于 BF16 的 Q8_0 误差。总体而言,Q8_K_XL(近乎无损)与 Q4_K_XL 之间存在一些误差,但不多。

⚙️ 使用指南

Kimi K2.7 Code 是 仅思考,并且 preserve_thinking 始终启用。不支持即时模式。

默认(思考模式)

temperature = 1.0

top_p = 0.95

  • 建议上下文长度 = 98,304 (最多 262,144)

如果模型能装入,在使用 B200 时你将获得 >100 tokens/s。我们建议 UD-Q2_K_XL (345GB)作为性能/质量平衡的理想大小。最佳经验法则:RAM+VRAM ≈ 量化大小;否则它仍然可以运行,只是由于卸载会更慢。

Kimi K2.7-Code 的聊天模板

运行 tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},]) 得到:

如果我们还输入了在 Tool Calling Guide,则我们会看到如下内容:

运行 Kimi K2.7 Code 指南

🦥 在 Unsloth Studio 中运行 Kimi-K2.7-Code

Kimi K2.7 Code 可以运行在 Unsloth Studio,这是一个用于本地 AI 的开源网页界面。 Unsloth Studio 会自动卸载到 RAM,并检测多 GPU 配置。使用 Unsloth Studio,你可以在本地运行模型,支持 MacOS、Windows、Linux 以及:

1

安装并启动 Unsloth

要安装,请在终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中。

2

搜索并下载 Kimi K2.7-Code

Unsloth Studio 会自动卸载到 RAM 并检测多 GPU 配置。首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。

然后前往 Studio Chat 选项卡并搜索 Kimi-K2.7 Code ,在搜索栏中下载你想要的模型和量化版本。确保你有足够的算力来运行该模型。

3

运行 Kimi-K2.7-Code

在使用 Unsloth Studio 时,推理参数应自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth Studio 推理指南.

使用工具调用运行 Qwen3.6 的示例

🦙 在 llama.cpp 中运行 Kimi K2.7 Code

在本指南中,我们将运行 UD-Q2_K_XL 该量化版本至少需要 345GB RAM。你可以自由更改量化类型。GGUF: Kimi-K2.7-Code-GGUF

对于这些教程,我们将使用 llama.cpp 进行快速本地推理,尤其是在你有 CPU 的情况下。

1

获取最新的 llama.cpp GitHub 这里。你也可以按照下面的构建说明进行。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF ,然后照常继续——Metal 支持默认开启。

2

让我们先获取一张图像! 你也可以上传图像。我们将使用 https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png,这只是我们的迷你 logo,用来展示微调是如何使用 Unsloth 制作的:

让我们获取第二张图像,位于 https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

3

你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 Q2_K_XL。同时使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 将其保存到特定位置。请注意,这个下载过程可能非常慢,所以最好使用下一节中的手动下载流程。

4

如果你想手动下载模型,我们可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住,请参见: Hugging Face Hub、XET 调试

5

然后在对话模式下运行模型:

然后你会看到如下内容:

6

然后使用 /image 将两张图像都加载进去,并询问“这是什么图像”:

然后你会得到类似下面的结果:

关于第二张树懒图片:

你会得到:

📊 基准测试

你可以在下方以表格格式查看基准测试:

基准
Kimi K2.7 Code
Kimi K2.6
GPT-5.5
Claude Opus 4.8

编码

Kimi Code Bench v2

62.0

50.9

69.0

67.4

Program Bench

53.6

48.3

69.1

63.8

MLS Bench Lite

35.1

26.7

35.5

42.8

代理式

Kimi Claw 24/7 Bench

46.9

42.9

52.8

50.4

MCP Atlas

76.0

69.4

79.4

81.3

MCP Mark Verified

81.1

72.8

92.9

76.4

最后更新于

这有帮助吗?