🌘Kimi K3 - 如何本地运行
在本地环境上运行 Kimi K3 量化模型的指南。
Moonshot AI 的 Kimi K3 是一个 2.8T 参数的开放权重模型(104B 活跃参数),专为最先进的编程、智能体、长上下文和聊天工作负载打造。它是 最强的开源模型 迄今为止,可与 Claude 4.8 Opus 和 GPT-5.6 相媲美。Kimi K3 具备原生视觉能力、100万 token 的上下文窗口,并使用 MXFP4。全精度推理需要 1.56 TB 存储,而 1 位 Kimi K3 Unsloth 动态 GGUF 需要 594 GB(减少 62%).
动态 1 位(见右)达到 ~78.9% top-1 准确率,同时 缩小 62%。动态 2 位 861.3GB 达到 ~90% 准确率,同时 缩小 45%。运行 Kimi-K3-GGUF 通过 Unsloth Studio 或 llama.cpp。Kimi K3 可在 NVIDIA DGX Station 上运行,或在连接到 128GB RAM 设备的 Mac Studio 上运行。
对于 无损 Kimi K3,请使用 Q8(UD-Q8_K_XL),它比 大 50GB 比 Q4(UD-Q4_K_XL)。我们仍在研究是否能在不损害模型的情况下将其压到 512GiB 以下(动态 1 位为 553.2 GiB)。

表:硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
610 GB
665 GB
726 GB
880 GB
1.6 TB
Kimi K3 GGUF 实现细节
我们基于 llama.cpp PR 以及 我们的分支 进行了构建,其中包含视觉支持和一些错误修复。
mmproj / vision tower 与 Kimi-K2.5 的 tower 类似,但使用了 RMSNorm、没有偏置、非方形融合 QKV(qkv 宽度 != n_embd)以及一个后归一化 projector。
我们发现,在运行 llama.cpp 时,
n_tokens * 40预算在大 batch size 下失效,因此我们不得不提高到n_tokens * 160我们还不得不将 Kimi 聊天模板转换为 jinja 格式。
我们尽可能进行了测试以覆盖所有情况。Kimi 默认训练时采用了 启用保留思考,因此所有思考痕迹不会被删除,而是保留。
📊 量化分析
与 Kimi K2.6 和 K2.7一样,K3 的 UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 MXFP4,而对其他所有内容使用 BF16,并且 Q8_K_XL 完全遵循这一点。 UD-Q4_K_XL 类似,只是其余部分的一些张量(除 norm 等之外)是 Q8_0,因此它接近全精度,并需要 1.56 TB RAM/VRAM。 UD-Q8_K_XL 相较于 MXFP4 完整 safetensors 版本,它是真正的“无损”。
UD-IQ1_S
594.0
0.5645
2.5789
78.875 +/- 0.107
36.495
UD-IQ1_M
648.9
0.4789
2.3639
81.219 +/- 0.103
33.629
UD-IQ2_XXS
711.1
0.3784
2.1266
84.127 +/- 0.096
29.826
UD-Q2_K_XL
861.3
0.1779
1.7359
90.390 +/- 0.077
19.862
UD-Q4_K_XL
1,510
1.4579
UD-Q8_K_XL
1,560
1.4581
在 imatrix 生成和量化过程中,我们使用了 1.56 TB 的无损 UD-Q8_K_XL 进行校准;其困惑度为 1.4581。我们的 Dynamic-1bit 量化达到 2.58 困惑度,top-1 准确率为 79%,出乎意料地实用。
其他社区量化版本更大,却退化得更严重。例如,一个 618.9 GB 的量化版本 IQ1_M 超过了我们 594 GB 的 1 位量化,但其困惑度飙升到 54.56——差 21 倍。相同的模式也适用于 IQ2_XXS:725 GB 时 PPL 为 96,而我们的 711 GB 仅为 2.12 PPL——差 45 倍,这意味着他们的 2 位表现甚至比 1 位还差。这凸显了动态量化 + 正确校准的重要性。
我们还提供 Top-1% 准确率、KLD 图:



⚙️ 使用指南
Kimi K3 是 仅思考,并且 preserve_thinking 始终启用 和 最大 默认开启思考。不支持即时模式。思考强度通过 reasoning_effort 请求字段进行配置,且 K3 支持 "低", "高",以及 "最大" 种思考强度。
temperature = 1.0
temperature = 1.0
top_p = 0.95
top_p = 1.0
上下文长度 = 最多可达
1,048,576低、高、最大思考可在 Unsloth 中切换
如果模型能装下,使用 B200 时你会得到约 20 token/s 的生成速度,以及 >120 token/s 的吞吐量。我们推荐 UD-IQ1_S (594GB)作为尺寸/质量平衡的不错选择。经验法则:RAM+VRAM ≈ 量化大小;否则它仍然能工作,只是由于磁盘卸载会慢得多。
运行 Kimi K3 指南
你现在可以在 llama.cpp 和 Unsloth Desktop。我们将使用 594GB UD-IQ1_S 量化版本,以在可访问性和准确性方面获得最佳结果,并且它至少需要 610GB RAM。你可以自由更改量化类型。GGUF: Kimi-K3-GGUF
🦥 在 Unsloth 中运行 Kimi-K3
Kimi K3 可以运行在 Unsloth Desktop,这是一个用于本地 AI 的开源桌面 UI。 Unsloth Desktop 会自动卸载到 RAM,并检测多 GPU 配置。借助 Unsloth Studio,你可以在本地运行模型于 macOS、Windows、Linux 以及:

安装并启动 Unsloth
最简单的入门方式是下载 Unsloth Desktop 应用。适用于 macOS, Windows,以及 Linux.
或者,如果你更喜欢手动安装:
macOS、Linux、WSL:
Windows PowerShell:
启动 Unsloth
macOS、Linux、WSL 和 Windows:
然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中打开。
使用 HTTPS 和 Cloudflare 安全启动 Unsloth
新! Unsloth 现在提供了一种通过免费的 Cloudflare 隧道以 HTTPS 安全启动 Unsloth 的方式。使用下面的命令(适用于 Windows、Mac 和 Linux):
搜索并下载 Kimi K3
Unsloth Studio 会自动卸载到 RAM 并检测多 GPU 配置。首次启动时,你需要创建密码来保护账户,并在之后重新登录。
然后转到 Model hub 选项卡并搜索 Kimi K3 在搜索栏中下载你想要的模型和量化版本。请确保你有足够的计算资源来运行该模型。

运行 Kimi K3
使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍可手动更改。你还可以切换 低、高或最大思考,编辑上下文长度、聊天模板和其他设置。
如需更多信息,你可以查看我们的 Unsloth Studio 推理指南.

🦙 在 llama.cpp 中运行 Kimi K3
在这些教程中,我们将使用 llama.cpp 用于快速本地推理,尤其是如果你有 CPU。我们 创建了一个分支 专门用于支持 Kimi K3 的视觉能力。这又基于另一个 llama.cpp PR.
获取以下 SPECIFIC 的 Unsloth 分支: llama.cpp 于 GitHub 上的这里 以启用视觉支持。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认已开启。
你现在可以使用 llama.cpp 直接加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 IQ1_S。同时使用 export LLAMA_CACHE="folder" 以强制 llama.cpp 保存到特定位置。 注意,此下载过程可能非常慢,因此最好使用下一节中的手动下载流程。
如果你想手动下载模型,可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住了,请查看: Hugging Face Hub、XET 调试
然后以对话模式运行模型:
然后你将看到:

然后我问:“-1 的平方根是什么”:

Kimi K3 也支持图像,例如加载 Unsloth 图片:

然后我们使用树懒图片,并询问它与什么相关:

📊 基准测试
你可以在下方查看表格式基准:


推理与知识
GPQA Diamond
93.5
92.6
94.1
91.0
93.5
91.2
HLE-Full
43.5 / 56.0
53.3 / 63.0
44.5 / 58.0
49.8 / 57.9
41.4 / 52.2
—
编程
DeepSWE
67.5
70.0
73.0
59.0
67.0
46.2
Terminal-Bench 2.1
88.3
88.0
88.8
84.6
83.4
82.7
智能体
BrowseComp
91.2
88.0
90.4
84.3
84.4
—
GDPval-AA v2 (Elo)
1686
1747
1736
1593
1491
1510
OSWorld 2.0
58.3
66.1
62.6
55.7
49.5
—
视觉
MMMU-Pro
81.6 / 83.4
81.2 / 86.5
83.0 / 84.6
78.9 / 82.7
81.2 / 83.2
—
MathVision
94.3 / 97.8
94.8 / 98.6
95.8 / 97.8
86.7 / 97.1
92.2 / 96.8
—
DeepSWE 基准显示 Kimi-K3 表现非常高效!

最后更新于
这有帮助吗?



