For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌘Kimi K3 - 如何本地运行

在本地环境上运行 Kimi K3 量化模型的指南。

Moonshot AI 的 Kimi K3 是一个 2.8T 参数的开放权重模型(104B 活跃参数),专为最先进的编程、智能体、长上下文和聊天工作负载打造。它是 最强的开源模型 迄今为止,可与 Claude 4.8 Opus 和 GPT-5.6 相媲美。Kimi K3 具备原生视觉能力、100万 token 的上下文窗口,并使用 MXFP4。全精度推理需要 1.56 TB 存储,而 1 位 Kimi K3 Unsloth 动态 GGUF 需要 594 GB(减少 62%).

动态 1 位(见右)达到 ~78.9% top-1 准确率,同时 缩小 62%。动态 2 位 861.3GB 达到 ~90% 准确率,同时 缩小 45%。运行 Kimi-K3-GGUF 通过 Unsloth Studio 或 llama.cpp。Kimi K3 可在 NVIDIA DGX Station 上运行,或在连接到 128GB RAM 设备的 Mac Studio 上运行。

对于 无损 Kimi K3,请使用 Q8(UD-Q8_K_XL),它比 大 50GB 比 Q4(UD-Q4_K_XL)。我们仍在研究是否能在不损害模型的情况下将其压到 512GiB 以下(动态 1 位为 553.2 GiB)。

运行 Kimi K3 教程量化结果

1 位 Kimi K3 GGUF vs Claude 5 vs GPT 5.6

表:硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)

动态 1 位 S
动态 1 位 M
动态 2 位 XXS
动态 2 位 XL
Q8(无损)

610 GB

665 GB

726 GB

880 GB

1.6 TB

Kimi K3 GGUF 实现细节

我们基于 llama.cpp PR 以及 我们的分支 进行了构建,其中包含视觉支持和一些错误修复。

  1. mmproj / vision tower 与 Kimi-K2.5 的 tower 类似,但使用了 RMSNorm、没有偏置、非方形融合 QKV(qkv 宽度 != n_embd)以及一个后归一化 projector。

  2. 我们发现,在运行 llama.cpp 时, n_tokens * 40 预算在大 batch size 下失效,因此我们不得不提高到 n_tokens * 160

  3. 我们还不得不将 Kimi 聊天模板转换为 jinja 格式。

  4. 我们尽可能进行了测试以覆盖所有情况。Kimi 默认训练时采用了 启用保留思考,因此所有思考痕迹不会被删除,而是保留。

📊 量化分析

与 Kimi K2.6K2.7一样,K3 的 UD-Q8_K_XL 是无损的,因为 Kimi 对 MoE 权重使用 MXFP4,而对其他所有内容使用 BF16,并且 Q8_K_XL 完全遵循这一点。 UD-Q4_K_XL 类似,只是其余部分的一些张量(除 norm 等之外)是 Q8_0,因此它接近全精度,并需要 1.56 TB RAM/VRAM。 UD-Q8_K_XL 相较于 MXFP4 完整 safetensors 版本,它是真正的“无损”。

量化
GB
平均 KLD
PPL(q)
top-1 一致率 %
RMS dp %

UD-IQ1_S

594.0

0.5645

2.5789

78.875 +/- 0.107

36.495

UD-IQ1_M

648.9

0.4789

2.3639

81.219 +/- 0.103

33.629

UD-IQ2_XXS

711.1

0.3784

2.1266

84.127 +/- 0.096

29.826

UD-Q2_K_XL

861.3

0.1779

1.7359

90.390 +/- 0.077

19.862

UD-Q4_K_XL

1,510

1.4579

UD-Q8_K_XL

1,560

1.4581

在 imatrix 生成和量化过程中,我们使用了 1.56 TB 的无损 UD-Q8_K_XL 进行校准;其困惑度为 1.4581。我们的 Dynamic-1bit 量化达到 2.58 困惑度,top-1 准确率为 79%,出乎意料地实用。

其他社区量化版本更大,却退化得更严重。例如,一个 618.9 GB 的量化版本 IQ1_M 超过了我们 594 GB 的 1 位量化,但其困惑度飙升到 54.56——差 21 倍。相同的模式也适用于 IQ2_XXS:725 GB 时 PPL 为 96,而我们的 711 GB 仅为 2.12 PPL——差 45 倍,这意味着他们的 2 位表现甚至比 1 位还差。这凸显了动态量化 + 正确校准的重要性。

我们还提供 Top-1% 准确率、KLD 图:

⚙️ 使用指南

Kimi K3 是 仅思考,并且 preserve_thinking 始终启用最大 默认开启思考。不支持即时模式。思考强度通过 reasoning_effort 请求字段进行配置,且 K3 支持 "低", "高",以及 "最大" 种思考强度。

默认
智能体

temperature = 1.0

temperature = 1.0

top_p = 0.95

top_p = 1.0

  • 上下文长度 = 最多可达 1,048,576

  • 低、高、最大思考可在 Unsloth 中切换

如果模型能装下,使用 B200 时你会得到约 20 token/s 的生成速度,以及 >120 token/s 的吞吐量。我们推荐 UD-IQ1_S (594GB)作为尺寸/质量平衡的不错选择。经验法则:RAM+VRAM ≈ 量化大小;否则它仍然能工作,只是由于磁盘卸载会慢得多。

运行 Kimi K3 指南

你现在可以在 llama.cppUnsloth Desktop。我们将使用 594GB UD-IQ1_S 量化版本,以在可访问性和准确性方面获得最佳结果,并且它至少需要 610GB RAM。你可以自由更改量化类型。GGUF: Kimi-K3-GGUF

🦥 在 Unsloth 中运行 Kimi-K3

Kimi K3 可以运行在 Unsloth Desktop,这是一个用于本地 AI 的开源桌面 UI。 Unsloth Desktop 会自动卸载到 RAM,并检测多 GPU 配置。借助 Unsloth Studio,你可以在本地运行模型于 macOS、Windows、Linux 以及:

1

安装并启动 Unsloth

最简单的入门方式是下载 Unsloth Desktop 应用。适用于 macOS, Windows,以及 Linux.

下载 Unsloth

或者,如果你更喜欢手动安装:

macOS、Linux、WSL:

Windows PowerShell:

启动 Unsloth

macOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中打开。

使用 HTTPS 和 Cloudflare 安全启动 Unsloth

新! Unsloth 现在提供了一种通过免费的 Cloudflare 隧道以 HTTPS 安全启动 Unsloth 的方式。使用下面的命令(适用于 Windows、Mac 和 Linux):

2

搜索并下载 Kimi K3

Unsloth Studio 会自动卸载到 RAM 并检测多 GPU 配置。首次启动时,你需要创建密码来保护账户,并在之后重新登录。

然后转到 Model hub 选项卡并搜索 Kimi K3 在搜索栏中下载你想要的模型和量化版本。请确保你有足够的计算资源来运行该模型。

3

运行 Kimi K3

使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍可手动更改。你还可以切换 低、高或最大思考,编辑上下文长度、聊天模板和其他设置。

如需更多信息,你可以查看我们的 Unsloth Studio 推理指南.

在 Unsloth 的 Canvas 中运行 1 位 Kimi-K3 的示例

🦙 在 llama.cpp 中运行 Kimi K3

在这些教程中,我们将使用 llama.cpp 用于快速本地推理,尤其是如果你有 CPU。我们 创建了一个分支 专门用于支持 Kimi K3 的视觉能力。这又基于另一个 llama.cpp PR.

1

获取以下 SPECIFIC 的 Unsloth 分支: llama.cppGitHub 上的这里 以启用视觉支持。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认已开启。

2

我们先获取一张图片! 你也可以上传图片。我们将使用 这张图片,这只是我们的迷你标志,展示如何用 Unsloth 制作微调模型:

我们来获取第二张图片 这里

3

你现在可以使用 llama.cpp 直接加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 IQ1_S。同时使用 export LLAMA_CACHE="folder" 以强制 llama.cpp 保存到特定位置。 注意,此下载过程可能非常慢,因此最好使用下一节中的手动下载流程。

4

如果你想手动下载模型,可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住了,请查看: Hugging Face Hub、XET 调试

5

然后以对话模式运行模型:

6

然后你将看到:

然后我问:“-1 的平方根是什么”:

Kimi K3 也支持图像,例如加载 Unsloth 图片:

然后我们使用树懒图片,并询问它与什么相关:

📊 基准测试

你可以在下方查看表格式基准:

基准
Kimi K3 (最大)
Claude Fable 5 (最大)
GPT-5.6 Sol (最大)
Claude Opus 4.8 (最大)
GPT-5.5 (xhigh)
GLM-5.2 (最大)

推理与知识

GPQA Diamond

93.5

92.6

94.1

91.0

93.5

91.2

HLE-Full

43.5 / 56.0

53.3 / 63.0

44.5 / 58.0

49.8 / 57.9

41.4 / 52.2

编程

DeepSWE

67.5

70.0

73.0

59.0

67.0

46.2

Terminal-Bench 2.1

88.3

88.0

88.8

84.6

83.4

82.7

智能体

BrowseComp

91.2

88.0

90.4

84.3

84.4

GDPval-AA v2 (Elo)

1686

1747

1736

1593

1491

1510

OSWorld 2.0

58.3

66.1

62.6

55.7

49.5

视觉

MMMU-Pro

81.6 / 83.4

81.2 / 86.5

83.0 / 84.6

78.9 / 82.7

81.2 / 83.2

MathVision

94.3 / 97.8

94.8 / 98.6

95.8 / 97.8

86.7 / 97.1

92.2 / 96.8

DeepSWE 基准显示 Kimi-K3 表现非常高效!

最后更新于

这有帮助吗?