🪽如何运行 MTP 模型:多 Token 预测指南
MTP,或多令牌预测,通过让模型一次预测多个即将到来的 token,而不是每一步只生成一个 token,从而加速推理。它能够在不损失准确性的情况下实现更快推理,尤其适用于 GPU。在本指南中,你将学习如何在本地设备上使用像 Gemma 4 或 Qwen3.6 这样的 MTP 模型。
MTP 会预测多个未来 token,由主模型并行验证。这减少了生成时的前向传递次数,在保留仅经过验证的 token 的同时加快输出速度并保持质量。
在运行 GGUF时,MTP 可以使生成 快约 1.4× 到 2.2×。像 Gemma-4-31B 这样的稠密模型收益最大,可达到 超过 1.4× 的加速 。在内存带宽较低的设备上,例如较旧的 Mac,收益会更小。你可以直接在 Unsloth Studio 的界面 或 llama.cpp 中运行 MTP 模型。
MTP 比标准占用更多内存,因此请预留约 2 GB 额外的 RAM/VRAM 空间。
我们发现 --spec-draft-n-max 2 是最好的起点,然而, 不要假定 2 是最优的,因为性能取决于硬件。请尝试从 1 到 6 之间的任意值,并使用对你的系统来说最快的那个。Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置理想的 MTP 参数——你之后仍然可以更改。
Gemma 4 MTP
Google DeepMind 将 MTP 与原始 Gemma 4 模型分开训练,包括 QAT 变体。与 Qwen 不同,Google 以 assistant 名称发布了特定的 MTP 变体。为获得最佳结果,我们只上传 3 种精度选项: 8 位 和 16 位 (BF16、F16)。对于 QAT——我们采用了 智能 4 位恢复流程 ,就像我们对 Gemma 4 QAT 量化所做的那样,因此 MTP 量化也是智能 4 位派生的。
我们已上传 mtp- 前缀的 GGUF 到每个仓库,因此你只需要使用 常规的原始 Gemma 4 GGUF,不需要单独的仓库。你可以在这里访问 Gemma MTP 模型 ,而且它们现在可以在 Unsloth中运行。我们对带 MTP 的 Gemma 4 QAT 进行了基准测试,其运行速度快 1.5x - 2.2x:

表:MTP 硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
E2B
5 GB
6–9 GB
11 GB
E4B
6.5–7 GB
10–13 GB
17 GB
12B Unified
8–9 GB
14–15 GB
26 GB
26B A4B
17–18 GB
29–31 GB
53 GB
31B
18–21 GB
35–39 GB
63 GB
Gemma 4 MTP 会在 Unsloth Studio中自动启用。你只需要下载常规的原始 Gemma 4 GGUF。 我们更新了 Gemma 4 GGUF 文件,在 GGUF 包内的单独文件夹中加入了额外的 MTP 文件,因此无需下载单独的 Gemma 4 assistant GGUF。
唯一仍然需要单独 MTP GGUF 的模型是 Qwen3.6。
要运行 Gemma 4 MTP 模型,请按照以下步骤之一操作,适用于 Unsloth Studio 或 llama.cpp.
🦥 在 Unsloth Studio 中运行🦙 在 llama.cpp 中运行
,因此下面的内容可以直接工作(这里使用的是 8 位版本)
Qwen3.6 MTP
Qwen 直接在 Qwen3.6 和 Qwen3.5 模型内部训练了 MTP。这使得 Qwen3.6 27B MTP 在 RTX 6000 GPU 上可达到 160 tokens/s,而 Qwen3.6 35B-A3B 可达到 240 tokens/s。GGUF 上传:
表:MTP 硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
27B
16 GB
19 GB
25 GB
31 GB
56 GB
35B-A3B
18 GB
24 GB
31 GB
39 GB
71 GB
下面是 MTP 与非 MTP 的推理吞吐量图表:


我们还 上传了 MTP GGUF 适用于 Qwen3.5 模型家族 包括:0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B 和 397B-A17B。Llama.cpp 正在持续改进 MTP 性能,所以预计它会随着时间推移越来越快!
要运行 Qwen MTP 模型,请按照以下步骤之一操作,适用于 Unsloth Studio 或 llama.cpp.
🦥 Unsloth Studio MTP 指南
Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置理想的 MTP 参数——你之后仍然可以更改。
搜索并下载你想要的模型
首次启动时,你需要创建一个密码来保护你的账户,并在之后重新登录。然后前往 Studio Chat 标签页,并在搜索栏中搜索 Qwen3.6 MTP 或 Gemma 4,然后下载你想要的模型和量化版本。
Gemma 4 MTP 会在 Unsloth 中自动启用。你只需要下载常规的原始 Gemma 4 GGUF。 我们更新了 Gemma 4 GGUF 文件,在 GGUF 包内的单独文件夹中加入了额外的 MTP 文件,因此无需下载单独的 Gemma 4 assistant GGUF。
唯一仍然需要单独 MTP GGUF 的模型是 Qwen3.6。


运行你的 MTP 模型
推理、MTP 和投机 解码设置 在使用 Unsloth Studio 时应会自动设置,不过你仍然可以手动更改。你还可以在右侧边栏中编辑投机解码、上下文长度、聊天模板和其他设置。

更多信息,请查看我们的 Unsloth Studio 推理指南。下面这个 2 位的 Qwen3.6 MTP GGUF 进行了 10+ 次工具调用、搜索了 10 个网站并执行了 Python 代码:

🦙 Llama.cpp MTP 指南
安装最新版本的 llama.cpp 在 GitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——Metal 支持默认已开启。
如果你想 llama.cpp 直接加载模型,你可以使用下面的方法:(:Q4_K_XL)是量化类型。你也可以通过 Hugging Face 下载(见第 3 点)。这类似于 ollama run 。使用 export LLAMA_CACHE="folder" 以强制 llama.cpp 保存到特定位置。该模型的最大上下文长度为 256K。
请遵循适用于特定模型的以下命令之一:
Gemma 4 MTP:
别忘了 更改模型名称 为你想要的 Gemma 4 模型大小,例如 Gemma-4-26B-A4B 等,因为下面的说明适用于 Gemma-4-12B。请注意,我们提供了一个 mtp- 带前缀的 GGUF,因此下面的 -hf 命令应会自动下载并使用 MTP。
思考模式:
请查看 Gemma 4 新的 保留思考.
非思考模式:
Qwen3.6 MTP:
别忘了 更改模型名称 为你想要的 Qwen3.6 变体更改为,例如 Qwen3.6-35B-A3B 或 Qwen3.5 等,因为下面的说明适用于 Qwen3.6-27B:
思考模式 (通用任务):
对于精确编码任务,改为: temperature=0.6
请查看 Qwen3.6 新的 保留思考.
非思考模式 (通用任务):
手动下载量化版本
如果你想手动下载量化版本和 MTP 量化版本,也可以!在安装 pip install huggingface_hub hf_transfer后,通过下面的代码下载模型。你可以选择 Q4_K_M 或其他量化版本,例如 UD-Q4_K_XL 。我们建议至少使用 2 位动态量化 UD-Q2_K_XL 来平衡体积和准确性。如果下载卡住,请查看: Hugging Face Hub、XET 调试
Gemma 4 MTP:
Qwen3.6 MTP:
最后更新于
这有帮助吗?


