💜Qwen3.6:如何本地运行
在本地运行新的 Qwen3.6-27B 和 35B-A3B 模型!
Qwen3.6 是阿里巴巴全新一代多模态混合思维模型家族,包括: Qwen3.6-27B 以及 35B-A3B。它在自身规模内提供顶尖性能,支持覆盖 201 种语言的 256K 上下文。它在智能体编程、视觉、聊天任务方面表现出色。Qwen3.6-27B 可在 18GB RAM 的配置上运行,而 35B-A3B 可在 22GB上运行。你现在可以在 Unsloth Desktop.
7 月 10 日: 我们发布了新的 NVFP4 量化版本 ,可在 GPU 上将 Qwen3.6 的运行速度提升 2.5 倍。
Qwen3.6 MTP 来了! MTP 可在不损失准确度的情况下实现 1.4-2.2 倍更快的推理。可直接在 Unsloth Studio中运行 MTP。我们进行了 Qwen3.6 GGUF 基准测试 ,帮助你挑选最佳量化版本。
Qwen3.6 GGUF 使用 Unsloth Dynamic 2.0 以实现业界领先的量化性能——因此量化版本会在真实使用场景数据集上进行校准,并对重要层进行上浮精度处理。 感谢 Qwen 在发布首日提供访问权限。
开发者角色支持 ,适用于 Codex、OpenCode 等: 我们的上传现在支持
开发者角色,用于智能体编程工具。工具调用: 像 Qwen3.5一样,我们改进了对嵌套对象的解析,使工具调用更容易成功。

⚙️ 使用指南
表:推理硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
27B
15 GB
18 GB
24 GB
30 GB
55 GB
35B-A3B
17 GB
23 GB
30 GB
38 GB
70 GB
为了获得最佳性能,请确保你的可用总内存(VRAM + 系统 RAM)大于你正在下载的量化模型文件大小。否则,你仍然可以通过 SSD/HDD 卸载来运行,但推理速度会更慢。
要训练 Qwen3.6,你可以参考我们之前的 Qwen3.5 微调指南.
推荐设置
最大上下文窗口:
262,144(可通过 YaRN 扩展到 1M)presence_penalty = 0.0 到 2.0默认情况下这是关闭的,但为了减少重复,你可以使用它,不过使用更高的值可能会导致 性能略有下降足够的输出长度:
32,768个 token,适用于大多数查询
由于 Qwen3.6 是混合推理,思考模式和非思考模式的设置不同:
思考模式:
Qwen3.6 现在具有 保留思考.
temperature = 1.0
temperature = 0.6
top_p = 0.95
top_p = 0.95
top_k = 20
top_k = 20
min_p = 0.0
min_p = 0.0
presence_penalty = 0.0
presence_penalty = 0.0
repeat_penalty = 已禁用或 1.0
repeat_penalty = 已禁用或 1.0
通用任务的思考模式:
精确编程任务的思考模式:
指令(非思考)模式设置:
temperature = 0.7
top_p = 0.8
top_k = 20
min_p = 0.0
presence_penalty = 1.5
repeat_penalty = 已禁用或 1.0
要 禁用思考 / 推理,请使用 --chat-template-kwargs '{"enable_thinking":false}'
如果你使用的是 Windows PowerShell,请使用: --chat-template-kwargs "{\"enable_thinking\":false}"
可交替使用 'true' 和 'false'。
通用任务的指令(非思考)模式:
Qwen3.6 推理教程:
我们将使用 Dynamic 4-bit UD-Q4_K_XL GGUF 变体进行推理工作负载。点击下方以跳转到指定模型说明:
请不要使用 CUDA 13.2,因为你可能会得到乱码输出。请使用低于 CUDA 13.2 的版本或 CUDA 13.3。
🦥 Unsloth 指南
Qwen3.6 和 Qwen3.6 MTP 现在可以在 Unsloth Desktop、 我们的全新本地 AI 开源 UI 中运行。Unsloth Studio 让你可以在本地运行模型,支持 MacOS、Windows、Linux 以及:

安装 Unsloth
最简单的上手方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.
或者,如果你更喜欢手动安装:
MacOS、Linux、WSL:
Windows PowerShell:
安装会很快,大约需要 20 秒到 1 分钟。
搜索并下载 Qwen3.6 或 Qwen3.6 MTP
首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 Qwen3.6 或 Qwen3.6 MTP,并下载你想要的模型和量化版本。

运行 Qwen3.6
在使用 Unsloth Studio 时,推理参数应该会自动设置,但你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth Studio 推理指南。下面这个 2-bit Qwen3.6 GGUF 完成了 30+ 次工具调用,搜索了 20 个网站,并执行了 Python 代码:
⚡ MTP 指南
MTP(多 token 预测)推测解码使 Qwen3.6 等模型能够实现 约 1.4-2.2 倍更快的生成速度,且 准确度没有变化。这使得 Qwen3.6 27B 和 35B-A3B 能实现 >1.4 倍加速 ,相较于原始基线版本,这对本地模型尤其有用。
Unsloth 的 Qwen3.6 MTP GGUF 现已不再处于实验模式,且 llama.cpp 已合并 MTP 支持。可直接在 Unsloth Studio 的 UI 中或通过 llama.cpp 运行。 Qwen3.6 27B MTP 现在在 RTX 6000 GPU 上可实现 160 tokens/s 的生成速度,而 Qwen3.6 35B-A3B 可实现 240 tokens/s。 参见 Qwen3.6.
Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置经过优化的理想 MTP 参数——你之后仍然可以修改。


实际上,MTP 会预测若干未来 token,然后主模型并行验证这些 token。这减少了生成过程中所需的前向传播次数,从而使输出更快。 我们发现 --spec-draft-n-max 2 在大多数配置中效果最好。 不过,不要假设 2 就是最佳,因为性能取决于硬件。请尝试从 1 到 6 的各个值,并使用对你的系统最快的那个。
我们还 上传了 MTP GGUF 用于 Qwen3.5 模型家族 ,包括:0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B 和 397B-A17B。Llama.cpp 正在持续改进 MTP 性能,所以预计它会随着时间推移越来越快!
表:MTP 硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
27B
16 GB
19 GB
25 GB
31 GB
56 GB
35B-A3B
18 GB
24 GB
31 GB
39 GB
71 GB
🦥 Unsloth Studio MTP 指南
Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置经过优化的理想 MTP 参数——你之后仍然可以修改。
搜索并下载 Qwen3.6 MTP
首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 Qwen3.6 MTP,并下载你想要的模型和量化版本。

运行 Qwen3.6 MTP
在使用 Unsloth Studio 时,推理参数应该会自动设置,但你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth Studio 推理指南。下面这个 2-bit Qwen3.6 MTP GGUF 完成了 10+ 次工具调用,搜索了 10 个网站,并执行了 Python 代码:

🦙 Llama.cpp MTP 指南
安装最新版本的 llama.cpp 在 GitHub 上点击这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。
如果你想使用 llama.cpp 直接加载模型,你可以使用下面的方法:(:Q4_K_XL)是量化类型。你也可以通过 Hugging Face 下载(见第 3 点)。这与 ollama run 类似。使用 export LLAMA_CACHE="folder" 可强制 llama.cpp 保存到特定位置。该模型的最大上下文长度为 256K。
请根据具体模型选择以下命令之一:
MTP Qwen3.6-27B:
思考模式:
通用任务:
对于精确编程任务,改为: temperature=0.6
非思考模式:
通用任务:
MTP Qwen3.6-35B-A3B:
思考模式:
通用任务:
对于精确编程任务,改为: temperature=0.6
非思考模式:
通用任务:
你也可以通过下面的代码手动下载模型(在安装之后 pip install huggingface_hub)。你可以选择 Q4_K_M 或其他量化版本,例如 UD-Q4_K_XL 。我们建议至少使用 2-bit dynamic 量化 UD-Q2_K_XL ,以平衡体积和准确度。如果下载卡住,请参见: Hugging Face Hub、XET 调试
然后以对话模式运行模型:
🍎 MLX 动态量化
我们还为 MacOS 设备上传了 Qwen3.6 的动态 4bit 和 8bit 量化版本!我们的 MLX 量化算法仍在不断演进,我们正在积极优化任何可以改进的地方。
你可以在 Unsloth Studio!
Qwen3.6-27B MLX:
Qwen3.6-35B-A3B MLX:
试用方法:
以下是 Qwen3.6-27B 的 KL 散度(KLD)和困惑度(PPL)分数(越低越好):
⚡️NVFP4
2026年7月10日: 我们正在发布新的 动态 NVFP4 Qwen3.6 量化 运行速度约为快 2.5 倍 ,相比其他 NVFP4 量化,具有 更好的性能 且文件大小相近。运行 Qwen3.6-27B NVFP4 快 2.5 倍 在 24GB 显存 以及 Qwen3.6-35B-A3B 快 1.7 倍 在 32GB 显存。我们还添加了 FP8 KV 缓存校准 ,可将上下文长度延长 2 倍!NVFP4 需要 NVIDIA 的 Blackwell GPU,例如 RTX 50X、DGX Spark(见 Qwen3.6)、B200、B300 GPU。对于更旧的 GPU,我们的 GGUF 表现也很好!

所有基准都使用 1x B200、128 并发。更高的并发可将 35B 提升到 17,561 token/s。我们还发布了两个 35B-A3B NVFP4 版本:
Qwen3.6-35B-A3B-NVFP4-Fast 这是完整的 W4A4 量化 - 快 1.79 倍
Qwen3.6-35B-A3B-NVFP4 它稍大一些,但更准确,且快 1.56 倍
对于准确率基准,我们对 FP8、BF16、NVIDIA 的 NVFP4 以及我们的 NVFP4 进行了 MMLU-Pro、AIME 2025、GPQA 测试——结果显示我们的更快量化在所有项目上表现相近:

Qwen3.6-35B-A3B-NVFP4 (快 1.56 倍)
Qwen3.6-27B-NVFP4 (快 2.5 倍)
Qwen3.6-35B-A3B-NVFP4-Fast (快 1.79 倍)
MTP 张量也直接内置到这些量化中,以进一步提速。 准确率提升来自对 Qwen3.6 聊天模板和数据集校准的改进。我们使用之前的聊天模板更新来提升编程和工具调用的一致性,同时减少循环和其他已报告的问题。我们的校准混合了为编程、工具调用和聊天优化的数据集,并结合了 UltraChat。
对于解码速度(每人 token 数),我们的 27B 快 1.03 倍,35B 分别快 1.17 倍和 1.22 倍。

NVFP4 基准
NVFP4 直接在 Blackwell Tensor Core 上运行 4-bit 权重和矩阵乘法。我们的 Qwen3.6 NVFP4 量化使用 W4A4,因此实际上使用的是 FP4 Tensor Core,所以它们的解码速度比 NVIDIA 使用 W4A16 的方案更快。我们还动态量化各层以保持准确率,并对所有量化做了 MMLU-Pro、AIME 2025、GPQA 测试,包括与 FP8 和 BF16 的比较。
Qwen3.6-27B NVFP4 准确率基准
Unsloth
86.25
86.34
93.12
NVIDIA
85.96
86.87
93.12
FP8
86.11
86.87
93.75
BF16
85.96
88.13
93.33
Qwen3.6-35B-A3B NVFP4 准确率基准
Unsloth
85.85
86.74
92.29
Unsloth Fast
85.58
87.75
91.67
NVIDIA
85.60
87.12
91.88
FP8
85.75
86.74
93.12
BF16
85.75
86.36
92.50
我们还检查了所有基准的输出长度,它们都相近,因此新的 NVFP4 量化不会为了量化而让模型思考更久——那样就失去了量化的意义!(也就是说,如果它快 2 倍,但思考量也多 2 倍,那就没用了)

Marlin vs Flashinfer vs cutlass vs cute-DSL
我们还发现 Marlin 内核对 W4A4 的支持不佳——启用后会导致性能下降 2.5 倍——所以请使用 CUTLASS、Flashinfer-TRTLLM 或 Cute-DSL(在 vLLM 中会自动启用)!另外,如果你有 DGX Spark,请参见 Qwen3.6 你必须使用 --moe-backend flashinfer_b12x ,否则推理速度会慢 2.5 倍。
所以不要设置任何后端——让 vLLM 自动选择最佳方案。
nvidia 27B
W4A16
marlin(自动)
115.6
2,403
unsloth 27B
W4A4
marlin
105.6
2,127
unsloth 27B
W4A4
cutlass
113.5
6,681
unsloth 27B
W4A4
flashinfer_trtllm
112.6
6,158
unsloth 27B
W4A4
cute-DSL(自动)
125.9
6,863
nvidia 35B-A3B
W4A4
marlin(自动)
240.8
8,721
unsloth 35B-A3B
W4A4
marlin
215.8
8,619
unsloth 35B-A3B
W4A4
cutlass
158.3
11,017
unsloth 35B-A3B
W4A4
cute-DSL(自动)
295.2
15,636
vLLM:
要运行 NVFP4 量化,请查看下面在 vLLM 以及 SGLang 中的 Qwen3.6-27B 运行命令(你可以将模型名称改为 Qwen3.6-35-A3B-NVFP4)。另外,不要选择任何 MoE 后端——让 vLLM 自行选择——例如 Marlin 会慢 2.5 倍!参见 Marlin vs Flashinfer vs cutlass vs cute-DSL如果你有 DGX Spark,请参见 Qwen3.6 你必须使用 --moe-backend flashinfer_b12x 否则推理会慢很多。
要在单独的 venv 中安装 vLLM:
然后启动 35B Fast 版本:
将 unsloth/Qwen3.6-35B-A3B-NVFP4-Fast 改成对应的 NVFP4 量化名称!
要启用 MTP / 预测解码(解码更快,但吞吐量会稍低),请使用:
如果你遇到 Torchcodec 问题,请先执行下面命令,然后重新启动 vllm。
带 NVFP4 量化的 DGX Spark
为确保 DGX Spark 使用正确的内核(否则你会得到 快 2 倍的慢速推理),请先检查:
这不应该报错——如果报错了,请更新 vllm 或通过以下方式重新安装:
然后在 DGX Spark 上使用 vLLM 运行:
如果你遇到 Torchcodec 问题,请先执行下面命令,然后重新启动 vllm。
SGLang:
🦙 Llama.cpp 指南
在本指南中,我们将使用动态 4-bit,它在 24GB 内存 / Mac 设备上运行效果很好,可用于在 llama.cpp上进行快速推理。由于该模型在完整 F16 精度下只有大约 72GB,我们无需过多担心性能。 查看我们的 GGUF 集合.
获取最新的 llama.cpp 在 GitHub 上点击这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。
如果你想使用 llama.cpp 直接加载模型,你可以使用下面的方法:(:Q4_K_XL)是量化类型。你也可以通过 Hugging Face 下载(见第 3 点)。这与 ollama run 类似。使用 export LLAMA_CACHE="folder" 可强制 llama.cpp 保存到特定位置。该模型的最大上下文长度为 256K。
请根据具体模型选择以下命令之一:
Qwen3.6-27B:
思考模式:
通用任务:
对于精确编程任务,改为: temperature=0.6
非思考模式:
通用任务:
Qwen3.6-35B-A3B:
思考模式:
通用任务:
对于精确编程任务,改为: temperature=0.6
非思考模式:
通用任务:
你也可以通过下面的代码手动下载模型(在安装之后 pip install huggingface_hub)。你可以选择 Q4_K_M 或其他量化版本,例如 UD-Q4_K_XL 。我们建议至少使用 2-bit dynamic 量化 UD-Q2_K_XL ,以平衡体积和准确度。如果下载卡住,请参见: Hugging Face Hub、XET 调试
然后以对话模式运行模型:
💡 思考:启用/禁用 + 保留思考
Qwen3.6 还具有 保留思考 ,它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数,但可能提升继续对话时的准确率。Unsloth Studio 为 Qwen3.6 提供了“Think”和“保留思考”切换:

要启用 保留思考 在 llama.cpp 中使用(将其改为 'true' 或 'false'): 'preserve_thinking,而不是 'enable_thinking' 或 'disable_thinking'.
对于普通思考,你可以通过以下命令在 llama.cpp 中启用/禁用思考。'true' 和 'false' 可互换使用。
Linux、MacOS、WSL:
Windows / Powershell:
以 Qwen3.6-35B-A3B 为例,要启用保留思考(默认已启用):
然后在 Python 中:
👨💻 OpenAI Codex 与 Claude Code
要通过本地编码代理式工作流运行模型,你可以 参考我们的指南。使用 llama-server 就是我们刚刚设置的那个,并将模型名称设置为它在 GET /v1/models 中报告的精确 id( --alias 上面的值,例如 unsloth/Qwen3.6-35B-A3B-GGUF)。请遵循正确的 Qwen3.6 参数和使用说明。
例如,在按照 Claude Code 的说明后,你会看到:

然后我们可以比如说让它: 创建一个 Python 国际象棋游戏 :



📊 基准测试
Unsloth GGUF 基准测试
我们对各提供方的 Qwen3.6-35-A3B GGUF 做了平均 KL 散度基准测试,以帮助你选择最佳量化。
KL 散度使几乎所有 Unsloth GGUF 都位于最优的 Pareto 前沿
KLD 用于衡量量化模型与原始 BF16 输出分布的匹配程度,反映保留的准确率。
这使得 Unsloth 在 22 种尺寸中的 21 种上都表现最佳
只有 Q6_K 更新了更多动态层,并且我们引入了一个新的
UD-IQ4_NL_XL量化

MTP 基准
我们对为 27B 和 35B MoE 制作的新量化进行了基准测试。总体而言,稠密模型在使用 MTP 时的加速幅度更大(1.4-2x),而 MoE 模型为(1.15-1.25x)。
有了它,Qwen3.6 27B 现在可以用 UD-Q2_K_XL 达到 140 token/s 的生成速度,而 Qwen3.6 35B-A3B 可达到 220 token/s!部分吞吐量数据存在噪声,所以不要据此推断某些量化一定比其他量化更慢。

就平均加速而言,稠密模型在 draft tokens = 2 时可达到 1.4x,而 MoE 大约为 1.15 到 1.2x。

我们不建议使用超过 2 个 draft tokens,因为当 draft tokens 为 4 时,接受率会从 83% 骤降到 50%,而 MTP 的前向传递也会变得不那么有益。

官方 Qwen 基准
Qwen3.6-27B

Qwen3.6-35B-A3B

这些结果让取舍很简单:如果你想要内存和质量的最佳平衡,就用 Dynamic GGUF;如果你想要更快生成,就用 MTP;如果你想要在 Blackwell GPU 上获得最高吞吐量,就用 NVFP4。如果你想走最简单的路线,就在 Unsloth Studio 中运行模型并保持推荐的默认设置。
最后更新于
这有帮助吗?


