For the complete documentation index, see llms.txt. This page is also available as Markdown.

💜Qwen3.6:如何本地运行

在本地运行新的 Qwen3.6-27B 和 35B-A3B 模型!

Qwen3.6 是阿里巴巴全新一代多模态混合思维模型家族,包括: Qwen3.6-27B 以及 35B-A3B。它在自身规模内提供顶尖性能,支持覆盖 201 种语言的 256K 上下文。它在智能体编程、视觉、聊天任务方面表现出色。Qwen3.6-27B 可在 18GB RAM 的配置上运行,而 35B-A3B 可在 22GB上运行。你现在可以在 Unsloth Desktop.

运行 Qwen3.6 教程MTP 指南

Qwen3.6 GGUF 使用 Unsloth Dynamic 2.0 以实现业界领先的量化性能——因此量化版本会在真实使用场景数据集上进行校准,并对重要层进行上浮精度处理。 感谢 Qwen 在发布首日提供访问权限。

  • 开发者角色支持 ,适用于 Codex、OpenCode 等: 我们的上传现在支持 开发者角色 ,用于智能体编程工具。

  • 工具调用:Qwen3.5一样,我们改进了对嵌套对象的解析,使工具调用更容易成功。

运行中的 Qwen3.6 Unsloth Studio.

⚙️ 使用指南

表:推理硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)

Qwen3.6
3 位
4 位
6 位
8 位
BF16

27B

15 GB

18 GB

24 GB

30 GB

55 GB

35B-A3B

17 GB

23 GB

30 GB

38 GB

70 GB

要训练 Qwen3.6,你可以参考我们之前的 Qwen3.5 微调指南.

推荐设置

  • 最大上下文窗口: 262,144 (可通过 YaRN 扩展到 1M)

  • presence_penalty = 0.0 到 2.0 默认情况下这是关闭的,但为了减少重复,你可以使用它,不过使用更高的值可能会导致 性能略有下降

  • 足够的输出长度: 32,768 个 token,适用于大多数查询

如果你看到的是乱码,你的上下文长度可能设置得太低。或者尝试使用 --cache-type-k bf16 --cache-type-v bf16 ,这可能会有帮助。

由于 Qwen3.6 是混合推理,思考模式和非思考模式的设置不同:

思考模式:

通用任务
精确编程任务(例如 WebDev)

temperature = 1.0

temperature = 0.6

top_p = 0.95

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 0.0

presence_penalty = 0.0

repeat_penalty = 已禁用或 1.0

repeat_penalty = 已禁用或 1.0

通用任务的思考模式:

精确编程任务的思考模式:

指令(非思考)模式设置:

通用任务

temperature = 0.7

top_p = 0.8

top_k = 20

min_p = 0.0

presence_penalty = 1.5

repeat_penalty = 已禁用或 1.0

通用任务的指令(非思考)模式:

Qwen3.6 推理教程:

我们将使用 Dynamic 4-bit UD-Q4_K_XL GGUF 变体进行推理工作负载。点击下方以跳转到指定模型说明:

在 Unsloth Desktop 中运行在 llama.cpp 中运行MTP 指南NVFP4 指南

🦥 Unsloth 指南

Qwen3.6 和 Qwen3.6 MTP 现在可以在 Unsloth Desktop、 我们的全新本地 AI 开源 UI 中运行。Unsloth Studio 让你可以在本地运行模型,支持 MacOS、Windows、Linux 以及:

1

安装 Unsloth

最简单的上手方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.

下载 Unsloth

或者,如果你更喜欢手动安装:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中。

通过 HTTPS 和 Cloudflare 安全启动 Unsloth

新! Unsloth 现在提供一种通过免费的 Cloudflare 隧道,以 HTTPS 方式安全启动 Unsloth 的方法。使用下面的命令(适用于 Windows、Mac 和 Linux):

3

搜索并下载 Qwen3.6 或 Qwen3.6 MTP

首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 Qwen3.6 或 Qwen3.6 MTP,并下载你想要的模型和量化版本。

4

运行 Qwen3.6

在使用 Unsloth Studio 时,推理参数应该会自动设置,但你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth Studio 推理指南。下面这个 2-bit Qwen3.6 GGUF 完成了 30+ 次工具调用,搜索了 20 个网站,并执行了 Python 代码:

⚡ MTP 指南

MTP(多 token 预测)推测解码使 Qwen3.6 等模型能够实现 约 1.4-2.2 倍更快的生成速度,且 准确度没有变化。这使得 Qwen3.6 27B 和 35B-A3B 能实现 >1.4 倍加速 ,相较于原始基线版本,这对本地模型尤其有用。

Unsloth 的 Qwen3.6 MTP GGUF 现已不再处于实验模式,且 llama.cpp 已合并 MTP 支持。可直接在 Unsloth Studio 的 UI 中或通过 llama.cpp 运行。 Qwen3.6 27B MTP 现在在 RTX 6000 GPU 上可实现 160 tokens/s 的生成速度,而 Qwen3.6 35B-A3B 可实现 240 tokens/s。 参见 Qwen3.6.

Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置经过优化的理想 MTP 参数——你之后仍然可以修改。

MTP 比标准 GGUF 使用略多一些 VRAM,因此请预留大约 1 GB 的额外 RAM/VRAM 空间。

在 Unsloth Studio 中运行在 llama.cpp 中运行运行 NVFP4

实际上,MTP 会预测若干未来 token,然后主模型并行验证这些 token。这减少了生成过程中所需的前向传播次数,从而使输出更快。 我们发现 --spec-draft-n-max 2 在大多数配置中效果最好。 不过,不要假设 2 就是最佳,因为性能取决于硬件。请尝试从 16 的各个值,并使用对你的系统最快的那个。

我们还 上传了 MTP GGUF 用于 Qwen3.5 模型家族 ,包括:0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B 和 397B-A17B。Llama.cpp 正在持续改进 MTP 性能,所以预计它会随着时间推移越来越快!

表:MTP 硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)

Qwen3.6
3 位
4 位
6 位
8 位
BF16

27B

16 GB

19 GB

25 GB

31 GB

56 GB

35B-A3B

18 GB

24 GB

31 GB

39 GB

71 GB

🦥 Unsloth Studio MTP 指南

Unsloth Studio 会自动为你的特定硬件(Mac、CPU、GPU 等)设置经过优化的理想 MTP 参数——你之后仍然可以修改。

1

安装 Unsloth

在你的终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中。

3

搜索并下载 Qwen3.6 MTP

首次启动时,你需要创建一个密码来保护你的账户,并在之后再次登录。然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 Qwen3.6 MTP,并下载你想要的模型和量化版本。

4

运行 Qwen3.6 MTP

在使用 Unsloth Studio 时,推理参数应该会自动设置,但你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth Studio 推理指南。下面这个 2-bit Qwen3.6 MTP GGUF 完成了 10+ 次工具调用,搜索了 10 个网站,并执行了 Python 代码:

🦙 Llama.cpp MTP 指南

1

安装最新版本的 llama.cppGitHub 上点击这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。

2

如果你想使用 llama.cpp 直接加载模型,你可以使用下面的方法:(:Q4_K_XL)是量化类型。你也可以通过 Hugging Face 下载(见第 3 点)。这与 ollama run 类似。使用 export LLAMA_CACHE="folder" 可强制 llama.cpp 保存到特定位置。该模型的最大上下文长度为 256K。

请根据具体模型选择以下命令之一:

27B MTP35-A3B MTP

MTP Qwen3.6-27B:

思考模式:

请查看 Qwen3.6 新的 保留思考.

通用任务:

对于精确编程任务,改为: temperature=0.6

非思考模式:

通用任务:

MTP Qwen3.6-35B-A3B:

思考模式:

请查看 Qwen3.6 新的 保留思考.

通用任务:

对于精确编程任务,改为: temperature=0.6

非思考模式:

通用任务:

3

你也可以通过下面的代码手动下载模型(在安装之后 pip install huggingface_hub)。你可以选择 Q4_K_M 或其他量化版本,例如 UD-Q4_K_XL 。我们建议至少使用 2-bit dynamic 量化 UD-Q2_K_XL ,以平衡体积和准确度。如果下载卡住,请参见: Hugging Face Hub、XET 调试

4

然后以对话模式运行模型:

🍎 MLX 动态量化

我们还为 MacOS 设备上传了 Qwen3.6 的动态 4bit 和 8bit 量化版本!我们的 MLX 量化算法仍在不断演进,我们正在积极优化任何可以改进的地方。

你可以在 Unsloth Studio!

Qwen3.6-27B MLX:

Qwen3.6-35B-A3B MLX:

试用方法:

以下是 Qwen3.6-27B 的 KL 散度(KLD)和困惑度(PPL)分数(越低越好):

模型
平均 KLD
中位数 KLD
PPL
P90 KLD
P99.9 KLD
大小

0.0028

0.0003

4.812

0.0019

0.192

34.7 GB

0.0037

0.0007

4.809

0.0032

0.343

30.5 GB

0.0227

0.0053

4.821

0.0293

2.339

26.2 GB

0.0325

0.0087

4.843

0.0466

3.693

26.2 GB

0.0479

0.0153

4.902

0.0769

4.035

25.6 GB

0.0734

0.0223

4.976

0.1261

5.529

24.1 GB

⚡️NVFP4

2026年7月10日: 我们正在发布新的 动态 NVFP4 Qwen3.6 量化 运行速度约为快 2.5 倍 ,相比其他 NVFP4 量化,具有 更好的性能 且文件大小相近。运行 Qwen3.6-27B NVFP4 快 2.5 倍 24GB 显存 以及 Qwen3.6-35B-A3B 快 1.7 倍 32GB 显存。我们还添加了 FP8 KV 缓存校准 ,可将上下文长度延长 2 倍!NVFP4 需要 NVIDIA 的 Blackwell GPU,例如 RTX 50X、DGX Spark(见 Qwen3.6)、B200、B300 GPU。对于更旧的 GPU,我们的 GGUF 表现也很好!

所有基准都使用 1x B200、128 并发。更高的并发可将 35B 提升到 17,561 token/s。我们还发布了两个 35B-A3B NVFP4 版本:

对于准确率基准,我们对 FP8、BF16、NVIDIA 的 NVFP4 以及我们的 NVFP4 进行了 MMLU-Pro、AIME 2025、GPQA 测试——结果显示我们的更快量化在所有项目上表现相近:

Qwen3.6-35B-A3B
Qwen3.6-27B

Qwen3.6-35B-A3B-NVFP4 (快 1.56 倍)

Qwen3.6-27B-NVFP4 (快 2.5 倍)

Qwen3.6-35B-A3B-NVFP4-Fast (快 1.79 倍)

MTP 张量也直接内置到这些量化中,以进一步提速。 准确率提升来自对 Qwen3.6 聊天模板和数据集校准的改进。我们使用之前的聊天模板更新来提升编程和工具调用的一致性,同时减少循环和其他已报告的问题。我们的校准混合了为编程、工具调用和聊天优化的数据集,并结合了 UltraChat。

对于解码速度(每人 token 数),我们的 27B 快 1.03 倍,35B 分别快 1.17 倍和 1.22 倍。

NVFP4 基准

NVFP4 直接在 Blackwell Tensor Core 上运行 4-bit 权重和矩阵乘法。我们的 Qwen3.6 NVFP4 量化使用 W4A4,因此实际上使用的是 FP4 Tensor Core,所以它们的解码速度比 NVIDIA 使用 W4A16 的方案更快。我们还动态量化各层以保持准确率,并对所有量化做了 MMLU-Pro、AIME 2025、GPQA 测试,包括与 FP8 和 BF16 的比较。

Qwen3.6-27B NVFP4 准确率基准

提供方
MMLU-Pro
GPQA
AIME 2025

Unsloth

86.25

86.34

93.12

NVIDIA

85.96

86.87

93.12

FP8

86.11

86.87

93.75

BF16

85.96

88.13

93.33

Qwen3.6-35B-A3B NVFP4 准确率基准

提供方
MMLU-Pro
GPQA
AIME 2025

Unsloth

85.85

86.74

92.29

Unsloth Fast

85.58

87.75

91.67

NVIDIA

85.60

87.12

91.88

FP8

85.75

86.74

93.12

BF16

85.75

86.36

92.50

我们还检查了所有基准的输出长度,它们都相近,因此新的 NVFP4 量化不会为了量化而让模型思考更久——那样就失去了量化的意义!(也就是说,如果它快 2 倍,但思考量也多 2 倍,那就没用了)

Marlin vs Flashinfer vs cutlass vs cute-DSL

我们还发现 Marlin 内核对 W4A4 的支持不佳——启用后会导致性能下降 2.5 倍——所以请使用 CUTLASS、Flashinfer-TRTLLM 或 Cute-DSL(在 vLLM 中会自动启用)!另外,如果你有 DGX Spark,请参见 Qwen3.6 你必须使用 --moe-backend flashinfer_b12x ,否则推理速度会慢 2.5 倍。

所以不要设置任何后端——让 vLLM 自动选择最佳方案。

模型
方案
后端
解码 tok/s
吞吐 tok/s

nvidia 27B

W4A16

marlin(自动)

115.6

2,403

unsloth 27B

W4A4

marlin

105.6

2,127

unsloth 27B

W4A4

cutlass

113.5

6,681

unsloth 27B

W4A4

flashinfer_trtllm

112.6

6,158

unsloth 27B

W4A4

cute-DSL(自动)

125.9

6,863

nvidia 35B-A3B

W4A4

marlin(自动)

240.8

8,721

unsloth 35B-A3B

W4A4

marlin

215.8

8,619

unsloth 35B-A3B

W4A4

cutlass

158.3

11,017

unsloth 35B-A3B

W4A4

cute-DSL(自动)

295.2

15,636

vLLM:

要运行 NVFP4 量化,请查看下面在 vLLM 以及 SGLang 中的 Qwen3.6-27B 运行命令(你可以将模型名称改为 Qwen3.6-35-A3B-NVFP4)。另外,不要选择任何 MoE 后端——让 vLLM 自行选择——例如 Marlin 会慢 2.5 倍!参见 Marlin vs Flashinfer vs cutlass vs cute-DSL如果你有 DGX Spark,请参见 Qwen3.6 你必须使用 --moe-backend flashinfer_b12x 否则推理会慢很多。

要在单独的 venv 中安装 vLLM:

然后启动 35B Fast 版本:

unsloth/Qwen3.6-35B-A3B-NVFP4-Fast 改成对应的 NVFP4 量化名称!

要启用 MTP / 预测解码(解码更快,但吞吐量会稍低),请使用:

如果你遇到 Torchcodec 问题,请先执行下面命令,然后重新启动 vllm。

带 NVFP4 量化的 DGX Spark

为确保 DGX Spark 使用正确的内核(否则你会得到 快 2 倍的慢速推理),请先检查:

这不应该报错——如果报错了,请更新 vllm 或通过以下方式重新安装:

然后在 DGX Spark 上使用 vLLM 运行:

如果你遇到 Torchcodec 问题,请先执行下面命令,然后重新启动 vllm。

SGLang:

🦙 Llama.cpp 指南

在本指南中,我们将使用动态 4-bit,它在 24GB 内存 / Mac 设备上运行效果很好,可用于在 llama.cpp上进行快速推理。由于该模型在完整 F16 精度下只有大约 72GB,我们无需过多担心性能。 查看我们的 GGUF 集合.

27B35-A3B

1

获取最新的 llama.cpp GitHub 上点击这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。

2

如果你想使用 llama.cpp 直接加载模型,你可以使用下面的方法:(:Q4_K_XL)是量化类型。你也可以通过 Hugging Face 下载(见第 3 点)。这与 ollama run 类似。使用 export LLAMA_CACHE="folder" 可强制 llama.cpp 保存到特定位置。该模型的最大上下文长度为 256K。

请根据具体模型选择以下命令之一:

27B35-A3B

Qwen3.6-27B:

思考模式:

请查看 Qwen3.6 新的 保留思考.

通用任务:

对于精确编程任务,改为: temperature=0.6

非思考模式:

通用任务:

Qwen3.6-35B-A3B:

思考模式:

请查看 Qwen3.6 新的 保留思考.

通用任务:

对于精确编程任务,改为: temperature=0.6

非思考模式:

通用任务:

3

你也可以通过下面的代码手动下载模型(在安装之后 pip install huggingface_hub)。你可以选择 Q4_K_M 或其他量化版本,例如 UD-Q4_K_XL 。我们建议至少使用 2-bit dynamic 量化 UD-Q2_K_XL ,以平衡体积和准确度。如果下载卡住,请参见: Hugging Face Hub、XET 调试

4

然后以对话模式运行模型:

💡 思考:启用/禁用 + 保留思考

Qwen3.6 还具有 保留思考 ,它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数,但可能提升继续对话时的准确率。Unsloth Studio 为 Qwen3.6 提供了“Think”和“保留思考”切换:

Unsloth Studio 默认启用 Think 开关,并提供一个新的 保留思考 切换

要启用 保留思考 在 llama.cpp 中使用(将其改为 'true' 或 'false'): 'preserve_thinking,而不是 'enable_thinking' 或 'disable_thinking'.

对于普通思考,你可以通过以下命令在 llama.cpp 中启用/禁用思考。'true' 和 'false' 可互换使用。

llama-server 操作系统:
启用思考
禁用思考

Linux、MacOS、WSL:

Windows / Powershell:

以 Qwen3.6-35B-A3B 为例,要启用保留思考(默认已启用):

然后在 Python 中:

👨‍💻 OpenAI Codex 与 Claude Code

要通过本地编码代理式工作流运行模型,你可以 参考我们的指南。使用 llama-server 就是我们刚刚设置的那个,并将模型名称设置为它在 GET /v1/models 中报告的精确 id( --alias 上面的值,例如 unsloth/Qwen3.6-35B-A3B-GGUF)。请遵循正确的 Qwen3.6 参数和使用说明。

例如,在按照 Claude Code 的说明后,你会看到:

然后我们可以比如说让它: 创建一个 Python 国际象棋游戏 :

📊 基准测试

Unsloth GGUF 基准测试

我们对各提供方的 Qwen3.6-35-A3B GGUF 做了平均 KL 散度基准测试,以帮助你选择最佳量化。

  • KL 散度使几乎所有 Unsloth GGUF 都位于最优的 Pareto 前沿

  • KLD 用于衡量量化模型与原始 BF16 输出分布的匹配程度,反映保留的准确率。

  • 这使得 Unsloth 在 22 种尺寸中的 21 种上都表现最佳

  • 只有 Q6_K 更新了更多动态层,并且我们引入了一个新的 UD-IQ4_NL_XL 量化

35B-A3B - KLD 基准(越低越好)

MTP 基准

我们对为 27B 和 35B MoE 制作的新量化进行了基准测试。总体而言,稠密模型在使用 MTP 时的加速幅度更大(1.4-2x),而 MoE 模型为(1.15-1.25x)。

有了它,Qwen3.6 27B 现在可以用 UD-Q2_K_XL 达到 140 token/s 的生成速度,而 Qwen3.6 35B-A3B 可达到 220 token/s!部分吞吐量数据存在噪声,所以不要据此推断某些量化一定比其他量化更慢。

就平均加速而言,稠密模型在 draft tokens = 2 时可达到 1.4x,而 MoE 大约为 1.15 到 1.2x。

我们不建议使用超过 2 个 draft tokens,因为当 draft tokens 为 4 时,接受率会从 83% 骤降到 50%,而 MTP 的前向传递也会变得不那么有益。

官方 Qwen 基准

Qwen3.6-27B

Qwen3.6-35B-A3B

这些结果让取舍很简单:如果你想要内存和质量的最佳平衡,就用 Dynamic GGUF;如果你想要更快生成,就用 MTP;如果你想要在 Blackwell GPU 上获得最高吞吐量,就用 NVFP4。如果你想走最简单的路线,就在 Unsloth Studio 中运行模型并保持推荐的默认设置。

最后更新于

这有帮助吗?