For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8 - 如何本地运行

在你的本地环境中运行包括 Qwen3.8-27B 在内的 Qwen3.8 量化模型指南。

Qwen3.8 是 Qwen 的新模型家族,包含 Qwen3.8-27B,Qwen3.8-2.4T-A95B 以及 Qwen3.8-Max。Qwen3.8-27B 具备 视觉 和推理能力,拥有 256K 上下文 窗口,并可在以下环境本地运行: 17GB RAM/VRAM 配置。Qwen3.8 在智能体编码、视觉和聊天任务方面表现出色,现在还可以通过 Unsloth GGUF、NVFP4 以及 Unsloth Desktop运行。Qwen3.8-2.4T-A95B 是一个拥有 2.4T 参数(95B 激活)的模型,可与 GPT-5.6 Sol 相媲美。

8 月 19 日更新: Qwen3.8-27B GGUF 现在使用 Unsloth Dynamic V3.0 ,在相同大小下可获得高出 10% 的准确率,整体表现大幅优于其他方案。

Qwen3.8 使用指南下载 Unsloth

感谢 Qwen 在第一时间开放访问。Unsloth 量化还包括:

  • 开发者角色支持 用于 Codex 等智能体工具

  • 已启用 MTP 用于快速推理

  • 工具调用: 改进了嵌套对象的解析,使工具更容易成功

完整精度的 Qwen3.8-2.4T-A95B 需要 4.9TB 存储和 1-bit Unsloth Dynamic GGUF 仅需 397GB(缩小 91%),而更大的 IQ1_S 需要 508GB。

在 Unsloth Desktop 中运行动态 4-bit Qwen3.8-27B

Unsloth 量化:

⚙️ 使用指南

Qwen3.8-27B 要求:

Qwen3.8-27B 4-bit 量化可在 16-19GB VRAM 上运行,例如 RTX 5080、4090,或配备 24GB RAM 的 Mac。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)

1-bit
2-bit
3-bit
4-bit
6-bit
8-bit
BF16

7-8 GB

9-11 GB

12-14 GB

16-19 GB

23-26 GB

31 GB

56 GB

如果你想使用 MTP 以获得更快的推理,请预留 1-2GB 的额外空间。

Qwen3.8-2.4T 要求:

动态 1-bit XXXS
动态 1-bit 标准版
动态 2-bit
Q8_0
BF16(无损)

397GB

508GB

657 GB

2.6 TB

4.9 TB

推荐设置

Qwen3.8-27B 设置:

Qwen3.8-27B 是一个 混合思考 模型,对思考和非思考模式有不同的默认设置。默认启用了 Extra high,因此如果你想要更短的思考轨迹,可以 调整思考强度:

参数
思考模式
Instruct(非思考)模式

temperature

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • 最大上下文窗口: 262,144 (可通过 YaRN 扩展到 1M)

  • 思考模式: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Instruct(或非思考)模式: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

Qwen3.8-2.4T 设置:

Qwen3.8-2.4T 是 仅思考,而 Qwen3.8-Max 是混合模式。

默认

temperature = 1.0

top_p = 0.95

top_k = 20

min_p = 0.0

presence_penalty = 0.0

  • 上下文长度 = 最多 1,010,000

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

如果模型能装下,在使用 B200 时,你将获得约 20 tokens/s 的生成速度和 >120 tokens/s 的吞吐量。最经验法则:RAM+VRAM ≈ 量化大小;否则它仍然可以运行,只是由于磁盘卸载会慢很多。

💡 思考 + 保留思考

Qwen3.8 具有 保留思考 功能,它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数量,但可能会提高连续对话中的准确率。 Unsloth 为 Qwen3.8 提供了“Think”和“保留思考”开关(见右侧):

Qwen3.8-27B 支持 reasoning_effort,可用于调整推理深度并控制成本。这些开关在 Unsloth 中会自动启用:

  • xhigh (默认):适用于需要深入分析的复杂任务

  • medium:平衡准确性与速度

  • low:高效推理,优化速度与成本

  • none

Qwen3.8 使用指南

现在你可以在 llama.cpp 和 Unsloth Desktop 中运行 Qwen3.8。对于大型的 Qwen3.8-2.T 模型,我们将使用 397GB IQ1_XXXS 量化(命名为 Q1_0),以在可访问性和准确性方面获得最佳结果,并且至少需要 450GB RAM。你可以随意更改量化类型。

在 Unsloth Desktop 中运行在 llama.cpp 中运行NVFP4 指南

🦥 在 Unsloth Desktop 中运行 Qwen3.8

Qwen3.8 可以在 Unsloth Desktop中运行,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM,并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台本地运行模型: MacOS、Windows、Linux 和:

1

安装 Unsloth

最简单的入门方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.

下载 Unsloth

或者,如果你更喜欢手动安装:

MacOS、Linux、WSL:

Windows PowerShell:

2

搜索并下载 Qwen3.8

前往 Unsloth Chat 或 Model hub,在搜索栏中搜索 Qwen3.8,然后下载你想要的模型和量化版本。

3

运行 Qwen3.8

使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动修改。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth 推理指南.

例如,在 Unsloth Desktop 中使用 397GB 的 Qwen3.8(缩小 91%)可以让你切换思考模式、启用内联画布、网页搜索和代码执行等更多功能。

在 Unsloth Desktop 中运行 Qwen3.8 2.4T 的动态 1-bit 397GB 91% 缩小版 GGUF
4

通过 Unsloth API 提供 Qwen3.8 服务

你可以使用 unsloth run 命令,并通过以下方式提供 Qwen3.8 的 API 服务: llama-server 运行时标志,包括上下文大小、GPU 层数、线程、采样、网络和工具配置。更多信息请参见我们的 API 文档unsloth start.

5

Unsloth 现在已准备就绪

你还可以通过 Unsloth Desktop 用 Qwen3.8 做很多其他事情,例如:

Qwen3.8-2.4T-A95B 新的 1-bit 数据类型

我们将 llama.cpp 中的 IQ1_S 扩展到每个权重 1.5625 位,并通过减少 codebook 中的条目数将其提升到 1.1875 bpw——我们发现这对大型模型效果很好,并且仍能保留大量准确率——我们还发现这些新的数据类型适用于训练后的量化(PTQ),无需 QAT 或 QAD(量化感知训练 / 蒸馏)。 Qwen3.8-2.4T-A95B-GGUF

由于命名问题,我们使用了 TQ2_0、TQ1_0 和 Q1_0,否则它不会在 HF 仓库中显示。

数据类型
命名
BPW
# 条目
索引位

IQ1_S

IQ1_S

1.5625

2048

11

50 B

UD-IQ1_XS

TQ2_0

1.4375

1024

10

46 B

UD-IQ1_XXS

TQ1_0

1.3125

512

9

42 B

UD-IQ1_XXXS

Q1_0

1.1875

256

8

38 B

我们仍在对新的数据类型进行基准测试,但对于其他大型模型,我们得到了 无需任何 QAT / QAD 的良好结果:

数据类型
GiB
PPL
KLD
top-p

IQ1_S

553.204

2.578876

0.564553

78.882

UD-IQ1_XS

513.583

2.931261

0.690161

75.726

UD-IQ1_XXS

473.961

3.540383

0.876007

71.284

UD-IQ1_XXXS

434.340

4.488796

1.109944

66.257

🦙 在 llama.cpp 中运行 Qwen3.8

1

我们需要使用特定的 IQ1_XXXS 分支 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后按常规继续——Metal 支持默认开启。

2

如果你只是想运行标准的 IQ1_S 以及其他量化版本,那么请按常规编译 llama.cpp:

3

通过以下方式下载模型(在安装后 pip install huggingface_hub)。你可以选择 Q1_0 用于 IQ1_XXXS ,或者其他量化版本,例如 Q8_0 。如果下载卡住,请参见: Hugging Face Hub、XET 调试

Qwen3.8-27B:

Qwen3.8-2.4T:

4

要在 llama-cli 中运行该模型,请按照下面的代码片段执行: 记得 根据你的使用场景更改设置

Qwen3.8-27B:

Qwen3.8-2.4T:

5

要运行通用的 UD-IQ1_S,你可以这样做:

Qwen3.8-2.4T:

6

然后运行它:

⚡️NVFP4

像 Qwen3.6 一样,我们也发布了新的 动态 NVFP4 Qwen3.8-27B 量化版本,可运行 快约 1.5× 相比 BF16 检查点,并且 性能更好 且文件大小相近。运行 Qwen3.8-27B NVFP4 快 1.5 倍 24GB 显存。 我们还添加了 FP8 KV 缓存校准 以实现长 2 倍的上下文长度!NVFP4 需要 NVIDIA 的 Blackwell GPU,例如 RTX 50X、DGX Spark(见 Qwen3.8-27B)、B200、B300 GPU。对于更老的 GPU,我们的 GGUF 也很好用!你现在可以在 vLLM 中运行 NVFP4 量化版本,但目前仅限于此(不支持 SGLang)。

批次
BF16 总 tok/s
NVFP4 总 tok/s
加速比
BF16 单用户
NVFP4 单用户

1

89.8

133.7

1.49x

89.8

133.7

8

649.4

938.8

1.45x

81.2

117.3

32

1983.0

2787.0

1.41x

62.0

87.1

64

3048.5

4407.2

1.45x

47.6

68.9

下面还可以查看之前为 Qwen3.6 进行的基准测试,这些测试也对比了其他 NVFP4 实现,它们使用 16 位激活值,而我们的 NVFP4 使用的是激活值:

所有基准测试都使用 1x B200,128 并发。更高并发可将 35B 提升到 17,561 tokens / s。

对于准确率基准测试,我们在代码、聊天和多个领域上运行了 KLD 以及 Top-1% 一致率。与 BF16 相比,NVFP4 的准确率恢复稳定在 92% 到 97%。

语料
KLD 均值
top-1 一致率

中文

0.01628

93.55%

代码

0.02600

96.68%

参考生成

0.03993

94.46%

聊天

0.05818

92.15%

日 / 韩 / 俄 / 西

0.0124-0.0155

94-95%

对于 Qwen 3.6 的准确率基准测试,我们对 FP8、BF16、NVIDIA 的 NVFP4 以及我们的 NVFP4s 进行了 MMLU-Pro、AIME 2025、GPQA 测试——我们展示的更快量化版本在所有项目上表现都相近:

更多信息,请阅读我们的 动态 NVFP4 量化博客.

要运行 NVFP4 量化版本,请见下方在 Qwen3.8-27B 中运行的命令, vLLMSGLang:

vLLM:

要在单独的虚拟环境中安装 vLLM:

然后提供 27B 变体:

要启用 MTP / 推测解码(解码更快,但吞吐量会稍低),请使用:

如果遇到 Torchcodec 问题,请先执行下面步骤,然后重新启动 vllm。

SGLang:

如果使用 SGLang,你必须使用 SGLang 版本 v0.5.19 否则将无法工作,因为我们将 lm_head 量化为 FP8。

vLLM 有一个 CompressedTensorsW8A8Fp8 内核支持这一点,而 SGLang v0.5.19 无法加载 FP8 lm_head。v0.5.19 现在可以用了!

对于 sglang,在安装最新版本后:

然后可以部署它:

要启用 MTP,请使用:

🤯量化分析

NVFP4 量化版本比 BF16 快 1.5 倍,并保留 92% 到 97% 的 top-1% 准确率。

我们使用了 Dynamic 3.0 GGUFs 使 Qwen3.8-27B 大幅提升!

如 UD-3 中所示的 Qwen3.8-27B 的 Top-1% 准确率图:

以及 Qwen3.8 的平均 KLD:

📊 基准测试

对于 GGUF 量化基准测试,你可以在上方查看我们的 量化分析动态 V3.0 文章.

Qwen3.8-27B

表格基准测试请见下方:

文本性能

基准
Qwen3.8-27B
Qwen3.6-27B
Qwen3.7-Plus
Muse Glimmer-30B
Opus4.6 Max

编程

代理式终端编程 Terminal Bench 2.1 (Terminus)

73.0

63.4

64.0

51.7

78.2

代理式编程 SWE-bench Pro

61.7

53.5

57.6

51.2

53.4

仓库级代码生成 NL2Repo-Bench

42.3

36.2

41.1

--

47.6

代理式编程 DeepSWE 1.1

42.2

13.3

14.2

--

--

软件工程 QwenSWEBench

79.0

49.3

59.2

--

63.8

代理

长周期办公工作 CoWorkBench

70.7

61.0

65.1

--

68.2

专业工作任务 JobBench

33.4

21.8

27.6

--

--

前沿代理任务 Agents' Last Exam

Pass@120.4分数42.9

Pass@1 10.6 分数 27.3

Pass@1 13.2 分数 33.6

--

--

通用

指令遵循 IFBench

79.5

69.1

79.1

77.0

62.5

科学推理 GPQA Diamond

89.2

87.8

90.3

83.5

91.3

多学科推理 HLE

30.8

24.0

34.7

22.0

40.0

竞技编程 LiveCodeBench v6

90.3

83.9

89.6

--

88.8

Qwen3.8-2.4T-A95B

最后更新于

这有帮助吗?