Qwen3.8 - 如何本地运行
在你的本地环境中运行包括 Qwen3.8-27B 在内的 Qwen3.8 量化模型指南。
Qwen3.8 是 Qwen 的新模型家族,包含 Qwen3.8-27B,Qwen3.8-2.4T-A95B 以及 Qwen3.8-Max。Qwen3.8-27B 具备 视觉 和推理能力,拥有 256K 上下文 窗口,并可在以下环境本地运行: 17GB RAM/VRAM 配置。Qwen3.8 在智能体编码、视觉和聊天任务方面表现出色,现在还可以通过 Unsloth GGUF、NVFP4 以及 Unsloth Desktop运行。Qwen3.8-2.4T-A95B 是一个拥有 2.4T 参数(95B 激活)的模型,可与 GPT-5.6 Sol 相媲美。
8 月 19 日更新: Qwen3.8-27B GGUF 现在使用 Unsloth Dynamic V3.0 ,在相同大小下可获得高出 10% 的准确率,整体表现大幅优于其他方案。
⚙️ 使用指南
Qwen3.8-27B 要求:
Qwen3.8-27B 4-bit 量化可在 16-19GB VRAM 上运行,例如 RTX 5080、4090,或配备 24GB RAM 的 Mac。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)
7-8 GB
9-11 GB
12-14 GB
16-19 GB
23-26 GB
31 GB
56 GB
Qwen3.8-2.4T 要求:
397GB
508GB
657 GB
2.6 TB
4.9 TB
推荐设置
Qwen3.8-27B 设置:
Qwen3.8-27B 是一个 混合思考 模型,对思考和非思考模式有不同的默认设置。默认启用了 Extra high,因此如果你想要更短的思考轨迹,可以 调整思考强度:
temperature
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
最大上下文窗口:
262,144(可通过 YaRN 扩展到 1M)思考模式:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct(或非思考)模式:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
Qwen3.8-2.4T 设置:
Qwen3.8-2.4T 是 仅思考,而 Qwen3.8-Max 是混合模式。
temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
presence_penalty = 0.0
上下文长度 = 最多
1,010,000temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
如果模型能装下,在使用 B200 时,你将获得约 20 tokens/s 的生成速度和 >120 tokens/s 的吞吐量。最经验法则:RAM+VRAM ≈ 量化大小;否则它仍然可以运行,只是由于磁盘卸载会慢很多。
💡 思考 + 保留思考
Qwen3.8 具有 保留思考 功能,它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数量,但可能会提高连续对话中的准确率。 Unsloth 为 Qwen3.8 提供了“Think”和“保留思考”开关(见右侧):

Qwen3.8-27B 支持 reasoning_effort,可用于调整推理深度并控制成本。这些开关在 Unsloth 中会自动启用:
xhigh(默认):适用于需要深入分析的复杂任务medium:平衡准确性与速度low:高效推理,优化速度与成本none
要更改 思考 / 推理 强度,在 unsloth run 或 llama-server中,使用 --chat-template-kwargs '{"reasoning_effort":"medium"}'
如果你在 Windows Powershell 中,请使用: --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
更改 medium 为你想要的推理级别。
Qwen3.8 使用指南
现在你可以在 llama.cpp 和 Unsloth Desktop 中运行 Qwen3.8。对于大型的 Qwen3.8-2.T 模型,我们将使用 397GB IQ1_XXXS 量化(命名为 Q1_0),以在可访问性和准确性方面获得最佳结果,并且至少需要 450GB RAM。你可以随意更改量化类型。
Hugging Face: Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
ModelScope: Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
2.4T-A95B: Qwen3.8-2.4T-A95B-GGUF
🦥 在 Unsloth Desktop 中运行 Qwen3.8
Qwen3.8 可以在 Unsloth Desktop中运行,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM,并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台本地运行模型: MacOS、Windows、Linux 和:

安装 Unsloth
最简单的入门方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.
或者,如果你更喜欢手动安装:
MacOS、Linux、WSL:
Windows PowerShell:
运行 Qwen3.8
使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动修改。你也可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth 推理指南.
例如,在 Unsloth Desktop 中使用 397GB 的 Qwen3.8(缩小 91%)可以让你切换思考模式、启用内联画布、网页搜索和代码执行等更多功能。

通过 Unsloth API 提供 Qwen3.8 服务
你可以使用 unsloth run 命令,并通过以下方式提供 Qwen3.8 的 API 服务: llama-server 运行时标志,包括上下文大小、GPU 层数、线程、采样、网络和工具配置。更多信息请参见我们的 API 文档 或 unsloth start.
Qwen3.8-2.4T-A95B 新的 1-bit 数据类型
我们将 llama.cpp 中的 IQ1_S 扩展到每个权重 1.5625 位,并通过减少 codebook 中的条目数将其提升到 1.1875 bpw——我们发现这对大型模型效果很好,并且仍能保留大量准确率——我们还发现这些新的数据类型适用于训练后的量化(PTQ),无需 QAT 或 QAD(量化感知训练 / 蒸馏)。 Qwen3.8-2.4T-A95B-GGUF
由于命名问题,我们使用了 TQ2_0、TQ1_0 和 Q1_0,否则它不会在 HF 仓库中显示。
IQ1_S
IQ1_S
1.5625
2048
11
50 B
UD-IQ1_XS
TQ2_0
1.4375
1024
10
46 B
UD-IQ1_XXS
TQ1_0
1.3125
512
9
42 B
UD-IQ1_XXXS
Q1_0
1.1875
256
8
38 B
我们仍在对新的数据类型进行基准测试,但对于其他大型模型,我们得到了 无需任何 QAT / QAD 的良好结果:
IQ1_S
553.204
2.578876
0.564553
78.882
UD-IQ1_XS
513.583
2.931261
0.690161
75.726
UD-IQ1_XXS
473.961
3.540383
0.876007
71.284
UD-IQ1_XXXS
434.340
4.488796
1.109944
66.257
🦙 在 llama.cpp 中运行 Qwen3.8
我们需要使用特定的 IQ1_XXXS 分支 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后按常规继续——Metal 支持默认开启。
如果你只是想运行标准的 IQ1_S 以及其他量化版本,那么请按常规编译 llama.cpp:
通过以下方式下载模型(在安装后 pip install huggingface_hub)。你可以选择 Q1_0 用于 IQ1_XXXS ,或者其他量化版本,例如 Q8_0 。如果下载卡住,请参见: Hugging Face Hub、XET 调试
Qwen3.8-27B:
Qwen3.8-2.4T:
要运行通用的 UD-IQ1_S,你可以这样做:
Qwen3.8-2.4T:
然后运行它:
⚡️NVFP4
像 Qwen3.6 一样,我们也发布了新的 动态 NVFP4 Qwen3.8-27B 量化版本,可运行 快约 1.5× 相比 BF16 检查点,并且 性能更好 且文件大小相近。运行 Qwen3.8-27B NVFP4 快 1.5 倍 在 24GB 显存。 我们还添加了 FP8 KV 缓存校准 以实现长 2 倍的上下文长度!NVFP4 需要 NVIDIA 的 Blackwell GPU,例如 RTX 50X、DGX Spark(见 Qwen3.8-27B)、B200、B300 GPU。对于更老的 GPU,我们的 GGUF 也很好用!你现在可以在 vLLM 中运行 NVFP4 量化版本,但目前仅限于此(不支持 SGLang)。
1
89.8
133.7
1.49x
89.8
133.7
8
649.4
938.8
1.45x
81.2
117.3
32
1983.0
2787.0
1.41x
62.0
87.1
64
3048.5
4407.2
1.45x
47.6
68.9
下面还可以查看之前为 Qwen3.6 进行的基准测试,这些测试也对比了其他 NVFP4 实现,它们使用 16 位激活值,而我们的 NVFP4 使用的是激活值:

所有基准测试都使用 1x B200,128 并发。更高并发可将 35B 提升到 17,561 tokens / s。
对于准确率基准测试,我们在代码、聊天和多个领域上运行了 KLD 以及 Top-1% 一致率。与 BF16 相比,NVFP4 的准确率恢复稳定在 92% 到 97%。
中文
0.01628
93.55%
代码
0.02600
96.68%
参考生成
0.03993
94.46%
聊天
0.05818
92.15%
日 / 韩 / 俄 / 西
0.0124-0.0155
94-95%
对于 Qwen 3.6 的准确率基准测试,我们对 FP8、BF16、NVIDIA 的 NVFP4 以及我们的 NVFP4s 进行了 MMLU-Pro、AIME 2025、GPQA 测试——我们展示的更快量化版本在所有项目上表现都相近:

更多信息,请阅读我们的 动态 NVFP4 量化博客.
要运行 NVFP4 量化版本,请见下方在 Qwen3.8-27B 中运行的命令, vLLM 或 SGLang:
vLLM:
要在单独的虚拟环境中安装 vLLM:
然后提供 27B 变体:
要启用 MTP / 推测解码(解码更快,但吞吐量会稍低),请使用:
如果遇到 Torchcodec 问题,请先执行下面步骤,然后重新启动 vllm。
SGLang:
如果使用 SGLang,你必须使用 SGLang 版本 v0.5.19 否则将无法工作,因为我们将 lm_head 量化为 FP8。
对于 sglang,在安装最新版本后:
然后可以部署它:
要启用 MTP,请使用:
🤯量化分析
NVFP4 量化版本比 BF16 快 1.5 倍,并保留 92% 到 97% 的 top-1% 准确率。
我们使用了 Dynamic 3.0 GGUFs 使 Qwen3.8-27B 大幅提升!
如 UD-3 中所示的 Qwen3.8-27B 的 Top-1% 准确率图:

以及 Qwen3.8 的平均 KLD:

📊 基准测试
对于 GGUF 量化基准测试,你可以在上方查看我们的 量化分析 或 动态 V3.0 文章.
Qwen3.8-27B
表格基准测试请见下方:


文本性能
编程
代理式终端编程 Terminal Bench 2.1 (Terminus)
73.0
63.4
64.0
51.7
78.2
代理式编程 SWE-bench Pro
61.7
53.5
57.6
51.2
53.4
仓库级代码生成 NL2Repo-Bench
42.3
36.2
41.1
--
47.6
代理式编程 DeepSWE 1.1
42.2
13.3
14.2
--
--
软件工程 QwenSWEBench
79.0
49.3
59.2
--
63.8
代理
长周期办公工作 CoWorkBench
70.7
61.0
65.1
--
68.2
专业工作任务 JobBench
33.4
21.8
27.6
--
--
前沿代理任务 Agents' Last Exam
Pass@120.4分数42.9
Pass@1 10.6 分数 27.3
Pass@1 13.2 分数 33.6
--
--
通用
指令遵循 IFBench
79.5
69.1
79.1
77.0
62.5
科学推理 GPQA Diamond
89.2
87.8
90.3
83.5
91.3
多学科推理 HLE
30.8
24.0
34.7
22.0
40.0
竞技编程 LiveCodeBench v6
90.3
83.9
89.6
--
88.8
Qwen3.8-2.4T-A95B

最后更新于
这有帮助吗?




