For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8-Flash-Next:如何本地运行

Qwen3.8 本地运行指南。

Qwen3.8-Flash-Next 是一款新的开放权重、 125B 参数 来自 Qwen 的 MoE 多模态模型。基于新的 Qwen4 架构,支持 262K 上下文窗口和高级推理。 Qwen3.8-Flash-Next 的表现优于 Claude-4.6-Opus(Max),并且可以在以下设备上本地运行: 75GB RAM/统一内存,无需 GPU VRAM。要运行该模型,请使用我们的 GGUF 文件 通过 llama.cpp 或 Unsloth Desktop。感谢 Qwen 提供首发访问权限。

1 位是 75GB 并对 Ngram / PLE 使用 4 位。这是 小 79% 比 BF16(355GB)更小,并且保留了 80% 的 top-1% 准确率.

运行 Qwen3.8-Flash下载 Unsloth

在 Unsloth 中运行的 4 位 Qwen3.8-Flash

⚙️ 使用指南

无论你运行 Qwen3.8-Flash-Next 在 CPU + 系统内存上或 GPU + VRAM 上运行,差异可能相对很小。其独特架构允许使用 RAM 或统一内存进行推理,性能更接近 GPU VRAM,这与其他模型通常不同。因此它尤其适合 Mac、NVIDIA DGX Spark 系统以及其他大内存容量设备。

你至少需要 75 GB 的 RAM 或统一内存 来运行该模型。其最小的 1 位量化版本比通常更大,这是因为新增了 Ngram 层或每层嵌入,它们类似查找表。不过这也意味着量化没有那么激进,使模型比更高强度量化的模型保留了更多原始准确率。你还可以将 PLE / Ngram 层卸载到 SSD 并使用 mmap,从而减少 CPU 和 GPU VRAM 的占用。

Qwen3.8-Flash-Next 要求:

最小的量化版本可在 75GB RAM 上运行,因此最好使用 96GB RAM/统一内存设备。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)

1 位
2 位
3 位
4 位
5 位
8 位
BF16

75 GB

79 GB

90 GB

96-114 GB

163 GB

200 GB

355 GB

如果你想使用 MTP 以获得更快推理,请准备额外 1-2GB 的余量。

推荐设置

Qwen3.8-Flash-Next 是一个 混合思考 模型,在思考模式和非思考模式下有不同的默认设置。默认启用 extra high,因此如果你想要更短的思考轨迹,可以 调整思考力度:

参数
思考模式
指令(非思考)模式

temperature

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • 上下文长度 = 最多 262,144

  • 思考模式: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • 指令(或非思考)模式: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

💡 思考 + 保留思考

Qwen3.8-Flash-Next 具有 保留思考 它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数量,但可能提高连续对话中的准确性。 Unsloth 为 Qwen3.8 提供“Think”和“保留思考”切换开关(见右侧):

Qwen3.8-Flash-Next 支持 reasoning_effort,可用于调整推理深度并控制成本。这些切换在 Unsloth 中会自动启用:

  • xhigh (默认):适用于需要深入分析的复杂任务

  • medium:在准确性和速度之间取得平衡

  • low:高效推理,优化速度和成本

量化分析

我们对 Qwen3.8-Flash 的量化版本进行了 KLD 测试,并表明在磁盘空间使用减少 79% 的情况下,能够恢复 80% 的 top-1% 准确率。新架构使用 PLE / Ngram,而这些部分不会被量化得那么厉害(最低 4 位),因为它们具有随机访问模式,过度量化会损害模型。

量化版本
GB
top-1%
平均 KLD
99.9% KLD

UD-IQ1_S

72.5

77.325

0.396070

7.2126

UD-IQ1_M

74.5

79.691

0.314739

6.1965

UD-Q2_K_XL

78.9

82.715

0.224607

4.9121

UD-IQ3_XXS

82.0

85.414

0.165120

4.0375

UD-Q3_K_XL

90.0

88.315

0.106504

3.0538

UD-IQ4_XS

93.7

89.554

0.083630

2.3677

UD-Q4_K_XL

111.3

92.255

0.046893

1.5468

UD-Q5_K_XL

158.3

93.680

0.030415

1.0036

UD-Q6_K_XL

169.2

94.089

0.027091

0.8416

Q8_0

188.2

94.122

0.026574

0.8118

运行 Qwen3.8-Flash-Next 指南

你现在可以在 Unsloth Desktop 和 llama.cpp 中运行 Qwen3.8-Flash-Next。可随意更改量化类型。

在 Unsloth Desktop 中运行在 llama.cpp 中运行MTP 指南

🦥 在 Unsloth 中运行 Qwen3.8-Flash-Next

Qwen3.8-Flash-Next 现在可以在以下环境中运行: Unsloth Desktop,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM 并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台上本地运行模型: MacOS、Windows、Linux,以及:

1

安装 Unsloth

最简单的开始方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.

下载 Unsloth

或者,如果你更喜欢手动安装:

MacOS、Linux、WSL:

Windows PowerShell:

2

搜索并下载 Qwen3.8-Flash-Next

前往 Unsloth Chat 或前往 Model hub,在搜索栏中搜索 Qwen3.8-Flash,并下载你想要的模型和量化版本。

3

运行 Qwen3.8-Flash-Next

MTP 会自动启用,但你可以将其关闭。使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth 推理指南.

例如,使用 Unsloth Desktop 搭配 397GB 的 Qwen3.8(体积缩小 91%)可以切换思考模式,支持内联画布、网页搜索、代码执行等更多功能。

4

通过 Unsloth API 部署 Qwen3.8-Flash-Next

你可以使用 unsloth run 命令,并使用以下方式通过 API 部署 Qwen3.8: llama-server 运行时标志,包括上下文大小、GPU 层、线程、采样、网络和工具配置。更多信息请参阅我们的 API 文档unsloth start.

5

Unsloth 现在已就绪

你还可以通过 Unsloth Desktop 使用 Qwen3.8-Flash-Next 做许多其他事情,例如:

🦙 在 llama.cpp 中运行 Qwen3.8-Flash-Next

1

安装最新版本的 llama.cpp。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认已开启。

2

要运行该模型,你可以这样做:

3

然后运行:

MTP 指南

Qwen3.8-Flash 可实现 1.3 到 1.7 倍更快的推理 通过 MTP (多 token 预测),且不会降低准确率!MTP 使 Qwen3.8-Flash 能达到 170 tokens/s 在 1 张 RTX 6000 PRO GPU 上,相比 100 token 基线。MTP 通过让模型一次预测多个后续 token,而不是每步生成一个 token,从而加速推理,并且在 GPU 上尤其有效。

要使用 MTP 运行 Qwen3.8-Flash,MTP 默认已在以下环境中启用: Unsloth Desktop 或者你也可以使用我们定制的 llama.cpp PR。

在内存带宽较低的设备上,例如较老的 Mac,收益会更小。我们创建了共享 MTP 模块(不包含 embed_tokens,并与主模型共享),可将磁盘空间、RAM 和 VRAM 的占用节省约 1 到 2GB。

MTP 类型
通用 MTP
共享 MTP
节省

BF16

7.77 GB

5.23 GB

2.54 GB

Q8_0

4.14 GB

2.79 GB

1.35 GB

Q4_K_M

2.79 GB

1.91 GB

880 MB

3 位 MTP 量化可在 91GB RAM 上运行,因此最好使用 96GB RAM/统一内存设备。 表:MTP 硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)

1 位
2 位
3 位
4 位
5 位
8 位
BF16

76 GB

80 GB

91 GB

97-115 GB

164 GB

200 GB

355 GB

运行 MTP Qwen3.8-Flash

要使用 MTP 运行 Qwen3.8-Flash,你只需要 安装 Unsloth Desktop 或者更新到最新版本的 Unsloth,然后重新下载模型或下载 MTP 文件。有关 llama.cpp 的说明请见下文。

Unsloth Desktop 支持 macOS, Windows,以及 Linux.

下载 Unsloth

在 Unsloth Desktop 中,你还可以更改 draft token 数量或自定义 MTP。使用右侧边栏中的高级设置,并启用“高级设置”,即可选择 MTP / Ngram 推测解码、draft token 数量等:

MTP Llama.cpp 指南

然后下载共享 MTP 模块:

然后使用 llama-server:

📊 基准测试

关于 GGUF 量化基准测试,请查看上面的 量化分析Dynamic V3.0 文章.

最后更新于

这有帮助吗?