Qwen3.8-Flash-Next:如何本地运行
Qwen3.8 本地运行指南。
Qwen3.8-Flash-Next 是一款新的开放权重、 125B 参数 来自 Qwen 的 MoE 多模态模型。基于新的 Qwen4 架构,支持 262K 上下文窗口和高级推理。 Qwen3.8-Flash-Next 的表现优于 Claude-4.6-Opus(Max),并且可以在以下设备上本地运行: 75GB RAM/统一内存,无需 GPU VRAM。要运行该模型,请使用我们的 GGUF 文件 通过 llama.cpp 或 Unsloth Desktop。感谢 Qwen 提供首发访问权限。
1 位是 75GB 并对 Ngram / PLE 使用 4 位。这是 小 79% 比 BF16(355GB)更小,并且保留了 80% 的 top-1% 准确率.
MTP 已上线!在以下环境中运行 Qwen3.8-Flash,可快 1.3-1.7 倍: Unsloth Desktop!

⚙️ 使用指南
无论你运行 Qwen3.8-Flash-Next 在 CPU + 系统内存上或 GPU + VRAM 上运行,差异可能相对很小。其独特架构允许使用 RAM 或统一内存进行推理,性能更接近 GPU VRAM,这与其他模型通常不同。因此它尤其适合 Mac、NVIDIA DGX Spark 系统以及其他大内存容量设备。
你至少需要 75 GB 的 RAM 或统一内存 来运行该模型。其最小的 1 位量化版本比通常更大,这是因为新增了 Ngram 层或每层嵌入,它们类似查找表。不过这也意味着量化没有那么激进,使模型比更高强度量化的模型保留了更多原始准确率。你还可以将 PLE / Ngram 层卸载到 SSD 并使用 mmap,从而减少 CPU 和 GPU VRAM 的占用。
Qwen3.8-Flash-Next 要求:
最小的量化版本可在 75GB RAM 上运行,因此最好使用 96GB RAM/统一内存设备。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)
75 GB
79 GB
90 GB
96-114 GB
163 GB
200 GB
355 GB
推荐设置
Qwen3.8-Flash-Next 是一个 混合思考 模型,在思考模式和非思考模式下有不同的默认设置。默认启用 extra high,因此如果你想要更短的思考轨迹,可以 调整思考力度:
temperature
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
上下文长度 = 最多
262,144思考模式:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0指令(或非思考)模式:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
💡 思考 + 保留思考
Qwen3.8-Flash-Next 具有 保留思考 它会保留上一轮对话中的思考轨迹。这会增加你使用的 token 数量,但可能提高连续对话中的准确性。 Unsloth 为 Qwen3.8 提供“Think”和“保留思考”切换开关(见右侧):

Qwen3.8-Flash-Next 支持 reasoning_effort,可用于调整推理深度并控制成本。这些切换在 Unsloth 中会自动启用:
xhigh(默认):适用于需要深入分析的复杂任务medium:在准确性和速度之间取得平衡low:高效推理,优化速度和成本无
要更改 思考 / 推理 力度,请在 unsloth run 或 llama-server,请使用 --chat-template-kwargs '{"reasoning_effort":"medium"}'
如果你使用的是 Windows Powershell,请使用: --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
将 medium 更改为你所需的推理级别。
量化分析
我们对 Qwen3.8-Flash 的量化版本进行了 KLD 测试,并表明在磁盘空间使用减少 79% 的情况下,能够恢复 80% 的 top-1% 准确率。新架构使用 PLE / Ngram,而这些部分不会被量化得那么厉害(最低 4 位),因为它们具有随机访问模式,过度量化会损害模型。


UD-IQ1_S
72.5
77.325
0.396070
7.2126
UD-IQ1_M
74.5
79.691
0.314739
6.1965
UD-Q2_K_XL
78.9
82.715
0.224607
4.9121
UD-IQ3_XXS
82.0
85.414
0.165120
4.0375
UD-Q3_K_XL
90.0
88.315
0.106504
3.0538
UD-IQ4_XS
93.7
89.554
0.083630
2.3677
UD-Q4_K_XL
111.3
92.255
0.046893
1.5468
UD-Q5_K_XL
158.3
93.680
0.030415
1.0036
UD-Q6_K_XL
169.2
94.089
0.027091
0.8416
Q8_0
188.2
94.122
0.026574
0.8118
运行 Qwen3.8-Flash-Next 指南
你现在可以在 Unsloth Desktop 和 llama.cpp 中运行 Qwen3.8-Flash-Next。可随意更改量化类型。
Hugging Face: Qwen3.8-Flash-Next-GGUF
ModelScope: Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Next 现在可在以下环境中本地运行: Unsloth Desktop!
🦥 在 Unsloth 中运行 Qwen3.8-Flash-Next
Qwen3.8-Flash-Next 现在可以在以下环境中运行: Unsloth Desktop,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM 并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台上本地运行模型: MacOS、Windows、Linux,以及:
搜索、下载、 运行 GGUF 文件、MLX 和 safetensor 模型
自我修复 工具调用 + 网页搜索
代码执行 (Python、Bash)
自动推理 参数调优(temp、top-p 等)
通过 MLX 和 llama.cpp 实现快速 CPU + GPU 推理
训练 LLM 速度快 2 倍,VRAM 占用减少 70%

安装 Unsloth
最简单的开始方式是下载 Unsloth Desktop 应用。支持 macOS, Windows,以及 Linux.
或者,如果你更喜欢手动安装:
MacOS、Linux、WSL:
Windows PowerShell:
运行 Qwen3.8-Flash-Next
MTP 会自动启用,但你可以将其关闭。使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth 推理指南.
例如,使用 Unsloth Desktop 搭配 397GB 的 Qwen3.8(体积缩小 91%)可以切换思考模式,支持内联画布、网页搜索、代码执行等更多功能。

通过 Unsloth API 部署 Qwen3.8-Flash-Next
你可以使用 unsloth run 命令,并使用以下方式通过 API 部署 Qwen3.8: llama-server 运行时标志,包括上下文大小、GPU 层、线程、采样、网络和工具配置。更多信息请参阅我们的 API 文档 或 unsloth start.
Unsloth 现在已就绪
你还可以通过 Unsloth Desktop 使用 Qwen3.8-Flash-Next 做许多其他事情,例如:
连接工具: , , , 等等
训练模型: 微调文本、扩散模型、 嵌入等更多内容
生成媒体: 创建并训练 、视频、 本地

🦙 在 llama.cpp 中运行 Qwen3.8-Flash-Next
安装最新版本的 llama.cpp。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认已开启。
要运行该模型,你可以这样做:
然后运行:
MTP 指南
Qwen3.8-Flash 可实现 1.3 到 1.7 倍更快的推理 通过 MTP (多 token 预测),且不会降低准确率!MTP 使 Qwen3.8-Flash 能达到 170 tokens/s 在 1 张 RTX 6000 PRO GPU 上,相比 100 token 基线。MTP 通过让模型一次预测多个后续 token,而不是每步生成一个 token,从而加速推理,并且在 GPU 上尤其有效。
要使用 MTP 运行 Qwen3.8-Flash,MTP 默认已在以下环境中启用: Unsloth Desktop 或者你也可以使用我们定制的 llama.cpp PR。


在内存带宽较低的设备上,例如较老的 Mac,收益会更小。我们创建了共享 MTP 模块(不包含 embed_tokens,并与主模型共享),可将磁盘空间、RAM 和 VRAM 的占用节省约 1 到 2GB。
BF16
7.77 GB
5.23 GB
2.54 GB
Q8_0
4.14 GB
2.79 GB
1.35 GB
Q4_K_M
2.79 GB
1.91 GB
880 MB
3 位 MTP 量化可在 91GB RAM 上运行,因此最好使用 96GB RAM/统一内存设备。 表:MTP 硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)
76 GB
80 GB
91 GB
97-115 GB
164 GB
200 GB
355 GB
运行 MTP Qwen3.8-Flash
要使用 MTP 运行 Qwen3.8-Flash,你只需要 安装 Unsloth Desktop 或者更新到最新版本的 Unsloth,然后重新下载模型或下载 MTP 文件。有关 llama.cpp 的说明请见下文。

MTP Llama.cpp 指南
然后下载共享 MTP 模块:
然后使用 llama-server:
📊 基准测试
关于 GGUF 量化基准测试,请查看上面的 量化分析 或 Dynamic V3.0 文章.


最后更新于
这有帮助吗?


