DeepSeek-V4:如何在本地运行
在你自己的设备上本地运行 DeepSeek-V4-Flash!
DeepSeek-V4 是 DeepSeek 的新开源模型,包括 DeepSeek-V4-Pro 以及 1.6T 参数(49B 激活),以及 DeepSeek-V4-Flash 以及 284B 参数(13B 激活)。这些模型在代码编写、智能体工作流和聊天方面表现出色,并支持 100万上下文 窗口。在本指南中,我们将向你展示如何在本地运行 DeepSeek-V4-Flash : DeepSeek-V4-Flash GGUF
对于 无损 DeepSeek,请使用 Q8(UD-Q8_K_XL),它只比 Q4( 大 7GB 多于 Q4(UD-Q4_K_XL)。 无损 8 位 GGUF 是 162 GB ,3 位是 103GB ,可在 110GB RAM 设备上运行. DeepSeek-V4-Flash 在 MMLU-Pro 上得分 86.2%,在 GPQA Diamond 上得分 88.1%,在 Terminal Bench 2.0 上得分 56.9%。
7 月 7 日: DeepSeek-V4 现在已可运行!我们还改进了 DeepSeek-V4 聊天 jinja 模板,并通过 4000 多段对话测试,使其与官方基线等效。
🦙 llama.cpp DeepSeek V4 实现修复
llama.cpp 已在 24162 - 我们注意到,当使用来自 任何提供方的任意 GGUF 时,在使用 KV 缓存量化时,多轮对话相较于 DS4 的 Hugging Face 基线表现不佳 --cache-type k/v q8_0 - 自 2026 年 7 月 7 日起,这一问题已在 llama.cpp 中修复并合并,使用 25202
具体来说,在修复之前,调用 DeepSeek 量化版本会导致 overlayotin kinetic academyléléléléulif ,而在 PR 之后则变为“法国的首都是巴黎。”,这是正确的。
💬 DeepSeek V4 聊天模板改进
我们还改进了 DeepSeek-V4 聊天 jinja 模板,并通过 4000 多段对话测试,使其与黄金基线(官方 DS4)等效
我们添加了 reasoning_effort ,你可以选择 max、high ,就像官方 DeepSeek-V4 一样。我们按 DS4 的要求前置了正确的系统提示词,并遵循了 gpt-oss 的风格。
而对于工具调用, reasoning_content 在 DS4 中被保留,但 jinja 聊天模板会将其排除。我们又把它加回来了。
关闭思考,修改推理强度
DeepSeek-V4 默认使用推理。它也支持推理强度,其中 reasoning_effort 可以是“high”、“max”或禁用。
要禁用思考,请使用 --chat-template-kwargs '{"enable_thinking":false}'。如果你使用的是 Windows PowerShell,请使用: --chat-template-kwargs "{\"enable_thinking\":false}"
你也可以使用 --reasoning on 或 --reasoning off ,现在也可在 llama.cpp 中使用!
对于推理强度自定义或禁用推理,请使用以下示例:
📊 量化分析
我们的 UD-Q8_K_XL 量化是完全无损的。DeepSeek-V4-Flash 是 量化感知训练:官方检查点将其路由专家(模型的 96%)原生存储为 MXFP4,其余部分存储为 FP8 或 BF16。GGUF 的 MXFP4 正是这种格式,因此我们按位重打包这些专家,而 FP8 会无舍入地反量化为 BF16。我们将每个张量都与官方 DeepSeek 权重进行了比对:1,328 个张量全部逐位一致,并且在推理时保持无损(KL 散度约为 0,100% 顶部 token 一致)。
非-Unsloth DeepSeek-V4-Flash GGUF 是在没有这些路径的情况下转换的,因此与官方权重存在偏差。 UD-Q4_K_XL 保持相同的逐位精确专家,仅将非专家张量(模型的 4%)量化为 Q8_0,因此其体积和质量都与 Q8 非常接近。


与官方权重相比,这两个 Unsloth 量化版本都处于质量/体积前沿。UD-Q8_K_XL 是唯一的无损点。UD-Q4_K_XL 与其他社区的 MXFP4 格式一致,并且比 Q4_K-experts 转换更准确,后者虽然更大,但 KLD 达到 0.029。

按层划分的误差显示了原因。保留原生 MXFP4 专家意味着每一层的权重误差都是 0%。将专家重新量化为 Q4_K 或 IQ2_XXS 的转换几乎会对每个权重进行舍入:Q4_K 为 5%,IQ2_XXS 超过 30%。

我们还发现,对某些张量使用 Q8_0 和 F16 并非无损,而且情况会更糟,因为 DeepSeek 已应用 QAT 来让 MXFP4 / FP8 正常工作,所以我们必须直接将它们保留为 BF16。因此,请使用 UD-Q8_K_XL 以获得真正无损的量化,而 UD-Q4_K_XL 会将部分 BF16 项下采样为 Q8_0。
有关完整基准表的 GGUF 基准测试,请看这里.
⚙️ 使用指南
DeepSeek-V4-Flash 比 DeepSeek-V4-Pro 更小、更快,具有 284B 参数(13B 激活),以及 100万上下文窗口。该模型有 3 种模式, 非思考, 思考 高 和 思考 最大.
建议使用 UD-IQ3_XXS , 103GB 以获得最佳结果。由于文件大小不包含 KV 缓存和上下文分配,请尽量至少有 110GB RAM 来运行该模型。
该 UD-Q8_K_XL 量化版本是完整原始精度的 DeepSeek-V4-Flash。其大小为 162GB,最好至少有 169GB 可用 RAM/VRAM。
表:推理硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
92 GB
102 GB
110-135 GB
162 GB
169 GB
为获得最佳性能,请确保包括 VRAM 和系统 RAM 在内的总可用内存,比量化模型文件大小富余足够多。
推荐设置
DeepSeek 建议使用以下参数以获得最佳性能: temperature=1.0, top-p=1.0
思考高默认开启。 如果已禁用,可以通过以下方式启用: --chat-template-kwargs '{"enable_thinking":true}' 或通过以下位置的 UI 下拉菜单切换: Unsloth Studio。另见 DeepSeek-V4
temperature = 1.0
top-p = 1.0
最大上下文窗口:
1,048,576对于 Think Max,请将上下文至少设置为 384K tokens.
运行 DeepSeek-V4-Flash 教程:
对于本教程,我们将使用 3 位量化 UD-IQ3_XXS,因为它适合 128GB RAM 设备。如果你的机器有足够内存,请替换为 UD-IQ3_XXS 以及 UD-Q8_K_XL (原始质量)或其他量化版本。现在你可以在 Unsloth Studio.
🦥 Unsloth Studio 指南🦙 Llama.cpp 指南
🦥 Unsloth Studio 指南
现在可以在 Unsloth Studio中运行和训练 DeepSeek-V4-Flash,这是我们新的本地 AI 开源 Web UI。Unsloth Studio 让你可以在以下系统上本地运行模型: MacOS, Windows、Linux 以及:

搜索并下载 DeepSeek-V4-Flash
首次启动时,你需要创建一个密码来保护你的账户,并重新登录。然后前往 Studio Chat 标签页,在搜索栏中搜索 DeepSeek-V4-Flash,并下载你想要的模型和量化版本。

运行 DeepSeek-V4-Flash
使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。因为 思考高默认开启,你可以到右侧下拉菜单将其切换为非思考或思考最大。你也可以编辑上下文长度、聊天模板和其他设置。
如需更多信息,你可以查看我们的 Unsloth Studio 推理指南.

🦙 Llama.cpp 指南
获取最新的 llama.cpp 在 GitHub 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后按常规继续——Metal 支持默认开启。
你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run一样。首先,选择你想要的量化类型,例如 IQ3_XXS。还可以使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 保存到特定位置。请注意,这个下载过程可能会非常慢,因此下一节的手动下载流程可能更好。
如果你想手动下载模型,我们可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住,请查看: Hugging Face Hub、XET 调试
你可以编辑 --threads 32 来设置 CPU 线程数, --ctx-size 32768 来设置上下文长度, --n-gpu-layers 2 来设置 GPU 卸载的层数。如果你的 GPU 内存不足,尝试调整它。如果你只进行 CPU 推理,也请将其移除。
📊 基准测试
GGUF 基准测试
请看下面的表格,其中比较了 Unsloth 和其他提供方的量化版本基准。参考基线 = 官方权重。在 4x B200 上,以 ctx 512 对 wikitext-2 计算困惑度和 KL 散度。

官方(参考)
156.4
4.5319
0
0%
100%
100%
Unsloth UD-Q8_K_XL
161.9
4.5319
~0(无损)
0.000%
100.000%
100.000%
Unsloth UD-Q4_K_XL
155.1
4.5335
0.0102
3.40%
96.28%
97.46%
bartowski MXFP4
156.0
4.5351
0.0105
3.42%
96.18%
97.57%
antirez Q4KExperts-F16(imatrix)
164.6
4.5743
0.0291
5.87%
93.95%
0.51%
antirez Q4KExperts-F16
164.6
4.5726
0.0290
5.89%
93.94%
0.93%
antirez 混合 L37-42-Q4K(imatrix)
97.6
5.8169
0.3605
21.15%
79.74%
0.41%
antirez IQ2XXS(imatrix)
86.7
6.0808
0.4079
22.23%
78.15%
0.39%
antirez IQ2XXS
86.7
6.1518
0.4207
22.74%
77.92%
0.47%
官方基准
更下方可查看表格式基准:

知识与推理
MMLU-Pro(EM)
83.0
86.4
86.2
82.9
87.1
87.5
SimpleQA-Verified(Pass@1)
23.1
28.9
34.1
45.0
46.2
57.9
Chinese-SimpleQA(Pass@1)
71.5
73.2
78.9
75.8
77.7
84.4
GPQA Diamond(Pass@1)
71.2
87.4
88.1
72.9
89.1
90.1
HLE(Pass@1)
8.1
29.4
34.8
7.7
34.5
37.7
LiveCodeBench(Pass@1)
55.2
88.4
91.6
56.8
89.8
93.5
Codeforces(评级)
-
2816
3052
-
2919
3206
HMMT 2026 2 月(Pass@1)
40.8
91.9
94.8
31.7
94.0
95.2
IMOAnswerBench(Pass@1)
41.9
85.1
88.4
35.3
88.0
89.8
Apex(Pass@1)
1.0
19.1
33.0
0.4
27.4
38.3
Apex 入围列表(Pass@1)
9.3
72.1
85.7
9.2
85.5
90.2
长上下文
MRCR 1M(MMR)
37.5
76.9
78.7
44.7
83.3
83.5
CorpusQA 1M(ACC)
15.5
59.3
60.5
35.6
56.5
62.0
智能体
Terminal Bench 2.0(准确率)
49.1
56.6
56.9
59.1
63.3
67.9
SWE Verified(已解决)
73.7
78.6
79.0
73.6
79.4
80.6
SWE Pro(已解决)
49.1
52.3
52.6
52.1
54.4
55.4
SWE 多语言(已解决)
69.7
70.2
73.3
69.8
74.1
76.2
BrowseComp(Pass@1)
-
53.5
73.2
-
80.4
83.4
带工具的 HLE(Pass@1)
-
40.3
45.1
-
44.7
48.2
MCPAtlas(Pass@1)
64.0
67.4
69.0
69.4
74.2
73.6
GDPval-AA(Elo)
-
-
1395
-
-
1554
Toolathlon(Pass@1)
40.7
43.5
47.8
46.3
49.0
51.8
最后更新于
这有帮助吗?

