GLM-5.3 - 如何本地运行
运行 Z.ai 的全新 GLM-5.3 模型。
GLM-5.3 是 Z.ai 的新款 744B 参数(40B 激活)模型。截至 2026 年 8 月,GLM-5.3 是 最强的开源模型 ,在 Terminal Bench 3.0 和 Agents' Last Exam 上取得了 SOTA。GLM-5.3 使用与 GLM-5.2相同的基础模型,所有提升都来自后训练。该模型拥有 100 万上下文 窗口,并且现在可通过 Unsloth Dynamic GGUF 与 llama.cpp 或 Unsloth Desktop.
动态 1-bit GGUF 可达到 ~76% top-1 准确率,同时 体积缩小 85%。动态 2-bit 可达到 ~81% 准确率,同时 体积缩小 83%。由于 GLM-5.3 与 GLM-5.2 在大小和架构上相同,大多数要求/设置也相同。感谢 Z.ai 提供 Unsloth 首日访问权限。 GLM-5.3-GGUF
⚙️ 使用指南
2-bit 动态量化版本 UD-IQ2_M 占用 239GB 的磁盘空间,可很好地运行在 256GB RAM 等设备上,例如 2x NVIDIA DGX Sparks 或 Mac Studio。
该 1-bit 量化版本可适配 223GB RAM,而 8-bit 需要 810GB RAM。
表:推理硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)
223GB
245GB
290-360GB
372-475GB
570GB
810GB
为获得最佳性能,请确保包括 VRAM 和系统 RAM 在内的可用总内存,明显大于量化后的模型文件大小。

推荐设置
GLM-5.3 具有 3 种思考模式: 低, 高,和 最大。对于复杂的编程任务,请使用 Max Thinking。在 Unsloth Desktop 中,你可以通过 UI 轻松切换 Low、High 和 Max Thinking。
大多数使用场景都可使用以下设置:
temperature = 1.0
temperature = 1.0
top_p = 0.95
top_p = 1.0
该 最大上下文窗口 是 1,048,576.
GLM-5.3 默认使用最大推理,且无法关闭思考。 reasoning_effort 可以是 低, 高,或 最大.
clear_thinking 默认值为 false,他们建议设为 true。
如需自定义推理强度(将 'low' 改为 'high' 或 'max'):
对于多轮对话,请使用 clear_thinking=true 以移除前几轮的推理内容(本模型推荐这样做):
聊天模板修复
我们发现 GLM 在聊天模板中使用了一种有趣的 .{id}. 记法,但许多引擎不支持。我们已将其全部改为 [id] ,以符合 Python 列表索引语法。请参见此 提交更改 了解更多细节。

运行 GLM-5.3 教程:
你现在可以在 llama.cpp 和 Unsloth Desktop中运行 GLM-5.3。我们将使用 239GB UD-IQ2_M 量化版本,以在可访问性和准确性之间取得最佳平衡。
🦥 在 Unsloth 中运行 GLM-5.3
GLM-5.3 现在可以在 Unsloth Desktop中运行,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM,并检测多 GPU 配置。借助 Unsloth Desktop,你可以在 macOS、Windows、Linux 上运行模型,并可:

安装 Unsloth
最简单的上手方式是下载 Unsloth Desktop 应用。适用于 macOS, Windows,和 Linux.
或者,如果你更喜欢手动安装:
macOS、Linux、WSL:
Windows PowerShell:
通过 Unsloth API 提供 GLM-5.3 服务
你可以使用 unsloth run 命令,并使用 llama-server 运行时标志,包括上下文大小、GPU 层数、线程、采样、网络和工具配置。更多信息请参阅我们的 API 文档 或 unsloth start.
Unsloth 现在已准备就绪
你还可以通过 Unsloth Desktop 使用 GLM-5.3 做许多其他事情,例如:
连接工具: , , , 等等
训练模型: 微调文本、扩散模型、 嵌入,以及更多
生成媒体: 创建和训练 、视频、 在本地

🦙 在 llama.cpp 中运行 GLM-5.3
在本指南中,我们将运行 UD-IQ2_M 量化版本,该版本至少需要 245GB RAM。你可以自由更改量化类型。在这些教程中,我们将使用 llama.cpp 以实现快速本地推理。GGUF: GLM-5.3-GGUF
获取最新的 llama.cpp 在 GitHub 上获取。首先,选择你想要的量化类型,例如 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF ,如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF ,然后照常继续——Metal 支持默认已开启。
你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run一样。首先,选择你想要的量化类型,例如 UD-IQ2_M。同时使用 export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" 以强制 llama.cpp 将其保存到特定位置。 注意,这个下载过程可能会非常慢,因此最好使用下一节中的手动下载方法。
如果你想手动下载模型 (快得多!),我们可以通过下面的代码下载模型(在安装 pip install huggingface_hub之后)。如果下载卡住,请参见: Hugging Face Hub、XET 调试
如果你想使用动态 1-bit,请执行:
然后以对话模式运行该模型。使用 unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf 用于 2bit,或 unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf 用于 1bit。
与 GLM-5.2 类似,当你启动 llama-cli 时,你会看到:

然后在提示之后,我们用 UD-IQ1_S 做了一个很酷的小贪吃蛇游戏,因此是 1-bit,并且与 GLM-5.3 配合得很好!

📐通过 KV Cache 量化实现长上下文
要在 llama.cpp 中使用长上下文,请使用 KV cache 量化来减少内存占用。
目前支持以下 KV cache 数据类型: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0,和 q5_1。默认情况下 f16 使用的是 q4_1 每个权重大约使用 5 bit,从而可实现约 3.2 倍更长的上下文长度.
量化分析
我们也对上传的量化版本进行了 KLD 测试,结果显示 Q4_K_XL 和 Q5_K_XL 非常接近基线,因此建议优先选择它们。

UD-IQ1_S
216.7
72.56
0.687991
9.104
4.6130
UD-IQ1_M
228.5
75.64
0.565455
8.595
4.1410
UD-IQ2_M
238.6
78.53
0.453992
7.717
3.7433
UD-Q2_K_XL
253.9
80.93
0.374219
7.076
3.5048
UD-IQ3_XXS
281.7
84.15
0.272796
6.252
3.2482
UD-Q3_K_XL
343.0
88.86
0.141406
4.127
2.9107
UD-IQ4_XS
365.3
90.59
0.101496
3.177
2.8460
UD-Q4_K_XL
467.3
94.29
0.036922
1.309
2.7006
UD-Q5_K_XL
562.5
95.82
0.019728
0.786
2.6842
UD-Q6_K_XL
684.4
96.59
0.013257
0.534
2.6771
📊 基准测试
你可以在下方表格中查看 GLM-5.3 的主要基准提升:


基准
GLM-5.3
GLM-5.2
Kimi K3
DeepSeek-V4
Pro-0813
Qwen3.8-Max
Opus 4.8
Fable 5
(含回退)
GPT-5.6 Sol
编程
Terminal Bench 2.1
88.2
81.0
88.3
87.9
86.6
85.0
88.0
88.8
Terminal Bench 3.0
28.3
4.6
17.4
-
-
21.1
33.7
34.6
DeepSWE
v1.1
66.9
46.2
67.5
62.7
56.6
58.0
69.7
72.7
NL2Repo
58.0
48.9
58.0
61.1
55.9
69.7
-
-
ProgramBench
Almost Solved
19.0
9.5
17.5
-
10.5
15.5
33.0
23.0
FrontierSWE
78.1
67.5
-
-
-
66.5
88.2
-
SWE-Marathon
v1.1
42.5
19.4
48.1
-
-
48.8
33.1
42.5
PostTrainBench
39.8
31.7
32.0
-
-
32.9
41.8
36.2
网络安全
CyberGym
84.5
77.2
80.0
83.3
78.5
78.1
83.8
83.6
ExploitGym
2h / 6h
105 / 130
29 / 39
36 / 70
-
14 / 26
80 / 120
181 / 247
216 / 293
ExploitBench
54.4
24.4
32.2
-
28.8
40.0
78.0
76.5
智能体
Toolathlon Verified
73.0
59.9
76.5
74.1
72.5
76.2
74.7
74.9
AutomationBench
v1.0.6
48.2
26.2
46.7
43.2
39.8
41.0
46.2
45.8
Agents' Last Exam
ALE-CLI
28.5
23.8
27.6
25.7
27.0
25.7
23.8
28.6
HLE w/ Tools
62.5
54.7
59.8
60.0
56.2
57.9
63.9
64.5
GDPval-AA v2
1769
1508
1682
1590
1739
1588
1743
1730
最后更新于
这有帮助吗?


