GLM-5.3-Flash:如何本地运行
本地运行 Z.ai 的新 GLM-5.3-Flash(即 ox-alpha)模型。
GLM-5.3-Flash,也称为 ox-alpha,是 Z.ai 全新的 320B 参数(18B 激活)多模态开源模型, 优于 GLM-5.2。GLM-5.3-Flash 是 GLM-5.3 的更小版本,并可与 Claude Opus 4.8 在代码和智能体基准上竞争。现在你可以通过 llama.cpp 或 Unsloth在本地使用 102GB RAM/VRAM 运行 1-bit 模型,或在 128GB 配置上运行 3-bit 模型。感谢 Z.ai 提供首日访问权限。
Unsloth 动态 1-bit (93GB)GGUF 保留了 71% 的 top-1% 准确率 同时 体积缩小 85% 相较 BF16(642GB)。动态 3-bit 体积缩小 76%,并保留 87% 的准确率。
9月4日: GLM-5.3-Flash 现在运行时具有 3.3 倍更快的推理速度!
GLM-5.3-Flash 在 30T tokens 上训练,并建立在一个新训练的基础模型之上。其混合稀疏与线性注意力架构在不牺牲准确率的前提下降低了长上下文服务成本。
你现在可以直接在 Unsloth Desktop.

⚙️ 使用指南
GLM-5.3-Flash 要求:
最小的 1-bit 量化可在 100GB RAM 上运行,而 3-bit 可在 128GB 设备上运行,例如 Mac 或 NVIDIA DGX Spark。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)
100 GB
115 GB
128-150 GB
162-210 GB
350 GB
650 GB
推荐设置
GLM-5.3-Flash 有 3 种思考模式:低、高和最大。复杂任务请使用最大思考模式。在 Unsloth中,你可以通过聊天区域中的切换按钮轻松选择低、高或最大思考模式。
大多数使用场景请使用以下设置:
temperature = 1.0
temperature = 0.95
top_p = 0.95
top_p = 1.0
最大上下文窗口:
1,048,576.
更改推理力度
GLM-5.3-Flash 默认使用最大推理。它也支持推理力度,其中 reasoning_effort 可以是“low”、“high”或“max”。
更快的推理与 MTP 支持
截至9月4日,我们对首日 llama.cpp PR进行了多项改进和优化。我们实现了更快的解码路径,并额外支持 MTP,使得在 推理速度最高快 3.3 倍 ,尤其是在长上下文长度下!
一切都能在 Unsloth Desktop中开箱即用,如有需要只需更新到最新版本即可。无需额外模块或 MTP 文件。或者,你也可以遵循我们的 llama.cpp 指南。


在 1xB200 上使用 GLM-5.3-Flash UD-IQ1_S,并先忽略 MTP,我们得到:
pp512
1121.80
1122.0
tg32
62.79
63.10
tg32 @ 4096
53.52
59.50
tg32 @ 16384
41.02
57.99
tg32 @ 65536
20.66
48.99
随后加入 MTP 后,我们看到收益更大,尤其是在更长上下文中。不过我们应当将 n 停在约 2,因为更多的草稿 token 会让推理变慢。
4096
58.6
86.5
80.2
63.7
16K
55.0
77.2
对于更短的上下文长度,我们仍然能看到速度提升,尽管最多快 1.6 倍。


📈 量化分析
我们将 GLM-5.3-Flash 量化到 UD-IQ1_S 1bit(93.09GB),在体积比 BF16(641.64GB)缩小 85% 的同时,仍保留 71% 的 top-1% 准确率
动态 2-bit UD-Q2_K_XL 为 109GB,体积缩小 83%,并保留 78% 的准确率。 动态 3-bit UD-IQ3_XXS 为 120GB,体积缩小 81%,并保留 82% 的准确率。 动态 4-bit UD-Q4_K_XL 为 200GB,体积缩小 69%,并保留 93% 的准确率。


UD-IQ1_S
93.09
70.89%
0.669714
9.1658
UD-IQ1_M
97.58
73.06%
0.572413
8.5069
UD-IQ2_XXS
101.84
76.30%
0.450148
7.5764
UD-Q2_K_XL
108.72
78.34%
0.380134
6.8412
UD-IQ3_XXS
120.37
81.63%
0.283772
5.9611
UD-Q3_K_XL
147.54
86.25%
0.159697
4.0281
UD-IQ4_XS
156.82
88.18%
0.116652
3.1014
UD-Q4_K_XL
199.71
92.22%
0.049294
1.4894
UD-Q5_K_XL
240.31
94.35%
0.027052
0.8696
UD-Q6_K_XL
291.83
95.23%
0.019007
0.6267
在本地运行 GLM-5.3-Flash(Ox-Alpha)
你现在可以通过我们专门的 PR在 Unsloth Desktop 和 llama.cpp 中运行 GLM-5.3-Flash(Ox-Alpha)。 UD-IQ3_XXS 我们在演示中使用 3-bit,因为它适合 128GB 设备。你可以随意更改量化类型。
Hugging Face: GLM-5.3-Flash-GGUF
🦥 在 Unsloth 中运行 GLM-5.3-Flash
GLM-5.3-Flash 现在可以在 Unsloth Desktop中运行,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM 并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台本地运行模型: MacOS、Windows、Linux 以及:

安装 Unsloth
最简单的开始方式是下载 Unsloth Desktop 应用。适用于 macOS, Windows,以及 Linux.
或者,如果你更愿意手动安装:
MacOS、Linux、WSL:
Windows PowerShell:
运行 GLM-5.3-Flash
使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动修改。你也可以编辑上下文长度、聊天模板和其他设置。
更多信息可查看我们的 Unsloth 推理指南。1-bit 运行如下:

使用 Unsloth API 部署 GLM-5.3-Flash
你可以使用 unsloth run 命令,并通过以下方式使用 API 部署 GLM-5.3-Flash: llama-server 运行时标志,包括上下文大小、GPU 层数、线程、采样、网络和工具配置。更多信息请参见我们的 API 文档 或 unsloth start.
🦙 在 llama.cpp 中运行 GLM-5.3-Flash
我们需要使用我们专门的 llama.cpp PR 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——Metal 支持默认开启。
要运行该模型,你可以这样做:
然后运行它:
将 UD-IQ3_XXS 替换为你偏好的量化版本,例如 IQ2_XXS 在上传后可用于 2-bit。
📊 基准测试


基准
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
编程
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE
v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
智能体
Toolathlon Verified
78.4
59.9
75.9
76.2
74.9
-
AutomationBench
v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
带工具的 HLE
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
视觉
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv 推理
带工具
89.4
-
80.4
89.9
88.0
88.7
Chartography
带工具
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
最后更新于
这有帮助吗?



