For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3-Flash:如何本地运行

本地运行 Z.ai 的新 GLM-5.3-Flash(即 ox-alpha)模型。

GLM-5.3-Flash,也称为 ox-alpha,是 Z.ai 全新的 320B 参数(18B 激活)多模态开源模型, 优于 GLM-5.2。GLM-5.3-Flash 是 GLM-5.3 的更小版本,并可与 Claude Opus 4.8 在代码和智能体基准上竞争。现在你可以通过 llama.cpp 或 Unsloth在本地使用 102GB RAM/VRAM 运行 1-bit 模型,或在 128GB 配置上运行 3-bit 模型。感谢 Z.ai 提供首日访问权限。

Unsloth 动态 1-bit (93GB)GGUF 保留了 71% 的 top-1% 准确率 同时 体积缩小 85% 相较 BF16(642GB)。动态 3-bit 体积缩小 76%,并保留 87% 的准确率。

​​运行 GLM-5.3-Flash 指南下载 Unsloth

GLM-5.3-Flash 在 30T tokens 上训练,并建立在一个新训练的基础模型之上。其混合稀疏与线性注意力架构在不牺牲准确率的前提下降低了长上下文服务成本。

你现在可以直接在 Unsloth Desktop.

⚙️ 使用指南

GLM-5.3-Flash 要求:

最小的 1-bit 量化可在 100GB RAM 上运行,而 3-bit 可在 128GB 设备上运行,例如 Mac 或 NVIDIA DGX Spark。 表:硬件要求 (单位 = 总内存:RAM + VRAM,或统一内存)

1-bit
2-bit
3-bit
4-bit
8-bit
BF16

100 GB

115 GB

128-150 GB

162-210 GB

350 GB

650 GB

推荐设置

GLM-5.3-Flash 有 3 种思考模式:低、高和最大。复杂任务请使用最大思考模式。在 Unsloth中,你可以通过聊天区域中的切换按钮轻松选择低、高或最大思考模式。

大多数使用场景请使用以下设置:

默认设置(大多数任务)
DeepSWE

temperature = 1.0

temperature = 0.95

top_p = 0.95

top_p = 1.0

  • 最大上下文窗口: 1,048,576.

更改推理力度

GLM-5.3-Flash 默认使用最大推理。它也支持推理力度,其中 reasoning_effort 可以是“low”、“high”或“max”。

更快的推理与 MTP 支持

截至9月4日,我们对首日 llama.cpp PR进行了多项改进和优化。我们实现了更快的解码路径,并额外支持 MTP,使得在 推理速度最高快 3.3 倍 ,尤其是在长上下文长度下!

一切都能在 Unsloth Desktop中开箱即用,如有需要只需更新到最新版本即可。无需额外模块或 MTP 文件。或者,你也可以遵循我们的 llama.cpp 指南。

在 1xB200 上使用 GLM-5.3-Flash UD-IQ1_S,并先忽略 MTP,我们得到:

测试
基线 tok/s
优化后 tok/s

pp512

1121.80

1122.0

tg32

62.79

63.10

tg32 @ 4096

53.52

59.50

tg32 @ 16384

41.02

57.99

tg32 @ 65536

20.66

48.99

随后加入 MTP 后,我们看到收益更大,尤其是在更长上下文中。不过我们应当将 n 停在约 2,因为更多的草稿 token 会让推理变慢。

提示词
关闭 MTP
n=2
n=3
n=5

4096

58.6

86.5

80.2

63.7

16K

55.0

77.2

对于更短的上下文长度,我们仍然能看到速度提升,尽管最多快 1.6 倍。

📈 量化分析

我们将 GLM-5.3-Flash 量化到 UD-IQ1_S 1bit(93.09GB),在体积比 BF16(641.64GB)缩小 85% 的同时,仍保留 71% 的 top-1% 准确率

动态 2-bit UD-Q2_K_XL 为 109GB,体积缩小 83%,并保留 78% 的准确率。 动态 3-bit UD-IQ3_XXS 为 120GB,体积缩小 81%,并保留 82% 的准确率。 动态 4-bit UD-Q4_K_XL 为 200GB,体积缩小 69%,并保留 93% 的准确率。

量化
大小
top-1 准确率
平均 KLD
KLD 99.9%

UD-IQ1_S

93.09

70.89%

0.669714

9.1658

UD-IQ1_M

97.58

73.06%

0.572413

8.5069

UD-IQ2_XXS

101.84

76.30%

0.450148

7.5764

UD-Q2_K_XL

108.72

78.34%

0.380134

6.8412

UD-IQ3_XXS

120.37

81.63%

0.283772

5.9611

UD-Q3_K_XL

147.54

86.25%

0.159697

4.0281

UD-IQ4_XS

156.82

88.18%

0.116652

3.1014

UD-Q4_K_XL

199.71

92.22%

0.049294

1.4894

UD-Q5_K_XL

240.31

94.35%

0.027052

0.8696

UD-Q6_K_XL

291.83

95.23%

0.019007

0.6267

在本地运行 GLM-5.3-Flash(Ox-Alpha)

你现在可以通过我们专门的 PR在 Unsloth Desktop 和 llama.cpp 中运行 GLM-5.3-Flash(Ox-Alpha)。 UD-IQ3_XXS 我们在演示中使用 3-bit,因为它适合 128GB 设备。你可以随意更改量化类型。

在 Unsloth Desktop 中运行在 llama.cpp 中运行

🦥 在 Unsloth 中运行 GLM-5.3-Flash

GLM-5.3-Flash 现在可以在 Unsloth Desktop中运行,这是一个用于本地 AI 的开源 UI 应用。 Unsloth 会自动卸载到 RAM 并检测多 GPU 配置。使用 Unsloth Desktop,你可以在以下平台本地运行模型: MacOS、Windows、Linux 以及:

1

安装 Unsloth

最简单的开始方式是下载 Unsloth Desktop 应用。适用于 macOS, Windows,以及 Linux.

下载 Unsloth

或者,如果你更愿意手动安装:

MacOS、Linux、WSL:

Windows PowerShell:

2

搜索并下载 GLM-5.3-Flash

前往 Unsloth Chat 或 Model hub,在搜索栏中搜索 GLM-5.3-Flash,下载你想要的模型和量化版本。

3

运行 GLM-5.3-Flash

使用 Unsloth 时,推理参数应会自动设置,不过你仍然可以手动修改。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息可查看我们的 Unsloth 推理指南。1-bit 运行如下:

4

使用 Unsloth API 部署 GLM-5.3-Flash

你可以使用 unsloth run 命令,并通过以下方式使用 API 部署 GLM-5.3-Flash: llama-server 运行时标志,包括上下文大小、GPU 层数、线程、采样、网络和工具配置。更多信息请参见我们的 API 文档unsloth start.

5

Unsloth 现已就绪

你还可以通过 Unsloth Desktop 用 GLM-5.3-Flash 做许多其他事情,例如:

🦙 在 llama.cpp 中运行 GLM-5.3-Flash

1

我们需要使用我们专门的 llama.cpp PR 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——Metal 支持默认开启。

2

要运行该模型,你可以这样做:

3

然后运行它:

UD-IQ3_XXS 替换为你偏好的量化版本,例如 IQ2_XXS 在上传后可用于 2-bit。

📊 基准测试

基准

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

编程

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE

v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

智能体

Toolathlon Verified

78.4

59.9

75.9

76.2

74.9

-

AutomationBench

v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

带工具的 HLE

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

视觉

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv 推理

带工具

89.4

-

80.4

89.9

88.0

88.7

Chartography

带工具

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

最后更新于

这有帮助吗?