For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5:如何在本地运行指南

在你自己的本地设备上运行 Z.ai 的新 GLM-5 模型!

GLM-5 是 Z.ai 最新的推理模型,在编程、智能体和聊天方面的表现优于 GLM-4.7,并且专为长上下文推理而设计。它在 Humanity's Last Exam 上的性能提升至 50.4%(+7.6%)、BrowseComp 75.9%(+8.4%)以及 Terminal-Bench-2.0 61.1%(+28.3%)。

完整的 744B 参数(40B 激活)模型具有 20 万上下文 窗口,并在 28.5T 个 token 上预训练。完整的 GLM-5 模型需要 1.65TB 的磁盘空间,而 Unsloth Dynamic 2-bit GGUF 将大小缩减至 241GB (-85%),而动态 1 位版本为 176GB(-89%): GLM-5-GGUF

所有上传都使用 Unsloth Dynamic 2.0 以获得 SOTA 量化性能——因此 1 位版本会将重要层提升为 8 位或 16 位。感谢 Z.ai 为 Unsloth 提供首日访问权限。

⚙️ 使用指南

2 位动态量化 UD-IQ2_XXS 仅需 241GB 的磁盘空间——这可以直接装入 256GB 统一内存的 Mac,并且也适用于 1 张 24GB 显卡和 256GB RAM ,配合 MoE 卸载。 1 位 量化版本可在 180GB RAM 上运行,而 8 位需要 805GB RAM。

推荐设置

针对不同使用场景使用不同设置:

默认设置(大多数任务)
SWE Bench 验证版

temperature = 1.0

temperature = 0.7

top_p = 0.95

top_p = 1.0

max new tokens = 131072

max new tokens = 16384

repeat penalty = 关闭或 1.0

repeat penalty = 关闭或 1.0

  • Min_P = 0.01 (llama.cpp 的默认值是 0.05)

  • 最大上下文窗口: 202,752.

  • 对于多轮智能体任务(τ²-Bench 和 Terminal Bench 2),请开启保留\n思考模式。

运行 GLM-5 教程:

✨ 在 llama.cpp 中运行

1

获取最新的 llama.cpp GitHub 上。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——Metal 支持默认已开启。

2

如果你想使用 llama.cpp 直接加载模型,你可以执行下面的操作:(:IQ2_XXS) 是量化类型。你也可以通过 Hugging Face 下载(第 3 点)。这类似于 ollama run 。使用 export LLAMA_CACHE="folder" 以强制 llama.cpp 将其保存到指定位置。请记住,该模型的最大上下文长度只有 20 万。

请按照以下内容用于 通用说明 场景:

请按照以下内容用于 工具调用 场景:

3

在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD-Q2_K_XL (动态 2 位量化)或其他量化版本,例如 UD-Q4_K_XL 。我们 建议使用我们的 2 位动态量化 UD-Q2_K_XL 以平衡大小和准确性。如果下载卡住,请参阅 Hugging Face Hub、XET 调试

4

你可以修改 --threads 32 用于 CPU 线程数, --ctx-size 16384 用于上下文长度, --n-gpu-layers 2 用于 GPU 卸载的层数。若 GPU 显存不足,可尝试调整它;如果你只进行 CPU 推理,也请将其移除。

🦙 Llama-server 服务与 OpenAI 的补全库

要将 GLM-5 部署到生产环境,我们使用 llama-server 在一个新的终端中,例如通过 tmux,使用以下方式部署模型:

然后在一个新的终端中,在执行 pip install openai之后,执行:

然后你将得到以下贪吃蛇游戏示例:

💻 vLLM 部署

现在你可以通过 vLLM 提供 Z.ai 的 FP8 版本模型服务。你需要 860GB 或更多的显存,因此至少建议使用 8xH200(141x8 = 1128GB)。8xB200 也表现良好。首先,安装 vllm nightly 版本:

要禁用 FP8 KV Cache(可将内存占用减少 50%),请移除 --kv-cache-dtype fp8

然后你可以通过 OpenAI API 调用已部署的模型:

🔨使用 GLM 5 进行工具调用

参见 Tool Calling Guide 有关如何进行工具调用的更多细节。在新的终端中(如果使用 tmux,请按 CTRL+B+D),我们创建一些工具,例如加 2 个数字、执行 Python 代码、执行 Linux 命令等等:

然后我们使用下面的函数(复制、粘贴并执行),它们会自动解析函数调用,并为任何模型调用 OpenAI 端点:

通过 llama-server 就像在 GLM-5 或者参见 Tool Calling Guide 以了解更多细节,然后我们就可以进行一些工具调用。

📊 基准测试

你可以在下面以表格形式查看更多基准测试:

基准
GLM-5
GLM-4.7
DeepSeek-V3.2
Kimi K2.5
Claude Opus 4.5
Gemini 3 Pro
GPT-5.2 (xhigh)

HLE

30.5

24.8

25.1

31.5

28.4

37.2

35.4

HLE(含工具)

50.4

42.8

40.8

51.8

43.4*

45.8*

45.5*

AIME 2026 I

92.7

92.9

92.7

92.5

93.3

90.6

-

HMMT 2025年11月

96.9

93.5

90.2

91.1

91.7

93.0

97.1

IMOAnswerBench

82.5

82.0

78.3

81.8

78.5

83.3

86.3

GPQA-Diamond

86.0

85.7

82.4

87.6

87.0

91.9

92.4

SWE-bench 已验证

77.8

73.8

73.1

76.8

80.9

76.2

80.0

SWE-bench 多语言

73.3

66.7

70.2

73.0

77.5

65.0

72.0

Terminal-Bench 2.0(Terminus 2)

56.2 / 60.7 †

41.0

39.3

50.8

59.3

54.2

54.0

Terminal-Bench 2.0(Claude Code)

56.2 / 61.1 †

32.8

46.4

-

57.9

-

-

CyberGym

43.2

23.5

17.3

41.3

50.6

39.9

-

BrowseComp

62.0

52.0

51.4

60.6

37.0

37.8

-

BrowseComp(含上下文管理)

75.9

67.5

67.6

74.9

67.8

59.2

65.8

BrowseComp-中文

72.7

66.6

65.0

62.3

62.4

66.8

76.1

τ²-Bench

89.7

87.4

85.3

80.2

91.6

90.7

85.5

MCP-Atlas(公开集)

67.8

52.0

62.2

63.8

65.2

66.6

68.0

工具十项全能

38.0

23.8

35.2

27.8

43.5

36.4

46.3

自动售货机基准 2

$4,432.12

$2,376.82

$1,034.00

$1,198.46

$4,967.06

$5,478.16

$3,591.33

最后更新于

这有帮助吗?