For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.1 - 如何在本地运行

在你自己的本地设备上运行 Z.ai 的新 GLM-5.1 模型!

GLM-5.1 是 Z.ai 的新开源模型。与 GLM-5相比,它在编码、智能体工具使用、推理、角色扮演、长程智能体任务以及整体聊天质量方面都有重大提升。

完整的 744B 参数(40B 激活)GLM-5.1 模型有一个 200K 上下文 窗口,并需要 1.65TB 的磁盘空间。Unsloth Dynamic 2-bit GGUF 将大小减少到 220GB (-80%),而 dynamic 1-bit 为 200GB(-85%): GLM-5.1-GGUF

所有上传都使用 Unsloth Dynamic 2.0 以获得最先进的量化性能——因此更低比特的版本会将重要层提升到 8 位或 16 位。感谢 Z.ai 让 Unsloth 在第一天就获得访问权限。

⚙️ 使用指南

中等的 2-bit 动态量化 UD-IQ2_M 使用 236GB 磁盘空间——这可以直接放在一台 256GB 统一内存的 Mac 上 并且在以下配置上表现良好: 1×24GB GPU 256GB 内存 ,并使用 MoE 卸载。该 1 位 量化版本可在 220GB RAM 上运行,而 8 位需要 805GB RAM。

推荐设置

针对不同用例使用不同设置:

默认设置(大多数任务)
Terminal Bench

temperature = 1.0

temperature = 0.7

top_p = 0.95

top_p = 1.0

最大新 token = 131072

最大新 token = 16384

  • 最大上下文窗口: 202,752.

  • 在 GLM-5.1 中,思考默认开启。要禁用思考:

聊天模板更新

GLM-5.1 采用与 GLM-5 相同的架构,只是 chat_template.jinja 不同。

  • 支持 Claude 的搜索工具。带有 defer_loading=True 的工具会从系统提示中省略,并改为显示在工具结果中。

  • 允许空的推理块(<think></think>)出现在助手消息中。连续的助手消息必须保持相同模式,要么都在思考,要么都不思考。

  • 总体而言,GLM-5.1 主要改进了工具暴露、推理历史重建以及工具消息渲染。

运行 GLM-5.1 教程:

你现在可以在以下环境中运行 GLM-5.1: llama.cppUnsloth Studio.

🦥 在 Unsloth Studio 中运行

GLM-5.1 现在可以在以下环境中运行: Unsloth Studio中运行和训练 Gemma 4 QAT,这是我们为本地 AI 推出的全新开源网页 UI。Unsloth Studio 可让你在 MacOS、Windows、Linux 以及:

1

安装 Unsloth

在终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://localhost:8888 在你的浏览器中。

3

搜索并下载 GLM-5.1

首次启动时,你需要创建一个密码来保护你的账户,并在之后重新登录。然后你会看到一个简短的引导向导,用于选择模型、数据集和基本设置。你可以随时跳过它。

你可以选择 UD-Q2_K_XL (dynamic 2bit 量化)或其他量化版本,例如 UD-Q4_K_XL 。我们 建议使用我们的 2bit 动态量化 UD-Q2_K_XL 以平衡大小和精度。如果下载卡住,请参阅 Hugging Face Hub、XET 调试

然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 GLM-5.1,并下载你想要的模型和量化版本。由于文件较大,下载需要一些时间,请耐心等待。为确保快速推理,请确保你有 足够的 RAM/VRAM,否则推理仍然可以运行,但 Unsloth 会卸载到你的 CPU。

4

运行 GLM-5.1

在使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。

更多信息请查看我们的 Unsloth Studio 推理指南.

🦙 在 llama.cpp 中运行

1

获取最新的 llama.cpp GitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后按常规继续——Metal 支持默认开启。

2

如果你想 llama.cpp 直接加载模型,你可以执行以下操作:(:IQ2_M)是量化类型。你也可以通过 Hugging Face 下载(第 3 点)。这类似于 ollama run 。使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 保存到特定位置。请记住,该模型的最大上下文长度只有 200K。

按照以下内容进行 通用说明 使用场景:

按照以下内容进行 工具调用 使用场景:

3

通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD-Q2_K_XL (dynamic 2bit 量化)或其他量化版本,例如 UD-Q4_K_XL 。我们 建议使用我们的 2bit 动态量化 UD-Q2_K_XL 以平衡大小和精度。如果下载卡住,请参阅 Hugging Face Hub、XET 调试

4

你可以修改 --threads 32 以设置 CPU 线程数, --ctx-size 16384 以设置上下文长度, --n-gpu-layers 2 以设置 GPU 负载到多少层。如果你的 GPU 内存不足,请尝试调整它。如果你只进行 CPU 推理,也请将其移除。

🦙 Llama-server 服务与 OpenAI 的补全库

要在生产环境部署 GLM-5.1,我们使用 llama-server 在新终端中,例如通过 tmux,使用以下方式部署模型:

然后在新终端中,在执行 pip install openai之后,执行:

然后你可以通过 OpenAI API 调用已部署的模型:

🔨GLM-5.1 的工具调用

参见 Tool Calling Guide 更多关于如何进行工具调用的细节。在新终端中(如果使用 tmux,请使用 CTRL+B+D),我们创建一些工具,例如加两个数、执行 Python 代码、执行 Linux 函数等等:

然后我们使用下面的函数(复制并粘贴后执行),它们会自动解析函数调用,并为任何模型调用 OpenAI 端点:

通过以下方式启动 GLM 5.1 后 llama-server 例如在 GLM-5.1 或者查看 Tool Calling Guide 了解更多细节后,我们就可以进行一些工具调用。

📊 基准测试

你可以在下方以表格形式查看 GLM-5.1 的基准测试:

基准
GLM-5.1
GLM-5
Qwen3.6-Plus
Minimax M2.7
DeepSeek-V3.2
Kimi K2.5
Claude Opus 4.6
Gemini 3.1 Pro
GPT-5.4

HLE

31.0

30.5

28.8

28.0

25.1

31.5

36.7

45.0

39.8

HLE(含工具)

52.3

50.4

50.6

-

40.8

51.8

53.1*

51.4*

52.1*

AIME 2026

95.3

95.4

95.1

89.8

95.1

94.5

95.6

98.2

98.7

HMMT 2025 年 11 月

94.0

96.9

94.6

81.0

90.2

91.1

96.3

94.8

95.8

HMMT 2026 年 2 月

82.6

82.8

87.8

72.7

79.9

81.3

84.3

87.3

91.8

IMOAnswerBench

83.8

82.5

83.8

66.3

78.3

81.8

75.3

81.0

91.4

GPQA-Diamond

86.2

86.0

90.4

87.0

82.4

87.6

91.3

94.3

92.0

SWE-Bench Pro

58.4

55.1

56.6

56.2

-

53.8

57.3

54.2

57.7

NL2Repo

42.7

35.9

37.9

39.8

-

32.0

49.8

33.4

41.3

Terminal-Bench 2.0 (Terminus-2)

63.5

56.2

61.6

-

39.3

50.8

65.4

68.5

-

Terminal-Bench 2.0 (Best self-reported)

66.5 (Claude Code)

56.2 (Claude Code)

-

57.0 (Claude Code)

46.4 (Claude Code)

-

-

-

75.1 (Codex)

CyberGym

68.7

48.3

-

-

17.3

41.3

66.6

-

-

BrowseComp

68.0

62.0

-

-

51.4

60.6

-

-

-

BrowseComp (w/ Context Manage)

79.3

75.9

-

-

67.6

74.9

84.0

85.9

82.7

τ³-Bench

70.6

69.2

70.7

67.6

69.2

66.0

72.4

67.1

72.9

MCP-Atlas(公开集)

71.8

69.2

74.1

48.8

62.2

63.8

73.8

69.2

67.2

Tool-Decathlon

40.7

38.0

39.8

46.3

35.2

27.8

47.2

48.8

54.6

Vending Bench 2

$5,634.00

$4,432.12

$5,114.87

-

$1,034.00

$1,198.46

$8,017.59

$911.21

$6,144.18

最后更新于

这有帮助吗?