GLM-5.1 - 如何在本地运行
在你自己的本地设备上运行 Z.ai 的新 GLM-5.1 模型!
GLM-5.1 是 Z.ai 的新开源模型。与 GLM-5相比,它在编码、智能体工具使用、推理、角色扮演、长程智能体任务以及整体聊天质量方面都有重大提升。
完整的 744B 参数(40B 激活)GLM-5.1 模型有一个 200K 上下文 窗口,并需要 1.65TB 的磁盘空间。Unsloth Dynamic 2-bit GGUF 将大小减少到 220GB (-80%),而 dynamic 1-bit 为 200GB(-85%): GLM-5.1-GGUF
所有上传都使用 Unsloth Dynamic 2.0 以获得最先进的量化性能——因此更低比特的版本会将重要层提升到 8 位或 16 位。感谢 Z.ai 让 Unsloth 在第一天就获得访问权限。
⚙️ 使用指南
中等的 2-bit 动态量化 UD-IQ2_M 使用 236GB 磁盘空间——这可以直接放在一台 256GB 统一内存的 Mac 上 并且在以下配置上表现良好: 1×24GB GPU 和 256GB 内存 ,并使用 MoE 卸载。该 1 位 量化版本可在 220GB RAM 上运行,而 8 位需要 805GB RAM。
为了获得最佳性能,请确保你的可用总内存(VRAM + 系统 RAM)大于你正在下载的量化模型文件大小。否则,llama.cpp 仍然可以通过 SSD/HDD 卸载运行,但推理速度会更慢。
推荐设置
针对不同用例使用不同设置:
temperature = 1.0
temperature = 0.7
top_p = 0.95
top_p = 1.0
最大新 token = 131072
最大新 token = 16384
最大上下文窗口:
202,752.在 GLM-5.1 中,思考默认开启。要禁用思考:
聊天模板更新
GLM-5.1 采用与 GLM-5 相同的架构,只是 chat_template.jinja 不同。
支持 Claude 的搜索工具。带有
defer_loading=True的工具会从系统提示中省略,并改为显示在工具结果中。允许空的推理块(
<think></think>)出现在助手消息中。连续的助手消息必须保持相同模式,要么都在思考,要么都不思考。总体而言,GLM-5.1 主要改进了工具暴露、推理历史重建以及工具消息渲染。
运行 GLM-5.1 教程:
你现在可以在以下环境中运行 GLM-5.1: llama.cpp 和 Unsloth Studio.
🦥 在 Unsloth Studio 中运行
GLM-5.1 现在可以在以下环境中运行: Unsloth Studio中运行和训练 Gemma 4 QAT,这是我们为本地 AI 推出的全新开源网页 UI。Unsloth Studio 可让你在 MacOS、Windows、Linux 以及:

搜索并下载 GLM-5.1
首次启动时,你需要创建一个密码来保护你的账户,并在之后重新登录。然后你会看到一个简短的引导向导,用于选择模型、数据集和基本设置。你可以随时跳过它。
你可以选择 UD-Q2_K_XL (dynamic 2bit 量化)或其他量化版本,例如 UD-Q4_K_XL 。我们 建议使用我们的 2bit 动态量化 UD-Q2_K_XL 以平衡大小和精度。如果下载卡住,请参阅 Hugging Face Hub、XET 调试
然后前往 Unsloth Chat 选项卡,在搜索栏中搜索 GLM-5.1,并下载你想要的模型和量化版本。由于文件较大,下载需要一些时间,请耐心等待。为确保快速推理,请确保你有 足够的 RAM/VRAM,否则推理仍然可以运行,但 Unsloth 会卸载到你的 CPU。

运行 GLM-5.1
在使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。
更多信息请查看我们的 Unsloth Studio 推理指南.
🦙 在 llama.cpp 中运行
获取最新的 llama.cpp 在 GitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后按常规继续——Metal 支持默认开启。
如果你想 llama.cpp 直接加载模型,你可以执行以下操作:(:IQ2_M)是量化类型。你也可以通过 Hugging Face 下载(第 3 点)。这类似于 ollama run 。使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 保存到特定位置。请记住,该模型的最大上下文长度只有 200K。
按照以下内容进行 通用说明 使用场景:
按照以下内容进行 工具调用 使用场景:
通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD-Q2_K_XL (dynamic 2bit 量化)或其他量化版本,例如 UD-Q4_K_XL 。我们 建议使用我们的 2bit 动态量化 UD-Q2_K_XL 以平衡大小和精度。如果下载卡住,请参阅 Hugging Face Hub、XET 调试
你可以修改 --threads 32 以设置 CPU 线程数, --ctx-size 16384 以设置上下文长度, --n-gpu-layers 2 以设置 GPU 负载到多少层。如果你的 GPU 内存不足,请尝试调整它。如果你只进行 CPU 推理,也请将其移除。
🦙 Llama-server 服务与 OpenAI 的补全库
要在生产环境部署 GLM-5.1,我们使用 llama-server 在新终端中,例如通过 tmux,使用以下方式部署模型:
然后在新终端中,在执行 pip install openai之后,执行:
然后你可以通过 OpenAI API 调用已部署的模型:
🔨GLM-5.1 的工具调用
参见 Tool Calling Guide 更多关于如何进行工具调用的细节。在新终端中(如果使用 tmux,请使用 CTRL+B+D),我们创建一些工具,例如加两个数、执行 Python 代码、执行 Linux 函数等等:
然后我们使用下面的函数(复制并粘贴后执行),它们会自动解析函数调用,并为任何模型调用 OpenAI 端点:
通过以下方式启动 GLM 5.1 后 llama-server 例如在 GLM-5.1 或者查看 Tool Calling Guide 了解更多细节后,我们就可以进行一些工具调用。
📊 基准测试
你可以在下方以表格形式查看 GLM-5.1 的基准测试:


HLE
31.0
30.5
28.8
28.0
25.1
31.5
36.7
45.0
39.8
HLE(含工具)
52.3
50.4
50.6
-
40.8
51.8
53.1*
51.4*
52.1*
AIME 2026
95.3
95.4
95.1
89.8
95.1
94.5
95.6
98.2
98.7
HMMT 2025 年 11 月
94.0
96.9
94.6
81.0
90.2
91.1
96.3
94.8
95.8
HMMT 2026 年 2 月
82.6
82.8
87.8
72.7
79.9
81.3
84.3
87.3
91.8
IMOAnswerBench
83.8
82.5
83.8
66.3
78.3
81.8
75.3
81.0
91.4
GPQA-Diamond
86.2
86.0
90.4
87.0
82.4
87.6
91.3
94.3
92.0
SWE-Bench Pro
58.4
55.1
56.6
56.2
-
53.8
57.3
54.2
57.7
NL2Repo
42.7
35.9
37.9
39.8
-
32.0
49.8
33.4
41.3
Terminal-Bench 2.0 (Terminus-2)
63.5
56.2
61.6
-
39.3
50.8
65.4
68.5
-
Terminal-Bench 2.0 (Best self-reported)
66.5 (Claude Code)
56.2 (Claude Code)
-
57.0 (Claude Code)
46.4 (Claude Code)
-
-
-
75.1 (Codex)
CyberGym
68.7
48.3
-
-
17.3
41.3
66.6
-
-
BrowseComp
68.0
62.0
-
-
51.4
60.6
-
-
-
BrowseComp (w/ Context Manage)
79.3
75.9
-
-
67.6
74.9
84.0
85.9
82.7
τ³-Bench
70.6
69.2
70.7
67.6
69.2
66.0
72.4
67.1
72.9
MCP-Atlas(公开集)
71.8
69.2
74.1
48.8
62.2
63.8
73.8
69.2
67.2
Tool-Decathlon
40.7
38.0
39.8
46.3
35.2
27.8
47.2
48.8
54.6
Vending Bench 2
$5,634.00
$4,432.12
$5,114.87
-
$1,034.00
$1,198.46
$8,017.59
$911.21
$6,144.18
最后更新于
这有帮助吗?

