GLM-5.3 - ローカル実行方法
Z.ai の新しい GLM-5.3 モデルを実行します。
GLM-5.3 は Z.ai の新しい 744B パラメータ(40B アクティブ)モデルです。2026年8月時点で、GLM-5.3 は これまでで最強のオープンモデル であり、Terminal Bench 3.0 と Agents' Last Exam で SOTA を達成しています。GLM-5.3 は GLM-5.2と同じ基盤モデルを使用しており、性能向上はすべて事後学習によるものです。モデルには 100万トークンのコンテキスト ウィンドウがあり、現在は以下でローカル実行できます: Unsloth Dynamic GGUF を llama.cpp または Unsloth Desktop.
Dynamic 1-bit GGUF は ~76% トップ1精度を達成しながら 85% 小型です。Dynamic 2-bit は ~81% 精度を達成しながら 83% 小型です。GLM-5.3 はサイズとアーキテクチャが GLM-5.2 と同じなので、ほとんどの要件/設定も同じです。Unsloth の発売当日アクセスを提供してくれた Z.ai に感謝します。 GLM-5.3-GGUF
⚙️ 使用ガイド
2-bit 動的量子化 UD-IQ2_M は 239GB のディスク容量を使用し、 256GB RAM を搭載した 2x NVIDIA DGX Spark や Mac Studio のようなデバイスで快適に動作します。
その 1-bit 量子化は 223GB RAM で収まり、8-bit には 810GB RAM が必要です。
表:推論ハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、またはユニファイドメモリ)
223GB
245GB
290~360GB
372~475GB
570GB
810GB
最高の性能を得るには、VRAM とシステム RAM を含む利用可能な合計メモリが、量子化モデルファイルサイズを十分に上回っていることを確認してください。

推奨設定
GLM-5.3 には 3 つの思考モード: Low, Highと Maxがあります。複雑なコーディング作業には Max Thinking を使ってください。In Unsloth Desktop では、UI で Low、High、Max Thinking を簡単に切り替えられます。
ほとんどの用途では、以下の設定を使ってください:
temperature = 1.0
temperature = 1.0
top_p = 0.95
top_p = 1.0
その 最大コンテキストウィンドウ は 1,048,576.
GLM-5.3 はデフォルトで最大推論を使用し、thinking は無効化できません。 reasoning_effort は low, high、または max.
clear_thinking はデフォルトで false で、true を推奨しています。
推論 effort のカスタマイズ('low' を 'high' または 'max' に変更):
複数ターンのチャットでは、 clear_thinking=true を使って前のターンの推論を削除してください(このモデルでは推奨):
チャットテンプレートの修正
GLM には興味深い .{id}. というチャットテンプレートの表記があることが分かりましたが、多くのエンジンはこれをサポートしていません。そこで、すべて [id] に変更しました。つまり Python のリストインデックス構文です。詳しくはこの コミット変更 をご覧ください。

GLM-5.3 チュートリアルを実行:
これで、 llama.cpp および Unsloth Desktopで GLM-5.3 を実行できるようになりました。可用性と精度の最適なバランスのため、239GB の UD-IQ2_M 量子化版を使います。
🦥 Unsloth で GLM-5.3 を実行
GLM-5.3 は現在 Unsloth Desktop、ローカル AI 向けのオープンソース UI アプリです。 Unsloth は RAM へのオフロードとマルチ GPU 構成の検出を自動で行います。Unsloth Desktop を使えば、次の環境でローカルにモデルを実行できます: MacOS、Windows、Linux、そして:
検索、ダウンロード、 GGUF を実行、MLX および safetensor モデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-p など)
MLX と llama.cpp による高速 CPU + GPU 推論
LLM を学習 VRAM を 70% 削減しつつ 2倍高速

Unsloth をインストール
始める最も簡単な方法は、 Unsloth Desktop アプリをダウンロードすることです。 macOS, Windowsと Linux.
または、手動インストールしたい場合:
MacOS、Linux、WSL:
Windows PowerShell:
GLM-5.3 を検索してダウンロード
次へ移動 Unsloth Chat または Model hub に行き、検索バーで GLM-5.3 を検索して、目的のモデルと量子化版をダウンロードしてください。

GLM-5.3 を実行
Unsloth を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、こちらの Unsloth 推論ガイド.
Unsloth API で GLM-5.3 を提供
次を使用できます unsloth run コマンドを使い、以下を用いて API 経由で GLM-5.3 を提供できます llama-server 実行時フラグ。コンテキストサイズ、GPU レイヤー、スレッディング、サンプリング、ネットワーキング、ツール設定を含みます。詳しくは API ドキュメント または unsloth start.
Unsloth の準備ができました
Unsloth Desktop を通じて GLM-5.3 で他にもいろいろできます。たとえば:
ツール接続: , , , など
モデルを学習: テキスト、拡散、 埋め込みなどを微調整
メディア生成: 作成して学習 、動画、 をローカルで

🦙 llama.cpp で GLM-5.3 を実行
このガイドでは、 UD-IQ2_M 量子化版を実行します。これには少なくとも 245GB RAM が必要です。量子化タイプは自由に変更してください。これらのチュートリアルでは、 llama.cpp を高速ローカル推論に使用します。GGUF: GLM-5.3-GGUF
最新の llama.cpp を取得 GitHub はこちら。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON を -DGGML_CUDA=OFF に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合です。 Apple Mac / Metal デバイスでは、 -DGGML_CUDA=OFF を設定し、その後は通常どおり続けてください。Metal サポートはデフォルトで有効です。
これで llama.cpp を直接使ってモデルを読み込み、ダウンロードできます。 ollama run。まず、 UD-IQ2_Mのように希望する量子化タイプを選択してください。さらに export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" を使って llama.cpp を特定の場所に保存するよう強制できます。 このダウンロード処理は非常に遅くなる可能性があることに注意してください。そのため、次のセクションの手動ダウンロード手順を使う方がよいでしょう。
モデルを手動でダウンロードしたい場合 (かなり高速です!)、以下のコードでモデルをダウンロードできます( pip install huggingface_hubのインストール後)。ダウンロードが止まる場合は、こちらを参照: Hugging Face Hub、XET デバッグ
動的 1-bit を使いたい場合は、次のようにします:
次に、会話モードでモデルを実行します。 unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf 2bit なら unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf 1bit なら。
GLM-5.2 と同様に、llama-cli を起動すると次が表示されます:

その後のプロンプトでは、 UD-IQ1_S を使ってクールな小さな Snake ゲームを作りました。1-bit で、GLM-5.3 でもうまく動作しました!

📐 KV Cache 量子化による長文コンテキスト
llama.cpp で長文コンテキストを利用するには、KV キャッシュ量子化を使ってメモリ使用量を削減します。
現在、以下の KV キャッシュ dtype がサポートされています: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0と q5_1。デフォルトでは f16 が使用されます。 q4_1 は重み 1 つあたり約 5 ビットを使用し、約 3.2倍長いコンテキスト長.
量子化分析
アップロードした量子化版についても KLD を実行したところ、Q4_K_XL と Q5_K_XL がベースラインに非常に近いことが分かったので、そのあたりを目指してください。

UD-IQ1_S
216.7
72.56
0.687991
9.104
4.6130
UD-IQ1_M
228.5
75.64
0.565455
8.595
4.1410
UD-IQ2_M
238.6
78.53
0.453992
7.717
3.7433
UD-Q2_K_XL
253.9
80.93
0.374219
7.076
3.5048
UD-IQ3_XXS
281.7
84.15
0.272796
6.252
3.2482
UD-Q3_K_XL
343.0
88.86
0.141406
4.127
2.9107
UD-IQ4_XS
365.3
90.59
0.101496
3.177
2.8460
UD-Q4_K_XL
467.3
94.29
0.036922
1.309
2.7006
UD-Q5_K_XL
562.5
95.82
0.019728
0.786
2.6842
UD-Q6_K_XL
684.4
96.59
0.013257
0.534
2.6771
📊 ベンチマーク
GLM-5.3 の主要なベンチマーク改善を、下の表形式で確認できます:


ベンチマーク
GLM-5.3
GLM-5.2
Kimi K3
DeepSeek-V4
Pro-0813
Qwen3.8-Max
Opus 4.8
Fable 5
(フォールバック付き)
GPT-5.6 Sol
コーディング
Terminal Bench 2.1
88.2
81.0
88.3
87.9
86.6
85.0
88.0
88.8
Terminal Bench 3.0
28.3
4.6
17.4
-
-
21.1
33.7
34.6
DeepSWE
v1.1
66.9
46.2
67.5
62.7
56.6
58.0
69.7
72.7
NL2Repo
58.0
48.9
58.0
61.1
55.9
69.7
-
-
ProgramBench
ほぼ解決
19.0
9.5
17.5
-
10.5
15.5
33.0
23.0
FrontierSWE
78.1
67.5
-
-
-
66.5
88.2
-
SWE-Marathon
v1.1
42.5
19.4
48.1
-
-
48.8
33.1
42.5
PostTrainBench
39.8
31.7
32.0
-
-
32.9
41.8
36.2
サイバー
CyberGym
84.5
77.2
80.0
83.3
78.5
78.1
83.8
83.6
ExploitGym
2h / 6h
105 / 130
29 / 39
36 / 70
-
14 / 26
80 / 120
181 / 247
216 / 293
ExploitBench
54.4
24.4
32.2
-
28.8
40.0
78.0
76.5
エージェント型
Toolathlon 検証済み
73.0
59.9
76.5
74.1
72.5
76.2
74.7
74.9
AutomationBench
v1.0.6
48.2
26.2
46.7
43.2
39.8
41.0
46.2
45.8
Agents' Last Exam
ALE-CLI
28.5
23.8
27.6
25.7
27.0
25.7
23.8
28.6
ツール付き HLE
62.5
54.7
59.8
60.0
56.2
57.9
63.9
64.5
GDPval-AA v2
1769
1508
1682
1590
1739
1588
1743
1730
最終更新
役に立ちましたか?

