For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3 - ローカル実行方法

Z.ai の新しい GLM-5.3 モデルを実行します。

GLM-5.3 は Z.ai の新しい 744B パラメータ(40B アクティブ)モデルです。2026年8月時点で、GLM-5.3 は これまでで最強のオープンモデル であり、Terminal Bench 3.0 と Agents' Last Exam で SOTA を達成しています。GLM-5.3 は GLM-5.2と同じ基盤モデルを使用しており、性能向上はすべて事後学習によるものです。モデルには 100万トークンのコンテキスト ウィンドウがあり、現在は以下でローカル実行できます: Unsloth Dynamic GGUF を llama.cpp または Unsloth Desktop.

GLM-5.3-Flash ガイドGLM-5.3 ガイド

もし GLM-5.3-Flashを実行したいなら、こちらの 専用記事 をお読みください。

Dynamic 1-bit GGUF は ~76% トップ1精度を達成しながら 85% 小型です。Dynamic 2-bit は ~81% 精度を達成しながら 83% 小型です。GLM-5.3 はサイズとアーキテクチャが GLM-5.2 と同じなので、ほとんどの要件/設定も同じです。Unsloth の発売当日アクセスを提供してくれた Z.ai に感謝します。 GLM-5.3-GGUF

⚙️ 使用ガイド

2-bit 動的量子化 UD-IQ2_M239GB のディスク容量を使用し、 256GB RAM を搭載した 2x NVIDIA DGX Spark や Mac Studio のようなデバイスで快適に動作します。

その 1-bit 量子化は 223GB RAM で収まり、8-bit には 810GB RAM が必要です。

表:推論ハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、またはユニファイドメモリ)

1-bit
2-bit
3-bit
4-bit
6-bit
8-bit

223GB

245GB

290~360GB

372~475GB

570GB

810GB

最高の性能を得るには、VRAM とシステム RAM を含む利用可能な合計メモリが、量子化モデルファイルサイズを十分に上回っていることを確認してください。

推奨設定

GLM-5.3 には 3 つの思考モード: Low, HighMaxがあります。複雑なコーディング作業には Max Thinking を使ってください。In Unsloth Desktop では、UI で Low、High、Max Thinking を簡単に切り替えられます。

ほとんどの用途では、以下の設定を使ってください:

デフォルト設定(ほとんどのタスク)
長時間のエージェントタスク

temperature = 1.0

temperature = 1.0

top_p = 0.95

top_p = 1.0

その 最大コンテキストウィンドウ 1,048,576.

GLM-5.3 はデフォルトで最大推論を使用し、thinking は無効化できません。 reasoning_effortlow, high、または max.

clear_thinking はデフォルトで false で、true を推奨しています。

推論 effort のカスタマイズ('low' を 'high' または 'max' に変更):

複数ターンのチャットでは、 clear_thinking=true を使って前のターンの推論を削除してください(このモデルでは推奨):

チャットテンプレートの修正

GLM には興味深い .{id}. というチャットテンプレートの表記があることが分かりましたが、多くのエンジンはこれをサポートしていません。そこで、すべて [id] に変更しました。つまり Python のリストインデックス構文です。詳しくはこの コミット変更 をご覧ください。

GLM-5.3 チュートリアルを実行:

これで、 llama.cpp および Unsloth Desktopで GLM-5.3 を実行できるようになりました。可用性と精度の最適なバランスのため、239GB の UD-IQ2_M 量子化版を使います。

🦥 Unsloth で GLM-5.3 を実行

GLM-5.3 は現在 Unsloth Desktop、ローカル AI 向けのオープンソース UI アプリです。 Unsloth は RAM へのオフロードとマルチ GPU 構成の検出を自動で行います。Unsloth Desktop を使えば、次の環境でローカルにモデルを実行できます: MacOS、Windows、Linux、そして:

1

Unsloth をインストール

始める最も簡単な方法は、 Unsloth Desktop アプリをダウンロードすることです。 macOS, WindowsLinux.

Unsloth をダウンロード

または、手動インストールしたい場合:

MacOS、Linux、WSL:

Windows PowerShell:

2

GLM-5.3 を検索してダウンロード

次へ移動 Unsloth Chat または Model hub に行き、検索バーで GLM-5.3 を検索して、目的のモデルと量子化版をダウンロードしてください。

3

GLM-5.3 を実行

Unsloth を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、こちらの Unsloth 推論ガイド.

4

Unsloth API で GLM-5.3 を提供

次を使用できます unsloth run コマンドを使い、以下を用いて API 経由で GLM-5.3 を提供できます llama-server 実行時フラグ。コンテキストサイズ、GPU レイヤー、スレッディング、サンプリング、ネットワーキング、ツール設定を含みます。詳しくは API ドキュメント または unsloth start.

5

Unsloth の準備ができました

Unsloth Desktop を通じて GLM-5.3 で他にもいろいろできます。たとえば:

🦙 llama.cpp で GLM-5.3 を実行

このガイドでは、 UD-IQ2_M 量子化版を実行します。これには少なくとも 245GB RAM が必要です。量子化タイプは自由に変更してください。これらのチュートリアルでは、 llama.cpp を高速ローカル推論に使用します。GGUF: GLM-5.3-GGUF

1

最新の llama.cpp を取得 GitHub はこちら。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON-DGGML_CUDA=OFF に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合です。 Apple Mac / Metal デバイスでは-DGGML_CUDA=OFF を設定し、その後は通常どおり続けてください。Metal サポートはデフォルトで有効です。

2

これで llama.cpp を直接使ってモデルを読み込み、ダウンロードできます。 ollama run。まず、 UD-IQ2_Mのように希望する量子化タイプを選択してください。さらに export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" を使って llama.cpp を特定の場所に保存するよう強制できます。 このダウンロード処理は非常に遅くなる可能性があることに注意してください。そのため、次のセクションの手動ダウンロード手順を使う方がよいでしょう。

3

モデルを手動でダウンロードしたい場合 (かなり高速です!)、以下のコードでモデルをダウンロードできます( pip install huggingface_hubのインストール後)。ダウンロードが止まる場合は、こちらを参照: Hugging Face Hub、XET デバッグ

動的 1-bit を使いたい場合は、次のようにします:

4

次に、会話モードでモデルを実行します。 unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf 2bit なら unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf 1bit なら。

5

GLM-5.2 と同様に、llama-cli を起動すると次が表示されます:

その後のプロンプトでは、 UD-IQ1_S を使ってクールな小さな Snake ゲームを作りました。1-bit で、GLM-5.3 でもうまく動作しました!

📐 KV Cache 量子化による長文コンテキスト

llama.cpp で長文コンテキストを利用するには、KV キャッシュ量子化を使ってメモリ使用量を削減します。

現在、以下の KV キャッシュ dtype がサポートされています: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0q5_1。デフォルトでは f16 が使用されます。 q4_1 は重み 1 つあたり約 5 ビットを使用し、約 3.2倍長いコンテキスト長.

量子化分析

アップロードした量子化版についても KLD を実行したところ、Q4_K_XL と Q5_K_XL がベースラインに非常に近いことが分かったので、そのあたりを目指してください。

量子化版
GB
トップ1 %
平均 KLD
99.9% KLD
PPL

UD-IQ1_S

216.7

72.56

0.687991

9.104

4.6130

UD-IQ1_M

228.5

75.64

0.565455

8.595

4.1410

UD-IQ2_M

238.6

78.53

0.453992

7.717

3.7433

UD-Q2_K_XL

253.9

80.93

0.374219

7.076

3.5048

UD-IQ3_XXS

281.7

84.15

0.272796

6.252

3.2482

UD-Q3_K_XL

343.0

88.86

0.141406

4.127

2.9107

UD-IQ4_XS

365.3

90.59

0.101496

3.177

2.8460

UD-Q4_K_XL

467.3

94.29

0.036922

1.309

2.7006

UD-Q5_K_XL

562.5

95.82

0.019728

0.786

2.6842

UD-Q6_K_XL

684.4

96.59

0.013257

0.534

2.6771

📊 ベンチマーク

GLM-5.3 の主要なベンチマーク改善を、下の表形式で確認できます:

ベンチマーク

GLM-5.3

GLM-5.2

Kimi K3

DeepSeek-V4

Pro-0813

Qwen3.8-Max

Opus 4.8

Fable 5

(フォールバック付き)

GPT-5.6 Sol

コーディング

Terminal Bench 2.1

88.2

81.0

88.3

87.9

86.6

85.0

88.0

88.8

Terminal Bench 3.0

28.3

4.6

17.4

-

-

21.1

33.7

34.6

DeepSWE

v1.1

66.9

46.2

67.5

62.7

56.6

58.0

69.7

72.7

NL2Repo

58.0

48.9

58.0

61.1

55.9

69.7

-

-

ProgramBench

ほぼ解決

19.0

9.5

17.5

-

10.5

15.5

33.0

23.0

FrontierSWE

78.1

67.5

-

-

-

66.5

88.2

-

SWE-Marathon

v1.1

42.5

19.4

48.1

-

-

48.8

33.1

42.5

PostTrainBench

39.8

31.7

32.0

-

-

32.9

41.8

36.2

サイバー

CyberGym

84.5

77.2

80.0

83.3

78.5

78.1

83.8

83.6

ExploitGym

2h / 6h

105 / 130

29 / 39

36 / 70

-

14 / 26

80 / 120

181 / 247

216 / 293

ExploitBench

54.4

24.4

32.2

-

28.8

40.0

78.0

76.5

エージェント型

Toolathlon 検証済み

73.0

59.9

76.5

74.1

72.5

76.2

74.7

74.9

AutomationBench

v1.0.6

48.2

26.2

46.7

43.2

39.8

41.0

46.2

45.8

Agents' Last Exam

ALE-CLI

28.5

23.8

27.6

25.7

27.0

25.7

23.8

28.6

ツール付き HLE

62.5

54.7

59.8

60.0

56.2

57.9

63.9

64.5

GDPval-AA v2

1769

1508

1682

1590

1739

1588

1743

1730

最終更新

役に立ちましたか?