For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.1 - ローカルでの実行方法

Z.aiの新しいGLM-5.1モデルを自分のローカルデバイスで実行しましょう!

GLM-5.1 は Z.ai の新しいオープンモデルです。GLM-5 と比べて GLM-5、コーディング、エージェント的なツール利用、推論、ロールプレイ、長期エージェントタスク、そして全体的なチャット品質が大幅に向上しています。

完全版の 744B パラメータ(40B アクティブ)の GLM-5.1 モデルには 200K コンテキスト ウィンドウがあり、必要なのは 1.65TB のディスク容量です。Unsloth Dynamic 2-bit GGUF にするとサイズは 220GB (-80%)になり、dynamic 1-bit は 200GB(-85%)です: GLM-5.1-GGUF

すべてのアップロードは Unsloth を使用します Dynamic 2.0 SOTA の量子化性能のためです。つまり、低ビットでは重要な層が 8 ビットまたは 16 ビットにアップキャストされます。初日からアクセスを提供してくれた Z.ai に感謝します。

⚙️ 使用ガイド

中サイズの 2-bit 動的量子化 UD-IQ2_M236GB のディスク容量を使用します。これは 256GBユニファイドメモリ搭載のMac に直接収まり、 1x24GB GPU および256GBのRAM MoE オフロード付きです。 1ビット この量子化版は 220GB の RAM に収まり、8-bit には 805GB の RAM が必要です。

推奨設定

用途ごとに異なる設定を使います:

デフォルト設定(ほとんどのタスク)
Terminal Bench

temperature = 1.0

temperature = 0.7

top_p = 0.95

top_p = 1.0

最大新規トークン数 = 131072

最大新規トークン数 = 16384

  • 最大コンテキストウィンドウ: 202,752.

  • GLM-5.1 では、思考はデフォルトで有効です。思考を無効にするには:

チャットテンプレートの更新

GLM-5.1 は GLM-5 と同じアーキテクチャを採用しており、ただ chat_template.jinja が異なります。

  • Claude の検索ツールをサポートします。以下を持つツールは defer_loading=True システムプロンプトから省略され、代わりにツール結果に表示されます。

  • 空の推論ブロック(<think></think>)をアシスタントメッセージで許可します。連続するアシスタントメッセージは、思考モードか非思考モードのどちらか同じモードのままでなければなりません。

  • 全体として、GLM-5.1 は主にツールの露出、推論履歴の再構築、ツールメッセージのレンダリングを改善しています。

GLM-5.1 のチュートリアルを実行:

GLM-5.1 を次の環境で実行できるようになりました: llama.cppUnsloth Studio.

🦥 Unsloth Studio で実行

GLM-5.1 は次の環境で実行できるようになりました: Unsloth Studio。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで次の環境上で実行できます: MacOS、Windows、Linux、および次の機能:

1

Unslothをインストール

ターミナルで実行:

MacOS、Linux、WSL:

Windows PowerShell:

2

Unslothを起動

MacOS、Linux、WSL、およびWindows:

次に開く http://localhost:8888 をブラウザーで。

3

GLM-5.1 を検索してダウンロード

初回起動時には、アカウントを保護し、後で再度サインインするためのパスワードを作成する必要があります。その後、モデル、データセット、基本設定を選ぶための簡単な初期設定ウィザードが表示されます。いつでもスキップできます。

次を選択できます UD-Q2_K_XL (dynamic 2bit 量子化) や、次のような他の量子化版も選べます: UD-Q4_K_XL 。私たちは 2bit 動的量子化の使用を推奨します UD-Q2_K_XL サイズと精度のバランスを取るためです。ダウンロードが止まる場合は、 Hugging Face Hub、XET デバッグ

次に〜へ移動し Unsloth Chat タブを開き、検索バーで GLM-5.1 を検索して、目的のモデルと量子化版をダウンロードしてください。サイズが大きいためダウンロードには時間がかかりますので、お待ちください。高速な推論を確実にするには、次を満たしていることを確認してください: 十分な RAM/VRAM。そうでなくても推論は動作しますが、Unsloth は CPU にオフロードします。

4

GLM-5.1 を実行

Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、次を参照してください Unsloth Studio推論ガイド.

🦙 llama.cpp で実行

1

最新の llama.cpp こちら GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

2

もし llama.cpp モデルを直接読み込むには、以下のようにできます(:IQ2_M)は量子化タイプです。Hugging Face 経由でもダウンロードできます(ポイント 3)。これは次と似ています: ollama run に似ています。 export LLAMA_CACHE="folder" して llama.cpp を使って特定の場所に保存します。モデルの最大コンテキスト長は 200K であることを忘れないでください。

これに従ってください: 一般的な指示 ユースケース:

これに従ってください: ツール呼び出し ユースケース:

3

(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hub hf_transfer をインストールした後)。 UD-Q2_K_XL (dynamic 2bit 量子化) や、次のような他の量子化版も選べます: UD-Q4_K_XL 。私たちは 2bit 動的量子化の使用を推奨します UD-Q2_K_XL サイズと精度のバランスを取るためです。ダウンロードが止まる場合は、 Hugging Face Hub、XET デバッグ

4

次を編集できます --threads 32 CPUスレッド数として --ctx-size 16384 コンテキスト長として --n-gpu-layers 2 GPUオフロードする層数として指定します。GPUのメモリ不足が起きる場合は調整してください。CPUのみで推論する場合は削除してください。

🦙 Llama-server の提供と OpenAI の completion ライブラリ

GLM-5.1 を本番環境にデプロイするには、次を使用します llama-server 新しいターミナルで、tmux などを使って、次の方法でモデルをデプロイします:

その後、新しいターミナルで、次を行ってから pip install openai、次を実行します:

その後、OpenAI API 経由で提供中のモデルを呼び出せます:

🔨GLM-5.1 でのツール呼び出し

参照 Tool Calling Guide ツール呼び出しの方法の詳細については、こちらをご覧ください。新しいターミナルで(tmux を使っている場合は CTRL+B+D)、2つの数値を加算する、Python コードを実行する、Linux の関数を実行するなど、いくつかのツールを作成します:

その後、以下の関数を使用します(コピーして貼り付けて実行してください)。これにより関数呼び出しを自動的に解析し、任意のモデルに対して OpenAI エンドポイントを呼び出します:

GLM-5.1 を次で起動した後: llama-server 次のように GLM-5.1 または次を参照: Tool Calling Guide 詳細については、その後いくつかのツール呼び出しを行えます。

📊 ベンチマーク

GLM-5.1 のベンチマークは、下の表形式でご覧いただけます:

ベンチマーク
GLM-5.1
GLM-5
Qwen3.6-Plus
Minimax M2.7
DeepSeek-V3.2
Kimi K2.5
Claude Opus 4.6
Gemini 3.1 Pro
GPT-5.4

HLE

31.0

30.5

28.8

28.0

25.1

31.5

36.7

45.0

39.8

HLE(ツール付き)

52.3

50.4

50.6

-

40.8

51.8

53.1*

51.4*

52.1*

AIME 2026

95.3

95.4

95.1

89.8

95.1

94.5

95.6

98.2

98.7

HMMT 2025年11月

94.0

96.9

94.6

81.0

90.2

91.1

96.3

94.8

95.8

HMMT 2026年2月

82.6

82.8

87.8

72.7

79.9

81.3

84.3

87.3

91.8

IMOAnswerBench

83.8

82.5

83.8

66.3

78.3

81.8

75.3

81.0

91.4

GPQA-Diamond

86.2

86.0

90.4

87.0

82.4

87.6

91.3

94.3

92.0

SWE-Bench Pro

58.4

55.1

56.6

56.2

-

53.8

57.3

54.2

57.7

NL2Repo

42.7

35.9

37.9

39.8

-

32.0

49.8

33.4

41.3

Terminal-Bench 2.0 (Terminus-2)

63.5

56.2

61.6

-

39.3

50.8

65.4

68.5

-

Terminal-Bench 2.0(自己報告ベスト)

66.5 (Claude Code)

56.2 (Claude Code)

-

57.0 (Claude Code)

46.4 (Claude Code)

-

-

-

75.1 (Codex)

CyberGym

68.7

48.3

-

-

17.3

41.3

66.6

-

-

BrowseComp

68.0

62.0

-

-

51.4

60.6

-

-

-

BrowseComp(Context Manage あり)

79.3

75.9

-

-

67.6

74.9

84.0

85.9

82.7

τ³-Bench

70.6

69.2

70.7

67.6

69.2

66.0

72.4

67.1

72.9

Tool-Decathlon

71.8

69.2

74.1

48.8

62.2

63.8

73.8

69.2

67.2

Tool-Decathlon

40.7

38.0

39.8

46.3

35.2

27.8

47.2

48.8

54.6

Vending Bench 2

$5,634.00

$4,432.12

$5,114.87

-

$1,034.00

$1,198.46

$8,017.59

$911.21

$6,144.18

最終更新

役に立ちましたか?