GLM-4.7-Flash: ローカルでの実行方法
お使いのデバイスでGLM-4.7-Flashをローカル実行・ファインチューニングしましょう!
GLM-4.7-Flash は Z.ai の新しい 30B MoE 推論モデルで、ローカルデプロイ向けに構築されています。コーディング、エージェント的ワークフロー、チャットでクラス最高の性能を発揮します。約 36 億パラメータを使用し、200K コンテキストをサポートし、SWE-Bench、GPQA、推論/チャットのベンチマークで首位です。
GLM-4.7-Flash は次で動作します 24GB RAM/VRAM/統合メモリ(フル精度では 32GB)が必要で、現在は Unsloth でファインチューニングできます。vLLM で GLM 4.7 Flash を実行するには、こちらを参照してください GLM-4.7-Flash
1月21日更新: llama.cpp 誤った scoring_func: "softmax" (本来は "sigmoid"であるべき)。これがループと質の悪い出力の原因でした。GGUF を更新したので、より良い出力のためにモデルを再ダウンロードしてください。
現在は、Z.ai 推奨のパラメータを使って、素晴らしい結果を得られます:
一般用途:
--temp 1.0 --top-p 0.95ツール呼び出し用:
--temp 0.7 --top-p 1.0繰り返しペナルティ: 無効にするか、次を設定してください
--repeat-penalty 1.0
1月22日: CUDA 向けの FA 修正がマージされたため、より高速な推論が利用可能になりました。
実行する GLM-4.7-Flash GGUF: unsloth/GLM-4.7-Flash-GGUF
⚙️ 使用ガイド
最良の性能を得るには、利用可能な総メモリ(VRAM + システムRAM)が、ダウンロードする量子化モデルファイルのサイズを上回っていることを確認してください。そうでない場合でも、llama.cppはSSD/HDDオフロード経由で実行できますが、推論は遅くなります。
Z.ai のチームと話した結果、彼らは GLM-4.7 のサンプリングパラメータを使うことを推奨しています:
temperature = 1.0
temperature = 0.7
top_p = 0.95
top_p = 1.0
繰り返しペナルティ = 無効、または 1.0
繰り返しペナルティ = 無効、または 1.0
一般用途:
--temp 1.0 --top-p 0.95ツール呼び出し用:
--temp 0.7 --top-p 1.0llama.cpp を使う場合は、次を設定してください
--min-p 0.01llama.cpp のデフォルトは 0.05 だからですユースケースによって、どの数値が最適かは試してみる必要がある場合があります。
現時点では、 推奨しません この GGUF を Ollama 実行することは、チャットテンプレートの互換性に関する潜在的な問題があるためです。GGUF は llama.cpp(または LM Studio、Jan などのバックエンド)でうまく動作します。
繰り返しペナルティを無効にするのを忘れずに! または次を設定してください --repeat-penalty 1.0
最大コンテキストウィンドウ:
202,752
🖥️ GLM-4.7-Flash を実行
用途によっては、異なる設定を使う必要があります。いくつかの GGUF は、モデルアーキテクチャ(たとえば gpt-oss)は 128 で割り切れない次元を持っているため、一部はより低いビットに量子化できないからです。
このガイドでは 4-bit を使うため、約 18GB の RAM/統合メモリが必要です。最高の性能を得るには、少なくとも 4-bit 精度を使うことを推奨します。
現時点では、 推奨しません この GGUF を Ollama 実行することは、チャットテンプレートの互換性に関する潜在的な問題があるためです。GGUF は llama.cpp(または LM Studio、Jan などのバックエンド)でうまく動作します。
繰り返しペナルティを無効にするのを忘れずに! または次を設定してください --repeat-penalty 1.0
🦥 Unsloth Studioガイド
GLM-4.7-Flash は Unsloth Studioで実行およびファインチューニングできます。これはローカルAI向けの新しいオープンソースのWeb UIです。Unsloth Studio を使えば、モデルをローカルで MacOS、Windows、Linux、および次の機能:
検索、ダウンロード、 GGUFの実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cpp経由の高速CPU+GPU推論
LLMの学習 VRAMを70%削減しつつ2倍高速

Unslothをインストール
ターミナルで実行:
MacOS、Linux、WSL:
Windows PowerShell:
インストールはすぐ完了し、約1~2分かかります。
Unslothを起動
MacOS、Linux、WSL、およびWindows:
次に開く http://localhost:8888 をブラウザーで。
GLM-4.7-Flash を検索してダウンロード
初回起動時には、アカウントを保護し、後で再度サインインするためのパスワードを作成する必要があります。その後、モデル、データセット、基本設定を選ぶための簡単な初期設定ウィザードが表示されます。いつでもスキップできます。
次に〜へ移動し Unsloth Chat タブを開いて GLM-4.7-Flash を検索バーに入力し、目的のモデルと量子化版をダウンロードしてください。

GLM-4.7-Flash を実行
Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、次を参照してください Unsloth Studio推論ガイド.

Llama.cpp チュートリアル(GGUF):
llama.cpp で実行する手順(ほとんどのデバイスに収まるよう4ビットを使用します):
最新の llama.cpp こちら GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
Hugging Face から直接取得できます。RAM/VRAM の許す限り、コンテキストを 200K まで増やせます。
Z.ai 推奨の GLM-4.7 サンプリングパラメータも試せます:
一般用途:
--temp 1.0 --top-p 0.95ツール呼び出し用:
--temp 0.7 --top-p 1.0繰り返しペナルティを無効にするのを忘れずに!
これに従ってください: 一般的な指示 ユースケース:
これに従ってください: ツール呼び出し ユースケース:
(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hubをインストールした後)。 UD-Q4_K_XL または他の量子化版。ダウンロードが止まる場合は、こちらを参照してください Hugging Face Hub、XET デバッグ
それでは、会話モードでモデルを実行します:
また、 コンテキストウィンドウ 必要に応じて、最大で 202752
➿繰り返しとループを軽減
1月21日更新: llama.cpp は、誤った "scoring_func": "softmax" を指定していたバグを修正しました。これがループと質の悪い出力の原因でした(本来は sigmoid であるべきです)。GGUF を更新しました。より良い出力のためにモデルを再ダウンロードしてください。
つまり、Z.ai 推奨のパラメータを使って、素晴らしい結果を得られるようになったということです:
一般用途:
--temp 1.0 --top-p 0.95ツール呼び出し用:
--temp 0.7 --top-p 1.0llama.cpp を使う場合は、次を設定してください
--min-p 0.01llama.cpp のデフォルトは 0.05 だからです繰り返しペナルティを無効にするのを忘れずに! または次を設定してください
--repeat-penalty 1.0
追加しました "scoring_func": "sigmoid" を config.json メインモデル用 - 参照.
現時点では、 推奨しません この GGUF を Ollama 実行することは、チャットテンプレートの互換性に関する潜在的な問題があるためです。GGUF は llama.cpp(または LM Studio、Jan などのバックエンド)でうまく動作します。
🐦UD-Q4_K_XL を使った Flappy Bird の例
例として、UD-Q4_K_XL を使って次の長い会話を行いました via ./llama.cpp/llama-cli --model unsloth/GLM-4.7-Flash-GGUF/GLM-4.7-Flash-UD-Q4_K_XL.gguf --fit on --temp 1.0 --top-p 0.95 --min-p 0.01 :
すると、次の Flappy Bird ゲームが HTML 形式でレンダリングされました:
そして、いくつかスクリーンショットを撮りました(4bit は動作します):


🦥 GLM-4.7-Flash のファインチューニング
現在 Unsloth は GLM-4.7-Flash のファインチューニングをサポートしていますが、次を使う必要があります transformers v5. 30B モデルは無料の Colab GPU には収まりませんが、私たちのノートブックを使えます。GLM-4.7-Flash の 16-bit LoRA ファインチューニングではおよそ 60GB の VRAM:
A100 40GB VRAM を使うと、時々メモリ不足になることがあります。より安定して実行するには H100/A100 80GB VRAM を使う必要があります。
MoE のファインチューニングでは、ルーター層までファインチューニングするのはおそらく良くないので、既定では無効にしています。推論能力を維持したい場合(任意)、直接回答と Chain-of-Thought の例を混ぜて使えます。少なくとも 75% の推論 と 25% の非推論 をデータセットに含めて、モデルに推論能力を保持させてください。
🦙Llama-server の提供とデプロイ
本番環境で GLM-4.7-Flash をデプロイするには、次を使用します llama-server 新しいターミナルで、tmux などを使って、次の方法でモデルをデプロイします:
その後、新しいターミナルで、次を行ってから pip install openai、次を実行します:
次が出力されます
💻 vLLM での GLM-4.7-Flash
現在は、新しい FP8 動的量子化 を使って、このモデルを高品質かつ高速な推論に利用できます。まず nightly 版から vLLM をインストールしてください:
次に、 Unsloth の動的 FP8 版 のモデルをサービングしてください。KV キャッシュのメモリ使用量を 50% 削減するために FP8 を有効化しており、4 GPU で動作します。1 GPU しかない場合は、次を使用してください CUDA_VISIBLE_DEVICES='0' そして、次を設定してください --tensor-parallel-size 1 またはこの引数を削除してください。FP8 を無効にするには、 --quantization fp8 --kv-cache-dtype fp8
その後、OpenAI API 経由で提供中のモデルを呼び出せます:
⭐ vLLM GLM-4.7-Flash の投機的デコード
GLM 4.7 Flash の MTP(マルチトークン予測)モジュールを使うと、生成スループットが 1 B200 あたり 13,000 トークンから 1,300 トークンに低下することがわかりました!(10倍遅い) Hopper では、おそらく問題ないはずです。
1xB200 ではスループットはわずか 1,300 トークン/秒(ユーザーごとのデコードは 130 トークン/秒)

そして 1xB200 では 13,000 トークン/秒のスループット(それでもユーザーごとのデコードは 130 トークン/秒)

🔨GLM-4.7-Flash によるツール呼び出し
参照 Tool Calling Guide ツール呼び出しの方法の詳細については、こちらをご覧ください。新しいターミナルで(tmux を使っている場合は CTRL+B+D)、2つの数値を加算する、Python コードを実行する、Linux の関数を実行するなど、いくつかのツールを作成します:
その後、以下の関数を使用します(コピーして貼り付けて実行してください)。これにより関数呼び出しを自動的に解析し、任意のモデルに対して OpenAI エンドポイントを呼び出します:
次の方法で GLM-4.7-Flash を起動した後 llama-server 次のように GLM-4.7-Flash または次を参照: Tool Calling Guide 詳細については、その後いくつかのツール呼び出しを行えます:
GLM 4.7 の数学演算用ツール呼び出し

GLM-4.7-Flash で生成された Python コードを実行するツール呼び出し

ベンチマーク
GLM-4.7-Flash は、AIME 25 を除くすべてのベンチマークで最も高性能な 30B モデルです。

AIME 25
91.6
85.0
91.7
GPQA
75.2
73.4
71.5
LCB v6
64.0
66.0
61.0
HLE
14.4
9.8
10.9
SWE-bench Verified
59.2
22.0
34.0
τ²-Bench
79.5
49.0
47.7
BrowseComp
42.8
2.29
28.3
最終更新
役に立ちましたか?

