GLM-5.3-Flash: ローカルでの実行方法
Z.aiの新しいGLM-5.3-Flash、別名ox-alphaモデルを実行します。
GLM-5.3-Flashは、別名 ox-alpha、Z.ai の新しい 320B パラメータ(18B アクティブ)のマルチモーダル・オープンモデルで、 上回ります GLM-5.2。GLM-5.3-Flash は、次のより小さい版です GLM-5.3 であり、次と競合します Claude Opus 4.8 のコーディングおよびエージェント系ベンチマークにおいて。今なら 1-bit モデルを 102GB の RAM/VRAM、または 3-bit を 128GB 構成で llama.cpp または Unslothを使ってローカルで実行できます。初日アクセスを提供してくれた Z.ai に感謝します。
Unsloth の動的 1-bit (93GB)GGUF は トップ1%精度の 71% を維持しながら 、 85% 小さく なっています。BF16(642GB)と比べて。動的 3-bit は 76% 小さく、87% の精度を維持します。
9月4日: GLM-5.3-Flash は現在、 3.3倍高速な推論で!
GLM-5.3-Flash は 30T トークンで学習され、新たに学習されたベースモデル上に構築されています。ハイブリッドな疎注意機構と線形注意機構により、精度を損なうことなく長文コンテキストの提供コストを下げています。
今ならモデルを直接 Unsloth Desktop.

⚙️ 使用ガイド
GLM-5.3-Flash の要件:
最小の 1-bit 量子化は 100GB RAM で動作し、3-bit は Mac や NVIDIA DGX Spark のような 128GB デバイスで動作します。 表:ハードウェア要件 (単位 = 総メモリ:RAM + VRAM、または統合メモリ)
100 GB
115 GB
128-150 GB
162-210 GB
350 GB
650 GB
推奨設定
GLM-5.3-Flash には 3つの思考モードがあります:Low、High、Max です。複雑なタスクには Max Thinking を使ってください。 Unslothでは、チャット領域のトグルで Low、High、Max Thinking を簡単に選択できます。
ほとんどのユースケースでは、次の設定を使ってください:
temperature = 1.0
temperature = 0.95
top_p = 0.95
top_p = 1.0
最大コンテキストウィンドウ:
1,048,576.
推論強度の変更
GLM-5.3-Flash はデフォルトで Max 推論を使用します。また、 reasoning_effort が「low」「high」「max」のいずれかになる推論強度もサポートしています。
高速化された推論と MTP サポート
9月4日時点で、私たちは初日版にいくつかの改善と最適化を追加しました llama.cpp の PR。より高速なデコードパスと追加の MTP サポートを実装し、最大で 3.3倍高速な推論 を長いコンテキスト長でも実現しました!
すべてが Unsloth Desktopでそのまま使えます。必要に応じて最新バージョンに更新するだけです。追加のモジュールや MTP ファイルは不要です。あるいは、次の llama.cpp ガイドに従うこともできます。


1xB200 上で GLM-5.3-Flash UD-IQ1_S を使用し、まず MTP を無視すると、次の結果になります:
pp512
1121.80
1122.0
tg32
62.79
63.10
tg32 @ 4096
53.52
59.50
tg32 @ 16384
41.02
57.99
tg32 @ 65536
20.66
48.99
その後 MTP を追加すると、特に長いコンテキストでさらに大きな効果が得られます。ただし、ドラフトトークンが増えるほど推論が遅くなるため、n=2 付近で止めるべきです。
4096
58.6
86.5
80.2
63.7
16K
55.0
77.2
短いコンテキスト長でも、最大 1.6倍の高速化ながら速度向上が見られます。


📈 量子化分析
GLM-5.3-Flash を UD-IQ1_S 1bit(93.09GB)まで量子化すると、BF16(641.64GB)と比べて 85% 小さくなりながら、トップ1%精度の 71% を維持します
動的 2-bit の UD-Q2_K_XL は 109GB で、83% 小さく、精度の 78% を維持します。 動的 3-bit の UD-IQ3_XXS は 120GB で、81% 小さく、精度の 82% を維持します。 動的 4-bit の UD-Q4_K_XL は 200GB で、69% 小さく、精度の 93% を維持します。


UD-IQ1_S
93.09
70.89%
0.669714
9.1658
UD-IQ1_M
97.58
73.06%
0.572413
8.5069
UD-IQ2_XXS
101.84
76.30%
0.450148
7.5764
UD-Q2_K_XL
108.72
78.34%
0.380134
6.8412
UD-IQ3_XXS
120.37
81.63%
0.283772
5.9611
UD-Q3_K_XL
147.54
86.25%
0.159697
4.0281
UD-IQ4_XS
156.82
88.18%
0.116652
3.1014
UD-Q4_K_XL
199.71
92.22%
0.049294
1.4894
UD-Q5_K_XL
240.31
94.35%
0.027052
0.8696
UD-Q6_K_XL
291.83
95.23%
0.019007
0.6267
GLM-5.3-Flash (Ox-Alpha) をローカルで実行
今なら、GLM-5.3-Flash (Ox-Alpha) を Unsloth Desktop と llama.cpp で、私たちの 専用 PRを使って実行できます。 UD-IQ3_XXS デモでは 128GB デバイスに収まるため 3-bit を使用しています。量子化タイプは自由に変更してください。
Hugging Face: GLM-5.3-Flash-GGUF
🦥 Unsloth で GLM-5.3-Flash を実行
GLM-5.3-Flash は現在、 Unsloth Desktopローカル AI 向けのオープンソース UI アプリです。 Unsloth は RAM へ自動的にオフロードし、マルチ GPU 構成を検出します。Unsloth Desktop を使えば、モデルをローカルで MacOS、Windows、Linux で実行でき、さらに:
検索、ダウンロード、 GGUF を実行、MLX および safetensor モデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-p など)
MLX と llama.cpp による高速な CPU + GPU 推論
LLM を学習 VRAM を 70% 削減し、2倍高速

Unsloth をインストール
始める最も簡単な方法は、 Unsloth Desktop アプリをダウンロードすることです。対応環境: macOS, Windows、 Linux.
または、手動でインストールしたい場合は:
MacOS、Linux、WSL:
Windows PowerShell:
GLM-5.3-Flash を検索してダウンロード
移動先: Unsloth Chat または Model hub で検索バーに GLM-5.3-Flash を入力し、目的のモデルと量子化をダウンロードしてください。

GLM-5.3-Flash を実行
Unsloth を使うと推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細は、以下をご覧ください: Unsloth 推論ガイド。以下は 1-bit 実行例:

Unsloth API で GLM-5.3-Flash を提供
次を使用できます unsloth run コマンドを使い、次を利用して API 経由で GLM-5.3-Flash を提供できます llama-server コンテキストサイズ、GPU レイヤー、スレッディング、サンプリング、ネットワーキング、ツール設定などのランタイムフラグ。詳細は以下をご覧ください: API ドキュメント または unsloth start.
🦙 llama.cpp で GLM-5.3-Flash を実行
専用の llama.cpp PR を使用する必要があります ここ。以下のビルド手順に従うこともできます。次を変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使いたい場合は。 Apple Mac / Metal デバイスでは、次に -DGGML_CUDA=OFF と設定し、その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
モデルを実行するには、次のようにします:
その後、実行します:
次に置き換えてください UD-IQ3_XXS お好みの量子化に、例えば IQ2_XXS を、アップロード後は 2-bit 用に。
📊 ベンチマーク


ベンチマーク
GLM-5.3-Flash
GLM-5.2
DeepSeek-V4-Vision-Exp
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
コーディング
Terminal Bench 2.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE
v1.1
63.4
46.2
59.3
58.0
69.6
65.3
NL2Repo
56.3
48.9
57.7
69.7
-
-
エージェント
Toolathlon 検証済み
78.4
59.9
75.9
76.2
74.9
-
AutomationBench
v1.0.6
48.8
26.2
38.8
41.0
37.2
52.3
Agents' Last Exam
26.3
20.4
27.3
27.0
28.0
-
ツール付き HLE
55.3
54.7
55.1
57.9
-
-
GDPval-AA v2
1773
1504
1675
1582
1571
1527
ビジョン
OfficeQA Pro
62.4
-
57.9
48.9
-
-
CharXiv 推論
ツール付き
89.4
-
80.4
89.9
88.0
88.7
Chartography
ツール付き
78.0
-
64.3
75.0
68.0
65.0
BabyVision
53.4
-
35.1
46.8
61.6
70.9
MVbench
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
最終更新
役に立ちましたか?


