For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3-Flash: ローカルでの実行方法

Z.aiの新しいGLM-5.3-Flash、別名ox-alphaモデルを実行します。

GLM-5.3-Flashは、別名 ox-alpha、Z.ai の新しい 320B パラメータ(18B アクティブ)のマルチモーダル・オープンモデルで、 上回ります GLM-5.2。GLM-5.3-Flash は、次のより小さい版です GLM-5.3 であり、次と競合します Claude Opus 4.8 のコーディングおよびエージェント系ベンチマークにおいて。今なら 1-bit モデルを 102GB の RAM/VRAM、または 3-bit を 128GB 構成で llama.cpp または Unslothを使ってローカルで実行できます。初日アクセスを提供してくれた Z.ai に感謝します。

Unsloth の動的 1-bit (93GB)GGUF は トップ1%精度の 71% を維持しながら85% 小さく なっています。BF16(642GB)と比べて。動的 3-bit は 76% 小さく、87% の精度を維持します。

​​GLM-5.3-Flash 実行ガイドUnsloth をダウンロード

GLM-5.3-Flash は 30T トークンで学習され、新たに学習されたベースモデル上に構築されています。ハイブリッドな疎注意機構と線形注意機構により、精度を損なうことなく長文コンテキストの提供コストを下げています。

今ならモデルを直接 Unsloth Desktop.

⚙️ 使用ガイド

GLM-5.3-Flash の要件:

最小の 1-bit 量子化は 100GB RAM で動作し、3-bit は Mac や NVIDIA DGX Spark のような 128GB デバイスで動作します。 表:ハードウェア要件 (単位 = 総メモリ:RAM + VRAM、または統合メモリ)

1-bit
2-bit
3-bit
4-bit
8-bit
BF16

100 GB

115 GB

128-150 GB

162-210 GB

350 GB

650 GB

推奨設定

GLM-5.3-Flash には 3つの思考モードがあります:Low、High、Max です。複雑なタスクには Max Thinking を使ってください。 Unslothでは、チャット領域のトグルで Low、High、Max Thinking を簡単に選択できます。

ほとんどのユースケースでは、次の設定を使ってください:

デフォルト設定(ほとんどのタスク)
DeepSWE

temperature = 1.0

temperature = 0.95

top_p = 0.95

top_p = 1.0

  • 最大コンテキストウィンドウ: 1,048,576.

推論強度の変更

GLM-5.3-Flash はデフォルトで Max 推論を使用します。また、 reasoning_effort が「low」「high」「max」のいずれかになる推論強度もサポートしています。

高速化された推論と MTP サポート

9月4日時点で、私たちは初日版にいくつかの改善と最適化を追加しました llama.cpp の PR。より高速なデコードパスと追加の MTP サポートを実装し、最大で 3.3倍高速な推論 を長いコンテキスト長でも実現しました!

すべてが Unsloth Desktopでそのまま使えます。必要に応じて最新バージョンに更新するだけです。追加のモジュールや MTP ファイルは不要です。あるいは、次の llama.cpp ガイドに従うこともできます。

1xB200 上で GLM-5.3-Flash UD-IQ1_S を使用し、まず MTP を無視すると、次の結果になります:

テスト
ベースライン tok/s
最適化後 tok/s

pp512

1121.80

1122.0

tg32

62.79

63.10

tg32 @ 4096

53.52

59.50

tg32 @ 16384

41.02

57.99

tg32 @ 65536

20.66

48.99

その後 MTP を追加すると、特に長いコンテキストでさらに大きな効果が得られます。ただし、ドラフトトークンが増えるほど推論が遅くなるため、n=2 付近で止めるべきです。

プロンプト
MTP オフ
n=2
n=3
n=5

4096

58.6

86.5

80.2

63.7

16K

55.0

77.2

短いコンテキスト長でも、最大 1.6倍の高速化ながら速度向上が見られます。

📈 量子化分析

GLM-5.3-Flash を UD-IQ1_S 1bit(93.09GB)まで量子化すると、BF16(641.64GB)と比べて 85% 小さくなりながら、トップ1%精度の 71% を維持します

動的 2-bit の UD-Q2_K_XL は 109GB で、83% 小さく、精度の 78% を維持します。 動的 3-bit の UD-IQ3_XXS は 120GB で、81% 小さく、精度の 82% を維持します。 動的 4-bit の UD-Q4_K_XL は 200GB で、69% 小さく、精度の 93% を維持します。

量子化
サイズ
top-1 精度
平均 KLD
KLD 99.9%

UD-IQ1_S

93.09

70.89%

0.669714

9.1658

UD-IQ1_M

97.58

73.06%

0.572413

8.5069

UD-IQ2_XXS

101.84

76.30%

0.450148

7.5764

UD-Q2_K_XL

108.72

78.34%

0.380134

6.8412

UD-IQ3_XXS

120.37

81.63%

0.283772

5.9611

UD-Q3_K_XL

147.54

86.25%

0.159697

4.0281

UD-IQ4_XS

156.82

88.18%

0.116652

3.1014

UD-Q4_K_XL

199.71

92.22%

0.049294

1.4894

UD-Q5_K_XL

240.31

94.35%

0.027052

0.8696

UD-Q6_K_XL

291.83

95.23%

0.019007

0.6267

GLM-5.3-Flash (Ox-Alpha) をローカルで実行

今なら、GLM-5.3-Flash (Ox-Alpha) を Unsloth Desktop と llama.cpp で、私たちの 専用 PRを使って実行できます。 UD-IQ3_XXS デモでは 128GB デバイスに収まるため 3-bit を使用しています。量子化タイプは自由に変更してください。

Unsloth Desktop で実行llama.cpp で実行

🦥 Unsloth で GLM-5.3-Flash を実行

GLM-5.3-Flash は現在、 Unsloth Desktopローカル AI 向けのオープンソース UI アプリです。 Unsloth は RAM へ自動的にオフロードし、マルチ GPU 構成を検出します。Unsloth Desktop を使えば、モデルをローカルで MacOS、Windows、Linux で実行でき、さらに:

1

Unsloth をインストール

始める最も簡単な方法は、 Unsloth Desktop アプリをダウンロードすることです。対応環境: macOS, WindowsLinux.

Unsloth をダウンロード

または、手動でインストールしたい場合は:

MacOS、Linux、WSL:

Windows PowerShell:

2

GLM-5.3-Flash を検索してダウンロード

移動先: Unsloth Chat または Model hub で検索バーに GLM-5.3-Flash を入力し、目的のモデルと量子化をダウンロードしてください。

3

GLM-5.3-Flash を実行

Unsloth を使うと推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は、以下をご覧ください: Unsloth 推論ガイド。以下は 1-bit 実行例:

4

Unsloth API で GLM-5.3-Flash を提供

次を使用できます unsloth run コマンドを使い、次を利用して API 経由で GLM-5.3-Flash を提供できます llama-server コンテキストサイズ、GPU レイヤー、スレッディング、サンプリング、ネットワーキング、ツール設定などのランタイムフラグ。詳細は以下をご覧ください: API ドキュメント または unsloth start.

5

Unsloth の準備ができました

Unsloth Desktop 経由で GLM-5.3-Flash を使って、他にも次のようなことができます:

🦙 llama.cpp で GLM-5.3-Flash を実行

1

専用の llama.cpp PR を使用する必要があります ここ。以下のビルド手順に従うこともできます。次を変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使いたい場合は。 Apple Mac / Metal デバイスでは、次に -DGGML_CUDA=OFF と設定し、その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

2

モデルを実行するには、次のようにします:

3

その後、実行します:

次に置き換えてください UD-IQ3_XXS お好みの量子化に、例えば IQ2_XXS を、アップロード後は 2-bit 用に。

📊 ベンチマーク

ベンチマーク

GLM-5.3-Flash

GLM-5.2

DeepSeek-V4-Vision-Exp

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

コーディング

Terminal Bench 2.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE

v1.1

63.4

46.2

59.3

58.0

69.6

65.3

NL2Repo

56.3

48.9

57.7

69.7

-

-

エージェント

Toolathlon 検証済み

78.4

59.9

75.9

76.2

74.9

-

AutomationBench

v1.0.6

48.8

26.2

38.8

41.0

37.2

52.3

Agents' Last Exam

26.3

20.4

27.3

27.0

28.0

-

ツール付き HLE

55.3

54.7

55.1

57.9

-

-

GDPval-AA v2

1773

1504

1675

1582

1571

1527

ビジョン

OfficeQA Pro

62.4

-

57.9

48.9

-

-

CharXiv 推論

ツール付き

89.4

-

80.4

89.9

88.0

88.7

Chartography

ツール付き

78.0

-

64.3

75.0

68.0

65.0

BabyVision

53.4

-

35.1

46.8

61.6

70.9

MVbench

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

最終更新

役に立ちましたか?