For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 QAT

E2B、E4B、12B、26B-A4B、31Bを含むGoogle Gemma 4 QATモデルをローカルで実行しましょう。

Gemma 4 QAT(Quantization-Aware Training)は、Google DeepMindの新しい Gemma 4 〜するように設計された モデル品質を保ちながらメモリ要件を削減する。これにより、たとえば次のようなより大きなモデルをローカルで実行できます: Gemma 4 26B-A4Bを、コンシューマー向けGPU上でローカルに、わずか 16GBのRAM.

Gemma 4 QATは量子化を前提に学習されており、4ビット形式で約72%少ないメモリ使用量元の性能に近い。E2BとE4B向けの特別なモバイル量子化版2種も提供されており、量子化幅の混合を使用しています。

〜に変換すると Q4_0 QATから素朴に変換すると、26B-A4Bではtop-1精度がわずか70.2%しか得られません。 私たちはUnsloth Dynamic手法を適用し それを〜まで引き上げるために 85.6%(+15.6%)まで向上させ、さらに 200MB小さく!

Gemma 4 QATには以下が含まれます: E2B, E4B, 12B, 26B-A4B、および 31B。 これらは、140以上の言語と最大 256Kコンテキスト。

Gemma 4 QATを実行QAT解析

Gemma-4-E2B QATは3GBのRAMで動作し、 E4B 5GBで、12B 7GBで、26-A4B 15GBで、さらに 31B 18GBで.

Gemma 4 QAT GGUFを次のように命名しています UD-Q4_K_XL q4_0はより大きいにもかかわらず精度を低下させることが分かったためです。以下をご覧ください: Gemma 4 QAT GGUF.

比較のために int4 量子化については、以下の元版とQAT版のサイズ差をご覧ください。QATは元の精度をほぼすべて維持しながら、約72%少ないメモリを使用します:

Gemma 4 Mobile QATの仕組みの可視化。
Gemma 4
QAT(int4)GGUF
元のBF16
変化率

E2B

2.62 GB

9.31 GB

71.86%

E4B

4.22 GB

15.1 GB

72.05%

12B

6.72 GB

23.8 GB

71.76%

26B A4B

14.2 GB

50.5 GB

71.88%

31B

17.3 GB

61.4 GB

71.82%

使用ガイド

E2BとE4B向けのGemma 4 QAT派生版はスマートフォンやノートPC向けに設計されており、より大きな26B-A4Bと31Bは QAT モデルは、強力な家庭用GPUだけでなく、ノートPCでも動作するようになりました。

〜があります GGUFファイルは1つだけ 各Gemma 4モデルについて、アップロードされた版より高い精度は精度を向上させるどころか低下させることが分かったためです。元の非QATのQ4_0量子化版を使用してください UD-Q4_K_XL こちら ハードウェア要件.

表: Gemma 4 QAT推論GGUFの推奨ハードウェア要件

(単位 = 総メモリ: RAM + VRAM、またはユニファイドメモリ)。 (units = total memory: RAM + VRAM, or unified memory).

Gemma 4 QAT
要件

E2B QAT

3 GB

E4B QAT

5 GB

12B QAT

7 GB

26B A4B QAT

15 GB

31B QAT

18 GB

推奨設定

QATチェックポイントは、Gemma 4の推奨設定をそのまま使用します:

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Gemma 4の最大コンテキスト長は 128K 〜向けは E2B, E4B および 256K 〜向けは 12B, 26B A4B, 31B.

QAT解析

QAT BF16をllama.cppのQ4_0形式へ素朴に変換すると、実際には精度が低下し、Q4_0におけるBF16 QATラティスとも実際には整合していませんでした。私たちはUnsloth Dynamic手法を適用し、llama.cpp互換のQ4_0形式と真のBF16 QAT Q4_0形式の間の一致をより良く強制し、その結果、量子化版をより小さくし(埋め込みにはQ6_Kは不要でした)、さらに高精度化することに成功しました!

以下にKLD、Top 1%精度、ディスク容量の表を示します。私たちの版が99.9% KLDと平均KLDを劇的に改善しているのが分かります。 たとえばE2Bでは、素朴なQ4_0量子化の平均KLDが0.05109なのに対し、私たちのものは0.00173(相対的に29倍良い)で、さらに22%小さいです!

主な問題は、QAT BF16からllama.cppのQ4_0形式への変換がロスレスではないことです。llama.cppはF16スケールを使うのに対し、QAT BF16はBF16スケールを使い、さらにスケールはllama.cpp側では最適に決定されません。

素朴な変換ではBF16 QATとのバイト一致率が24.77%ですが、いくつかのハックを使うことで99.96%まで押し上げられることが分かりました!

モデル
手法
ディスク(GB)
99.9% KLD
平均KLD
Top-1 %

E2B

Unsloth

2.62

0.0557

0.00173

98.16

E2B

Q4_0

3.35

1.0513

0.05109

89.29

E4B

Unsloth

4.22

0.0536

0.00121

98.54

E4B

Q4_0

5.15

0.6722

0.03778

90.94

26B

Unsloth

14.25

2.7087

0.09788

85.63

26B

Q4_0

14.44

4.5420

0.36094

70.20

31B

Unsloth

17.29

1.3659

0.01403

96.67

31B

Q4_0

17.65

3.0030

0.09349

87.91

12B

Unsloth

6.72

9.2740

0.13288

88.76

12B

Q4_0

6.98

14.7323

0.50702

74.08

モバイル混合QAT

Gemma-4チームは、Gemma-4-E2B-itとGemma-4-E4B-itの特別なモバイル混合QAT版もリリースしました。私たちはそれらもllama.cpp互換形式に忠実に変換し、ほぼすべての精度も回復しました。2ビット層にはTQ2_0を使い、ネガティブスケーラーを使用しました。

E2BとE4Bの両方についてUD-Q2_K_XL量子化版を作成しました。

E2Bモバイル
E4Bモバイル

サイズ

2.19 GB

3.22 GB

2ビット(TQ2_0)テンソル

61(deep MLPを含む)

2(埋め込みのみ)

BF16に対する平均KLD

0.00409

0.00102

Top-1 %

97.82%

98.76%

ベースPPL

~103

42.4

参照 gemma-4-E2B-it-qat-GGUF および gemma-4-E4B-it-qat-GGUF 〜向けは UD-Q2_K_XL.

Gemma 4 QATチュートリアルを実行

Gemma 4 GGUFは複数のサイズがあるため、小さいモデルの推奨開始点は8ビットで、大きいモデルの推奨開始点は 動的4ビット. Gemma 4 GGUF:

🦥 Unsloth Studioガイド🦙 Llama.cppガイド

私たちの Unsloth Studio ノートブック:

🦥 Unsloth Studioガイド

Gemma 4 QATは現在、 Unsloth Studio。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで次の環境上で実行できます: MacOS、Windows、Linux、そして:

1

Unslothをインストール

ターミナルで実行:

MacOS、Linux、WSL:

Windows PowerShell:

2

Unslothを起動

MacOS、Linux、WSL、およびWindows:

次に開く http://127.0.0.1:8888 (またはお使いのURL)をブラウザで。

3

Gemma 4 QATを検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。

次に〜へ移動し Unsloth Chat タブで検索バーにGemma 4を入力し、目的のモデルと量子化版をダウンロードしてください。

4

Gemma 4 QATを実行

Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は、次をご覧ください: Unsloth Studio推論ガイド.

🦙 Llama.cppガイド

このガイドでは量子化タイプを選択する必要はありません。1つしかないためです: UD-Q4_K_XL。参照: Gemma 4 QATコレクション。これらのチュートリアルでは、次を使用します: llama.cpp 高速なローカル推論のために、特にCPUしかない場合に使用します。

1

最新のものを入手 llama.cpp GitHubはこちら。以下のビルド手順に従っても構いません。変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPUがない場合、またはCPU推論だけを使いたい場合。 Apple Mac / Metalデバイスの場合、次のように設定し -DGGML_CUDA=OFF その後は通常どおり続けてください。Metalサポートはデフォルトで有効です。

2

使用したい場合は llama.cpp モデルを直接読み込むには、各モデルに応じて以下のコマンドに従ってください。 UD-Q4_K_XL は唯一の量子化タイプです。Hugging Face(ステップ3)からもダウンロードできます。これは次に似ています: ollama run 。使用してください: export LLAMA_CACHE="folder" を強制して llama.cpp 特定の場所に保存します。

26B-A4B:

31B:

E4B:

E2B:

3

(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hub hf_transfer )。次を選択できます: UD-Q4_K_XL または、次のような他の量子化版: Q8_0 。ダウンロードが止まる場合は、次をご覧ください: Hugging Face Hub、XETのデバッグ

4

次に、会話モードでモデルを実行します(vision対応で mmproj-F16):

5

Llama-serverへのデプロイ

llama-serverでGemma-4をデプロイするには、次を使用します:

最終更新

役に立ちましたか?