Gemma 4 QAT
E2B、E4B、12B、26B-A4B、31Bを含むGoogle Gemma 4 QATモデルをローカルで実行しましょう。
Gemma 4 QAT(Quantization-Aware Training)は、Google DeepMindの新しい Gemma 4 〜するように設計された モデル品質を保ちながらメモリ要件を削減する。これにより、たとえば次のようなより大きなモデルをローカルで実行できます: Gemma 4 26B-A4Bを、コンシューマー向けGPU上でローカルに、わずか 16GBのRAM.
Gemma 4 QATは量子化を前提に学習されており、4ビット形式で約72%少ないメモリ使用量 で 元の性能に近い。E2BとE4B向けの特別なモバイル量子化版2種も提供されており、量子化幅の混合を使用しています。
〜に変換すると Q4_0 QATから素朴に変換すると、26B-A4Bではtop-1精度がわずか70.2%しか得られません。 私たちはUnsloth Dynamic手法を適用し それを〜まで引き上げるために 85.6%(+15.6%)まで向上させ、さらに 200MB小さく!
Gemma 4 QATには以下が含まれます: E2B, E4B, 12B, 26B-A4B、および 31B。 これらは、140以上の言語と最大 256Kコンテキスト。
Gemma-4-E2B QATは3GBのRAMで動作し、 E4B 5GBで、12B 7GBで、26-A4B 15GBで、さらに 31B 18GBで.
Gemma 4 QAT GGUFを次のように命名しています UD-Q4_K_XL q4_0はより大きいにもかかわらず精度を低下させることが分かったためです。以下をご覧ください: Gemma 4 QAT GGUF.
比較のために int4 量子化については、以下の元版とQAT版のサイズ差をご覧ください。QATは元の精度をほぼすべて維持しながら、約72%少ないメモリを使用します:

E2B
2.62 GB
9.31 GB
71.86%
E4B
4.22 GB
15.1 GB
72.05%
12B
6.72 GB
23.8 GB
71.76%
26B A4B
14.2 GB
50.5 GB
71.88%
31B
17.3 GB
61.4 GB
71.82%
使用ガイド
E2BとE4B向けのGemma 4 QAT派生版はスマートフォンやノートPC向けに設計されており、より大きな26B-A4Bと31Bは QAT モデルは、強力な家庭用GPUだけでなく、ノートPCでも動作するようになりました。
〜があります GGUFファイルは1つだけ 各Gemma 4モデルについて、アップロードされた版より高い精度は精度を向上させるどころか低下させることが分かったためです。元の非QATのQ4_0量子化版を使用してください UD-Q4_K_XL こちら ハードウェア要件.

表: Gemma 4 QAT推論GGUFの推奨ハードウェア要件
(単位 = 総メモリ: RAM + VRAM、またはユニファイドメモリ)。 (units = total memory: RAM + VRAM, or unified memory).
E2B QAT
3 GB
E4B QAT
5 GB
12B QAT
7 GB
26B A4B QAT
15 GB
31B QAT
18 GB
推奨設定
QATチェックポイントは、Gemma 4の推奨設定をそのまま使用します:
temperature = 1.0top_p = 0.95top_k = 64
Gemma 4の最大コンテキスト長は 128K 〜向けは E2B, E4B および 256K 〜向けは 12B, 26B A4B, 31B.
QAT解析
QAT BF16をllama.cppのQ4_0形式へ素朴に変換すると、実際には精度が低下し、Q4_0におけるBF16 QATラティスとも実際には整合していませんでした。私たちはUnsloth Dynamic手法を適用し、llama.cpp互換のQ4_0形式と真のBF16 QAT Q4_0形式の間の一致をより良く強制し、その結果、量子化版をより小さくし(埋め込みにはQ6_Kは不要でした)、さらに高精度化することに成功しました!

以下にKLD、Top 1%精度、ディスク容量の表を示します。私たちの版が99.9% KLDと平均KLDを劇的に改善しているのが分かります。 たとえばE2Bでは、素朴なQ4_0量子化の平均KLDが0.05109なのに対し、私たちのものは0.00173(相対的に29倍良い)で、さらに22%小さいです!
主な問題は、QAT BF16からllama.cppのQ4_0形式への変換がロスレスではないことです。llama.cppはF16スケールを使うのに対し、QAT BF16はBF16スケールを使い、さらにスケールはllama.cpp側では最適に決定されません。
素朴な変換ではBF16 QATとのバイト一致率が24.77%ですが、いくつかのハックを使うことで99.96%まで押し上げられることが分かりました!
E2B
Unsloth
2.62
0.0557
0.00173
98.16
E2B
Q4_0
3.35
1.0513
0.05109
89.29
E4B
Unsloth
4.22
0.0536
0.00121
98.54
E4B
Q4_0
5.15
0.6722
0.03778
90.94
26B
Unsloth
14.25
2.7087
0.09788
85.63
26B
Q4_0
14.44
4.5420
0.36094
70.20
31B
Unsloth
17.29
1.3659
0.01403
96.67
31B
Q4_0
17.65
3.0030
0.09349
87.91
12B
Unsloth
6.72
9.2740
0.13288
88.76
12B
Q4_0
6.98
14.7323
0.50702
74.08
モバイル混合QAT
Gemma-4チームは、Gemma-4-E2B-itとGemma-4-E4B-itの特別なモバイル混合QAT版もリリースしました。私たちはそれらもllama.cpp互換形式に忠実に変換し、ほぼすべての精度も回復しました。2ビット層にはTQ2_0を使い、ネガティブスケーラーを使用しました。
E2BとE4Bの両方についてUD-Q2_K_XL量子化版を作成しました。
サイズ
2.19 GB
3.22 GB
2ビット(TQ2_0)テンソル
61(deep MLPを含む)
2(埋め込みのみ)
BF16に対する平均KLD
0.00409
0.00102
Top-1 %
97.82%
98.76%
ベースPPL
~103
42.4
参照 gemma-4-E2B-it-qat-GGUF および gemma-4-E4B-it-qat-GGUF 〜向けは UD-Q2_K_XL.
Gemma 4 QATチュートリアルを実行
Gemma 4 GGUFは複数のサイズがあるため、小さいモデルの推奨開始点は8ビットで、大きいモデルの推奨開始点は 動的4ビット. Gemma 4 GGUF:
🦥 Unsloth Studioガイド🦙 Llama.cppガイド
私たちの Unsloth Studio✨ ノートブック:
🦥 Unsloth Studioガイド
Gemma 4 QATは現在、 Unsloth Studio。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで次の環境上で実行できます: MacOS、Windows、Linux、そして:
検索、ダウンロード、 GGUFを実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cppによる高速なCPU+GPU推論
LLMを学習 VRAMを70%削減しつつ2倍高速

Gemma 4 QATを検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。
次に〜へ移動し Unsloth Chat タブで検索バーにGemma 4を入力し、目的のモデルと量子化版をダウンロードしてください。
Gemma 4 QATを実行
Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細は、次をご覧ください: Unsloth Studio推論ガイド.

🦙 Llama.cppガイド
このガイドでは量子化タイプを選択する必要はありません。1つしかないためです: UD-Q4_K_XL。参照: Gemma 4 QATコレクション。これらのチュートリアルでは、次を使用します: llama.cpp 高速なローカル推論のために、特にCPUしかない場合に使用します。
最新のものを入手 llama.cpp で GitHubはこちら。以下のビルド手順に従っても構いません。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPUがない場合、またはCPU推論だけを使いたい場合。 Apple Mac / Metalデバイスの場合、次のように設定し -DGGML_CUDA=OFF その後は通常どおり続けてください。Metalサポートはデフォルトで有効です。
使用したい場合は llama.cpp モデルを直接読み込むには、各モデルに応じて以下のコマンドに従ってください。 UD-Q4_K_XL は唯一の量子化タイプです。Hugging Face(ステップ3)からもダウンロードできます。これは次に似ています: ollama run 。使用してください: export LLAMA_CACHE="folder" を強制して llama.cpp 特定の場所に保存します。
26B-A4B:
31B:
E4B:
E2B:
(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hub hf_transfer )。次を選択できます: UD-Q4_K_XL または、次のような他の量子化版: Q8_0 。ダウンロードが止まる場合は、次をご覧ください: Hugging Face Hub、XETのデバッグ
次に、会話モードでモデルを実行します(vision対応で mmproj-F16):
Llama-serverへのデプロイ
llama-serverでGemma-4をデプロイするには、次を使用します:
〜するには 思考 / 推論を無効化する、次を使用します: --chat-template-kwargs '{"enable_thinking":false}'
もし〜をお使いなら Windows PowerShellでは、次を使用します: --chat-template-kwargs "{\"enable_thinking\":false}"
「true」と「false」は互換的に使えます。
最終更新
役に立ちましたか?

