> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/moderu/gemma-4/qat.md).

# Gemma 4 QAT

Gemma 4 QAT（量子化対応学習）は Google DeepMind の新しい [Gemma 4](/docs/jp/moderu/gemma-4.md) モデル群で、 **モデル品質を保ちながらメモリ要件を削減するよう設計されています**。これにより、次のようなより大きなモデルを実行できるようになります。 **Gemma 4 26B-A4B**を、コンシューマー向けGPUでローカルに、わずか **16GBのRAM**.

Gemma 4 QAT は量子化を前提に学習されており、4ビット形式で約**72%低いメモリ使用量** および **ほぼ元の性能**。E2B と E4B の特別なモバイル量子化版も 2 つ提供されており、量子化幅の混合を使用しています。

変換先は `Q4_0` を QAT から単純に変換すると、26B-A4B では Top-1 精度が 70.2% にしかなりません。 [私たちは Unsloth Dynamic 手法を適用し](#qat-analysis) それを次まで引き上げ **85.6%（+15.6%）まで高め、さらに** [**200MB小さく**](#usage-guide)!

Gemma 4 QAT には以下が含まれます: **E2B**, **E4B**, **12B、26B-A4B**、および **31B。** これらはマルチモーダルでハイブリッド思考のモデルで、140以上の言語と最大 **256Kのコンテキストに対応しています。**

{% columns %}
{% column %} <a href="/pages/136e446d64d842f3384bec65ba2ec312454e6e91#run-gemma-4-qat-tutorials" class="button primary">Gemma 4 QAT を実行</a><a href="/pages/136e446d64d842f3384bec65ba2ec312454e6e91#qat-analysis" class="button secondary">QAT 分析</a>

**Gemma-4-E2B** QAT は 3GB の RAM で動作し、 **E4B** 5GB &#x3067;**、12B は** 7GB &#x3067;**、26-A4B は** 15GB で、 **31B** 18GB で動作しま&#x3059;**.**

私たちの Gemma 4 QAT GGUF は次のように名付けています `UD-Q4_K_XL` 。q4\_0 は大きいにもかかわらず精度を低下させることが分かったためです。こちらも参照してください: [Gemma 4 QAT GGUF](https://huggingface.co/collections/unsloth/gemma-4-qat).

比較するには `int4` の量子化については、元版と QAT のサイズ差を以下で比較してください。QAT は元の精度をほぼそのまま維持しつつ、メモリ使用量を約72%削減します:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/f0d3196b1e43e97d3fb6ebef2f1e0aafda402146" alt="" width="563"><figcaption><p>Gemma 4 Mobile QAT の仕組みの可視化。</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

| Gemma 4     | QAT（int4）GGUF | 元の BF16 |    変化率 |
| ----------- | ------------: | ------: | -----: |
| **E2B**     |       2.62 GB | 9.31 GB | 71.86% |
| **E4B**     |       4.22 GB | 15.1 GB | 72.05% |
| **12B**     |       6.72 GB | 23.8 GB | 71.76% |
| **26B A4B** |       14.2 GB | 50.5 GB | 71.88% |
| **31B**     |       17.3 GB | 61.4 GB | 71.82% |

### 使用ガイド

E2B と E4B 向けの Gemma 4 QAT 版はスマートフォンやラップトップ向けに設計されており、より大きな 26B-A4B と 31B は QAT モデルは、強力な自宅用 GPU だけでなくラップトップでも動作するようになりました。

各 **GGUF ファイルは 1 つ** 各 Gemma 4 モデルにつき 1 つしかありません。アップロードされた `UD-Q4_K_XL` 版より高い精度は、向上するどころか精度を悪化させることが分かったためです。元の非 QAT の Q4\_0 量子化版を使用してください [こちら](https://huggingface.co/collections/unsloth/gemma-4).

<figure><img src="/files/11009f671b38e83f6a98086ccc2186228ada90bd" alt="" width="563"><figcaption></figcaption></figure>

### ハードウェア要件

**表: Gemma 4 QAT 推論 GGUF の推奨ハードウェア要件** （単位 = 総メモリ: RAM + VRAM、またはユニファイドメモリ）

| Gemma 4 QAT     |    要件 |
| --------------- | ----: |
| **E2B** QAT     |  3 GB |
| **E4B** QAT     |  5 GB |
| **12B** QAT     |  7 GB |
| **26B A4B** QAT | 15 GB |
| **31B** QAT     | 18 GB |

### 推奨設定

QAT チェックポイントは、Gemma 4 の推奨設定を同じく使用します:

* `temperature = 1.0`
* `top_p = 0.95`
* `top_k = 64`

{% hint style="info" %}
Gemma 4 の最大コンテキストは **128K** には **E2B**, **E4B** と **256K** には **12B**, **26B A4B**, **31B**.
{% endhint %}

## QAT 分析

QAT の Q4\_0 チェックポイントを llama.cpp 側で Q4\_0 に単純変換すると、実際には精度が低下し、Q4\_0 向けの BF16 QAT 格子とも整合していないことが分かりました。そこで Unsloth Dynamic 手法を適用し、llama.cpp 互換の Q4\_0 形式と真の BF16 QAT Q4\_0 形式の一致をより強制的に高めたところ、量子化サイズを小さくでき（埋め込みには Q6\_K は不要でした）、しかも精度も向上させることができました！

<figure><img src="/files/212a02662c38d25abe7bbfbbb6732591bf7c1f54" alt=""><figcaption></figcaption></figure>

以下は KLD、Top 1% 精度、ディスク容量の表です。私たちの版が 99.9% KLD と平均 KLD を大幅に改善していることが分かります。 **たとえば E2B の平均 KLD は、単純な Q4\_0 量子化では 0.05109 ですが、私たちは 0.00173 で、相対的に 29 倍良く、しかも 22% も小さいです！**

主な問題は、QAT BF16 から llama.cpp の Q4\_0 形式への変換が非可逆であることです。llama.cpp は F16 スケールを使いますが、QAT BF16 は BF16 スケールを使っており、llama.cpp 側ではスケールが最適に決定されていません。

単純変換では BF16 QAT に対するバイト一致率は 24.77% ですが、いくつかの工夫で 99.96% まで引き上げられることが分かりました！

<table><thead><tr><th width="100">モデル</th><th>手法</th><th>ディスク（GB）</th><th>99.9% KLD</th><th>平均KLD</th><th width="77.5999755859375">Top-1 %</th></tr></thead><tbody><tr><td>E2B</td><td>Unsloth</td><td><strong>2.62</strong></td><td>0.0557</td><td>0.00173</td><td><strong>98.16</strong></td></tr><tr><td>E2B</td><td>Q4_0</td><td>3.35</td><td>1.0513</td><td>0.05109</td><td>89.29</td></tr><tr><td>E4B</td><td>Unsloth</td><td><strong>4.22</strong></td><td>0.0536</td><td>0.00121</td><td><strong>98.54</strong></td></tr><tr><td>E4B</td><td>Q4_0</td><td>5.15</td><td>0.6722</td><td>0.03778</td><td>90.94</td></tr><tr><td>26B</td><td>Unsloth</td><td><strong>14.25</strong></td><td>2.7087</td><td>0.09788</td><td><strong>85.63</strong></td></tr><tr><td>26B</td><td>Q4_0</td><td>14.44</td><td>4.5420</td><td>0.36094</td><td>70.20</td></tr><tr><td>31B</td><td>Unsloth</td><td><strong>17.29</strong></td><td>1.3659</td><td>0.01403</td><td><strong>96.67</strong></td></tr><tr><td>31B</td><td>Q4_0</td><td>17.65</td><td>3.0030</td><td>0.09349</td><td>87.91</td></tr><tr><td>12B</td><td>Unsloth</td><td><strong>6.72</strong></td><td>9.2740</td><td>0.13288</td><td><strong>88.76</strong></td></tr><tr><td>12B</td><td>Q4_0</td><td>6.98</td><td>14.7323</td><td>0.50702</td><td>74.08</td></tr></tbody></table>

## モバイル混合 QAT

Gemma-4 チームは、Gemma-4-E2B-it と Gemma-4-E4B-it の特別なモバイル混合 QAT 版も公開しました。私たちはそれらを llama.cpp 互換形式へ忠実に変換し、精度もほぼすべて取り戻しました。2 ビット層には TQ2\_0 を使い、負のスケーラーを適用しました。

E2B と E4B の両方について UD-Q2\_K\_XL 量子化版を作成しました。

|                  | E2B モバイル       | E4B モバイル  |
| ---------------- | -------------- | --------- |
| サイズ              | 2.19 GB        | 3.22 GB   |
| 2ビット（TQ2\_0）テンソル | 61（深い MLP を含む） | 2（埋め込みのみ） |
| BF16 に対する平均 KLD  | 0.00409        | 0.00102   |
| Top-1 %          | 97.82%         | 98.76%    |
| ベース PPL          | \~103          | 42.4      |

参照 [gemma-4-E2B-it-qat-GGUF](https://huggingface.co/unsloth/gemma-4-E2B-it-qat-GGUF) と [gemma-4-E4B-it-qat-GGUF](https://huggingface.co/unsloth/gemma-4-E4B-it-qat-GGUF) には `UD-Q2_K_XL`.

## Gemma 4 QAT チュートリアルを実行

Gemma 4 GGUF は複数のサイズがあるため、小さいモデルの推奨出発点は 8 ビットで、大きいモデルの推奨出発点は **Dynamic 4ビット**. [Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4-qat):

| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-qat-GGUF) | [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-qat-GGUF) | [12b](https://huggingface.co/unsloth/gemma-4-12b-it-qat-GGUF) | [26B-A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-qat-GGUF) | [31B](https://huggingface.co/unsloth/gemma-4-31B-it-qat-GGUF) |
| ------------------------------------------------------------- | ------------------------------------------------------------- | ------------------------------------------------------------- | --------------------------------------------------------------------- | ------------------------------------------------------------- |

<a href="/pages/136e446d64d842f3384bec65ba2ec312454e6e91#unsloth-studio-guide" class="button primary">🦥 Unsloth Studioガイド</a><a href="/pages/136e446d64d842f3384bec65ba2ec312454e6e91#llama.cpp-guide" class="button primary">🦙 Llama.cppガイド</a>

{% columns %}
{% column %}
**私たちの UI で Gemma 4 QAT を無料で実行・学習できます** [**Unsloth Studio**](/docs/jp/xin-zhe/studio.md)✨ **ノートブック:**
{% endcolumn %}

{% column %}
{% embed url="<https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb>" %}
{% endcolumn %}
{% endcolumns %}

### 🦥 Unsloth Studioガイド

Gemma 4 QAT は الآن、次の環境で実行・学習できます [Unsloth Studio](/docs/jp/xin-zhe/studio.md)。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで **MacOS、Windows**、Linux、そして：

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUFの実行](/docs/jp/xin-zhe/studio.md#run-models-locally) およびsafetensorモデル
* [**自己修復** ツール呼び出し](/docs/jp/xin-zhe/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/xin-zhe/studio.md#run-models-locally) （Python、Bash）
* [自動推論](/docs/jp/xin-zhe/studio.md#model-arena) パラメータ調整（temp、top-pなど）
* llama.cppによる高速なCPU + GPU推論
* [LLMの学習](/docs/jp/xin-zhe/studio.md#no-code-training) VRAMを70%削減しつつ2倍高速
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/15781d66f25558946794c4025a5ece324f0db186" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth をインストール

ターミナルで次を実行してください：

**MacOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell：**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth を起動

**MacOS、Linux、WSL および Windows：**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

その後 `http://127.0.0.1:8888` （または指定した URL）をブラウザで開いてください。
{% endstep %}

{% step %}

#### Gemma 4 QAT を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。

その後、 [Unsloth Chat](/docs/jp/xin-zhe/studio/chat.md) タブに移動し、検索バーで Gemma 4 を検索して、目的のモデルと量子化版をダウンロードしてください。
{% endstep %}

{% step %}

#### Gemma 4 QAT を実行

Unsloth Studioを使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、 [Unsloth Studio 推論ガイド](/docs/jp/xin-zhe/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/15781d66f25558946794c4025a5ece324f0db186" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cppガイド

このガイドでは量子化タイプを選択する必要はありません。1 つしかないためです: `UD-Q4_K_XL`。参照: [Gemma 4 QAT コレクション](https://huggingface.co/collections/unsloth/gemma-4-qat)。これらのチュートリアルでは、 [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) 特に CPU を使っている場合に、ローカルで高速推論するために使用します。

{% stepper %}
{% step %}
最新の `llama.cpp` **で** [**GitHub はこちら**](https://github.com/ggml-org/llama.cpp)。以下のビルド手順に従うこともできます。 `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` に変更してください。GPU がない場合や CPU 推論だけを使いたい場合です。 **Apple Mac / Metal デバイスの場合**、 `-DGGML_CUDA=OFF` に設定し、そのまま続行してください。Metal サポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
もし `llama.cpp` モデルを直接読み込むには、各モデルに応じて以下のコマンドに従ってください。 `UD-Q4_K_XL` が唯一の量子化タイプです。Hugging Face 経由でもダウンロードできます（手順 3）。これは次と似ています: `ollama run` と似ています。 `export LLAMA_CACHE="folder"` を使って `llama.cpp` 特定の場所に保存するためのものです。

**26B-A4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-26B-A4B-it-qat-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**31B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-31B-it-qat-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E4B-it-qat-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E4B-it-qat-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E2B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E2B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E2B-it-qat-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endstep %}

{% step %}
（をインストールした後に）モデルをダウンロードしてください `pip install huggingface_hub hf_transfer` ）。次のいずれかを選択できます `UD-Q4_K_XL` または次のような他の量子化版を選択できます `Q8_0` 。ダウンロードが止まる場合は、以下を参照してください: [Hugging Face Hub、XETのデバッグ](/docs/jp/ji-ben/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/gemma-4-26B-A4B-it-qat-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-qat-GGUF \\
    --include "*mmproj-BF16*" \\
    --include "*UD-Q4_K_XL*" # 動的 2ビットには "*UD-Q2_K_XL*" を使用
```

{% endstep %}

{% step %}
その後、会話モードでモデルを実行します（vision 付き `mmproj-F16`):

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-26B-A4B-it-qat-GGUF/gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-qat-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endcode %}
{% endstep %}

{% step %}

### Llama-server のデプロイ

llama-server で Gemma-4 をデプロイするには、次を使用します：

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-qat-GGUF/gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-qat-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-26B-A4B-it-qat-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% hint style="warning" %}
無効化するには [思考 / 推論を無効にする](#how-to-enable-or-disable-reasoning-and-thinking)、次を使用します `--chat-template-kwargs '{"enable_thinking":false}'`

もしあなたが **Windows** のPowerShellでは、次を使用してください： `--chat-template-kwargs "{\"enable_thinking\":false}"`

'true' と 'false' は同じように使用してください。
{% endhint %}
{% endstep %}
{% endstepper %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/moderu/gemma-4/qat.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
