> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/moderu/gemma-4.md).

# Gemma 4 - ローカルでの実行方法

Gemma 4 は Google DeepMind の新しいオープンモデル群で、以下を含みます **12B**, **E2B**, **E4B**, **26B-A4B**、および **31B。** マルチモーダルでハイブリッド思考のモデルは 140以上の言語、最大 **256K コンテキスト**に対応し、Dense と MoE のバリアントがあります。Gemma 4 は Apache-2.0 ライセンスで、ローカルデバイスで実行できます。

**Gemma-4-12B** は新しく、テキスト・画像・音声を統合してサポートします。実行には **8GB** RAM（4-bit）または 14GB（8-bit）。 **Gemma-4-E2B** と **E4B** も画像と音声に対応しています。実行には **5GB RAM** （4-bit）または 15GB（完全な 16-bit）を GGUF、MLX、または NVFP4 の量子化で使用します。

<a href="/pages/693bc7a2f22dcaf0c6bc0818f2076196fe331fa7#run-gemma-4-tutorials" class="button primary">Gemma 4 を実行する</a><a href="/pages/4a6e7bbec569d341f876db55593564610de4d0a8" class="button secondary">Gemma 4 をファインチューニングする</a><a href="/pages/136e446d64d842f3384bec65ba2ec312454e6e91" class="button primary">Gemma 4 QAT</a><a href="/pages/dd5bb70bca754ea9bde116b50d92614a5ee10c37#gemma-4-mtp" class="button secondary">Gemma 4 MTP</a>

{% hint style="success" %}
**新着:** [**Gemma 4 MTP が登場**](/docs/jp/moderu/mtp.md)**! MTP により、精度を落とさずに推論を 1.4〜2.2 倍高速化できます。MTP を** [**Unsloth Studio**](/docs/jp/moderu/mtp.md#unsloth-studio-mtp-guide)**.**
{% endhint %}

{% columns %}
{% column %}
**Gemma-4-26B-A4B** で動作します **18GB** （4-bit）または 28GB（8-bit）。 **Gemma-4-31B** には **20GB RAM** （4-bit）または 34GB（8-bit）。

今ではすべての GGUF、 [MLX](#mlx-dynamic-quants) および Gemma 4 のファインチューニングを [Unsloth Studio](#unsloth-studio-guide) （右を参照）。

[**QAT** バリアント](/docs/jp/moderu/gemma-4/qat.md) の Gemma 4 は、モデル品質を維持しながらメモリ要件を約 3 分の 1 に削減します。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/52ac81606e9a31b3f691aabcec5c0ad84f45aee2" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
**6月9日:** [Gemma 4 MTP](/docs/jp/moderu/mtp.md) が登場。

**6月5日:** [Gemma 4 QAT](/docs/jp/moderu/gemma-4/qat.md) がリリースされました。

**6月2日:** Gemma 4 12B Unified がリリースされました。

**4月20日:** 私たちは [Gemma 4 GGUF ベンチマーク](#unsloth-gguf-benchmarks) を実施し、最適な量子化モデルの選択を支援しました。
{% endhint %}

### 使用ガイド

Gemma 4 は、推論、コーディング、ツール使用、長文コンテキストとエージェント型ワークフロー、そしてマルチモーダルタスクで優れています。小型の E2B と E4B はスマートフォンやノートPC向けに設計されており、一方大きいモデルは NVIDIA RTX GPU 搭載 PC などの中〜高 CPU/VRAM システムを対象としています。

| Gemma 4 バリアント   | 詳細                                                 | 最適                                 |
| --------------- | -------------------------------------------------- | ---------------------------------- |
| **E2B**         | <p>Dense + PLE (128K コンテキスト)<br>対応: テキスト、画像、音声</p> | スマートフォン / エッジ推論、ASR、音声翻訳向け         |
| **E4B**         | <p>Dense + PLE (128K コンテキスト)<br>対応: テキスト、画像、音声</p> | ノートPC向けの小型モデルで、高速なローカルマルチモーダル利用に最適 |
| **12B Unified** | <p>Dense (256K コンテキスト)<br>対応: テキスト、画像、音声</p>       | ノートPCおよびローカルマルチモーダル利用向けの中型モデル      |
| **26B-A4B**     | <p>MoE (256K コンテキスト)<br>対応: テキスト、画像</p>            | コンピュータ利用における速度 / 品質の最適なバランス        |
| **31B**         | <p>Dense (256K コンテキスト)<br>対応: テキスト、画像</p>          | 低速な推論でも最も高い性能                      |

**Gemma 4 の参照:** [**性能ベンチマーク**](#official-gemma-benchmarks) **と** [**GGUF ベンチマーク**](#unsloth-gguf-benchmarks)**.**

**26B-A4B と 31B のどちらを選ぶべき？**

* **26B-A4B** - 速度と精度のバランスが取れています。MoE 設計により、4B のアクティブパラメータで 31B より高速です。RAM が限られていて、品質を少し速度と引き換えにしてもよいなら、これを選んでください。
* **31B** - 現在のところ最も強力な Gemma 4 モデルです。十分なメモリがあり、やや遅い速度を受け入れられるなら、最高品質を求めてこれを選んでください。

### ハードウェア要件

**表: Gemma 4 推論 GGUF の推奨ハードウェア要件** （単位 = 合計メモリ: RAM + VRAM、またはユニファイドメモリ）。Gemma 4 は MacOS、NVIDIA RTX GPU などで使用できます。

| Gemma 4 バリアント   |    4-bit |    8-bit | BF16 / FP16 |
| --------------- | -------: | -------: | ----------: |
| **E2B**         |     4 GB |   5〜8 GB |       10 GB |
| **E4B**         | 5.5〜6 GB |  9〜12 GB |       16 GB |
| **12B Unified** |   7〜8 GB | 13〜14 GB |       25 GB |
| **26B A4B**     | 16〜18 GB | 28〜30 GB |       52 GB |
| **31B**         | 17〜20 GB | 34〜38 GB |       62 GB |

{% hint style="info" %}
目安として、利用可能な総メモリは、ダウンロードする量子化モデルのサイズを少なくとも上回っている必要があります。そうでない場合でも、llama.cpp は RAM / ディスクへの部分オフロードで実行できますが、生成は遅くなります。さらに、使用するコンテキストウィンドウに応じて、より多くの計算資源も必要になります。
{% endhint %}

### 推奨設定

Google のデフォルトの Gemma 4 パラメータを使用することを推奨します:

* `temperature = 1.0`
* `top_p = 0.95`
* `top_k = 64`

{% hint style="info" %}
Gemma 4 の最大コンテキストは **128K** です **E2B** / **E4B** と `262,144` です **12B** / **26B A4B** / **31B**.
{% endhint %}

#### 思考モード

旧来の Gemma チャットテンプレートと比べて、Gemma 4 は標準の **`system`**, **`assistant`**、および **`user`** ロールを使い、明示的な思考制御を追加しています。

**思考を有効にする方法:**

トークン **`<|think|>`** を **システムプロンプトの先頭に**.

{% columns %}
{% column %}
**思考有効**

```
<|think|>
あなたは慎重なコーディングアシスタントです。回答を明確に説明してください。
```

{% endcolumn %}

{% column %}
**思考無効**

```
あなたは慎重なコーディングアシスタントです。回答を明確に説明してください。
```

{% endcolumn %}
{% endcolumns %}

**出力の動作:**

{% columns %}
{% column %}
思考が有効な場合、モデルは最終回答の前に内部推論チャネルを出力します。

```
<|channel>thought
[内部推論]
<channel|>
[最終回答]
```

{% endcolumn %}

{% column %}
思考が無効な場合でも、大きいモデルは最終回答の前に **空の思考ブロック** を出力することがあります。

```
<|channel>thought
<channel|>
[最終回答]
```

{% endcolumn %}
{% endcolumns %}

**たとえば「**&#x30D5;ランスの首都はどこですか？」:

{% code overflow="wrap" %}

```
<bos><|turn>system\n<|think|><turn|>\n<|turn>user\nフランスの首都はどこですか？<turn|>\n<|turn>model\n
```

{% endcode %}

**すると、次のように出力されます:**

{% code overflow="wrap" %}

```
<|channel>thought\nユーザーはフランスの首都を尋ねています。\nフランスの首都はパリです。<channel|>フランスの首都はパリです。<turn|>
```

{% endcode %}

**マルチターンチャットのルール:**

複数ターンの会話では、 **チャット履歴には最終的に表示された回答のみを保持し**。しないで **ください** 。以前の思考ブロックを次のターンに戻さないでください。

{% code overflow="wrap" %}

```
<bos><|turn>user\n1+1 はいくつですか？<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\n1+1 はいくつですか？<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\n1+1 はいくつですか？<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\n1+1 はいくつですか？<turn|>\n<|turn>model\n2<turn|>\n
```

{% endcode %}

**思考を無効にする方法:**

注 `llama-cli` は安定して動作しない可能性があるため、代わりに `llama-server` を使用して推論を無効にします:

{% hint style="warning" %}
無効化 [するには](#how-to-enable-or-disable-reasoning-and-thinking)、次を使用: `--chat-template-kwargs '{"enable_thinking":false}'`

お使いの環境が **Windows** PowerShell の場合は、次を使用します: `--chat-template-kwargs "{\"enable_thinking\":false}"`

「true」と「false」は同じ意味で使えます。
{% endhint %}

## Gemma 4 チュートリアルを実行する

Gemma 4 GGUF は複数のサイズで提供されているため、小型モデルの推奨開始点は 8-bit で、大型モデルは [**Dynamic**](/docs/jp/ji-chu/unsloth-dynamic-2.0-ggufs.md) **4-bit**. [Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4) または [MLX](#mlx-dynamic-quants) または [NVFP4](#nvfp4-guide):

| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-GGUF) | [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-GGUF) | [12b](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) | [26B-A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF) | [31B](https://huggingface.co/unsloth/gemma-4-31B-it-GGUF) |
| --------------------------------------------------------- | --------------------------------------------------------- | --------------------------------------------------------- | ----------------------------------------------------------------- | --------------------------------------------------------- |

<a href="/pages/693bc7a2f22dcaf0c6bc0818f2076196fe331fa7#unsloth-studio-guide" class="button primary">🦥 Unsloth Studio ガイド</a><a href="/pages/693bc7a2f22dcaf0c6bc0818f2076196fe331fa7#llama.cpp-guide" class="button primary">🦙 Llama.cpp ガイド</a><a class="button primary">NVFP4 ガイド</a>

{% columns %}
{% column %}
**当社の** [**Unsloth Studio**](/docs/jp/xin-zhe/studio.md)✨ **ノートブックで、UI 付きで Gemma 4 を無料で実行・学習できます:**
{% endcolumn %}

{% column %}
{% embed url="<https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb>" %}
{% endcolumn %}
{% endcolumns %}

### 🦥 Unsloth Studio ガイド

Gemma 4 は現在、 [Unsloth Studio](/docs/jp/xin-zhe/studio.md)、ローカル AI 向けの新しいオープンソース Web UI です。Unsloth Studio を使用すると、モデルをローカルで **MacOS、Windows**、Linux で実行できます。さらに:

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUF を実行](/docs/jp/xin-zhe/studio.md#run-models-locally) および safetensor モデル
* [**自己修復** ツール呼び出し](/docs/jp/xin-zhe/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/xin-zhe/studio.md#run-models-locally) （Python、Bash）
* [自動推論](/docs/jp/xin-zhe/studio.md#model-arena) パラメータ調整（temp、top-p など）
* llama.cpp による高速な CPU + GPU 推論
* [LLM を学習](/docs/jp/xin-zhe/studio.md#no-code-training) VRAM を 70% 削減して 2 倍高速
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/15781d66f25558946794c4025a5ece324f0db186" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth をインストール

ターミナルで次を実行:

**MacOS、Linux、WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth を起動

**MacOS、Linux、WSL、Windows:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

次に開く `http://127.0.0.1:8888` またはご利用の特定の URL をブラウザで開いてください。

**HTTPS と Cloudflare を使って安全に Unsloth を起動**

**新着!** Unsloth は現在、無料の Cloudflare トンネルを通じて HTTPS で Unsloth を起動する安全な方法を提供しています。以下を使用してください（Windows、Mac、Linux で動作します）:

```bash
unsloth studio --secure
```

{% endstep %}

{% step %}

#### Gemma 4 を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。

次に [Unsloth Chat](/docs/jp/xin-zhe/studio/chat.md) タブを開き、検索バーで Gemma 4 を検索して、希望するモデルと量子化版をダウンロードしてください。Unsloth は最新の Gemma-4-12B Unified モデルをサポートしています。

<div data-with-frame="true"><figure><img src="/files/5ce0cbbf8496663435148cc3eb0a7f192d13179d" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Gemma 4 を実行する

Unsloth Studio を使用すると推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。GGUF と MLX ファイルを実行できます。

詳細については、 [Unsloth Studio 推論ガイド](/docs/jp/xin-zhe/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/15781d66f25558946794c4025a5ece324f0db186" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp ガイド

をご覧ください。このガイドでは、12B、26B-A4B、31B には Dynamic 4-bit を、E2B と E4B には 8-bit を使用します。以下を参照: [Gemma 4 GGUF コレクション](https://huggingface.co/collections/unsloth/gemma-4)

これらのチュートリアルでは、 [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) を使って高速なローカル推論を行います。特に CPU をお使いの場合に適しています。

{% stepper %}
{% step %}
最新の `llama.cpp` **を** [**GitHub から入手**](https://github.com/ggml-org/llama.cpp)してください。また、以下のビルド手順にも従えます。 `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` に変更してください。GPU がない場合や CPU 推論のみを行いたい場合です。 **Apple Mac / Metal デバイスでは**、 `-DGGML_CUDA=OFF` を設定し、その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
を使いたい場合は `llama.cpp` 、モデルごとに以下のコマンドに従って直接モデルを読み込むことができます。 `UD-Q4_K_XL` は量子化タイプです。Hugging Face 経由でもダウンロードできます（手順 3）。これは `ollama run` に似ています。 `export LLAMA_CACHE="folder"` を使って `llama.cpp` を特定の場所に保存するよう強制できます。llama.cpp が必要な正確な量を自動的に使用するため、コンテキスト長を設定する必要はありません。

{% hint style="warning" %}
無効化 [するには](#how-to-enable-or-disable-reasoning-and-thinking)、次を使用: `--chat-template-kwargs '{"enable_thinking":false}'`

**Windows** PowerShell: `--chat-template-kwargs "{\"enable_thinking\":false}"`

「`true`」と「`false`」は同じ意味で使えます。
{% endhint %}

**12B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-12B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**26B-A4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-26B-A4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**31B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-31B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-31B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E4B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E2B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E2B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E2B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endstep %}

{% step %}
モデルを手動でダウンロードすることもできます（ `pip install huggingface_hub`のインストール後）。 `UD-Q4_K_XL` または `Q8_0` などの他の量子化版を選ぶことができます。ダウンロードが止まった場合は、以下を参照: [Hugging Face Hub、XETのデバッグ](/docs/jp/ji-chu/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/gemma-4-26B-A4B-it-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-GGUF \\
    --include "*mmproj-BF16*" \\
    --include "*UD-Q4_K_XL*" # Dynamic 2bit には "*UD-Q2_K_XL*" を使用
```

{% endstep %}

{% step %}
次に、会話モード（vision 付き）でモデルを実行します `mmproj-F16`):

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endcode %}
{% endstep %}

{% step %}

#### Llama-server のデプロイ

Gemma-4 を llama-server でデプロイするには、次を使用します:

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-26B-A4B-it-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% endstep %}
{% endstepper %}

### MLX のダイナミック量子化版

MacOS デバイス向けの最初の試みとして、ダイナミック 4bit と 8bit の量子化版もアップロードしました！MLX の量子化版は **vision に対応しています。**

{% hint style="success" %}
すべての MLX 量子化版は現在[ Unsloth Studio](#unsloth-studio-guide)!
{% endhint %}

| Gemma 4 | 4-bit MLX                                                            | 8-bit MLX                                                         |
| ------- | -------------------------------------------------------------------- | ----------------------------------------------------------------- |
| 31B     | [リンク](https://huggingface.co/unsloth/gemma-4-31b-it-UD-MLX-4bit)     | [リンク](https://huggingface.co/unsloth/gemma-4-31b-it-MLX-8bit)     |
| 26B-A4B | [リンク](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit) | [リンク](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-MLX-8bit) |
| E4B     | [リンク](https://huggingface.co/unsloth/gemma-4-E4B-it-UD-MLX-4bit)     | [リンク](https://huggingface.co/unsloth/gemma-4-E4B-it-MLX-8bit)     |
| E2B     | [リンク](https://huggingface.co/unsloth/gemma-4-E2B-it-UD-MLX-4bit)     | [リンク](https://huggingface.co/unsloth/gemma-4-E2B-it-MLX-8bit)     |

試すには次を使用:

{% code overflow="wrap" %}

```bash
curl -fsSL https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/scripts/install_gemma4_mlx.sh | sh
source ~/.unsloth/unsloth_gemma4_mlx/bin/activate
python -m mlx_vlm.chat --model unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit
```

{% endcode %}

### **NVFP4 ガイド**

アップロードしました [動的 NVFP4](/docs/jp/ji-chu/nvfp4.md) Gemma 4 の量子化モデルは、NVIDIA Blackwell GPU 上でより高速な 4-bit 推論を実現します。Gemma 4 を含む、使用できるモデルのハードウェア要件は次のとおりです。得られる全体的な速度向上もご覧ください:

| Gemma 4 バリアント                                                      | 必要VRAM | BF16より高速 |
| ------------------------------------------------------------------ | -----: | -------: |
| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-NVFP4)         |   7 GB |  1.12倍高速 |
| [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-NVFP4)         |   9 GB |  1.22倍高速 |
| [12B Unified](https://huggingface.co/unsloth/gemma-4-12b-it-NVFP4) |  11 GB |  1.26倍高速 |
| [26B A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-NVFP4) |  26 GB |  1.41倍高速 |
| [31B](https://huggingface.co/unsloth/gemma-4-31B-it-NVFP4)         |  32 GB |  1.45倍高速 |

<figure><img src="/files/4be465fbffe804dae8002ce19bdbfa30382add76" alt="" width="563"><figcaption></figcaption></figure>

#### **vLLM チュートリアル:**

NVFP4 量子化モデルを実行するには、以下の Gemma-4-26B-A4B を実行するコマンドをご覧ください: [vLLM](/docs/jp/ji-chu/inference-and-deployment/vllm-guide.md) と [SGLang](/docs/jp/ji-chu/inference-and-deployment/sglang-guide.md) （モデル名を次のように変更できます: `gemma-4-31B-it-NVFP4` など）また、MoE バックエンドは選択しないでください。vLLM に選ばせてください。たとえば Marlin は 2.5倍遅いです！参照: [#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl](#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl "mention")DGX Spark をお持ちの場合は、参照: [#dgx-spark-serving](#dgx-spark-serving "mention") 必ず使用してください `--moe-backend flashinfer_b12x` さもないと推論がかなり遅くなります。

別の venv に vLLM をインストールするには:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto
```

{% endcode %}

それから 26B MoE 版をサービングするには:

```shell
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
```

変更してください `unsloth/gemma-4-26B-A4B-it-NVFP4` 任意の [利用可能な NVFP4](/docs/jp/ji-chu/nvfp4.md#overview) 量子化名に！

MTP / 予測デコードを有効にするには（デコードは高速になりますが、スループットはやや低下します）、次を使用してください:

```bash
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Torchcodec の問題が発生した場合は、必ず以下を実行してから vllm を再起動してください。

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **NVFP4量子化モデルを使う DGX Spark**

DGX Spark に正しいカーネルがあることを確認するには（そうしないと **2倍遅い推論**）、まず次を確認してください:

{% code overflow="wrap" expandable="true" %}

```bash
python -c "
import torch; from vllm.utils.flashinfer import has_flashinfer_b12x_gemm as g, has_flashinfer_b12x_moe as m
cap = torch.cuda.get_device_capability(); print('cap', cap, '| b12x gemm', g(), '| b12x moe', m()); assert cap[0] == 12 and g() and m(), 'b12x unavailable: serving would degrade to marlin W4A16'"
```

{% endcode %}

これはエラーになってはいけません。もしエラーになる場合は、vllm を更新するか、次で再インストールしてください:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto
```

{% endcode %}

それから DGX Spark で vLLM でサービングするには:

{% code overflow="wrap" expandable="true" %}

```shellscript
export CUTE_DSL_ARCH=sm_121a
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4 --moe-backend flashinfer_b12x
```

{% endcode %}

Torchcodec の問題が発生した場合は、必ず以下を実行してから vllm を再起動してください。

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang チュートリアル:**

```bash
python -m sglang.launch_server --model-path unsloth/gemma-4-31B-it-NVFP4 --speculative-algorithm NEXTN \
     --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
```

### Ollama ガイド

Ollama は現在 Unsloth GGUF をよくサポートしています。次を使用してください `curl -fsSL https://ollama.com/install.sh | sh` Linux に Ollama をインストールするには、または `irm https://ollama.com/install.ps1 | iex` Windows では。\
\
単一の量子化ファイル（50GB未満）を使うには、次を使用してください:

{% code overflow="wrap" %}

```bash
ollama run hf.co/unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL
```

{% endcode %}

より大きな BF16 シャードのような複数のシャードの場合は、次を行ってください:

{% code overflow="wrap" %}

```bash
pip install -U huggingface_hub

# mmproj と BF16 を 2 回でダウンロード
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "BF16/*" \
    --local-dir gemma4
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "mmproj-BF16.gguf" \
    --local-dir gemma4

mv gemma4/mmproj-BF16.gguf gemma4/BF16/
echo "FROM ./gemma4/BF16" > Modelfile

ollama create unsloth-gemma4 -f Modelfile
ollama run unsloth-gemma4
```

{% endcode %}

<div data-with-frame="true"><figure><img src="/files/0761a140fbaca6784e4d35032c20a60ea20bd865" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
もし次が表示されたら `エラー: 500 Internal Server Error: モデルを読み込めません` 次で Ollama を更新してください `curl -fsSL https://ollama.com/install.sh | sh` または PowerShell 版を使ってください。
{% endhint %}

## Gemma 4 のベストプラクティス

### プロンプト例

#### シンプルな推論プロンプト

```
システム:
<|think|>
あなたは正確な推論アシスタントです。

ユーザー:
列車は午前8時15分に出発し、午前11時47分に到着しました。所要時間はどれくらいでしたか?
```

#### OCR / 文書プロンプト

OCR には、 **高い視覚トークン予算** のような **560** または **1120**.

```
[画像を先に]
この領収書からすべてのテキストを抽出してください。明細、合計、店舗名、日付を JSON 形式で返してください。
```

#### マルチモーダル比較プロンプト

```
[画像 1]
[画像 2]
これら 2 枚のスクリーンショットを比較し、新しいユーザーをより混乱させそうなのはどちらか教えてください。
```

#### 音声ASRプロンプト

```
以下の音声区間を {LANGUAGE} で書き起こし、{LANGUAGE} のテキストにしてください。

回答の書式について、以下の具体的な指示に従ってください:
* 改行なしで、書き起こし結果のみを出力してください。
* 数字を書くときは数字で表記してください。つまり one point seven ではなく 1.7 と書き、three ではなく 3 と書いてください。
```

#### 音声翻訳プロンプト

```
以下の音声区間を {SOURCE_LANGUAGE} で書き起こし、その後 {TARGET_LANGUAGE} に翻訳してください。回答の書式では、まず {SOURCE_LANGUAGE} の書き起こしを出力し、次に改行を 1 つ入れ、その後文字列 '{TARGET_LANGUAGE}: ' を出力し、最後に {TARGET_LANGUAGE} の翻訳を出力してください。
```

### マルチモーダル設定

マルチモーダルプロンプトで最良の結果を得るには、マルチモーダルの内容を先に置いてください:

* 置いてください **画像および/または音声をテキストの前に**.
* 動画の場合は、まずフレーム列を渡し、その後に指示を渡してください。

#### 音声と動画の制限

* **音声** で利用可能です **12B**, **E2B** と **E4B** のみです。
* 音声は最大 **30秒**.
* 動画は最大 **60秒** を前提に **1秒あたり1フレーム** の処理。

#### 音声プロンプトテンプレート

**ASRプロンプト**

```
以下の音声区間を {LANGUAGE} で書き起こし、{LANGUAGE} のテキストにしてください。

回答の書式について、以下の具体的な指示に従ってください:
* 改行なしで、書き起こし結果のみを出力してください。
* 数字を書くときは数字で表記してください。つまり one point seven ではなく 1.7 と書き、three ではなく 3 と書いてください。
```

**音声翻訳プロンプト**

```
以下の音声区間を {SOURCE_LANGUAGE} で書き起こし、その後 {TARGET_LANGUAGE} に翻訳してください。
回答の書式では、まず {SOURCE_LANGUAGE} の書き起こしを出力し、次に改行を 1 つ入れ、その後文字列 '{TARGET_LANGUAGE}: ' を出力し、最後に {TARGET_LANGUAGE} の翻訳を出力してください。
```

## 📊 ベンチマーク

### Unsloth GGUF ベンチマーク

最適な量子化モデルを選べるように、Gemma 4 GGUF のプロバイダー横断の平均 KL ダイバージェンス ベンチマークを実施しました（低いほど良い）。

* KL ダイバージェンスにより、すべての Unsloth GGUF が SOTA のパレートフロンティア上に位置づけられます
* KLD は、量子化モデルが元の BF16 出力分布にどれだけ一致しているかを示し、保持された精度を示します。

<div data-with-frame="true"><figure><img src="/files/d265501d0f0774cfc0fc76a1d11f9ff5179a6a94" alt=""><figcaption><p>26B A4B - KLD ベンチマーク（低いほど良い）</p></figcaption></figure></div>

### 公式 Gemma ベンチマーク

**テキスト/コード ベンチマーク**

| ベンチマーク              | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B（思考なし） |
| ------------------- | ----------- | --------------- | ------------------- | ----------- | ----------- | ----------------- |
| MMLU Pro            | 85.2%       | 82.6%           | 77.2%               | 69.4%       | 60.0%       | 67.6%             |
| AIME 2026（ツールなし）    | 89.2%       | 88.3%           | 77.5%               | 42.5%       | 37.5%       | 20.8%             |
| LiveCodeBench v6    | 80.0%       | 77.1%           | 72.0%               | 52.0%       | 44.0%       | 29.1%             |
| Codeforces ELO      | 2150        | 1718            | 1659                | 940         | 633         | 110               |
| GPQA Diamond        | 84.3%       | 82.3%           | 78.8%               | 58.6%       | 43.4%       | 42.4%             |
| Tau2                | 76.9%       | 68.2%           | 69.0%               | 42.2%       | 24.5%       | 16.2%             |
| HLE（ツールなし）          | 19.5%       | 8.7%            | 5.2%                | -           | -           | -                 |
| 検索ありの HLE           | 26.5%       | 17.2%           | -                   | -           | -           | -                 |
| BigBench Extra Hard | 74.4%       | 64.8%           | 53.0%               | 33.1%       | 21.9%       | 19.3%             |
| MMMLU               | 88.4%       | 86.3%           | 83.4%               | 76.6%       | 67.4%       | 70.7%             |

**画像ベンチマーク**

| MMMU Pro                 | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
| ------------------------ | ----- | ----- | ----- | ----- | ----- | ----- |
| OmniDocBench 1.5（低いほど良い） | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
| MATH-Vision              | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
| MedXPertQA MM            | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -     |

**音声ベンチマーク**

| CoVoST                    | -     | -     | 38.5<sup>\*</sup>  | 35.54 | 33.47 | -     |
| ------------------------- | ----- | ----- | ------------------ | ----- | ----- | ----- |
| FLEURS（低いほど良い）            | -     | -     | 0.069<sup>\*</sup> | 0.08  | 0.09  | -     |
| **長文コンテキスト**              |       |       |                    |       |       |       |
| MRCR v2 8 needle 128k（平均） | 66.4% | 44.1% | 43.4%              | 25.4% | 19.1% | 13.5% |

<div data-with-frame="true"><figure><img src="/files/2f05e915ec04ec487a14a8f018a782370af74f57" alt=""><figcaption></figcaption></figure></div>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/moderu/gemma-4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
