For the complete documentation index, see llms.txt. This page is also available as Markdown.

DiffusionGemma - ローカル実行方法

DiffusionGemma 26B-A4B は Google DeepMind の新しいオープン マルチモーダル モデルで、〜上に構築された Gemma 4 MoEアーキテクチャを採用しています。〜のサポート付きで 256Kのコンテキスト, 140以上の言語、DiffusionGemma は〜向けに設計されています 高速テキスト生成 テキスト、動画、画像入力全体にわたって。DiffusionGemma はローカルで実行できます 18GB RAM、および ファインチューニング は現在、〜を通じてサポートされています Unsloth.

標準的なトークンごとのデコードの代わりに、DiffusionGemma は〜を使用します 拡散生成 出力を並列に生成し、それらを徐々に最終回答へと洗練します。拡散画像モデルに似ていますが、テキスト向けです。モデルの実行は〜で Unsloth Studio または llama.cpp。RTX 6000 では、DiffusionGemma は〜に達します 2000トークン/秒以上. GGUF: diffusiongemma-26B-A4B-it-GGUF

DiffusionGemma を実行DiffusionGemma をファインチューニング

使用ガイド

DiffusionGemma は、標準モデルよりも高速な生成を必要とするユーザー向けに設計されています。高速なローカル推論、長文脈の文書分析、画像/動画理解、OCR、文書解析、コード生成、ツール利用、エージェント的ワークフロー、低遅延の小バッチ推論に適しています。

標準的な Gemma 4 モデルとは異なり、DiffusionGemma には拡散対応の推論ランタイムが必要です。〜のような自己回帰設定は temperature, top_p、および top_k 必要な拡散サンプラーがなければ、推奨動作を再現するには十分ではありません。

ハードウェア要件

4ビット精度でモデルを実行するには、通常少なくとも18GBのRAMがあるとよいです。 GGUF: diffusiongemma-26B-A4B-it-GGUF

表: DiffusionGemma 推論 GGUF 推奨ハードウェア要件 (単位 = 総メモリ:RAM + VRAM、またはユニファイドメモリ)。

4ビット
5ビット
6ビット
8ビット
BF16 / FP16

18 GB

20 GB

24 GB

28 GB

52 GB

目安として、利用可能な総メモリは少なくともダウンロードする量子化モデルのサイズを上回っている必要があります。そうでない場合でも、RAM/ディスクへの部分オフロードで実行できますが、生成は遅くなります。使用するコンテキストウィンドウに応じて、より多くの計算資源も必要になります。

DiffusionGemma チュートリアルを実行

少なくとも4ビット精度を使うのが最善なので、ここでは4ビットを使用します Q4_K_M 量子化版を使用します。これは18GBのRAMを必要とします。 GGUF: diffusiongemma-26B-A4B-it-GGUF

🦥 Unsloth Studioガイド🦙 Llama.cppガイド

🦥 Unsloth Studioガイド

DiffusionGemma は現在〜で実行および学習できます Unsloth Studio。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで次の環境上で実行できます: MacOS, Windows、Linux、および次の機能:

1

Unslothをインストール

最新の v0.1.463-beta または 2026.6.6を使用してください。ターミナルで実行:

MacOS、Linux、WSL:

Windows PowerShell:

2

Unslothを起動

MacOS、Linux、WSL、およびWindows:

次に開く http://127.0.0.1:8888 (またはお使いのURL)をブラウザで。

3

DiffusionGemma を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。

次に〜へ移動し Unsloth Chat タブで、検索バーに DiffusionGemma を入力して検索し、目的のモデルと量子化版をダウンロードします。

4

DiffusionGemma を実行

Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、次を参照してください Unsloth Studio推論ガイド.

🦙 Llama.cppガイド

このチュートリアルでは、Dynamic 4ビットを利用します Q4_K_M 量子化版を使用し、18GBのRAMが必要で llama.cpp 高速なローカル推論のために、特にCPUしかない場合に使用します。

1

特定の llama.cpp PRを GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

2

(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hubをインストールした後)。 Q4_K_M または、次のような他の量子化版を選ぶこともできます: Q8_0 。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ

DiffusionGemma とチャット

次に以下を実行します:

次のように表示されます:

また、「Create a Flappy Bird Game」のような質問を入力すると、手順が表示されます:

その後、出力が表示されます:

会話を続けることもできます!

変更してください -n 2048 予測したいトークン数を指定します。多いほど、より長い回答になります。

拡散のライブ可視化

拡散を実際にライブで見るには、以下を使用してください。特に〜を有効にします --diffusion-visual:

再び次のように表示されます:

すると、次の結果が得られます:

ブランチを使用した llama.cpp の全パラメータ:

  • -n, --n-predict N - 目標トークン; 導出されます --diffusion-blocks および増加します -ub / -b / -c.

  • -ngl 99 - すべてのレイヤーをGPUへオフロード(-ngl 0 CPUのみの場合)。

  • -cnv - 複数ターン会話モード。

  • --diffusion-visual - ライブキャンバスのノイズ除去表示。

  • Entropy-Boundサンプラーはデフォルトで有効です(--diffusion-eb auto)。次の項目で調整できます: --diffusion-eb-max-steps (デフォルト48)、 --diffusion-eb-t-max / --diffusion-eb-t-min (0.8 -> 0.4), --diffusion-eb-entropy-bound (0.1)、および --diffusion-eb-confidence (0.005).

  • --diffusion-kv-cache {auto,on,off} - プロンプト先頭のKVキャッシュ(auto = 単一GPUではon)。

DiffusionGemma をファインチューニング

現在、DiffusionGemma を直接〜で学習およびファインチューニングできます Unsloth。この例では、モデルを数独でファインチューニングすることで、ドメイン固有の学習の効果を示しています。ベースモデルは当初、数独タスクでうまく動作しませんが、対象を絞ったデータセットで学習すると、実際に数独を解く方法を学び、すべての例を正しく解けるようになります。

Colabノートブック(A100)を使って、以下の内容で DiffusionGemma をファインチューニングできます:

推奨設定

Unsloth Studio モデルに最適な推論設定を自動的に設定します。必要に応じて以下を使用してください:

カテゴリ
設定

サンプリング

手法

diffusion_sampling

サンプリング

サンプラー

entropy_bounded_denoising

サンプリング

最大ノイズ除去ステップ

48

温度

温度スケジュール

linear_decay

温度

温度開始

0.8

温度

温度終了

0.4

エントロピー

エントロピー境界

0.1

適応停止

適応停止が有効

true

適応停止

エントロピーしきい値

0.005

キャンバス

キャンバス長

256

適応停止のトリガー条件

適応停止は、次の場合にのみトリガーされるべきです 両方 の条件が満たされたとき:

条件
必要な値

キャンバス平均エントロピー

< 0.005

最高確率トークンが2ステップ連続で安定

true

各ノイズ除去ステップで、サンプラーは相互情報量境界が次のままである最小エントロピートークンを選択すべきです: entropy_bound = 0.1。選択されなかったトークンは、次のノイズ除去ステップの前に完全に再ノイズ化されるべきです。

思考モード

DiffusionGemma は Gemma 4 風の思考モードをサポートしています。思考を有効にするには、システムプロンプトの先頭に思考トークンを追加します:

思考が有効な場合、モデルは内部推論チャンネルの後に最終回答を出力することがあります:

思考を無効にするには、〜を削除します <|think|> トークンをシステムプロンプトから削除します。思考が無効でも、モデルは空の思考チャンネルを出力する場合があります:

複数ターン会話では、〜しないでください しない 会話履歴に以前の隠れた思考を含める。次のユーザーターンの前には、最終的なアシスタント応答のみを含めてください。

DiffusionGemma のベストプラクティス

マルチモーダルプロンプト

DiffusionGemma は、テキストと画像を含むインターリーブされたマルチモーダル入力をサポートします。動画は画像フレームのシーケンスとして処理できます。

マルチモーダルプロンプトで最良の結果を得るには、画像またはフレームの内容をテキスト指示の前に配置します。例:

文書解析、OCR、チャート理解、UI理解、または短いテキスト抽出には、より大きい視覚トークン予算を使用してください。

サポートされる視覚トークン予算:

視覚トークン予算
最適用途

70

高速分類、簡単なキャプション作成

140

軽量な視覚QA

280

一般的な画像理解

560

OCR、チャート、UIスクリーンショット

1120

高密度文書、小さな文字、詳細抽出

動画形式の入力では、DiffusionGemma は最大〜を処理できます 60秒 〜でサンプリングした場合 1秒あたり1フレーム.

サンプリングの注意

DiffusionGemma は通常の次トークンのみのモデルではありません。これは、ノイズのあるトークン予測を繰り返し洗練することで、 キャンバスと呼ばれるトークンのブロックを生成します。生成プロセスはおおむね次のように進みます:

  1. エンコーダーがプロンプトを処理し、コンテキストキャッシュを構築します。

  2. デコーダーが256トークンの生成キャンバスを受け取ります。

  3. 拡散サンプラーがキャンバスを反復的にノイズ除去します。

  4. 確信度の高いトークンが選択され、保持されます。

  5. 不確実なトークンは再ノイズ化され、再び洗練されます。

  6. キャンバスが完成すると、コンテキストに追加されます。

  7. モデルは次のキャンバスへ進みます。

このブロック自己回帰アプローチにより、DiffusionGemma は標準的な自己回帰モデルよりも少ない順伝播で多くのトークンを生成できます。

ベンチマーク

DiffusionGemma は速度とマルチモーダル推論に最適化されていますが、標準の Gemma 4 は従来の推論ベンチマークでより強力です。

ベンチマーク
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MMLU Pro

77.6%

82.6%

AIME 2026 no tools

69.1%

88.3%

LiveCodeBench v6

69.1%

77.1%

Codeforces ELO

1429

1718

GPQA Diamond

73.2%

82.3%

Tau2 Average

56.2%

68.2%

HLE no tools

11.0%

8.7%

HLE with search

11.9%

17.2%

BigBench Extra Hard

47.6%

64.8%

MMMLU

81.5%

86.3%

長文脈ベンチマーク
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MRCR v2 8 needle 128K 平均

32.0%

44.1%

視覚ベンチマーク:

視覚ベンチマーク
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MMMU Pro

54.3%

73.8%

OmniDocBench 1.5、低いほど良い

0.319

0.149

MATH-Vision

70.5%

82.4%

MedXPertQA MM

49.0%

58.1%

最終更新

役に立ちましたか?