DiffusionGemma - ローカル実行方法
DiffusionGemma 26B-A4B は Google DeepMind の新しいオープン マルチモーダル モデルで、〜上に構築された Gemma 4 MoEアーキテクチャを採用しています。〜のサポート付きで 256Kのコンテキスト, 140以上の言語、DiffusionGemma は〜向けに設計されています 高速テキスト生成 テキスト、動画、画像入力全体にわたって。DiffusionGemma はローカルで実行できます 18GB RAM、および ファインチューニング は現在、〜を通じてサポートされています Unsloth.
標準的なトークンごとのデコードの代わりに、DiffusionGemma は〜を使用します 拡散生成 出力を並列に生成し、それらを徐々に最終回答へと洗練します。拡散画像モデルに似ていますが、テキスト向けです。モデルの実行は〜で Unsloth Studio または llama.cpp。RTX 6000 では、DiffusionGemma は〜に達します 2000トークン/秒以上. GGUF: diffusiongemma-26B-A4B-it-GGUF
DiffusionGemma を実行DiffusionGemma をファインチューニング
6月12日: 現在、DiffusionGemma は〜経由で実行できます Unsloth Studio ✨ 1.8倍高速な推論で!
使用ガイド
DiffusionGemma は、標準モデルよりも高速な生成を必要とするユーザー向けに設計されています。高速なローカル推論、長文脈の文書分析、画像/動画理解、OCR、文書解析、コード生成、ツール利用、エージェント的ワークフロー、低遅延の小バッチ推論に適しています。
標準的な Gemma 4 モデルとは異なり、DiffusionGemma には拡散対応の推論ランタイムが必要です。〜のような自己回帰設定は temperature, top_p、および top_k 必要な拡散サンプラーがなければ、推奨動作を再現するには十分ではありません。

ハードウェア要件
4ビット精度でモデルを実行するには、通常少なくとも18GBのRAMがあるとよいです。 GGUF: diffusiongemma-26B-A4B-it-GGUF
表: DiffusionGemma 推論 GGUF 推奨ハードウェア要件 (単位 = 総メモリ:RAM + VRAM、またはユニファイドメモリ)。
18 GB
20 GB
24 GB
28 GB
52 GB
目安として、利用可能な総メモリは少なくともダウンロードする量子化モデルのサイズを上回っている必要があります。そうでない場合でも、RAM/ディスクへの部分オフロードで実行できますが、生成は遅くなります。使用するコンテキストウィンドウに応じて、より多くの計算資源も必要になります。
DiffusionGemma チュートリアルを実行
少なくとも4ビット精度を使うのが最善なので、ここでは4ビットを使用します Q4_K_M 量子化版を使用します。これは18GBのRAMを必要とします。 GGUF: diffusiongemma-26B-A4B-it-GGUF
🦥 Unsloth Studioガイド🦙 Llama.cppガイド
🦥 Unsloth Studioガイド
現在、DiffusionGemma は〜経由で実行できます Unsloth Studio ✨。必ず〜を使用してください v0.1.463-beta または 2026.6.6.
DiffusionGemma は現在〜で実行および学習できます Unsloth Studio。これはローカルAI向けの新しいオープンソースWeb UIです。Unsloth Studioでは、モデルをローカルで次の環境上で実行できます: MacOS, Windows、Linux、および次の機能:
検索、ダウンロード、 GGUFの実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cpp経由の高速CPU+GPU推論
LLMの学習 VRAMを70%削減しつつ2倍高速

DiffusionGemma を検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、再度サインインする必要があります。
次に〜へ移動し Unsloth Chat タブで、検索バーに DiffusionGemma を入力して検索し、目的のモデルと量子化版をダウンロードします。
DiffusionGemma を実行
Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、次を参照してください Unsloth Studio推論ガイド.

🦙 Llama.cppガイド
このチュートリアルでは、Dynamic 4ビットを利用します Q4_K_M 量子化版を使用し、18GBのRAMが必要で llama.cpp 高速なローカル推論のために、特にCPUしかない場合に使用します。
特定の llama.cpp PRを GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hubをインストールした後)。 Q4_K_M または、次のような他の量子化版を選ぶこともできます: Q8_0 。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ
DiffusionGemma とチャット
次に以下を実行します:
次のように表示されます:

また、「Create a Flappy Bird Game」のような質問を入力すると、手順が表示されます:

その後、出力が表示されます:

会話を続けることもできます!
変更してください -n 2048 予測したいトークン数を指定します。多いほど、より長い回答になります。
拡散のライブ可視化
拡散を実際にライブで見るには、以下を使用してください。特に〜を有効にします --diffusion-visual:
再び次のように表示されます:

すると、次の結果が得られます:

ブランチを使用した llama.cpp の全パラメータ:
-n, --n-predict N- 目標トークン; 導出されます--diffusion-blocksおよび増加します-ub/-b/-c.-ngl 99- すべてのレイヤーをGPUへオフロード(-ngl 0CPUのみの場合)。-cnv- 複数ターン会話モード。--diffusion-visual- ライブキャンバスのノイズ除去表示。Entropy-Boundサンプラーはデフォルトで有効です(
--diffusion-eb auto)。次の項目で調整できます:--diffusion-eb-max-steps(デフォルト48)、--diffusion-eb-t-max/--diffusion-eb-t-min(0.8 -> 0.4),--diffusion-eb-entropy-bound(0.1)、および--diffusion-eb-confidence(0.005).--diffusion-kv-cache {auto,on,off}- プロンプト先頭のKVキャッシュ(auto = 単一GPUではon)。
DiffusionGemma をファインチューニング
現在、DiffusionGemma を直接〜で学習およびファインチューニングできます Unsloth。この例では、モデルを数独でファインチューニングすることで、ドメイン固有の学習の効果を示しています。ベースモデルは当初、数独タスクでうまく動作しませんが、対象を絞ったデータセットで学習すると、実際に数独を解く方法を学び、すべての例を正しく解けるようになります。
Colabノートブック(A100)を使って、以下の内容で DiffusionGemma をファインチューニングできます:

推奨設定
Unsloth Studio モデルに最適な推論設定を自動的に設定します。必要に応じて以下を使用してください:
サンプリング
手法
diffusion_sampling
サンプリング
サンプラー
entropy_bounded_denoising
サンプリング
最大ノイズ除去ステップ
48
温度
温度スケジュール
linear_decay
温度
温度開始
0.8
温度
温度終了
0.4
エントロピー
エントロピー境界
0.1
適応停止
適応停止が有効
true
適応停止
エントロピーしきい値
0.005
キャンバス
キャンバス長
256
適応停止のトリガー条件
適応停止は、次の場合にのみトリガーされるべきです 両方 の条件が満たされたとき:
キャンバス平均エントロピー
< 0.005
最高確率トークンが2ステップ連続で安定
true
各ノイズ除去ステップで、サンプラーは相互情報量境界が次のままである最小エントロピートークンを選択すべきです: entropy_bound = 0.1。選択されなかったトークンは、次のノイズ除去ステップの前に完全に再ノイズ化されるべきです。
思考モード
DiffusionGemma は Gemma 4 風の思考モードをサポートしています。思考を有効にするには、システムプロンプトの先頭に思考トークンを追加します:
思考が有効な場合、モデルは内部推論チャンネルの後に最終回答を出力することがあります:
思考を無効にするには、〜を削除します <|think|> トークンをシステムプロンプトから削除します。思考が無効でも、モデルは空の思考チャンネルを出力する場合があります:
複数ターン会話では、〜しないでください しない 会話履歴に以前の隠れた思考を含める。次のユーザーターンの前には、最終的なアシスタント応答のみを含めてください。
DiffusionGemma のベストプラクティス
マルチモーダルプロンプト
DiffusionGemma は、テキストと画像を含むインターリーブされたマルチモーダル入力をサポートします。動画は画像フレームのシーケンスとして処理できます。
マルチモーダルプロンプトで最良の結果を得るには、画像またはフレームの内容をテキスト指示の前に配置します。例:
文書解析、OCR、チャート理解、UI理解、または短いテキスト抽出には、より大きい視覚トークン予算を使用してください。
サポートされる視覚トークン予算:
70
高速分類、簡単なキャプション作成
140
軽量な視覚QA
280
一般的な画像理解
560
OCR、チャート、UIスクリーンショット
1120
高密度文書、小さな文字、詳細抽出
動画形式の入力では、DiffusionGemma は最大〜を処理できます 60秒 〜でサンプリングした場合 1秒あたり1フレーム.
サンプリングの注意
DiffusionGemma は通常の次トークンのみのモデルではありません。これは、ノイズのあるトークン予測を繰り返し洗練することで、 キャンバスと呼ばれるトークンのブロックを生成します。生成プロセスはおおむね次のように進みます:
エンコーダーがプロンプトを処理し、コンテキストキャッシュを構築します。
デコーダーが256トークンの生成キャンバスを受け取ります。
拡散サンプラーがキャンバスを反復的にノイズ除去します。
確信度の高いトークンが選択され、保持されます。
不確実なトークンは再ノイズ化され、再び洗練されます。
キャンバスが完成すると、コンテキストに追加されます。
モデルは次のキャンバスへ進みます。
このブロック自己回帰アプローチにより、DiffusionGemma は標準的な自己回帰モデルよりも少ない順伝播で多くのトークンを生成できます。
ベンチマーク
DiffusionGemma は速度とマルチモーダル推論に最適化されていますが、標準の Gemma 4 は従来の推論ベンチマークでより強力です。
MMLU Pro
77.6%
82.6%
AIME 2026 no tools
69.1%
88.3%
LiveCodeBench v6
69.1%
77.1%
Codeforces ELO
1429
1718
GPQA Diamond
73.2%
82.3%
Tau2 Average
56.2%
68.2%
HLE no tools
11.0%
8.7%
HLE with search
11.9%
17.2%
BigBench Extra Hard
47.6%
64.8%
MMMLU
81.5%
86.3%
MRCR v2 8 needle 128K 平均
32.0%
44.1%
視覚ベンチマーク:
MMMU Pro
54.3%
73.8%
OmniDocBench 1.5、低いほど良い
0.319
0.149
MATH-Vision
70.5%
82.4%
MedXPertQA MM
49.0%
58.1%
最終更新
役に立ちましたか?

