🪽MTPモデルの実行方法: マルチトークン予測ガイド
MTP、または Multi-Token Prediction は、1ステップにつき1トークンを生成する代わりに、モデルに複数の次トークンをまとめて予測させることで推論を高速化します。精度を落とさずに推論を高速化でき、特に GPU で効果的です。このガイドでは、次のような MTP モデルの使い方を学びます。 Gemma 4 または Qwen3.6 をローカルデバイスで。
MTP は複数の将来トークンを予測し、メインモデルがそれらを並列に検証します。これにより生成のフォワードパスが減り、検証済みトークンだけが保持されるため、品質を保ちながら出力が高速化されます。
実行時に GGUFs、MTP により生成が 約1.4×〜2.2×高速化します。Gemma-4-31B のような密なモデルが最も恩恵を受け、 1.4×超の高速化 を達成します。古い Mac など、メモリ帯域幅が低いデバイスでは効果は小さくなります。MTP モデルは Unsloth Studio の UI または llama.cpp で直接実行できます。
MTP は標準のより多くのメモリを使用するため、約2 GB の追加 RAM/VRAM の余裕を見込んでください。
私たちは --spec-draft-n-max 2 が最適な出発点だと分かりましたが、 最適だと 2 考えないでください。性能はハードウェアに依存するためです。 1 から 6 までの任意の値を試し、システムで最も速いものを使ってください。Unsloth Studio は、お使いの特定のハードウェア(Mac、CPU、GPU など)に最適化された理想的な MTP 設定を自動的に適用します。後から変更することもできます。
Gemma 4 MTP
Google DeepMind は MTP を元の Gemma 4 モデルとは別に学習し、 QAT 版にも対応しています。Qwen とは異なり、Google は assistant という名前で特定の MTP バリアントを公開しました。最良の結果のため、私たちは 3 つの精度オプションのみをアップロードしています: 8ビット と 16ビット (BF16、F16)。QAT については、 スマート 4ビット復元プロセス を Gemma 4 QAT の量子化版で行ったのと同様に適用したため、MTP の量子化版もスマート 4ビット由来です。
私たちは mtp- を接頭辞とする GGUF を各リポジトリにアップロードしたので、必要なのは 通常の元の Gemma 4 GGUFだけです。別のリポジトリは必要ありません。Gemma の MTP モデルはこちらからアクセスできます 。そして現在、 Unslothで実行できます。Gemma 4 QAT を MTP でベンチマークしたところ、1.5倍〜2.2倍高速です:

表:MTP のハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、または統合メモリ)
E2B
5 GB
6〜9 GB
11 GB
E4B
6.5〜7 GB
10〜13 GB
17 GB
12B 統合
8〜9 GB
14〜15 GB
26 GB
26B A4B
17〜18 GB
29〜31 GB
53 GB
31B
18〜21 GB
35〜39 GB
63 GB
Gemma 4 MTP は Unsloth Studioで自動的に有効になります。通常の元の Gemma 4 GGUF をダウンロードするだけで構いません。 Gemma 4 GGUF ファイルを更新して、GGUF パッケージ内の別フォルダに追加の MTP ファイルを含めたため、別の Gemma 4 assistant GGUF をダウンロードする必要はありません。
それでも別個の MTP GGUF が必要なのは Qwen3.6 だけです。
Gemma 4 MTP モデルを実行するには、次のいずれかの手順に従ってください。 Unsloth Studio または llama.cpp.
🦥 Unsloth Studio で実行🦙 llama.cpp で実行
ので、以下の内容はそのまま動作します(これは 8ビット版を使用しています)
Qwen3.6 MTP
Qwen は MTP を Qwen3.6 と Qwen3.5 モデル内で直接学習しました。これにより Qwen3.6 27B MTP は RTX 6000 GPU で 160 tokens/s、Qwen3.6 35B-A3B は 240 tokens/s に達します。GGUF のアップロード:
表:MTP のハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、または統合メモリ)
27B
16 GB
19 GB
25 GB
31 GB
56 GB
35B-A3B
18 GB
24 GB
31 GB
39 GB
71 GB
以下は、MTP と非 MTP の推論スループットのグラフです:


また MTP GGUF をアップロードしました ための Qwen3.5 モデルファミリー には 0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B、397B-A17B が含まれます。Llama.cpp は MTP 性能を継続的に改善しているため、今後さらに速くなるはずです!
Qwen MTP モデルを実行するには、次のいずれかの手順に従ってください。 Unsloth Studio または llama.cpp.
🦥 Unsloth Studio MTP ガイド
Unsloth Studio は、お使いの特定のハードウェア(Mac、CPU、GPU など)に最適化された理想的な MTP 設定を自動的に適用します。後から変更することもできます。
目的のモデルを検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。その後、 Unsloth Chat タブに移動し、検索バーで Qwen3.6 MTP または Gemma 4 を検索して、目的のモデルと量子化版をダウンロードしてください。
Gemma 4 MTP は Unsloth で自動的に有効になります。通常の元の Gemma 4 GGUF をダウンロードするだけで構いません。 Gemma 4 GGUF ファイルを更新して、GGUF パッケージ内の別フォルダに追加の MTP ファイルを含めたため、別の Gemma 4 assistant GGUF をダウンロードする必要はありません。
それでも別個の MTP GGUF が必要なのは Qwen3.6 だけです。


MTP モデルを実行
推論、MTP、および speculative デコード設定 は Unsloth Studio を使うと自動設定されるはずですが、手動で変更することもできます。右側のサイドバーで speculative decoding、コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、 Unsloth Studio 推論ガイドをご覧ください。以下では、2ビットの Qwen3.6 MTP GGUF が 10 回以上のツール呼び出しを行い、10 のサイトを検索し、Python コードを実行しました:

🦙 Llama.cpp MTP ガイド
最新バージョンをインストールしてください llama.cpp で GitHub はこちら。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON を -DGGML_CUDA=OFF に変更してください。GPU がない場合や CPU 推論だけを使いたい場合です。 Apple Mac / Metal デバイスの場合、 -DGGML_CUDA=OFF に設定し、そのまま続行してください。Metal サポートはデフォルトで有効です。
もし llama.cpp を直接使ってモデルを読み込みたい場合は、以下のようにできます:(Q4_K_XL ollama run と似ています。 export LLAMA_CACHE="folder" を使って llama.cpp に保存先を強制できます。モデルの最大コンテキスト長は 256K です。
特定のモデル向けのコマンドのいずれかに従ってください:
Gemma 4 MTP:
忘れずに モデル名を変更して 、Gemma-4-26B-A4B などお好みの Gemma 4 モデルサイズにしてください。以下の手順は Gemma-4-12B 用です。 mtp- 接頭辞付き GGUF を用意しているので、以下の -hf コマンドは MTP を自動ダウンロードして使用します。
思考モード:
Gemma 4 の新しい Preserved Thinking.
非思考モード:
Qwen3.6 MTP:
忘れずに モデル名を変更して 以下の手順は Qwen3.6-27B 用ですので、Qwen3.6-35B-A3B や Qwen3.5 などお好みの Qwen3.6 バリアントに変更してください:
思考モード (一般タスク):
精密なコーディング作業では、次を変更してください: temperature=0.6
Qwen3.6 の新しい Preserved Thinking.
非思考モード (一般タスク):
量子化版を手動でダウンロード
量子化版と MTP の量子化版を手動でダウンロードしたい場合は、それも可能です!以下のコードでモデルをダウンロードしてください( pip install huggingface_hub hf_transferをインストールした後)。Q4_K_M や UD-Q4_K_XL のような他の量子化版も選べます。サイズと精度のバランスを取るため、少なくとも 2ビット動的量子化 UD-Q2_K_XL の使用を推奨します。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ
Gemma 4 MTP:
Qwen3.6 MTP:
最終更新
役に立ちましたか?


