For the complete documentation index, see llms.txt. This page is also available as Markdown.

🪽MTPモデルの実行方法: マルチトークン予測ガイド

MTP、または Multi-Token Prediction は、1ステップにつき1トークンを生成する代わりに、モデルに複数の次トークンをまとめて予測させることで推論を高速化します。精度を落とさずに推論を高速化でき、特に GPU で効果的です。このガイドでは、次のような MTP モデルの使い方を学びます。 Gemma 4 または Qwen3.6 をローカルデバイスで。

MTP は複数の将来トークンを予測し、メインモデルがそれらを並列に検証します。これにより生成のフォワードパスが減り、検証済みトークンだけが保持されるため、品質を保ちながら出力が高速化されます。

実行時に GGUFs、MTP により生成が 約1.4×〜2.2×高速化します。Gemma-4-31B のような密なモデルが最も恩恵を受け、 1.4×超の高速化 を達成します。古い Mac など、メモリ帯域幅が低いデバイスでは効果は小さくなります。MTP モデルは Unsloth Studio の UI または llama.cpp で直接実行できます。

MTP は標準のより多くのメモリを使用するため、約2 GB の追加 RAM/VRAM の余裕を見込んでください。

Gemma 4 MTPQwen3.6 MTP

私たちは --spec-draft-n-max 2 が最適な出発点だと分かりましたが、 最適だと 2 考えないでください。性能はハードウェアに依存するためです。 1 から 6 までの任意の値を試し、システムで最も速いものを使ってください。Unsloth Studio は、お使いの特定のハードウェア(Mac、CPU、GPU など)に最適化された理想的な MTP 設定を自動的に適用します。後から変更することもできます。

Gemma 4 MTP

Google DeepMind は MTP を元の Gemma 4 モデルとは別に学習し、 QAT 版にも対応しています。Qwen とは異なり、Google は assistant という名前で特定の MTP バリアントを公開しました。最良の結果のため、私たちは 3 つの精度オプションのみをアップロードしています: 8ビット16ビット (BF16、F16)。QAT については、 スマート 4ビット復元プロセス を Gemma 4 QAT の量子化版で行ったのと同様に適用したため、MTP の量子化版もスマート 4ビット由来です。

私たちは mtp- を接頭辞とする GGUF を各リポジトリにアップロードしたので、必要なのは 通常の元の Gemma 4 GGUFだけです。別のリポジトリは必要ありません。Gemma の MTP モデルはこちらからアクセスできます 。そして現在、 Unslothで実行できます。Gemma 4 QAT を MTP でベンチマークしたところ、1.5倍〜2.2倍高速です:

表:MTP のハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、または統合メモリ)

Gemma 4 バリアント
4ビット
8ビット
BF16 / FP16

E2B

5 GB

6〜9 GB

11 GB

E4B

6.5〜7 GB

10〜13 GB

17 GB

12B 統合

8〜9 GB

14〜15 GB

26 GB

26B A4B

17〜18 GB

29〜31 GB

53 GB

31B

18〜21 GB

35〜39 GB

63 GB

Gemma 4 MTP モデルを実行するには、次のいずれかの手順に従ってください。 Unsloth Studio または llama.cpp.

🦥 Unsloth Studio で実行🦙 llama.cpp で実行

ので、以下の内容はそのまま動作します(これは 8ビット版を使用しています)

Qwen3.6 MTP

Qwen は MTP を Qwen3.6Qwen3.5 モデル内で直接学習しました。これにより Qwen3.6 27B MTP は RTX 6000 GPU で 160 tokens/s、Qwen3.6 35B-A3B は 240 tokens/s に達します。GGUF のアップロード:

表:MTP のハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、または統合メモリ)

Qwen3.6
3ビット
4ビット
6ビット
8ビット
BF16

27B

16 GB

19 GB

25 GB

31 GB

56 GB

35B-A3B

18 GB

24 GB

31 GB

39 GB

71 GB

以下は、MTP と非 MTP の推論スループットのグラフです:

また MTP GGUF をアップロードしました ための Qwen3.5 モデルファミリー には 0.8B、2B、4B、9B、27B、35B-A3B、122B-A10B、397B-A17B が含まれます。Llama.cpp は MTP 性能を継続的に改善しているため、今後さらに速くなるはずです!

Qwen MTP モデルを実行するには、次のいずれかの手順に従ってください。 Unsloth Studio または llama.cpp.

🦥 Unsloth Studio MTP ガイド

Unsloth Studio は、お使いの特定のハードウェア(Mac、CPU、GPU など)に最適化された理想的な MTP 設定を自動的に適用します。後から変更することもできます。

1

Unsloth をインストール

ターミナルで次を実行してください:

MacOS、Linux、WSL:

Windows PowerShell:

2

Unsloth を起動

MacOS、Linux、WSL および Windows:

その後 http://127.0.0.1:8888 (または指定した URL)をブラウザで開いてください。

3

目的のモデルを検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。その後、 Unsloth Chat タブに移動し、検索バーで Qwen3.6 MTP または Gemma 4 を検索して、目的のモデルと量子化版をダウンロードしてください。

4

MTP モデルを実行

推論、MTP、および speculative デコード設定 は Unsloth Studio を使うと自動設定されるはずですが、手動で変更することもできます。右側のサイドバーで speculative decoding、コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、 Unsloth Studio 推論ガイドをご覧ください。以下では、2ビットの Qwen3.6 MTP GGUF が 10 回以上のツール呼び出しを行い、10 のサイトを検索し、Python コードを実行しました:

🦙 Llama.cpp MTP ガイド

1

最新バージョンをインストールしてください llama.cppGitHub はこちら。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON-DGGML_CUDA=OFF に変更してください。GPU がない場合や CPU 推論だけを使いたい場合です。 Apple Mac / Metal デバイスの場合-DGGML_CUDA=OFF に設定し、そのまま続行してください。Metal サポートはデフォルトで有効です。

2

もし llama.cpp直接使ってモデルを読み込みたい場合は、以下のようにできます:(Q4_K_XL ollama run と似ています。 export LLAMA_CACHE="folder" を使って llama.cpp に保存先を強制できます。モデルの最大コンテキスト長は 256K です。

特定のモデル向けのコマンドのいずれかに従ってください:

Gemma 4Qwen3.6

Gemma 4 MTP:

忘れずに モデル名を変更して 、Gemma-4-26B-A4B などお好みの Gemma 4 モデルサイズにしてください。以下の手順は Gemma-4-12B 用です。 mtp- 接頭辞付き GGUF を用意しているので、以下の -hf コマンドは MTP を自動ダウンロードして使用します。

思考モード:

Gemma 4 の新しい Preserved Thinking.

非思考モード:

Qwen3.6 MTP:

忘れずに モデル名を変更して 以下の手順は Qwen3.6-27B 用ですので、Qwen3.6-35B-A3B や Qwen3.5 などお好みの Qwen3.6 バリアントに変更してください:

思考モード (一般タスク):

精密なコーディング作業では、次を変更してください: temperature=0.6

Qwen3.6 の新しい Preserved Thinking.

非思考モード (一般タスク):

3

量子化版を手動でダウンロード

量子化版と MTP の量子化版を手動でダウンロードしたい場合は、それも可能です!以下のコードでモデルをダウンロードしてください( pip install huggingface_hub hf_transferをインストールした後)。Q4_K_M や UD-Q4_K_XL のような他の量子化版も選べます。サイズと精度のバランスを取るため、少なくとも 2ビット動的量子化 UD-Q2_K_XL の使用を推奨します。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ

Gemma 4 MTP:

Qwen3.6 MTP:

4

その後、会話モードでモデルを実行します:

Gemma 4 MTP:

そして以下の内容が表示されます。エラーメッセージも無視してください

Qwen3.6 MTP:

5

Llama-server のデプロイ

llama-server で Gemma-4 をデプロイするには、次を使用します:

最終更新

役に立ちましたか?