> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/mtp.md).

# Wie man MTP-Modelle ausführt: Anleitung zur Multi-Token-Vorhersage

MTP, oder Multi-Token-Vorhersage, beschleunigt die Inferenz, indem es einem Modell erlaubt, mehrere kommende Token auf einmal vorherzusagen, statt pro Schritt nur ein Token zu erzeugen. Dadurch ist schnellere Inferenz ohne Genauigkeitsverlust möglich und es ist besonders effektiv auf GPUs. In diesem Leitfaden lernen Sie, wie Sie MTP-Modelle wie [Gemma 4](/docs/de/modelle/gemma-4.md) oder [Qwen3.6](/docs/de/modelle/qwen3.6.md) auf Ihrem lokalen Gerät verwenden.

MTP sagt mehrere zukünftige Token voraus, die das Hauptmodell parallel überprüft. Dadurch werden die Forward-Pässe bei der Generierung reduziert, was die Ausgabe beschleunigt, während die Qualität erhalten bleibt, da nur verifizierte Token behalten werden.

Beim Ausführen von [GGUFs](/docs/de/grundlagen/unsloth-dynamic-2.0-ggufs.md), kann MTP die Generierung **\~1,4× bis 2,2× schneller**. Dichte Modelle wie Gemma-4-31B profitieren am meisten und erreichen **>1,4× Beschleunigung** gegenüber dem Original. Die Zugewinne sind auf Geräten mit geringerer Speicherbandbreite, etwa älteren Macs, kleiner. Sie können MTP-Modelle direkt in [der Benutzeroberfläche von Unsloth Studio](/docs/de/neu/studio.md) oder llama.cpp ausführen.

{% hint style="info" %}
**MTP benötigt mehr Speicher als standardmäßiges**, planen Sie daher etwa 2 GB zusätzlichen RAM-/VRAM-Puffer ein.
{% endhint %}

<a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#gemma-4-mtp" class="button primary">Gemma 4 MTP</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#qwen3.6-mtp" class="button primary">Qwen3.6 MTP</a>

Wir haben festgestellt `--spec-draft-n-max 2` ist jedoch der beste Ausgangspunkt, **nehmen Sie nicht an `2` optimal ist**, da die Leistung von der Hardware abhängt. Probieren Sie einen beliebigen Wert von `1` bis `6` und verwenden Sie den schnellsten für Ihr System. Unsloth Studio setzt automatisch die idealen MTP-Einstellungen, optimiert für Ihre spezifische Hardware (Mac, CPU, GPU usw.) – Sie können sie später noch ändern.

### Gemma 4 MTP

Google DeepMind hat MTP separat vom ursprünglichen [Gemma 4](/docs/de/modelle/gemma-4/qat.md) Modellen trainiert, einschließlich für [QAT-Varianten](/docs/de/modelle/gemma-4/qat.md). Anders als bei Qwen veröffentlichte Google spezielle MTP-Varianten unter dem `Assistenten` -Namen. Für beste Ergebnisse laden wir nur 3 Präzisionsoptionen hoch: **8-Bit** und **16-Bit** (BF16, F16). Für QAT haben wir das [intelligente 4-Bit-Wiederherstellungsverfahren](/docs/de/modelle/gemma-4/qat.md#qat-analysis) angewendet, wie wir es auch für Gemma-4-QAT-Quants getan haben, sodass die MTP-Quants ebenfalls intelligent aus 4 Bit abgeleitet sind.

Wir haben `mtp-` mit Präfix versehenen GGUFs in jedes Repo hochgeladen, sodass Sie nur die **regulären originalen Gemma-4-GGUFs**, kein separates Repo ist erforderlich. Sie können auf Gemma [MTP-Modelle hier zugreifen](https://huggingface.co/collections/unsloth/gemma-4) und sie können jetzt in [Unsloth](#unsloth-studio-mtp-guide)ausgeführt werden. Wir haben Gemma 4 QAT mit MTP getestet, und es läuft 1,5x - 2,2x schneller:

<div data-with-frame="true"><figure><img src="/files/2e49b2f8fce956b70a055a775f927c43374a7837" alt="" width="563"><figcaption></figcaption></figure></div>

**Tabelle: MTP-Hardwareanforderungen** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

| Gemma-4-Variante |    4-Bit |    8-Bit | BF16 / FP16 |
| ---------------- | -------: | -------: | ----------: |
| **E2B**          |     5 GB |   6–9 GB |       11 GB |
| **E4B**          | 6,5–7 GB | 10–13 GB |       17 GB |
| **12B Unified**  |   8–9 GB | 14–15 GB |       26 GB |
| **26B A4B**      | 17–18 GB | 29–31 GB |       53 GB |
| **31B**          | 18–21 GB | 35–39 GB |       63 GB |

{% hint style="warning" %}
**Gemma 4 MTP ist in** [**Unsloth Studio**](#unsloth-studio-mtp-guide)**automatisch aktiviert. Sie müssen nur die regulären originalen Gemma-4-GGUFs herunterladen.** Wir haben die Gemma-4-GGUF-Dateien aktualisiert, um eine zusätzliche MTP-Datei in einem separaten Ordner innerhalb des GGUF-Pakets einzuschließen, sodass kein separater Gemma-4-Assistent-GGUF heruntergeladen werden muss.

Das einzige Modell, für das weiterhin ein separates MTP-GGUF erforderlich ist, ist Qwen3.6.
{% endhint %}

Um die Gemma-4-MTP-Modelle auszuführen, folgen Sie den Schritten entweder für [Unsloth Studio](#unsloth-studio-mtp-guide) oder [llama.cpp](#llama.cpp-mtp-guide).

<a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#unsloth-studio-mtp-guide" class="button primary">🦥 In Unsloth Studio ausführen</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#llama.cpp-mtp-guide" class="button primary">🦙 In llama.cpp ausführen</a>

damit das Folgende einfach funktioniert (es wird die 8-Bit-Variante verwendet)

{% code overflow="wrap" %}

```bash
llama-server \\
    -hf unsloth/gemma-4-31B-it-GGUF \\
    --spec-type draft-mtp \\
    --spec-draft-n-max 4
```

{% endcode %}

### Qwen3.6 MTP

Qwen hat MTP direkt innerhalb der [Qwen3.6](/docs/de/modelle/qwen3.6.md) und [Qwen3.5](/docs/de/modelle/qwen3.5.md) Modelle trainiert. Dadurch erreicht Qwen3.6 27B MTP 160 Token/s und Qwen3.6 35B-A3B 240 Token/s auf einer RTX-6000-GPU. GGUF-Uploads:

| [Qwen3.6-27B-MTP-GGUF](https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF) | [Qwen3.6-35B-A3B-MTP-GGUF](https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF) |
| --------------------------------------------------------------------------- | ----------------------------------------------------------------------------------- |

**Tabelle: MTP-Hardwareanforderungen** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

<table><thead><tr><th>Qwen3.6</th><th>3-Bit</th><th>4-Bit</th><th width="128">6-Bit</th><th>8-Bit</th><th>BF16</th></tr></thead><tbody><tr><td><strong>27B</strong></td><td>16 GB</td><td>19 GB</td><td>25 GB</td><td>31 GB</td><td>56 GB</td></tr><tr><td><strong>35B-A3B</strong></td><td>18 GB</td><td>24 GB</td><td>31 GB</td><td>39 GB</td><td>71 GB</td></tr></tbody></table>

Nachfolgend sind Grafiken des Inferenz-Durchsatzes mit MTP vs. ohne MTP:

<div><figure><img src="/files/f8c87439abe15f73cff50df3fcae98c0bf70c29f" alt=""><figcaption></figcaption></figure> <figure><img src="/files/ec4d8476c8e56b3a563be19a241f2549577bba9f" alt=""><figcaption></figcaption></figure></div>

Wir haben außerdem [MTP-GGUFs hochgeladen](https://huggingface.co/unsloth/models?search=mtp) für die [Qwen3.5](/docs/de/modelle/qwen3.5.md) **Modellfamilie** einschließlich: 0.8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B und 397B-A17B. Llama.cpp verbessert die MTP-Leistung fortlaufend, also erwarten Sie, dass es im Laufe der Zeit schneller wird!

Um die Qwen-MTP-Modelle auszuführen, folgen Sie den Schritten entweder für [Unsloth Studio](#unsloth-studio-mtp-guide) oder [llama.cpp](#llama.cpp-mtp-guide).

### 🦥 Unsloth-Studio-MTP-Anleitung

Unsloth Studio setzt automatisch die idealen MTP-Einstellungen, optimiert für Ihre spezifische Hardware (Mac, CPU, GPU usw.) – Sie können sie später noch ändern.

{% stepper %}
{% step %}

#### Unsloth installieren

Führen Sie im Terminal aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**macOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 127.0.0.1 -p 8888
```

Öffnen Sie dann `http://127.0.0.1:8888` (oder Ihre spezifische URL) in Ihrem Browser.
{% endstep %}

{% step %}

#### Suchen und laden Sie Ihr gewünschtes Modell herunter

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum [Unsloth Chat](/docs/de/neu/studio/chat.md) Tab und suchen Sie in der Suchleiste nach Qwen3.6 MTP oder Gemma 4 und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter.

{% hint style="warning" %}
**Gemma 4 MTP ist in Unsloth automatisch aktiviert. Sie müssen nur das reguläre originale Gemma-4-GGUF herunterladen.** Wir haben die Gemma-4-GGUF-Dateien aktualisiert, um eine zusätzliche MTP-Datei in einem separaten Ordner innerhalb des GGUF-Pakets einzuschließen, sodass kein separater Gemma-4-Assistent-GGUF heruntergeladen werden muss.

Das einzige Modell, für das weiterhin ein separates MTP-GGUF erforderlich ist, ist Qwen3.6.
{% endhint %}

<div><figure><img src="/files/dd8c6ab3357870744139210aca59ad7204cabd9b" alt="" width="375"><figcaption></figcaption></figure> <figure><img src="/files/fd68b412c09f9c1d5b0dd4e209842d5b364948a9" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Führen Sie Ihr MTP-Modell aus

Inferenz, MTP und spekulative **Decodierungseinstellungen** sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können außerdem spekulative Decodierung, die Kontextlänge, die Chat-Vorlage und andere Einstellungen in der rechten Seitenleiste bearbeiten.

<div data-with-frame="true"><figure><img src="/files/7469bae03905d4003d41740545988fe7a75752c5" alt="" width="149"><figcaption></figcaption></figure></div>

Für weitere Informationen können Sie unseren [Unsloth-Studio-Inferenzleitfaden](/docs/de/neu/studio/chat.md). Unten hat das 2-Bit-Qwen3.6-MTP-GGUF mehr als 10 Tool-Aufrufe gemacht, 10 Seiten durchsucht und Python-Code ausgeführt:

<div data-with-frame="true"><figure><img src="/files/0d35eb4b2d8f8d310dac25e6054f257e57c04b55" alt=""><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-MTP-Anleitung

{% stepper %}
{% step %}
Installieren Sie die neueste Version von `llama.cpp` auf [**GitHub hier**](https://github.com/ggml-org/llama.cpp/pull/22673). Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn Sie `llama.cpp` direkt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:`Q4_K_XL`) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie `ollama run` . Verwenden Sie `export LLAMA_CACHE="folder"` um zu erzwingen, dass `llama.cpp` an einem bestimmten Ort gespeichert wird. Das Modell hat eine maximale Kontextlänge von 256K.

Folgen Sie einem der Befehle für die jeweiligen Modelle:

<a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#gemma-4-mtp-1" class="button primary">Gemma 4</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#qwen3.6-mtp-1" class="button primary">Qwen3.6</a>

#### Gemma 4 MTP:

Vergessen Sie nicht, **den Modellnamen zu ändern** auf Ihre gewünschte Gemma-4-Modellgröße wie Gemma-4-26B-A4B usw. anzupassen, da die folgenden Anweisungen für Gemma-4-12B gelten. Beachten Sie, dass wir einen `mtp-` mit Präfix versehenen GGUF bereitgestellt haben, sodass der folgende `-hf` Befehl MTP automatisch herunterladen und verwenden sollte.

**Denkmodus:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-12b-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% hint style="info" %}
Bitte beachten Sie Gemma 4s neues [Bewahrtes Denken](#thinking-enable-disable--preserve-thinking).
{% endhint %}

**Nicht-Denkmodus**:

```bash
export LLAMA_CACHE="unsloth/gemma-4-12b-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2 \\
    --chat-template-kwargs '{"enable_thinking":false}'
```

#### Qwen3.6 MTP:

Vergessen Sie nicht, **den Modellnamen zu ändern** auf Ihre gewünschte Qwen3.6-Variante wie Qwen3.6-35B-A3B oder Qwen3.5 usw. anzupassen, da die folgenden Anweisungen für Qwen3.6-27B gelten:

**Denkmodus** (Allgemeine Aufgaben)**:**

```bash
export LLAMA_CACHE="unsloth/Qwen3.6-27B-MTP-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.00 \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

Für präzise Programmieraufgaben ändern Sie: `temperature=0.6`

{% hint style="info" %}
Bitte beachten Sie Qwen3.6s neue [Bewahrtes Denken](#thinking-enable-disable--preserve-thinking).
{% endhint %}

**Nicht-Denkmodus** (Allgemeine Aufgaben):

```bash
export LLAMA_CACHE="unsloth/Qwen3.6-27B-MTP-GGUF"
./llama.cpp/llama-server \\
    -hf unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q4_K_XL \\
    --temp 0.7 \\
    --top-p 0.8 \\
    --top-k 20 \\
    --presence-penalty 1.5 \\
    --min-p 0.00 \\
    --spec-type draft-mtp --spec-draft-n-max 2 \\
    --chat-template-kwargs '{"enable_thinking":false}'
```

{% endstep %}

{% step %}

#### Quantisierungen manuell herunterladen

Wenn Sie die Quantisierungen und die MTP-Quantisierungen manuell herunterladen möchten, können Sie das ebenfalls tun! Laden Sie das Modell über den folgenden Code herunter (nach der Installation von `pip install huggingface_hub hf_transfer`). Sie können Q4\_K\_M oder andere quantisierte Versionen wie `UD-Q4_K_XL` . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden `UD-Q2_K_XL` um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

#### Gemma 4 MTP:

```bash
hf download unsloth/gemma-4-12B-it-qat-GGUF \\
    --local-dir unsloth/gemma-4-12B-it-qat-GGUF \\
    --include "*mmproj-F16*" \\
    --include "mtp-*" \\
    --include "*UD-Q4_K_XL*" # Verwenden Sie "*UD-Q2_K_XL*" für dynamische 2-Bit
```

#### Qwen3.6 MTP:

```bash
hf download unsloth/Qwen3.6-27B-MTP-GGUF \\
    --local-dir unsloth/Qwen3.6-27B-MTP-GGUF \\
    --include "*mmproj-F16*" \\
    --include "*UD-Q4_K_XL*" # Verwenden Sie "*UD-Q2_K_XL*" für dynamische 2-Bit
```

{% endstep %}

{% step %}
Dann führen Sie das Modell im Gesprächsmodus aus:

#### Gemma 4 MTP:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-12B-it-qat-GGUF/mmproj-F16.gguf \\
    --model-draft unsloth/gemma-4-12B-it-qat-GGUF/mtp-gemma-4-12B-it.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% endcode %}

Und Sie werden Folgendes sehen - ignorieren Sie ebenfalls die Fehlermeldungen

<img src="/files/b192ad861085cebbe9a8e52d834e77fb5e7720cb" alt="" data-size="original">

#### Qwen3.6 MTP:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/Qwen3.6-27B-MTP-GGUF/mmproj-F16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.00 \\
    --top-k 20 \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% endcode %}
{% endstep %}

{% step %}

#### Bereitstellung von Llama-Server

Um Gemma-4 auf llama-server bereitzustellen, verwenden Sie:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-12B-it-qat-GGUF/mmproj-F16.gguf \\
    --model-draft unsloth/gemma-4-12B-it-qat-GGUF/mtp-gemma-4-12B-it.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-12b-it-qat-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% endcode %}
{% endstep %}
{% endstepper %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/mtp.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
