> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/mtp.md).

# Wie man MTP-Modelle ausführt: Leitfaden zur Multi-Token-Vorhersage

MTP oder Multi-Token Prediction beschleunigt die Inferenz, indem ein Modell mehrere kommende Tokens auf einmal vorhersagt, statt pro Schritt nur ein Token zu erzeugen. Dadurch wird eine schnellere Inferenz ohne Genauigkeitsverlust ermöglicht und es ist besonders effektiv auf GPUs. In diesem Leitfaden lernst du, wie du MTP-Modelle wie [Gemma 4](/docs/de/modelle/gemma-4.md) oder [Qwen3.8](/docs/de/modelle/qwen3.6.md) auf deinem lokalen Gerät verwendest.

MTP sagt mehrere zukünftige Tokens voraus, die das Hauptmodell parallel überprüft. Dadurch werden die Forward-Pässe der Generierung reduziert, was die Ausgabe beschleunigt, während die Qualität erhalten bleibt, da nur verifizierte Tokens übernommen werden.

Beim Ausführen von [GGUFs](/docs/de/grundlagen/dynamic-3.0-ggufs.md)kann MTP die Generierung **ca. 1,4× bis 2,2× schneller**machen. Dichte Modelle wie Gemma-4-31B profitieren am meisten und erreichen **>1,4× Beschleunigung** gegenüber dem Original. Die Gewinne sind auf Geräten mit geringerer Speicherbandbreite, wie älteren Macs, kleiner. Du kannst MTP-Modelle direkt in [der UI von Unsloth Studio](/docs/de/neu/studio.md) oder llama.cpp ausführen.

{% hint style="info" %}
**MTP verwendet mehr Speicher als Standard-**, plane daher mit etwa 2 GB zusätzlichem RAM/VRAM-Spielraum.
{% endhint %}

<a href="/docs/de/modelle/mtp.md#gemma-4-mtp" class="button primary">Gemma 4 MTP</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#qwen3.6-mtp" class="button primary">Qwen3.6 MTP</a>

Wir haben festgestellt, `--spec-draft-n-max 2` ist allerdings der beste Ausgangspunkt, **nimm nicht an, `2` dass es optimal ist**, da die Leistung hardwareabhängig ist. Probiere jeden Wert von `1` bis `6` und verwende den, der auf deinem System am schnellsten ist. Unsloth Studio setzt automatisch die idealen MTP-Einstellungen, optimiert für deine spezifische Hardware (Mac, CPU, GPU usw.) - du kannst sie später trotzdem noch ändern.

### Gemma 4 MTP

Google DeepMind hat MTP getrennt von den ursprünglichen [Gemma 4](/docs/de/modelle/gemma-4/qat.md) Modellen trainiert, einschließlich [QAT-Varianten](/docs/de/modelle/gemma-4/qat.md). Anders als bei Qwen hat Google spezifische MTP-Varianten unter dem Namen `assistant` veröffentlicht. Für beste Ergebnisse laden wir nur 3 Präzisionsoptionen hoch: **8-Bit** und **16-Bit** (BF16, F16). Für QAT haben wir den [intelligenten 4-Bit-Wiederherstellungsprozess](/docs/de/modelle/gemma-4/qat.md#qat-analysis) angewendet, wie wir es auch bei den Gemma-4-QAT-Quants getan haben, sodass die MTP-Quants ebenfalls intelligent aus 4-Bit abgeleitet sind.

Wir haben `mtp-` vorangestellte GGUFs in jedes Repo hochgeladen, sodass du nur die **regulären originalen Gemma-4-GGUFs**verwenden musst; kein separates Repo ist nötig. Du kannst auf Gemma [MTP-Modelle hier zugreifen](https://huggingface.co/collections/unsloth/gemma-4) und sie können jetzt in [Unsloth](#unsloth-studio-mtp-guide)ausgeführt werden. Wir haben Gemma-4-QAT mit MTP benchmarked, und es läuft 1,5x - 2,2x schneller:

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FbFaiVrra3iTZQvZjAeoR%2Fgemma%204%20mtp.png?alt=media&amp;token=c32a50d3-36ef-47b6-a9c0-5ca0b1d1549b" alt="" width="563"><figcaption></figcaption></figure></div>

**Tabelle: Hardware-Anforderungen für MTP** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

| Gemma-4-Variante |    4-Bit |    8-Bit | BF16 / FP16 |
| ---------------- | -------: | -------: | ----------: |
| **E2B**          |     5 GB |   6–9 GB |       11 GB |
| **E4B**          | 6,5–7 GB | 10–13 GB |       17 GB |
| **12B Unified**  |   8–9 GB | 14–15 GB |       26 GB |
| **26B A4B**      | 17–18 GB | 29–31 GB |       53 GB |
| **31B**          | 18–21 GB | 35–39 GB |       63 GB |

{% hint style="warning" %}
**Gemma 4 MTP ist automatisch aktiviert in** [**Unsloth Studio**](#unsloth-studio-mtp-guide)**. Du musst nur die regulären originalen Gemma-4-GGUFs herunterladen.** Wir haben die Gemma-4-GGUF-Dateien aktualisiert, damit sie innerhalb des GGUF-Pakets in einem separaten Ordner eine zusätzliche MTP-Datei enthalten, sodass kein separater Gemma-4-Assistant-GGUF heruntergeladen werden muss.

Das einzige Modell, für das immer noch ein separater MTP-GGUF erforderlich ist, ist Qwen3.6.
{% endhint %}

Um die Gemma-4-MTP-Modelle auszuführen, folge entweder den Schritten für [Unsloth Studio](#unsloth-studio-mtp-guide) oder [llama.cpp](#llama.cpp-mtp-guide).

<a href="/docs/de/modelle/mtp.md#unsloth-studio-mtp-guide" class="button primary">🦥 In Unsloth Studio ausführen</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#llama.cpp-mtp-guide" class="button primary">🦙 In llama.cpp ausführen</a>

sodass das Folgende einfach funktioniert (dies verwendet die 8-Bit-Version)

{% code overflow="wrap" %}

```bash
llama-server \\
    -hf unsloth/gemma-4-31B-it-GGUF \\
    --spec-type draft-mtp \\
    --spec-draft-n-max 4
```

{% endcode %}

### Qwen3.6 MTP

Qwen hat MTP direkt in den [Qwen3.6](/docs/de/modelle/qwen3.6.md) und [Qwen3.5](/docs/de/modelle/qwen3.5.md) Modelle trainiert. Dadurch erreicht Qwen3.6 27B MTP 160 Tokens/s und Qwen3.6 35B-A3B 240 Tokens/s auf einer RTX-6000-GPU. GGUF-Uploads:

| [Qwen3.6-27B-MTP-GGUF](https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF) | [Qwen3.6-35B-A3B-MTP-GGUF](https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF) |
| --------------------------------------------------------------------------- | ----------------------------------------------------------------------------------- |

**Tabelle: Hardware-Anforderungen für MTP** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

<table><thead><tr><th>Qwen3.6</th><th>3-Bit</th><th>4-Bit</th><th width="128">6-Bit</th><th>8-Bit</th><th>BF16</th></tr></thead><tbody><tr><td><strong>27B</strong></td><td>16 GB</td><td>19 GB</td><td>25 GB</td><td>31 GB</td><td>56 GB</td></tr><tr><td><strong>35B-A3B</strong></td><td>18 GB</td><td>24 GB</td><td>31 GB</td><td>39 GB</td><td>71 GB</td></tr></tbody></table>

Unten sind Grafiken des Inferenz-Durchsatzes für MTP gegenüber ohne MTP:

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FMYn1g7MDeVRAUa6i2oOk%2Fthroughput%20mpt.png?alt=media&amp;token=aff44c0a-3cc3-493e-b6b4-e3279dfb90c1" alt=""><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F4CvUpxr0xdxCR1lTGUbS%2Fmtp%20benchmarks%20landscape.png?alt=media&amp;token=d6579f47-a196-408b-a013-329e09705251" alt=""><figcaption></figcaption></figure></div>

Wir haben außerdem [MTP-GGUFs hochgeladen](https://huggingface.co/unsloth/models?search=mtp) für die [Qwen3.5](/docs/de/modelle/qwen3.5.md) **Modellfamilie** einschließlich: 0,8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B und 397B-A17B. Llama.cpp verbessert die MTP-Leistung fortlaufend, also erwarte, dass es mit der Zeit schneller wird!

Um die Qwen-MTP-Modelle auszuführen, folge entweder den Schritten für [Unsloth Studio](#unsloth-studio-mtp-guide) oder [llama.cpp](#llama.cpp-mtp-guide).

### 🦥 Unsloth Studio MTP-Leitfaden

Unsloth Studio setzt automatisch die idealen MTP-Einstellungen, optimiert für deine spezifische Hardware (Mac, CPU, GPU usw.) - du kannst sie später trotzdem noch ändern.

{% stepper %}
{% step %}

#### Installiere Unsloth

Führe in deinem Terminal aus:

**MacOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**MacOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 127.0.0.1 -p 8888
```

Dann öffne `http://127.0.0.1:8888` (oder deine spezifische URL) in deinem Browser.
{% endstep %}

{% step %}

#### Suche und lade dein gewünschtes Modell herunter

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich später erneut anmelden. Gehe dann zum [Unsloth Chat](/docs/de/neu/studio/chat.md) Tab und suche in der Suchleiste nach Qwen3.6 MTP oder Gemma 4 und lade dein gewünschtes Modell und Quant herunter.

{% hint style="warning" %}
**Gemma 4 MTP ist in Unsloth automatisch aktiviert. Du musst nur den regulären originalen Gemma-4-GGUF herunterladen.** Wir haben die Gemma-4-GGUF-Dateien aktualisiert, damit sie innerhalb des GGUF-Pakets in einem separaten Ordner eine zusätzliche MTP-Datei enthalten, sodass kein separater Gemma-4-Assistant-GGUF heruntergeladen werden muss.

Das einzige Modell, für das immer noch ein separater MTP-GGUF erforderlich ist, ist Qwen3.6.
{% endhint %}

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FdtEdYQfmVn80wEC6rw5P%2FScreenshot%202026-06-11%20at%208.37.44%E2%80%AFAM.png?alt=media&amp;token=288c2c95-9ddc-41c8-aefe-4ce81af16ff1" alt="" width="375"><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F2zQdtdNf0CRBrnTOXBZa%2FScreenshot%202026-05-16%20at%207.10.39%E2%80%AFPM.png?alt=media&amp;token=d1f2e482-5cb7-4e41-97ed-f2905a81f262" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Führe dein MTP-Modell aus

Inferenz-, MTP- und spekulative **Dekodierungseinstellungen** sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst spekulatives Decoding, die Kontextlänge, die Chat-Vorlage und andere Einstellungen auch in der rechten Seitenleiste bearbeiten.

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6OmL5f4aDMFPFCqUcfsN%2FScreenshot%202026-06-11%20at%208.39.48%E2%80%AFAM.png?alt=media&amp;token=3d6fc88a-e275-4a07-bb84-4305f9ba1089" alt="" width="149"><figcaption></figcaption></figure></div>

Für weitere Informationen kannst du unseren [Unsloth Studio Inferenz-Leitfaden](/docs/de/neu/studio/chat.md)ansehen. Unten hat der 2-Bit-Qwen3.6-MTP-GGUF 10+ Tool-Aufrufe gemacht, 10 Websites durchsucht und Python-Code ausgeführt:

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FsERzR65n4jc1UtuSHozZ%2Fwedefrwfwe.gif?alt=media&amp;token=e303ed9e-0d90-456d-8d57-874a06803903" alt=""><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp MTP-Leitfaden

{% stepper %}
{% step %}
Installiere die neueste Version von `llama.cpp` auf [**GitHub hier**](https://github.com/ggml-org/llama.cpp/pull/22673). Du kannst auch den folgenden Build-Anweisungen folgen. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine GPU hast oder einfach nur CPU-Inferenz möchtest. **Für Apple-Mac-/Metal-Geräte**, setze `-DGGML_CUDA=OFF` und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn du `llama.cpp` direkt zum Laden von Modellen verwenden möchtest, kannst du Folgendes tun: (:`Q4_K_XL`) ist der Quantisierungs-Typ. Du kannst auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie `ollama run` . Verwende `export LLAMA_CACHE="folder"` um `llama.cpp` zu erzwingen, dass es an einem bestimmten Ort gespeichert wird. Das Modell hat eine maximale Kontextlänge von 256K.

Folge einem der Befehle für die jeweiligen Modelle:

<a href="/docs/de/modelle/mtp.md#gemma-4-mtp-1" class="button primary">Gemma 4</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#qwen3.6-mtp-1" class="button primary">Qwen3.6</a>

#### Gemma 4 MTP:

Vergiss nicht, **den Modellnamen zu ändern** zu deiner gewünschten Gemma-4-Modellgröße wie Gemma-4-26B-A4B usw., da die folgenden Anweisungen für Gemma-4-12B gelten. Beachte, dass wir einen `mtp-` vorangestellten GGUF bereitgestellt haben, sodass das folgende `-hf` Kommando MTP automatisch herunterladen und verwenden sollte.

**Denken-Modus:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-12b-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% hint style="info" %}
Bitte beachte Gemma 4s neuen [Erhaltener Denkmodus](#thinking-enable-disable--preserve-thinking).
{% endhint %}

**Nicht-Denkmodus**:

```bash
export LLAMA_CACHE="unsloth/gemma-4-12b-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2 \\
    --chat-template-kwargs '{"enable_thinking":false}'
```

#### Qwen3.6 MTP:

Vergiss nicht, **den Modellnamen zu ändern** zu deiner gewünschten Qwen3.6-Variante wie Qwen3.6-35B-A3B oder Qwen3.5 usw., da die folgenden Anweisungen für Qwen3.6-27B gelten:

**Denken-Modus** (Allgemeine Aufgaben)**:**

```bash
export LLAMA_CACHE="unsloth/Qwen3.6-27B-MTP-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.00 \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

Für präzise Codierungsaufgaben ändere: `temperature=0.6`

{% hint style="info" %}
Bitte beachte Qwen3.6s neuen [Erhaltener Denkmodus](#thinking-enable-disable--preserve-thinking).
{% endhint %}

**Nicht-Denkmodus** (Allgemeine Aufgaben):

```bash
export LLAMA_CACHE="unsloth/Qwen3.6-27B-MTP-GGUF"
./llama.cpp/llama-server \\
    -hf unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q4_K_XL \\
    --temp 0.7 \\
    --top-p 0.8 \\
    --top-k 20 \\
    --presence-penalty 1.5 \\
    --min-p 0.00 \\
    --spec-type draft-mtp --spec-draft-n-max 2 \\
    --chat-template-kwargs '{"enable_thinking":false}'
```

{% endstep %}

{% step %}

#### Quants manuell herunterladen

Wenn du die Quants und die MTP-Quants manuell herunterladen möchtest, kannst du das ebenfalls tun! Lade das Modell über den untenstehenden Code herunter (nach der Installation von `pip install huggingface_hub hf_transfer`). Du kannst Q4\_K\_M oder andere quantisierte Versionen wie `UD-Q4_K_XL` wählen. Wir empfehlen, mindestens die dynamische 2-Bit-Quantisierung zu verwenden `UD-Q2_K_XL` um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

#### Gemma 4 MTP:

```bash
hf download unsloth/gemma-4-12B-it-qat-GGUF \\
    --local-dir unsloth/gemma-4-12B-it-qat-GGUF \\
    --include "*mmproj-F16*" \\
    --include "mtp-*" \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q2_K_XL*" für Dynamic 2bit
```

#### Qwen3.6 MTP:

```bash
hf download unsloth/Qwen3.6-27B-MTP-GGUF \\
    --local-dir unsloth/Qwen3.6-27B-MTP-GGUF \\
    --include "*mmproj-F16*" \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q2_K_XL*" für Dynamic 2bit
```

{% endstep %}

{% step %}
Führe das Modell dann im Gesprächsmodus aus:

#### Gemma 4 MTP:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-12B-it-qat-GGUF/mmproj-F16.gguf \\
    --model-draft unsloth/gemma-4-12B-it-qat-GGUF/mtp-gemma-4-12B-it.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64  \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% endcode %}

Und du wirst das Folgende sehen - ignoriere auch die Fehlermeldungen

<img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FxvFX69qVxC4PBQ5CyzrN%2Fimage.png?alt=media&amp;token=0ac706d9-1492-4224-be7f-a6876aa488ca" alt="" data-size="original">

#### Qwen3.6 MTP:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/Qwen3.6-27B-MTP-GGUF/mmproj-F16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.00 \\
    --top-k 20 \\
    --spec-type draft-mtp --spec-draft-n-max 2
```

{% endcode %}
{% endstep %}

{% step %}

#### Llama-Server-Bereitstellung

Um Gemma-4 auf llama-server bereitzustellen, verwende:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-12B-it-qat-GGUF/gemma-4-12B-it-qat-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-12B-it-qat-GGUF/mmproj-F16.gguf \\
    --model-draft unsloth/gemma-4-12B-it-qat-GGUF/mtp-gemma-4-12B-it.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-12b-it-qat-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% endcode %}
{% endstep %}
{% endstepper %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/mtp.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
