🪽Wie man MTP-Modelle ausführt: Leitfaden zur Multi-Token-Vorhersage
MTP oder Multi-Token Prediction beschleunigt die Inferenz, indem ein Modell mehrere kommende Token auf einmal vorhersagt, statt pro Schritt nur einen Token zu generieren. Dadurch ermöglicht es schnellere Inferenz ohne Genauigkeitsverlust und ist besonders effektiv auf GPUs. In dieser Anleitung lernen Sie, wie Sie MTP-Modelle wie Gemma 4 oder Qwen3.6 auf Ihrem lokalen Gerät verwenden.
MTP sagt mehrere zukünftige Token vorher, die das Hauptmodell parallel überprüft. Dadurch werden die Vorwärtsdurchläufe der Generierung reduziert, was die Ausgabe beschleunigt und gleichzeitig die Qualität erhält, da nur verifizierte Token beibehalten werden.
Beim Ausführen von GGUFs kann MTP die Generierung um etwa das 1,4- bis 2,2-Fache beschleunigen. Dichte Modelle wie Gemma-4-31B profitieren am meisten und erreichen >1,4x Beschleunigung gegenüber dem Original. Die Gewinne sind auf Geräten mit geringerer Speicherbandbreite, wie älteren Macs, kleiner. Sie können MTP-Modelle direkt in der UI von Unsloth Studio oder in llama.cpp ausführen.
MTP benötigt mehr Speicher als Standard, also planen Sie etwa 2 GB zusätzlichen RAM-/VRAM-Spielraum ein.
Wir haben festgestellt, --spec-draft-n-max 2 ist jedoch der beste Ausgangspunkt, nehmen Sie nicht an, 2 dassoptimal ist, da die Leistung von der Hardware abhängt. Probieren Sie jeden Wert von 1 bis 6 und verwenden Sie denjenigen, der für Ihr System am schnellsten ist. Unsloth Studio setzt automatisch die idealen MTP-Einstellungen für Ihre spezifische Hardware (Mac, CPU, GPU usw.) fest – Sie können sie später dennoch ändern.
Gemma 4 MTP
Google DeepMind hat MTP getrennt von den ursprünglichen Gemma 4 Modellen trainiert, auch für QAT-Varianten. Im Gegensatz zu Qwen veröffentlichte Google spezielle MTP-Varianten unter dem assistant Namen. Für beste Ergebnisse laden wir nur 3 Präzisionsoptionen hoch: 8-Bit und 16-Bit (BF16, F16). Für QAT haben wir denselben intelligenten 4-Bit-Wiederherstellungsprozess angewendet wie bei den Gemma-4-QAT-Quants, sodass die MTP-Quants ebenfalls intelligent aus 4-Bit abgeleitet sind.
Wir haben mtp- präfixierte GGUFs in jedes Repo hochgeladen, sodass Sie nur die regulären originalen Gemma-4-GGUFs verwenden müssen; ein separates Repo ist nicht erforderlich. Sie können auf Gemma MTP-Modelle hier zugreifen und sie können jetzt in Unsloth ausgeführt werden. Wir haben Gemma-4-QAT mit MTP benchmarked, und es läuft 1,5x - 2,2x schneller:

Tabelle: Hardwareanforderungen für MTP (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher)
E2B
5 GB
6–9 GB
11 GB
E4B
6,5–7 GB
10–13 GB
17 GB
12B Unified
8–9 GB
14–15 GB
26 GB
26B A4B
17–18 GB
29–31 GB
53 GB
31B
18–21 GB
35–39 GB
63 GB
Gemma 4 MTP ist in Unsloth Studio automatisch aktiviert. Sie müssen nur die regulären originalen Gemma-4-GGUFs herunterladen. Wir haben die Gemma-4-GGUF-Dateien aktualisiert, um eine zusätzliche MTP-Datei in einem separaten Ordner innerhalb des GGUF-Pakets einzuschließen, sodass kein separates Gemma-4-Assistant-GGUF heruntergeladen werden muss.
Das einzige Modell, das weiterhin ein separates MTP-GGUF benötigt, ist Qwen3.6.
Um die Gemma-4-MTP-Modelle auszuführen, folgen Sie entweder den Schritten für Unsloth Studio oder llama.cpp.
🦥 In Unsloth Studio ausführen🦙 In llama.cpp ausführen
damit das Folgende einfach funktioniert (dies verwendet die 8-Bit-Version)
Qwen3.6 MTP
Qwen hat MTP direkt innerhalb der Qwen3.6 und Qwen3.5 Modelle trainiert. Dadurch kann Qwen3.6 27B MTP auf einer RTX-6000-GPU 160 Token/s und Qwen3.6 35B-A3B 240 Token/s erreichen. GGUF-Uploads:
Tabelle: Hardwareanforderungen für MTP (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher)
27B
16 GB
19 GB
25 GB
31 GB
56 GB
35B-A3B
18 GB
24 GB
31 GB
39 GB
71 GB
Unten finden Sie Grafiken des Inferenzdurchsatzes für MTP im Vergleich zu ohne MTP:


Wir haben außerdem MTP-GGUFs hochgeladen für die Qwen3.5 Modellfamilie einschließlich: 0,8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B und 397B-A17B. Llama.cpp verbessert die MTP-Leistung kontinuierlich, also erwarten Sie, dass es mit der Zeit schneller wird!
Um die Qwen-MTP-Modelle auszuführen, folgen Sie entweder den Schritten für Unsloth Studio oder llama.cpp.
🦥 Unsloth Studio MTP-Anleitung
Unsloth Studio setzt automatisch die idealen MTP-Einstellungen für Ihre spezifische Hardware (Mac, CPU, GPU usw.) fest – Sie können sie später dennoch ändern.
Suchen und laden Sie Ihr gewünschtes Modell herunter
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum Studio-Chat Tab und suchen Sie in der Suchleiste nach Qwen3.6 MTP oder Gemma 4 und laden Sie das gewünschte Modell und die gewünschte Quantisierung herunter.
Gemma 4 MTP ist in Unsloth automatisch aktiviert. Sie müssen nur den regulären originalen Gemma-4-GGUF herunterladen. Wir haben die Gemma-4-GGUF-Dateien aktualisiert, um eine zusätzliche MTP-Datei in einem separaten Ordner innerhalb des GGUF-Pakets einzuschließen, sodass kein separates Gemma-4-Assistant-GGUF heruntergeladen werden muss.
Das einzige Modell, das weiterhin ein separates MTP-GGUF benötigt, ist Qwen3.6.


Führen Sie Ihr MTP-Modell aus
Inferenz, MTP und spekulative Decoding-Einstellungen sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können außerdem spekulatives Decoding, die Kontextlänge, die Chatvorlage und andere Einstellungen in der rechten Seitenleiste bearbeiten.

Für weitere Informationen können Sie unseren Inferenzleitfaden für Unsloth Studio ansehen. Unten machte der 2-Bit-Qwen3.6-MTP-GGUF mehr als 10 Tool-Aufrufe, durchsuchte 10 Websites und führte Python-Code aus:

🦙 Llama.cpp MTP-Anleitung
Installieren Sie die neueste Version von llama.cpp auf GitHub hier. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:Q4_K_XL) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwenden Sie export LLAMA_CACHE="folder" um llama.cpp zu zwingen, an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.
Folgen Sie einem der Befehle für die jeweiligen Modelle:
Gemma 4 MTP:
Vergessen Sie nicht, den Modellnamen zu ändern zu Ihrer gewünschten Gemma-4-Modellgröße wie Gemma-4-26B-A4B usw., da die folgenden Anweisungen für Gemma-4-12B gelten. Beachten Sie, dass wir ein mtp- mit Präfix versehenes GGUF bereitgestellt haben, sodass der folgende -hf Befehl MTP automatisch herunterladen und verwenden sollte.
Denkmodus:
Bitte sehen Sie sich Gemma 4s neues Beibehaltenes Denken.
Nicht-Denkmodus:
Qwen3.6 MTP:
Vergessen Sie nicht, den Modellnamen zu ändern zu Ihrer gewünschten Qwen3.6-Variante wie Qwen3.6-35B-A3B oder Qwen3.5 usw., da die folgenden Anweisungen für Qwen3.6-27B gelten:
Denkmodus (Allgemeine Aufgaben):
Für präzise Coding-Aufgaben ändern Sie: temperature=0.6
Bitte sehen Sie sich Qwen3.6s neues Beibehaltenes Denken.
Nicht-Denkmodus (Allgemeine Aufgaben):
Quants manuell herunterladen
Wenn Sie die Quants und die MTP-Quants manuell herunterladen möchten, können Sie das ebenfalls tun! Laden Sie das Modell über den folgenden Code herunter (nach der Installation von pip install huggingface_hub hf_transfer). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL wählen. Wir empfehlen, mindestens die dynamische 2-Bit-Quant UD-Q2_K_XL zu verwenden, um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Gemma 4 MTP:
Qwen3.6 MTP:
Zuletzt aktualisiert
War das hilfreich?


