🌠Qwen3-Next: Leitfaden zum lokalen Ausführen
Führe die Qwen3-Next-80B-A3B-Instruct- und Thinking-Versionen lokal auf deinem Gerät aus!
Qwen veröffentlichte im Sept. 2025 Qwen3-Next, das 80B-MoEs mit Thinking- und Instruct-Modellvarianten von Qwen3. Mit 256K Kontext wurde Qwen3-Next mit einer brandneuen Architektur entworfen (Hybrid aus MoEs & Gated DeltaNet + Gated Attention), die speziell für schnelle Inferenz bei längeren Kontextlängen optimiert ist. Qwen3-Next hat eine 10-mal schnellere Inferenz als Qwen3-32B.
Qwen3-Next-80B-A3B Dynamische GGUFs: Instruct • Thinking
⚙️ Nutzungsanleitung
NEU seit dem 6. Dez. 2025: Unsloth Qwen3-Next jetzt mit iMatrix aktualisiert für verbesserte Leistung.
Das Thinking-Modell verwendet temperature = 0.6, aber das Instruct-Modell verwendet temperature = 0.7
Das Thinking-Modell verwendet top_p = 0.95, aber das Instruct-Modell verwendet top_p = 0.8
Um eine optimale Leistung zu erreichen, empfiehlt Qwen diese Einstellungen:
Temperatur = 0,7
Temperatur = 0,6
Min_P = 0,00 (Der Standardwert von llama.cpp ist 0,1)
Min_P = 0,00 (Der Standardwert von llama.cpp ist 0,1)
Top_P = 0,80
Top_P = 0,95
TopK = 20
TopK = 20
presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden)
presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden)
Angemessene Ausgabelänge: Verwenden Sie eine Ausgabelänge von 32,768 Tokens für die meisten Anfragen für die Thinking-Variante und 16,384 für die Instruct-Variante. Sie können die maximale Ausgabengröße für das Thinking-Modell bei Bedarf erhöhen.
Chat-Vorlage für sowohl Thinking (Thinking hat <think></think>) und Instruct ist unten:
<|im_start|>user
Hey da!<|im_end|>
<|im_start|>assistant
Was ist 1+1?<|im_end|>
<|im_start|>user
2<|im_end|>
<|im_start|>assistant📖 Qwen3-Next-Tutorials ausführen
Unten sind Anleitungen für die Thinking und Instruct Versionen des Modells.
Instruct: Qwen3-Next-80B-A3B-Instruct
Da dies ein Nicht-Thinking-Modell ist, erzeugt das Modell keine <think> </think> Blöcke.
⚙️Best Practices
Um eine optimale Leistung zu erreichen, empfiehlt Qwen die folgenden Einstellungen:
Wir empfehlen die Verwendung von
temperature=0.7, top_p=0.8, top_k=20 und min_p=0.0presence_penaltyzwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.temperature = 0.7top_k = 20min_p = 0,00(Der Standardwert von llama.cpp ist 0,1)top_p = 0,80presence_penalty = 0,0 bis 2,0(Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden) Versuchen Sie beispielsweise 1,0.Unterstützt nativ bis zu
262,144Kontext, aber Sie können es auf32,768Tokens für geringeren RAM-Verbrauch setzen
✨ Llama.cpp: Qwen3-Next-80B-A3B-Instruct-Tutorial ausführen
Hole dir die neueste
llama.cppauf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere-DGGML_CUDA=ONzu-DGGML_CUDA=OFFwenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze-DGGML_CUDA=OFFund fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Du kannst direkt von HuggingFace herunterladen über:
Lade das Modell herunter über (nach der Installation von
pip install huggingface_hub hf_transfer). Du kannstUD_Q4_K_XLoder andere quantisierte Versionen auswählen.
Thinking: Qwen3-Next-80B-A3B-Thinking
Dieses Modell unterstützt nativ nur den Thinking-Modus und ein 256K-Kontextfenster. Die Standard-Chatvorlage fügt <think> automatisch hinzu, sodass Sie in der Ausgabe möglicherweise nur ein schließendes </think> Tag sehen.
⚙️Best Practices
Um eine optimale Leistung zu erreichen, empfiehlt Qwen die folgenden Einstellungen:
Wir empfehlen die Verwendung von
temperature=0.6, top_p=0.95, top_k=20 und min_p=0.0presence_penaltyzwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.temperature = 0.6top_k = 20min_p = 0,00(Der Standardwert von llama.cpp ist 0,1)top_p = 0.95presence_penalty = 0,0 bis 2,0(Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden) Versuchen Sie beispielsweise 1,0.Unterstützt nativ bis zu
262,144Kontext, aber Sie können es auf32,768Tokens für geringeren RAM-Verbrauch setzen
✨ Llama.cpp: Qwen3-Next-80B-A3B-Thinking-Tutorial ausführen
Hole dir die neueste
llama.cppauf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere-DGGML_CUDA=ONzu-DGGML_CUDA=OFFwenn du keine GPU hast oder nur CPU-Inferenz möchtest.
Sie können direkt von Hugging Face ziehen über:
Lade das Modell herunter über (nach der Installation von
pip install huggingface_hub hf_transfer). Du kannstUD_Q4_K_XLoder andere quantisierte Versionen auswählen.
🛠️ Generierungsgeschwindigkeit verbessern
Wenn Sie mehr VRAM haben, können Sie versuchen, mehr MoE-Layer oder ganze Layer auszulagern.
Normalerweise -ot ".ffn_.*_exps.=CPU" lagert alle MoE-Layer auf die CPU aus! Dadurch können Sie effektiv alle Nicht-MoE-Layer auf 1 GPU unterbringen, was die Generierungsgeschwindigkeit verbessert. Sie können den Regex-Ausdruck anpassen, um mehr Layer unterzubringen, wenn Sie mehr GPU-Kapazität haben.
Wenn Sie etwas mehr GPU-Speicher haben, versuchen Sie -ot ".ffn_(up|down)_exps.=CPU" Dies lagert die MoE-Layer für Up- und Down-Projektionen aus.
Versuchen Sie -ot ".ffn_(up)_exps.=CPU" wenn Sie noch mehr GPU-Speicher haben. Dies lagert nur die MoE-Layer für Up-Projektionen aus.
Sie können den Regex auch anpassen, zum Beispiel -ot "\.(6|7|8|9|[0-9][0-9]|[0-9][0-9][0-9])\.ffn_(gate|up|down)_exps.=CPU" bedeutet, Gate-, Up- und Down-MoE-Layer auszulagern, aber nur ab der 6. Schicht.
Die neueste llama.cpp-Version führt außerdem den High-Throughput-Modus ein. Verwenden Sie llama-parallel. Lesen Sie mehr darüber hier. Sie können auch den KV-Cache auf 4 Bit quantisieren zum Beispiel, um VRAM-/RAM-Übertragungen zu reduzieren, was den Generierungsprozess auch schneller machen kann. Der nächste Abschnitt spricht über die KV-Cache-Quantisierung.
📐Wie man langen Kontext unterbringt
Um längeren Kontext unterzubringen, können Sie KV-Cache-Quantisierung verwenden, um die K- und V-Caches auf niedrigere Bits zu quantisieren. Dies kann auch die Generierungsgeschwindigkeit aufgrund des geringeren RAM-/VRAM-Datenverkehrs erhöhen. Die zulässigen Optionen für die K-Quantisierung (Standard ist f16) sind unten aufgeführt.
--cache-type-k f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1
Sie sollten die _1 Varianten verwenden, um die Genauigkeit etwas zu erhöhen, auch wenn es etwas langsamer ist. Zum Beispiel q4_1, q5_1 Probieren Sie also --cache-type-k q4_1
Sie können auch den V-Cache quantisieren, aber dafür müssen Sie llama.cpp mit Flash Attention-Unterstützung kompilieren via -DGGML_CUDA_FA_ALL_QUANTS=ON , und--flash-attn verwenden, um es zu aktivieren. Dann können Sie es zusammen mit aus, um es zu aktivieren. Nach der Installation von Flash Attention können Sie dann --cache-type-v q4_1

Zuletzt aktualisiert
War das hilfreich?

