For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌠Qwen3-Next: Leitfaden zum lokalen Ausführen

Führe die Qwen3-Next-80B-A3B-Instruct- und Thinking-Versionen lokal auf deinem Gerät aus!

Qwen veröffentlichte im Sept. 2025 Qwen3-Next, das 80B-MoEs mit Thinking- und Instruct-Modellvarianten von Qwen3. Mit 256K Kontext wurde Qwen3-Next mit einer brandneuen Architektur entworfen (Hybrid aus MoEs & Gated DeltaNet + Gated Attention), die speziell für schnelle Inferenz bei längeren Kontextlängen optimiert ist. Qwen3-Next hat eine 10-mal schnellere Inferenz als Qwen3-32B.

Qwen3-Next Instruct ausführenQwen3-Next Thinking ausführen

Qwen3-Next-80B-A3B Dynamische GGUFs: InstructThinking

⚙️ Nutzungsanleitung

Um eine optimale Leistung zu erreichen, empfiehlt Qwen diese Einstellungen:

Instruct:
Thinking:

Temperatur = 0,7

Temperatur = 0,6

Min_P = 0,00 (Der Standardwert von llama.cpp ist 0,1)

Min_P = 0,00 (Der Standardwert von llama.cpp ist 0,1)

Top_P = 0,80

Top_P = 0,95

TopK = 20

TopK = 20

presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden)

presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden)

Angemessene Ausgabelänge: Verwenden Sie eine Ausgabelänge von 32,768 Tokens für die meisten Anfragen für die Thinking-Variante und 16,384 für die Instruct-Variante. Sie können die maximale Ausgabengröße für das Thinking-Modell bei Bedarf erhöhen.

Chat-Vorlage für sowohl Thinking (Thinking hat <think></think>) und Instruct ist unten:

<|im_start|>user
Hey da!<|im_end|>
<|im_start|>assistant
Was ist 1+1?<|im_end|>
<|im_start|>user
2<|im_end|>
<|im_start|>assistant

📖 Qwen3-Next-Tutorials ausführen

Unten sind Anleitungen für die Thinking und Instruct Versionen des Modells.

Instruct: Qwen3-Next-80B-A3B-Instruct

Da dies ein Nicht-Thinking-Modell ist, erzeugt das Modell keine <think> </think> Blöcke.

⚙️Best Practices

Um eine optimale Leistung zu erreichen, empfiehlt Qwen die folgenden Einstellungen:

  • Wir empfehlen die Verwendung von temperature=0.7, top_p=0.8, top_k=20 und min_p=0.0 presence_penalty zwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.

  • temperature = 0.7

  • top_k = 20

  • min_p = 0,00 (Der Standardwert von llama.cpp ist 0,1)

  • top_p = 0,80

  • presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden) Versuchen Sie beispielsweise 1,0.

  • Unterstützt nativ bis zu 262,144 Kontext, aber Sie können es auf 32,768 Tokens für geringeren RAM-Verbrauch setzen

Llama.cpp: Qwen3-Next-80B-A3B-Instruct-Tutorial ausführen

  1. Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

  1. Du kannst direkt von HuggingFace herunterladen über:

  2. Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst UD_Q4_K_XL oder andere quantisierte Versionen auswählen.

Thinking: Qwen3-Next-80B-A3B-Thinking

Dieses Modell unterstützt nativ nur den Thinking-Modus und ein 256K-Kontextfenster. Die Standard-Chatvorlage fügt <think> automatisch hinzu, sodass Sie in der Ausgabe möglicherweise nur ein schließendes </think> Tag sehen.

⚙️Best Practices

Um eine optimale Leistung zu erreichen, empfiehlt Qwen die folgenden Einstellungen:

  • Wir empfehlen die Verwendung von temperature=0.6, top_p=0.95, top_k=20 und min_p=0.0 presence_penalty zwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.

  • temperature = 0.6

  • top_k = 20

  • min_p = 0,00 (Der Standardwert von llama.cpp ist 0,1)

  • top_p = 0.95

  • presence_penalty = 0,0 bis 2,0 (Der Standardwert von llama.cpp deaktiviert dies, aber um Wiederholungen zu reduzieren, können Sie dies verwenden) Versuchen Sie beispielsweise 1,0.

  • Unterstützt nativ bis zu 262,144 Kontext, aber Sie können es auf 32,768 Tokens für geringeren RAM-Verbrauch setzen

Llama.cpp: Qwen3-Next-80B-A3B-Thinking-Tutorial ausführen

  1. Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

  1. Sie können direkt von Hugging Face ziehen über:

  2. Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst UD_Q4_K_XL oder andere quantisierte Versionen auswählen.

🛠️ Generierungsgeschwindigkeit verbessern

Wenn Sie mehr VRAM haben, können Sie versuchen, mehr MoE-Layer oder ganze Layer auszulagern.

Normalerweise -ot ".ffn_.*_exps.=CPU" lagert alle MoE-Layer auf die CPU aus! Dadurch können Sie effektiv alle Nicht-MoE-Layer auf 1 GPU unterbringen, was die Generierungsgeschwindigkeit verbessert. Sie können den Regex-Ausdruck anpassen, um mehr Layer unterzubringen, wenn Sie mehr GPU-Kapazität haben.

Wenn Sie etwas mehr GPU-Speicher haben, versuchen Sie -ot ".ffn_(up|down)_exps.=CPU" Dies lagert die MoE-Layer für Up- und Down-Projektionen aus.

Versuchen Sie -ot ".ffn_(up)_exps.=CPU" wenn Sie noch mehr GPU-Speicher haben. Dies lagert nur die MoE-Layer für Up-Projektionen aus.

Sie können den Regex auch anpassen, zum Beispiel -ot "\.(6|7|8|9|[0-9][0-9]|[0-9][0-9][0-9])\.ffn_(gate|up|down)_exps.=CPU" bedeutet, Gate-, Up- und Down-MoE-Layer auszulagern, aber nur ab der 6. Schicht.

Die neueste llama.cpp-Version führt außerdem den High-Throughput-Modus ein. Verwenden Sie llama-parallel. Lesen Sie mehr darüber hier. Sie können auch den KV-Cache auf 4 Bit quantisieren zum Beispiel, um VRAM-/RAM-Übertragungen zu reduzieren, was den Generierungsprozess auch schneller machen kann. Der nächste Abschnitt spricht über die KV-Cache-Quantisierung.

📐Wie man langen Kontext unterbringt

Um längeren Kontext unterzubringen, können Sie KV-Cache-Quantisierung verwenden, um die K- und V-Caches auf niedrigere Bits zu quantisieren. Dies kann auch die Generierungsgeschwindigkeit aufgrund des geringeren RAM-/VRAM-Datenverkehrs erhöhen. Die zulässigen Optionen für die K-Quantisierung (Standard ist f16) sind unten aufgeführt.

--cache-type-k f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1

Sie sollten die _1 Varianten verwenden, um die Genauigkeit etwas zu erhöhen, auch wenn es etwas langsamer ist. Zum Beispiel q4_1, q5_1 Probieren Sie also --cache-type-k q4_1

Sie können auch den V-Cache quantisieren, aber dafür müssen Sie llama.cpp mit Flash Attention-Unterstützung kompilieren via -DGGML_CUDA_FA_ALL_QUANTS=ON , und--flash-attn verwenden, um es zu aktivieren. Dann können Sie es zusammen mit aus, um es zu aktivieren. Nach der Installation von Flash Attention können Sie dann --cache-type-v q4_1

Zuletzt aktualisiert

War das hilfreich?