🌠Qwen3-2507: Leitfaden zum lokalen Ausführen
Führe Qwen3-30B-A3B-2507 und die 235B-A22B-Thinking- und Instruct-Versionen lokal auf deinem Gerät aus!
Qwen veröffentlichte 2507-Updates (Juli 2025) für ihre Qwen3 4B-, 30B- und 235B-Modelle und führte sowohl „Thinking“- als auch „Non-Thinking“-Varianten ein. Die Non-Thinking-Qwen3-30B-A3B-Instruct-2507' und 'Qwen3-235B-A22B-Instruct-2507' verfügt über ein Kontextfenster von 256K, verbessertes Befolgen von Anweisungen, mehrsprachige Fähigkeiten und Ausrichtung.
Die Thinking-Modelle 'Qwen3-30B-A3B-Thinking-2507' und 'Qwen3-235B-A22B-Thinking-2507' glänzen beim Schlussfolgern, wobei das 235B in Logik, Mathematik, Wissenschaft, Programmierung und fortgeschrittenen akademischen Aufgaben SOTA-Ergebnisse erzielt.
Unsloth unterstützt jetzt auch Fine-Tuning und Bestärkendes Lernen (RL) von Qwen3-2507-Modellen — 2x schneller, mit 70 % weniger VRAM und 8x längeren Kontextlängen
30B-A3B ausführen235B-A22B ausführenQwen3-2507 feinabstimmen
Unsloth Dynamic 2.0 GGUFs:
⚙️Best Practices
Die Einstellungen für das Thinking- und das Instruct-Modell sind unterschiedlich. Das Thinking-Modell verwendet temperature = 0.6, das Instruct-Modell verwendet jedoch temperature = 0.7 Das Thinking-Modell verwendet top_p = 0.95, das Instruct-Modell verwendet jedoch top_p = 0.8
Um optimale Leistung zu erzielen, empfiehlt Qwen diese Einstellungen:
Temperatur = 0.7
Temperatur = 0.6
Min_P = 0.00 (llama.cpps Standard ist 0.1)
Min_P = 0.00 (llama.cpps Standard ist 0.1)
Top_P = 0.80
Top_P = 0.95
TopK = 20
TopK = 20
presence_penalty = 0.0 bis 2.0 (der Standard von llama.cpp deaktiviert es, aber um Wiederholungen zu reduzieren, können Sie es verwenden)
presence_penalty = 0.0 bis 2.0 (der Standard von llama.cpp deaktiviert es, aber um Wiederholungen zu reduzieren, können Sie es verwenden)
Ausreichende Ausgabelänge: Verwenden Sie eine Ausgabelänge von 32,768 Tokens für die meisten Abfragen, was für die meisten Abfragen ausreichend ist.
Chat-Vorlage für beide Thinking-Modelle (Thinking hat <think></think>) und Instruct ist unten:
📖 Tutorials zum Ausführen von Qwen3-30B-A3B-2507
Unten finden Sie Anleitungen für die Thinking und Instruct Versionen des Modells.
Instruct: Qwen3-30B-A3B-Instruct-2507
Da dies ein Nicht-Thinking-Modell ist, muss thinking=False nicht gesetzt werden, und das Modell erzeugt keine <think> </think> Blöcke.
⚙️Best Practices
Um optimale Leistung zu erzielen, empfiehlt Qwen die folgenden Einstellungen:
Wir empfehlen die Verwendung von
temperature=0.7, top_p=0.8, top_k=20 und min_p=0.0presence_penaltyzwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.temperature = 0.7top_k = 20min_p = 0.00(llama.cpps Standard ist 0.1)top_p = 0.80presence_penalty = 0.0 bis 2.0(der Standard von llama.cpp deaktiviert es, aber um Wiederholungen zu reduzieren, können Sie es verwenden) Probieren Sie zum Beispiel 1.0 aus.Unterstützt nativ bis zu
262,144Kontext, aber Sie können es auf32,768Tokens einstellen, um weniger RAM zu verbrauchen
🦙 Ollama: Tutorial zum Ausführen von Qwen3-30B-A3B-Instruct-2507
Installieren
ollamafalls Sie das nicht schon getan haben! Sie können nur Modelle bis zu 32B Größe ausführen.
Führen Sie das Modell aus! Beachten Sie, dass Sie
ollama servein einem anderen Terminal aufrufen können, falls es fehlschlägt! Wir enthalten alle unsere Korrekturen und vorgeschlagenen Parameter (Temperatur usw.) inparamsin unserem Hugging-Face-Upload!
✨ Llama.cpp: Tutorial zum Ausführen von Qwen3-30B-A3B-Instruct-2507
Erhalten Sie das neueste
llama.cppstandardmäßig GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie-DGGML_CUDA=ONauf-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie üblich fort - Metal-Unterstützung ist standardmäßig aktiviert.
Sie können direkt von HuggingFace herunterladen über:
Laden Sie das Modell herunter über (nach der Installation von
pip install huggingface_hub hf_transfer). Sie können UD_Q4_K_XL oder andere quantisierte Versionen wählen.
Thinking: Qwen3-30B-A3B-Thinking-2507
Dieses Modell unterstützt nativ nur den Thinking-Modus und ein Kontextfenster von 256K. Die Standard-Chat-Vorlage fügt <think> automatisch hinzu, sodass Sie möglicherweise nur einen schließenden </think> Tag in der Ausgabe sehen.
⚙️Best Practices
Um optimale Leistung zu erzielen, empfiehlt Qwen die folgenden Einstellungen:
Wir empfehlen die Verwendung von
temperature=0.6, top_p=0.95, top_k=20 und min_p=0.0presence_penaltyzwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.temperature = 0.6top_k = 20min_p = 0.00(llama.cpps Standard ist 0.1)top_p = 0.95presence_penalty = 0.0 bis 2.0(der Standard von llama.cpp deaktiviert es, aber um Wiederholungen zu reduzieren, können Sie es verwenden) Probieren Sie zum Beispiel 1.0 aus.Unterstützt nativ bis zu
262,144Kontext, aber Sie können es auf32,768Tokens einstellen, um weniger RAM zu verbrauchen
🦙 Ollama: Tutorial zum Ausführen von Qwen3-30B-A3B-Instruct-2507
Installieren
ollamafalls Sie das nicht schon getan haben! Sie können nur Modelle bis zu 32B Größe ausführen. Um die vollständigen 235B-A22B-Modelle auszuführen, siehe hier.
Führen Sie das Modell aus! Beachten Sie, dass Sie
ollama servein einem anderen Terminal aufrufen können, falls es fehlschlägt! Wir enthalten alle unsere Korrekturen und vorgeschlagenen Parameter (Temperatur usw.) inparamsin unserem Hugging-Face-Upload!
✨ Llama.cpp: Tutorial zum Ausführen von Qwen3-30B-A3B-Instruct-2507
Erhalten Sie das neueste
llama.cppstandardmäßig GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie-DGGML_CUDA=ONauf-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie üblich fort - Metal-Unterstützung ist standardmäßig aktiviert.
Sie können direkt von Hugging Face herunterladen über:
Laden Sie das Modell herunter über (nach der Installation von
pip install huggingface_hub hf_transfer). Sie können UD_Q4_K_XL oder andere quantisierte Versionen wählen.
📖 Ausführen Qwen3-235B-A22B-2507 Tutorials
Unten finden Sie Anleitungen für die Thinking und Instruct Versionen des Modells.
Thinking: Qwen3-235B-A22B-Thinking-2507
Dieses Modell unterstützt nativ nur den Thinking-Modus und ein Kontextfenster von 256K. Die Standard-Chat-Vorlage fügt <think> automatisch hinzu, sodass Sie möglicherweise nur einen schließenden </think> Tag in der Ausgabe sehen.
⚙️ Best Practices
Um optimale Leistung zu erzielen, empfiehlt Qwen für das Thinking-Modell diese Einstellungen:
temperature = 0.6top_k = 20min_p = 0.00(llama.cpps Standard ist 0.1)top_p = 0.95presence_penalty = 0.0 bis 2.0(der Standard von llama.cpp deaktiviert es, aber um Wiederholungen zu reduzieren, können Sie es verwenden) Probieren Sie zum Beispiel 1.0 aus.Ausreichende Ausgabelänge: Verwenden Sie eine Ausgabelänge von
32,768Tokens für die meisten Abfragen, was für die meisten Abfragen ausreichend ist.
✨Führen Sie Qwen3-235B-A22B-Thinking via llama.cpp aus:
Für Qwen3-235B-A22B werden wir speziell Llama.cpp für optimierte Inferenz und eine Vielzahl von Optionen verwenden.
Wenn Sie eine vollpräzise unquantisierte Versionmöchten, verwenden Sie unsere Q8_K_XL, Q8_0 oder BF16 Versionen!
Erhalten Sie das neueste
llama.cppstandardmäßig GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie-DGGML_CUDA=ONauf-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie üblich fort - Metal-Unterstützung ist standardmäßig aktiviert.Sie können llama.cpp direkt verwenden, um das Modell herunterzuladen, aber ich empfehle normalerweise die Verwendung von
huggingface_hubUm llama.cpp direkt zu verwenden, tun Sie Folgendes:Laden Sie das Modell herunter über (nach der Installation von
pip install huggingface_hub hf_transfer). Sie können UD-Q2_K_XL oder andere quantisierte Versionen wählen..Führen Sie das Modell aus und probieren Sie irgendeinen Prompt aus.
Bearbeiten Sie
--threads -1für die Anzahl der CPU-Threads,--ctx-size262114 für die Kontextlänge,--n-gpu-layers 99für GPU-Offloading, wie viele Schichten. Versuchen Sie, dies anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie es auch, wenn Sie nur CPU-Inferenz haben.
Verwenden Sie -ot ".ffn_.*_exps.=CPU" um alle MoE-Schichten auf die CPU auszulagern! Dadurch können Sie effektiv alle Nicht-MoE-Schichten auf 1 GPU unterbringen und die Generierungsgeschwindigkeit verbessern. Sie können den Regex-Ausdruck anpassen, um mehr Schichten unterzubringen, wenn Sie mehr GPU-Kapazität haben.
Instruct: Qwen3-235B-A22B-Instruct-2507
Da dies ein Nicht-Thinking-Modell ist, muss thinking=False nicht gesetzt werden, und das Modell erzeugt keine <think> </think> Blöcke.
⚙️Best Practices
Um optimale Leistung zu erzielen, empfehlen wir die folgenden Einstellungen:
1. Sampling-Parameter: Wir empfehlen die Verwendung von temperature=0.7, top_p=0.8, top_k=20 und min_p=0. presence_penalty zwischen 0 und 2, falls das Framework dies unterstützt, um endlose Wiederholungen zu reduzieren.
2. Ausreichende Ausgabelänge: Wir empfehlen, eine Ausgabelänge von 16,384 Tokens für die meisten Abfragen zu verwenden, was für Instruct-Modelle ausreichend ist.
3. Ausgabeformat standardisieren: Wir empfehlen, Prompts zu verwenden, um Modell-Ausgaben beim Benchmarking zu standardisieren.
Matheaufgaben: Fügen Sie
Bitte schrittweise herleiten und die endgültige Antwort in \boxed{} setzen.im Prompt ein.Multiple-Choice-Fragen: Fügen Sie die folgende JSON-Struktur zum Prompt hinzu, um Antworten zu standardisieren: "Bitte geben Sie Ihre Wahl im `answer`-Feld nur mit dem Buchstaben der Wahl an, z. B. `"answer": "C".
✨Führen Sie Qwen3-235B-A22B-Instruct via llama.cpp aus:
Für Qwen3-235B-A22B werden wir speziell Llama.cpp für optimierte Inferenz und eine Vielzahl von Optionen verwenden.
Wenn Sie eine vollpräzise unquantisierte Versionmöchten, verwenden Sie unsere Q8_K_XL, Q8_0 oder BF16 Versionen!
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie
-DGGML_CUDA=ONauf-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie üblich fort - Metal-Unterstützung ist standardmäßig aktiviert.
2. Sie können llama.cpp direkt verwenden, um das Modell herunterzuladen, aber ich empfehle normalerweise die Verwendung von huggingface_hub Um llama.cpp direkt zu verwenden, tun Sie Folgendes:\
3. Laden Sie das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können UD-Q2_K_XL oder andere quantisierte Versionen wählen..
4. Führen Sie das Modell aus und probieren Sie irgendeinen Prompt aus. 5. Bearbeiten Sie --threads -1 für die Anzahl der CPU-Threads, --ctx-size 262114 für die Kontextlänge, --n-gpu-layers 99 für GPU-Offloading, wie viele Schichten. Versuchen Sie, dies anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie es auch, wenn Sie nur CPU-Inferenz haben.
Verwenden Sie -ot ".ffn_.*_exps.=CPU" um alle MoE-Schichten auf die CPU auszulagern! Dadurch können Sie effektiv alle Nicht-MoE-Schichten auf 1 GPU unterbringen und die Generierungsgeschwindigkeit verbessern. Sie können den Regex-Ausdruck anpassen, um mehr Schichten unterzubringen, wenn Sie mehr GPU-Kapazität haben.
🛠️ Verbesserung der Generierungsgeschwindigkeit
Wenn Sie mehr VRAM haben, können Sie versuchen, mehr MoE-Schichten auszulagern oder ganze Schichten auszulagern.
Normalerweise -ot ".ffn_.*_exps.=CPU" lagert alle MoE-Schichten auf die CPU aus! Dadurch können Sie effektiv alle Nicht-MoE-Schichten auf 1 GPU unterbringen und die Generierungsgeschwindigkeit verbessern. Sie können den Regex-Ausdruck anpassen, um mehr Schichten unterzubringen, wenn Sie mehr GPU-Kapazität haben.
Wenn Sie etwas mehr GPU-Speicher haben, versuchen Sie -ot ".ffn_(up|down)_exps.=CPU" Dies lagert die Up- und Down-Projektions-MoE-Schichten aus.
Versuchen Sie -ot ".ffn_(up)_exps.=CPU" wenn Sie noch mehr GPU-Speicher haben. Dies lagert nur die Up-Projektions-MoE-Schichten aus.
Sie können auch den Regex anpassen, zum Beispiel -ot "\.(6|7|8|9|[0-9][0-9]|[0-9][0-9][0-9])\.ffn_(gate|up|down)_exps.=CPU" bedeutet, Gate-, Up- und Down-MoE-Schichten auszulagern, jedoch nur ab der 6. Schicht aufwärts.
Der neueste llama.cpp-Version führt außerdem einen High-Throughput-Modus ein. Verwenden Sie llama-parallel. Lesen Sie hier mehr darüber hier. Sie können auch den KV-Cache auf 4 Bit quantisieren um beispielsweise die VRAM-/RAM-Bewegung zu reduzieren, was den Generierungsprozess ebenfalls beschleunigen kann. Der nächste Abschnitt spricht über die KV-Cache-Quantisierung.
📐So passt langer Kontext hinein
Um längeren Kontext unterzubringen, können Sie KV-Cache-Quantisierung verwenden, um die K- und V-Caches auf niedrigere Bits zu quantisieren. Dies kann auch die Generierungsgeschwindigkeit aufgrund reduzierter RAM-/VRAM-Datenbewegung erhöhen. Die erlaubten Optionen für die K-Quantisierung (Standard ist f16) umfassen die folgenden.
--cache-type-k f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1
Sie sollten die _1 Varianten für etwas höhere Genauigkeit verwenden, obwohl sie etwas langsamer sind. Z. B. q4_1, q5_1 Probieren Sie also --cache-type-k q4_1
Sie können auch den V-Cache quantisieren, aber dafür müssen Sie llama.cpp mit Flash Attention kompilieren Unterstützung über -DGGML_CUDA_FA_ALL_QUANTS=ON, und verwendet --flash-attn aktivieren. Nach der Installation von Flash Attention können Sie dann --cache-type-v q4_1
🦥 Fine-Tuning von Qwen3-2507 mit Unsloth
Unsloth macht Qwen3 und Qwen3-2507-Fine-Tuning 2x schneller, verwendet 70 % weniger VRAM und unterstützt 8x längere Kontextlängen. Da Qwen3-2507 nur in einer 30B-Variante veröffentlicht wurde, bedeutet dies, dass Sie etwa eine 40GB A100-GPU benötigen, um das Modell mit QLoRA (4-Bit) feinabzustimmen.
Für ein Notebook benötigen Sie, da das Modell nicht in Colabs kostenlose 16GB-GPUs passt, eine 40GB A100. Sie können unser Conversational-Notebook verwenden, aber den Datensatz durch einen Ihrer Wahl ersetzen. Diesmal müssen Sie das Reasoning nicht in Ihren Datensatz kombinieren, da das Modell kein Reasoning hat.
Wenn du eine ältere Version von Unsloth hast und/oder lokal feinabstimmst, installiere die neueste Version von Unsloth:
Fine-Tuning von Qwen3-2507-MOE-Modellen
Die Fine-Tuning-Unterstützung umfasst MOE-Modelle: 30B-A3B und 235B-A22B. Qwen3-30B-A3B läuft mit Unsloth auf 30GB VRAM. Beim Fine-Tuning von MoE ist es wahrscheinlich keine gute Idee, die Router-Schicht feinabzustimmen, daher haben wir sie standardmäßig deaktiviert.
Qwen3-2507-4B-Notebooks für: Thinking und Instruct
Das 30B-A3B passt in 30GB VRAM, aber Ihnen könnten RAM oder Speicherplatz fehlen, da das vollständige 16-Bit-Modell heruntergeladen und für das QLoRA-Fine-Tuning unterwegs in 4-Bit konvertiert werden muss. Dies liegt an Problemen beim direkten Import von 4-Bit-BnB-MOE-Modellen. Das betrifft nur MOE-Modelle.
Wenn Sie die MOE-Modelle feinabstimmen, verwenden Sie bitte FastModel und nicht FastLanguageModel

Zuletzt aktualisiert
War das hilfreich?

