For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌠Qwen3-Coder-Next: So lokal ausführen

Leitfaden zum lokalen Ausführen von Qwen3-Coder-Next auf deinem Gerät!

Qwen veröffentlicht Qwen3-Coder-Next, ein 80B-MoE-Modell (3B aktive Parameter) mit 256K-Kontext für schnelles agentisches Programmieren und lokale Nutzung. Es ist vergleichbar mit der Leistung von Modellen mit 10–20× mehr aktiven Parametern.

Es läuft auf 46 GB RAM/VRAM/unified memory (85 GB für 8-Bit), ist nicht-deduktiv für extrem schnelle Code-Antworten. Das Modell glänzt bei Langzeit-Reasoning, komplexer Werkzeugnutzung und der Wiederherstellung nach Ausführungsfehlern.

Du lernst außerdem, das Modell auf Codex & Claude Code auszuführen. Für Fine-Tuning, Qwen3-Next-Coder passt auf eine einzelne B200-GPU für bf16 LoRA in Unsloth.

Qwen3-Coder-Next Unsloth Dynamic GGUFs auszuführen: unsloth/Qwen3-Coder-Next-GGUF

GGUF-Tutorial ausführenCodex & Claude CodeFP8-vLLM-Tutorial

⚙️ Nutzungsanleitung

Keine 46 GB RAM oder Unified Memory? Keine Sorge, du kannst unsere kleineren Quants wie 3-Bit ausführen. Am besten ist es, wenn die Modellgröße = zur Summe deiner Rechenressourcen ( Speicherplatz + RAM + VRAM ≥ Größe des Quants). Wenn dein Quant vollständig auf dein Gerät passt, erwarte 20+ Tokens/s. Wenn nicht, funktioniert es trotzdem per Offloading, wird aber langsamer sein.

Um optimale Leistung zu erreichen, empfiehlt Qwen diese Einstellungen:

  • Temperatur = 1.0

  • Top_P = 0.95

  • Top_K = 40

  • Min_P = 0.01 (llama.cpps Standardwert ist 0.05)

  • Wiederholungsstrafe = deaktiviert oder 1.0

Unterstützt bis zu 262,144 Kontext nativ, aber du kannst ihn einstellen auf 32,768 Tokens für geringeren Speicherverbrauch.

🖥️ Qwen3-Coder-Next ausführen

Je nach Anwendungsfall musst du unterschiedliche Einstellungen verwenden. Da dieser Leitfaden 4-Bit verwendet, benötigst du etwa 46 GB RAM/Unified Memory. Wir empfehlen, mindestens 3-Bit-Präzision für die beste Leistung zu verwenden.

🦥 Unsloth Studio-Anleitung

Qwen3-Coder-Next kann ausgeführt und feinabgestimmt werden in Unsloth Studiounserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Führen Sie dies in Ihrem Terminal aus:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://localhost:8888 in Ihrem Browser.

3

Qwen3-Coder-Next suchen und herunterladen

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern und dich später erneut anzumelden. Anschließend siehst du einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Du kannst ihn jederzeit überspringen und direkt zum Chat gehen.

Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach Qwen3-Coder-Next in der Suchleiste und lade das gewünschte Modell und den gewünschten Quant herunter.

4

Qwen3-Coder-Next ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

Llama.cpp-Tutorial (GGUF):

Anweisungen für die Ausführung in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Du kannst direkt von Hugging Face ziehen. Du kannst den Kontext auf 256K erhöhen, wenn dein RAM/VRAM dafür ausreicht. Die Verwendung von --fit on wird auch automatisch die Kontextlänge bestimmen.

Du kannst die empfohlenen Parameter verwenden: temperature=1.0, top_p=0.95, top_k=40

3

Laden Sie das Modell über herunter (nach der Installation von pip install huggingface_hub). Sie können UD-Q4_K_XL oder andere quantisierte Versionen. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Konversationsmodus aus:

Passen Sie außerdem das Kontextfenster bei Bedarf, bis zu 262,144

HINWEIS: Dieses Modell unterstützt nur den Nicht-Denkmodus und erzeugt keine <think></think> Blöcke in seiner Ausgabe. Daher ist das Angeben von enable_thinking=False nicht mehr erforderlich.

🦙 Llama-Server-Bereitstellung & Deployment

Um Qwen3-Coder-Next produktiv bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. via tmux. Dann stelle das Modell bereit mit:

Dann in einem neuen Terminal, nach dem Ausführen von pip install openai, können wir das Modell ausführen:

Das gibt Folgendes aus:

Wir haben das HTML extrahiert und ausgeführt, und das beispielhafte Flappy-Bird-Spiel, das es erzeugte, funktionierte gut!

👾 OpenAI Codex & Claude Code

Um das Modell über lokale agentische Coding-Workloads auszuführen, kannst du unserer Anleitung folgen. Verwende den llama-server die wir gerade eingerichtet haben, und setze den Modellnamen auf die exakte ID, die sie unter GET /v1/models (den --alias oben stehenden Wert, unsloth/Qwen3-Coder-Next). Folge den korrekten Qwen3-Coder-Next-Parametern und Nutzungshinweisen.

Nachdem du beispielsweise die Anweisungen für Claude Code befolgt hast, wirst du sehen:

Dann können wir beispielsweise fragen Erstelle ein Schachspiel in Python :

Wenn Sie API-Fehler: 400 {"error":{"code":400,"message":"request (16582 tokens) exceeds the available context size (16384 tokens), try increasing it","type":"exceed_context_size_error","n_prompt_tokens":16582,"n_ctx":16384}} das bedeutet, dass du die Kontextlänge erhöhen musst oder siehe Qwen3-Coder-Next

🎱 FP8 Qwen3-Coder-Next in vLLM

Du kannst jetzt unsere neue FP8-Dynamic-Quant des Modells für Premium- und schnelle Inferenz verwenden. Installiere zuerst vLLM aus nightly. Ändere --extra-index-url https://wheels.vllm.ai/nightly/cu130 auf deine CUDA-Version, gefunden mit nvidia-smi - nur cu129 und cu130 werden derzeit unterstützt.

Dann bereitstellen Unsloths dynamische FP8-Version des Modells. Du kannst FP8 auch aktivieren, um die KV-Cache-Speichernutzung um 50% zu reduzieren, indem du --kv-cache-dtype fp8 Wir haben es auf 4 GPUs bereitgestellt, aber wenn du 1 GPU hast, verwende CUDA_VISIBLE_DEVICES='0' und setze --tensor-parallel-size 1 oder entferne dieses Argument. Verwende tmux um das Folgende in einem neuen Terminal zu starten, dann STRG+B+D - verwende tmux attach-session -t0 um wieder dorthin zurückzukehren.

Du solltest etwas wie unten sehen. Siehe Qwen3-Coder-Next für die tatsächliche Verwendung von Qwen3-Coder-Next über die OpenAI API und Tool-Calling - das funktioniert für vLLM und llama-server.

🔧Tool-Calling mit Qwen3-Coder-Next

In einem neuen Terminal erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:

Dann verwenden wir die folgenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:

Im Folgenden zeigen wir mehrere Methoden zur Ausführung von Tool-Calling für viele verschiedene Anwendungsfälle:

Generierten Python-Code ausführen

Beliebige Terminalfunktionen ausführen

Wir bestätigen, dass die Datei erstellt wurde, und das wurde sie!

Siehe Tool Calling Guide für weitere Beispiele für Tool-Calling.

📐Benchmarks

GGUF-Quantisierungs-Benchmarks

Hier sind einige Quantisierungs-Benchmarks, die von unabhängigen Gutachtern durchgeführt wurden.

Aider-Polyglot-Benchmarks
Benjamine Marie Benchmarks (Quelle)

Die Benchmarks wurden von unabhängigen Mitwirkenden auf dem Aider-Polyglot-Server durchgeführt und vergleichen Unsloth-GGUF-Quantisierungen im Aider-Polyglot-Benchmark (Score vs. VRAM). Bemerkenswert ist, dass die 3-Bit- UD-IQ3_XXS Quantisierung kommt nahe an BF16 Leistung heran, was 3-Bit zu einem sinnvollen Minimum für die meisten Anwendungsfälle macht.

NVFP4 schneidet geringfügig besser ab als die BF16-Referenz, was aufgrund der begrenzten Anzahl an Durchläufen Sampling-Rauschen sein könnte; das Gesamtmuster für: 1-Bit → 2-Bit → 3-Bit → 6-Bit das sich stetig verbessert, deutet darauf hin, dass der Benchmark aussagekräftige Qualitätsunterschiede zwischen Unsloth-GGUFs erfasst. Die nicht-Unsloth FP8 scheint schlechter abzuschneiden als beide UD-IQ3_XXS und UD-Q6_K_XL, was Unterschiede in der Quantisierungspipeline oder wiederum unzureichendes Sampling widerspiegeln könnte.

Benjamin Marie (Drittanbieter) benchmarkte Qwen3-Coder-Next unter Verwendung von Unsloth- und Qwen-GGUFs auf einem 750-Prompt-Mischsuite (LiveCodeBench v6, MMLU Pro, GPQA, Math500), wobei sowohl Gesamtgenauigkeit und relative Fehlerzunahme (wie viel häufiger das quantisierte Modell im Vergleich zum Original Fehler macht).

Die Grafiken zeigen deutlich, dass die Q4_K_M-Quantisierungen von Unsloth besser abschneiden als standardmäßige Q4_K_M. Q3_K_M schneidet erwartungsgemäß auf Live Code Bench v6 schlechter ab, aber überraschenderweise auf HumanEval deutlich besser als standardmäßige Q4_K_M. Es scheint mit der höchsten Effizienz zu laufen; mindestens Q4_K_M zu verwenden, wird empfohlen.

Qwen3-Coder-Next-Benchmarks

Qwen3-Coder-Next ist das leistungsstärkste Modell seiner Größe, und seine Leistung ist vergleichbar mit Modellen, die 10–20× mehr aktive Parameter haben.

Benchmark
Qwen3-Coder-Next (80B)
DeepSeek-V3.2 (671B)
GLM-4.7 (358B)
MiniMax M2.1 (229B)

SWE-Bench Verified (mit SWE-Agent)

70.6

70.2

74.2

74.8

SWE-Bench Multilingual (mit SWE-Agent)

62.8

62.3

63.7

66.2

SWE-Bench Pro (mit SWE-Agent)

44.3

40.9

40.6

34.6

Terminal-Bench 2.0 (mit Terminus-2-JSON)

36.2

39.3

37.1

32.6

Aider

66.2

69.9

52.1

61.0

Zuletzt aktualisiert

War das hilfreich?