🌠Qwen3-Coder-Next : comment l’exécuter localement
Guide pour exécuter Qwen3-Coder-Next localement sur votre appareil !
Qwen lance Qwen3-Coder-Next, un modèle MoE 80B (3B de paramètres actifs) avec contexte de 256K pour un codage agentique rapide et une utilisation locale. Il est comparable aux performances de modèles avec 10 à 20 fois plus de paramètres actifs.
Il fonctionne avec 46 Go de RAM/VRAM/mémoire unifiée (85 Go pour 8 bits), est sans raisonnement pour des réponses de code ultra-rapides. Le modèle excelle dans le raisonnement à long horizon, l'utilisation complexe d'outils et la récupération après des échecs d'exécution.
Mise à jour du 19 févr.: l'appel d'outils devrait maintenant être encore meilleur après les corrections d'analyse de llama.cpp.
NOUVEAU ! Voir benchmarks de quantification pour nos Dynamic GGUF !
4 févr. : llama.cpp corrigé un bug qui rectifie le calcul pour key_gdiff vectorisé. Cela corrige les problèmes précédents de boucle et de sortie. Nous avons mis à jour les GGUF - veuillez retélécharger et MISE À JOUR llama.cpp pour de meilleures sorties.
Vous apprendrez également à exécuter le modèle sur Codex et Claude Code. Pour ajustement fin, Qwen3-Next-Coder tient sur un seul GPU B200 pour du LoRA bf16 dans Unsloth.
Unsloth Qwen3-Coder-Next Dynamic GGUF à exécuter : unsloth/Qwen3-Coder-Next-GGUF
Tutoriel d'exécution GGUFCodex et Claude CodeTutoriel FP8 vLLM
⚙️ Guide d'utilisation
Vous n'avez pas 46 Go de RAM ou de mémoire unifiée ? Pas de souci, vous pouvez exécuter nos quants plus petits comme le 3 bits. Il est préférable que la taille du modèle soit = à la somme de vos ressources ( espace disque + RAM + VRAM ≥ taille du quant). Si votre quant tient entièrement sur votre appareil, attendez-vous à 20+ jetons/s. S'il ne tient pas, il fonctionnera quand même en déchargeant des éléments, mais ce sera plus lent.
Pour obtenir des performances optimales, Qwen recommande ces réglages :
Température = 1.0Top_P = 0.95Top_K = 40Min_P = 0.01(la valeur par défaut de llama.cpp est 0.05)pénalité de répétition= désactivée ou 1.0
Prend en charge jusqu'à 262,144 de contexte en natif, mais vous pouvez le définir à 32,768 jetons pour réduire l'utilisation de la mémoire.
🖥️ Exécuter Qwen3-Coder-Next
Selon votre cas d'utilisation, vous devrez utiliser différents réglages. Comme ce guide utilise du 4 bits, vous aurez besoin d'environ 46 Go de RAM/mémoire unifiée. Nous recommandons d'utiliser au moins une précision 3 bits pour de meilleures performances.
🦥 Guide d'Unsloth Studio
Qwen3-Coder-Next peut être exécuté et ajusté dans Unsloth Studio, notre nouvelle interface web open source pour l’IA locale. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
Exécutez dans votre terminal :
macOS, Linux, WSL :
Windows PowerShell :
L'installation sera rapide et prendra environ 1 à 2 minutes.
Lancer Unsloth
MacOS, Linux, WSL et Windows :
Puis ouvrez http://localhost:8888 dans votre navigateur.
Rechercher et télécharger Qwen3-Coder-Next
Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Vous verrez ensuite un bref assistant d'intégration pour choisir un modèle, un jeu de données et des paramètres de base. Vous pouvez l'ignorer à tout moment et aller directement au chat.
Puis allez dans l’onglet Unsloth Chat onglet et recherchez Qwen3-Coder-Next dans la barre de recherche et téléchargez le modèle et le quant de votre choix.

Exécuter Qwen3-Coder-Next
Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

Tutoriel Llama.cpp (GGUF) :
Instructions pour l'exécution dans llama.cpp (notez que nous utiliserons 4 bits pour tenir sur la plupart des appareils) :
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Vous pouvez directement le récupérer depuis Hugging Face. Vous pouvez augmenter le contexte à 256K si votre RAM/VRAM peut le contenir. L'utilisation de --fit on déterminera également automatiquement la longueur du contexte.
Vous pouvez utiliser les paramètres recommandés : temperature=1.0, top_p=0.95, top_k=40
Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d'autres versions quantifiées. Si les téléchargements restent bloqués, voir Dépannage de Hugging Face Hub et XET
Ensuite, exécutez le modèle en mode conversation :
Ajustez également la fenêtre de contexte si nécessaire, jusqu'à 262,144
REMARQUE : Ce modèle ne prend en charge que le mode sans réflexion et ne génère pas <think></think> de blocs dans sa sortie. Donc préciser enable_thinking=False n'est plus nécessaire.
🦙 Diffusion et déploiement de Llama-server
Pour déployer Qwen3-Coder-Next en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux. Puis, déployez le modèle via :
Puis dans un nouveau terminal, après avoir fait pip install openai, nous pouvons exécuter le modèle :
Ce qui produira :
Nous avons extrait le HTML et l'avons exécuté, et l'exemple de jeu Flappy Bird qu'il a généré a bien fonctionné !

👾 OpenAI Codex et Claude Code
Pour exécuter le modèle via des charges de travail agentiques de codage locales, vous pouvez suivre notre guide. Utilisez la llama-server que nous venons de configurer à l’instant, et définissez le nom du modèle sur l’identifiant exact qu’il renvoie à GET /v1/models (la --alias valeur ci-dessus, unsloth/Qwen3-Coder-Next). Suivez les paramètres et les instructions d'utilisation corrects de Qwen3-Coder-Next.
Après avoir suivi les instructions pour Claude Code, par exemple, vous verrez :

Nous pouvons alors demander par exemple Créer un jeu d’échecs en Python :



Si vous voyez Erreur API : 400 {"error":{"code":400,"message":"la requête (16582 jetons) dépasse la taille de contexte disponible (16384 jetons), essayez de l'augmenter","type":"exceed_context_size_error","n_prompt_tokens":16582,"n_ctx":16384}} cela signifie que vous devez augmenter la longueur du contexte ou voir Qwen3-Coder-Next

🎱 FP8 Qwen3-Coder-Next dans vLLM
Vous pouvez maintenant utiliser notre nouveau quant FP8 dynamique du modèle pour une inférence premium et rapide. Installez d'abord vLLM depuis la version nightly. Changez --extra-index-url https://wheels.vllm.ai/nightly/cu130 à votre version de CUDA trouvée via nvidia-smi - uniquement cu129 et cu130 sont actuellement pris en charge.
Si vous utilisez vLLM / SGLang, essayez nos quants FP8 dynamiques, qui peuvent augmenter le débit de 25 % ou plus ! Voir Qwen3-Coder-Next
Puis servez la version FP8 dynamique d'Unsloth du modèle. Vous pouvez également activer FP8 pour réduire de 50 % l'utilisation de la mémoire du cache KV en ajoutant --kv-cache-dtype fp8 Nous l'avons servi sur 4 GPU, mais si vous n'avez qu'un seul GPU, utilisez CUDA_VISIBLE_DEVICES='0' et définissez --tensor-parallel-size 1 ou supprimez cet argument. Utilisez tmux pour lancer ce qui suit dans un nouveau terminal puis CTRL+B+D - utilisez tmux attach-session -t0 pour y revenir.
Vous devriez voir quelque chose comme ci-dessous. Voir Qwen3-Coder-Next pour savoir comment utiliser réellement Qwen3-Coder-Next avec l'API OpenAI et l'appel d'outils - cela fonctionne pour vLLM et llama-server.

🔧Appel d'outils avec Qwen3-Coder-Next
Dans un nouveau terminal, nous créons quelques outils comme additionner 2 nombres, exécuter du code Python, exécuter des fonctions Linux et bien plus encore :
Nous utilisons ensuite les fonctions ci-dessous (copier-coller et exécuter), qui analyseront automatiquement les appels de fonction et appelleront le point de terminaison OpenAI pour n'importe quel modèle :
Nous allons maintenant présenter ci-dessous plusieurs méthodes d’exécution de l’appel d’outils pour de nombreux cas d’usage différents :
Exécuter le code Python généré

Exécuter des fonctions de terminal arbitraires
Nous confirmons que le fichier a été créé, et c’est bien le cas !

Voir Tool Calling Guide pour plus d’exemples d’appel d’outils.
📐Benchmarks
Benchmarks de quantification GGUF
Voici quelques benchmarks de quantification réalisés par des évaluateurs tiers.


Les benchmarks ont été exécutés par des contributeurs tiers sur le serveur Aider Polyglot, comparant les quantifications GGUF d’Unsloth sur le benchmark Aider Polyglot (score vs. VRAM). À noter, la quantification 3 bits UD-IQ3_XXS se rapproche de BF16 les performances, ce qui fait que 3 bits constituent un minimum raisonnable pour la plupart des cas d’usage.
NVFP4 surpasse légèrement la référence BF16, ce qui peut être du bruit d’échantillonnage en raison du nombre limité d’exécutions ; cependant, la tendance globale pour : 1-bit → 2-bit → 3-bit → 6-bit en s’améliorant régulièrement, suggère que le benchmark capture des différences de qualité significatives entre les GGUF d’Unsloth. Le non-Unsloth FP8 semble moins bien performer que les deux UD-IQ3_XXS et UD-Q6_K_XL, ce qui pourrait refléter des différences dans la chaîne de quantification ou, là encore, un échantillonnage insuffisant.
Benjamin Marie (tiers) a évalué Qwen3-Coder-Next en utilisant Unsloth et des GGUF Qwen sur un suite mixte de 750 invites (LiveCodeBench v6, MMLU Pro, GPQA, Math500), en rapportant à la fois la précision globale et l'augmentation relative de l'erreur (à quelle fréquence le modèle quantifié fait des erreurs par rapport à l'original).
Les graphiques montrent clairement que les quantifications Q4_K_M d’Unsloth obtiennent de meilleurs résultats que le Q4_K_M standard. Comme prévu, Q3_K_M obtient de moins bons résultats sur Live Code Bench v6, mais, contre toute attente, bien meilleurs sur HumanEval que le Q4_K_M standard. Il semble fonctionner avec la plus grande efficacité ; il est conseillé d’utiliser au moins Q4_K_M.
Benchmarks Qwen3-Coder-Next
Qwen3-Coder-Next est le modèle le plus performant pour sa taille, et ses performances sont comparables à celles de modèles ayant 10–20× plus de paramètres actifs.
SWE-Bench Verified (avec SWE-Agent)
70.6
70.2
74.2
74.8
SWE-Bench Multilingual (avec SWE-Agent)
62.8
62.3
63.7
66.2
SWE-Bench Pro (avec SWE-Agent)
44.3
40.9
40.6
34.6
Terminal-Bench 2.0 (avec Terminus-2 json)
36.2
39.3
37.1
32.6
Aider
66.2
69.9
52.1
61.0



Mis à jour
Ce contenu vous a-t-il été utile ?

