Qwen3.8-Flash-Next : comment l'exécuter localement
Guide pour exécuter Qwen3.8-Flash-Next localement.
Qwen3.8-Flash-Next est un nouveau modèle à poids ouverts, à 125 milliards de paramètres un modèle multimodal MoE de Qwen. Construit sur la nouvelle architecture Qwen4, il prend en charge une fenêtre de contexte de 262K et un raisonnement avancé. Qwen3.8-Flash-Next surpasse Claude-4.6-Opus (Max) et peut s’exécuter localement sur des appareils avec 75 Go de RAM/mémoire unifiée sans nécessiter de VRAM GPU. Pour exécuter le modèle, utilisez nos GGUF via llama.cpp ou Unsloth Desktop. Merci à Qwen pour l’accès dès le premier jour.
Le 1 bit nécessite 75 Go et utilise du 4 bits pour le Ngram / PLE. C’est 79 % plus petit que BF16 (355 Go), et conserve une précision top-1 % de 80 %.
MTP est là ! Exécutez Qwen3.8-Flash 1,3 à 1,7x plus vite dans Unsloth Desktop!

⚙️ Guide d’utilisation
Que vous exécutiez Qwen3.8-Flash-Next sur un CPU avec de la RAM système ou sur un GPU avec de la VRAM peut faire une différence relativement faible. Son architecture unique permet une inférence utilisant la RAM ou la mémoire unifiée pour atteindre des performances plus proches de celles de la VRAM GPU que ce qui est habituel pour d’autres modèles. Cela le rend particulièrement adapté aux Mac, aux systèmes NVIDIA DGX Spark et à d’autres appareils dotés de grandes capacités mémoire.
Vous aurez besoin d’au moins 75 Go de RAM ou de mémoire unifiée pour exécuter le modèle. Sa plus petite version quantifiée en 1 bit est plus volumineuse que d’habitude en raison des nouvelles couches Ngram ou des embeddings par couche, qui ressemblent à une table de recherche. Cependant, cela signifie aussi que la quantification est moins agressive, ce qui permet au modèle de conserver davantage de sa précision d’origine que les modèles davantage quantifiés. Vous pouvez également décharger la couche PLE / Ngram sur SSD et utiliser mmap, ce qui permet de réduire l’utilisation de la VRAM CPU et GPU.
Exigences de Qwen3.8-Flash-Next :
La plus petite quantification fonctionne avec 75 Go de RAM, il est donc préférable d’avoir un appareil avec 96 Go de RAM/mémoire unifiée. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
75 Go
79 Go
90 Go
96-114 Go
163 Go
200 Go
355 Go
Paramètres recommandés
Qwen3.8-Flash-Next est un modèle à raisonnement hybride avec différents paramètres par défaut pour les modes de raisonnement et de non-raisonnement. Extra high est activé par défaut, donc si vous souhaitez des traces de raisonnement plus courtes, vous pouvez ajuster l’effort de raisonnement:
température
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
Longueur de contexte = jusqu’à
262,144Mode raisonnement :
température=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Mode Instruct (ou sans raisonnement) :
température=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
💡 Raisonnement + Préserver le raisonnement
Qwen3.8-Flash-Next dispose de Préserver le raisonnement qui conserve la trace de raisonnement de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations continues. Unsloth propose des bascules « Think » et « Preserved Thinking » pour Qwen3.8 (voir à droite) :

Qwen3.8-Flash-Next prend en charge reasoning_effort, qui peut être utilisé pour ajuster la profondeur du raisonnement et contrôler les coûts. Ces bascules sont automatiquement activées dans Unsloth :
xhigh(par défaut) : pour les tâches complexes nécessitant une analyse approfondiemedium: équilibre entre précision et vitesselow: raisonnement efficace optimisant la vitesse et le coûtnone
Pour modifier l’effort de raisonnement / réflexion dans ou llama-server, utilisez --chat-template-kwargs '{"reasoning_effort":"medium"}'
Si vous êtes sous Windows Powershell, utilisez : --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
Modifiez medium au niveau de raisonnement souhaité.
Analyse de la quantification
Nous avons exécuté KLD pour les quantifications de Qwen3.8-Flash, et montrons qu’une récupération de 80 % de la précision top-1 % est possible avec 79 % d’utilisation du disque en moins. La nouvelle architecture utilise des PLE / Ngrams, et ceux-ci ne sont pas quantifiés aussi fortement (minimum 4 bits) car ils ont un schéma d’accès aléatoire, et les quantifier fortement endommagera le modèle.


UD-IQ1_S
72.5
77.325
0.396070
7.2126
UD-IQ1_M
74.5
79.691
0.314739
6.1965
UD-Q2_K_XL
78.9
82.715
0.224607
4.9121
UD-IQ3_XXS
82.0
85.414
0.165120
4.0375
UD-Q3_K_XL
90.0
88.315
0.106504
3.0538
UD-IQ4_XS
93.7
89.554
0.083630
2.3677
UD-Q4_K_XL
111.3
92.255
0.046893
1.5468
UD-Q5_K_XL
158.3
93.680
0.030415
1.0036
UD-Q6_K_XL
169.2
94.089
0.027091
0.8416
Q8_0
188.2
94.122
0.026574
0.8118
Guide d’exécution de Qwen3.8-Flash-Next
Vous pouvez désormais exécuter Qwen3.8-Flash-Next dans Unsloth Desktop et llama.cpp. N’hésitez pas à changer le type de quantification.
Hugging Face : Qwen3.8-Flash-Next-GGUF
ModelScope : Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Next est maintenant disponible pour une exécution locale dans Unsloth Desktop!
🦥 Exécutez Qwen3.8-Flash-Next dans Unsloth
Qwen3.8-Flash-Next peut désormais s’exécuter dans Unsloth Desktop, une application UI open source pour l’IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF, des modèles MLX et safetensor
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique ajustement des paramètres (temp, top-p, etc.)
Inférence CPU + GPU rapide via MLX et llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
La manière la plus simple de commencer est de télécharger l’ application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez l’installation manuelle :
MacOS, Linux, WSL :
Windows PowerShell :
Rechercher et télécharger Qwen3.8-Flash-Next
Allez dans Unsloth Chat ou le hub de modèles et recherchez Qwen3.8-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Qwen3.8-Flash-Next
MTP est activé automatiquement, mais vous pouvez le désactiver. Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth.
Par exemple, utiliser Unsloth Desktop avec le Qwen3.8 de 397 Go (-91 % plus petit) vous permet d’activer les modes de raisonnement, d’autoriser le canevas intégré, la recherche web et l’exécution de code, et bien plus encore.

Servir Qwen3.8-Flash-Next avec l’API Unsloth
Vous pouvez utiliser dans la commande et servir Qwen3.8 via une API en utilisant llama-server des drapeaux d’exécution, y compris la taille du contexte, les couches GPU, le threading, l’échantillonnage, le réseau et la configuration des outils. Pour plus d’informations, voir nos docs API ou unsloth start.
Unsloth est maintenant prêt
Vous pouvez également faire beaucoup d’autres choses avec Qwen3.8-Flash-Next via Unsloth Desktop, comme :
Connecter des outils : , , , et plus encore
Entraîner des modèles : Affiner du texte, de la diffusion, l’encodage, et plus encore
Générer des médias : Créer et entraîner , de la vidéo, localement

🦙 Exécutez Qwen3.8-Flash-Next dans llama.cpp
Installez la dernière version de llama.cpp. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude - la prise en charge Metal est activée par défaut.
Pour exécuter le modèle, vous pouvez faire :
Puis pour l’exécuter :
Guide MTP
Qwen3.8-Flash peut fonctionner avec une inférence 1,3 à 1,7x plus rapide via MTP (prédiction multi-jetons) sans dégradation de précision ! MTP permet à Qwen3.8-Flash d’atteindre 170 jetons/s sur 1 GPU RTX 6000 PRO par rapport à la base de 100 jetons. MTP accélère l’inférence en permettant à un modèle de prédire plusieurs jetons à venir en même temps au lieu d’en générer un par étape, et est particulièrement efficace sur GPU.
Pour exécuter Qwen3.8-Flash avec MTP, MTP est activé par défaut dans Unsloth Desktop ou vous pouvez utiliser notre PR personnalisée pour llama.cpp.


Les gains sont plus faibles sur les appareils à bande passante mémoire plus réduite, comme les anciens Mac. Nous avons créé à la fois des modules MTP partagés (exclut les embed_tokens et les partage avec le modèle principal) afin d’économiser de l’espace disque ainsi que l’utilisation de la RAM et de la VRAM d’environ 1 à 2 Go.
BF16
7,77 Go
5,23 Go
2,54 Go
Q8_0
4,14 Go
2,79 Go
1,35 Go
Q4_K_M
2,79 Go
1,91 Go
880 Mo
La quantification MTP en 3 bits fonctionne avec 91 Go de RAM, il est donc préférable d’avoir un appareil avec 96 Go de RAM/mémoire unifiée. Tableau : exigences matérielles MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
76 Go
80 Go
91 Go
97-115 Go
164 Go
200 Go
355 Go
Exécuter MTP Qwen3.8-Flash
Pour exécuter Qwen3.8-Flash avec MTP, tout ce que vous avez à faire est installer Unsloth Desktop ou mettre à jour vers la dernière version d’Unsloth, puis retélécharger le modèle ou télécharger le fichier MTP. Voir plus bas pour les instructions llama.cpp.
Unsloth Desktop fonctionne sur macOS, Windows, et Linux.
Dans Unsloth Desktop, vous pouvez également modifier le nombre de jetons brouillons ou personnaliser MTP. Utilisez les paramètres avancés dans la barre latérale droite, puis activez « Advanced settings » et vous pourrez sélectionner le décodage spéculatif MTP / Ngram, le nombre de jetons brouillons et plus encore :

Guide MTP pour Llama.cpp
Puis pour télécharger le module MTP partagé :
Et pour l’utiliser avec llama-server :
📊 Benchmarks
Pour les benchmarks de quantification GGUF, vous pouvez voir ci-dessus notre analyse de la quantification ou article Dynamic V3.0.


Mis à jour
Ce contenu vous a-t-il été utile ?

