For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8 - Comment exécuter localement

Guide pour exécuter les quantifiés Qwen3.8, y compris Qwen3.8-27B, sur votre configuration locale.

Qwen3.8 est la nouvelle famille de modèles de Qwen, comprenant Qwen3.8-27B, Qwen3.8-2.4T-A95B et Qwen3.8-Max. Qwen3.8-27B possède vision et des capacités de raisonnement, une fenêtre de contexte de 256K et s'exécute localement sur des configurations avec 17 Go de RAM/VRAM Qwen3.8 excelle dans les tâches de codage agentique, de vision et de chat, et peut désormais s'exécuter via les GGUF Unsloth, NVFP4 et Unsloth Desktop. Qwen3.8-2.4T-A95B est un modèle de 2,4T paramètres (95B actifs) rivalisant avec GPT-5.6 Sol.

Guide pour exécuter Qwen3.8Télécharger Unsloth

Les GGUF Qwen3.8 utilisent Unsloth Dynamic V3.0 (aperçu) pour des performances de quantification de pointe. Merci à Qwen pour l'accès le jour zéro. Les quantifications Unsloth incluent aussi :

  • Prise en charge du rôle de développeur pour des outils agentiques comme Codex

  • MTP activé pour une inférence rapide

  • Appel d'outils : Analyse améliorée des objets imbriqués pour faire mieux réussir les outils

La version complète en précision totale de Qwen3.8-2.4T-A95B nécessite 4,9 To de stockage et du 1-bit Unsloth Les GGUF Dynamic prennent 397 Go (91 % plus petits), et le plus grand IQ1_S prend 508 Go.

Qwen3.8-27B dynamique 4 bits dans Unsloth Desktop

Quantifications Unsloth :

⚙️ Guide d'utilisation

Exigences pour Qwen3.8-27B :

Qwen3.8-27B Les quantifications 4 bits fonctionneront sur la plupart des appareils avec 17 à 19 Go de VRAM, comme la RTX 5080, la 4090 ou un Mac avec 24 Go de RAM. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

2 bits
3 bits
4 bits
6 bits
8 bits
BF16

11-13 Go

13-16 Go

17-19 Go

24 Go

31 Go

56 Go

Qwen3.8-2.4T Exigences :

Dynamic 1-bit XXXS
Dynamic 1-bit Standard
Dynamic 2 bits
Q8_0
BF16 (sans perte)

397 Go

508 Go

657 Go

2,6 To

4,9 To

Paramètres recommandés

Qwen3.8-Paramètres 27B :

Qwen3.8-27B est un modèle de raisonnement hybride modèle avec différents paramètres par défaut pour les modes de raisonnement et sans raisonnement. Extra high est activé par défaut, donc si vous voulez des traces de raisonnement plus courtes, vous pouvez ajuster l'effort de raisonnement:

Paramètre
Mode raisonnement
Mode Instruct (sans raisonnement)

température

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • Fenêtre de contexte maximale : 262,144 (peut être étendue à 1M via YaRN)

  • Mode raisonnement : temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Mode Instruct (ou sans raisonnement) : temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

Qwen3.8-Paramètres 2.4T :

Qwen3.8-2.4T est uniquement pour le raisonnement, tandis que Qwen3.8-Max est hybride.

Par défaut

temperature = 1.0

top_p = 0.95

top_k = 20

min_p = 0.0

presence_penalty = 0.0

  • Longueur de contexte = jusqu'à 1,010,000

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

Si le modèle tient, vous obtiendrez une génération d'environ 20 jetons/s avec des B200 et un débit supérieur à 120 jetons/s. La meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.

💡 Raisonnement + Conserver le raisonnement

Qwen3.8 possède Conserver le raisonnement qui conserve la trace de raisonnement de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations continues. Unsloth dispose des bascules « Think » et « Preserve Thinking » pour Qwen3.8 (voir à droite) :

Qwen3.8-27B est livré avec la prise en charge de reasoning_effort, qui peut être utilisée pour ajuster la profondeur du raisonnement et contrôler le coût. Ces bascules sont automatiquement activées dans Unsloth :

  • xhigh (par défaut) : pour les tâches complexes exigeant une analyse approfondie

  • medium: équilibre entre précision et vitesse

  • low: raisonnement efficace optimisé pour la vitesse et le coût

  • aucun

Guide pour exécuter Qwen3.8

Vous pouvez désormais exécuter Qwen3.8 dans llama.cpp et Unsloth Desktop. Pour le grand modèle Qwen3.8-2.T, nous utiliserons la quantification 397 Go IQ1_XXXS (nommée Q1_0) pour obtenir les meilleurs résultats en termes d'accessibilité et de précision, et elle nécessitera au moins 450 Go de RAM. N'hésitez pas à changer le type de quantification. GGUF : Qwen3.8-GGUF

Exécuter dans Unsloth DesktopExécuter dans llama.cppGuide NVFP4

🦥 Exécuter Qwen3.8 dans Unsloth Desktop

Qwen3.8 peut s'exécuter dans Unsloth Desktopune application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :

1

Installer Unsloth

La façon la plus simple de commencer est de télécharger l'application Unsloth Desktop. Fonctionne sur macOS, Windowset Linux.

Télécharger Unsloth

Ou, si vous préférez installer manuellement :

MacOS, Linux, WSL :

Windows PowerShell :

2

Rechercher et télécharger Qwen3.8

Allez à Unsloth Chat ou Model Hub et recherchez Qwen3.8 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter Qwen3.8

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

Par exemple, utiliser Unsloth Desktop avec le Qwen3.8 de 397 Go (-91 % plus petit) permet d'activer les modes de raisonnement, d'autoriser le canvas intégré, la recherche web et l'exécution de code, et bien plus encore.

GGUF dynamique 1 bit de Qwen3.8 2.4T, 397 Go, 91 % plus petit, dans Unsloth Desktop
4

Diffuser Qwen3.8 avec l'API Unsloth

Vous pouvez utiliser unsloth run la commande et diffuser Qwen3.8 via une API en utilisant llama-server les indicateurs d'exécution, notamment la taille du contexte, les couches GPU, le threading, l'échantillonnage, la mise en réseau et la configuration des outils. Pour plus d'infos, voir nos docs API.

5

Unsloth est maintenant prêt

Vous pouvez aussi faire beaucoup d'autres choses avec Qwen3.8 via Unsloth Desktop, comme :

Qwen3.8-2.4T-A95B Nouveaux types de données 1 bit

Nous avons étendu IQ1_S dans llama.cpp, qui est à 1,5625 bits par poids, à 1,1875 bpw en réduisant le nombre d'entrées dans le codebook - nous avons constaté que cela fonctionne bien pour les grands modèles, et peut toujours conserver beaucoup de précision - nous avons également constaté que ces nouveaux types de données conviennent bien à la quantification après entraînement (PTQ), sans avoir besoin de QAT ou de QAD (quantization aware training / distillation)

En raison de problèmes de nommage, nous avons utilisé TQ2_0, TQ1_0 et Q1_0, sinon cela n'apparaîtrait pas dans le dépôt HF.

Type de donnée
Nom
BPW
# d'entrées
Bits d'index
Bloc

IQ1_S

IQ1_S

1.5625

2048

11

50 B

UD-IQ1_XS

TQ2_0

1.4375

1024

10

46 B

UD-IQ1_XXS

TQ1_0

1.3125

512

9

42 B

UD-IQ1_XXXS

Q1_0

1.1875

256

8

38 B

Nous effectuons encore des benchmarks pour les nouveaux types de données, mais pour d'autres grands modèles, nous obtenons de bons résultats sans aucun QAT / QAD:

Type de donnée
GiB
PPL
KLD
top-p

IQ1_S

553.204

2.578876

0.564553

78.882

UD-IQ1_XS

513.583

2.931261

0.690161

75.726

UD-IQ1_XXS

473.961

3.540383

0.876007

71.284

UD-IQ1_XXXS

434.340

4.488796

1.109944

66.257

🦙 Exécuter Qwen3.8 dans llama.cpp

1

Nous devons utiliser la branche spécifique IQ1_XXXS ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Si vous voulez simplement exécuter la version standard IQ1_S et d'autres quantifications, compilez alors llama.cpp normalement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q1_0 pour IQ1_XXXS ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub et XET

Qwen3.8-27B :

Qwen3.8-2.4T :

4

Pour exécuter le modèle dans llama-cli, suivez les extraits de code ci-dessous : N'oubliez pas de modifier les paramètres selon votre cas d'utilisation.

Qwen3.8-27B :

Qwen3.8-2.4T :

5

Pour exécuter le UD-IQ1_S générique, vous pouvez faire :

Qwen3.8-2.4T :

6

Puis pour l'exécuter :

⚡️NVFP4

Comme pour Qwen3.6, nous publions aussi de nouvelles quantifications dynamiques NVFP4 de Qwen3.8-27B qui s'exécutent ~1,5× plus vite que les checkpoints BF16, avec de meilleures performances et des tailles de fichiers comparables. Exécutez Qwen3.8-27B NVFP4 1,5x plus rapide sur 24 Go de VRAM. Nous avons aussi ajouté l'étalonnage du cache KV en FP8 pour des longueurs de contexte 2x plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir Qwen3.8), GPU B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien ! Vous pouvez exécuter des quantifications NVFP4 dans vLLM pour l’instant seulement (SGLang n’est pas pris en charge).

lot
tokens/s totaux BF16
tokens/s totaux NVFP4
accélération
BF16 par utilisateur
NVFP4 par utilisateur

1

89.8

133.7

1.49x

89.8

133.7

8

649.4

938.8

1.45x

81.2

117.3

32

1983.0

2787.0

1.41x

62.0

87.1

64

3048.5

4407.2

1.45x

47.6

68.9

Voir ci-dessous les benchmarks précédents réalisés pour Qwen3.6, ainsi qu’une comparaison avec d’autres implémentations NVFP4 qui utilisent des activations 16 bits par rapport à nos activations NVFP4 :

Tous les benchmarks utilisent 1× B200 avec une concurrence de 128. Une concurrence plus élevée peut porter le 35B à 17 561 tokens/s.

Pour les benchmarks de précision, nous avons exécuté KLD et l’accord top-1 % sur le code, le chat et de nombreux domaines. NVFP4 permet de récupérer de manière constante 92 % à 97 % de précision par rapport au BF16

corpus
moyenne KLD
accord top-1

zh

0.01628

93.55%

code

0.02600

96.68%

refgen

0.03993

94.46%

chat

0.05818

92.15%

ja / ko / ru / es

0.0124-0.0155

94-95%

Pour les benchmarks de précision pour Qwen 3.6, nous avons mené MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 — nous montrons que nos quantifications plus rapides se comportent de manière similaire sur tous :

Pour plus d’informations, vous pouvez lire notre article de blog sur les quantifications dynamiques NVFP4.

Pour exécuter des quantifications NVFP4, voir ci-dessous les commandes pour exécuter Qwen3.8-27B dans vLLM ou SGLang:

vLLM :

Pour installer vLLM dans un environnement virtuel séparé :

Puis pour servir la variante 27B :

Pour activer le MTP / le décodage spéculatif (décodage plus rapide mais avec un débit un peu plus faible), utilisez :

Si vous rencontrez des problèmes avec Torchcodec, assurez-vous d’effectuer ce qui suit puis de relancer vllm.

SGLang :

SGLang n’est pas encore pris en charge, car nous quantifions le lm_head en FP8.

vLLM dispose d’un CompressedTensorsW8A8Fp8 noyau qui prend cela en charge, tandis que SGLang ne peut pas charger le lm_head FP8.

🤯Analyse de quantification

Nous avons exécuté le top-1 % et KLD pour les GGUF Qwen3.8, et nous conservons 82,5 % de précision (IQ2_XXS 9 Go) tout en étant 83,5 % plus petits (BF16 54,7 Go).

Les quantifications NVFP4 sont 1,5× plus rapides que le BF16 et conservent 92 à 97 % de précision top-1 %.

D’autres benchmarks arrivent bientôt !

📊 Benchmarks

Qwen3.8-27B

Voir plus bas pour les benchmarks en tableau :

Performances textuelles

Qwen3.8-27B
Qwen3.6-27B
Qwen3.7-Plus
Muse Glimmer-30B
Opus4.6 Max

Codage

Codage agentique en terminalTerminal Bench 2.1 (Terminus)

73.0

63.4

64.0

51.7

78.2

Codage agentiqueSWE-bench Pro

61.7

53.5

57.6

51.2

53.4

Génération de code au niveau du dépôtNL2Repo-Bench

42.3

36.2

41.1

--

47.6

Codage agentiqueDeepSWE 1.1

42.2

13.3

14.2

--

--

Génie logicielQwenSWEBench

79.0

49.3

59.2

--

63.8

Agent

Travail de bureau à long horizonCoWorkBench

70.7

61.0

65.1

--

68.2

Tâches professionnellesJobBench

33.4

21.8

27.6

--

--

Tâches agentiques de pointeAgents' Last Exam

Pass@120.4Score42.9

Pass@110,6Score27,3

Pass@113,2Score33,6

--

--

Général

Suivi d’instructionsIFBench

79.5

69.1

79.1

77.0

62.5

Raisonnement scientifiqueGPQA Diamond

89.2

87.8

90.3

83.5

91.3

Raisonnement pluridisciplinaireHLE

30.8

24.0

34.7

22.0

40.0

Codage compétitifLiveCodeBench v6

90.3

83.9

89.6

--

88.8

Qwen3.8-2.4T-A95B

Mis à jour

Ce contenu vous a-t-il été utile ?