DeepSeek-V4 : comment l’exécuter localement
Exécutez DeepSeek-V4-Pro-0813 et DeepSeek-V4-Flash-0731 localement sur votre propre appareil !
DeepSeek-V4, DeepSeek-V4-Pro-0813, et DeepSeek-V4-Flash-0731 sont de nouveaux modèles à poids ouverts - la variante Flash possède 284B paramètres (13B actifs), tandis que V4-Pro en a 1.6T (49B actifs). V4-Pro-0813, sorti le 13 août, égalise les performances de Claude-4.8-Opus, tandis que V4-Flash-0731, sorti le 31 juillet, offre les meilleures performances de sa catégorie de taille et surpasse V4-Pro (Aperçu). Conçu pour les workflows de codage, agentiques et de chat avec une fenêtre de contexte de 1M, ce guide montre comment exécuter DeepSeek-V4-Flash-0731 localement à l'aide des GGUF dynamiques d'Unsloth et Unsloth Desktop.
Pour sans perte DeepSeek, utilisez Q8 (UD-Q8_K_XL), qui n'est que 7 Go plus volumineux que Q4 (UD-Q4_K_XL). Le GGUF 8 bits sans perte fait 162 Go et le 3 bits fait 103 Go qui peut s'exécuter sur un appareil avec 110 Go de RAM appareil. DeepSeek-V4-Flash-0731 obtient 82,7 % sur Terminal Bench 2.1, 54,4 % sur DeepSWE et 54,2 % sur NL2Repo. DSpark est également activé pour les GGUF, permettant jusqu'à une vitesse de décodage 2x plus rapide!
13 août : DeepSeek-V4-Pro-0813 a été publié et les quants sont maintenant disponibles à l'exécution.
6 août : DSpark est activé pour DeepSeek-V4-Flash-0731 - permettant une inférence 1,5x à 1,9x plus rapide ! DSpark est automatiquement activé dans Unsloth.
Nous avons également amélioré le modèle Jinja de chat DeepSeek-V4, et l'avons testé sur plus de 4000 conversations pour qu'il soit équivalent à la base de référence officielle.
Guide d'utilisationTutoriels d'exécution
📊 Analyse de la quantification
Notre UD-Q8_K_XL quantification est entièrement sans perte. DeepSeek-V4-Flash est entraîné en tenant compte de la quantification: le point de contrôle officiel stocke ses experts routés (96 % du modèle) nativement en MXFP4 et tout le reste en FP8 ou BF16. Le MXFP4 de GGUF correspond exactement à ce format, donc nous réempaquetons les experts bit pour bit, et FP8 se déquantifie en BF16 sans arrondi. Nous avons vérifié chaque tenseur par rapport aux poids officiels de DeepSeek : les 1 328 sont tous identiques bit à bit, et cela reste sans perte à l'inférence (divergence KL ~0, accord à 100 % sur le top token).
Non-Unsloth Les GGUF DeepSeek-V4-Flash ont été convertis sans ces chemins, s'écartant ainsi des poids officiels. UD-Q4_K_XL conserve les mêmes experts identiques au bit près et ne quantifie que les tenseurs non experts (4 % du modèle) en Q8_0, ce qui le place juste à côté de Q8 en taille et en qualité.


Mesurées par rapport aux poids officiels, les deux quantifications Unsloth se situent sur la frontière qualité/taille. UD-Q8_K_XL est le seul point sans perte. UD-Q4_K_XL correspond aux autres formats MXFP4 communautaires et est plus précis que les conversions Q4_K-experts, qui sont plus volumineuses mais atteignent 0,029 KLD.

La répartition des erreurs par couche montre pourquoi. Conserver les experts MXFP4 natifs signifie 0 % d'erreur de poids à chaque couche. Les conversions qui re-quantifient les experts en Q4_K ou IQ2_XXS arrondissent presque chaque poids : 5 % pour Q4_K, plus de 30 % pour IQ2_XXS.

Nous avons également constaté que l'utilisation de Q8_0 et F16 pour certains tenseurs n'est pas sans perte, et cela empire puisque le QAT a été appliqué par DeepSeek pour faire fonctionner correctement MXFP4 / FP8, nous avons donc dû les laisser directement en BF16. Utilisez donc UD-Q8_K_XL pour une véritable quantification sans perte, et UD-Q4_K_XL rétrograde certains éléments BF16 en Q8_0.
Pour les tableaux complets des Benchmarks GGUF, voir ici.
💬 Améliorations du modèle de chat DeepSeek V4
Nous avons également amélioré le modèle Jinja de chat DeepSeek-V4, et l'avons testé sur plus de 4000 conversations pour qu'il soit équivalent à la référence dorée (DS4 officiel)
Nous avons ajouté reasoning_effort et vous pouvez choisir max, high tout comme le DeepSeek-V4 officiel. Nous préfixons l'invite système correcte conformément à DS4, et avons suivi le style de gpt-oss.
Et pour les appels d'outils, reasoning_content a été conservé pour DS4, mais le modèle de chat Jinja les exclurait. Nous l'avons réajouté.
Désactiver la réflexion, modifier l'effort de raisonnement
DeepSeek-V4 utilise le raisonnement par défaut. Il prend également en charge des niveaux d'effort de raisonnement où reasoning_effort peut être "high", "max" ou désactivé.
Pour désactiver la réflexion, utilisez --chat-template-kwargs '{"enable_thinking":false}'. Si vous êtes sur Windows PowerShell, utilisez : --chat-template-kwargs "{\"enable_thinking\":false}"
Vous pouvez également utiliser --reasoning on ou --reasoning off dans llama.cpp également désormais !
Pour personnaliser l'effort de raisonnement ou désactiver le raisonnement, utilisez les exemples ci-dessous :
⚙️ Guide d'utilisation
DeepSeek-V4-Flash est plus petit et plus rapide que DeepSeek-V4-Pro, avec 284B paramètres (13B actifs), et une fenêtre de contexte de 1M. Le modèle a 3 modes, Sans réflexion, Réfléchir Élevé et Réfléchir Max.
Il est recommandé d'utiliser UD-IQ3_XXS qui est 103 Go pour obtenir les meilleurs résultats. Comme la taille du fichier n'inclut pas le cache KV ni l'allocation du contexte, essayez d'avoir au moins appareil avec 110 Go de RAM pour exécuter le modèle.
Le UD-Q8_K_XL quantification est DeepSeek-V4-Flash en précision d'origine complète. Sa taille est de 162 Go et il vaut mieux disposer d'au moins 169 Go de RAM/VRAM disponibles.
Tableau : Exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
Standard
92 Go
102 Go
110-135 Go
162 Go
169 Go
DSpark
102 Go
112 Go
120-145 Go
172 Go
179 Go
DSpark utilise plus de VRAM que le standard, prévoyez donc ~10 Go de marge supplémentaire en RAM/VRAM.
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse confortablement la taille du fichier du modèle quantifié.
Paramètres recommandés
DeepSeek recommande ces paramètres pour obtenir les meilleures performances : temperature = 1.0, top-p = 1.0. Pour DeepSeek-V4-Flash-0731 et les scénarios agentiques, top-p = 0.95 est suggéré à la place et top-p = 1.0 pour les autres tâches.
Think High est activé par défaut. S'il est désactivé, vous pouvez l'activer via : --chat-template-kwargs '{"enable_thinking":true}' ou le basculer via le menu déroulant de l'interface dans Unsloth. Voir aussi DeepSeek-V4-Flash-0731
temperature = 1.0
top-p = 1.0
top-p = 0.95 (agentique uniquement)
temperature = 1.0
top-p = 1.0
Fenêtre de contexte maximale :
1,048,576Pour Think Max, réglez le contexte à au moins 384K tokens.
Exécuter les tutoriels DeepSeek-V4-Flash :
Pour ce tutoriel, nous utiliserons la quantification 3 bits UD-IQ3_XXS, car elle tient sur un appareil avec 128 Go de RAM. Remplacez UD-IQ3_XXS par UD-Q8_K_XL (qualité d'origine) ou une autre quantification si votre machine dispose de suffisamment de mémoire. Vous pouvez maintenant exécuter DeepSeek-V4-Flash-0731 dans Unsloth Desktop . DSpark est automatiquement activé dans Unsloth.
🦥 Guide Unsloth🦙 Guide Llama.cpp⚡ Guide DSpark
🦥 Guide Unsloth
DeepSeek-V4-Flash-0731 peut désormais être exécuté et entraîné dans Unsloth, notre nouvelle interface open source pour l'IA locale. Unsloth Desktop vous permet d'exécuter des modèles localement sur macOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide CPU + GPU via llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
La façon la plus simple de commencer est de télécharger l'application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez installer manuellement :
macOS, Linux, WSL :
PowerShell Windows :
Rechercher et télécharger DeepSeek-V4-Flash
Allez à Unsloth Chat ou Model hub et recherchez DeepSeek-V4-Flash dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter DeepSeek-V4-Flash-0731
Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth, cependant vous pouvez toujours les modifier manuellement. Comme Think High est activé par défaut, vous pouvez utiliser le menu déroulant de droite pour le basculer en Sans réflexion ou Think Max. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d'autres paramètres. DSpark est automatiquement activé dans Unsloth.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

🦙 Guide Llama.cpp
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité comme IQ3_XXS. Utilisez également export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, donc il vaut probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET
Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --ctx-size 32768 pour la longueur du contexte, --n-gpu-layers 2 pour le déchargement GPU du nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le également si vous n'avez qu'une inférence CPU.
⚡DSpark - Décodage spéculatif
DeepSeek-V4-Flash-0731 dispose de DSpark natif, ce qui permet une vitesse de décodage 2x plus rapide! DSpark est un nouvel algorithme de DeepSeek, supérieur au MTP naïf, et a été introduit dans cet article. DSpark permet à DeepSeek-V4-Flash d'atteindre 120 tokens/s sur un GPU B200, contre la base initiale de 60 tokens/s. DSpark est automatiquement activé dans l Unsloth interface locale.
Llama.cpp a intégré DSpark dans le cadre de PR 25784 avec d'autres améliorations pour le multi-GPU et plus encore. Nous montrons l'utilisation de --spec-draft-n-max 3 comme bon réglage par défaut, permettant une vitesse d'inférence 1,9x plus rapide. Les valeurs plus élevées semblent être plus lentes.

Téléchargez à la fois le drafter et le GGUF - nous en avons créé deux en Q8_0 et un en BF16 sans perte. Notez que DSpark nécessitera ~10 Go de mémoire supplémentaire, donc les machines de 128 Go auront besoin de IQ3_XXS et Q8_0
Chargez ensuite via llama-cli ou llama-server :
Benchmarks tirés de l'article original sur DSpark montrant également ses performances face à MTP :

📊 Benchmarks
Benchmarks GGUF
Voir ci-dessous un tableau comparant les benchmarks des quants d'Unsloth et d'autres fournisseurs. Référence = poids officiels. Perplexité et divergence KL sur wikitext-2 à ctx 512 sur 4x B200.

Officiel (référence)
156.4
4.5319
0
0%
100%
100%
Unsloth UD-Q8_K_XL
161.9
4.5319
~0 (sans perte)
0.000%
100.000%
100.000%
Unsloth UD-Q4_K_XL
155.1
4.5335
0.0102
3.40%
96.28%
97.46%
bartowski MXFP4
156.0
4.5351
0.0105
3.42%
96.18%
97.57%
antirez Q4KExperts-F16 (imatrix)
164.6
4.5743
0.0291
5.87%
93.95%
0.51%
antirez Q4KExperts-F16
164.6
4.5726
0.0290
5.89%
93.94%
0.93%
antirez mixed L37-42-Q4K (imatrix)
97.6
5.8169
0.3605
21.15%
79.74%
0.41%
antirez IQ2XXS (imatrix)
86.7
6.0808
0.4079
22.23%
78.15%
0.39%
antirez IQ2XXS
86.7
6.1518
0.4207
22.74%
77.92%
0.47%
Benchmarks officiels
DeepSeek-V4-Flash-0731 surpasse DeepSeek-V4-Pro (Aperçu) sur les benchmarks ci-dessous malgré un nombre bien moindre de paramètres activés, et reste compétitif face aux principaux modèles propriétaires.
Terminal Bench 2.1
82.7
61.8
72.1
81.0
85.0
NL2Repo
54.2
39.4
38.5
48.9
69.7
Cybergym
76.7
38.7
52.7
-
83.1
DeepSWE
54.4
7.3
12.8
46.2
58.0
Toolathlon-Verified
70.3
49.7
55.9
59.9
76.2
Agents' Last Exam
25.2
15.8
16.5
23.8
25.7
AutomationBench Public
25.1
10.8
12.8
12.9
27.2
DSBench-FullStack †
68.7
37.0
41.8
61.8
71.6
DSBench-Hard †
59.6
25.8
31.1
54.5
71.7
Mis à jour
Ce contenu vous a-t-il été utile ?

