🌘Kimi K3 - Comment l’exécuter localement
Guide pour exécuter les quants Kimi K3 sur votre configuration locale.
Kimi K3 de Moonshot AI est un modèle à poids ouverts de 2,8 T de paramètres (104 B actifs) conçu pour des charges de travail de codage, agentiques, à long contexte et de chat de pointe. C’est le modèle ouvert le plus puissant à ce jour, rivalisant avec Claude 4.8 Opus et GPT-5.6. Kimi K3 dispose d’une vision native, d’une fenêtre de contexte d’un million de jetons et utilise MXFP4. L’inférence en pleine précision nécessite 1,56 To de stockage et Kimi K3 en 1 bit Unsloth Dynamic GGUF nécessite 594 Go (62 % de moins).
Dynamic 1 bit (voir à droite) atteint ~78.9% une précision top-1 tout en étant 62 % plus petit. Dynamic 2 bits 861,3 Go atteint ~90% une précision tout en étant 45 % plus petit. Exécutez Kimi-K3-GGUF via Unsloth Studio ou llama.cpp. Kimi K3 peut fonctionner sur une station NVIDIA DGX ou sur un Mac Studio connecté à un appareil doté de 128 Go de RAM.
Pour sans perte Kimi K3, utilisez Q8 (UD-Q8_K_XL), qui est 50 Go plus grand que Q4 (UD-Q4_K_XL). Nous étudions encore s’il est possible de le faire passer sous 512 Gio (le 1 bit dynamique fait 553,2 Gio) sans endommager le modèle.

Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
610 Go
665 Go
726 Go
880 Go
1,6 To
Détails d’implémentation de Kimi K3 GGUF
Nous nous sommes appuyés sur la PR de llama.cpp avec notre fork qui inclut la prise en charge de la vision et quelques corrections de bugs.
Le mmproj / vision tower est similaire à la tour de Kimi-K2.5, mais avec RMSNorm, sans biais, un QKV fusionné non carré (largeur qkv != n_embd) et un projecteur post-norm.
Nous avons constaté qu’en exécutant llama.cpp, le
n_tokens * 40budget échouait pour de grandes tailles de lot, et nous avons donc dû augmenter jusqu’àn_tokens * 160Nous avons également dû convertir le modèle de chat Kimi au format jinja.
Nous avons testé autant que possible pour couvrir tous les cas. Par défaut, Kimi a été entraîné avec la conservation du raisonnement activée sur, donc toutes les traces de raisonnement ne sont pas supprimées, mais conservées.
📊 Analyse de la quantification
Comme Kimi K2.6 et K2.7, de K3 UD-Q8_K_XL est sans perte car Kimi utilise MXFP4 pour les poids MoE et BF16 pour tout le reste, et Q8_K_XL le suit exactement. UD-Q4_K_XL est similaire, sauf que certains des tenseurs restants (sauf les normes, etc.) sont Q8_0, donc il est proche de la pleine précision et nécessite 1,56 To de RAM/VRAM. UD-Q8_K_XL est « véritablement sans perte » par rapport à la version safetensors complète MXFP4.
UD-IQ1_S
594.0
0.5645
2.5789
78.875 +/- 0.107
36.495
UD-IQ1_M
648.9
0.4789
2.3639
81.219 +/- 0.103
33.629
UD-IQ2_XXS
711.1
0.3784
2.1266
84.127 +/- 0.096
29.826
UD-Q2_K_XL
861.3
0.1779
1.7359
90.390 +/- 0.077
19.862
UD-Q4_K_XL
1,510
1.4579
UD-Q8_K_XL
1,560
1.4581
Pour la génération de l’imatrix et la quantification, nous avons utilisé le 1,56 To sans perte UD-Q8_K_XL tout au long de l’étalonnage ; sa perplexité est de 1,4581. Notre quantification Dynamic-1bit atteint une perplexité de 2,58 avec une précision top-1 de 79 %, ce qui la rend étonnamment utilisable.
D’autres quantifications de la communauté sont plus volumineuses tout en se dégradant beaucoup plus. Par exemple, une quantification de 618,9 Go IQ1_M dépasse notre quantification 1 bit de 594 Go, mais sa perplexité grimpe à 54,56 — 21× pire. Le même schéma vaut pour IQ2_XXS : 725 Go à 96 PPL contre nos 711 Go à 2,12 PPL — 45× pire, ce qui signifie que leur 2 bits est même moins performant que leur 1 bit. Cela souligne l’importance de la quantification dynamique et d’un bon étalonnage.
Nous fournissons également des graphiques de précision top-1 % et de KLD :



⚙️ Guide d’utilisation
Kimi K3 est réservé au raisonnement, avec preserve_thinking toujours activé et max le raisonnement est activé par défaut. Le mode instantané n’est pas pris en charge. L’effort de raisonnement est configuré avec le reasoning_effort champ de requête, et K3 prend en charge "low", "high"et "max" niveaux d’effort de raisonnement.
temperature = 1.0
temperature = 1.0
top_p = 0.95
top_p = 1.0
Longueur du contexte = jusqu’à
1,048,576Le raisonnement Faible, Élevé, Max est activable dans Unsloth
Si le modèle tient, vous obtiendrez ~20 jetons/s de génération avec des B200 et un débit >120 jetons/s. Nous recommandons UD-IQ1_S (594 Go) comme bon compromis taille/qualité. Règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.
Guide pour exécuter Kimi K3
Vous pouvez maintenant exécuter Kimi K3 dans llama.cpp et Unsloth Desktop. Nous utiliserons la quantification de 594 Go UD-IQ1_S pour obtenir les meilleurs résultats en termes d’accessibilité et de précision, et elle nécessitera au moins 610 Go de RAM. N’hésitez pas à changer le type de quantification. GGUF : Kimi-K3-GGUF
🦥 Exécuter Kimi-K3 dans Unsloth
Kimi K3 peut fonctionner dans Unsloth Desktop, une interface de bureau open source pour l’IA locale. Unsloth Desktop décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d’outils + recherche web
exécution de code (Python, Bash)
inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence CPU + GPU rapide via llama.cpp
Entraîner des LLM 2× plus rapide avec 70 % de VRAM en moins

Installer et lancer Unsloth
La façon la plus simple de commencer est de télécharger l’ application Unsloth Desktop. Fonctionne sur macOS, Windowset Linux.
Ou, si vous préférez l’installer manuellement :
macOS, Linux, WSL :
Windows PowerShell :
Lancer Unsloth
macOS, Linux, WSL et Windows :
Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.
Lancez Unsloth de manière sécurisée avec HTTPS et Cloudflare
NOUVEAU ! Unsloth propose désormais un moyen sécurisé de lancer Unsloth en HTTPS via un tunnel Cloudflare gratuit. Utilisez la commande ci-dessous (fonctionne sous Windows, Mac et Linux) :
Rechercher et télécharger Kimi K3
Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.
Puis allez dans l’onglet Model hub et recherchez Kimi K3 dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous de disposer de suffisamment de capacité de calcul pour exécuter le modèle.

Exécuter Kimi K3
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également basculer le raisonnement faible, élevé ou max, modifier la longueur du contexte, le modèle de chat et d’autres paramètres.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

🦙 Exécuter Kimi K3 dans llama.cpp
Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU. Nous avons créé un fork spécifiquement pour prendre en charge ainsi la vision de Kimi K3. Cela s’appuie sur un autre la PR de llama.cpp.
Obtenez le fork SPÉCIFIQUE d’Unsloth de llama.cpp sur GitHub ici pour activer la prise en charge de la vision. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metaldéfinissez -DGGML_CUDA=OFF puis continuez normalement — la prise en charge de Metal est activée par défaut.
Obtenons d’abord une image ! Vous pouvez également téléverser des images. Nous utiliserons cette image, qui est simplement notre mini logo montrant comment les modèles affinés sont créés avec Unsloth :

Prenons la deuxième image ici

Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D’abord, sélectionnez le type de quantification que vous souhaitez, comme IQ1_S. Utilisez également export LLAMA_CACHE="folder" pour forcer llama.cpp la sauvegarde à un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d’utiliser le processus de téléchargement manuel dans la section suivante.
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET
Puis exécutez le modèle en mode conversation :
Vous verrez alors :

Et j’ai demandé « Quelle est la racine carrée de -1 » :

Kimi K3 prend également en charge les images, par exemple en chargeant l’image Unsloth :

Puis nous utilisons l’image du paresseux et demandons quel est son lien :

📊 Références
Vous pouvez voir plus bas les références au format tableau :


Raisonnement et connaissances
GPQA Diamond
93.5
92.6
94.1
91.0
93.5
91.2
HLE-Full
43.5 / 56.0
53.3 / 63.0
44.5 / 58.0
49.8 / 57.9
41.4 / 52.2
—
Codage
DeepSWE
67.5
70.0
73.0
59.0
67.0
46.2
Terminal-Bench 2.1
88.3
88.0
88.8
84.6
83.4
82.7
Agentique
BrowseComp
91.2
88.0
90.4
84.3
84.4
—
GDPval-AA v2 (Elo)
1686
1747
1736
1593
1491
1510
OSWorld 2.0
58.3
66.1
62.6
55.7
49.5
—
Vision
MMMU-Pro
81.6 / 83.4
81.2 / 86.5
83.0 / 84.6
78.9 / 82.7
81.2 / 83.2
—
MathVision
94.3 / 97.8
94.8 / 98.6
95.8 / 97.8
86.7 / 97.1
92.2 / 96.8
—
Les benchmarks DeepSWE montrent que Kimi-K3 est très efficace !

Mis à jour
Ce contenu vous a-t-il été utile ?

