For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌘Kimi K3 - Comment l’exécuter localement

Guide pour exécuter les quants Kimi K3 sur votre configuration locale.

Kimi K3 de Moonshot AI est un modèle à poids ouverts de 2,8 T de paramètres (104 B actifs) conçu pour des charges de travail de codage, agentiques, à long contexte et de chat de pointe. C’est le modèle ouvert le plus puissant à ce jour, rivalisant avec Claude 4.8 Opus et GPT-5.6. Kimi K3 dispose d’une vision native, d’une fenêtre de contexte d’un million de jetons et utilise MXFP4. L’inférence en pleine précision nécessite 1,56 To de stockage et Kimi K3 en 1 bit Unsloth Dynamic GGUF nécessite 594 Go (62 % de moins).

Dynamic 1 bit (voir à droite) atteint ~78.9% une précision top-1 tout en étant 62 % plus petit. Dynamic 2 bits 861,3 Go atteint ~90% une précision tout en étant 45 % plus petit. Exécutez Kimi-K3-GGUF via Unsloth Studio ou llama.cpp. Kimi K3 peut fonctionner sur une station NVIDIA DGX ou sur un Mac Studio connecté à un appareil doté de 128 Go de RAM.

Pour sans perte Kimi K3, utilisez Q8 (UD-Q8_K_XL), qui est 50 Go plus grand que Q4 (UD-Q4_K_XL). Nous étudions encore s’il est possible de le faire passer sous 512 Gio (le 1 bit dynamique fait 553,2 Gio) sans endommager le modèle.

Tutoriels pour exécuter Kimi K3Résultats de quantification

Kimi K3 GGUF 1 bit contre Claude 5 contre GPT 5.6

Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

Dynamic 1 bit S
Dynamic 1 bit M
Dynamic 2 bits XXS
Dynamic 2 bits XL
Q8 (sans perte)

610 Go

665 Go

726 Go

880 Go

1,6 To

Détails d’implémentation de Kimi K3 GGUF

Nous nous sommes appuyés sur la PR de llama.cpp avec notre fork qui inclut la prise en charge de la vision et quelques corrections de bugs.

  1. Le mmproj / vision tower est similaire à la tour de Kimi-K2.5, mais avec RMSNorm, sans biais, un QKV fusionné non carré (largeur qkv != n_embd) et un projecteur post-norm.

  2. Nous avons constaté qu’en exécutant llama.cpp, le n_tokens * 40 budget échouait pour de grandes tailles de lot, et nous avons donc dû augmenter jusqu’à n_tokens * 160

  3. Nous avons également dû convertir le modèle de chat Kimi au format jinja.

  4. Nous avons testé autant que possible pour couvrir tous les cas. Par défaut, Kimi a été entraîné avec la conservation du raisonnement activée sur, donc toutes les traces de raisonnement ne sont pas supprimées, mais conservées.

📊 Analyse de la quantification

Comme Kimi K2.6 et K2.7, de K3 UD-Q8_K_XL est sans perte car Kimi utilise MXFP4 pour les poids MoE et BF16 pour tout le reste, et Q8_K_XL le suit exactement. UD-Q4_K_XL est similaire, sauf que certains des tenseurs restants (sauf les normes, etc.) sont Q8_0, donc il est proche de la pleine précision et nécessite 1,56 To de RAM/VRAM. UD-Q8_K_XL est « véritablement sans perte » par rapport à la version safetensors complète MXFP4.

Quant
Go
KLD moyenne
PPL(q)
% d’accord top-1
% dp RMS

UD-IQ1_S

594.0

0.5645

2.5789

78.875 +/- 0.107

36.495

UD-IQ1_M

648.9

0.4789

2.3639

81.219 +/- 0.103

33.629

UD-IQ2_XXS

711.1

0.3784

2.1266

84.127 +/- 0.096

29.826

UD-Q2_K_XL

861.3

0.1779

1.7359

90.390 +/- 0.077

19.862

UD-Q4_K_XL

1,510

1.4579

UD-Q8_K_XL

1,560

1.4581

Pour la génération de l’imatrix et la quantification, nous avons utilisé le 1,56 To sans perte UD-Q8_K_XL tout au long de l’étalonnage ; sa perplexité est de 1,4581. Notre quantification Dynamic-1bit atteint une perplexité de 2,58 avec une précision top-1 de 79 %, ce qui la rend étonnamment utilisable.

D’autres quantifications de la communauté sont plus volumineuses tout en se dégradant beaucoup plus. Par exemple, une quantification de 618,9 Go IQ1_M dépasse notre quantification 1 bit de 594 Go, mais sa perplexité grimpe à 54,56 — 21× pire. Le même schéma vaut pour IQ2_XXS : 725 Go à 96 PPL contre nos 711 Go à 2,12 PPL — 45× pire, ce qui signifie que leur 2 bits est même moins performant que leur 1 bit. Cela souligne l’importance de la quantification dynamique et d’un bon étalonnage.

Nous fournissons également des graphiques de précision top-1 % et de KLD :

⚙️ Guide d’utilisation

Kimi K3 est réservé au raisonnement, avec preserve_thinking toujours activé et max le raisonnement est activé par défaut. Le mode instantané n’est pas pris en charge. L’effort de raisonnement est configuré avec le reasoning_effort champ de requête, et K3 prend en charge "low", "high"et "max" niveaux d’effort de raisonnement.

Par défaut
Agentique

temperature = 1.0

temperature = 1.0

top_p = 0.95

top_p = 1.0

  • Longueur du contexte = jusqu’à 1,048,576

  • Le raisonnement Faible, Élevé, Max est activable dans Unsloth

Si le modèle tient, vous obtiendrez ~20 jetons/s de génération avec des B200 et un débit >120 jetons/s. Nous recommandons UD-IQ1_S (594 Go) comme bon compromis taille/qualité. Règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.

Guide pour exécuter Kimi K3

Vous pouvez maintenant exécuter Kimi K3 dans llama.cpp et Unsloth Desktop. Nous utiliserons la quantification de 594 Go UD-IQ1_S pour obtenir les meilleurs résultats en termes d’accessibilité et de précision, et elle nécessitera au moins 610 Go de RAM. N’hésitez pas à changer le type de quantification. GGUF : Kimi-K3-GGUF

🦥 Exécuter Kimi-K3 dans Unsloth

Kimi K3 peut fonctionner dans Unsloth Desktop, une interface de bureau open source pour l’IA locale. Unsloth Desktop décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :

1

Installer et lancer Unsloth

La façon la plus simple de commencer est de télécharger l’ application Unsloth Desktop. Fonctionne sur macOS, Windowset Linux.

Télécharger Unsloth

Ou, si vous préférez l’installer manuellement :

macOS, Linux, WSL :

Windows PowerShell :

Lancer Unsloth

macOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

Lancez Unsloth de manière sécurisée avec HTTPS et Cloudflare

NOUVEAU ! Unsloth propose désormais un moyen sécurisé de lancer Unsloth en HTTPS via un tunnel Cloudflare gratuit. Utilisez la commande ci-dessous (fonctionne sous Windows, Mac et Linux) :

2

Rechercher et télécharger Kimi K3

Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.

Puis allez dans l’onglet Model hub et recherchez Kimi K3 dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous de disposer de suffisamment de capacité de calcul pour exécuter le modèle.

3

Exécuter Kimi K3

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également basculer le raisonnement faible, élevé ou max, modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

Exemple de Kimi-K3 1 bit fonctionnant avec Canvas d’Unsloth

🦙 Exécuter Kimi K3 dans llama.cpp

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU. Nous avons créé un fork spécifiquement pour prendre en charge ainsi la vision de Kimi K3. Cela s’appuie sur un autre la PR de llama.cpp.

1

Obtenez le fork SPÉCIFIQUE d’Unsloth de llama.cpp sur GitHub ici pour activer la prise en charge de la vision. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metaldéfinissez -DGGML_CUDA=OFF puis continuez normalement — la prise en charge de Metal est activée par défaut.

2

Obtenons d’abord une image ! Vous pouvez également téléverser des images. Nous utiliserons cette image, qui est simplement notre mini logo montrant comment les modèles affinés sont créés avec Unsloth :

Prenons la deuxième image ici

3

Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D’abord, sélectionnez le type de quantification que vous souhaitez, comme IQ1_S. Utilisez également export LLAMA_CACHE="folder" pour forcer llama.cpp la sauvegarde à un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d’utiliser le processus de téléchargement manuel dans la section suivante.

4

Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET

5

Puis exécutez le modèle en mode conversation :

6

Vous verrez alors :

Et j’ai demandé « Quelle est la racine carrée de -1 » :

Kimi K3 prend également en charge les images, par exemple en chargeant l’image Unsloth :

Puis nous utilisons l’image du paresseux et demandons quel est son lien :

📊 Références

Vous pouvez voir plus bas les références au format tableau :

Référence
Kimi K3 (max)
Claude Fable 5 (max)
GPT-5.6 Sol (max)
Claude Opus 4.8 (max)
GPT-5.5 (xhigh)
GLM-5.2 (max)

Raisonnement et connaissances

GPQA Diamond

93.5

92.6

94.1

91.0

93.5

91.2

HLE-Full

43.5 / 56.0

53.3 / 63.0

44.5 / 58.0

49.8 / 57.9

41.4 / 52.2

Codage

DeepSWE

67.5

70.0

73.0

59.0

67.0

46.2

Terminal-Bench 2.1

88.3

88.0

88.8

84.6

83.4

82.7

Agentique

BrowseComp

91.2

88.0

90.4

84.3

84.4

GDPval-AA v2 (Elo)

1686

1747

1736

1593

1491

1510

OSWorld 2.0

58.3

66.1

62.6

55.7

49.5

Vision

MMMU-Pro

81.6 / 83.4

81.2 / 86.5

83.0 / 84.6

78.9 / 82.7

81.2 / 83.2

MathVision

94.3 / 97.8

94.8 / 98.6

95.8 / 97.8

86.7 / 97.1

92.2 / 96.8

Les benchmarks DeepSWE montrent que Kimi-K3 est très efficace !

Mis à jour

Ce contenu vous a-t-il été utile ?