For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌘Kimi K2.7 Code - comment l’exécuter localement

Guide pas à pas pour exécuter Kimi K2.7 Code sur votre propre appareil local.

Kimi K2.7 Code est le modèle de codage agentique de Moonshot AI, s'appuyant sur K2.6 pour améliorer l'achèvement des tâches tout en utilisant ~30 % de jetons de réflexion en moins. Le modèle MoE à 1 T de paramètres (32 B actifs) prend en charge uniquement le raisonnement, la vision et un contexte de 256K. Il offre des performances open SOTA dans les tâches de vision, de codage, agentiques, à long contexte et de chat. La précision complète nécessite 605 Go d'espace disque ; Unsloth Dynamic en 2 bits nécessite 325 Go (-48 %). Exécutez Kimi-K2.7-Code-GGUF via Unsloth Studio ou llama.cpp.

Unsloth Dynamic quants convertit les couches importantes en 8 bits et les versions 1 bit nécessitent 310 Go+ de VRAM/RAM configurations. Pour sans perte Pour Kimi K2.7, utilisez Q8 (UD-Q8_K_XL), qui n'est que 10 Go de plus que Q4 (UD-Q4_K_XL). Vous pouvez exécuter Kimi K2.7 Code via un Mac Studio ou DGX Station.

Tableau : Exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

1 bit dynamique
2 bits dynamiques
Q3 dynamique
Q8 (sans perte)

310 Go

325-350 Go

385-470 Go

605 Go

📊 Analyse de quantification

Comme Kimi-K2.6, UD-Q8_K_XL est sans perte car Kimi utilise int4 pour les poids MoE et BF16 pour tout le reste, et Q8_K_XL en découle. Ainsi, nous utilisons la même méthodologie dynamique pour la conversion de Kimi-K2.6. UD-Q4_K_XL est similaire, sauf que les tenseurs restants sont Q8_0, donc il est proche de la précision complète et nécessite 600 Go de RAM/VRAM. UD-Q8_K_XL est « véritablement sans perte ».

Mesure
UD-Q2_K_XL
UD-Q4_K_XL
UD-Q8_K_XL (Sans perte)

Espace disque

339 Go

584 Go

595 Go

Perplexité

~2.4131

~1.8420

~1.8419

Nous avons suivi la découverte de jukofyorkselon laquelle const float d = max / -7; au lieu de la valeur par défaut const float d = max / -8; uniquement pendant le processus de quantification sur les couches MoE. Ce correctif de bijection sur les MoE natives INT4 permet au Q4_0 type de quantification de réduire l'erreur absolue de 1,8 % à presque 0 % (epsilon). Par exemple, voici l'histogramme pour Kimi-K2.7-Code, et vous pouvez voir que -8 n'est pas du tout utilisé :

Notez que nous devons également conserver les autres couches en BF16 et ne pas utiliser un "Q4_0" intelligent. Nous montrons ci-dessous les graphiques d'erreur pour les deux par rapport à la référence BF16. UD-Q8-K_XL est vraiment « sans perte » avec une légère différence d'epsilon machine lors de la conversion de Q4_0 en BF16. Ainsi, Q4_K_XL présente bien une certaine erreur de quantification due à l'utilisation de Q8_0, tandis que Q8_K_XL est presque sans perte, sauf pour l'arrondi BF16.

Pour Q4_K_XL, nous traçons également l'erreur par tenseur de Q8_0 par rapport à BF16. En général, il existe une certaine erreur entre Q8_K_XL (presque sans perte) et Q4_K_XL, mais pas beaucoup.

⚙️ Guide d’utilisation

Kimi K2.7 Code est uniquement réflexion, avec preserve_thinking toujours activé. Le mode instantané n'est pas pris en charge.

Par défaut (mode de réflexion)

temperature = 1.0

top_p = 0.95

  • Longueur de contexte suggérée = 98,304 (jusqu'à 262,144)

Si le modèle tient, vous obtiendrez >100 jetons/s avec des B200. Nous recommandons UD-Q2_K_XL (345 Go) comme bon compromis taille/qualité. Meilleure règle empirique : RAM+VRAM ≈ la taille du quant ; sinon cela fonctionnera quand même, mais plus lentement à cause du déchargement.

Modèle de chat pour Kimi K2.7-Code

Exécution tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},]) donne :

Si nous fournissons aussi les outils comme référencés dans Tool Calling Guide, alors nous voyons ce qui suit :

Guide d'exécution de Kimi K2.7 Code

🦥 Exécuter Kimi-K2.7-Code dans Unsloth Studio

Kimi K2.7 Code peut fonctionner dans Unsloth Studio, une interface web open source pour l'IA locale. Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer et lancer Unsloth

Pour l'installer, exécutez dans votre terminal :

macOS, Linux, WSL :

Windows PowerShell :

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

2

Rechercher et télécharger Kimi K2.7-Code

Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.

Puis allez dans l’onglet Unsloth Chat onglet et recherchez Kimi-K2.7 Code dans la barre de recherche et téléchargez le modèle et le quant souhaités. Assurez-vous d'avoir suffisamment de calcul pour exécuter le modèle.

3

Exécuter Kimi-K2.7-Code

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; cependant, vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de discussion et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence d’Unsloth Studio.

Exemple de Qwen3.6 exécuté avec appel d'outils

🦙 Exécuter Kimi K2.7 Code dans llama.cpp

Pour ce guide, nous allons exécuter le UD-Q2_K_XL quant qui nécessitera au moins 345 Go de RAM. N'hésitez pas à changer le type de quantification. GGUF : Kimi-K2.7-Code-GGUF

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.

1

Obtenez la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.

2

Commençons d'abord par obtenir une image ! Vous pouvez également téléverser des images. Nous utiliserons https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, qui n'est que notre mini logo montrant comment les fine-tunes sont réalisés avec Unsloth :

Allons chercher la 2e image à https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

3

Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. Tout d'abord, sélectionnez le type de quantification que vous voulez, comme Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.

4

Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET

5

Ensuite, exécutez le modèle en mode conversation :

Vous verrez alors ce qui suit :

6

Puis utilisez /image pour charger les deux images et demander « Quelle est cette image » :

et vous obtiendrez quelque chose comme ci-dessous :

Sur la 2e image du paresseux :

Ce qui vous donnera :

📊 Benchmarks

Vous pouvez consulter plus bas les benchmarks sous forme de tableau :

Benchmark
Kimi K2.7 Code
Kimi K2.6
GPT-5.5
Claude Opus 4.8

Codage

Kimi Code Bench v2

62.0

50.9

69.0

67.4

Program Bench

53.6

48.3

69.1

63.8

MLS Bench Lite

35.1

26.7

35.5

42.8

Agentique

Kimi Claw 24/7 Bench

46.9

42.9

52.8

50.4

MCP Atlas

76.0

69.4

79.4

81.3

MCP Mark vérifié

81.1

72.8

92.9

76.4

Mis à jour

Ce contenu vous a-t-il été utile ?