🥝Kimi K2.6 - comment exécuter en local
Guide étape par étape pour exécuter Kimi-K2.6 sur votre propre appareil local.
Kimi K2.6 est un modèle ouvert de Moonshot qui offre des performances de pointe (SOTA) dans les tâches de vision, de codage, agentiques, à long contexte et de chat. Le modèle hybride de raisonnement de 1 T de paramètres a une longueur de contexte de 256 K et, en pleine précision, nécessite 610 Go d’espace disque. Le mode dynamique 2 bits nécessite 350 Go (-43 % de taille). Exécutez Kimi K2.6 via Unsloth Dynamic Kimi-K2.6-GGUFs dans Unsloth Studio ou llama.cpp.
2 bits dynamique rehausse les couches importantes en 8 bits et nécessite 350 Go+ de VRAM/RAM configurations. Pour sans perte Kimi K2.6, utilisez Q8 (UD-Q8_K_XL), qui n’est que 10 Go plus volumineux que Q4 (UD-Q4_K_XL). Tous les envois utilisent Dynamic 2.0 pour des performances de quantification de pointe (SOTA). Les GGUF de Kimi-K2.6 prennent aussi en charge la vision.
Tableau : Exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
Espace disque
340 Go
584 Go
595 Go
Perplexité
2.4131
1.8420
1.8419
📊 Analyse de la quantification
UD-Q8_K_XL est sans perte parce que Kimi utilise int4 pour les poids MoE et BF16 pour tout le reste, et Q8_K_XL suit cela. UD-Q4_K_XL est similaire, sauf que les tenseurs restants sont Q8_0, donc elle est proche de la pleine précision et nécessite 600 Go de RAM/VRAM. D’autres GGUF non-Unsloth provenant d’autres fournisseurs peuvent suivre l’ UD-Q4_K_XL approche plutôt que le « véritablement sans perte » UD-Q8_K_XL.
Nous avons suivi jukofyorkla découverte de const float d = max / -7; au lieu de la valeur par défaut const float d = max / -8; pendant le processus de quantification, uniquement sur les couches MoE. Ce correctif de bijection sur les MoE natifs INT4 permet au Q4_0 type de quantification de réduire l’erreur absolue de 1,8 % à presque 0 % (epsilon).
Cependant, nous devons conserver les autres couches en BF16, et nous montrons ci-dessous les graphiques d’erreur pour les deux par rapport à la référence BF16. UD-Q8-K_XL est véritablement « sans perte », avec une légère différence de l’epsilon machine lors de la conversion de Q4_0 vers BF16. La perplexité pour UD-Q8_K_XL était de 1,8419 ± 0,00721 et UD-Q4_K_XL 1,8420 ± 0,00720. Notez que le graphique d’erreur ci-dessous est le RMSE divisé par l’epsilon du bfloat16, donc c’est une petite échelle d’erreur.

Q4_K_XL (bleu) et Q8_K_XL (orange), qui est sans perte et 10 Go plus volumineux.⚙️ Guide d’utilisation
Les modes de raisonnement et non-raisonnement nécessitent des paramètres différents :
temperature = 1.0
temperature = 0.6
top_p = 0.95
top_p = 0.95
Longueur de contexte suggérée =
98,304(jusqu’à262,144)
Si le modèle tient, vous obtiendrez >40 jetons/s avec des B200. Nous recommandons UD-Q2_K_XL (350 Go) comme bon compromis taille/qualité. Meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon cela fonctionnera quand même, juste plus lentement à cause du déchargement.
Modèle de chat pour Kimi K2.6
Exécution de tokenizer.apply_chat_template([{"role": "user", "content": "Que vaut 1+1 ?"},]) donne :
Guide d’exécution de Kimi K2.6
🦥 Exécutez Kimi-K2.6 dans Unsloth Studio
Kimi K2.6 peut fonctionner dans Unsloth Studio, une interface Web open source pour l’IA locale. Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur macOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensors
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via llama.cpp
Entraînez des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer et lancer Unsloth
Pour l’installer, exécutez dans votre terminal :
macOS, Linux, WSL :
Windows PowerShell :
Lancer Unsloth
macOS, Linux, WSL et Windows :
Puis ouvrez http://localhost:8888 dans votre navigateur.
Rechercher et télécharger Kimi-K2.6
Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.
Ensuite, allez dans l’ Studio Chat onglet et recherchez Kimi-K2.6 dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous d’avoir suffisamment de ressources de calcul pour exécuter le modèle.

Exécuter Kimi-K2.6
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le modèle de chat et d’autres paramètres.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

🦙 Exécutez Kimi K2.6 dans llama.cpp
Pour ce guide, nous utiliserons la quantification UD-Q2_K_XL, qui nécessitera au moins 350 Go de RAM. N’hésitez pas à changer le type de quantification. GGUF : Kimi-K2.6-GGUF
Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement — la prise en charge de Metal est activée par défaut.
Vous pouvez maintenant utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D’abord, sélectionnez le type de quantification souhaité, par exemple Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d’utiliser le processus de téléchargement manuel dans la section suivante.
Utilisez l’une des commandes spécifiques ci-dessous, selon votre cas d’utilisation :
Mode raisonnement :
Mode non-raisonnement (instantané) :
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub, XET
Puis exécutez le modèle en mode conversation :
📊 Références
Vous pouvez consulter ci-dessous des benchmarks sous forme de tableau :

Mis à jour
Ce contenu vous a-t-il été utile ?

