> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/kimi-k2.6.md).

# Kimi K2.6 - Comment l'exécuter localement

Kimi K2.6 est un modèle ouvert de Moonshot qui offre des performances SOTA dans les tâches de vision, de codage, agentiques, à long contexte et de chat. Le modèle de réflexion hybride à 1T de paramètres a une longueur de contexte de 256K et, en pleine précision, nécessite 610 Go d'espace disque. Le mode dynamique 2 bits nécessite **350 Go (-43 % de taille)**. Exécutez Kimi K2.6 via Unsloth Dynamic [**Kimi-K2.6-GGUFs**](https://huggingface.co/unsloth/Kimi-K2.6-GGUF) sur Unsloth Studio ou llama.cpp.

**Dynamique 2 bits** remonte les couches importantes en 8 bits et nécessite **350 Go+ de VRAM/RAM** configuration&#x73;**.** Pour **sans perte** Kimi K2.6, utilisez Q8 (`UD-Q8_K_XL`), qui n'est que **10 Go de plus** que Q4 (`UD-Q4_K_XL`). Tous les téléchargements utilisent [Dynamique 2.0](/docs/fr/bases/unsloth-dynamic-2.0-ggufs.md) pour des performances de quantification SOTA. Les GGUF de Kimi-K2.6 prennent aussi **en charge la vision.**

**Tableau : Exigences matérielles** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

| Mesure        | Dynamique 2 bits | Q4     | Q8 (sans perte) |
| ------------- | ---------------- | ------ | --------------- |
| Espace disque | 340 Go           | 584 Go | 595 Go          |
| Perplexité    | 2.4131           | 1.8420 | 1.8419          |

### 📊 Analyse de quantification

`UD-Q8_K_XL` est sans perte car Kimi utilise int4 pour les poids MoE et BF16 pour tout le reste, et `Q8_K_XL` suit cela. `UD-Q4_K_XL` est similaire, sauf que les tenseurs restants sont `Q8_0`, donc il est quasiment en pleine précision et nécessite 600 Go de RAM/VRAM. D'autres GGUF non-Unsloth d'autres fournisseurs peuvent suivre l' `UD-Q4_K_XL` approche plutôt que le « vraiment sans perte » `UD-Q8_K_XL`.

Nous avons suivi [jukofyork](https://github.com/jukofyork)la découverte de `const float d = max / -7;` au lieu de la valeur par défaut `const float d = max / -8;` pendant le processus de quantification uniquement sur les couches MoE. Ce correctif de bijection sur les MoE natifs INT4 permet au `Q4_0` type de quantification de réduire l'erreur absolue de 1,8 % à presque 0 % (epsilon).

Cependant, nous devons conserver les autres couches en BF16, et nous montrons ci-dessous les courbes d'erreur pour les deux par rapport à la référence BF16. `UD-Q8-K_XL` est véritablement « sans perte », avec une différence d'epsilon machine lors de la conversion de Q4\_0 en BF16. La perplexité pour `UD-Q8_K_XL` était de 1,8419 ± 0,00721 et `UD-Q4_K_XL` 1,8420 ± 0,00720. Notez que le graphe d'erreur ci-dessous est la RMSE divisée par l'epsilon du bfloat16, donc c'est une petite échelle d'erreur.

<div data-with-frame="true"><figure><img src="/files/7cc1773e1357faad6081f56ada3edce05efc6b44" alt=""><figcaption><p>Voir la différence entre <code>Q4_K_XL</code> (bleu) et <code>Q8_K_XL</code> (orange), qui est sans perte et 10 Go plus grand.</p></figcaption></figure></div>

### :gear: Guide d'utilisation

**Le mode de réflexion et le mode sans réflexion nécessitent des réglages différents :**

| Par défaut (mode de réflexion) | Mode instantané   |
| ------------------------------ | ----------------- |
| temperature = 1.0              | temperature = 0.6 |
| top\_p = 0,95                  | top\_p = 0,95     |

* Longueur de contexte suggérée = `98,304` (jusqu'à `262,144`)

Si le modèle tient en mémoire, vous obtiendrez >40 jetons/s en utilisant des B200. Nous recommandons `UD-Q2_K_XL` (350 Go) comme bon équilibre taille/qualité. Meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, juste plus lentement à cause du déchargement.

#### Modèle de chat pour Kimi K2.6

Exécution `tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},])` donne :

{% code overflow="wrap" %}

```
<|im_system|>system<|im_middle|>Vous êtes Kimi, un assistant IA créé par Moonshot AI.<|im_end|><|im_user|>user<|im_middle|>Que vaut 1+1 ?<|im_end|><|im_assistant|>assistant<|im_middle|><think>
```

{% endcode %}

## Guide pour exécuter Kimi K2.6

### 🦥 Exécutez Kimi-K2.6 dans Unsloth Studio

Kimi K2.6 peut fonctionner dans [Unsloth Studio](/docs/fr/nouveau/studio.md), une interface web open source pour l'IA locale. **Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multiGPU**. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur **MacOS, Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9d149ac4b773a56a635d40ab8347ea2896781ae6" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}
**Installer et lancer Unsloth**

Pour l'installer, exécutez dans votre terminal :

MacOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

**Lancer Unsloth**

MacOS, Linux, WSL et Windows :

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Puis ouvrez `http://localhost:8888` dans votre navigateur.
{% endstep %}

{% step %}
**Recherchez et téléchargez Kimi-K2.6**

Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multiGPU. Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.

Puis allez dans l’ [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet et recherchez **Kimi-K2.6** dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous d'avoir suffisamment de ressources de calcul pour exécuter le modèle.

<div data-with-frame="true"><figure><img src="/files/df61ee5eb2591c27e4d52ac3611114e3e421a4b8" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}
**Exécuter Kimi-K2.6**

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/acbddf2b13951f7e83eb5a222093fd827a4b5258" alt="" width="563"><figcaption><p>Exemple de Qwen3.6 exécuté avec appel d'outils</p></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Exécutez Kimi K2.6 dans llama.cpp

Pour ce guide, nous utiliserons la quantification UD-Q2\_K\_XL, qui nécessitera au moins 350 Go de RAM. N'hésitez pas à changer le type de quantification. GGUF : [**Kimi-K2.6-GGUF**](https://huggingface.co/unsloth/Kimi-K2.6-GGUF)

Pour ces tutoriels, nous utiliserons [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) pour une inférence locale rapide, surtout si vous avez un CPU.

{% stepper %}
{% step %}
Obtenez la dernière `llama.cpp` **sur** [**GitHub ici**](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. Tout d'abord, sélectionnez le type de quantification que vous souhaitez, comme `Q2_K_XL`. Utilisez aussi `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` l'enregistrement dans un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il est donc probablement préférable d'utiliser le processus de téléchargement manuel dans la section suivante.

Utilisez l'une des commandes spécifiques ci-dessous, selon votre cas d'utilisation :

**Mode réflexion :**

```bash
export LLAMA_CACHE="unsloth/Kimi-K2.6-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/Kimi-K2.6-GGUF:UD-Q2_K_XL \
    --temp 1.0 \
    --top-p 0.95
```

**Mode sans réflexion (instantané) :**

```bash
export LLAMA_CACHE="unsloth/Kimi-K2.6-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/Kimi-K2.6-GGUF:UD-Q2_K_XL \
    --temp 0.6 \\
    --top-p 0.95 \\
    --chat-template-kwargs '{"enable_thinking":false}'
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements restent bloqués, voir : [Dépannage Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Kimi-K2.6-GGUF \
    --local-dir unsloth/Kimi-K2.6-GGUF \
    --include "*mmproj-F16*" \\
    --include "*UD-Q2_K_XL*" # Utilisez "*UD-Q8_K_XL*" pour la pleine précision
```

{% endstep %}

{% step %}
Puis exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Kimi-K2.6-GGUF/UD-Q2_K_XL/Kimi-K2.6-UD-Q2_K_XL-00001-of-0008.gguf \
    --mmproj unsloth/Kimi-K2.6-GGUF/mmproj-F16.gguf \
    --temp 1.0 \
    --top-p 0.95
```

{% endcode %}
{% endstep %}
{% endstepper %}

### 📊 Benchmarks

Vous pouvez voir plus bas les benchmarks sous forme de tableau :

<div data-with-frame="true"><figure><img src="/files/8c11e136580df03889e138aa6ae26b75ae84e8c5" alt="" width="563"><figcaption></figcaption></figure></div>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/kimi-k2.6.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
