> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/kimi-k3.md).

# Kimi K3 - Comment exécuter localement

Kimi K3 de Moonshot AI est un modèle à poids ouverts de 2,8 T de paramètres (104 B actifs) conçu pour des charges de travail de codage, agentiques, à long contexte et de chat de pointe. C’est le **modèle ouvert le plus puissant** à ce jour, rivalisant avec Claude 4.8 Opus et GPT-5.6. Kimi K3 dispose d’une vision native, d’une fenêtre de contexte d’un million de jetons et utilise MXFP4. L’inférence en pleine précision nécessite 1,56 To de stockage et Kimi K3 en 1 bit [Unsloth](https://github.com/unslothai/unsloth) Dynamic GGUF nécessite **594 Go (62 % de moins)**.

{% columns %}
{% column %}
Dynamic 1 bit (voir à droite) atteint **\~78.9%** une précision top-1 tout en étant **62 % plus petit**. Dynamic 2 bits 861,3 Go atteint **\~90%** une précision tout en étant **45 % plus petit**. Exécutez [**Kimi-K3-GGUF**](https://huggingface.co/unsloth/Kimi-K3-GGUF) via [Unsloth Studio](/docs/fr/nouveau/studio.md) ou llama.cpp. Kimi K3 peut fonctionner sur une station NVIDIA DGX ou sur un Mac Studio connecté à un appareil doté de 128 Go de RAM.&#x20;

Pour **sans perte** Kimi K3, utilisez Q8 (`UD-Q8_K_XL`), qui est **50 Go plus grand** que Q4 (`UD-Q4_K_XL`). Nous étudions encore s’il est possible de le faire passer sous 512 Gio (le 1 bit dynamique fait 553,2 Gio) sans endommager le modèle.

<a href="/pages/07e30a8dcb33df37dfe47914f17848e02495e2b6" class="button primary">Tutoriels pour exécuter Kimi K3</a><a href="/pages/07e30a8dcb33df37dfe47914f17848e02495e2b6#usage-guide" class="button secondary">Résultats de quantification</a>
{% endcolumn %}

{% column %}

<figure><img src="/files/6d7a1d84e7f3751dbda0d89088a3858890a5099e" alt=""><figcaption><p>Kimi K3 GGUF 1 bit contre Claude 5 contre GPT 5.6</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

**Tableau : exigences matérielles** (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

| Dynamic 1 bit S | Dynamic 1 bit M | Dynamic 2 bits XXS | Dynamic 2 bits XL | Q8 (sans perte) |
| --------------- | --------------- | ------------------ | ----------------- | --------------- |
| 610 Go          | 665 Go          | 726 Go             | 880 Go            | 1,6 To          |

### Détails d’implémentation de Kimi K3 GGUF

Nous nous sommes appuyés sur [la PR de llama.cpp](https://github.com/ggml-org/llama.cpp/pull/26185) avec [notre fork](https://github.com/unslothai/llama.cpp/pull/48) qui inclut la prise en charge de la vision et quelques corrections de bugs.

1. Le mmproj / vision tower est similaire à la tour de Kimi-K2.5, mais avec RMSNorm, sans biais, un QKV fusionné non carré (largeur qkv != n\_embd) et un projecteur post-norm.
2. Nous avons constaté qu’en exécutant llama.cpp, le `n_tokens * 40` budget échouait pour de grandes tailles de lot, et nous avons donc dû augmenter jusqu’à `n_tokens * 160`&#x20;
3. Nous avons également dû convertir le modèle de chat Kimi au format jinja.
4. Nous avons testé autant que possible pour couvrir tous les cas. Par défaut, Kimi a été entraîné avec **la conservation du raisonnement activée sur**, donc toutes les traces de raisonnement ne sont pas supprimées, mais conservées.

### 📊 Analyse de la quantification

Comme Kimi [K2.6](/docs/fr/modeles/kimi-k2.6.md) et [K2.7](/docs/fr/modeles/kimi-k2.7-code.md), de K3 `UD-Q8_K_XL` est sans perte car Kimi utilise MXFP4 pour les poids MoE et BF16 pour tout le reste, et `Q8_K_XL` le suit exactement. `UD-Q4_K_XL` est similaire, sauf que certains des tenseurs restants (sauf les normes, etc.) sont `Q8_0`, donc il est proche de la pleine précision et nécessite 1,56 To de RAM/VRAM. `UD-Q8_K_XL` est « véritablement sans perte » par rapport à la version safetensors complète MXFP4.

<table><thead><tr><th width="119.20001220703125">Quant</th><th width="71.60000610351562" align="right">Go</th><th width="124.800048828125" align="right">KLD moyenne</th><th width="104.9998779296875" align="right">PPL(q)</th><th width="188.79998779296875" align="right">% d’accord top-1</th><th width="140.20001220703125" align="right">% dp RMS</th></tr></thead><tbody><tr><td><code>UD-IQ1_S</code></td><td align="right">594.0</td><td align="right">0.5645</td><td align="right">2.5789</td><td align="right">78.875 +/- 0.107</td><td align="right">36.495</td></tr><tr><td><code>UD-IQ1_M</code></td><td align="right">648.9</td><td align="right">0.4789</td><td align="right">2.3639</td><td align="right">81.219 +/- 0.103</td><td align="right">33.629</td></tr><tr><td><code>UD-IQ2_XXS</code></td><td align="right">711.1</td><td align="right">0.3784</td><td align="right">2.1266</td><td align="right">84.127 +/- 0.096</td><td align="right">29.826</td></tr><tr><td><code>UD-Q2_K_XL</code></td><td align="right">861.3</td><td align="right">0.1779</td><td align="right">1.7359</td><td align="right">90.390 +/- 0.077</td><td align="right">19.862</td></tr><tr><td><code>UD-Q4_K_XL</code></td><td align="right">1,510</td><td align="right"></td><td align="right">1.4579</td><td align="right"></td><td align="right"></td></tr><tr><td><code>UD-Q8_K_XL</code></td><td align="right">1,560</td><td align="right"></td><td align="right">1.4581</td><td align="right"></td><td align="right"></td></tr></tbody></table>

Pour la génération de l’imatrix et la quantification, nous avons utilisé le 1,56 To sans perte `UD-Q8_K_XL` tout au long de l’étalonnage ; sa perplexité est de 1,4581. Notre quantification Dynamic-1bit atteint une perplexité de 2,58 avec une précision top-1 de 79 %, ce qui la rend étonnamment utilisable.

D’autres quantifications de la communauté sont plus volumineuses tout en se dégradant beaucoup plus. Par exemple, une quantification de 618,9 Go `IQ1_M` dépasse notre quantification 1 bit de 594 Go, mais sa perplexité grimpe à 54,56 — 21× pire. Le même schéma vaut pour `IQ2_XXS` : 725 Go à 96 PPL contre nos 711 Go à 2,12 PPL — 45× pire, ce qui signifie que leur 2 bits est même moins performant que leur 1 bit. Cela souligne l’importance de la quantification dynamique et d’un bon étalonnage.

**Nous fournissons également des graphiques de précision top-1 % et de KLD :**

<div><figure><img src="/files/7c253986e7a2fdd47490abdd08061dd52ecd097e" alt=""><figcaption></figcaption></figure> <figure><img src="/files/05ac3a1fe4c74574b1f794cf7a1092ffb97f252d" alt=""><figcaption></figcaption></figure> <figure><img src="/files/c18c0f99e82df05d1d03987ce391bfb484f86a0d" alt=""><figcaption></figcaption></figure></div>

### :gear: Guide d’utilisation

Kimi K3 est **réservé au raisonnement**, avec **`preserve_thinking` toujours activé** et **max** le raisonnement est activé par défaut. Le mode instantané n’est pas pris en charge. L’effort de raisonnement est configuré avec le `reasoning_effort` champ de requête, et K3 prend en charge `"low"`, `"high"`et `"max"` niveaux d’effort de raisonnement.

| Par défaut        | Agentique         |
| ----------------- | ----------------- |
| temperature = 1.0 | temperature = 1.0 |
| top\_p = 0.95     | top\_p = 1.0      |

* Longueur du contexte = jusqu’à `1,048,576`
* Le raisonnement Faible, Élevé, Max est activable dans Unsloth

Si le modèle tient, vous obtiendrez \~20 jetons/s de génération avec des B200 et un débit >120 jetons/s. Nous recommandons [`UD-IQ1_S`](https://huggingface.co/unsloth/Kimi-K3-GGUF?show_file_info=UD-IQ1_S%2FKimi-K3-UD-IQ1_S-00001-of-00015.gguf) (594 Go) comme bon compromis taille/qualité. Règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon, cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.

## Guide pour exécuter Kimi K3

Vous pouvez maintenant exécuter Kimi K3 dans [llama.cpp](#run-in-llama.cpp) et [Unsloth Desktop](https://unsloth.ai/docs/fr/modeles/pages/5a7cb89811055498b527bf86240cffd678766c37#run-glm-5.2-in-unsloth-studio). Nous utiliserons la quantification de 594 Go [`UD-IQ1_S`](https://huggingface.co/unsloth/Kimi-K3-GGUF?show_file_info=UD-IQ1_S%2FKimi-K3-UD-IQ1_S-00001-of-00015.gguf) pour obtenir les meilleurs résultats en termes d’accessibilité et de précision, et elle nécessitera au moins 610 Go de RAM. N’hésitez pas à changer le type de quantification. GGUF : [**Kimi-K3-GGUF**](https://huggingface.co/unsloth/Kimi-K3-GGUF)

### 🦥 Exécuter Kimi-K3 dans Unsloth

Kimi K3 peut fonctionner dans [Unsloth Desktop](/docs/fr/desktop.md), une interface de bureau open source pour l’IA locale. **Unsloth Desktop décharge automatiquement vers la RAM et détecte les configurations multi-GPU**. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur **macOS, Windows**, Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Auto-réparation** appel d’outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [inférence automatique](https://unsloth.ai/docs/desktop#feature-deep-dive) réglage des paramètres (temp, top-p, etc.)
* Inférence CPU + GPU rapide via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2× plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="/files/41fee5ed39cb0d26cb672cb6d7aaf86cf7e47717" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}
**Installer et lancer Unsloth**

La façon la plus simple de commencer est de télécharger l’ [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md)et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez l’installer manuellement :

macOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

**Lancer Unsloth**

macOS, Linux, WSL et Windows :

```bash
unsloth studio
```

Puis ouvrez `http://127.0.0.1:8888` (ou votre URL spécifique) dans votre navigateur.

**Lancez Unsloth de manière sécurisée avec HTTPS et Cloudflare**

**NOUVEAU !** Unsloth propose désormais un moyen sécurisé de lancer Unsloth en HTTPS via un tunnel Cloudflare gratuit. Utilisez la commande ci-dessous (fonctionne sous Windows, Mac et Linux) :

```bash
unsloth studio --secure
```

{% endstep %}

{% step %}
**Rechercher et télécharger Kimi K3**

Unsloth Studio décharge automatiquement vers la RAM et détecte les configurations multi-GPU. Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard.

Puis allez dans l’onglet Model hub et recherchez **Kimi K3** dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous de disposer de suffisamment de capacité de calcul pour exécuter le modèle.

<figure><img src="/files/055bdcc90b9d6d80f070f31aa14d008e2a039cc5" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}
**Exécuter Kimi K3**

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez également basculer **le raisonnement faible, élevé ou max**, modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre [guide d’inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).

<figure><img src="/files/41fee5ed39cb0d26cb672cb6d7aaf86cf7e47717" alt=""><figcaption><p>Exemple de Kimi-K3 1 bit fonctionnant avec Canvas d’Unsloth</p></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Exécuter Kimi K3 dans llama.cpp

Pour ces tutoriels, nous utiliserons [llama.cpp](https://github.com/ggml-org/llama.cpp) pour une inférence locale rapide, surtout si vous avez un CPU. Nous [avons créé un fork](https://github.com/unslothai/llama.cpp/pull/48) spécifiquement pour prendre en charge ainsi la vision de Kimi K3. Cela s’appuie sur un autre [la PR de llama.cpp](https://github.com/ggml-org/llama.cpp/pull/26185).

{% stepper %}
{% step %}
Obtenez le fork SPÉCIFIQUE d’Unsloth de `llama.cpp` sur [**GitHub ici**](https://github.com/unslothai/llama.cpp/pull/48) pour activer la prise en charge de la vision. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**définissez `-DGGML_CUDA=OFF` puis continuez normalement — la prise en charge de Metal est activée par défaut.

```bash
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
**Obtenons d’abord une image !** Vous pouvez également téléverser des images. Nous utiliserons [cette image](https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png), qui est simplement notre mini logo montrant comment les modèles affinés sont créés avec Unsloth :

{% code overflow="wrap" %}

```bash
wget https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png -O unsloth.png
```

{% endcode %}

<figure><img src="/files/8226e799b1a697c94669626a5da8371ee8388470" alt="" width="188"><figcaption></figcaption></figure>

Prenons la deuxième image [ici](https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg)

{% code overflow="wrap" %}

```bash
wget https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg -O picture.png
```

{% endcode %}

<figure><img src="/files/eb404a2bbe8e7f1836a2608a3950391d566357e3" alt="" width="188"><figcaption></figcaption></figure>
{% endstep %}

{% step %}
Vous pouvez maintenant utiliser `llama.cpp` directement pour charger et télécharger des modèles, tout comme `ollama run`. D’abord, sélectionnez le type de quantification que vous souhaitez, comme `IQ1_S`. Utilisez également `export LLAMA_CACHE="folder"` pour forcer `llama.cpp` la sauvegarde à un emplacement spécifique. **Notez que ce processus de téléchargement peut être très lent**, il est donc probablement préférable d’utiliser le processus de téléchargement manuel dans la section suivante.

```bash
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \\
    --temp 1.0 \\
    --top-p 0.95
```

{% endstep %}

{% step %}
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Si les téléchargements se bloquent, voir : [Dépannage de Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Kimi-K3-GGUF \\
    --local-dir unsloth/Kimi-K3-GGUF \\
    --include "*mmproj-BF16*" \\
    --include "*UD-IQ1_S*" # Utilisez "*UD-Q8_K_XL*" pour la pleine précision
```

{% endstep %}

{% step %}
Puis exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \\
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95
```

{% endcode %}
{% endstep %}

{% step %}
Vous verrez alors :

<figure><img src="/files/2cd017db24452373001ecd0870a0f890e60bff63" alt=""><figcaption></figcaption></figure>

Et j’ai demandé « Quelle est la racine carrée de -1 » :

<figure><img src="/files/65d3bed59d49ec2132ed57111f466694bc623bfe" alt=""><figcaption></figcaption></figure>

Kimi K3 prend également en charge les images, par exemple en chargeant l’image Unsloth :

<figure><img src="/files/39e9b2603369859fc92fcb3b81a8376a10cf2866" alt=""><figcaption></figcaption></figure>

Puis nous utilisons l’image du paresseux et demandons quel est son lien :

<figure><img src="/files/9c63b3a137959d6e4008201a0d1aec67d2d8bc2a" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 📊 Références

Vous pouvez voir plus bas les références au format tableau :

<div><figure><img src="/files/a9368a60012b558b65941e01f6bca635c1a1b933" alt=""><figcaption></figcaption></figure> <figure><img src="/files/7a93cb24f31f39617200402783e2ae82108055e3" alt=""><figcaption></figcaption></figure></div>

|             Référence             | Kimi K3&#xA;(max) | Claude Fable 5&#xA;(max) | GPT-5.6 Sol&#xA;(max) | Claude Opus 4.8&#xA;(max) | GPT-5.5&#xA;(xhigh) | GLM-5.2&#xA;(max) |
| :-------------------------------: | :---------------: | :----------------------: | :-------------------: | :-----------------------: | :-----------------: | :---------------: |
| **Raisonnement et connaissances** |                   |                          |                       |                           |                     |                   |
|            GPQA Diamond           |        93.5       |           92.6           |        **94.1**       |            91.0           |         93.5        |        91.2       |
|              HLE-Full             |    43.5 / 56.0    |      **53.3 / 63.0**     |      44.5 / 58.0      |        49.8 / 57.9        |     41.4 / 52.2     |         —         |
|             **Codage**            |                   |                          |                       |                           |                     |                   |
|              DeepSWE              |        67.5       |           70.0           |        **73.0**       |            59.0           |         67.0        |        46.2       |
|         Terminal-Bench 2.1        |        88.3       |           88.0           |        **88.8**       |            84.6           |         83.4        |        82.7       |
|           **Agentique**           |                   |                          |                       |                           |                     |                   |
|             BrowseComp            |      **91.2**     |           88.0           |          90.4         |            84.3           |         84.4        |         —         |
|         GDPval-AA v2 (Elo)        |        1686       |         **1747**         |          1736         |            1593           |         1491        |        1510       |
|            OSWorld 2.0            |        58.3       |         **66.1**         |          62.6         |            55.7           |         49.5        |         —         |
|             **Vision**            |                   |                          |                       |                           |                     |                   |
|              MMMU-Pro             |    81.6 / 83.4    |      81.2 / **86.5**     |    **83.0** / 84.6    |        78.9 / 82.7        |     81.2 / 83.2     |         —         |
|             MathVision            |    94.3 / 97.8    |      94.8 / **98.6**     |    **95.8** / 97.8    |        86.7 / 97.1        |     92.2 / 96.8     |         —         |

Les benchmarks DeepSWE montrent que Kimi-K3 est très efficace !

<figure><img src="/files/da3c85c9251d49d0bf0099f31d66db68e3de948a" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/kimi-k3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
