> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/kimi-k3.md).

# Kimi K3 - So führst du es lokal aus

Kimi K3 von Moonshot AI ist ein Open-Weight-Modell mit 2,8 Billionen Parametern (104B aktiv), gebaut für SOTA-Coding-, Agenten-, Langkontext- und Chat-Workloads. Es ist das **stärkste offene Modell** bis heute und steht Claude 4.8 Opus und GPT-5.6 in nichts nach. Kimi K3 verfügt über native Bildverarbeitung, ein Kontextfenster mit 1 Mio. Tokens und verwendet MXFP4. Inferenz in voller Präzision erfordert 1,56 TB Speicher und 1-Bit Kimi K3 [Unsloth](https://github.com/unslothai/unsloth) Dynamic GGUF erfordert **594 GB (62 % weniger)**.

{% columns %}
{% column %}
Dynamic 1-Bit (siehe rechts) erreicht **\~78.9%** Top-1-Genauigkeit und ist dabei **62 % kleiner**. Dynamic 2-Bit 861,3 GB erreicht **\~90%** Genauigkeit und ist dabei **45 % kleiner**. Ausführen [**Kimi-K3-GGUF**](https://huggingface.co/unsloth/Kimi-K3-GGUF) über [Unsloth Studio](/docs/de/neu/studio.md) oder llama.cpp. Kimi K3 kann auf einer NVIDIA DGX Station oder einem Mac Studio ausgeführt werden, das mit einem 128-GB-RAM-Gerät verbunden ist.&#x20;

Für **verlustfrei** Kimi K3 verwende Q8 (`UD-Q8_K_XL`), was **50 GB größer ist** als Q4 (`UD-Q4_K_XL`). Wir untersuchen noch, ob wir es unter 512 GiB drücken können (Dynamic 1-Bit ist 553,2 GiB), ohne das Modell zu beschädigen.

<a href="/pages/da8ea8f35970b5a8aab75c464434778994dac49f" class="button primary">Tutorials zum Ausführen von Kimi K3</a><a href="/pages/da8ea8f35970b5a8aab75c464434778994dac49f#usage-guide" class="button secondary">Quantisierungsergebnisse</a>
{% endcolumn %}

{% column %}

<figure><img src="/files/eceefc1b03fe3fe1deb25937268c465385d04e79" alt=""><figcaption><p>1-Bit Kimi K3 GGUF vs Claude 5 vs GPT 5.6</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

**Tabelle: Hardware-Anforderungen** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

| Dynamic 1-Bit S | Dynamic 1-Bit M | Dynamic 2-Bit XXS | Dynamic 2-Bit XL | Q8 (verlustfrei) |
| --------------- | --------------- | ----------------- | ---------------- | ---------------- |
| 610 GB          | 665 GB          | 726 GB            | 880 GB           | 1,6 TB           |

### Details zur Kimi K3 GGUF-Implementierung

Wir haben auf [llama.cpp-PR](https://github.com/ggml-org/llama.cpp/pull/26185) aufgebaut, [unserem Fork,](https://github.com/unslothai/llama.cpp/pull/48) der Bildunterstützung und einige Fehlerbehebungen enthält.

1. Der mmproj-/Vision-Tower ähnelt dem Kimi-K2.5-Tower, jedoch mit RMSNorm, ohne Biases, einem nicht-quadratischen verschmolzenen QKV (qkv width != n\_embd) und einem Projektor nach der Normierung.
2. Wir haben festgestellt, als wir llama.cpp ausführten, dass das `n_tokens * 40` Budget bei großen Batchgrößen versagte, und daher mussten wir auf `n_tokens * 160`&#x20;
3. umstellen. Wir mussten außerdem die Kimi-Chat-Vorlage in ein Jinja-Format umwandeln.
4. Wir haben so viel wie möglich getestet, um alle Fälle abzudecken. Kimi wurde standardmäßig mit **erhaltenem Denken auf**, trainiert, daher werden alle Denktraces nicht gelöscht, sondern beibehalten.

### 📊 Quantisierungsanalyse

Wie Kimi [K2.6](/docs/de/modelle/kimi-k2.6.md) und [K2.7](/docs/de/modelle/kimi-k2.7-code.md), ist K3s `UD-Q8_K_XL` verlustfrei, weil Kimi MXFP4 für MoE-Gewichte und BF16 für alles andere verwendet, und `Q8_K_XL` folgt genau dem. `UD-Q4_K_XL` ist ähnlich, außer dass einige der verbleibenden Tensoren (außer Norms usw.) `Q8_0`, daher ist es nahezu voller Präzision und erfordert 1,56 TB RAM/VRAM. `UD-Q8_K_XL` ist gegenüber der vollständigen MXFP4-Safetensors-Version 'wirklich verlustfrei'.

<table><thead><tr><th width="119.20001220703125">Quant</th><th width="71.60000610351562" align="right">GB</th><th width="124.800048828125" align="right">mittlere KLD</th><th width="104.9998779296875" align="right">PPL(q)</th><th width="188.79998779296875" align="right">Top-1-Übereinstimmung %</th><th width="140.20001220703125" align="right">RMS dp %</th></tr></thead><tbody><tr><td><code>UD-IQ1_S</code></td><td align="right">594.0</td><td align="right">0.5645</td><td align="right">2.5789</td><td align="right">78.875 +/- 0.107</td><td align="right">36.495</td></tr><tr><td><code>UD-IQ1_M</code></td><td align="right">648.9</td><td align="right">0.4789</td><td align="right">2.3639</td><td align="right">81.219 +/- 0.103</td><td align="right">33.629</td></tr><tr><td><code>UD-IQ2_XXS</code></td><td align="right">711.1</td><td align="right">0.3784</td><td align="right">2.1266</td><td align="right">84.127 +/- 0.096</td><td align="right">29.826</td></tr><tr><td><code>UD-Q2_K_XL</code></td><td align="right">861.3</td><td align="right">0.1779</td><td align="right">1.7359</td><td align="right">90.390 +/- 0.077</td><td align="right">19.862</td></tr><tr><td><code>UD-Q4_K_XL</code></td><td align="right">1,510</td><td align="right"></td><td align="right">1.4579</td><td align="right"></td><td align="right"></td></tr><tr><td><code>UD-Q8_K_XL</code></td><td align="right">1,560</td><td align="right"></td><td align="right">1.4581</td><td align="right"></td><td align="right"></td></tr></tbody></table>

Für die Imatrix-Erzeugung und Quantisierung verwendeten wir die verlustfreie 1,56-TB- `UD-Q8_K_XL` während der Kalibrierung; seine Perplexität beträgt 1,4581. Unsere Dynamic-1-Bit-Quantisierung erreicht eine Perplexität von 2,58 mit 79 % Top-1-Genauigkeit und ist damit überraschend gut nutzbar.

Andere Community-Quants sind größer, verschlechtern sich jedoch weit stärker. Zum Beispiel übertrifft eine 618,9-GB-Quantisierung `IQ1_M` unsere 594-GB-1-Bit-Quantisierung, aber ihre Perplexität steigt auf 54,56 – 21× schlechter. Dasselbe Muster gilt für `IQ2_XXS`: 725 GB bei 96 PPL gegenüber unseren 711 GB bei 2,12 PPL – 45× schlechter, was bedeutet, dass ihre 2-Bit-Version sogar schlechter abschneidet als ihre 1-Bit-Version. Dies unterstreicht die Bedeutung dynamischer Quantisierung und korrekter Kalibrierung.

**Wir bieten außerdem Top-1%-Genauigkeits-, KLD-Diagramme an:**

<div><figure><img src="/files/03c445df1e6f5e90b3d6d221a2487fd1a4488728" alt=""><figcaption></figcaption></figure> <figure><img src="/files/00d677295d0557f7ab6d321c3c6e4fd3dd2bfa1c" alt=""><figcaption></figcaption></figure> <figure><img src="/files/bc5b40dec5a307a1b3536308faf6464cd5099c59" alt=""><figcaption></figcaption></figure></div>

### :gear: Anleitung zur Nutzung

Kimi K3 ist **nur für Denken**, mit **`preserve_thinking` immer aktiviert** und **max** standardmäßig aktiviertem Denken. Der Sofortmodus wird nicht unterstützt. Der Denkaufwand wird mit dem `reasoning_effort` Anfragefeld konfiguriert, und K3 unterstützt `"low"`, `"high"`und `"max"` -Denkaufwände.

| Standard         | Agentisch        |
| ---------------- | ---------------- |
| Temperatur = 1,0 | Temperatur = 1,0 |
| top\_p = 0,95    | top\_p = 1,0     |

* Kontextlänge = bis zu `1,048,576`
* Low, High, Max Thinking ist in Unsloth umschaltbar

Wenn das Modell passt, erhalten Sie bei der Verwendung von B200s eine Generierung mit \~20 Token/s und einen Durchsatz von >120 Token/s. Wir empfehlen [`UD-IQ1_S`](https://huggingface.co/unsloth/Kimi-K3-GGUF?show_file_info=UD-IQ1_S%2FKimi-K3-UD-IQ1_S-00001-of-00015.gguf) (594 GB) als guten Kompromiss zwischen Größe und Qualität. Die beste Faustregel: RAM+VRAM ≈ die Quantisierungsgröße; andernfalls funktioniert es zwar trotzdem, aber deutlich langsamer wegen Auslagerung auf die Festplatte.

## Anleitung zum Ausführen von Kimi K3

Sie können Kimi K3 jetzt in [llama.cpp](#run-in-llama.cpp) und [Unsloth Desktop](https://unsloth.ai/docs/de/modelle/pages/58e5f3df7be61773c8d7055c30a65310240079a4#run-glm-5.2-in-unsloth-studio). Wir werden die 594-GB- [`UD-IQ1_S`](https://huggingface.co/unsloth/Kimi-K3-GGUF?show_file_info=UD-IQ1_S%2FKimi-K3-UD-IQ1_S-00001-of-00015.gguf) Quantisierung für beste Ergebnisse hinsichtlich Zugänglichkeit und Genauigkeit verwenden und sie erfordert mindestens 610 GB RAM. Sie können den Quantisierungstyp gerne ändern. GGUF: [**Kimi-K3-GGUF**](https://huggingface.co/unsloth/Kimi-K3-GGUF)

### 🦥 Kimi-K3 in Unsloth ausführen

Kimi K3 kann ausgeführt werden in [Unsloth Desktop](/docs/de/desktop.md), einer Open-Source-Desktop-Oberfläche für lokale KI. **Unsloth Desktop lagert automatisch in RAM aus und erkennt Multi-GPU-Setups**. Mit Unsloth Studio können Sie Modelle lokal ausführen auf **macOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameterabstimmung (Temp, Top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="/files/1b4e35a8560500631afb36e8e183698d03fb9b5c" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}
**Unsloth installieren und starten**

Der einfachste Einstieg ist das Herunterladen der [Unsloth Desktop-App](/docs/de/desktop.md). Läuft auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md)und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn Sie lieber manuell installieren möchten:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

**Unsloth starten**

MacOS, Linux, WSL und Windows:

```bash
unsloth studio
```

Dann öffnen Sie `http://127.0.0.1:8888` (oder Ihre spezifische URL) in Ihrem Browser.

**Unsloth sicher mit HTTPS und Cloudflare starten**

**NEU!** Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS über einen kostenlosen Cloudflare-Tunnel zu starten. Verwenden Sie das Folgende (funktioniert unter Windows, Mac und Linux):

```bash
unsloth studio --secure
```

{% endstep %}

{% step %}
**Kimi K3 suchen und herunterladen**

Unsloth Studio lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden.

Gehen Sie dann zum Tab „Model hub“ und suchen Sie nach **Kimi K3** in der Suchleiste und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter. Stellen Sie sicher, dass Sie genug Rechenleistung haben, um das Modell auszuführen.

<figure><img src="/files/89777a39834ddb7a2c0b3e5bf2677c8e29325031" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}
**Kimi K3 ausführen**

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können auch umschalten **Low-, High- oder Max-Thinking**, die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unseren [Inferenzleitfaden für Unsloth Studio](/docs/de/neu/studio/chat.md).

<figure><img src="/files/1b4e35a8560500631afb36e8e183698d03fb9b5c" alt=""><figcaption><p>Beispiel für 1-Bit Kimi-K3, das mit Unsloths Canvas läuft</p></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 Kimi K3 in llama.cpp ausführen

Für diese Tutorials verwenden wir [llama.cpp](https://github.com/ggml-org/llama.cpp) für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben. Wir [haben einen Fork erstellt](https://github.com/unslothai/llama.cpp/pull/48) speziell, um die Kimi-K3-Vision zu unterstützen. Dies baut auf einem weiteren [llama.cpp-PR](https://github.com/ggml-org/llama.cpp/pull/26185).

{% stepper %}
{% step %}
Holen Sie sich den SPEZIFISCHEN Unsloth-Fork von `llama.cpp` auf [**GitHub hier**](https://github.com/unslothai/llama.cpp/pull/48) um Bildunterstützung zu aktivieren. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie `-DGGML_CUDA=ON` in `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
git clone https://github.com/unslothai/llama.cpp
cd llama.cpp
git fetch origin pull/48/head:kimi-k3-fullsize-vision
git checkout kimi-k3-fullsize-vision
cd ..
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
**Lassen Sie uns zuerst ein Bild holen!** Sie können auch Bilder hochladen. Wir werden [dieses Bild](https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png), das einfach unser Mini-Logo ist und zeigt, wie Finetunes mit Unsloth erstellt werden:

{% code overflow="wrap" %}

```bash
wget https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png -O unsloth.png
```

{% endcode %}

<figure><img src="/files/160964fe46d3d435f00c2ea49f3597248b55aef1" alt="" width="188"><figcaption></figcaption></figure>

Lassen Sie uns das 2. Bild holen [hier](https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg)

{% code overflow="wrap" %}

```bash
wget https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg -O picture.png
```

{% endcode %}

<figure><img src="/files/9348b2f2ccd13a6029ac983226c9dc6671d3bc23" alt="" width="188"><figcaption></figcaption></figure>
{% endstep %}

{% step %}
Sie können jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wählen Sie zunächst den gewünschten Quantisierungstyp wie `IQ1_S`. Verwenden Sie außerdem `export LLAMA_CACHE="folder"` um zu erzwingen `llama.cpp` an einen bestimmten Speicherort zu speichern. **Beachten Sie, dass dieser Downloadvorgang sehr langsam sein könnte**, daher ist es wahrscheinlich am besten, im nächsten Abschnitt den manuellen Downloadprozess zu verwenden.

```bash
export LLAMA_CACHE="unsloth/Kimi-K3-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/Kimi-K3-GGUF:UD-IQ1_S \
    --temp 1.0 \
    --top-p 0.95
```

{% endstep %}

{% step %}
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Falls Downloads hängen bleiben, siehe: [Debugging für Hugging Face Hub, XET](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Kimi-K3-GGUF \
    --local-dir unsloth/Kimi-K3-GGUF \
    --include "*mmproj-BF16*" \
    --include "*UD-IQ1_S*" # Verwenden Sie "*UD-Q8_K_XL*" für volle Präzision
```

{% endstep %}

{% step %}
Dann führen Sie das Modell im Konversationsmodus aus:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_S-00001-of-00014.gguf \
    --mmproj unsloth/Kimi-K3-GGUF/mmproj-BF16.gguf \
    --temp 1.0 \
    --top-p 0.95
```

{% endcode %}
{% endstep %}

{% step %}
Dann werden Sie sehen:

<figure><img src="/files/4ecc4f9d92d47f11ab74239e277812374f16650c" alt=""><figcaption></figcaption></figure>

Und ich fragte: „Was ist die Wurzel aus -1“:

<figure><img src="/files/6f6f05e8af5c9ad2bc06623671834aee86ad0736" alt=""><figcaption></figcaption></figure>

Kimi K3 unterstützt auch Bilder, z. B. beim Laden des Unsloth-Bildes:

<figure><img src="/files/e7e6da654d163f011b2aa2fd76e305cdcf5a3fc0" alt=""><figcaption></figcaption></figure>

Und dann verwenden wir das Faultier-Bild und fragen, wie es damit zusammenhängt:

<figure><img src="/files/2705e5bf8d0fedff084c9cb7191ce6cc88fdf097" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 📊 Benchmarks

Sie können weiter unten Benchmarks in Tabellenform sehen:

<div><figure><img src="/files/295dcca58f8935ef9b51a4cd7cb9c9faef8d71d6" alt=""><figcaption></figcaption></figure> <figure><img src="/files/0d6929638830c5704a0b2e0105ff43bcb7193b3e" alt=""><figcaption></figcaption></figure></div>

|      Benchmark      | Kimi K3\n(max) | Claude Fable 5\n(max) | GPT-5.6 Sol\n(max) | Claude Opus 4.8\n(max) | GPT-5.5\n(xhigh) | GLM-5.2\n(max) |
| :-----------------: | :------------: | :-------------------: | :----------------: | :--------------------: | :--------------: | :------------: |
| **Denken & Wissen** |                |                       |                    |                        |                  |                |
|     GPQA Diamond    |      93.5      |          92.6         |      **94.1**      |          91.0          |       93.5       |      91.2      |
|       HLE-Full      |   43.5 / 56.0  |    **53.3 / 63.0**    |     44.5 / 58.0    |       49.8 / 57.9      |    41.4 / 52.2   |        —       |
|    **Codierung**    |                |                       |                    |                        |                  |                |
|       DeepSWE       |      67.5      |          70.0         |      **73.0**      |          59.0          |       67.0       |      46.2      |
|  Terminal-Bench 2.1 |      88.3      |          88.0         |      **88.8**      |          84.6          |       83.4       |      82.7      |
|    **Agentisch**    |                |                       |                    |                        |                  |                |
|      BrowseComp     |    **91.2**    |          88.0         |        90.4        |          84.3          |       84.4       |        —       |
|  GDPval-AA v2 (Elo) |      1686      |        **1747**       |        1736        |          1593          |       1491       |      1510      |
|     OSWorld 2.0     |      58.3      |        **66.1**       |        62.6        |          55.7          |       49.5       |        —       |
|      **Vision**     |                |                       |                    |                        |                  |                |
|       MMMU-Pro      |   81.6 / 83.4  |    81.2 / **86.5**    |   **83.0** / 84.6  |       78.9 / 82.7      |    81.2 / 83.2   |        —       |
|      MathVision     |   94.3 / 97.8  |    94.8 / **98.6**    |   **95.8** / 97.8  |       86.7 / 97.1      |    92.2 / 96.8   |        —       |

Die DeepSWE-Benchmarks zeigen, dass Kimi-K3 sehr effizient arbeitet!

<figure><img src="/files/ec89291fe98cc4127209ce772b03242bdb414f25" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/kimi-k3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
