For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌘Kimi K3 - Wie man lokal ausführt

Leitfaden zum Ausführen von Kimi K3-Quants in deinem lokalen Setup.

Kimi K3 von Moonshot AI ist ein Open-Weight-Modell mit 2,8 Billionen Parametern (104B aktiv), gebaut für SOTA-Coding-, Agenten-, Langkontext- und Chat-Workloads. Es ist das stärkste offene Modell bis heute und steht Claude 4.8 Opus und GPT-5.6 in nichts nach. Kimi K3 verfügt über native Bildverarbeitung, ein Kontextfenster mit 1 Mio. Tokens und verwendet MXFP4. Inferenz in voller Präzision erfordert 1,56 TB Speicher und 1-Bit Kimi K3 Unsloth Dynamic GGUF erfordert 594 GB (62 % weniger).

Dynamic 1-Bit (siehe rechts) erreicht ~78.9% Top-1-Genauigkeit und ist dabei 62 % kleiner. Dynamic 2-Bit 861,3 GB erreicht ~90% Genauigkeit und ist dabei 45 % kleiner. Ausführen Kimi-K3-GGUF über Unsloth Studio oder llama.cpp. Kimi K3 kann auf einer NVIDIA DGX Station oder einem Mac Studio ausgeführt werden, das mit einem 128-GB-RAM-Gerät verbunden ist.

Für verlustfrei Kimi K3 verwende Q8 (UD-Q8_K_XL), was 50 GB größer ist als Q4 (UD-Q4_K_XL). Wir untersuchen noch, ob wir es unter 512 GiB drücken können (Dynamic 1-Bit ist 553,2 GiB), ohne das Modell zu beschädigen.

Tutorials zum Ausführen von Kimi K3Quantisierungsergebnisse

1-Bit Kimi K3 GGUF vs Claude 5 vs GPT 5.6

Tabelle: Hardware-Anforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

Dynamic 1-Bit S
Dynamic 1-Bit M
Dynamic 2-Bit XXS
Dynamic 2-Bit XL
Q8 (verlustfrei)

610 GB

665 GB

726 GB

880 GB

1,6 TB

Details zur Kimi K3 GGUF-Implementierung

Wir haben auf llama.cpp-PR aufgebaut, unserem Fork, der Bildunterstützung und einige Fehlerbehebungen enthält.

  1. Der mmproj-/Vision-Tower ähnelt dem Kimi-K2.5-Tower, jedoch mit RMSNorm, ohne Biases, einem nicht-quadratischen verschmolzenen QKV (qkv width != n_embd) und einem Projektor nach der Normierung.

  2. Wir haben festgestellt, als wir llama.cpp ausführten, dass das n_tokens * 40 Budget bei großen Batchgrößen versagte, und daher mussten wir auf n_tokens * 160

  3. umstellen. Wir mussten außerdem die Kimi-Chat-Vorlage in ein Jinja-Format umwandeln.

  4. Wir haben so viel wie möglich getestet, um alle Fälle abzudecken. Kimi wurde standardmäßig mit erhaltenem Denken auf, trainiert, daher werden alle Denktraces nicht gelöscht, sondern beibehalten.

📊 Quantisierungsanalyse

Wie Kimi K2.6 und K2.7, ist K3s UD-Q8_K_XL verlustfrei, weil Kimi MXFP4 für MoE-Gewichte und BF16 für alles andere verwendet, und Q8_K_XL folgt genau dem. UD-Q4_K_XL ist ähnlich, außer dass einige der verbleibenden Tensoren (außer Norms usw.) Q8_0, daher ist es nahezu voller Präzision und erfordert 1,56 TB RAM/VRAM. UD-Q8_K_XL ist gegenüber der vollständigen MXFP4-Safetensors-Version 'wirklich verlustfrei'.

Quant
GB
mittlere KLD
PPL(q)
Top-1-Übereinstimmung %
RMS dp %

UD-IQ1_S

594.0

0.5645

2.5789

78.875 +/- 0.107

36.495

UD-IQ1_M

648.9

0.4789

2.3639

81.219 +/- 0.103

33.629

UD-IQ2_XXS

711.1

0.3784

2.1266

84.127 +/- 0.096

29.826

UD-Q2_K_XL

861.3

0.1779

1.7359

90.390 +/- 0.077

19.862

UD-Q4_K_XL

1,510

1.4579

UD-Q8_K_XL

1,560

1.4581

Für die Imatrix-Erzeugung und Quantisierung verwendeten wir die verlustfreie 1,56-TB- UD-Q8_K_XL während der Kalibrierung; seine Perplexität beträgt 1,4581. Unsere Dynamic-1-Bit-Quantisierung erreicht eine Perplexität von 2,58 mit 79 % Top-1-Genauigkeit und ist damit überraschend gut nutzbar.

Andere Community-Quants sind größer, verschlechtern sich jedoch weit stärker. Zum Beispiel übertrifft eine 618,9-GB-Quantisierung IQ1_M unsere 594-GB-1-Bit-Quantisierung, aber ihre Perplexität steigt auf 54,56 – 21× schlechter. Dasselbe Muster gilt für IQ2_XXS: 725 GB bei 96 PPL gegenüber unseren 711 GB bei 2,12 PPL – 45× schlechter, was bedeutet, dass ihre 2-Bit-Version sogar schlechter abschneidet als ihre 1-Bit-Version. Dies unterstreicht die Bedeutung dynamischer Quantisierung und korrekter Kalibrierung.

Wir bieten außerdem Top-1%-Genauigkeits-, KLD-Diagramme an:

⚙️ Anleitung zur Nutzung

Kimi K3 ist nur für Denken, mit preserve_thinking immer aktiviert und max standardmäßig aktiviertem Denken. Der Sofortmodus wird nicht unterstützt. Der Denkaufwand wird mit dem reasoning_effort Anfragefeld konfiguriert, und K3 unterstützt "low", "high"und "max" -Denkaufwände.

Standard
Agentisch

Temperatur = 1,0

Temperatur = 1,0

top_p = 0,95

top_p = 1,0

  • Kontextlänge = bis zu 1,048,576

  • Low, High, Max Thinking ist in Unsloth umschaltbar

Wenn das Modell passt, erhalten Sie bei der Verwendung von B200s eine Generierung mit ~20 Token/s und einen Durchsatz von >120 Token/s. Wir empfehlen UD-IQ1_S (594 GB) als guten Kompromiss zwischen Größe und Qualität. Die beste Faustregel: RAM+VRAM ≈ die Quantisierungsgröße; andernfalls funktioniert es zwar trotzdem, aber deutlich langsamer wegen Auslagerung auf die Festplatte.

Anleitung zum Ausführen von Kimi K3

Sie können Kimi K3 jetzt in llama.cpp und Unsloth Desktop. Wir werden die 594-GB- UD-IQ1_S Quantisierung für beste Ergebnisse hinsichtlich Zugänglichkeit und Genauigkeit verwenden und sie erfordert mindestens 610 GB RAM. Sie können den Quantisierungstyp gerne ändern. GGUF: Kimi-K3-GGUF

🦥 Kimi-K3 in Unsloth ausführen

Kimi K3 kann ausgeführt werden in Unsloth Desktop, einer Open-Source-Desktop-Oberfläche für lokale KI. Unsloth Desktop lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und:

1

Unsloth installieren und starten

Der einfachste Einstieg ist das Herunterladen der Unsloth Desktop-App. Läuft auf macOS, Windowsund Linux.

Unsloth herunterladen

Oder, wenn Sie lieber manuell installieren möchten:

MacOS, Linux, WSL:

Windows PowerShell:

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://127.0.0.1:8888 (oder Ihre spezifische URL) in Ihrem Browser.

Unsloth sicher mit HTTPS und Cloudflare starten

NEU! Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS über einen kostenlosen Cloudflare-Tunnel zu starten. Verwenden Sie das Folgende (funktioniert unter Windows, Mac und Linux):

2

Kimi K3 suchen und herunterladen

Unsloth Studio lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden.

Gehen Sie dann zum Tab „Model hub“ und suchen Sie nach Kimi K3 in der Suchleiste und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter. Stellen Sie sicher, dass Sie genug Rechenleistung haben, um das Modell auszuführen.

3

Kimi K3 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können auch umschalten Low-, High- oder Max-Thinking, die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unseren Inferenzleitfaden für Unsloth Studio.

Beispiel für 1-Bit Kimi-K3, das mit Unsloths Canvas läuft

🦙 Kimi K3 in llama.cpp ausführen

Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben. Wir haben einen Fork erstellt speziell, um die Kimi-K3-Vision zu unterstützen. Dies baut auf einem weiteren llama.cpp-PR.

1

Holen Sie sich den SPEZIFISCHEN Unsloth-Fork von llama.cpp auf GitHub hier um Bildunterstützung zu aktivieren. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON in -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Lassen Sie uns zuerst ein Bild holen! Sie können auch Bilder hochladen. Wir werden dieses Bild, das einfach unser Mini-Logo ist und zeigt, wie Finetunes mit Unsloth erstellt werden:

Lassen Sie uns das 2. Bild holen hier

3

Sie können jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wählen Sie zunächst den gewünschten Quantisierungstyp wie IQ1_S. Verwenden Sie außerdem export LLAMA_CACHE="folder" um zu erzwingen llama.cpp an einen bestimmten Speicherort zu speichern. Beachten Sie, dass dieser Downloadvorgang sehr langsam sein könnte, daher ist es wahrscheinlich am besten, im nächsten Abschnitt den manuellen Downloadprozess zu verwenden.

4

Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Falls Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

5

Dann führen Sie das Modell im Konversationsmodus aus:

6

Dann werden Sie sehen:

Und ich fragte: „Was ist die Wurzel aus -1“:

Kimi K3 unterstützt auch Bilder, z. B. beim Laden des Unsloth-Bildes:

Und dann verwenden wir das Faultier-Bild und fragen, wie es damit zusammenhängt:

📊 Benchmarks

Sie können weiter unten Benchmarks in Tabellenform sehen:

Benchmark
Kimi K3\n(max)
Claude Fable 5\n(max)
GPT-5.6 Sol\n(max)
Claude Opus 4.8\n(max)
GPT-5.5\n(xhigh)
GLM-5.2\n(max)

Denken & Wissen

GPQA Diamond

93.5

92.6

94.1

91.0

93.5

91.2

HLE-Full

43.5 / 56.0

53.3 / 63.0

44.5 / 58.0

49.8 / 57.9

41.4 / 52.2

Codierung

DeepSWE

67.5

70.0

73.0

59.0

67.0

46.2

Terminal-Bench 2.1

88.3

88.0

88.8

84.6

83.4

82.7

Agentisch

BrowseComp

91.2

88.0

90.4

84.3

84.4

GDPval-AA v2 (Elo)

1686

1747

1736

1593

1491

1510

OSWorld 2.0

58.3

66.1

62.6

55.7

49.5

Vision

MMMU-Pro

81.6 / 83.4

81.2 / 86.5

83.0 / 84.6

78.9 / 82.7

81.2 / 83.2

MathVision

94.3 / 97.8

94.8 / 98.6

95.8 / 97.8

86.7 / 97.1

92.2 / 96.8

Die DeepSWE-Benchmarks zeigen, dass Kimi-K3 sehr effizient arbeitet!

Zuletzt aktualisiert

War das hilfreich?