🌘Kimi K3 - Wie man lokal ausführt
Leitfaden zum Ausführen von Kimi K3-Quants in deinem lokalen Setup.
Kimi K3 von Moonshot AI ist ein Open-Weight-Modell mit 2,8 Billionen Parametern (104B aktiv), gebaut für SOTA-Coding-, Agenten-, Langkontext- und Chat-Workloads. Es ist das stärkste offene Modell bis heute und steht Claude 4.8 Opus und GPT-5.6 in nichts nach. Kimi K3 verfügt über native Bildverarbeitung, ein Kontextfenster mit 1 Mio. Tokens und verwendet MXFP4. Inferenz in voller Präzision erfordert 1,56 TB Speicher und 1-Bit Kimi K3 Unsloth Dynamic GGUF erfordert 594 GB (62 % weniger).
Dynamic 1-Bit (siehe rechts) erreicht ~78.9% Top-1-Genauigkeit und ist dabei 62 % kleiner. Dynamic 2-Bit 861,3 GB erreicht ~90% Genauigkeit und ist dabei 45 % kleiner. Ausführen Kimi-K3-GGUF über Unsloth Studio oder llama.cpp. Kimi K3 kann auf einer NVIDIA DGX Station oder einem Mac Studio ausgeführt werden, das mit einem 128-GB-RAM-Gerät verbunden ist.
Für verlustfrei Kimi K3 verwende Q8 (UD-Q8_K_XL), was 50 GB größer ist als Q4 (UD-Q4_K_XL). Wir untersuchen noch, ob wir es unter 512 GiB drücken können (Dynamic 1-Bit ist 553,2 GiB), ohne das Modell zu beschädigen.

Tabelle: Hardware-Anforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)
610 GB
665 GB
726 GB
880 GB
1,6 TB
Details zur Kimi K3 GGUF-Implementierung
Wir haben auf llama.cpp-PR aufgebaut, unserem Fork, der Bildunterstützung und einige Fehlerbehebungen enthält.
Der mmproj-/Vision-Tower ähnelt dem Kimi-K2.5-Tower, jedoch mit RMSNorm, ohne Biases, einem nicht-quadratischen verschmolzenen QKV (qkv width != n_embd) und einem Projektor nach der Normierung.
Wir haben festgestellt, als wir llama.cpp ausführten, dass das
n_tokens * 40Budget bei großen Batchgrößen versagte, und daher mussten wir aufn_tokens * 160umstellen. Wir mussten außerdem die Kimi-Chat-Vorlage in ein Jinja-Format umwandeln.
Wir haben so viel wie möglich getestet, um alle Fälle abzudecken. Kimi wurde standardmäßig mit erhaltenem Denken auf, trainiert, daher werden alle Denktraces nicht gelöscht, sondern beibehalten.
📊 Quantisierungsanalyse
Wie Kimi K2.6 und K2.7, ist K3s UD-Q8_K_XL verlustfrei, weil Kimi MXFP4 für MoE-Gewichte und BF16 für alles andere verwendet, und Q8_K_XL folgt genau dem. UD-Q4_K_XL ist ähnlich, außer dass einige der verbleibenden Tensoren (außer Norms usw.) Q8_0, daher ist es nahezu voller Präzision und erfordert 1,56 TB RAM/VRAM. UD-Q8_K_XL ist gegenüber der vollständigen MXFP4-Safetensors-Version 'wirklich verlustfrei'.
UD-IQ1_S
594.0
0.5645
2.5789
78.875 +/- 0.107
36.495
UD-IQ1_M
648.9
0.4789
2.3639
81.219 +/- 0.103
33.629
UD-IQ2_XXS
711.1
0.3784
2.1266
84.127 +/- 0.096
29.826
UD-Q2_K_XL
861.3
0.1779
1.7359
90.390 +/- 0.077
19.862
UD-Q4_K_XL
1,510
1.4579
UD-Q8_K_XL
1,560
1.4581
Für die Imatrix-Erzeugung und Quantisierung verwendeten wir die verlustfreie 1,56-TB- UD-Q8_K_XL während der Kalibrierung; seine Perplexität beträgt 1,4581. Unsere Dynamic-1-Bit-Quantisierung erreicht eine Perplexität von 2,58 mit 79 % Top-1-Genauigkeit und ist damit überraschend gut nutzbar.
Andere Community-Quants sind größer, verschlechtern sich jedoch weit stärker. Zum Beispiel übertrifft eine 618,9-GB-Quantisierung IQ1_M unsere 594-GB-1-Bit-Quantisierung, aber ihre Perplexität steigt auf 54,56 – 21× schlechter. Dasselbe Muster gilt für IQ2_XXS: 725 GB bei 96 PPL gegenüber unseren 711 GB bei 2,12 PPL – 45× schlechter, was bedeutet, dass ihre 2-Bit-Version sogar schlechter abschneidet als ihre 1-Bit-Version. Dies unterstreicht die Bedeutung dynamischer Quantisierung und korrekter Kalibrierung.
Wir bieten außerdem Top-1%-Genauigkeits-, KLD-Diagramme an:



⚙️ Anleitung zur Nutzung
Kimi K3 ist nur für Denken, mit preserve_thinking immer aktiviert und max standardmäßig aktiviertem Denken. Der Sofortmodus wird nicht unterstützt. Der Denkaufwand wird mit dem reasoning_effort Anfragefeld konfiguriert, und K3 unterstützt "low", "high"und "max" -Denkaufwände.
Temperatur = 1,0
Temperatur = 1,0
top_p = 0,95
top_p = 1,0
Kontextlänge = bis zu
1,048,576Low, High, Max Thinking ist in Unsloth umschaltbar
Wenn das Modell passt, erhalten Sie bei der Verwendung von B200s eine Generierung mit ~20 Token/s und einen Durchsatz von >120 Token/s. Wir empfehlen UD-IQ1_S (594 GB) als guten Kompromiss zwischen Größe und Qualität. Die beste Faustregel: RAM+VRAM ≈ die Quantisierungsgröße; andernfalls funktioniert es zwar trotzdem, aber deutlich langsamer wegen Auslagerung auf die Festplatte.
Anleitung zum Ausführen von Kimi K3
Sie können Kimi K3 jetzt in llama.cpp und Unsloth Desktop. Wir werden die 594-GB- UD-IQ1_S Quantisierung für beste Ergebnisse hinsichtlich Zugänglichkeit und Genauigkeit verwenden und sie erfordert mindestens 610 GB RAM. Sie können den Quantisierungstyp gerne ändern. GGUF: Kimi-K3-GGUF
🦥 Kimi-K3 in Unsloth ausführen
Kimi K3 kann ausgeführt werden in Unsloth Desktop, einer Open-Source-Desktop-Oberfläche für lokale KI. Unsloth Desktop lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilendes Tool-Calling + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parameterabstimmung (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren und starten
Der einfachste Einstieg ist das Herunterladen der Unsloth Desktop-App. Läuft auf macOS, Windowsund Linux.
Oder, wenn Sie lieber manuell installieren möchten:
MacOS, Linux, WSL:
Windows PowerShell:
Unsloth starten
MacOS, Linux, WSL und Windows:
Dann öffnen Sie http://127.0.0.1:8888 (oder Ihre spezifische URL) in Ihrem Browser.
Unsloth sicher mit HTTPS und Cloudflare starten
NEU! Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS über einen kostenlosen Cloudflare-Tunnel zu starten. Verwenden Sie das Folgende (funktioniert unter Windows, Mac und Linux):
Kimi K3 suchen und herunterladen
Unsloth Studio lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden.
Gehen Sie dann zum Tab „Model hub“ und suchen Sie nach Kimi K3 in der Suchleiste und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter. Stellen Sie sicher, dass Sie genug Rechenleistung haben, um das Modell auszuführen.

Kimi K3 ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können auch umschalten Low-, High- oder Max-Thinking, die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen können Sie unseren Inferenzleitfaden für Unsloth Studio.

🦙 Kimi K3 in llama.cpp ausführen
Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben. Wir haben einen Fork erstellt speziell, um die Kimi-K3-Vision zu unterstützen. Dies baut auf einem weiteren llama.cpp-PR.
Holen Sie sich den SPEZIFISCHEN Unsloth-Fork von llama.cpp auf GitHub hier um Bildunterstützung zu aktivieren. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON in -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Lassen Sie uns zuerst ein Bild holen! Sie können auch Bilder hochladen. Wir werden dieses Bild, das einfach unser Mini-Logo ist und zeigt, wie Finetunes mit Unsloth erstellt werden:

Lassen Sie uns das 2. Bild holen hier

Sie können jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wählen Sie zunächst den gewünschten Quantisierungstyp wie IQ1_S. Verwenden Sie außerdem export LLAMA_CACHE="folder" um zu erzwingen llama.cpp an einen bestimmten Speicherort zu speichern. Beachten Sie, dass dieser Downloadvorgang sehr langsam sein könnte, daher ist es wahrscheinlich am besten, im nächsten Abschnitt den manuellen Downloadprozess zu verwenden.
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Falls Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Konversationsmodus aus:
Dann werden Sie sehen:

Und ich fragte: „Was ist die Wurzel aus -1“:

Kimi K3 unterstützt auch Bilder, z. B. beim Laden des Unsloth-Bildes:

Und dann verwenden wir das Faultier-Bild und fragen, wie es damit zusammenhängt:

📊 Benchmarks
Sie können weiter unten Benchmarks in Tabellenform sehen:


Denken & Wissen
GPQA Diamond
93.5
92.6
94.1
91.0
93.5
91.2
HLE-Full
43.5 / 56.0
53.3 / 63.0
44.5 / 58.0
49.8 / 57.9
41.4 / 52.2
—
Codierung
DeepSWE
67.5
70.0
73.0
59.0
67.0
46.2
Terminal-Bench 2.1
88.3
88.0
88.8
84.6
83.4
82.7
Agentisch
BrowseComp
91.2
88.0
90.4
84.3
84.4
—
GDPval-AA v2 (Elo)
1686
1747
1736
1593
1491
1510
OSWorld 2.0
58.3
66.1
62.6
55.7
49.5
—
Vision
MMMU-Pro
81.6 / 83.4
81.2 / 86.5
83.0 / 84.6
78.9 / 82.7
81.2 / 83.2
—
MathVision
94.3 / 97.8
94.8 / 98.6
95.8 / 97.8
86.7 / 97.1
92.2 / 96.8
—
Die DeepSWE-Benchmarks zeigen, dass Kimi-K3 sehr effizient arbeitet!

Zuletzt aktualisiert
War das hilfreich?

