🌘Kimi K2.7 Code - So lokal ausführen
Schritt-für-Schritt-Anleitung zum Ausführen von Kimi K2.7 Code auf Ihrem eigenen lokalen Gerät.
Kimi K2.7 Code ist Moonshot AIs agentisches Codierungsmodell und baut auf K2.6 auf, um die Aufgabenerfüllung zu verbessern und dabei etwa 30 % weniger Denk-Token zu verwenden. Das 1T-Parameter-(32B aktiv)-MoE-Modell unterstützt nur Denken, Vision und 256K Kontext. Es liefert SOTA-Open-Performance bei Vision-, Coding-, agentischen, Langkontext- und Chat-Aufgaben. Vollständige Präzision erfordert 605 GB Festplattenspeicher; Unsloth Dynamisch 2-Bit benötigt 325 GB (-48 %). Ausführen Kimi-K2.7-Code-GGUF über Unsloth Studio oder llama.cpp.
Unsloth Dynamic Quants hebt wichtige Schichten auf 8-Bit an und 1-Bit benötigt 310 GB+ VRAM/RAM Setups. Für verlustfrei Kimi K2.6, verwende Q8 (UD-Q8_K_XL), was nur 10 GB größer ist als Q4 (UD-Q4_K_XL). Du kannst Kimi K2.7 Code über einen Mac Studio oder DGX Station.
Tabelle: Hardwareanforderungen (Einheiten = Gesamtspeicher: RAM + VRAM, oder einheitlicher Speicher)
310 GB
325–350 GB
385–470 GB
605 GB
📊 Quantisierungsanalyse
Wie Kimi-K2.6, UD-Q8_K_XL ist verlustfrei, weil Kimi int4 für die MoE-Gewichte und BF16 für alles andere verwendet, und Q8_K_XL folgt dem. Daher verwenden wir für die Konvertierung von Kimi-K2.6 dieselbe Dynamic-Methodik. UD-Q4_K_XL ist ähnlich, außer dass die übrigen Tensoren Q8_0sind, also nahezu volle Präzision haben und 600 GB RAM/VRAM benötigen. UD-Q8_K_XL ist „wirklich verlustfrei“.
Festplattenspeicher
339 GB
584 GB
595 GB
Perplexity
~2.4131
~1.8420
~1.8419
Wir sind der jukofyorksFeststellung gefolgt, dass const float d = max / -7; statt des Standardwerts const float d = max / -8; während des Quantisierungsprozesses nur auf die MoE-Schichten. Dieser Bijektions-Patch auf INT4-nativen MoEs ermöglicht es dem Q4_0 Quant-Typ, den absoluten Fehler von 1,8 % auf nahezu 0 % (Epsilon) zu reduzieren. Unten ist beispielsweise das Histogramm für Kimi-K2.7-Code, und man sieht, dass -8 vollständig ungenutzt ist:

Beachte, dass wir andere Schichten ebenfalls in BF16 belassen und nicht smart „Q4_0“ verwenden müssen. Unten zeigen wir die Fehlerdiagramme für beide im Vergleich zur BF16-Basislinie. UD-Q8-K_XL ist tatsächlich „verlustfrei“ mit einem kleinen Unterschied im Maschinen-Epsilon beim Konvertieren von Q4_0 zu BF16. Q4_K_XL hat also einen gewissen Quantisierungsfehler aufgrund der Verwendung von Q8_0, während Q8_K_XL nahezu verlustfrei ist, abgesehen von der BF16-Rundung.

Für Q4_K_XL zeigen wir außerdem den Fehler pro Tensor von Q8_0 gegenüber BF16. Im Allgemeinen gibt es einen gewissen Fehler zwischen Q8_K_XL (nahezu verlustfrei) und Q4_K_XL, aber nicht viel.

⚙️ Anleitung zur Verwendung
Kimi K2.7 Code ist nur für Denkmodus, mit preserve_thinking immer aktiviert. Der Instant-Modus wird nicht unterstützt.
temperature = 1.0
top_p = 0.95
Empfohlene Kontextlänge =
98,304(bis zu262,144)
Wenn das Modell passt, erhältst du >100 Token/s bei Verwendung von B200s. Wir empfehlen UD-Q2_K_XL (345 GB) als guten Kompromiss zwischen Größe und Qualität. Beste Faustregel: RAM+VRAM ≈ die Quant-Größe; andernfalls funktioniert es trotzdem, nur langsamer wegen Auslagerung.
Chat-Vorlage für Kimi K2.7-Code
Ausführen tokenizer.apply_chat_template([{"role": "user", "content": "Was ist 1+1?"},]) ergibt:
Wenn wir auch Tools wie in Tool Calling Guidereferenziert eingeben, sehen wir Folgendes:
Kimi K2.7 Code-Anleitung ausführen
🦥 Kimi-K2.7-Code in Unsloth Studio ausführen
Kimi K2.7 Code kann ausgeführt werden in Unsloth Studio, einer Open-Source-Web-UI für lokale KI. Unsloth Studio entlädt automatisch in den RAM und erkennt Multi-GPU-Setups. Mit Unsloth Studio kannst du Modelle lokal ausführen auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz via llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren und starten
Zur Installation führe in deinem Terminal aus:
MacOS, Linux, WSL:
Windows PowerShell:
Unsloth starten
MacOS, Linux, WSL und Windows:
Dann öffne http://127.0.0.1:8888 (oder deine spezielle URL) in deinem Browser.
Kimi K2.7-Code suchen und herunterladen
Unsloth Studio entlädt automatisch in den RAM und erkennt Multi-GPU-Setups. Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich später erneut anmelden.
Dann gehe zum Studio-Chat Tab und suche nach Kimi-K2.7 Code in der Suchleiste und lade dein gewünschtes Modell und die gewünschte Quantisierung herunter. Stelle sicher, dass du genug Rechenleistung hast, um das Modell auszuführen.

Kimi-K2.7-Code ausführen
Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen kannst du unsere Unsloth-Studio-Inferenzanleitung.

🦙 Kimi K2.7 Code in llama.cpp ausführen
Für diese Anleitung werden wir die UD-Q2_K_XL Quantisierung verwenden, die mindestens 345 GB RAM erfordert. Du kannst den Quantisierungstyp gerne ändern. GGUF: Kimi-K2.7-Code-GGUF
Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn du eine CPU hast.
Besorge dir die neueste llama.cpp auf hier auf GitHub. Du kannst auch den Build-Anweisungen unten folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple-Mac-/Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Lass uns zuerst ein Bild holen! Du kannst auch Bilder hochladen. Wir verwenden https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, das einfach unser Mini-Logo ist und zeigt, wie Finetunes mit Unsloth erstellt werden:

Holen wir das 2. Bild von https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

Du kannst jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wähle zuerst den gewünschten Quantisierungstyp wie Q2_K_XL. Verwende außerdem export LLAMA_CACHE="folder" um llama.cpp zu zwingen, an einem bestimmten Ort zu speichern. Beachte, dass dieser Download-Prozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.
Wenn du das Modell manuell herunterladen möchtest, können wir das Modell mit dem folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führe das Modell im Gesprächsmodus aus:
Dann wirst du Folgendes sehen:

Dann verwende /image um beide Bilder zu laden und zu fragen „Was ist dieses Bild“:

und du wirst so etwas wie unten erhalten:

Beim 2. Bild des Faultiers:

Was dir Folgendes liefern wird:

📊 Benchmarks
Du kannst weiter unten Benchmarks in Tabellenform ansehen:

Coding
Kimi Code Bench v2
62.0
50.9
69.0
67.4
Program Bench
53.6
48.3
69.1
63.8
MLS Bench Lite
35.1
26.7
35.5
42.8
Agentic
Kimi Claw 24/7 Bench
46.9
42.9
52.8
50.4
MCP Atlas
76.0
69.4
79.4
81.3
MCP Mark Verified
81.1
72.8
92.9
76.4
Zuletzt aktualisiert
War das hilfreich?

