🥝Kimi K2.5: Leitfaden zum lokalen Ausführen
Leitfaden zum Ausführen von Kimi-K2.5 auf deinem eigenen lokalen Gerät!
Kimi-K2.5 ist das neue Modell von Moonshot, das SOTA-Performance in Vision-, Coding-, agentischen und Chat-Aufgaben erzielt. Das hybride Reasoning-Modell mit 1T Parametern benötigt 600 GB Festplattenspeicher, während die quantisierte Unsloth Dynamic 1,8-Bit Version reduziert dies auf 240 GB (-60 % Größe): Kimi-K2.5-GGUF
Alle Uploads verwenden Unsloth Dynamic 2.0 für SOTA-Aider- und 5-shot-MMLU-Performance. Sieh, wie unsere Dynamic-1–2-Bit-GGUFs auf Coding-Benchmarks.
⚙️ Empfohlene Systemvoraussetzungen
Die 1,8-Bit-Quantisierung (UD-TQ1_0) läuft auf einer einzelnen 24-GB-GPU, wenn du alle MoE-Schichten in den System-RAM (oder eine schnelle SSD) auslagerst. Bei ~256 GB RAM kannst du mit ~10 Token/s rechnen. Das vollständige Kimi-K2.5-Modell ist 630 GB groß und benötigt typischerweise mindestens 4× H200-GPUs.
Wenn das Modell hineinpasst, erhältst du >40 Token/s bei Verwendung einer B200.
Um das Modell in nahezu Vollpräzision, kannst du die 4-Bit- oder 5-Bit-Quants verwenden. Du kannst zur Sicherheit auch eine höhere wählen.
Für starke Performance solltest du >240 GB Unified Memory (oder kombiniertes RAM+VRAM) anstreben, um 10+ Token/s zu erreichen. Wenn du darunter liegst, funktioniert es zwar, aber die Geschwindigkeit sinkt (llama.cpp kann weiterhin über mmap/Disk-Offloading laufen) und kann von ~10 Token/s auf <2 Token/s fallen.
Wir empfehlen UD-Q2_K_XL (375 GB) als guten Kompromiss zwischen Größe und Qualität. Die beste Faustregel: RAM+VRAM ≈ die Größe der Quantisierung; andernfalls funktioniert es weiterhin, nur langsamer wegen des Offloadings.
🥝 Leitfaden für Kimi-K2.5
Kimi-K2.5 benötigt für unterschiedliche Anwendungsfälle unterschiedliche Sampling-Parameter.
Derzeit gibt es keine Vision-Unterstützung für das Modell, aber hoffentlich unterstützt llama.cpp es bald.
Um das Modell in Vollpräzision auszuführen, musst du nur die 4-Bit- oder 5-Bit-Dynamic-GGUFs (z. B. UD_Q4_K_XL) verwenden, da das Modell ursprünglich im INT4-Format veröffentlicht wurde.
Du kannst zur Sicherheit eine Quantisierung mit höherer Bitzahl wählen, falls es kleine Quantisierungsunterschiede gibt, aber in den meisten Fällen ist das unnötig.
🌙 Nutzungsanleitung:
Laut Moonshot AI sind dies die empfohlenen Einstellungen für die Kimi-K2.5-Inferenz:
temperature = 0.6
temperature = 1.0
top_p = 0.95
top_p = 0.95
min_p = 0.01
min_p = 0.01
Setze die Temperatur auf 1.0 um Wiederholungen und Inkohärenz zu reduzieren.
Empfohlene Kontextlänge = 98.304 (bis zu 256K)
Hinweis: Die Verwendung verschiedener Tools kann andere Einstellungen erfordern
Chat-Vorlage für Kimi K2.5
Ausführen tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},]) erhältst du:
🦥 Kimi-K2.5 in Unsloth Studio ausführen
Kimi-K2.5 kann ausgeführt werden in Unsloth Studiounserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-P usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Führen Sie dies in Ihrem Terminal aus:
macOS, Linux, WSL:
Windows PowerShell:
Die Installation wird schnell sein und dauert ca. 1–2 Minuten.
Unsloth starten
MacOS, Linux, WSL und Windows:
Dann öffnen Sie http://localhost:8888 in Ihrem Browser.
Kimi-K2.5 suchen und herunterladen
Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern und dich später erneut anzumelden. Anschließend siehst du einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Du kannst ihn jederzeit überspringen und direkt zum Chat gehen.
Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach Kimi-K2.5 in der Suchleiste und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Stelle sicher, dass du genügend Rechenleistung hast, um das Modell auszuführen.

Kimi-K2.5 ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

✨ Kimi K2.5 in llama.cpp ausführen
Für diesen Leitfaden verwenden wir die kleinste 1-Bit-Quantisierung, die 240 GB groß ist. Du kannst den Quantisierungstyp gern auf 2-Bit, 3-Bit usw. ändern. Um das Modell in nahezu Vollpräzision, kannst du die 4-Bit- oder 5-Bit-Quants verwenden. Du kannst zur Sicherheit auch eine höhere wählen.
Holen Sie sich die neueste
llama.cppauf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie-DGGML_CUDA=ONzu-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie
llama.cppdirekt Modelle zu laden, kannst du Folgendes tun: (:UD-TQ1_0) ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wieollama run. Verwenden Sieexport LLAMA_CACHE="folder"um zu erzwingen,llama.cppdass an einem bestimmten Speicherort gespeichert wird.
LLAMA_SET_ROWS=1 macht llama.cpp ein wenig schneller! Nutze es! --fit on passt Modelle automatisch optimal auf all deine GPUs und CPUs an.
--fit onpasst das Modell automatisch an dein System an. Wenn du nicht--fit onund du ungefähr 360 GB kombinierten GPU-Speicher hast, entferne-ot ".ffn_.*_exps.=CPU"um maximale Geschwindigkeit zu erreichen.
Laden Sie das Modell über herunter (nach der Installation von
pip install huggingface_hub hf_transfer). Wir empfehlen, unsere dynamische 2-Bit-Quantisierung UD-Q2_K_XL zu verwenden, um Größe und Genauigkeit auszubalancieren. Alle Versionen unter: huggingface.co/unsloth/Kimi-K2.5-GGUF Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging
Beliebigen Prompt ausführen.
Bearbeiten
--ctx-size 16384für die Kontextlänge. Du kannst dies auch weglassen, um die automatische Ermittlung der Kontextlänge via--fit on
Als Beispiel probiere: "Erstelle ein Flappy-Bird-Spiel in HTML", und du erhältst:

✨ Bereitstellen mit llama-server und OpenAIs Completion-Bibliothek
Die Verwendung von --kv-unified kann das Inferenz-Serving in llama.cpp schneller machen! Siehe https://www.reddit.com/r/LocalLLaMA/comments/1qnwa33/glm_47_flash_huge_performance_improvement_with_kvu/
Nachdem du llama.cpp gemäß Kimi K2.5, kannst du Folgendes verwenden, um einen OpenAI-kompatiblen Server zu starten:
Dann verwende anschließend OpenAIs Python-Bibliothek pip install openai :
Und wir erhalten:

Und im anderen llama-server-Fenster:

📊 Benchmarks
Du kannst weiter unten Benchmarks in Tabellenform ansehen:

Schlussfolgern & Wissen
HLE-Full
30.1
34.5
30.8
37.5
25.1†
-
HLE-Full (mit Tools)
50.2
45.5
43.2
45.8
40.8†
-
AIME 2025
96.1
100
92.8
95.0
93.1
-
HMMT 2025 (Feb)
95.4
99.4
92.9*
97.3*
92.5
-
IMO-AnswerBench
81.8
86.3
78.5*
83.1*
78.3
-
GPQA-Diamond
87.6
92.4
87.0
91.9
82.4
-
MMLU-Pro
87.1
86.7*
89.3*
90.1
85.0
-
Bild & Video
MMMU-Pro
78.5
79.5*
74.0
81.0
-
69.3
CharXiv (RQ)
77.5
82.1
67.2*
81.4
-
66.1
MathVision
84.2
83.0
77.1*
86.1*
-
74.6
MathVista (mini)
90.1
82.8*
80.2*
89.8*
-
85.8
ZeroBench
9
9*
3*
8*
-
4*
ZeroBench (mit Tools)
11
7*
9*
12*
-
3*
OCRBench
92.3
80.7*
86.5*
90.3*
-
87.5
OmniDocBench 1.5
88.8
85.7
87.7*
88.5
-
82.0*
InfoVQA (val)
92.6
84*
76.9*
57.2*
-
89.5
SimpleVQA
71.2
55.8*
69.7*
69.7*
-
56.8*
WorldVQA
46.3
28.0
36.8
47.4
-
23.5
VideoMMMU
86.6
85.9
84.4*
87.6
-
80.0
MMVU
80.4
80.8*
77.3
77.5
-
71.1
MotionBench
70.4
64.8
60.3
70.3
-
-
VideoMME
87.4
86.0*
-
88.4*
-
79.0
LongVideoBench
79.8
76.5*
67.2*
77.7*
-
65.6*
LVBench
75.9
-
-
73.5*
-
63.6
Programmierung
SWE-Bench Verified
76.8
80.0
80.9
76.2
73.1
-
SWE-Bench Pro
50.7
55.6
55.4*
-
-
-
SWE-Bench Multilingual
73.0
72.0
77.5
65.0
70.2
-
Terminal Bench 2.0
50.8
54.0
59.3
54.2
46.4
-
PaperBench
63.5
63.7*
72.9*
-
47.1
-
CyberGym
41.3
-
50.6
39.9*
17.3*
-
SciCode
48.7
52.1
49.5
56.1
38.9
-
OJBench (cpp)
57.4
-
54.6*
68.5*
54.7*
-
LiveCodeBench (v6)
85.0
-
82.2*
87.4*
83.3
-
Langer Kontext
Longbench v2
61.0
54.5*
64.4*
68.2*
59.8*
-
AA-LCR
70.0
72.3*
71.3*
65.3*
64.3*
-
Agentische Suche
BrowseComp
60.6
65.8
37.0
37.8
51.4
-
BrowseComp (mit Kontextverwaltung)
74.9
65.8
57.8
59.2
67.6
-
BrowseComp (Agentenschwarm)
78.4
-
-
-
-
-
WideSearch (item-f1)
72.7
-
76.2*
57.0
32.5*
-
WideSearch (item-f1 Agentenschwarm)
79.0
-
-
-
-
-
DeepSearchQA
77.1
71.3*
76.1*
63.2*
60.9*
-
FinSearchCompT2&T3
67.8
-
66.2*
49.9
59.1*
-
Seal-0
57.4
45.0
47.7*
45.5*
49.5*
-
Anmerkungen
*= von den Autoren neu berechneter Score (zuvor nicht öffentlich verfügbar).†= Der DeepSeek-V3.2-Score entspricht seinem Nur-Text-Teildatensatz (wie in den Fußnoten vermerkt).-= nicht bewertet / nicht verfügbar.
Zuletzt aktualisiert
War das hilfreich?

