For the complete documentation index, see llms.txt. This page is also available as Markdown.

🥝Kimi K2.5: Leitfaden zum lokalen Ausführen

Leitfaden zum Ausführen von Kimi-K2.5 auf deinem eigenen lokalen Gerät!

Kimi-K2.5 ist das neue Modell von Moonshot, das SOTA-Performance in Vision-, Coding-, agentischen und Chat-Aufgaben erzielt. Das hybride Reasoning-Modell mit 1T Parametern benötigt 600 GB Festplattenspeicher, während die quantisierte Unsloth Dynamic 1,8-Bit Version reduziert dies auf 240 GB (-60 % Größe): Kimi-K2.5-GGUF

Alle Uploads verwenden Unsloth Dynamic 2.0 für SOTA-Aider- und 5-shot-MMLU-Performance. Sieh, wie unsere Dynamic-1–2-Bit-GGUFs auf Coding-Benchmarks.

⚙️ Empfohlene Systemvoraussetzungen

Du benötigst >240 GB Speicherplatz um die 1-Bit-Quantisierung auszuführen!

Für die beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher (VRAM + Systemspeicher) größer ist als die Größe der quantisierten Modelldatei, die du herunterlädst. Falls nicht, kann llama.cpp weiterhin per SSD/HDD-Offloading laufen, aber die Inferenz wird langsamer.

Die 1,8-Bit-Quantisierung (UD-TQ1_0) läuft auf einer einzelnen 24-GB-GPU, wenn du alle MoE-Schichten in den System-RAM (oder eine schnelle SSD) auslagerst. Bei ~256 GB RAM kannst du mit ~10 Token/s rechnen. Das vollständige Kimi-K2.5-Modell ist 630 GB groß und benötigt typischerweise mindestens 4× H200-GPUs.

Wenn das Modell hineinpasst, erhältst du >40 Token/s bei Verwendung einer B200.

Um das Modell in nahezu Vollpräzision, kannst du die 4-Bit- oder 5-Bit-Quants verwenden. Du kannst zur Sicherheit auch eine höhere wählen.

Für starke Performance solltest du >240 GB Unified Memory (oder kombiniertes RAM+VRAM) anstreben, um 10+ Token/s zu erreichen. Wenn du darunter liegst, funktioniert es zwar, aber die Geschwindigkeit sinkt (llama.cpp kann weiterhin über mmap/Disk-Offloading laufen) und kann von ~10 Token/s auf <2 Token/s fallen.

Wir empfehlen UD-Q2_K_XL (375 GB) als guten Kompromiss zwischen Größe und Qualität. Die beste Faustregel: RAM+VRAM ≈ die Größe der Quantisierung; andernfalls funktioniert es weiterhin, nur langsamer wegen des Offloadings.

🥝 Leitfaden für Kimi-K2.5

Kimi-K2.5 benötigt für unterschiedliche Anwendungsfälle unterschiedliche Sampling-Parameter.

Derzeit gibt es keine Vision-Unterstützung für das Modell, aber hoffentlich unterstützt llama.cpp es bald.

🌙 Nutzungsanleitung:

Laut Moonshot AI sind dies die empfohlenen Einstellungen für die Kimi-K2.5-Inferenz:

Standardeinstellungen (Sofortmodus)
Denkmodus

temperature = 0.6

temperature = 1.0

top_p = 0.95

top_p = 0.95

min_p = 0.01

min_p = 0.01

  • Setze die Temperatur auf 1.0 um Wiederholungen und Inkohärenz zu reduzieren.

  • Empfohlene Kontextlänge = 98.304 (bis zu 256K)

  • Hinweis: Die Verwendung verschiedener Tools kann andere Einstellungen erfordern

Wir empfehlen, min_p auf 0.01 um das Auftreten unwahrscheinlicher Tokens mit niedrigen Wahrscheinlichkeiten zu unterdrücken. Und deaktiviere oder setze repeat penalty = 1.0 falls nötig.

Chat-Vorlage für Kimi K2.5

Ausführen tokenizer.apply_chat_template([{"role": "user", "content": "What is 1+1?"},]) erhältst du:

🦥 Kimi-K2.5 in Unsloth Studio ausführen

Kimi-K2.5 kann ausgeführt werden in Unsloth Studiounserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Führen Sie dies in Ihrem Terminal aus:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://localhost:8888 in Ihrem Browser.

3

Kimi-K2.5 suchen und herunterladen

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern und dich später erneut anzumelden. Anschließend siehst du einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Du kannst ihn jederzeit überspringen und direkt zum Chat gehen.

Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach Kimi-K2.5 in der Suchleiste und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Stelle sicher, dass du genügend Rechenleistung hast, um das Modell auszuführen.

4

Kimi-K2.5 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

✨ Kimi K2.5 in llama.cpp ausführen

Für diesen Leitfaden verwenden wir die kleinste 1-Bit-Quantisierung, die 240 GB groß ist. Du kannst den Quantisierungstyp gern auf 2-Bit, 3-Bit usw. ändern. Um das Modell in nahezu Vollpräzision, kannst du die 4-Bit- oder 5-Bit-Quants verwenden. Du kannst zur Sicherheit auch eine höhere wählen.

  1. Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

  1. Wenn Sie llama.cpp direkt Modelle zu laden, kannst du Folgendes tun: (:UD-TQ1_0) ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp dass an einem bestimmten Speicherort gespeichert wird.

  1. --fit on passt das Modell automatisch an dein System an. Wenn du nicht --fit on und du ungefähr 360 GB kombinierten GPU-Speicher hast, entferne -ot ".ffn_.*_exps.=CPU" um maximale Geschwindigkeit zu erreichen.

Verwenden Sie --fit on für das automatische Anpassen an GPUs und CPUs. Wenn das nicht funktioniert, siehe unten:

Bitte probiere -ot ".ffn_.*_exps.=CPU" um alle MoE-Schichten auf die CPU auszulagern! Dadurch kannst du effektiv alle Nicht-MoE-Schichten auf 1 GPU unterbringen, was die Generierungsgeschwindigkeit verbessert. Du kannst den Regex-Ausdruck anpassen, um mehr Schichten unterzubringen, wenn du mehr GPU-Kapazität hast.

Wenn Sie etwas mehr GPU-Speicher haben, versuchen Sie -ot ".ffn_(up|down)_exps.=CPU" Dies lagert die MoE-Layer für Up- und Down-Projektionen aus.

Versuchen Sie -ot ".ffn_(up)_exps.=CPU" wenn Sie noch mehr GPU-Speicher haben. Dadurch werden nur die MoE-Layer für Up-Projektionen ausgelagert.

Und schließlich lagere alle Schichten via -ot ".ffn_.*_exps.=CPU" Das verbraucht am wenigsten VRAM.

Sie können den Regex auch anpassen, zum Beispiel -ot "\.(6|7|8|9|[0-9][0-9]|[0-9][0-9][0-9])\.ffn_(gate|up|down)_exps.=CPU" bedeutet, dass Gate-, Up- und Down-MoE-Layer ausgelagert werden, aber erst ab der 6. Schicht.

  1. Laden Sie das Modell über herunter (nach der Installation von pip install huggingface_hub hf_transfer ). Wir empfehlen, unsere dynamische 2-Bit-Quantisierung UD-Q2_K_XL zu verwenden, um Größe und Genauigkeit auszubalancieren. Alle Versionen unter: huggingface.co/unsloth/Kimi-K2.5-GGUF Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

Wenn du feststellst, dass Downloads bei etwa 90 bis 95 % hängen bleiben, siehe bitte unsere Fehlerbehebungsanleitung.

  1. Beliebigen Prompt ausführen.

  2. Bearbeiten --ctx-size 16384 für die Kontextlänge. Du kannst dies auch weglassen, um die automatische Ermittlung der Kontextlänge via --fit on

  1. Als Beispiel probiere: "Erstelle ein Flappy-Bird-Spiel in HTML", und du erhältst:

✨ Bereitstellen mit llama-server und OpenAIs Completion-Bibliothek

Nachdem du llama.cpp gemäß Kimi K2.5, kannst du Folgendes verwenden, um einen OpenAI-kompatiblen Server zu starten:

Dann verwende anschließend OpenAIs Python-Bibliothek pip install openai :

Und wir erhalten:

Und im anderen llama-server-Fenster:

📊 Benchmarks

Du kannst weiter unten Benchmarks in Tabellenform ansehen:

Schlussfolgern & Wissen

Benchmark
Kimi K2.5
GPT-5.2
Claude 4.5 Opus
Gemini 3 Pro
DeepSeek V3.2
Qwen3-VL-235B-A22B-Thinking

HLE-Full

30.1

34.5

30.8

37.5

25.1†

-

HLE-Full (mit Tools)

50.2

45.5

43.2

45.8

40.8†

-

AIME 2025

96.1

100

92.8

95.0

93.1

-

HMMT 2025 (Feb)

95.4

99.4

92.9*

97.3*

92.5

-

IMO-AnswerBench

81.8

86.3

78.5*

83.1*

78.3

-

GPQA-Diamond

87.6

92.4

87.0

91.9

82.4

-

MMLU-Pro

87.1

86.7*

89.3*

90.1

85.0

-

Bild & Video

Benchmark
Kimi K2.5
GPT-5.2
Claude 4.5 Opus
Gemini 3 Pro
DeepSeek V3.2
Qwen3-VL-235B-A22B-Thinking

MMMU-Pro

78.5

79.5*

74.0

81.0

-

69.3

CharXiv (RQ)

77.5

82.1

67.2*

81.4

-

66.1

MathVision

84.2

83.0

77.1*

86.1*

-

74.6

MathVista (mini)

90.1

82.8*

80.2*

89.8*

-

85.8

ZeroBench

9

9*

3*

8*

-

4*

ZeroBench (mit Tools)

11

7*

9*

12*

-

3*

OCRBench

92.3

80.7*

86.5*

90.3*

-

87.5

OmniDocBench 1.5

88.8

85.7

87.7*

88.5

-

82.0*

InfoVQA (val)

92.6

84*

76.9*

57.2*

-

89.5

SimpleVQA

71.2

55.8*

69.7*

69.7*

-

56.8*

WorldVQA

46.3

28.0

36.8

47.4

-

23.5

VideoMMMU

86.6

85.9

84.4*

87.6

-

80.0

MMVU

80.4

80.8*

77.3

77.5

-

71.1

MotionBench

70.4

64.8

60.3

70.3

-

-

VideoMME

87.4

86.0*

-

88.4*

-

79.0

LongVideoBench

79.8

76.5*

67.2*

77.7*

-

65.6*

LVBench

75.9

-

-

73.5*

-

63.6

Programmierung

Benchmark
Kimi K2.5
GPT-5.2
Claude 4.5 Opus
Gemini 3 Pro
DeepSeek V3.2
Qwen3-VL-235B-A22B-Thinking

SWE-Bench Verified

76.8

80.0

80.9

76.2

73.1

-

SWE-Bench Pro

50.7

55.6

55.4*

-

-

-

SWE-Bench Multilingual

73.0

72.0

77.5

65.0

70.2

-

Terminal Bench 2.0

50.8

54.0

59.3

54.2

46.4

-

PaperBench

63.5

63.7*

72.9*

-

47.1

-

CyberGym

41.3

-

50.6

39.9*

17.3*

-

SciCode

48.7

52.1

49.5

56.1

38.9

-

OJBench (cpp)

57.4

-

54.6*

68.5*

54.7*

-

LiveCodeBench (v6)

85.0

-

82.2*

87.4*

83.3

-

Langer Kontext

Benchmark
Kimi K2.5
GPT-5.2
Claude 4.5 Opus
Gemini 3 Pro
DeepSeek V3.2
Qwen3-VL-235B-A22B-Thinking

Longbench v2

61.0

54.5*

64.4*

68.2*

59.8*

-

AA-LCR

70.0

72.3*

71.3*

65.3*

64.3*

-

Agentische Suche

Benchmark
Kimi K2.5
GPT-5.2
Claude 4.5 Opus
Gemini 3 Pro
DeepSeek V3.2
Qwen3-VL-235B-A22B-Thinking

BrowseComp

60.6

65.8

37.0

37.8

51.4

-

BrowseComp (mit Kontextverwaltung)

74.9

65.8

57.8

59.2

67.6

-

BrowseComp (Agentenschwarm)

78.4

-

-

-

-

-

WideSearch (item-f1)

72.7

-

76.2*

57.0

32.5*

-

WideSearch (item-f1 Agentenschwarm)

79.0

-

-

-

-

-

DeepSearchQA

77.1

71.3*

76.1*

63.2*

60.9*

-

FinSearchCompT2&T3

67.8

-

66.2*

49.9

59.1*

-

Seal-0

57.4

45.0

47.7*

45.5*

49.5*

-

Anmerkungen

  • * = von den Autoren neu berechneter Score (zuvor nicht öffentlich verfügbar).

  • = Der DeepSeek-V3.2-Score entspricht seinem Nur-Text-Teildatensatz (wie in den Fußnoten vermerkt).

  • - = nicht bewertet / nicht verfügbar.

Zuletzt aktualisiert

War das hilfreich?