For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5: Leitfaden zum lokalen Ausführen

Führe das neue GLM-5-Modell von Z.ai auf deinem eigenen lokalen Gerät aus!

GLM-5 ist Z.ais neuestes Reasoning-Modell und liefert stärkere Leistungen beim Coden, bei Agenten und im Chat als GLM-4.7, und ist für Long-Context-Reasoning konzipiert. Es steigert die Leistung bei Benchmarks wie Humanity's Last Exam auf 50,4 % (+7,6 %), BrowseComp auf 75,9 % (+8,4 %) und Terminal-Bench-2.0 auf 61,1 % (+28,3 %).

Das vollständige Modell mit 744B Parametern (40B aktiv) hat ein 200K-Kontext Fenster und wurde auf 28,5T Tokens vortrainiert. Das vollständige GLM-5-Modell benötigt 1,65 TB Festplattenspeicher, während das Unsloth Dynamic 2-Bit GGUF die Größe reduziert auf 241 GB (-85%), und dynamisch 1-Bit sind es 176 GB (-89 %): GLM-5-GGUF

Alle Uploads verwenden Unsloth Dynamic 2.0 für Spitzenleistung bei der Quantisierung – daher werden bei 1-Bit wichtige Layer auf 8- oder 16-Bit hochgestuft. Vielen Dank an Z.ai für den Day-Zero-Zugriff auf Unsloth.

⚙️ Nutzungsanleitung

Die dynamische 2-Bit-Quantisierung UD-IQ2_XXS verwendet 241 GB an Festplattenspeicher – das passt direkt auf einen Mac mit 256 GB Unified Memory, und funktioniert auch gut in einer 1x24-GB-Karte und 256 GB RAM mit MoE-Offloading. Das 1-Bit Quant passt in 180 GB RAM, und 8-Bit benötigt 805 GB RAM.

Empfohlene Einstellungen

Verwenden Sie unterschiedliche Einstellungen für verschiedene Anwendungsfälle:

Standardeinstellungen (die meisten Aufgaben)
SWE Bench Verified

temperature = 1.0

temperature = 0.7

top_p = 0.95

top_p = 1.0

max. neue Token = 131072

max. neue Token = 16384

Wiederholungsstrafe = deaktiviert oder 1,0

Wiederholungsstrafe = deaktiviert oder 1,0

  • Min_P = 0.01 (Der Standardwert von llama.cpp ist 0.05)

  • Maximales Kontextfenster: 202,752.

  • Für mehrstufige agentische Aufgaben (τ²-Bench und Terminal Bench 2) schalten Sie bitte den Preserved Thinking-Modus ein.

GLM-5-Tutorials ausführen:

✨ In llama.cpp ausführen

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:IQ2_XXS) ist der Quantisierungstyp. Sie können auch über Hugging Face (Punkt 3) herunterladen. Das ist ähnlich wie ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp dass es an einem bestimmten Ort gespeichert wird. Denken Sie daran, dass das Modell nur eine maximale Kontextlänge von 200K hat.

Befolgen Sie dies für allgemeine Anweisungen Anwendungsfälle:

Befolgen Sie dies für Tool-Aufrufe Anwendungsfälle:

3

Laden Sie das Modell über Folgendes herunter (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können wählen UD-Q2_K_XL (dynamische 2-Bit-Quantisierung) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, unsere dynamische 2-Bit-Quantisierung zu verwenden, UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

4

Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 16384 für die Kontextlänge, --n-gpu-layers 2 für GPU-Offloading, wie viele Layer ausgelagert werden. Versuchen Sie, diesen Wert anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie ihn außerdem, wenn Sie nur CPU-Inferenz haben.

🦙 Llama-Server-Serving & OpenAIs Completion-Bibliothek

Um GLM-5 für den produktiven Einsatz bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. über tmux, stellen Sie das Modell wie folgt bereit:

Dann führen Sie in einem neuen Terminal nach pip install openaiFolgendes aus:

Und Sie erhalten das folgende Beispiel eines Snake-Spiels:

💻 vLLM-Bereitstellung

Sie können jetzt Z.ai's FP8-Version des Modells über vLLM bereitstellen. Sie benötigen 860 GB VRAM oder mehr, daher werden mindestens 8xH200 (141x8 = 1128 GB) empfohlen. 8xB200 funktioniert gut. Installieren Sie zunächst die Nightly-Version von vllm:

Um den FP8-KV-Cache zu deaktivieren (reduziert den Speicherverbrauch um 50 %), entfernen Sie --kv-cache-dtype fp8

Anschließend können Sie das bereitgestellte Modell über die OpenAI-API aufrufen:

🔨Tool-Calling mit GLM 5

Siehe Tool Calling Guide für weitere Details zum Tool-Calling. In einem neuen Terminal (wenn Sie tmux verwenden, drücken Sie CTRL+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:

Anschließend verwenden wir die untenstehenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:

Nach dem Start von GLM 5 über llama-server wie in GLM-5 oder siehe Tool Calling Guide für weitere Details können wir dann einige Tool-Calls durchführen.

📊 Benchmarks

Weiter unten können Sie die Benchmarks in Tabellenform sehen:

Benchmark
GLM-5
GLM-4.7
DeepSeek-V3.2
Kimi K2.5
Claude Opus 4.5
Gemini 3 Pro
GPT-5.2 (xhigh)

HLE

30.5

24.8

25.1

31.5

28.4

37.2

35.4

HLE (mit Tools)

50.4

42.8

40.8

51.8

43.4*

45.8*

45.5*

AIME 2026 I

92.7

92.9

92.7

92.5

93.3

90.6

-

HMMT Nov. 2025

96.9

93.5

90.2

91.1

91.7

93.0

97.1

IMOAnswerBench

82.5

82.0

78.3

81.8

78.5

83.3

86.3

GPQA-Diamond

86.0

85.7

82.4

87.6

87.0

91.9

92.4

SWE-bench Verified

77.8

73.8

73.1

76.8

80.9

76.2

80.0

SWE-bench Multilingual

73.3

66.7

70.2

73.0

77.5

65.0

72.0

Terminal-Bench 2.0 (Terminus 2)

56.2 / 60.7 †

41.0

39.3

50.8

59.3

54.2

54.0

Terminal-Bench 2.0 (Claude Code)

56.2 / 61.1 †

32.8

46.4

-

57.9

-

-

CyberGym

43.2

23.5

17.3

41.3

50.6

39.9

-

BrowseComp

62.0

52.0

51.4

60.6

37.0

37.8

-

BrowseComp (mit Kontextverwaltung)

75.9

67.5

67.6

74.9

67.8

59.2

65.8

BrowseComp-Zh

72.7

66.6

65.0

62.3

62.4

66.8

76.1

τ²-Bench

89.7

87.4

85.3

80.2

91.6

90.7

85.5

MCP-Atlas (öffentliches Set)

67.8

52.0

62.2

63.8

65.2

66.6

68.0

Tool-Decathlon

38.0

23.8

35.2

27.8

43.5

36.4

46.3

Vending Bench 2

$4,432.12

$2,376.82

$1,034.00

$1,198.46

$4,967.06

$5,478.16

$3,591.33

Zuletzt aktualisiert

War das hilfreich?