GLM-5: Leitfaden zum lokalen Ausführen
Führe das neue GLM-5-Modell von Z.ai auf deinem eigenen lokalen Gerät aus!
GLM-5 ist Z.ais neuestes Reasoning-Modell und liefert stärkere Leistungen beim Coden, bei Agenten und im Chat als GLM-4.7, und ist für Long-Context-Reasoning konzipiert. Es steigert die Leistung bei Benchmarks wie Humanity's Last Exam auf 50,4 % (+7,6 %), BrowseComp auf 75,9 % (+8,4 %) und Terminal-Bench-2.0 auf 61,1 % (+28,3 %).
Das vollständige Modell mit 744B Parametern (40B aktiv) hat ein 200K-Kontext Fenster und wurde auf 28,5T Tokens vortrainiert. Das vollständige GLM-5-Modell benötigt 1,65 TB Festplattenspeicher, während das Unsloth Dynamic 2-Bit GGUF die Größe reduziert auf 241 GB (-85%), und dynamisch 1-Bit sind es 176 GB (-89 %): GLM-5-GGUF
Alle Uploads verwenden Unsloth Dynamic 2.0 für Spitzenleistung bei der Quantisierung – daher werden bei 1-Bit wichtige Layer auf 8- oder 16-Bit hochgestuft. Vielen Dank an Z.ai für den Day-Zero-Zugriff auf Unsloth.
⚙️ Nutzungsanleitung
Die dynamische 2-Bit-Quantisierung UD-IQ2_XXS verwendet 241 GB an Festplattenspeicher – das passt direkt auf einen Mac mit 256 GB Unified Memory, und funktioniert auch gut in einer 1x24-GB-Karte und 256 GB RAM mit MoE-Offloading. Das 1-Bit Quant passt in 180 GB RAM, und 8-Bit benötigt 805 GB RAM.
Für die beste Leistung stellen Sie sicher, dass Ihr insgesamt verfügbarer Speicher (VRAM + Systemspeicher) größer ist als die Größe der quantisierten Modelldatei, die Sie herunterladen. Falls nicht, kann llama.cpp weiterhin per SSD/HDD-Offloading laufen, aber die Inferenz wird langsamer sein.
Empfohlene Einstellungen
Verwenden Sie unterschiedliche Einstellungen für verschiedene Anwendungsfälle:
temperature = 1.0
temperature = 0.7
top_p = 0.95
top_p = 1.0
max. neue Token = 131072
max. neue Token = 16384
Wiederholungsstrafe = deaktiviert oder 1,0
Wiederholungsstrafe = deaktiviert oder 1,0
Min_P = 0.01(Der Standardwert von llama.cpp ist 0.05)Maximales Kontextfenster:
202,752.Für mehrstufige agentische Aufgaben (τ²-Bench und Terminal Bench 2) schalten Sie bitte den Preserved Thinking-Modus ein.
GLM-5-Tutorials ausführen:
✨ In llama.cpp ausführen
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch die Build-Anweisungen unten befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:IQ2_XXS) ist der Quantisierungstyp. Sie können auch über Hugging Face (Punkt 3) herunterladen. Das ist ähnlich wie ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp dass es an einem bestimmten Ort gespeichert wird. Denken Sie daran, dass das Modell nur eine maximale Kontextlänge von 200K hat.
Befolgen Sie dies für allgemeine Anweisungen Anwendungsfälle:
Befolgen Sie dies für Tool-Aufrufe Anwendungsfälle:
Laden Sie das Modell über Folgendes herunter (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können wählen UD-Q2_K_XL (dynamische 2-Bit-Quantisierung) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, unsere dynamische 2-Bit-Quantisierung zu verwenden, UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging
Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 16384 für die Kontextlänge, --n-gpu-layers 2 für GPU-Offloading, wie viele Layer ausgelagert werden. Versuchen Sie, diesen Wert anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie ihn außerdem, wenn Sie nur CPU-Inferenz haben.
🦙 Llama-Server-Serving & OpenAIs Completion-Bibliothek
Um GLM-5 für den produktiven Einsatz bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. über tmux, stellen Sie das Modell wie folgt bereit:
Dann führen Sie in einem neuen Terminal nach pip install openaiFolgendes aus:
Und Sie erhalten das folgende Beispiel eines Snake-Spiels:

💻 vLLM-Bereitstellung
Sie können jetzt Z.ai's FP8-Version des Modells über vLLM bereitstellen. Sie benötigen 860 GB VRAM oder mehr, daher werden mindestens 8xH200 (141x8 = 1128 GB) empfohlen. 8xB200 funktioniert gut. Installieren Sie zunächst die Nightly-Version von vllm:
Um den FP8-KV-Cache zu deaktivieren (reduziert den Speicherverbrauch um 50 %), entfernen Sie --kv-cache-dtype fp8
Anschließend können Sie das bereitgestellte Modell über die OpenAI-API aufrufen:
🔨Tool-Calling mit GLM 5
Siehe Tool Calling Guide für weitere Details zum Tool-Calling. In einem neuen Terminal (wenn Sie tmux verwenden, drücken Sie CTRL+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:
Anschließend verwenden wir die untenstehenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:
Nach dem Start von GLM 5 über llama-server wie in GLM-5 oder siehe Tool Calling Guide für weitere Details können wir dann einige Tool-Calls durchführen.
📊 Benchmarks
Weiter unten können Sie die Benchmarks in Tabellenform sehen:

HLE
30.5
24.8
25.1
31.5
28.4
37.2
35.4
HLE (mit Tools)
50.4
42.8
40.8
51.8
43.4*
45.8*
45.5*
AIME 2026 I
92.7
92.9
92.7
92.5
93.3
90.6
-
HMMT Nov. 2025
96.9
93.5
90.2
91.1
91.7
93.0
97.1
IMOAnswerBench
82.5
82.0
78.3
81.8
78.5
83.3
86.3
GPQA-Diamond
86.0
85.7
82.4
87.6
87.0
91.9
92.4
SWE-bench Verified
77.8
73.8
73.1
76.8
80.9
76.2
80.0
SWE-bench Multilingual
73.3
66.7
70.2
73.0
77.5
65.0
72.0
Terminal-Bench 2.0 (Terminus 2)
56.2 / 60.7 †
41.0
39.3
50.8
59.3
54.2
54.0
Terminal-Bench 2.0 (Claude Code)
56.2 / 61.1 †
32.8
46.4
-
57.9
-
-
CyberGym
43.2
23.5
17.3
41.3
50.6
39.9
-
BrowseComp
62.0
52.0
51.4
60.6
37.0
37.8
-
BrowseComp (mit Kontextverwaltung)
75.9
67.5
67.6
74.9
67.8
59.2
65.8
BrowseComp-Zh
72.7
66.6
65.0
62.3
62.4
66.8
76.1
τ²-Bench
89.7
87.4
85.3
80.2
91.6
90.7
85.5
MCP-Atlas (öffentliches Set)
67.8
52.0
62.2
63.8
65.2
66.6
68.0
Tool-Decathlon
38.0
23.8
35.2
27.8
43.5
36.4
46.3
Vending Bench 2
$4,432.12
$2,376.82
$1,034.00
$1,198.46
$4,967.06
$5,478.16
$3,591.33
Zuletzt aktualisiert
War das hilfreich?

