GLM-5.3 – So führen Sie es lokal aus
Führen Sie das neue Modell GLM-5.3 von Z.ai aus.
GLM-5.3 ist Z.ais neues Modell mit 744B Parametern (40B aktiv). Stand Aug. 2026 ist GLM-5.3 das stärkste Open-Model bis heute und erreicht SOTA auf Terminal Bench 3.0 und Agents' Last Exam. GLM-5.3 verwendet dasselbe Basismodell wie GLM-5.2, wobei jeder Gewinn aus dem Post-Training stammt. Das Modell hat ein 1M-Context -Fenster und kann jetzt lokal ausgeführt werden über Unsloth Dynamic GGUFs mit llama.cpp oder Unsloth Desktop.
Dynamic 1-bit GGUF erreicht ~76% Top-1-Genauigkeit und ist dabei 85% kleiner. Dynamic 2-bit erreicht ~81% Genauigkeit und ist dabei 83% kleiner. Da GLM-5.3 dieselbe Größe und Architektur wie GLM-5.2 hat, sind die meisten Anforderungen/Einstellungen gleich. Danke an Z.ai für den Unsloth-Zugriff am ersten Tag. GLM-5.3-GGUF
⚙️ Nutzungsanleitung
Die dynamische 2-Bit-Quant UD-IQ2_M verwendet 239GB Speicherplatz auf der Festplatte und läuft gut auf 256GB RAM Geräten wie 2x NVIDIA DGX Sparks oder einem Mac Studio.
Die 1-Bit Quant passt auf 223GB RAM und 8-Bit benötigt 810GB RAM.
Tabelle: Hardware-Anforderungen für Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)
223GB
245GB
290-360GB
372-475GB
570GB
810GB
Für beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher einschließlich VRAM und System-RAM die Dateigröße des quantisierten Modells mit komfortablem Abstand übersteigt.

Empfohlene Einstellungen
GLM-5.3 hat 3 Denkmodi: Niedrig, Hoch, und Max. Verwende Max Thinking für komplexe Coding-Aufgaben. In Unsloth Desktop kannst du Niedrig, Hoch und Max Thinking ganz einfach über eine UI umschalten.
Verwende diese Einstellungen für die meisten Anwendungsfälle:
Temperatur = 1.0
Temperatur = 1.0
top_p = 0.95
top_p = 1.0
Die maximales Kontextfenster ist 1,048,576.
GLM-5.3 verwendet standardmäßig maximales Reasoning und Thinking kann nicht deaktiviert werden. reasoning_effort kann niedrig, hoch, oder max.
clear_thinking ist standardmäßig false und sie empfehlen true.
Für die Anpassung des Reasoning-Aufwands (ändere 'low' zu 'high' oder 'max'):
Für Multi-Turn-Chat verwende clear_thinking=true um Reasoning aus vorherigen Turns zu entfernen (für dieses Modell empfohlen):
Chat-Template-Korrekturen
Wir haben festgestellt, dass GLM eine interessante .{id}. Notation für Chat-Templates verwendet, aber viele Engines unterstützen das nicht. Wir haben es auf alles [id] geändert, also auf Python-Listen-Indizierungssyntax. Siehe diesen Commit-Änderung für weitere Details.

GLM-5.3-Tutorials ausführen:
Du kannst GLM-5.3 jetzt in llama.cpp und Unsloth Desktop. Wir werden die 239GB UD-IQ2_M Quant verwenden, um die beste Balance aus Zugänglichkeit und Genauigkeit zu erreichen.
🦥 GLM-5.3 in Unsloth ausführen
GLM-5.3 kann jetzt in Unsloth Desktopeiner Open-Source-UI-App für lokale KI ausgeführt werden. Unsloth lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Desktop kannst du Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen, MLX- und Safetensor-Modelle
Selbstheilung Tool-Calling + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-P usw.)
Schnelle CPU- und GPU-Inferenz über MLX und llama.cpp
LLMs trainieren 2x schneller mit 70% weniger VRAM

Unsloth installieren
Der einfachste Einstieg ist das Herunterladen der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.
Oder, wenn du lieber manuell installieren möchtest:
MacOS, Linux, WSL:
Windows PowerShell:
GLM-5.3 suchen und herunterladen
Gehe zu Unsloth Chat oder Model hub und suche in der Suchleiste nach GLM-5.3 und lade dein gewünschtes Modell und deine gewünschte Quant herunter.

GLM-5.3 ausführen
Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Für weitere Informationen kannst du unsere Unsloth-Inferenzanleitung.
GLM-5.3 mit der Unsloth-API bereitstellen
Du kannst den unsloth run Befehl verwenden und GLM-5.3 über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Infos findest du in unseren API-Dokumenten oder unsloth start.
Unsloth ist jetzt bereit
Du kannst mit GLM-5.3 über Unsloth Desktop auch viele andere Dinge tun, z. B.:
Tools verbinden: , , , und mehr
Modelle trainieren: Text, Diffusion, Embedding, und mehr
Medien generieren: Erstellen und trainieren , Video, lokal

🦙 GLM-5.3 in llama.cpp ausführen
Für diese Anleitung werden wir die UD-IQ2_M Quant verwenden, die mindestens 245GB RAM benötigt. Du kannst den Quantisierungstyp gerne ändern. Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz. GGUF: GLM-5.3-GGUF
Beschaffe die neueste llama.cpp auf GitHub hier. Du kannst auch den Build-Anweisungen unten folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Du kannst jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wähle zuerst den gewünschten Quantisierungstyp wie UD-IQ2_M. Verwende außerdem export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" um zu erzwingen llama.cpp an einem bestimmten Speicherort zu speichern. Beachte, dass dieser Download-Vorgang sehr langsam sein könnte, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.
Wenn du das Modell manuell herunterladen möchtest (viel schneller!), können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Wenn du das dynamische 1-Bit verwenden möchtest, dann mache Folgendes:
Dann das Modell im Gesprächsmodus ausführen. Verwende unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf für 2-Bit oder unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf für 1-Bit.
Ähnlich wie bei GLM-5.2 wirst du beim Starten von llama-cli Folgendes sehen:

Dann haben wir nach dem Prompt ein cooles kleines Snake-Spiel mit UD-IQ1_S also 1-Bit, und es funktionierte gut mit GLM-5.3!

📐Langer Kontext über KV-Cache-Quantisierung
Um langen Kontext in llama.cpp zu nutzen, verwende KV-Cache-Quantisierung, um den Speicherverbrauch zu reduzieren.
Derzeit werden diese KV-Cache-Datentypen unterstützt: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, und q5_1. Standardmäßig wird f16 verwendet. q4_1 verwendet etwa 5 Bits pro Gewicht und ermöglicht etwa 3,2x längere Kontextlängen.
Quantisierungsanalyse
Wir haben auch KLD für die von uns hochgeladenen Quants berechnet, und es zeigt, dass Q4_K_XL und Q5_K_XL dem Baseline-Modell sehr nahe kommen, also ziele auf diese ab.

UD-IQ1_S
216.7
72.56
0.687991
9.104
4.6130
UD-IQ1_M
228.5
75.64
0.565455
8.595
4.1410
UD-IQ2_M
238.6
78.53
0.453992
7.717
3.7433
UD-Q2_K_XL
253.9
80.93
0.374219
7.076
3.5048
UD-IQ3_XXS
281.7
84.15
0.272796
6.252
3.2482
UD-Q3_K_XL
343.0
88.86
0.141406
4.127
2.9107
UD-IQ4_XS
365.3
90.59
0.101496
3.177
2.8460
UD-Q4_K_XL
467.3
94.29
0.036922
1.309
2.7006
UD-Q5_K_XL
562.5
95.82
0.019728
0.786
2.6842
UD-Q6_K_XL
684.4
96.59
0.013257
0.534
2.6771
📊 Benchmarks
Du kannst die wichtigsten Benchmark-Verbesserungen von GLM-5.3 weiter unten in Tabellenform ansehen:


Benchmark
GLM-5.3
GLM-5.2
Kimi K3
DeepSeek-V4
Pro-0813
Qwen3.8-Max
Opus 4.8
Fable 5
(mit Fallback)
GPT-5.6 Sol
Coding
Terminal Bench 2.1
88.2
81.0
88.3
87.9
86.6
85.0
88.0
88.8
Terminal Bench 3.0
28.3
4.6
17.4
-
-
21.1
33.7
34.6
DeepSWE
v1.1
66.9
46.2
67.5
62.7
56.6
58.0
69.7
72.7
NL2Repo
58.0
48.9
58.0
61.1
55.9
69.7
-
-
ProgramBench
Fast gelöst
19.0
9.5
17.5
-
10.5
15.5
33.0
23.0
FrontierSWE
78.1
67.5
-
-
-
66.5
88.2
-
SWE-Marathon
v1.1
42.5
19.4
48.1
-
-
48.8
33.1
42.5
PostTrainBench
39.8
31.7
32.0
-
-
32.9
41.8
36.2
Cyber
CyberGym
84.5
77.2
80.0
83.3
78.5
78.1
83.8
83.6
ExploitGym
2h / 6h
105 / 130
29 / 39
36 / 70
-
14 / 26
80 / 120
181 / 247
216 / 293
ExploitBench
54.4
24.4
32.2
-
28.8
40.0
78.0
76.5
Agentisch
Toolathlon Verified
73.0
59.9
76.5
74.1
72.5
76.2
74.7
74.9
AutomationBench
v1.0.6
48.2
26.2
46.7
43.2
39.8
41.0
46.2
45.8
Agents' Last Exam
ALE-CLI
28.5
23.8
27.6
25.7
27.0
25.7
23.8
28.6
HLE mit Tools
62.5
54.7
59.8
60.0
56.2
57.9
63.9
64.5
GDPval-AA v2
1769
1508
1682
1590
1739
1588
1743
1730
Zuletzt aktualisiert
War das hilfreich?

