For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3 – So führen Sie es lokal aus

Führen Sie das neue Modell GLM-5.3 von Z.ai aus.

GLM-5.3 ist Z.ais neues Modell mit 744B Parametern (40B aktiv). Stand Aug. 2026 ist GLM-5.3 das stärkste Open-Model bis heute und erreicht SOTA auf Terminal Bench 3.0 und Agents' Last Exam. GLM-5.3 verwendet dasselbe Basismodell wie GLM-5.2, wobei jeder Gewinn aus dem Post-Training stammt. Das Modell hat ein 1M-Context -Fenster und kann jetzt lokal ausgeführt werden über Unsloth Dynamic GGUFs mit llama.cpp oder Unsloth Desktop.

GLM-5.3-Flash-AnleitungGLM-5.3-Anleitung

Wenn du GLM-5.3-Flashausführen möchtest, lies bitte unseren spezifischen Artikel dazu.

Dynamic 1-bit GGUF erreicht ~76% Top-1-Genauigkeit und ist dabei 85% kleiner. Dynamic 2-bit erreicht ~81% Genauigkeit und ist dabei 83% kleiner. Da GLM-5.3 dieselbe Größe und Architektur wie GLM-5.2 hat, sind die meisten Anforderungen/Einstellungen gleich. Danke an Z.ai für den Unsloth-Zugriff am ersten Tag. GLM-5.3-GGUF

⚙️ Nutzungsanleitung

Die dynamische 2-Bit-Quant UD-IQ2_M verwendet 239GB Speicherplatz auf der Festplatte und läuft gut auf 256GB RAM Geräten wie 2x NVIDIA DGX Sparks oder einem Mac Studio.

Die 1-Bit Quant passt auf 223GB RAM und 8-Bit benötigt 810GB RAM.

Tabelle: Hardware-Anforderungen für Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

1-Bit
2-Bit
3-Bit
4-Bit
6-Bit
8-Bit

223GB

245GB

290-360GB

372-475GB

570GB

810GB

Für beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher einschließlich VRAM und System-RAM die Dateigröße des quantisierten Modells mit komfortablem Abstand übersteigt.

Empfohlene Einstellungen

GLM-5.3 hat 3 Denkmodi: Niedrig, Hoch, und Max. Verwende Max Thinking für komplexe Coding-Aufgaben. In Unsloth Desktop kannst du Niedrig, Hoch und Max Thinking ganz einfach über eine UI umschalten.

Verwende diese Einstellungen für die meisten Anwendungsfälle:

Standardeinstellungen (die meisten Aufgaben)
Lange agentische Aufgaben

Temperatur = 1.0

Temperatur = 1.0

top_p = 0.95

top_p = 1.0

Die maximales Kontextfenster ist 1,048,576.

GLM-5.3 verwendet standardmäßig maximales Reasoning und Thinking kann nicht deaktiviert werden. reasoning_effort kann niedrig, hoch, oder max.

clear_thinking ist standardmäßig false und sie empfehlen true.

Für die Anpassung des Reasoning-Aufwands (ändere 'low' zu 'high' oder 'max'):

Für Multi-Turn-Chat verwende clear_thinking=true um Reasoning aus vorherigen Turns zu entfernen (für dieses Modell empfohlen):

Chat-Template-Korrekturen

Wir haben festgestellt, dass GLM eine interessante .{id}. Notation für Chat-Templates verwendet, aber viele Engines unterstützen das nicht. Wir haben es auf alles [id] geändert, also auf Python-Listen-Indizierungssyntax. Siehe diesen Commit-Änderung für weitere Details.

GLM-5.3-Tutorials ausführen:

Du kannst GLM-5.3 jetzt in llama.cpp und Unsloth Desktop. Wir werden die 239GB UD-IQ2_M Quant verwenden, um die beste Balance aus Zugänglichkeit und Genauigkeit zu erreichen.

🦥 GLM-5.3 in Unsloth ausführen

GLM-5.3 kann jetzt in Unsloth Desktopeiner Open-Source-UI-App für lokale KI ausgeführt werden. Unsloth lagert automatisch in RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Desktop kannst du Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, wenn du lieber manuell installieren möchtest:

MacOS, Linux, WSL:

Windows PowerShell:

2

GLM-5.3 suchen und herunterladen

Gehe zu Unsloth Chat oder Model hub und suche in der Suchleiste nach GLM-5.3 und lade dein gewünschtes Modell und deine gewünschte Quant herunter.

3

GLM-5.3 ausführen

Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unsere Unsloth-Inferenzanleitung.

4

GLM-5.3 mit der Unsloth-API bereitstellen

Du kannst den unsloth run Befehl verwenden und GLM-5.3 über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Infos findest du in unseren API-Dokumenten oder unsloth start.

5

Unsloth ist jetzt bereit

Du kannst mit GLM-5.3 über Unsloth Desktop auch viele andere Dinge tun, z. B.:

🦙 GLM-5.3 in llama.cpp ausführen

Für diese Anleitung werden wir die UD-IQ2_M Quant verwenden, die mindestens 245GB RAM benötigt. Du kannst den Quantisierungstyp gerne ändern. Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz. GGUF: GLM-5.3-GGUF

1

Beschaffe die neueste llama.cpp auf GitHub hier. Du kannst auch den Build-Anweisungen unten folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Du kannst jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wähle zuerst den gewünschten Quantisierungstyp wie UD-IQ2_M. Verwende außerdem export LLAMA_CACHE="unsloth/GLM-5.3-GGUF" um zu erzwingen llama.cpp an einem bestimmten Speicherort zu speichern. Beachte, dass dieser Download-Vorgang sehr langsam sein könnte, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.

3

Wenn du das Modell manuell herunterladen möchtest (viel schneller!), können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

Wenn du das dynamische 1-Bit verwenden möchtest, dann mache Folgendes:

4

Dann das Modell im Gesprächsmodus ausführen. Verwende unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf für 2-Bit oder unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf für 1-Bit.

5

Ähnlich wie bei GLM-5.2 wirst du beim Starten von llama-cli Folgendes sehen:

Dann haben wir nach dem Prompt ein cooles kleines Snake-Spiel mit UD-IQ1_S also 1-Bit, und es funktionierte gut mit GLM-5.3!

📐Langer Kontext über KV-Cache-Quantisierung

Um langen Kontext in llama.cpp zu nutzen, verwende KV-Cache-Quantisierung, um den Speicherverbrauch zu reduzieren.

Derzeit werden diese KV-Cache-Datentypen unterstützt: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, und q5_1. Standardmäßig wird f16 verwendet. q4_1 verwendet etwa 5 Bits pro Gewicht und ermöglicht etwa 3,2x längere Kontextlängen.

Quantisierungsanalyse

Wir haben auch KLD für die von uns hochgeladenen Quants berechnet, und es zeigt, dass Q4_K_XL und Q5_K_XL dem Baseline-Modell sehr nahe kommen, also ziele auf diese ab.

Quant
GB
Top-1 %
mittlere KLD
99,9% KLD
PPL

UD-IQ1_S

216.7

72.56

0.687991

9.104

4.6130

UD-IQ1_M

228.5

75.64

0.565455

8.595

4.1410

UD-IQ2_M

238.6

78.53

0.453992

7.717

3.7433

UD-Q2_K_XL

253.9

80.93

0.374219

7.076

3.5048

UD-IQ3_XXS

281.7

84.15

0.272796

6.252

3.2482

UD-Q3_K_XL

343.0

88.86

0.141406

4.127

2.9107

UD-IQ4_XS

365.3

90.59

0.101496

3.177

2.8460

UD-Q4_K_XL

467.3

94.29

0.036922

1.309

2.7006

UD-Q5_K_XL

562.5

95.82

0.019728

0.786

2.6842

UD-Q6_K_XL

684.4

96.59

0.013257

0.534

2.6771

📊 Benchmarks

Du kannst die wichtigsten Benchmark-Verbesserungen von GLM-5.3 weiter unten in Tabellenform ansehen:

Benchmark

GLM-5.3

GLM-5.2

Kimi K3

DeepSeek-V4

Pro-0813

Qwen3.8-Max

Opus 4.8

Fable 5

(mit Fallback)

GPT-5.6 Sol

Coding

Terminal Bench 2.1

88.2

81.0

88.3

87.9

86.6

85.0

88.0

88.8

Terminal Bench 3.0

28.3

4.6

17.4

-

-

21.1

33.7

34.6

DeepSWE

v1.1

66.9

46.2

67.5

62.7

56.6

58.0

69.7

72.7

NL2Repo

58.0

48.9

58.0

61.1

55.9

69.7

-

-

ProgramBench

Fast gelöst

19.0

9.5

17.5

-

10.5

15.5

33.0

23.0

FrontierSWE

78.1

67.5

-

-

-

66.5

88.2

-

SWE-Marathon

v1.1

42.5

19.4

48.1

-

-

48.8

33.1

42.5

PostTrainBench

39.8

31.7

32.0

-

-

32.9

41.8

36.2

Cyber

CyberGym

84.5

77.2

80.0

83.3

78.5

78.1

83.8

83.6

ExploitGym

2h / 6h

105 / 130

29 / 39

36 / 70

-

14 / 26

80 / 120

181 / 247

216 / 293

ExploitBench

54.4

24.4

32.2

-

28.8

40.0

78.0

76.5

Agentisch

Toolathlon Verified

73.0

59.9

76.5

74.1

72.5

76.2

74.7

74.9

AutomationBench

v1.0.6

48.2

26.2

46.7

43.2

39.8

41.0

46.2

45.8

Agents' Last Exam

ALE-CLI

28.5

23.8

27.6

25.7

27.0

25.7

23.8

28.6

HLE mit Tools

62.5

54.7

59.8

60.0

56.2

57.9

63.9

64.5

GDPval-AA v2

1769

1508

1682

1590

1739

1588

1743

1730

Zuletzt aktualisiert

War das hilfreich?