GLM-5.3-Flash: Wie man lokal ausführt
Führe das neue GLM-5.3-Flash-Modell, auch bekannt als ox-alpha, von Z.ai aus.
GLM-5.3-Flash, auch bekannt als ox-alpha, ist Z.ais neues multimodales Open-Model mit 320B Parametern (18B aktiv), das übertrifft GLM-5.2. GLM-5.3-Flash ist die kleinere Version von GLM-5.3 und kann es mit Claude Opus 4.8 bei Coding- und agentischen Benchmarks aufnehmen. Du kannst das 1-Bit-Modell jetzt lokal auf 102 GB RAM/VRAM oder 3-Bit auf 128-GB-Setups über llama.cpp oder Unsloth. Vielen Dank an Z.ai für den Zugang ab Tag 0.
Unsloth dynamisch 1-Bit (93 GB) GGUFs behalten 71 % der Top-1%-Genauigkeit wobei es 85 % kleiner im Vergleich zu BF16 (642 GB). Dynamisches 3-Bit ist 76 % kleiner und behält 87 % Genauigkeit.
4. Sep.: GLM-5.3-Flash läuft jetzt mit 3,3x schnellerer Inferenz!
GLM-5.3-Flash wurde auf 30T Tokens trainiert und basiert auf einem neu trainierten Basismodell. Seine hybride sparse und lineare Attention-Architektur senkt die Kosten für das Serving langer Kontexte, ohne die Genauigkeit zu beeinträchtigen.
Du kannst das Modell jetzt direkt in Unsloth Desktop.

⚙️ Nutzungsanleitung
Anforderungen für GLM-5.3-Flash:
Die kleinste 1-Bit-Quantisierung funktioniert mit 100 GB RAM, während 3-Bit auf 128-GB-Geräten wie einem Mac oder NVIDIA DGX Spark läuft. Tabelle: Hardware-Anforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)
100 GB
115 GB
128–150 GB
162–210 GB
350 GB
650 GB
Empfohlene Einstellungen
GLM-5.3-Flash hat 3 Denkmodi: Niedrig, Hoch und Max. Verwende Max Thinking für komplizierte Aufgaben. In Unslothkannst du Niedrig-, Hoch- oder Max-Thinking einfach per Umschalter im Chat-Bereich auswählen.
Verwende diese Einstellungen für die meisten Anwendungsfälle:
Temperatur = 1.0
Temperatur = 0.95
top_p = 0.95
top_p = 1.0
Maximales Kontextfenster:
1,048,576.
Änderung des Reasoning-Aufwands
GLM-5.3-Flash verwendet standardmäßig maximales Reasoning. Es unterstützt auch Reasoning-Aufwände, bei denen reasoning_effort „low“, „high“ oder „max“ sein kann.
Schnellere Inferenz und MTP-Unterstützung
Seit dem 4. Sep. haben wir mehrere Verbesserungen und Optimierungen an unserem Day-0- llama.cpp-PRvorgenommen. Wir haben einen schnelleren Decoding-Pfad plus zusätzliche MTP-Unterstützung implementiert, wodurch bis zu 3,3× schnellere Inferenz bei langen Kontextlängen möglich sind!
Alles funktioniert sofort in Unsloth Desktop, aktualisiere bei Bedarf einfach auf die neueste Version. Es sind keine zusätzlichen Module oder MTP-Dateien erforderlich. Alternativ kannst du unserer llama.cpp Anleitung folgen.


Wenn wir GLM-5.3-Flash UD-IQ1_S auf 1xB200 verwenden und MTP zunächst ignorieren, erhalten wir:
pp512
1121.80
1122.0
tg32
62.79
63.10
tg32 @ 4096
53.52
59.50
tg32 @ 16384
41.02
57.99
tg32 @ 65536
20.66
48.99
Sobald wir dann MTP hinzufügen, sehen wir sogar noch größere Gewinne, insbesondere bei längeren Kontexten. Wir sollten jedoch bei etwa n=2 aufhören, da mehr Entwurfstoken die Inferenz langsamer machen.
4096
58.6
86.5
80.2
63.7
16K
55.0
77.2
Bei kürzeren Kontextlängen sehen wir weiterhin Beschleunigungen, wenn auch nur bis zu 1,6x schneller.


📈 Quantisierungsanalyse
Wir haben GLM-5.3-Flash auf UD-IQ1_S 1bit (93,09 GB) quantisiert, und es behält 71 % der Top-1%-Genauigkeit, während es 85 % kleiner als BF16 (641,64 GB) ist
Dynamic 2-bit UD-Q2_K_XL ist 109 GB groß, ist 83 % kleiner und behält 78 % Genauigkeit. Dynamic 3-bit UD-IQ3_XXS ist 120 GB groß, ist 81 % kleiner und behält 82 % Genauigkeit. Dynamic 4-bit UD-Q4_K_XL ist 200 GB groß, ist 69 % kleiner und behält 93 % Genauigkeit.


UD-IQ1_S
93.09
70.89%
0.669714
9.1658
UD-IQ1_M
97.58
73.06%
0.572413
8.5069
UD-IQ2_XXS
101.84
76.30%
0.450148
7.5764
UD-Q2_K_XL
108.72
78.34%
0.380134
6.8412
UD-IQ3_XXS
120.37
81.63%
0.283772
5.9611
UD-Q3_K_XL
147.54
86.25%
0.159697
4.0281
UD-IQ4_XS
156.82
88.18%
0.116652
3.1014
UD-Q4_K_XL
199.71
92.22%
0.049294
1.4894
UD-Q5_K_XL
240.31
94.35%
0.027052
0.8696
UD-Q6_K_XL
291.83
95.23%
0.019007
0.6267
GLM-5.3-Flash (Ox-Alpha) lokal ausführen
Du kannst GLM-5.3-Flash (Ox-Alpha) jetzt in Unsloth Desktop und llama.cpp mit unserem spezifischen PRausführen. Wir verwenden in unseren Demos 3-Bit, da es auf 128-GB-Geräten passt. Du kannst den Quantisierungstyp gerne ändern. UD-IQ3_XXS Hugging Face:
GLM-5.3-Flash-GGUF In Unsloth Desktop ausführen
GLM-5.3-Flash kann jetzt ausgeführt werden in
in einer Open-Source-UI-App für lokale KI. Unsloth DesktopUnsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Setups Mit Unsloth Desktop kannst du Modelle lokal ausführen aufMacOS, Windows , Linux und:Suchen, herunterladen,
GGUFs ausführen , MLX- und Safetensor-ModelleSelbstheilung
Tool-Aufrufe Websuche + Codeausführung
(Python, Bash) Automatische Inferenz
Parameter-Tuning (Temp, Top-p usw.) Schnelle CPU- + GPU-Inferenz über MLX und llama.cpp
LLMs trainieren
2x schneller mit 70 % weniger VRAM Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der
Unsloth Desktop-App . Funktioniert aufmacOS Windows, undLinux Download für macOS.
MacOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | sh
irm https://unsloth.ai/install.ps1 | iex
Gehe zu
Unsloth Chat oder zum Model Hub und suche in der Suchleiste nach GLM-5.3-Flash und lade das gewünschte Modell und die gewünschte Quantisierung herunter. GLM-5.3-Flash ausführen

Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen kannst du unsere
Unsloth-Inferenzanleitung . 1-Bit-Ausführung unten:GLM-5.3-Flash mit der Unsloth-API bereitstellen

Du kannst den
unsloth run Befehl verwenden und GLM-5.3-Flash über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Informationen findest du in unseren API-Dokumentation oder unsloth start unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS.
Du kannst mit GLM-5.3-Flash über Unsloth Desktop auch viele andere Dinge tun, wie zum Beispiel:
Tools verbinden:
Claude Code Codex, MCP, Codeausführung, und mehr Modelle trainieren:
Text, Diffusion, Embedding und mehrMedien generieren:

🦙 Wir müssen hier unseren speziellen llama.cpp-PR verwenden
hier . Du kannst auch den Build-Anweisungen unten folgen. Ändere-DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple-Mac-/Metal-Geräte , setzedann fahre wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert. wenn du keine GPU hast oder nur CPU-Inferenz möchtest. apt-get update
pip install -U "huggingface_hub[cli]"
./llama.cpp/llama-cli \\
durch deine bevorzugte Quantisierung, z. B. UD-IQ3_XXS IQ2_XXS für 2-Bit nach dem Hochladen. 📊 Benchmarks
Benchmark


GLM-5.3-Flash
DeepSeek-V4-Vision-Exp
GLM-5.2
Opus 4.8
GPT-5.6 Terra
Gemini 3.7 Flash
Coding
Terminal Bench 2.1
v1.1
84.3
81.0
83.9
85.0
87.4
85.8
DeepSWE
NL2Repo
63.4
46.2
59.3
58.0
69.6
65.3
Agentisch
56.3
48.9
57.7
69.7
-
-
Toolathlon Verified
AutomationBench
78.4
59.9
75.9
76.2
74.9
-
v1.0.6
Agents' Last Exam
48.8
26.2
38.8
41.0
37.2
52.3
HLE mit Tools
26.3
20.4
27.3
27.0
28.0
-
GDPval-AA v2
55.3
54.7
55.1
57.9
-
-
Vision
1773
1504
1675
1582
1571
1527
OfficeQA Pro
CharXiv Reasoning
62.4
-
57.9
48.9
-
-
mit Tools
Chartography
89.4
-
80.4
89.9
88.0
88.7
BabyVision
Chartography
78.0
-
64.3
75.0
68.0
65.0
MVbench
53.4
-
35.1
46.8
61.6
70.9
MMVU
77.8
-
69.4
67.1
75.0
82.2
MMVU
80.5
-
72.7
67.4
75.8
82.3
Zuletzt aktualisiert
War das hilfreich?

