For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-5.3-Flash: Wie man lokal ausführt

Führe das neue GLM-5.3-Flash-Modell, auch bekannt als ox-alpha, von Z.ai aus.

GLM-5.3-Flash, auch bekannt als ox-alpha, ist Z.ais neues multimodales Open-Model mit 320B Parametern (18B aktiv), das übertrifft GLM-5.2. GLM-5.3-Flash ist die kleinere Version von GLM-5.3 und kann es mit Claude Opus 4.8 bei Coding- und agentischen Benchmarks aufnehmen. Du kannst das 1-Bit-Modell jetzt lokal auf 102 GB RAM/VRAM oder 3-Bit auf 128-GB-Setups über llama.cpp oder Unsloth. Vielen Dank an Z.ai für den Zugang ab Tag 0.

Unsloth dynamisch 1-Bit (93 GB) GGUFs behalten 71 % der Top-1%-Genauigkeit wobei es 85 % kleiner im Vergleich zu BF16 (642 GB). Dynamisches 3-Bit ist 76 % kleiner und behält 87 % Genauigkeit.

​​Anleitung zum Ausführen von GLM-5.3-FlashUnsloth herunterladen

GLM-5.3-Flash wurde auf 30T Tokens trainiert und basiert auf einem neu trainierten Basismodell. Seine hybride sparse und lineare Attention-Architektur senkt die Kosten für das Serving langer Kontexte, ohne die Genauigkeit zu beeinträchtigen.

Du kannst das Modell jetzt direkt in Unsloth Desktop.

⚙️ Nutzungsanleitung

Anforderungen für GLM-5.3-Flash:

Die kleinste 1-Bit-Quantisierung funktioniert mit 100 GB RAM, während 3-Bit auf 128-GB-Geräten wie einem Mac oder NVIDIA DGX Spark läuft. Tabelle: Hardware-Anforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

1-Bit
2-Bit
3-Bit
4-Bit
8-Bit
BF16

100 GB

115 GB

128–150 GB

162–210 GB

350 GB

650 GB

Empfohlene Einstellungen

GLM-5.3-Flash hat 3 Denkmodi: Niedrig, Hoch und Max. Verwende Max Thinking für komplizierte Aufgaben. In Unslothkannst du Niedrig-, Hoch- oder Max-Thinking einfach per Umschalter im Chat-Bereich auswählen.

Verwende diese Einstellungen für die meisten Anwendungsfälle:

Standard-Einstellungen (die meisten Aufgaben)
DeepSWE

Temperatur = 1.0

Temperatur = 0.95

top_p = 0.95

top_p = 1.0

  • Maximales Kontextfenster: 1,048,576.

Änderung des Reasoning-Aufwands

GLM-5.3-Flash verwendet standardmäßig maximales Reasoning. Es unterstützt auch Reasoning-Aufwände, bei denen reasoning_effort „low“, „high“ oder „max“ sein kann.

Schnellere Inferenz und MTP-Unterstützung

Seit dem 4. Sep. haben wir mehrere Verbesserungen und Optimierungen an unserem Day-0- llama.cpp-PRvorgenommen. Wir haben einen schnelleren Decoding-Pfad plus zusätzliche MTP-Unterstützung implementiert, wodurch bis zu 3,3× schnellere Inferenz bei langen Kontextlängen möglich sind!

Alles funktioniert sofort in Unsloth Desktop, aktualisiere bei Bedarf einfach auf die neueste Version. Es sind keine zusätzlichen Module oder MTP-Dateien erforderlich. Alternativ kannst du unserer llama.cpp Anleitung folgen.

Wenn wir GLM-5.3-Flash UD-IQ1_S auf 1xB200 verwenden und MTP zunächst ignorieren, erhalten wir:

Test
Basis tok/s
Optimierte tok/s

pp512

1121.80

1122.0

tg32

62.79

63.10

tg32 @ 4096

53.52

59.50

tg32 @ 16384

41.02

57.99

tg32 @ 65536

20.66

48.99

Sobald wir dann MTP hinzufügen, sehen wir sogar noch größere Gewinne, insbesondere bei längeren Kontexten. Wir sollten jedoch bei etwa n=2 aufhören, da mehr Entwurfstoken die Inferenz langsamer machen.

Prompt
MTP aus
n=2
n=3
n=5

4096

58.6

86.5

80.2

63.7

16K

55.0

77.2

Bei kürzeren Kontextlängen sehen wir weiterhin Beschleunigungen, wenn auch nur bis zu 1,6x schneller.

📈 Quantisierungsanalyse

Wir haben GLM-5.3-Flash auf UD-IQ1_S 1bit (93,09 GB) quantisiert, und es behält 71 % der Top-1%-Genauigkeit, während es 85 % kleiner als BF16 (641,64 GB) ist

Dynamic 2-bit UD-Q2_K_XL ist 109 GB groß, ist 83 % kleiner und behält 78 % Genauigkeit. Dynamic 3-bit UD-IQ3_XXS ist 120 GB groß, ist 81 % kleiner und behält 82 % Genauigkeit. Dynamic 4-bit UD-Q4_K_XL ist 200 GB groß, ist 69 % kleiner und behält 93 % Genauigkeit.

Quant
Größe
Top-1-Genauigkeit
mittlere KLD
KLD 99,9 %

UD-IQ1_S

93.09

70.89%

0.669714

9.1658

UD-IQ1_M

97.58

73.06%

0.572413

8.5069

UD-IQ2_XXS

101.84

76.30%

0.450148

7.5764

UD-Q2_K_XL

108.72

78.34%

0.380134

6.8412

UD-IQ3_XXS

120.37

81.63%

0.283772

5.9611

UD-Q3_K_XL

147.54

86.25%

0.159697

4.0281

UD-IQ4_XS

156.82

88.18%

0.116652

3.1014

UD-Q4_K_XL

199.71

92.22%

0.049294

1.4894

UD-Q5_K_XL

240.31

94.35%

0.027052

0.8696

UD-Q6_K_XL

291.83

95.23%

0.019007

0.6267

GLM-5.3-Flash (Ox-Alpha) lokal ausführen

Du kannst GLM-5.3-Flash (Ox-Alpha) jetzt in Unsloth Desktop und llama.cpp mit unserem spezifischen PRausführen. Wir verwenden in unseren Demos 3-Bit, da es auf 128-GB-Geräten passt. Du kannst den Quantisierungstyp gerne ändern. UD-IQ3_XXS Hugging Face:

In llama.cpp ausführen🦥 GLM-5.3-Flash in Unsloth ausführen

GLM-5.3-Flash kann jetzt ausgeführt werden in

in einer Open-Source-UI-App für lokale KI. Unsloth DesktopUnsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Setups Mit Unsloth Desktop kannst du Modelle lokal ausführen aufMacOS, Windows , Linux und:Suchen, herunterladen,

1

Der einfachste Einstieg ist das Herunterladen der

Unsloth Desktop-App . Funktioniert aufmacOS Windows, undLinux Download für macOS.

Unsloth herunterladen

MacOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

irm https://unsloth.ai/install.ps1 | iex

3

Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unsere

Unsloth-Inferenzanleitung . 1-Bit-Ausführung unten:GLM-5.3-Flash mit der Unsloth-API bereitstellen

4

Du kannst den

unsloth run Befehl verwenden und GLM-5.3-Flash über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Informationen findest du in unseren API-Dokumentation oder unsloth start unsloth run --model unsloth/GLM-5.3-Flash-GGUF:UD-IQ3_XXS.

5

Du kannst mit GLM-5.3-Flash über Unsloth Desktop auch viele andere Dinge tun, wie zum Beispiel:

Tools verbinden:

🦙 Wir müssen hier unseren speziellen llama.cpp-PR verwenden

1

hier . Du kannst auch den Build-Anweisungen unten folgen. Ändere-DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple-Mac-/Metal-Geräte , setzedann fahre wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert. wenn du keine GPU hast oder nur CPU-Inferenz möchtest. apt-get update

2

pip install -U "huggingface_hub[cli]"

3

./llama.cpp/llama-cli \\

durch deine bevorzugte Quantisierung, z. B. UD-IQ3_XXS IQ2_XXS für 2-Bit nach dem Hochladen. 📊 Benchmarks

Benchmark

GLM-5.3-Flash

DeepSeek-V4-Vision-Exp

GLM-5.2

Opus 4.8

GPT-5.6 Terra

Gemini 3.7 Flash

Coding

Terminal Bench 2.1

v1.1

84.3

81.0

83.9

85.0

87.4

85.8

DeepSWE

NL2Repo

63.4

46.2

59.3

58.0

69.6

65.3

Agentisch

56.3

48.9

57.7

69.7

-

-

Toolathlon Verified

AutomationBench

78.4

59.9

75.9

76.2

74.9

-

v1.0.6

Agents' Last Exam

48.8

26.2

38.8

41.0

37.2

52.3

HLE mit Tools

26.3

20.4

27.3

27.0

28.0

-

GDPval-AA v2

55.3

54.7

55.1

57.9

-

-

Vision

1773

1504

1675

1582

1571

1527

OfficeQA Pro

CharXiv Reasoning

62.4

-

57.9

48.9

-

-

mit Tools

Chartography

89.4

-

80.4

89.9

88.0

88.7

BabyVision

Chartography

78.0

-

64.3

75.0

68.0

65.0

MVbench

53.4

-

35.1

46.8

61.6

70.9

MMVU

77.8

-

69.4

67.1

75.0

82.2

MMVU

80.5

-

72.7

67.4

75.8

82.3

Zuletzt aktualisiert

War das hilfreich?