> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/glm-5.3.md).

# GLM-5.3 – So führen Sie es lokal aus

Führen Sie das neue Modell GLM-5.3 von Z.ai lokal aus.

GLM-5.3 ist Z.ais neues Modell mit 744B Parametern (40B aktiv). Stand Aug. 2026 ist GLM-5.3 das **stärkste Open-Model** bis heute und erreicht SOTA auf Terminal Bench 3.0 und Agents' Last Exam. GLM-5.3 verwendet dasselbe Basismodell wie [GLM-5.2](/docs/de/modelle/glm-5.2.md), wobei jeder Gewinn aus dem Post-Training stammt. Das Modell hat ein **1M-Context** -Fenster und kann jetzt lokal ausgeführt werden über [Unsloth Dynamic](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) GGUFs mit llama.cpp oder [Unsloth Desktop](#run-glm-5.3-in-unsloth).

<a href="/docs/de/modelle/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash-Anleitung</a><a href="/pages/26372eccf479a820ef99fc9d99e67cb6d61b257e#run-glm-5.3-tutorials" class="button secondary">GLM-5.3-Anleitung</a>

{% hint style="info" %}
Wenn du [**GLM-5.3-Flash**](/docs/de/modelle/glm-5.3-flash.md)ausführen möchtest, lies bitte unseren [spezifischen Artikel](/docs/de/modelle/glm-5.3-flash.md) dazu.
{% endhint %}

Dynamic 1-bit GGUF erreicht **\~76%** Top-1-Genauigkeit und ist dabei **85% kleiner**. Dynamic 2-bit erreicht **\~81%** Genauigkeit und ist dabei **83% kleiner**. Da GLM-5.3 dieselbe Größe und Architektur wie GLM-5.2 hat, sind die meisten Anforderungen/Einstellungen gleich. Danke an Z.ai für den Unsloth-Zugriff am ersten Tag. [**GLM-5.3-GGUF**](https://huggingface.co/unsloth/GLM-5.3-GGUF)

### **⚙️ Nutzungsanleitung**

Die dynamische 2-Bit-Quant `UD-IQ2_M` verwendet **239GB** Speicherplatz auf der Festplatte und läuft gut auf **256GB RAM** Geräten wie 2x NVIDIA DGX Sparks oder einem Mac Studio.

Die **1-Bit** Quant passt auf 223GB RAM und 8-Bit benötigt 810GB RAM.

**Tabelle: Hardware-Anforderungen für Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

| 1-Bit | 2-Bit | 3-Bit     | 4-Bit     | 6-Bit | 8-Bit |
| ----- | ----- | --------- | --------- | ----- | ----- |
| 223GB | 245GB | 290-360GB | 372-475GB | 570GB | 810GB |

Für beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher einschließlich VRAM und System-RAM die Dateigröße des quantisierten Modells mit komfortablem Abstand übersteigt.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FJsaB5Sn5JEJXD40RU06i%2Fglm53_unsloth_dynamic_ggufs_top1_accuracy_updated.png?alt=media&amp;token=ef24f54e-c3a7-461e-aa02-ccb8f654fede" alt=""><figcaption></figcaption></figure>

#### Empfohlene Einstellungen

GLM-5.3 hat **3 Denkmodi**: **Niedrig**, **Hoch**, und **Max**. Verwende Max Thinking für komplexe Coding-Aufgaben. In [Unsloth Desktop](/docs/de/desktop.md) kannst du Niedrig, Hoch und Max Thinking ganz einfach über eine UI umschalten.

Verwende diese Einstellungen für die meisten Anwendungsfälle:

| Standardeinstellungen (die meisten Aufgaben) | Lange agentische Aufgaben |
| -------------------------------------------- | ------------------------- |
| `Temperatur` = 1.0                           | `Temperatur` = 1.0        |
| `top_p` = 0.95                               | `top_p` = 1.0             |

Die **maximales Kontextfenster** ist `1,048,576`.

GLM-5.3 verwendet standardmäßig maximales Reasoning und Thinking kann nicht deaktiviert werden. `reasoning_effort` kann `niedrig`, `hoch`, oder `max`.

`clear_thinking` ist standardmäßig false und sie empfehlen true.

Für die Anpassung des Reasoning-Aufwands (ändere 'low' zu 'high' oder 'max'):

```bash
--chat-template-kwargs '{"reasoning_effort":"low"}'
```

Für Multi-Turn-Chat verwende `clear_thinking=true` um Reasoning aus vorherigen Turns zu entfernen (für dieses Modell empfohlen):

```bash
--chat-template-kwargs '{"reasoning_effort":"max","clear_thinking":true}'
```

### Chat-Template-Korrekturen

Wir haben festgestellt, dass GLM eine interessante `.{id}.` Notation für Chat-Templates verwendet, aber viele Engines unterstützen das nicht. Wir haben es auf alles `[id]` geändert, also auf Python-Listen-Indizierungssyntax. Siehe diesen [Commit-Änderung](https://huggingface.co/unsloth/GLM-5.3/commit/05cd131f7ab554f983b81c6be97916450b0ff8d2) für weitere Details.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F3d64OwoEjqpJ5fHum860%2Fimage.png?alt=media&amp;token=784da534-c703-4246-886d-bd058cf345f1" alt="" width="563"><figcaption></figcaption></figure>

## GLM-5.3-Tutorials ausführen:

Du kannst GLM-5.3 jetzt in [llama.cpp](https://unsloth.ai/docs/models/glm-5.3#run-glm-5.3-in-llama.cpp) und [Unsloth Desktop](#run-glm-5.3-flash-in-unsloth). Wir werden die 239GB [`UD-IQ2_M`](https://huggingface.co/unsloth/GLM-5.3-GGUF/tree/main/UD-IQ2_M) Quant verwenden, um die beste Balance aus Zugänglichkeit und Genauigkeit zu erreichen.

### 🦥 GLM-5.3 in Unsloth ausführen

GLM-5.3 kann jetzt in [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop)einer Open-Source-UI-App für lokale KI ausgeführt werden. **Unsloth lagert automatisch in RAM aus und erkennt Multi-GPU-Setups**. Mit Unsloth Desktop kannst du Modelle lokal auf **MacOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally), MLX- und Safetensor-Modelle
* [**Selbstheilung** Tool-Calling](/docs/de/neu/studio/chat.md#auto-healing-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/desktop.md#code-execution) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameter-Tuning (Temp, Top-P usw.)
* Schnelle CPU- und GPU-Inferenz über MLX und llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70% weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FYVcpYHcS7vpnYcZUiwpO%2Fglm52%20example.png?alt=media&amp;token=d218ed4e-5102-48a6-943a-7d6b7a10446f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du lieber manuell installieren möchtest:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### GLM-5.3 suchen und herunterladen

Gehe zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder Model hub und suche in der Suchleiste nach GLM-5.3 und lade dein gewünschtes Modell und deine gewünschte Quant herunter.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fpcug1oswnDUemsv08ffL%2FScreenshot%202026-08-28%20at%209.45.17%E2%80%AFAM.png?alt=media&amp;token=716b05f9-b0e9-4433-a592-6f9fdcec13a3" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### GLM-5.3 ausführen

Inferenzparameter sollten bei der Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unsere [Unsloth-Inferenzanleitung](/docs/de/neu/studio/chat.md).
{% endstep %}

{% step %}

#### GLM-5.3 mit der Unsloth-API bereitstellen

Du kannst den `unsloth run` Befehl verwenden und GLM-5.3 über eine API bereitstellen mit `llama-server` Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Infos findest du in unseren [API-Dokumenten](/docs/de/grundlagen/api.md) oder [unsloth start](/docs/de/integrationen/unsloth-start.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/GLM-5.3-GGUF:UD-IQ2_M
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth ist jetzt bereit

Du kannst mit GLM-5.3 über Unsloth Desktop auch viele andere Dinge tun, z. B.:

* **Tools verbinden:** [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [Websuche](/docs/de/neu/studio/chat.md#advanced-web-search), [MCP](/docs/de/grundlagen/mcp.md) und mehr
* **Modelle trainieren:** Text, Diffusion, [Embedding](/docs/de/grundlagen/embedding-finetuning.md), und mehr
* **Medien generieren:** Erstellen und trainieren [Bilder](/docs/de/grundlagen/diffusion-image.md), Video, [TTS](/docs/de/grundlagen/text-to-speech-tts-fine-tuning.md) lokal

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FhxlaXPPPrWDFXhdkSdck%2FScreenshot%202026-08-27%20at%2011.59.01%E2%80%AFPM.png?alt=media&amp;token=a2ef8037-b657-473d-83e6-a5f5f22208ff" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🦙 GLM-5.3 in llama.cpp ausführen

Für diese Anleitung werden wir die `UD-IQ2_M` Quant verwenden, die mindestens 245GB RAM benötigt. Du kannst den Quantisierungstyp gerne ändern. Für diese Tutorials verwenden wir [llama.cpp](https://https/github.com/ggml-org/llama.cpp) für schnelle lokale Inferenz. GGUF: [**GLM-5.3-GGUF**](https://huggingface.co/unsloth/GLM-5.3-GGUF)&#x20;

{% stepper %}
{% step %}
Beschaffe die neueste `llama.cpp` **auf** [**GitHub hier**](https://github.com/ggml-org/llama.cpp). Du kannst auch den Build-Anweisungen unten folgen. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine GPU hast oder nur CPU-Inferenz möchtest. **Für Apple Mac / Metal-Geräte**, setze `-DGGML_CUDA=OFF` und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Du kannst jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wähle zuerst den gewünschten Quantisierungstyp wie `UD-IQ2_M`. Verwende außerdem `export LLAMA_CACHE="unsloth/GLM-5.3-GGUF"` um zu erzwingen `llama.cpp` an einem bestimmten Speicherort zu speichern. **Beachte, dass dieser Download-Vorgang sehr langsam sein könnte**, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.

```bash
export LLAMA_CACHE="unsloth/GLM-5.3-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/GLM-5.3-GGUF:UD-IQ2_M \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endstep %}

{% step %}
Wenn du das Modell manuell herunterladen möchtest **(viel schneller!)**, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/GLM-5.3-GGUF \\
    --local-dir unsloth/GLM-5.3-GGUF \\
    --include "*UD-IQ2_M*" # Verwende "*UD-Q8_K_XL*" für nahezu vollständige Präzision
```

Wenn du das dynamische 1-Bit verwenden möchtest, dann mache Folgendes:

{% code overflow="wrap" expandable="true" %}

```bash
hf download unsloth/GLM-5.3-GGUF \\
    --local-dir unsloth/GLM-5.3-GGUF \\
    --include "*UD-IQ1_S*"
```

{% endcode %}
{% endstep %}

{% step %}
Dann das Modell im Gesprächsmodus ausführen. Verwende `unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf` für 2-Bit oder `unsloth/GLM-5.3-GGUF/UD-IQ1_S/GLM-5.3-UD-IQ1_S-00001-of-00006.gguf`  für 1-Bit.

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/GLM-5.3-GGUF/UD-IQ2_M/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}

{% step %}
Ähnlich wie bei GLM-5.2 wirst du beim Starten von llama-cli Folgendes sehen:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FUalNNvFxH613C9kcM3r4%2Fimage.png?alt=media&amp;token=f376e93d-26af-472f-8ea3-0968b57b004c" alt="" width="375"><figcaption></figcaption></figure>

Dann haben wir nach dem Prompt ein cooles kleines Snake-Spiel mit `UD-IQ1_S` also 1-Bit, und es funktionierte gut mit GLM-5.3!

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FDmysmr1aSotb5nIbLou5%2Fglm53-ezgif.com-video-to-gif-converter.gif?alt=media&amp;token=dff4c0a8-cf4f-43e8-99a0-40430ab8153b" alt="" width="395"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

#### 📐Langer Kontext über KV-Cache-Quantisierung

Um langen Kontext in llama.cpp zu nutzen, verwende KV-Cache-Quantisierung, um den Speicherverbrauch zu reduzieren.

Derzeit werden diese KV-Cache-Datentypen unterstützt: `f32`, `f16`, `bf16`, `q8_0`, `q4_0`, `q4_1`, `iq4_nl`, `q5_0`, und `q5_1`. Standardmäßig wird `f16` verwendet. `q4_1` verwendet etwa 5 Bits pro Gewicht und ermöglicht etwa **3,2x längere Kontextlängen**.

```bash
./llama.cpp/llama-cli \\
    --model unsloth/GLM-5.3-GGUF/UD-IQ2_M-/GLM-5.3-UD-IQ2_M-00001-of-00006.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01 \\
    --cache-type-k q4_1 \\
    --cache-type-v q4_1 \\
    --jinja \\
    --chat-template-kwargs '{"reasoning_effort":"max"}'
```

### Quantisierungsanalyse

Wir haben auch KLD für die von uns hochgeladenen Quants berechnet, und es zeigt, dass Q4\_K\_XL und Q5\_K\_XL dem Baseline-Modell sehr nahe kommen, also ziele auf diese ab.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1ClHNDXzzv9r4bLywjEJ%2Fglm53_unsloth_dynamic_ggufs_kld_benchmarks_updated.png?alt=media&amp;token=9e4677e8-df89-4718-acf2-5c14aad393c9" alt=""><figcaption></figcaption></figure>

| Quant        |    GB | Top-1 % | mittlere KLD | 99,9% KLD |    PPL |
| ------------ | ----: | ------: | -----------: | --------: | -----: |
| UD-IQ1\_S    | 216.7 |   72.56 |     0.687991 |     9.104 | 4.6130 |
| UD-IQ1\_M    | 228.5 |   75.64 |     0.565455 |     8.595 | 4.1410 |
| UD-IQ2\_M    | 238.6 |   78.53 |     0.453992 |     7.717 | 3.7433 |
| UD-Q2\_K\_XL | 253.9 |   80.93 |     0.374219 |     7.076 | 3.5048 |
| UD-IQ3\_XXS  | 281.7 |   84.15 |     0.272796 |     6.252 | 3.2482 |
| UD-Q3\_K\_XL | 343.0 |   88.86 |     0.141406 |     4.127 | 2.9107 |
| UD-IQ4\_XS   | 365.3 |   90.59 |     0.101496 |     3.177 | 2.8460 |
| UD-Q4\_K\_XL | 467.3 |   94.29 |     0.036922 |     1.309 | 2.7006 |
| UD-Q5\_K\_XL | 562.5 |   95.82 |     0.019728 |     0.786 | 2.6842 |
| UD-Q6\_K\_XL | 684.4 |   96.59 |     0.013257 |     0.534 | 2.6771 |

### 📊 Benchmarks

Du kannst die wichtigsten Benchmark-Verbesserungen von GLM-5.3 weiter unten in Tabellenform ansehen:

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fm0D8JgqiMhFBvxu1IBfm%2Fglm53bench.jpg?alt=media&amp;token=fe3e5fdf-c5e8-45a2-8a7a-941fdcd5ec6b" alt=""><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Ftqb0wwb4uhbrmjB3bOAr%2Fglmcodingper.png?alt=media&amp;token=fc306ac0-a542-4675-b361-ccac23b691a8" alt=""><figcaption></figcaption></figure></div>

| Benchmark                              | GLM-5.3   | GLM-5.2 | Kimi K3 | <p>DeepSeek-V4</p><p>Pro-0813</p> | Qwen3.8-Max | Opus 4.8 | <p>Fable 5</p><p>(mit Fallback)</p> | GPT-5.6 Sol |
| -------------------------------------- | --------- | ------- | ------- | --------------------------------- | ----------- | -------- | ----------------------------------- | ----------- |
| Coding                                 |           |         |         |                                   |             |          |                                     |             |
| Terminal Bench 2.1                     | 88.2      | 81.0    | 88.3    | 87.9                              | 86.6        | 85.0     | 88.0                                | 88.8        |
| Terminal Bench 3.0                     | 28.3      | 4.6     | 17.4    | -                                 | -           | 21.1     | 33.7                                | 34.6        |
| <p>DeepSWE</p><p>v1.1</p>              | 66.9      | 46.2    | 67.5    | 62.7                              | 56.6        | 58.0     | 69.7                                | 72.7        |
| NL2Repo                                | 58.0      | 48.9    | 58.0    | 61.1                              | 55.9        | 69.7     | -                                   | -           |
| <p>ProgramBench</p><p>Fast gelöst</p>  | 19.0      | 9.5     | 17.5    | -                                 | 10.5        | 15.5     | 33.0                                | 23.0        |
| FrontierSWE                            | 78.1      | 67.5    | -       | -                                 | -           | 66.5     | 88.2                                | -           |
| <p>SWE-Marathon</p><p>v1.1</p>         | 42.5      | 19.4    | 48.1    | -                                 | -           | 48.8     | 33.1                                | 42.5        |
| PostTrainBench                         | 39.8      | 31.7    | 32.0    | -                                 | -           | 32.9     | 41.8                                | 36.2        |
| Cyber                                  |           |         |         |                                   |             |          |                                     |             |
| CyberGym                               | 84.5      | 77.2    | 80.0    | 83.3                              | 78.5        | 78.1     | 83.8                                | 83.6        |
| <p>ExploitGym</p><p>2h / 6h</p>        | 105 / 130 | 29 / 39 | 36 / 70 | -                                 | 14 / 26     | 80 / 120 | 181 / 247                           | 216 / 293   |
| ExploitBench                           | 54.4      | 24.4    | 32.2    | -                                 | 28.8        | 40.0     | 78.0                                | 76.5        |
| Agentisch                              |           |         |         |                                   |             |          |                                     |             |
| Toolathlon Verified                    | 73.0      | 59.9    | 76.5    | 74.1                              | 72.5        | 76.2     | 74.7                                | 74.9        |
| <p>AutomationBench</p><p>v1.0.6</p>    | 48.2      | 26.2    | 46.7    | 43.2                              | 39.8        | 41.0     | 46.2                                | 45.8        |
| <p>Agents' Last Exam</p><p>ALE-CLI</p> | 28.5      | 23.8    | 27.6    | 25.7                              | 27.0        | 25.7     | 23.8                                | 28.6        |
| HLE mit Tools                          | 62.5      | 54.7    | 59.8    | 60.0                              | 56.2        | 57.9     | 63.9                                | 64.5        |
| GDPval-AA v2                           | 1769      | 1508    | 1682    | 1590                              | 1739        | 1588     | 1743                                | 1730        |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/glm-5.3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
