> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/qwen3.8.md).

# Qwen3.8 - So führst du es lokal aus

Leitfaden zum Ausführen von Qwen3.8-Quants, einschließlich Qwen3.8-27B, in deinem lokalen Setup.

Qwen3.8 ist Qwens neue Modellfamilie mit Qwen3.8-**27B**, Qwen3.8-**2.4T-A95B** und Qwen3.8-**Max**. Qwen3.8-27B hat **Vision** und Denkfähigkeiten, ein **256K-Kontext-** fenster und läuft lokal auf **17GB RAM/VRAM** Konfigurationen. Qwen3.8 glänzt bei agentischem Coden, Vision- und Chat-Aufgaben und kann jetzt über Unsloth GGUFs, NVFP4 und [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop). Qwen3.8-2.4T-A95B ist ein Modell mit 2,4 Billionen Parametern (95B aktiv), das mit GPT-5.6 Sol konkurriert.

**Update vom 19. Aug.:** Qwen3.8-27B-GGUFs verwenden jetzt [Unsloth Dynamic V3.0](/docs/de/grundlagen/dynamic-3.0-ggufs.md) für 10 % mehr Genauigkeit bei gleicher Größe und übertreffen andere weitgehend.

{% columns %}
{% column %} <a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-guide" class="button primary">Anleitung zum Ausführen von Qwen3.8</a><a href="https://unsloth.ai/download" class="button primary">Unsloth herunterladen</a>

Vielen Dank an Qwen für den Zugriff ab Tag null. Zu den Unsloth-Quants gehören auch:

* **Unterstützung für die Entwicklerrolle** für agentische Tools wie Codex
* [MTP aktiviert](/docs/de/modelle/mtp.md) für schnelle Inferenz
* **Tool-Aufrufe:** Verbesserte Analyse verschachtelter Objekte, damit Tools häufiger erfolgreich sind

Qwen3.8-2.4T-A95B in Vollpräzision benötigt 4,9 TB Speicher und 1-Bit [Unsloth](https://github.com/unslothai/unsloth) Dynamic GGUFs benötigen **397GB (91% kleiner)**, und das größere IQ1\_S benötigt 508GB.
{% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6aw6IjO7lnYJhSyzXYwq%2Fvolcano%20qwen.gif?alt=media&amp;token=94e56117-d10d-45e8-82dc-3e134b2b9359" alt=""><figcaption><p>Dynamisches 4-Bit-Qwen3.8-27B in Unsloth Desktop</p></figcaption></figure>

Unsloth-Quants:

* [Qwen3.8-**27B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
  {% endcolumn %}
  {% endcolumns %}

### :gear: Nutzungsanleitung

#### Anforderungen für Qwen3.8-27B:

Qwen3.8-**27B** 4-Bit-Quants funktionieren auf 16-19 GB VRAM wie einer RTX 5080, 4090 oder einem Mac mit 24 GB RAM.\
**Tabelle: Hardwareanforderungen** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

<table><thead><tr><th>1-Bit</th><th>2-Bit</th><th>3-Bit</th><th>4-Bit</th><th width="128">6-Bit</th><th>8-Bit</th><th>BF16</th></tr></thead><tbody><tr><td>7-8 GB</td><td>9-11 GB</td><td>12-14 GB</td><td>16-19 GB</td><td>23-26 GB</td><td>31 GB</td><td>56 GB</td></tr></tbody></table>

{% hint style="info" %}
Wenn Sie [MTP](/docs/de/modelle/mtp.md) für schnellere Inferenz verwenden möchten, planen Sie 1-2 GB zusätzlichen Puffer ein.
{% endhint %}

#### Qwen3.8-**2.4T** Anforderungen:

* [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

| Dynamisch 1-Bit XXXS | Dynamisch 1-Bit Standard | Dynamisch 2-Bit | Q8\_0  | BF16 (verlustfrei) |
| -------------------- | ------------------------ | --------------- | ------ | ------------------ |
| 397GB                | 508GB                    | 657 GB          | 2.6 TB | 4.9 TB             |

### Empfohlene Einstellungen

#### Qwen3.8-**Einstellungen für 27B:**

Qwen3.8-27B ist ein **hybrides Denken** Modell mit unterschiedlichen Standard-Einstellungen für Denk- und Nicht-Denk-Modi. Extra High ist standardmäßig aktiviert, also können Sie, wenn Sie kürzere Denkspuren möchten, [den Denkaufwand anpassen](#thinking--preserve-thinking):

| Parameter            | Denkmodus | Instruct- (Nicht-Denk-) Modus |
| -------------------- | --------- | ----------------------------- |
| `temperature`        | 1.0       | 0.7                           |
| `top_p`              | 0.95      | 0.80                          |
| `top_k`              | 20        | 20                            |
| `min_p`              | 0.0       | 0.0                           |
| `presence_penalty`   | 0.0       | 1.5                           |
| `repetition_penalty` | 1.0       | 1.0                           |

* **Maximales Kontextfenster:** `262,144` (kann über YaRN auf 1M erweitert werden)
* Denkmodus: `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
* Instruct- (oder Nicht-Denk-) Modus: `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`

#### Qwen3.8-**Einstellungen für 2.4T:**

Qwen3.8-2.4T ist **nur für Denken**, während Qwen3.8-Max hybrid ist.

| Standard                |
| ----------------------- |
| temperature = 1.0       |
| top\_p = 0.95           |
| top\_k = 20             |
| min\_p = 0.0            |
| presence\_penalty = 0.0 |

* Kontextlänge = bis zu `1,010,000`
* `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`

Wenn das Modell passt, erhalten Sie bei Verwendung von B200s etwa 20 Token/s Generierung und >120 Token/s Durchsatz. Beste Faustregel: RAM+VRAM ≈ die Quant-Größe; ansonsten funktioniert es zwar weiterhin, aber wegen Auslagerung auf die Festplatte deutlich langsamer.

### 💡 Denken + Denken beibehalten

{% columns %}
{% column %}
Qwen3.8 hat **Denken beibehalten** wodurch die Denkspur aus der vorherigen Unterhaltung erhalten bleibt. Das erhöht die Anzahl der verwendeten Token, könnte aber die Genauigkeit in fortgesetzten Unterhaltungen erhöhen. [Unsloth](#run-qwen3.8-in-unsloth-desktop) hat für Qwen3.8 die Umschalter „Think“ und „Erhaltenes Denken“ (siehe rechts):
{% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FLdgmjRrb5qhpbY9PwYe8%2FScreenshot%202026-08-14%20at%2011.26.15%E2%80%AFAM.png?alt=media&amp;token=6333f5ca-196d-46ae-9efd-2e522014e6db" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Qwen3.8-27B unterstützt `reasoning_effort`, mit dem sich die Argumentationstiefe anpassen und die Kosten steuern lassen. Diese Umschalter sind in Unsloth automatisch aktiviert:

* `xhigh` (Standard): für komplexe Aufgaben, die eine gründliche Analyse erfordern
* `medium`: Ausgewogen zwischen Genauigkeit und Geschwindigkeit
* `low`: effizientes Schlussfolgern, optimiert für Geschwindigkeit und Kosten
* none

{% hint style="warning" %}
Um[ den Denk-/Schlussfolgerungs-](#how-to-enable-or-disable-reasoning-and-thinking) Aufwand in `unsloth run` oder `llama-server`, verwenden Sie `--chat-template-kwargs '{"reasoning_effort":"medium"}'`

Wenn Sie auf **Windows** PowerShell verwenden Sie: `--chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"`

Ändern Sie `medium` auf die gewünschte Argumentationsstufe.
{% endhint %}

## Anleitung zum Ausführen von Qwen3.8

Sie können Qwen3.8 jetzt in llama.cpp und Unsloth Desktop ausführen. Für das große Qwen3.8-2.T-Modell werden wir die 397 GB `IQ1_XXXS` Quantisierung (Q1\_0 genannt) für beste Ergebnisse in Bezug auf Zugänglichkeit und Genauigkeit verwenden, und sie erfordert mindestens 450 GB RAM. Sie können den Quantisierungstyp gerne ändern.

* Hugging Face: [Qwen3.8-27B-**GGUF**](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
* ModelScope: [Qwen3.8-27B-**GGUF**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-27B-**NVFP4**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-NVFP4)
* **2.4T-A95B:** [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

<a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-unsloth-desktop" class="button primary">In Unsloth Desktop ausführen</a><a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-llama.cpp" class="button secondary">In llama.cpp ausführen</a><a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-llama.cpp" class="button secondary">NVFP4-Anleitung</a>

### 🦥 Qwen3.8 in Unsloth Desktop ausführen

Qwen3.8 kann ausgeführt werden in [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop), einer Open-Source-UI-App für lokale KI. **Unsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Konfigurationen**. Mit Unsloth Desktop können Sie Modelle lokal ausführen auf **macOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally), MLX- und Safetensor-Modelle
* [**Selbstheilend** Tool-Aufrufe](/docs/de/neu/studio/chat.md#auto-healing-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/desktop.md#code-execution) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameterabstimmung (Temp, Top-p usw.)
* Schnelle CPU- und GPU-Inferenz via MLX und llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6IXaXdTVyvbrnjehlxys%2Fkimik3.gif?alt=media&amp;token=31e1213b-d7da-46e9-bc7f-3a8c402513fc" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Download für macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Download für Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Download für Linux](https://unsloth.ai/download/linux)

Oder, wenn Sie lieber manuell installieren möchten:

macOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Qwen3.8 suchen und herunterladen

Gehen Sie zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder dem Model Hub und suchen Sie in der Suchleiste nach Qwen3.8 und laden Sie Ihr gewünschtes Modell und die gewünschte Quantisierung herunter.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fo53hIyoFypinWWLa1c0x%2FScreenshot%202026-08-14%20at%2012.42.38%E2%80%AFPM.png?alt=media&amp;token=a69de985-56ee-4ef3-8e10-f669cc168346" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Qwen3.8 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere [Unsloth-Inferenzanleitung](/docs/de/neu/studio/chat.md).

Zum Beispiel ermöglicht Ihnen die Verwendung von Unsloth Desktop mit dem 397-GB-Qwen3.8 (91 % kleiner), Denkmodi umzuschalten, Inline-Canvas, Websuche und Code-Ausführung zu nutzen und vieles mehr.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fb3IiYJzHzsp2698xTim4%2Fgiffyy%20gf.gif?alt=media&amp;token=f1bda1a1-b81f-43e2-ba10-dbdc9a29c0c0" alt="" width="563"><figcaption><p>Dynamischer 1-Bit-397-GB-91 % kleinerer GGUF von Qwen3.8 2.4T in Unsloth Desktop</p></figcaption></figure>
{% endstep %}

{% step %}

#### Qwen3.8 mit der Unsloth-API bereitstellen

Sie können `unsloth run` Befehl verwenden und Qwen3.8 über eine API bereitstellen mit `llama-server` Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layer, Threading, Sampling, Netzwerkeinstellungen und Tool-Konfiguration. Weitere Informationen finden Sie in unseren [API-Dokumenten](/docs/de/grundlagen/api.md) oder [unsloth start](/docs/de/integrationen/unsloth-start.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/qwen3.8-27B-GGUF:UD-Q4_K_XL
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0 \
    --reasoning-effort medium
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth ist jetzt bereit

Sie können mit Qwen3.8 über Unsloth Desktop auch viele andere Dinge tun, wie zum Beispiel:

* **Tools verbinden:** [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [Websuche](/docs/de/neu/studio/chat.md#advanced-web-search), [MCP](/docs/de/grundlagen/mcp.md) und mehr
* **Modelle trainieren:** Text, Diffusion, [Embedding](/docs/de/grundlagen/embedding-finetuning.md), und mehr
* **Medien erzeugen:** Erstellen und trainieren [Bilder](/docs/de/grundlagen/diffusion-image.md), Video, [TTS](/docs/de/grundlagen/text-to-speech-tts-fine-tuning.md) lokal

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FYShiiub5gs5pCQLX6d4U%2FScreenshot%202026-08-15%20at%2012.18.24%E2%80%AFAM.png?alt=media&amp;token=d6996797-a144-4113-b4c3-155cca6c39a0" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Qwen3.8-2.4T-A95B neue 1-Bit-Datentypen

Wir haben IQ1\_S in llama.cpp, das 1,5625 Bits pro Gewicht hat, durch Reduzierung der Anzahl der Einträge im Codebuch auf 1,1875 bpw erweitert – wir haben festgestellt, dass das gut für große Modelle funktioniert und dennoch viel Genauigkeit beibehalten kann – außerdem fanden wir, dass diese neuen Datentypen für Post-Training-Quantisierung (PTQ) ohne die Notwendigkeit von QAT oder QAD (quantisierungsbewusstes Training / Distillation) geeignet sind. [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

Aufgrund von Benennungsproblemen haben wir TQ2\_0, TQ1\_0 und Q1\_0 verwendet, sonst erscheint es nicht im HF-Repo.

<table><thead><tr><th>Dtype</th><th width="147.60000610351562">Benennung</th><th width="114.39996337890625" align="right">BPW</th><th width="106.20001220703125" align="right"># Einträge</th><th width="113.413330078125" align="right">Index-Bits</th><th width="106.4000244140625" align="right">Block</th></tr></thead><tbody><tr><td>IQ1_S</td><td>IQ1_S</td><td align="right"><strong>1.5625</strong></td><td align="right">2048</td><td align="right">11</td><td align="right">50 B</td></tr><tr><td>UD-IQ1_XS</td><td>TQ2_0</td><td align="right">1.4375</td><td align="right">1024</td><td align="right">10</td><td align="right">46 B</td></tr><tr><td>UD-IQ1_XXS</td><td>TQ1_0</td><td align="right">1.3125</td><td align="right">512</td><td align="right">9</td><td align="right">42 B</td></tr><tr><td>UD-IQ1_XXXS</td><td>Q1_0</td><td align="right"><strong>1.1875</strong></td><td align="right">256</td><td align="right">8</td><td align="right">38 B</td></tr></tbody></table>

Wir führen noch Benchmarks für die neuen Datentypen durch, aber bei anderen großen Modellen erhalten wir **gute Ergebnisse ohne QAT/QAD**:

| Dtype        |     GiB |      PPL |      KLD |  top-p |
| ------------ | ------: | -------: | -------: | -----: |
| IQ1\_S       | 553.204 | 2.578876 | 0.564553 | 78.882 |
| UD-IQ1\_XS   | 513.583 | 2.931261 | 0.690161 | 75.726 |
| UD-IQ1\_XXS  | 473.961 | 3.540383 | 0.876007 | 71.284 |
| UD-IQ1\_XXXS | 434.340 | 4.488796 | 1.109944 | 66.257 |

### :llama: Qwen3.8 in llama.cpp ausführen

{% stepper %}
{% step %}
Wir müssen den speziellen IQ1\_XXXS-Zweig verwenden [hier](https://github.com/unslothai/llama.cpp/pull/61). Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn Sie nur die Standard `IQ1_S` und andere Quants ausführen möchten, kompilieren Sie llama.cpp einfach normal:

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Laden Sie das Modell über (nach der Installation von `pip install huggingface_hub`). Sie können wählen `Q1_0` für `IQ1_XXXS` oder andere quantisierte Versionen wie `Q8_0` . Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

**Qwen3.8-27B:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \
    --local-dir unsloth/Qwen3.8-27B-GGUF \
    --include "*UD-Q4_K_XL*" # Verwenden Sie "*UD-Q3_K_XL*" für 3-Bit
```

**Qwen3.8-2.4T:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF \
    --include "*Q1_0*" # Verwenden Sie "*IQ2_XXS*" für 2-Bit
```

{% endstep %}

{% step %}
Um das Modell in llama-cli auszuführen, folgen Sie den folgenden Code-Snippets:\
Denken Sie daran, [Einstellungen zu ändern](#recommended-settings) je nach Ihrem Anwendungsfall.

**Qwen3.8-27B:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}
{% endstep %}

{% step %}
Um das allgemeine UD-IQ1\_S auszuführen, können Sie Folgendes tun:

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGFF \
    --include "*IQ1_S*" # Verwenden Sie "*IQ2_XXS*" für 2-Bit
```

{% endcode %}
{% endstep %}

{% step %}
Dann führen Sie es aus:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-IQ1_S/Qwen3.8-2.4T-A95B-UD-IQ1_S-00001-of-00012.gguf \\
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

### ⚡️NVFP4

Wie bei Qwen3.6 veröffentlichen wir außerdem neue [dynamische NVFP4-Qwen3.8](/docs/de/grundlagen/nvfp4.md)-27B-Quants, die laufen **etwa 1,5× schneller** als BF16-Checkpoints, mit **besserer Leistung** und vergleichbaren Dateigrößen. Führe Qwen3.8-27B NVFP4 aus **1,5x schneller** auf **24 GB VRAM.** Wir haben außerdem **FP8-KV-Cache-Kalibrierung** für 2x längere Kontextlängen hinzugefügt! NVFP4 erfordert NVIDIAs Blackwell-GPUs wie RTX 50X, DGX Spark (siehe [#dgx-spark-with-nvfp4-quants](#dgx-spark-with-nvfp4-quants "mention")), B200-, B300-GPUs. Für ältere GPUs funktionieren unsere GGUFs gut! Du kannst NVFP4-Quants in [vLLM](#vllm) vorerst nur verwenden (SGLang wird nicht unterstützt).

* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4) Quant

<table><thead><tr><th width="90" align="right">Batch</th><th width="114.5999755859375" align="right">BF16 Gesamt-Tok/s</th><th width="122.60003662109375" align="right">NVFP4 Gesamt-Tok/s</th><th width="122" align="right">Beschleunigung</th><th width="137.4000244140625" align="right">BF16 pro Nutzer</th><th align="right">NVFP4 pro Nutzer</th></tr></thead><tbody><tr><td align="right">1</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td><td align="right">1,49x</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td></tr><tr><td align="right">8</td><td align="right">649.4</td><td align="right"><strong>938.8</strong></td><td align="right">1,45x</td><td align="right">81.2</td><td align="right"><strong>117.3</strong></td></tr><tr><td align="right">32</td><td align="right">1983.0</td><td align="right"><strong>2787.0</strong></td><td align="right">1,41x</td><td align="right">62.0</td><td align="right"><strong>87.1</strong></td></tr><tr><td align="right">64</td><td align="right">3048.5</td><td align="right"><strong>4407.2</strong></td><td align="right">1,45x</td><td align="right">47.6</td><td align="right"><strong>68.9</strong></td></tr></tbody></table>

Siehe unten die früheren Benchmarks, die ebenfalls für Qwen3.6 durchgeführt wurden, sowie den Vergleich mit anderen NVFP4-Implementierungen, die 16-Bit-Aktivierungen verwenden, versus unseren NVFP4-Aktivierungen:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F8zM7cg0Xgo2pAlop1iPW%2F01_qwen36_combined_throughput.png?alt=media&amp;token=23131a96-4c41-42d7-aa16-5bfb21bb44a3" alt="" width="563"><figcaption></figcaption></figure>

Alle Benchmarks verwenden 1x B200 bei 128 gleichzeitigen Anfragen. Höhere Parallelität kann 35B auf 17.561 Tokens/s steigern.&#x20;

Für Genauigkeits-Benchmarks haben wir KLD und Top-1%-Übereinstimmung über Code, Chat und viele Domänen hinweg ausgeführt. NVFP4 erzielt konsistent 92 % bis 97 % Genauigkeitswiederherstellung gegenüber BF16

| Korpus            | mittlerer KLD | Top-1-Übereinstimmung |
| ----------------- | ------------: | --------------------: |
| zh                |       0.01628 |                93.55% |
| Code              |       0.02600 |                96.68% |
| RefGen            |       0.03993 |                94.46% |
| Chat              |       0.05818 |                92.15% |
| ja / ko / ru / es | 0.0124-0.0155 |                94-95% |

Für Genauigkeits-Benchmarks haben wir für Qwen 3.6 MMLU-Pro, AIME 2025, GPQA für FP8, BF16, NVIDIAs NVFP4 und unsere NVFP4s durchgeführt – wir zeigen, dass unsere schnelleren Quants bei allem ähnlich abschneiden:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FFhOUUUlRBj3dafGnmvhK%2F03_qwen36_combined_accuracy(7).png?alt=media&amp;token=9178447f-d5ae-4489-9bdc-73b2b7b1631b" alt=""><figcaption></figcaption></figure>

Für weitere Informationen kannst du unseren [Blog zu dynamischen NVFP4-Quants](/docs/de/grundlagen/nvfp4.md).

Um NVFP4-Quants auszuführen, siehe unten die Befehle, um Qwen3.8-27B in [vLLM](/docs/de/grundlagen/inference-and-deployment/vllm-guide.md) oder [SGLang](/docs/de/grundlagen/inference-and-deployment/sglang-guide.md):

#### **vLLM:**

Um vLLM in einer separaten venv zu installieren:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \\
    --torch-backend=auto
```

{% endcode %}

Dann, um die 27B-Variante zu starten:

```shell
vllm serve unsloth/Qwen3.8-27B-NVFP4
```

Um MTP / speculative decoding zu aktivieren (schnelleres Decoding, aber etwas geringerer Durchsatz), verwende:

```bash
vllm serve unsloth/Qwen3.8-27B-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Falls du Torchcodec-Probleme bekommst, führe unbedingt Folgendes aus und starte dann vLLM neu.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang:**

Wenn du SGLang verwendest, musst du **SGLang-Version v0.5.19** verwenden, andernfalls funktioniert es nicht, da wir den lm\_head auf FP8 quantisieren.

{% hint style="info" %}
vLLM hat einen `CompressedTensorsW8A8Fp8` Kernel, der dies unterstützt, während SGLang v0.5.19 den FP8-lm\_head nicht laden kann. v0.5.19 funktioniert jetzt!
{% endhint %}

Für sglang nach der Installation der neuesten Version:

{% code overflow="wrap" %}

```bash
uv pip install sglang sglang-kernel \\
  --extra-index-url https://sgl-project.github.io/whl/cu130/ \\
  --extra-index-url https://download.pytorch.org/whl/cu130 \\
  --index-strategy unsafe-best-match
```

{% endcode %}

Dann kannst du es starten:

```bash
sglang serve unsloth/Qwen3.8-27B-NVFP4
```

Um MTP zu aktivieren, verwende:

{% code overflow="wrap" %}

```bash
sglang serve unsloth/Qwen3.8-27B-NVFP4 --speculative-algorithm EAGLE \\
    --speculative-num-steps 3 --speculative-eagle-topk 1  --speculative-num-draft-tokens 4
```

{% endcode %}

### :exploding\_head:Quantisierungsanalyse

NVFP4-Quants sind 1,5x schneller als BF16 und behalten 92 bis 97 % Top-1%-Genauigkeit bei.

Wir haben [Dynamic 3.0 GGUFs](/docs/de/grundlagen/dynamic-3.0-ggufs.md) verwendet, um Qwen3.8-27B viel besser zu machen!

Top-1%-Genauigkeitsdiagramm, wie in UD-3 für Qwen3.8-27B gezeigt:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FVg5FHPxOpmaJ1r3ciw4u%2Fimage.png?alt=media&amp;token=107ef044-0181-489b-b6ae-da218e16c98b" alt=""><figcaption></figcaption></figure>

Und der mittlere KLD für Qwen3.8:

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Ft8BnEqBLUQGUgu2cAKKI%2Fimage.png?alt=media&amp;token=912d5b6a-540f-4ee0-9208-f5ad45776341" alt=""><figcaption></figcaption></figure>

### 📊 Benchmarks

Für GGUF-Quantisierungs-Benchmarks kannst du oben unsere [Quantisierungsanalyse](#quantization-analysis) oder [Artikel Dynamic V3.0](/docs/de/grundlagen/dynamic-3.0-ggufs.md).

#### Qwen3.8-**27B**

Siehe weiter unten für Tabellen-Benchmarks:

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWijY5wYmLx70Ao2ol7Tj%2Fqwen%20benchmark%201.jpeg?alt=media&amp;token=f69ebf50-cf35-426f-a610-8eeb32151d90" alt=""><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FELa2vq8Wh3oelQi6Bf07%2Fqwen%20benchmark%202.jpeg?alt=media&amp;token=2cc6d085-630d-4fa1-9b50-784b22a1fb04" alt=""><figcaption></figcaption></figure></div>

#### Textleistung

| Benchmark                                                | Qwen3.8-27B                      | Qwen3.6-27B          | Qwen3.7-Plus         | Muse Glimmer-30B | Opus4.6 Max |
| -------------------------------------------------------- | -------------------------------- | -------------------- | -------------------- | ---------------- | ----------- |
| **Codierung**                                            |                                  |                      |                      |                  |             |
| Agentisches Terminal-CodingTerminal Bench 2.1 (Terminus) | 73.0                             | 63.4                 | 64.0                 | 51.7             | **78.2**    |
| Agentisches CodingSWE-bench Pro                          | **61.7**                         | 53.5                 | 57.6                 | 51.2             | 53.4        |
| Codegenerierung auf Repo-EbeneNL2Repo-Bench              | 42.3                             | 36.2                 | 41.1                 | --               | **47.6**    |
| Agentisches CodingDeepSWE 1.1                            | **42.2**                         | 13.3                 | 14.2                 | --               | --          |
| SoftwareentwicklungQwenSWEBench                          | **79.0**                         | 49.3                 | 59.2                 | --               | 63.8        |
| **Agent**                                                |                                  |                      |                      |                  |             |
| Langfristige BüroarbeitCoWorkBench                       | **70.7**                         | 61.0                 | 65.1                 | --               | 68.2        |
| Berufliche AufgabenJobBench                              | **33.4**                         | 21.8                 | 27.6                 | --               | --          |
| Agentische Frontier-AufgabenAgents' Last Exam            | Pass\@1**20.4**Punktzahl**42.9** | Pass\@110.6Score27.3 | Pass\@113.2Score33.6 | --               | --          |
| Allgemein                                                |                                  |                      |                      |                  |             |
| InstruktionsbefolgungIFBench                             | **79.5**                         | 69.1                 | 79.1                 | 77.0             | 62.5        |
| wissenschaftliches SchlussfolgernGPQA Diamond            | 89.2                             | 87.8                 | 90.3                 | 83.5             | **91.3**    |
| multidisziplinäres SchlussfolgernHLE                     | 30.8                             | 24.0                 | 34.7                 | 22.0             | **40.0**    |
| kompetitives ProgrammierenLiveCodeBench v6               | **90.3**                         | 83.9                 | 89.6                 | --               | 88.8        |

#### Qwen3.8-**2.4T-A95B**

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWP0nBgaQcnnAGjqG1jyQ%2Fqwen3.8%20bench.jpg?alt=media&amp;token=92a0d19c-51cb-4df2-a4f5-334fe08e6a21" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/qwen3.8.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
