> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/qwen3.8.md).

# Qwen3.8 - So führst du es lokal aus

Qwen3.8 ist Qwens neue Modellfamilie mit Qwen3.8-**27B**, Qwen3.8-**2.4T-A95B** und Qwen3.8-**Max**. Qwen3.8-27B hat **Vision** - und Reasoning-Fähigkeiten, ein **256K-Kontext** fenster und läuft lokal auf **17 GB RAM/VRAM** Setups. Qwen3.8 glänzt bei agentischem Coding sowie bei Vision- und Chat-Aufgaben und kann jetzt über Unsloth GGUFs, NVFP4 und [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop). Qwen3.8-2.4T-A95B ist ein Modell mit 2,4T Parametern (95B aktiv), das mit GPT-5.6 Sol. konkurriert.

**Update vom 19. Aug.:** Qwen3.8-27B-GGUFs verwenden jetzt [Unsloth Dynamic V3.0](/docs/de/grundlagen/dynamic-3.0-ggufs.md) für 10 % mehr Genauigkeit bei gleicher Größe und übertreffen andere dabei größtenteils.

{% columns %}
{% column %} <a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-guide" class="button primary">Anleitung zum Ausführen von Qwen3.8</a><a href="https://unsloth.ai/download" class="button primary">Unsloth herunterladen</a>

Danke an Qwen für den Zugriff ab Tag 0. Unsloth-Quants umfassen außerdem:

* **Unterstützung für die Developer-Rolle** für agentische Tools wie Codex
* [MTP aktiviert](/docs/de/modelle/mtp.md) für schnelle Inferenz
* **Tool-Aufruf:** Verbesserte Analyse verschachtelter Objekte, damit Tools häufiger erfolgreich sind

Vollpräzisions-Qwen3.8-2.4T-A95B benötigt 4,9 TB Speicher und 1-Bit [Unsloth](https://github.com/unslothai/unsloth) Dynamic GGUFs benötigen **397 GB (91 % kleiner)**, und das größere IQ1\_S benötigt 508 GB.
{% endcolumn %}

{% column %}

<figure><img src="/files/890a793f7df395610304b6fca7b69cde807076b5" alt=""><figcaption><p>Dynamic 4-Bit Qwen3.8-27B in Unsloth Desktop</p></figcaption></figure>

Unsloth-Quants:

* [Qwen3.8-**27B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
  {% endcolumn %}
  {% endcolumns %}

### :gear: Anleitung zur Nutzung

#### Anforderungen für Qwen3.8-27B:

Qwen3.8-**27B** 4-Bit-Quants funktionieren auf 16–19 GB VRAM wie einer RTX 5080, 4090 oder einem Mac mit 24 GB RAM.\
**Tabelle: Hardwareanforderungen** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

<table><thead><tr><th>1-Bit</th><th>2-Bit</th><th>3-Bit</th><th>4-Bit</th><th width="128">6-Bit</th><th>8-Bit</th><th>BF16</th></tr></thead><tbody><tr><td>7–8 GB</td><td>9–11 GB</td><td>12–14 GB</td><td>16–19 GB</td><td>23–26 GB</td><td>31 GB</td><td>56 GB</td></tr></tbody></table>

#### Qwen3.8-**2,4T** Anforderungen:

* [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

| Dynamisches 1-Bit XXXS | Dynamisches 1-Bit Standard | Dynamisches 2-Bit | Q8\_0  | BF16 (verlustfrei) |
| ---------------------- | -------------------------- | ----------------- | ------ | ------------------ |
| 397 GB                 | 508 GB                     | 657 GB            | 2,6 TB | 4,9 TB             |

### Empfohlene Einstellungen

#### Qwen3.8-**Einstellungen für 27B:**

Qwen3.8-27B ist ein **hybrides Denken** Modell mit unterschiedlichen Standardwerten für Denk- und Nicht-Denk-Modi. Extra High ist standardmäßig aktiviert, wenn du also kürzere Denkspuren möchtest, kannst du [den Denkaufwand anpassen](#thinking--preserve-thinking):

| Parameter            | Denkmodus | Instruct-Modus (ohne Denken) |
| -------------------- | --------- | ---------------------------- |
| `temperature`        | 1.0       | 0.7                          |
| `top_p`              | 0.95      | 0.80                         |
| `top_k`              | 20        | 20                           |
| `min_p`              | 0.0       | 0.0                          |
| `presence_penalty`   | 0.0       | 1.5                          |
| `repetition_penalty` | 1.0       | 1.0                          |

* **Maximales Kontextfenster:** `262,144` (kann über YaRN auf 1M erweitert werden)
* Denkmodus: `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
* Instruct- (oder Nicht-Denk-)Modus: `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`

#### Qwen3.8-**2,4T-Einstellungen:**

Qwen3.8-2.4T ist **nur zum Denken**, während Qwen3.8-Max hybrid ist.

| Standard                |
| ----------------------- |
| temperature = 1.0       |
| top\_p = 0.95           |
| top\_k = 20             |
| min\_p = 0.0            |
| presence\_penalty = 0.0 |

* Kontextlänge = bis zu `1,010,000`
* `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`

Wenn das Modell hineinpasst, erhältst du bei der Verwendung von B200s etwa 20 Token/s Generierung und einen Durchsatz von >120 Token/s. Als beste Faustregel gilt: RAM+VRAM ≈ die Quant-Größe; andernfalls funktioniert es trotzdem, nur deutlich langsamer wegen Auslagerung auf die Festplatte.

### 💡 Denken + Denken beibehalten

{% columns %}
{% column %}
Qwen3.8 hat **Denken beibehalten** das die Denkspur aus der vorherigen Unterhaltung erhält. Das erhöht die Anzahl der Token, die du verwendest, kann aber die Genauigkeit in fortgesetzten Gesprächen verbessern. [Unsloth](#run-qwen3.8-in-unsloth-desktop) hat Umschalter für 'Think' und 'Preserved Thinking' für Qwen3.8 (siehe rechts):
{% endcolumn %}

{% column %}

<figure><img src="/files/8cf20366f4c63cf31317c93511f10b79b26717c0" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Qwen3.8-27B wird mit Unterstützung für `reasoning_effort`geliefert, womit sich die Tiefe des Reasonings anpassen und die Kosten steuern lassen. Diese Umschalter sind in Unsloth automatisch aktiviert:

* `xhigh` (Standard): für komplexe Aufgaben, die gründliche Analyse erfordern
* `medium`: ausgewogene Genauigkeit und Geschwindigkeit
* `low`: effizientes Reasoning, optimiert auf Geschwindigkeit und Kosten
* none

{% hint style="warning" %}
Um das[ Denken / Reasoning](#how-to-enable-or-disable-reasoning-and-thinking) -Niveau in `unsloth run` oder `llama-server`zu ändern, verwende `--chat-template-kwargs '{"reasoning_effort":"medium"}'`

Wenn du unter **Windows** PowerShell bist, verwende: `--chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"`

Ändere `medium` auf das gewünschte Reasoning-Niveau.
{% endhint %}

## Anleitung zum Ausführen von Qwen3.8

Du kannst Qwen3.8 jetzt in llama.cpp und Unsloth Desktop ausführen. Für das große Qwen3.8-2.T-Modell verwenden wir das 397-GB `IQ1_XXXS` Quant (Q1\_0 genannt) für die besten Ergebnisse in Bezug auf Zugänglichkeit und Genauigkeit, und es wird mindestens 450 GB RAM benötigen. Du kannst den Quantisierungstyp gern ändern.

* Hugging Face: [Qwen3.8-**GGUF**](https://huggingface.co/unsloth/Qwen3.8-GGUF) • [Qwen3.8-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-NVFP4)
* ModelScope: [Qwen3.8-**GGUF**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-**NVFP4**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-NVFP4)
* **2.4T-A95B:** [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

<a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-unsloth-desktop" class="button primary">In Unsloth Desktop ausführen</a><a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-llama.cpp" class="button secondary">In llama.cpp ausführen</a><a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616#run-qwen3.8-in-llama.cpp" class="button secondary">NVFP4-Anleitung</a>

### 🦥 Qwen3.8 in Unsloth Desktop ausführen

Qwen3.8 kann in [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop), einer Open-Source-UI-App für lokale KI ausgeführt werden. **Unsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Setups**. Mit Unsloth Desktop kannst du Modelle lokal ausführen auf **MacOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilend** Tool-Aufruf](/docs/de/neu/studio/chat.md#auto-healing-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/desktop.md#code-execution) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameterabstimmung (Temp, Top-P usw.)
* Schnelle CPU- + GPU-Inferenz über MLX und llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="/files/1b4e35a8560500631afb36e8e183698d03fb9b5c" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Weg, loszulegen, ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du lieber manuell installierst:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Qwen3.8 suchen und herunterladen

Gehe zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder Model Hub und suche in der Suchleiste nach Qwen3.8 und lade das gewünschte Modell und die gewünschte Quantisierung herunter.

<figure><img src="/files/8978d8a032e899831452d076aebf04df924862b8" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Qwen3.8 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden; du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unseren [Unsloth-Inferenzleitfaden](/docs/de/neu/studio/chat.md).

Zum Beispiel ermöglicht dir die Verwendung von Unsloth Desktop mit dem 397-GB-Qwen3.8 (-91 % kleiner), den Denkmodus umzuschalten, Inline-Canvas zu erlauben, Websuche und Code-Ausführung zu nutzen und vieles mehr.

<figure><img src="/files/2630281a95c07604cf46535c7e72cad0e332817e" alt="" width="563"><figcaption><p>Dynamisches 1-Bit-397-GB-91 % kleineres GGUF von Qwen3.8 2.4T in Unsloth Desktop</p></figcaption></figure>
{% endstep %}

{% step %}

#### Qwen3.8 mit Unsloth API bereitstellen

Du kannst `unsloth run` den Befehl verwenden und Qwen3.8 über eine API bereitstellen mit `llama-server` Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Networking und Tool-Konfiguration. Weitere Infos findest du in unseren [API-Dokumenten](/docs/de/grundlagen/api.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0 \\
    --chat-template-kwargs '{"reasoning_effort":"medium"}'
```

{% endcode %}
{% endstep %}

{% step %}

#### Unsloth ist jetzt bereit

Du kannst mit Qwen3.8 über Unsloth Desktop auch viele andere Dinge tun, zum Beispiel:

* **Tools verbinden:** [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [Websuche](/docs/de/neu/studio/chat.md#advanced-web-search), [MCP](/docs/de/grundlagen/mcp.md) und mehr
* **Modelle trainieren:** Text, Diffusion, [Embedding](/docs/de/grundlagen/embedding-finetuning.md)und mehr
* **Medien erzeugen:** Erstellen und trainieren [Bilder](/docs/de/grundlagen/diffusion-image.md), Video, [TTS](/docs/de/grundlagen/text-to-speech-tts-fine-tuning.md) lokal

<figure><img src="/files/2f8be2857d830ff5a25dc27824e318e254331cc7" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Neue 1-Bit-Datentypen für Qwen3.8-2.4T-A95B

Wir haben IQ1\_S in llama.cpp, das 1,5625 Bit pro Gewicht hat, auf 1,1875 bpw erweitert, indem wir die Anzahl der Einträge im Codebook reduziert haben – wir haben festgestellt, dass dies bei großen Modellen gut funktioniert und dennoch viel Genauigkeit erhalten kann – wir haben außerdem festgestellt, dass diese neuen Datentypen für Post-Training-Quantisierung (PTQ) gut geeignet sind, ohne dass QAT oder QAD (quantization aware training / distillation) erforderlich wären. [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

Aufgrund von Benennungsproblemen haben wir TQ2\_0, TQ1\_0 und Q1\_0 verwendet, sonst taucht es nicht im HF-Repo auf.

<table><thead><tr><th>Datentyp</th><th width="147.60000610351562">Benennung</th><th width="114.39996337890625" align="right">BPW</th><th width="106.20001220703125" align="right"># Einträge</th><th width="113.413330078125" align="right">Index-Bits</th><th width="106.4000244140625" align="right">Block</th></tr></thead><tbody><tr><td>IQ1_S</td><td>IQ1_S</td><td align="right"><strong>1.5625</strong></td><td align="right">2048</td><td align="right">11</td><td align="right">50 B</td></tr><tr><td>UD-IQ1_XS</td><td>TQ2_0</td><td align="right">1.4375</td><td align="right">1024</td><td align="right">10</td><td align="right">46 B</td></tr><tr><td>UD-IQ1_XXS</td><td>TQ1_0</td><td align="right">1.3125</td><td align="right">512</td><td align="right">9</td><td align="right">42 B</td></tr><tr><td>UD-IQ1_XXXS</td><td>Q1_0</td><td align="right"><strong>1.1875</strong></td><td align="right">256</td><td align="right">8</td><td align="right">38 B</td></tr></tbody></table>

Wir testen die neuen Datentypen noch, aber bei anderen großen Modellen erhalten wir **gute Ergebnisse ganz ohne QAT / QAD**:

| Datentyp     |     GiB |      PPL |      KLD |  top-p |
| ------------ | ------: | -------: | -------: | -----: |
| IQ1\_S       | 553.204 | 2.578876 | 0.564553 | 78.882 |
| UD-IQ1\_XS   | 513.583 | 2.931261 | 0.690161 | 75.726 |
| UD-IQ1\_XXS  | 473.961 | 3.540383 | 0.876007 | 71.284 |
| UD-IQ1\_XXXS | 434.340 | 4.488796 | 1.109944 | 66.257 |

### :llama: Qwen3.8 in llama.cpp ausführen

{% stepper %}
{% step %}
Wir müssen hier den speziellen IQ1\_XXXS-Zweig verwenden [hier](https://github.com/unslothai/llama.cpp/pull/61). Du kannst auch den folgenden Build-Anweisungen folgen. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine GPU hast oder nur CPU-Inferenz möchtest. **Für Apple-Mac-/Metal-Geräte**, setze `-DGGML_CUDA=OFF` und fahre dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn du nur die Standard- `IQ1_S` und andere Quants ausführen möchtest, dann kompiliere llama.cpp normal:

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Lade das Modell herunter über (nach der Installation von `pip install huggingface_hub`). Du kannst `Q1_0` für `IQ1_XXXS` oder andere quantisierte Versionen wie `Q8_0` . Falls Downloads hängen bleiben, siehe: [Debugging für Hugging Face Hub, XET](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

**Qwen3.8-27B:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \\
    --local-dir unsloth/Qwen3.8-27B-GGUF \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q3_K_XL*" für 3-Bit
```

**Qwen3.8-2.4T:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --include "*Q1_0*" # Verwende "*IQ2_XXS*" für 2-Bit
```

{% endstep %}

{% step %}
Um das Modell in llama-cli auszuführen, befolge die Codeausschnitte unten:\
Denke daran, [Einstellungen zu ändern](#recommended-settings) entsprechend deinem Anwendungsfall.

**Qwen3.8-27B:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}

{% step %}
Um das allgemeine UD-IQ1\_S auszuführen, kannst du Folgendes tun:

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGFF \\
    --include "*IQ1_S*" # Verwende "*IQ2_XXS*" für 2-Bit
```

{% endcode %}
{% endstep %}

{% step %}
Dann so ausführen:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-IQ1_S/Qwen3.8-2.4T-A95B-UD-IQ1_S-00001-of-00012.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

### ⚡️NVFP4

Wie bei Qwen3.6 veröffentlichen wir auch neue [dynamische NVFP4 Qwen3.8](/docs/de/grundlagen/nvfp4.md)-27B-Quants, die laufen **\~1,5× schneller** als BF16-Checkpoints, mit **besserer Leistung** und vergleichbaren Dateigrößen. Führen Sie Qwen3.8-27B NVFP4 aus **1,5x schneller** auf **24 GB VRAM.** Wir haben außerdem hinzugefügt **FP8-KV-Cache-Kalibrierung** für doppelt so lange Kontextlängen! NVFP4 erfordert NVIDIA Blackwell-GPUs wie RTX 50X, DGX Spark (siehe [#dgx-spark-with-nvfp4-quants](#dgx-spark-with-nvfp4-quants "mention")), B200-, B300-GPUs. Für ältere GPUs funktionieren unsere GGUFs gut! Sie können NVFP4-Quantisierungen in [vLLM](#vllm) vorerst nur verwenden (SGLang wird nicht unterstützt).

* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4) Quant

<table><thead><tr><th width="90" align="right">Batch</th><th width="114.5999755859375" align="right">BF16 gesamt Token/s</th><th width="122.60003662109375" align="right">NVFP4 gesamt Token/s</th><th width="122" align="right">Beschleunigung</th><th width="137.4000244140625" align="right">BF16 pro Nutzer</th><th align="right">NVFP4 pro Nutzer</th></tr></thead><tbody><tr><td align="right">1</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td><td align="right">1.49x</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td></tr><tr><td align="right">8</td><td align="right">649.4</td><td align="right"><strong>938.8</strong></td><td align="right">1.45x</td><td align="right">81.2</td><td align="right"><strong>117.3</strong></td></tr><tr><td align="right">32</td><td align="right">1983.0</td><td align="right"><strong>2787.0</strong></td><td align="right">1.41x</td><td align="right">62.0</td><td align="right"><strong>87.1</strong></td></tr><tr><td align="right">64</td><td align="right">3048.5</td><td align="right"><strong>4407.2</strong></td><td align="right">1.45x</td><td align="right">47.6</td><td align="right"><strong>68.9</strong></td></tr></tbody></table>

Siehe unten für frühere Benchmarks für Qwen3.6, die ebenfalls mit anderen NVFP4-Implementierungen verglichen wurden, die 16-Bit-Aktivierungen verwenden, im Vergleich zu unseren NVFP4-Aktivierungen:

<figure><img src="/files/14c0c1287547b602c4f5aa5d340799045f9ec44d" alt="" width="563"><figcaption></figcaption></figure>

Alle Benchmarks verwenden 1x B200 bei 128 gleichzeitigen Anfragen. Höhere Parallelität kann 35B auf 17.561 Tokens/s steigern.&#x20;

Für Genauigkeits-Benchmarks führten wir KLD und Top-1%-Übereinstimmung über Code, Chat und viele Domänen aus. NVFP4 erreicht konsistent 92 % bis 97 % Genauigkeitswiederherstellung gegenüber BF16

| Korpus            |  mittlere KLD | Top-1-Übereinstimmung |
| ----------------- | ------------: | --------------------: |
| zh                |       0.01628 |                93.55% |
| code              |       0.02600 |                96.68% |
| refgen            |       0.03993 |                94.46% |
| chat              |       0.05818 |                92.15% |
| ja / ko / ru / es | 0.0124-0.0155 |                94-95% |

Für Genauigkeits-Benchmarks für Qwen 3.6 haben wir MMLU-Pro, AIME 2025, GPQA für FP8, BF16, NVIDIA NVFP4 und unsere NVFP4s durchgeführt – wir zeigen, dass unsere schnelleren Quantisierungen bei allen ähnlich abschneiden:

<figure><img src="/files/41f6a7c7341486abdd02bea40b415c494dfcb5a5" alt=""><figcaption></figcaption></figure>

Weitere Informationen finden Sie in unserem [Blog zu dynamischen NVFP4-Quantisierungen](/docs/de/grundlagen/nvfp4.md).

Um NVFP4-Quantisierungen auszuführen, siehe unten für Befehle zum Ausführen von Qwen3.8-27B in [vLLM](/docs/de/grundlagen/inference-and-deployment/vllm-guide.md) oder [SGLang](/docs/de/grundlagen/inference-and-deployment/sglang-guide.md):

#### **vLLM:**

Um vLLM in einer separaten venv zu installieren:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto
```

{% endcode %}

Dann die 27B-Variante bereitstellen:

```shell
vllm serve unsloth/Qwen3.8-27B-NVFP4
```

Um MTP / spekulatives Decoding zu aktivieren (schnellere Dekodierung, aber etwas geringerer Durchsatz), verwenden Sie:

```bash
vllm serve unsloth/Qwen3.8-27B-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Wenn Sie Torchcodec-Probleme haben, führen Sie unbedingt die folgenden Schritte aus und starten Sie vllm dann erneut.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang:**

**SGLang wird noch nicht unterstützt, da wir den lm\_head auf FP8 quantisieren.**

vLLM hat einen `CompressedTensorsW8A8Fp8` Kernel, der dies unterstützt, während SGLang den FP8-lm\_head nicht laden kann.

### :exploding\_head:Quantisierungsanalyse

NVFP4-Quantisierungen sind 1,5x schneller als BF16 und behalten 92 bis 97 % Top-1%-Genauigkeit bei.

Wir haben [Dynamic 3.0 GGUFs](/docs/de/grundlagen/dynamic-3.0-ggufs.md) verwendet, um Qwen3.8-27B deutlich besser zu machen!

Top-1%-Genauigkeitsdiagramm wie in UD-3 für Qwen3.8-27B gezeigt:

<figure><img src="/files/48e427033ef3ed12f4e041c50f4e67dcb247085c" alt=""><figcaption></figcaption></figure>

Und die mittlere KLD für Qwen3.8:

<figure><img src="/files/43d9345b0423bc8470a3ea32438308698feb3688" alt=""><figcaption></figcaption></figure>

### 📊 Benchmarks

#### Qwen3.8-**27B**

Siehe weiter unten für Tabellen-Benchmarks:

<div><figure><img src="/files/3b0291cbaf20ad1f6ad1b3f87d9f281ada6f586e" alt=""><figcaption></figcaption></figure> <figure><img src="/files/65fd40a938df255350a6f7fe224e24d5f33f7686" alt=""><figcaption></figcaption></figure></div>

#### Textleistung

| Benchmark                                                       | Qwen3.8-27B                      | Qwen3.6-27B              | Qwen3.7-Plus             | Muse Glimmer-30B | Opus4.6 Max |
| --------------------------------------------------------------- | -------------------------------- | ------------------------ | ------------------------ | ---------------- | ----------- |
| **Programmierung**                                              |                                  |                          |                          |                  |             |
| Agentische Terminal-ProgrammierungTerminal Bench 2.1 (Terminus) | 73.0                             | 63.4                     | 64.0                     | 51.7             | **78.2**    |
| Agentische ProgrammierungSWE-bench Pro                          | **61.7**                         | 53.5                     | 57.6                     | 51.2             | 53.4        |
| Codegenerierung auf Repo-EbeneNL2Repo-Bench                     | 42.3                             | 36.2                     | 41.1                     | --               | **47.6**    |
| Agentische ProgrammierungDeepSWE 1.1                            | **42.2**                         | 13.3                     | 14.2                     | --               | --          |
| SoftwareentwicklungQwenSWEBench                                 | **79.0**                         | 49.3                     | 59.2                     | --               | 63.8        |
| **Agent**                                                       |                                  |                          |                          |                  |             |
| Langfristige BüroarbeitCoWorkBench                              | **70.7**                         | 61.0                     | 65.1                     | --               | 68.2        |
| Professionelle ArbeitsaufgabenJobBench                          | **33.4**                         | 21.8                     | 27.6                     | --               | --          |
| Frontier-AgentenaufgabenAgents' Last Exam                       | Pass\@1**20.4**Punktzahl**42.9** | Pass\@110.6Punktzahl27.3 | Pass\@113.2Punktzahl33.6 | --               | --          |
| Allgemein                                                       |                                  |                          |                          |                  |             |
| Befolgung von AnweisungenIFBench                                | **79.5**                         | 69.1                     | 79.1                     | 77.0             | 62.5        |
| Wissenschaftliches SchließenGPQA Diamond                        | 89.2                             | 87.8                     | 90.3                     | 83.5             | **91.3**    |
| Multidisziplinäres SchließenHLE                                 | 30.8                             | 24.0                     | 34.7                     | 22.0             | **40.0**    |
| WettbewerbsprogrammierungLiveCodeBench v6                       | **90.3**                         | 83.9                     | 89.6                     | --               | 88.8        |

#### Qwen3.8-**2.4T-A95B**

<figure><img src="/files/040b50c0273c9f754997091f11d5102cca9b47e7" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/qwen3.8.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
