> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/gemma-4.md).

# Gemma 4 - Wie man es lokal ausführt

Gemma 4 ist die neue Familie offener Modelle von Google DeepMind, einschließlich **12B**, **E2B**, **E4B**, **26B-A4B**, und **31B.** Die multimodalen Hybrid-Denkmodelle unterstützen über 140 Sprachen, bis zu **256K Kontext**, und es gibt dichte sowie MoE-Varianten. Gemma 4 ist unter Apache-2.0 lizenziert und kann auf deinem lokalen Gerät ausgeführt werden.

**Gemma-4-12B** ist neu und bietet vereinheitlichte Unterstützung für Text, Bild und Audio. Es läuft auf **8 GB** RAM (4-Bit) oder 14 GB (8-Bit). **Gemma-4-E2B** und **E4B** unterstützen ebenfalls Bild und Audio. Läuft auf **5 GB RAM** (4-Bit) oder 15 GB (voll 16-Bit) über GGUF, MLX oder NVFP4-Quants.

<a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#run-gemma-4-tutorials" class="button primary">Gemma 4 ausführen</a><a href="/pages/6b0583a8449166f2d11877ed16e0b6c150d61586" class="button secondary">Gemma 4 feinabstimmen</a><a href="/pages/5f03e50470f4e75e2f364ba071a97734e3604a69" class="button primary">Gemma 4 QAT</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#gemma-4-mtp" class="button secondary">Gemma 4 MTP</a>

{% hint style="success" %}
**NEU:** [**Gemma 4 MTP ist da**](/docs/de/modelle/mtp.md)**! MTP ermöglicht 1,4–2,2x schnellere Inferenz ohne Genauigkeitsverlust. Führe MTP direkt in** [**Unsloth Studio**](/docs/de/modelle/mtp.md#unsloth-studio-mtp-guide)**.**
{% endhint %}

{% columns %}
{% column %}
**Gemma-4-26B-A4B** läuft auf **18 GB** (4-Bit) oder 28 GB (8-Bit). **Gemma-4-31B** benötigt **20 GB RAM** (4-Bit) oder 34 GB (8-Bit).

Du kannst jetzt alle GGUFs, [MLX](#mlx-dynamic-quants) ausführen und Gemma 4 feinabstimmen in [Unsloth Studio](#unsloth-studio-guide) (siehe rechts).

[**QAT** Varianten](/docs/de/modelle/gemma-4/qat.md) von Gemma 4 reduzieren den Speicherbedarf um etwa das 3-Fache, während die Modellqualität erhalten bleibt.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/d7c42ebe749f1a6355e750ad6d546c1c25be81de" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
**9. Jun:** [Gemma 4 MTP](/docs/de/modelle/mtp.md) ist da.

**5. Jun:** [Gemma 4 QAT](/docs/de/modelle/gemma-4/qat.md) ist veröffentlicht.

**2. Jun:** Gemma 4 12B Unified ist veröffentlicht.

**20. Apr:** Wir haben [Gemma 4 GGUF-Benchmarks](#unsloth-gguf-benchmarks) durchgeführt, um dir bei der Auswahl der besten Quant zu helfen.
{% endhint %}

### Nutzungsanleitung

Gemma 4 glänzt bei Schlussfolgern, Programmierung, Tool-Nutzung, Langkontext- und agentischen Workflows sowie multimodalen Aufgaben. Die kleineren Varianten E2B und E4B sind für Telefone und Laptops gedacht, während die größeren Modelle auf Systeme mit mittlerer bis hoher CPU-/VRAM-Leistung abzielen, etwa PCs mit NVIDIA-RTX-GPUs.

| Gemma-4-Variante | Details                                                               | Am besten geeignet für                                                     |
| ---------------- | --------------------------------------------------------------------- | -------------------------------------------------------------------------- |
| **E2B**          | <p>Dense + PLE (128K Kontext)<br>Unterstützung: Text, Bild, Audio</p> | Für Telefon-/Edge-Inferenz, ASR, Sprachübersetzung                         |
| **E4B**          | <p>Dense + PLE (128K Kontext)<br>Unterstützung: Text, Bild, Audio</p> | Kleines Modell für Laptops und schnelle lokale multimodale Nutzung         |
| **12B Unified**  | <p>Dense (256K Kontext)<br>Unterstützung: Text, Bild, Audio</p>       | Mittleres Modell für Laptops und lokale multimodale Nutzung                |
| **26B-A4B**      | <p>MoE (256K Kontext)<br>Unterstützung: Text, Bild</p>                | Bester Kompromiss aus Geschwindigkeit und Qualität für die Computernutzung |
| **31B**          | <p>Dense (256K Kontext)<br>Unterstützung: Text, Bild</p>              | Stärkste Leistung bei langsamerer Inferenz                                 |

**Siehe Gemma 4:** [**Leistungs-Benchmarks**](#official-gemma-benchmarks) **und** [**GGUF-Benchmarks**](#unsloth-gguf-benchmarks)**.**

**Soll ich 26B-A4B oder 31B wählen?**

* **26B-A4B** - balanciert Geschwindigkeit und Genauigkeit. Sein MoE-Design macht es schneller als 31B, mit 4B aktiven Parametern. Wähle es, wenn RAM knapp ist und du bereit bist, etwas Qualität gegen Geschwindigkeit einzutauschen.
* **31B** - derzeit das stärkste Gemma-4-Modell. Wähle es für maximale Qualität, wenn du genug Speicher hast und etwas langsamere Geschwindigkeiten akzeptieren kannst.

### Hardware-Anforderungen

**Tabelle: Empfohlene Hardwareanforderungen für Gemma 4 Inferenz GGUF** (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher). Du kannst Gemma 4 auf MacOS, NVIDIA-RTX-GPUs usw. verwenden.

| Gemma-4-Variante |    4-Bit |    8-Bit | BF16 / FP16 |
| ---------------- | -------: | -------: | ----------: |
| **E2B**          |     4 GB |   5–8 GB |       10 GB |
| **E4B**          | 5,5–6 GB |  9–12 GB |       16 GB |
| **12B Unified**  |   7–8 GB | 13–14 GB |       25 GB |
| **26B A4B**      | 16–18 GB | 28–30 GB |       52 GB |
| **31B**          | 17–20 GB | 34–38 GB |       62 GB |

{% hint style="info" %}
Als Faustregel gilt: Dein insgesamt verfügbarer Speicher sollte mindestens größer sein als die Größe des quantisierten Modells, das du herunterlädst. Wenn das nicht der Fall ist, kann llama.cpp zwar weiterhin mit teilweisem RAM-/Festplatten-Offload laufen, aber die Generierung wird langsamer sein. Je nach verwendetem Kontextfenster benötigst du außerdem mehr Rechenleistung.
{% endhint %}

### Empfohlene Einstellungen

Es wird empfohlen, Googles Standardparameter für Gemma 4 zu verwenden:

* `temperature = 1,0`
* `top_p = 0,95`
* `top_k = 64`

{% hint style="info" %}
Der maximale Kontext von Gemma 4 ist **128K** für **E2B** / **E4B** und `262,144` für **12B** / **26B A4B** / **31B**.
{% endhint %}

#### Denkmodus

Im Vergleich zu älteren Gemma-Chat-Templates verwendet Gemma 4 die standardmäßigen **`System-`**, **`Assistent-`**, und **`Benutzer-`** Rollen und fügt eine explizite Denksteuerung hinzu.

**So aktivierst du das Denken:**

Füge das Token **`<|think|>`** am **Anfang des System-Prompts hinzu**.

{% columns %}
{% column %}
**Denken aktiviert**

```
<|think|>
Du bist ein sorgfältiger Programmierassistent. Erkläre deine Antwort klar.
```

{% endcolumn %}

{% column %}
**Denken deaktiviert**

```
Du bist ein sorgfältiger Programmierassistent. Erkläre deine Antwort klar.
```

{% endcolumn %}
{% endcolumns %}

**Ausgabeverhalten:**

{% columns %}
{% column %}
Wenn das Denken aktiviert ist, gibt das Modell vor der endgültigen Antwort seinen internen Denkkanal aus.

```
<|channel>thought
[interne Überlegung]
<channel|>
[endgültige Antwort]
```

{% endcolumn %}

{% column %}
Wenn das Denken deaktiviert ist, können die größeren Modelle dennoch ein **leeres Gedankenfeld** vor der endgültigen Antwort ausgeben.

```
<|channel>thought
<channel|>
[endgültige Antwort]
```

{% endcolumn %}
{% endcolumns %}

**Zum Beispiel mit "**&#x57;as ist die Hauptstadt von Frankreich?":

{% code overflow="wrap" %}

```
<bos><|turn>system\n<|think|><turn|>\n<|turn>user\nWas ist die Hauptstadt von Frankreich?<turn|>\n<|turn>model\n
```

{% endcode %}

**dann gibt es Folgendes aus:**

{% code overflow="wrap" %}

```
<|channel>thought\nDer Benutzer fragt nach der Hauptstadt von Frankreich.\nDie Hauptstadt von Frankreich ist Paris.<channel|>Die Hauptstadt von Frankreich ist Paris.<turn|>
```

{% endcode %}

**Regel für Mehrfachdialoge:**

Bei Unterhaltungen mit mehreren Runden **nur die endgültige sichtbare Antwort im Chatverlauf behalten**. Tue **nicht** frühere Gedankenblöcke in die nächste Runde zurückspeisen.

{% code overflow="wrap" %}

```
<bos><|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n
```

{% endcode %}

**So deaktivierst du das Denken:**

Hinweis `llama-cli` funktioniert möglicherweise nicht zuverlässig, verwende daher `llama-server` zum Deaktivieren des Schlussfolgerns:

{% hint style="warning" %}
Um [Denken / Schlussfolgern deaktivieren](#how-to-enable-or-disable-reasoning-and-thinking), verwende `--chat-template-kwargs '{"enable_thinking":false}'`

Wenn du auf **Windows** Powershell bist, verwende: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Verwende 'true' und 'false' austauschbar.
{% endhint %}

## Gemma-4-Tutorials ausführen

Da Gemma-4-GGUFs in mehreren Größen verfügbar sind, ist der empfohlene Ausgangspunkt für die kleineren Modelle 8-Bit und für die größeren Modelle [**Dynamisch**](/docs/de/grundlagen/unsloth-dynamic-2.0-ggufs.md) **4-Bit**. [Gemma-4-GGUFs](https://huggingface.co/collections/unsloth/gemma-4) oder [MLX](#mlx-dynamic-quants) oder [NVFP4](#nvfp4-guide):

| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-GGUF) | [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-GGUF) | [12b](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) | [26B-A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF) | [31B](https://huggingface.co/unsloth/gemma-4-31B-it-GGUF) |
| --------------------------------------------------------- | --------------------------------------------------------- | --------------------------------------------------------- | ----------------------------------------------------------------- | --------------------------------------------------------- |

<a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#unsloth-studio-guide" class="button primary">🦥 Unsloth-Desktop-Anleitung</a><a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Anleitung</a><a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#nvfp4-guide" class="button primary">NVFP4-Anleitung</a>

{% columns %}
{% column %}
**Du kannst Gemma 4 kostenlos mit einer UI in unserem** [**Unsloth Studio**](/docs/de/neu/studio.md)✨ **Notebook:**
{% endcolumn %}

{% column %}
{% embed url="<https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb>" %}
{% endcolumn %}
{% endcolumns %}

### 🦥 Unsloth-Anleitung

Gemma 4 kann jetzt ausgeführt und feinabgestimmt werden in [Unsloth Desktop](/docs/de/neu/studio.md), unserer neuen Open-Source-Desktop-UI für lokale KI. Unsloth Studio ermöglicht es dir, Modelle lokal auszuführen auf **MacOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilung** Tool-Aufruf](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parameter-Tuning (Temp, Top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/7dd332eeb14ab9597f3e5b90e819b2fc153fd3ca" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist der Download der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/los-gehts/install/mac.md), [Windows](/docs/de/los-gehts/install/windows-installation.md), und [Linux](/docs/de/los-gehts/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du es lieber manuell installieren möchtest:

**MacOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**MacOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Dann öffne `http://127.0.0.1:8888` oder deine spezifische URL in deinem Browser.

**Unsloth sicher mit HTTPS und Cloudflare starten**

**NEU!** Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS durch einen kostenlosen Cloudflare-Tunnel zu starten. Verwende das Folgende (funktioniert unter Windows, Mac & Linux):

```bash
unsloth studio --secure
```

{% endstep %}

{% step %}

#### Gemma 4 suchen und herunterladen

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.

Dann gehe zum [Unsloth Chat](/docs/de/neu/studio/chat.md) Tab, suche in der Suchleiste nach Gemma 4 und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Unsloth unterstützt das neueste Gemma-4-12B-Unity-Modell.

<div data-with-frame="true"><figure><img src="/files/59e4ba0397de8461eae6bdceb892085d889565f6" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Gemma 4 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Du kannst GGUF- und MLX-Dateien ausführen.

Für weitere Informationen kannst du unsere [Unsloth-Studio-Inferenzanleitung](/docs/de/neu/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/25b89cbb431e29420702ee3c1e8f64e47233d588" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-Anleitung

Für diese Anleitung verwenden wir Dynamic 4-Bit für die 12B, 26B-A4B und 31B sowie 8-Bit für E2B und E4B. Siehe: [Gemma-4-GGUF-Sammlung](https://huggingface.co/collections/unsloth/gemma-4)

Für diese Tutorials werden wir [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) für schnelle lokale Inferenz verwenden, besonders wenn du eine CPU hast.

{% stepper %}
{% step %}
Hole dir die neueste `llama.cpp` **auf** [**GitHub hier**](https://github.com/ggml-org/llama.cpp). Du kannst auch die Build-Anweisungen unten befolgen. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine GPU hast oder nur CPU-Inferenz möchtest. **Für Apple Mac / Metal-Geräte**, setze `-DGGML_CUDA=OFF` und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn du verwenden möchtest `llama.cpp` direkt zum Laden von Modellen, kannst du den unten stehenden Befehlen folgen, je nach Modell. `UD-Q4_K_XL` ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich wie `ollama run` . Verwende `export LLAMA_CACHE="folder"` um zu erzwingen `llama.cpp` dass in einem bestimmten Speicherort gespeichert wird. Es ist nicht nötig, die Kontextlänge festzulegen, da llama.cpp automatisch die exakt benötigte Menge verwendet.

{% hint style="warning" %}
Um [Denken / Schlussfolgern deaktivieren](#how-to-enable-or-disable-reasoning-and-thinking), verwende: `--chat-template-kwargs '{"enable_thinking":false}'`

**Windows** Powershell: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Verwende '`true`' und '`false`' austauschbar.
{% endhint %}

**12B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-12B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**26B-A4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-26B-A4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**31B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-31B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-31B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E4B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E2B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E2B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E2B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endstep %}

{% step %}
Du kannst das Modell auch manuell über den unten stehenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Du kannst wählen `UD-Q4_K_XL` oder andere quantisierte Versionen wie `Q8_0` . Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/gemma-4-26B-A4B-it-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-GGUF \\
    --include "*mmproj-BF16*" \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q2_K_XL*" für Dynamic 2bit
```

{% endstep %}

{% step %}
Dann führe das Modell im Konversationsmodus aus (mit Vision `mmproj-F16`):

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endcode %}
{% endstep %}

{% step %}

#### Bereitstellung von Llama-server

Um Gemma-4 auf llama-server bereitzustellen, verwende:

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-26B-A4B-it-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% endstep %}
{% endstepper %}

### MLX Dynamic Quants

Wir haben außerdem dynamische 4-Bit- und 8-Bit-Quants als ersten Test für MacOS-Geräte hochgeladen! Die MLX-Quants unterstützen **Vision.**

{% hint style="success" %}
Alle MLX-Quants funktionieren jetzt in[ Unsloth Studio](#unsloth-studio-guide)!
{% endhint %}

| Gemma 4 | 4-Bit-MLX                                                             | 8-Bit-MLX                                                          |
| ------- | --------------------------------------------------------------------- | ------------------------------------------------------------------ |
| 31B     | [Link](https://huggingface.co/unsloth/gemma-4-31b-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-31b-it-MLX-8bit)     |
| 26B-A4B | [Link](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit) | [Link](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-MLX-8bit) |
| E4B     | [Link](https://huggingface.co/unsloth/gemma-4-E4B-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-E4B-it-MLX-8bit)     |
| E2B     | [Link](https://huggingface.co/unsloth/gemma-4-E2B-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-E2B-it-MLX-8bit)     |

Um sie auszuprobieren, verwenden Sie:

{% code overflow="wrap" %}

```bash
curl -fsSL https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/scripts/install_gemma4_mlx.sh | sh
source ~/.unsloth/unsloth_gemma4_mlx/bin/activate
python -m mlx_vlm.chat --model unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit
```

{% endcode %}

### **NVFP4-Anleitung**

Wir haben [Dynamisches NVFP4](/docs/de/grundlagen/nvfp4.md) Gemma-4-Quants für schnellere 4-Bit-Inferenz auf NVIDIA-Blackwell-GPUs. Dies sind die Hardwareanforderungen für Modelle, die Sie verwenden können, einschließlich Gemma 4. Sehen Sie sich auch den gesamten Geschwindigkeitszuwachs an, den Sie erzielen werden:

| Gemma-4-Variante                                                   | Erforderlicher VRAM | Schneller als BF16 |
| ------------------------------------------------------------------ | ------------------: | -----------------: |
| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-NVFP4)         |                7 GB |    1,12× schneller |
| [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-NVFP4)         |                9 GB |    1,22× schneller |
| [12B Unified](https://huggingface.co/unsloth/gemma-4-12b-it-NVFP4) |               11 GB |    1,26× schneller |
| [26B A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-NVFP4) |               26 GB |    1,41× schneller |
| [31B](https://huggingface.co/unsloth/gemma-4-31B-it-NVFP4)         |               32 GB |    1,45× schneller |

<figure><img src="/files/af476f6bdd08b288ae3e6f3ec01cdd784e2094d6" alt="" width="563"><figcaption></figcaption></figure>

#### **vLLM-Anleitung:**

Um NVFP4-Quants auszuführen, sehen Sie unten die Befehle zum Ausführen von Gemma-4-26B-A4B in [vLLM](/docs/de/grundlagen/inference-and-deployment/vllm-guide.md) und [SGLang](/docs/de/grundlagen/inference-and-deployment/sglang-guide.md) (Sie können den Modellnamen ändern zu `gemma-4-31B-it-NVFP4` usw.) Wählen Sie außerdem KEIN MoE-Backend aus - lassen Sie vLLM es auswählen - z. B. ist Marlin 2,5x langsamer! Siehe [#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl](#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl "mention")Wenn Sie einen DGX Spark haben, siehe [#dgx-spark-serving](#dgx-spark-serving "mention") Sie müssen `--moe-backend flashinfer_b12x` oder Sie erhalten eine viel langsamere Inferenz.

Um vLLM in einer separaten venv zu installieren:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto
```

{% endcode %}

Dann, um die 26B-MoE-Variante bereitzustellen:

```shell
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
```

Ändern Sie `unsloth/gemma-4-26B-A4B-it-NVFP4` in jeden [verfügbaren NVFP4-](/docs/de/grundlagen/nvfp4.md#overview) Quant-Namen!

Um MTP / spekulatives Decodieren zu aktivieren (schnelleres Decodieren, aber etwas geringerer Durchsatz), verwenden Sie:

```bash
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **DGX Spark mit NVFP4-Quants**

Um sicherzustellen, dass DGX Spark die richtigen Kernel hat (sonst erhalten Sie **2x LANGSAMERE Inferenz**), prüfen Sie zuerst:

{% code overflow="wrap" expandable="true" %}

```bash
python -c "
import torch; from vllm.utils.flashinfer import has_flashinfer_b12x_gemm as g, has_flashinfer_b12x_moe as m
cap = torch.cuda.get_device_capability(); print('cap', cap, '| b12x gemm', g(), '| b12x moe', m()); assert cap[0] == 12 and g() and m(), 'b12x unavailable: serving would degrade to marlin W4A16'"
```

{% endcode %}

was KEINEN Fehler auslösen sollte - falls doch, aktualisieren Sie bitte vllm oder installieren Sie es neu über:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \
    --torch-backend=auto
```

{% endcode %}

Dann, um in vLLM für DGX Spark bereitzustellen:

{% code overflow="wrap" expandable="true" %}

```shellscript
export CUTE_DSL_ARCH=sm_121a
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4 --moe-backend flashinfer_b12x
```

{% endcode %}

Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang-Anleitung:**

```bash
python -m sglang.launch_server --model-path unsloth/gemma-4-31B-it-NVFP4 --speculative-algorithm NEXTN \
     --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
```

### Ollama-Anleitung

Ollama unterstützt Unsloth-GGUFs jetzt gut. Verwenden Sie `curl -fsSL https://ollama.com/install.sh | sh` um Ollama unter Linux zu installieren oder `irm https://ollama.com/install.ps1 | iex` für Windows.\
\
Um eine einzelne Quant-Datei (unter 50 GB) zu verwenden, nutzen Sie:

{% code overflow="wrap" %}

```bash
ollama run hf.co/unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL
```

{% endcode %}

Für mehrere Shards, wie größere BF16-Shards, führen Sie Folgendes aus:

{% code overflow="wrap" %}

```bash
pip install -U huggingface_hub

# mmproj und BF16 in 2 Aufrufen herunterladen
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "BF16/*" \
    --local-dir gemma4
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "mmproj-BF16.gguf" \
    --local-dir gemma4

mv gemma4/mmproj-BF16.gguf gemma4/BF16/
echo "FROM ./gemma4/BF16" > Modelfile

ollama create unsloth-gemma4 -f Modelfile
ollama run unsloth-gemma4
```

{% endcode %}

<div data-with-frame="true"><figure><img src="/files/07a8d29a04146b11c4b97dc17a0e6b3a3fc4444d" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
Wenn Sie `Fehler: 500 Interner Serverfehler: Modell konnte nicht geladen werden` aktualisieren Sie Ollama über `curl -fsSL https://ollama.com/install.sh | sh` oder verwenden Sie die PowerShell-Variante.
{% endhint %}

## Best Practices für Gemma 4

### Beispiel-Prompts

#### Einfacher Schlussfolgerungs-Prompt

```
System:
<|think|>
Sie sind ein präziser Schlussfolgerungsassistent.

Benutzer:
Ein Zug fährt um 8:15 Uhr ab und kommt um 11:47 Uhr an. Wie lang war die Fahrt?
```

#### OCR-/Dokumenten-Prompt

Für OCR verwenden Sie ein **hohes visuelles Token-Budget** wie **560** oder **1120**.

```
[Bild zuerst]
Extrahieren Sie den gesamten Text aus diesem Beleg. Geben Sie Positionen, Gesamtsumme, Händler und Datum als JSON zurück.
```

#### Multimodaler Vergleichs-Prompt

```
[Bild 1]
[Bild 2]
Vergleichen Sie diese beiden Screenshots und sagen Sie mir, welcher einen neuen Benutzer eher verwirren würde.
```

#### Audio-ASR-Prompt

```
Transkribieren Sie den folgenden Sprachabschnitt in {LANGUAGE} in {LANGUAGE}-Text.

Befolgen Sie diese spezifischen Anweisungen zur Formatierung der Antwort:
* Geben Sie nur die Transkription aus, ohne Zeilenumbrüche.
* Schreiben Sie beim Transkribieren von Zahlen die Ziffern, d. h. schreiben Sie 1.7 und nicht eins Komma sieben, und schreiben Sie 3 statt drei.
```

#### Audio-Übersetzungs-Prompt

```
Transkribieren Sie den folgenden Sprachabschnitt in {SOURCE_LANGUAGE}, und übersetzen Sie ihn dann in {TARGET_LANGUAGE}. Geben Sie bei der Formatierung der Antwort zuerst die Transkription in {SOURCE_LANGUAGE} aus, dann eine neue Zeile, dann den String '{TARGET_LANGUAGE}: ', und dann die Übersetzung in {TARGET_LANGUAGE}.
```

### Multimodale Einstellungen

Für beste Ergebnisse bei multimodalen Prompts platzieren Sie multimodale Inhalte zuerst:

* Platzieren Sie **Bild und/oder Audio vor Text**.
* Für Video übergeben Sie zuerst eine Sequenz von Frames, dann die Anweisung.

#### Audio- und Videolimits

* **Audio** ist verfügbar auf **12B**, **E2B** und **E4B** nur.
* Audio unterstützt maximal **30 Sekunden**.
* Video unterstützt maximal **60 Sekunden** bei Annahme von **1 Frame pro Sekunde** Verarbeitung.

#### Audio-Promptvorlagen

**ASR-Prompt**

```
Transkribieren Sie den folgenden Sprachabschnitt in {LANGUAGE} in {LANGUAGE}-Text.

Befolgen Sie diese spezifischen Anweisungen zur Formatierung der Antwort:
* Geben Sie nur die Transkription aus, ohne Zeilenumbrüche.
* Schreiben Sie beim Transkribieren von Zahlen die Ziffern, d. h. schreiben Sie 1.7 und nicht eins Komma sieben, und schreiben Sie 3 statt drei.
```

**Sprachübersetzungs-Prompt**

```
Transkribieren Sie den folgenden Sprachabschnitt in {SOURCE_LANGUAGE}, und übersetzen Sie ihn dann in {TARGET_LANGUAGE}.
Geben Sie bei der Formatierung der Antwort zuerst die Transkription in {SOURCE_LANGUAGE} aus, dann eine neue Zeile, dann den String '{TARGET_LANGUAGE}: ', und dann die Übersetzung in {TARGET_LANGUAGE}.
```

## 📊 Benchmarks

### Unsloth GGUF-Benchmarks

Wir haben Mean-KL-Divergenz-Benchmarks für Gemma-4-GGUFs über verschiedene Anbieter hinweg durchgeführt, damit Sie den besten Quant auswählen können (niedriger ist besser).

* KL-Divergenz bringt alle Unsloth-GGUFs auf die SOTA-Pareto-Frontier
* KLD zeigt, wie gut ein quantisiertes Modell der ursprünglichen BF16-Ausgabeverteilung entspricht und damit die erhaltene Genauigkeit anzeigt.

<div data-with-frame="true"><figure><img src="/files/77a35e40de621cafc51c11dbb1812999ef4ffadf" alt=""><figcaption><p>26B A4B - KLD-Benchmarks (niedriger ist besser)</p></figcaption></figure></div>

### Offizielle Gemma-Benchmarks

**Text-/Code-Benchmarks**

| Benchmark            | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (ohne Denken) |
| -------------------- | ----------- | --------------- | ------------------- | ----------- | ----------- | ------------------------- |
| MMLU Pro             | 85.2%       | 82.6%           | 77.2%               | 69.4%       | 60.0%       | 67.6%                     |
| AIME 2026 ohne Tools | 89.2%       | 88.3%           | 77.5%               | 42.5%       | 37.5%       | 20.8%                     |
| LiveCodeBench v6     | 80.0%       | 77.1%           | 72.0%               | 52.0%       | 44.0%       | 29.1%                     |
| Codeforces-ELO       | 2150        | 1718            | 1659                | 940         | 633         | 110                       |
| GPQA Diamond         | 84.3%       | 82.3%           | 78.8%               | 58.6%       | 43.4%       | 42.4%                     |
| Tau2                 | 76.9%       | 68.2%           | 69.0%               | 42.2%       | 24.5%       | 16.2%                     |
| HLE ohne Tools       | 19.5%       | 8.7%            | 5.2%                | -           | -           | -                         |
| HLE mit Suche        | 26.5%       | 17.2%           | -                   | -           | -           | -                         |
| BigBench Extra Hard  | 74.4%       | 64.8%           | 53.0%               | 33.1%       | 21.9%       | 19.3%                     |
| MMMLU                | 88.4%       | 86.3%           | 83.4%               | 76.6%       | 67.4%       | 70.7%                     |

**Vision-Benchmarks**

| MMMU Pro                                | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
| --------------------------------------- | ----- | ----- | ----- | ----- | ----- | ----- |
| OmniDocBench 1.5 (niedriger ist besser) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
| MATH-Vision                             | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
| MedXPertQA MM                           | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -     |

**Audio-Benchmarks**

| CoVoST                               | -     | -     | 38.5<sup>\*</sup>  | 35.54 | 33.47 | -     |
| ------------------------------------ | ----- | ----- | ------------------ | ----- | ----- | ----- |
| FLEURS (niedriger ist besser)        | -     | -     | 0.069<sup>\*</sup> | 0.08  | 0.09  | -     |
| **Langer Kontext**                   |       |       |                    |       |       |       |
| MRCR v2 8 needle 128k (Durchschnitt) | 66.4% | 44.1% | 43.4%              | 25.4% | 19.1% | 13.5% |

<div data-with-frame="true"><figure><img src="/files/b6dee250a47ad24ed4d941817e6871af979eaa1b" alt=""><figcaption></figcaption></figure></div>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/gemma-4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
