> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/gemma-4.md).

# Gemma 4 - So wird es lokal ausgeführt

Gemma 4 ist die neue Familie offener Modelle von Google DeepMind, darunter **12B**, **E2B**, **E4B**, **26B-A4B**, und **31B.** Die multimodalen Hybrid-Thinking-Modelle unterstützen über 140 Sprachen, bis zu **256K Kontext**und es gibt Dense- und MoE-Varianten. Gemma 4 steht unter Apache-2.0-Lizenz und kann auf Ihrem lokalen Gerät ausgeführt werden.

**Gemma-4-12B** ist neu und bietet einheitliche Unterstützung für Text, Bild und Audio. Es läuft auf **8GB** RAM (4-Bit) oder 14GB (8-Bit). **Gemma-4-E2B** und **E4B** unterstützen ebenfalls Bild und Audio. Läuft auf **5GB RAM** (4-Bit) oder 15GB (voll 16-Bit) über GGUF-, MLX- oder NVFP4-Quants.

<a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#run-gemma-4-tutorials" class="button primary">Gemma 4 ausführen</a><a href="/pages/6b0583a8449166f2d11877ed16e0b6c150d61586" class="button secondary">Gemma 4 feinabstimmen</a><a href="/pages/5f03e50470f4e75e2f364ba071a97734e3604a69" class="button primary">Gemma 4 QAT</a><a href="/pages/06ebf4fba16c8e679877873e78ad6925ec2310c1#gemma-4-mtp" class="button secondary">Gemma 4 MTP</a>

{% hint style="success" %}
**NEU:** [**Gemma 4 MTP ist da**](/docs/de/modelle/mtp.md)**! MTP ermöglicht 1,4-2,2-fach schnellere Inferenz ohne Genauigkeitsverlust. Führen Sie MTP direkt in** [**Unsloth Studio**](/docs/de/modelle/mtp.md#unsloth-studio-mtp-guide)**.**
{% endhint %}

{% columns %}
{% column %}
**Gemma-4-26B-A4B** läuft auf **18GB** (4-Bit) oder 28GB (8-Bit). **Gemma-4-31B** benötigt **20GB RAM** (4-Bit) oder 34GB (8-Bit).

Sie können jetzt alle GGUFs, [MLX](#mlx-dynamic-quants) und Gemma 4 feinabstimmen in [Unsloth Studio](#unsloth-studio-guide) (siehe rechts).

[**QAT** Varianten](/docs/de/modelle/gemma-4/qat.md) von Gemma 4 reduzieren den Speicherbedarf um etwa das 3-Fache, während die Modellqualität erhalten bleibt.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/d7c42ebe749f1a6355e750ad6d546c1c25be81de" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
**9. Juni:** [Gemma 4 MTP](/docs/de/modelle/mtp.md) ist da.

**5. Juni:** [Gemma 4 QAT](/docs/de/modelle/gemma-4/qat.md) wird veröffentlicht.

**2. Juni:** Gemma 4 12B Unified wird veröffentlicht.

**20. April:** Wir haben [Gemma 4 GGUF-Benchmarks](#unsloth-gguf-benchmarks) durchgeführt, um Ihnen bei der Auswahl der besten Quantisierung zu helfen.
{% endhint %}

### Verwendungsanleitung

Gemma 4 zeichnet sich durch Schlussfolgern, Programmierung, Tool-Nutzung, Long-Context- und agentische Workflows sowie multimodale Aufgaben aus. Die kleineren Varianten E2B und E4B sind für Smartphones und Laptops gedacht, während die größeren Modelle auf Systeme mit mittlerer bis hoher CPU-/VRAM-Leistung wie PCs mit NVIDIA-RTX-GPUs abzielen.

| Gemma-4-Variante | Details                                                      | Am besten geeignet                                                         |
| ---------------- | ------------------------------------------------------------ | -------------------------------------------------------------------------- |
| **E2B**          | Dense + PLE (128K Kontext)\nUnterstützung: Text, Bild, Audio | Für Inferenz auf dem Smartphone/Edge, ASR und Sprachübersetzung            |
| **E4B**          | Dense + PLE (128K Kontext)\nUnterstützung: Text, Bild, Audio | Kleines Modell für Laptops und schnelle lokale multimodale Nutzung         |
| **12B Unified**  | Dense (256K Kontext)\nUnterstützung: Text, Bild, Audio       | Mittleres Modell für Laptops und lokale multimodale Nutzung                |
| **26B-A4B**      | MoE (256K Kontext)\nUnterstützung: Text, Bild                | Bester Kompromiss aus Geschwindigkeit und Qualität für den Computereinsatz |
| **31B**          | Dense (256K Kontext)\nUnterstützung: Text, Bild              | Stärkste Leistung bei langsamerer Inferenz                                 |

**Siehe Gemma 4:** [**Leistungs-Benchmarks**](#official-gemma-benchmarks) **und** [**GGUF-Benchmarks**](#unsloth-gguf-benchmarks)**.**

**Sollte ich 26B-A4B oder 31B wählen?**

* **26B-A4B** – bietet ein ausgewogenes Verhältnis zwischen Geschwindigkeit und Genauigkeit. Sein MoE-Design macht es schneller als 31B, mit 4B aktiven Parametern. Wählen Sie es, wenn der RAM begrenzt ist und Sie bereit sind, etwas Qualität gegen Geschwindigkeit einzutauschen.
* **31B** – derzeit das stärkste Gemma-4-Modell. Wählen Sie es für maximale Qualität, wenn Sie genug Speicher haben und etwas langsamere Geschwindigkeiten akzeptieren können.

### Hardwareanforderungen

**Tabelle: Empfohlene Hardwareanforderungen für Gemma-4-Inferenz GGUF** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher). Sie können Gemma 4 auf macOS, NVIDIA RTX GPUs usw. verwenden.

| Gemma-4-Variante |    4-bit |    8-bit | BF16 / FP16 |
| ---------------- | -------: | -------: | ----------: |
| **E2B**          |     4 GB |   5–8 GB |       10 GB |
| **E4B**          | 5,5–6 GB |  9–12 GB |       16 GB |
| **12B Unified**  |   7–8 GB | 13–14 GB |       25 GB |
| **26B A4B**      | 16–18 GB | 28–30 GB |       52 GB |
| **31B**          | 17–20 GB | 34–38 GB |       62 GB |

{% hint style="info" %}
Als Faustregel gilt: Ihr gesamter verfügbarer Speicher sollte mindestens die Größe des quantisierten Modells übertreffen, das Sie herunterladen. Wenn das nicht der Fall ist, kann llama.cpp weiterhin mit teilweisem RAM-/Festplatten-Auslagern ausgeführt werden, die Generierung wird jedoch langsamer. Je nach verwendetem Kontextfenster benötigen Sie außerdem mehr Rechenleistung.
{% endhint %}

### Empfohlene Einstellungen

Es wird empfohlen, die Standardparameter von Google für Gemma 4 zu verwenden:

* `temperature = 1.0`
* `top_p = 0.95`
* `top_k = 64`

{% hint style="info" %}
Der maximale Kontext von Gemma 4 beträgt **128K** für **E2B** / **E4B** und `262,144` für **12B** / **26B A4B** / **31B**.
{% endhint %}

#### Denkmodus

Im Vergleich zu älteren Gemma-Chat-Templates verwendet Gemma 4 die standardmäßigen **`system`**, **`assistant`**, und **`user`** Rollen und fügt eine explizite Denksteuerung hinzu.

**So aktivieren Sie das Denken:**

Fügen Sie das Token **`<|think|>`** am **Anfang des System-Prompts**.

{% columns %}
{% column %}
**Denken aktiviert**

```
<|think|>
Sie sind ein sorgfältiger Coding-Assistent. Erklären Sie Ihre Antwort klar.
```

{% endcolumn %}

{% column %}
**Denken deaktiviert**

```
Sie sind ein sorgfältiger Coding-Assistent. Erklären Sie Ihre Antwort klar.
```

{% endcolumn %}
{% endcolumns %}

**Ausgabeverhalten:**

{% columns %}
{% column %}
Wenn das Denken aktiviert ist, gibt das Modell vor der endgültigen Antwort seinen internen Denkkanal aus.

```
<|channel>thought
[interne Begründung]
<channel|>
[endgültige Antwort]
```

{% endcolumn %}

{% column %}
Wenn das Denken deaktiviert ist, können die größeren Modelle dennoch einen **leeren Gedankenblock** vor der endgültigen Antwort ausgeben.

```
<|channel>thought
<channel|>
[endgültige Antwort]
```

{% endcolumn %}
{% endcolumns %}

**Zum Beispiel bei Verwendung von "**&#x57;ie heißt die Hauptstadt von Frankreich?":

{% code overflow="wrap" %}

```
<bos><|turn>system\n<|think|><turn|>\n<|turn>user\nWas ist die Hauptstadt von Frankreich?<turn|>\n<|turn>model\n
```

{% endcode %}

**dann gibt es mit:**

{% code overflow="wrap" %}

```
<|channel>thought\nDer Benutzer fragt nach der Hauptstadt von Frankreich.\nDie Hauptstadt von Frankreich ist Paris.<channel|>Die Hauptstadt von Frankreich ist Paris.<turn|>
```

{% endcode %}

**Regel für Mehrturn-Dialoge:**

Bei Mehrturn-Gesprächen, **nur die endgültige sichtbare Antwort im Chatverlauf behalten**. Tun Sie **nicht** vorherige Gedankenblöcke in den nächsten Turn zurückführen.

{% code overflow="wrap" %}

```
<bos><|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n<|turn>user\nWas ist 1+1?<turn|>\n<|turn>model\n2<turn|>\n
```

{% endcode %}

**So deaktivieren Sie das Denken:**

Hinweis `llama-cli` funktioniert möglicherweise nicht zuverlässig, also verwenden Sie `llama-server` zum Deaktivieren des Reasonings:

{% hint style="warning" %}
Um [Denken / Reasoning zu deaktivieren](#how-to-enable-or-disable-reasoning-and-thinking), verwenden Sie `--chat-template-kwargs '{"enable_thinking":false}'`

Wenn Sie auf **Windows** PowerShell verwenden, nutzen Sie: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Verwenden Sie 'true' und 'false' austauschbar.
{% endhint %}

## Gemma 4-Tutorials

Da Gemma-4-GGUFs in mehreren Größen erhältlich sind, ist der empfohlene Ausgangspunkt für die kleinen Modelle 8-Bit und für die größeren Modelle [**Dynamisch**](/docs/de/grundlagen/unsloth-dynamic-2.0-ggufs.md) **4-bit**. [Gemma 4 GGUFs](https://huggingface.co/collections/unsloth/gemma-4) oder [MLX](#mlx-dynamic-quants) oder [NVFP4](#nvfp4-guide):

| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-GGUF) | [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-GGUF) | [12b](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) | [26B-A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF) | [31B](https://huggingface.co/unsloth/gemma-4-31B-it-GGUF) |
| --------------------------------------------------------- | --------------------------------------------------------- | --------------------------------------------------------- | ----------------------------------------------------------------- | --------------------------------------------------------- |

<a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#unsloth-studio-guide" class="button primary">🦥 Unsloth Studio-Leitfaden</a><a href="/pages/774ab7ebd11d30a8067d492668e9dd61a8b209fb#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Leitfaden</a><a class="button primary">NVFP4-Leitfaden</a>

{% columns %}
{% column %}
**Sie können Gemma 4 kostenlos mit einer UI in unserem** [**Unsloth Studio**](/docs/de/neu/studio.md)✨ **Notebook:**
{% endcolumn %}

{% column %}
{% embed url="<https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb>" %}
{% endcolumn %}
{% endcolumns %}

### 🦥 Unsloth Studio-Leitfaden

Gemma 4 kann jetzt in [Unsloth Studio](/docs/de/neu/studio.md), unserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf **macOS, Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilung** Tool-Aufrufe](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](/docs/de/neu/studio.md#model-arena) Parameterabstimmung (temp, top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/25b89cbb431e29420702ee3c1e8f64e47233d588" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Führen Sie in Ihrem Terminal aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**macOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Dann öffnen Sie `http://127.0.0.1:8888` oder Ihre spezifische URL in Ihrem Browser.

**Unsloth sicher mit HTTPS und Cloudflare starten**

**NEU!** Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS durch einen kostenlosen Cloudflare-Tunnel zu starten. Verwenden Sie das Folgende (funktioniert unter Windows, Mac und Linux):

```bash
unsloth studio --secure
```

{% endstep %}

{% step %}

#### Gemma 4 suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto abzusichern, und sich dann erneut anmelden.

Gehen Sie dann zum [Unsloth Chat](/docs/de/neu/studio/chat.md) Tab und suchen Sie in der Suchleiste nach Gemma 4, um Ihr gewünschtes Modell und die gewünschte Quantisierung herunterzuladen. Unsloth unterstützt das neueste Gemma-4-12B-Unified-Modell.

<div data-with-frame="true"><figure><img src="/files/59e4ba0397de8461eae6bdceb892085d889565f6" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Gemma 4 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Sie können GGUFs- und MLX-Dateien ausführen.

Weitere Informationen finden Sie in unserem [Unsloth-Studio-Inferenzleitfaden](/docs/de/neu/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/25b89cbb431e29420702ee3c1e8f64e47233d588" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-Leitfaden

Für diesen Leitfaden verwenden wir Dynamic 4-Bit für 12B, 26B-A4B und 31B sowie 8-Bit für E2B und E4B. Siehe: [Gemma-4-GGUF-Sammlung](https://huggingface.co/collections/unsloth/gemma-4)

Für diese Tutorials verwenden wir [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.

{% stepper %}
{% step %}
Holen Sie sich die neueste `llama.cpp` **auf** [**hier auf GitHub**](https://github.com/ggml-org/llama.cpp). Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Wenn Sie `llama.cpp` direkt zum Laden von Modellen verwenden möchten, können Sie die folgenden Befehle je nach Modell befolgen. `UD-Q4_K_XL` ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich wie `ollama run` . Verwenden Sie `export LLAMA_CACHE="folder"` um zu erzwingen `llama.cpp` dass an einem bestimmten Speicherort gespeichert wird. Es ist nicht nötig, die Kontextlänge festzulegen, da llama.cpp automatisch genau die erforderliche Menge verwendet.

{% hint style="warning" %}
Um [Denken / Reasoning zu deaktivieren](#how-to-enable-or-disable-reasoning-and-thinking), verwenden Sie: `--chat-template-kwargs '{"enable_thinking":false}'`

**Windows** PowerShell: `--chat-template-kwargs "{\"enable_thinking\":false}"`

Verwenden Sie '`true`' und '`false`' austauschbar.
{% endhint %}

**12B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-12B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**26B-A4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-26B-A4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**31B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-31B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-31B-it-GGUF:UD-Q4_K_XL \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E4B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E4B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E4B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

**E2B:**

```bash
export LLAMA_CACHE="unsloth/gemma-4-E2B-it-GGUF"
./llama.cpp/llama-cli \\
    -hf unsloth/gemma-4-E2B-it-GGUF:Q8_0 \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endstep %}

{% step %}
Sie können das Modell auch manuell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Sie können wählen `UD-Q4_K_XL` oder andere quantisierte Versionen wie `Q8_0` . Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/gemma-4-26B-A4B-it-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-GGUF \\
    --include "*mmproj-BF16*" \\
    --include "*UD-Q4_K_XL*" # Verwenden Sie "*UD-Q2_K_XL*" für Dynamisch 2bit
```

{% endstep %}

{% step %}
Führen Sie das Modell dann im Konversationsmodus aus (mit Vision `mmproj-F16`):

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64
```

{% endcode %}
{% endstep %}

{% step %}

#### Bereitstellung mit Llama-Server

Um Gemma-4 auf llama-server bereitzustellen, verwenden Sie:

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 64 \\
    --alias "unsloth/gemma-4-26B-A4B-it-GGUF" \\
    --port 8001 \\
    --chat-template-kwargs '{"enable_thinking":true}'
```

{% endstep %}
{% endstepper %}

### Dynamische MLX-Quants

Wir haben auch dynamische 4-Bit- und 8-Bit-Quants als ersten Test für macOS-Geräte hochgeladen! Die MLX-Quants unterstützen **Vision.**

{% hint style="success" %}
Alle MLX-Quants funktionieren jetzt in[ Unsloth Studio](#unsloth-studio-guide)!
{% endhint %}

| Gemma 4 | 4-Bit-MLX                                                             | 8-Bit-MLX                                                          |
| ------- | --------------------------------------------------------------------- | ------------------------------------------------------------------ |
| 31B     | [Link](https://huggingface.co/unsloth/gemma-4-31b-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-31b-it-MLX-8bit)     |
| 26B-A4B | [Link](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit) | [Link](https://huggingface.co/unsloth/gemma-4-26b-a4b-it-MLX-8bit) |
| E4B     | [Link](https://huggingface.co/unsloth/gemma-4-E4B-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-E4B-it-MLX-8bit)     |
| E2B     | [Link](https://huggingface.co/unsloth/gemma-4-E2B-it-UD-MLX-4bit)     | [Link](https://huggingface.co/unsloth/gemma-4-E2B-it-MLX-8bit)     |

Um sie auszuprobieren, verwenden Sie:

{% code overflow="wrap" %}

```bash
curl -fsSL https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/scripts/install_gemma4_mlx.sh | sh
source ~/.unsloth/unsloth_gemma4_mlx/bin/activate
python -m mlx_vlm.chat --model unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit
```

{% endcode %}

### **NVFP4-Leitfaden**

Wir haben hochgeladen [Dynamisches NVFP4](/docs/de/grundlagen/nvfp4.md) Gemma-4-Quantisierungen für schnellere 4-Bit-Inferenz auf NVIDIA-Blackwell-GPUs. Dies sind die Hardwareanforderungen für Modelle, die Sie verwenden können, einschließlich Gemma 4. Siehe auch den Gesamtspeedup, den Sie erreichen werden:

| Gemma-4-Variante                                                   | Erforderlicher VRAM | Schneller als BF16 |
| ------------------------------------------------------------------ | ------------------: | -----------------: |
| [E2B](https://huggingface.co/unsloth/gemma-4-E2B-it-NVFP4)         |                7 GB |    1,12× schneller |
| [E4B](https://huggingface.co/unsloth/gemma-4-E4B-it-NVFP4)         |                9 GB |    1,22× schneller |
| [12B Unified](https://huggingface.co/unsloth/gemma-4-12b-it-NVFP4) |               11 GB |    1,26× schneller |
| [26B A4B](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-NVFP4) |               26 GB |    1,41× schneller |
| [31B](https://huggingface.co/unsloth/gemma-4-31B-it-NVFP4)         |               32 GB |    1,45× schneller |

<figure><img src="/files/af476f6bdd08b288ae3e6f3ec01cdd784e2094d6" alt="" width="563"><figcaption></figcaption></figure>

#### **vLLM-Tutorial:**

Um NVFP4-Quantisierungen auszuführen, siehe unten die Befehle, um Gemma-4-26B-A4B in [vLLM](/docs/de/grundlagen/inference-and-deployment/vllm-guide.md) und [SGLang](/docs/de/grundlagen/inference-and-deployment/sglang-guide.md) (Sie können den Modellnamen ändern in `gemma-4-31B-it-NVFP4` usw.) Wählen Sie außerdem KEIN MoE-Backend aus - lassen Sie vLLM es auswählen - z. B. ist Marlin 2,5x langsamer! Siehe [#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl](#marlin-vs-flashinfer-vs-cutlass-vs-cute-dsl "mention")Wenn Sie einen DGX Spark haben, siehe [#dgx-spark-serving](#dgx-spark-serving "mention") Sie müssen `--moe-backend flashinfer_b12x` oder Sie erhalten eine deutlich langsamere Inferenz.

Um vLLM in einer separaten venv zu installieren:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \\
    --torch-backend=auto
```

{% endcode %}

Dann, um die 26B-MoE-Variante zu bedienen:

```shell
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
```

Ändern Sie `unsloth/gemma-4-26B-A4B-it-NVFP4` in einen beliebigen [verfügbaren NVFP4](/docs/de/grundlagen/nvfp4.md#overview) Quant-Namen!

Um MTP / spekulatives Decoding zu aktivieren (schnelleres Decoding, aber etwas geringerer Durchsatz), verwenden Sie:

```bash
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Wenn Sie Torchcodec-Probleme bekommen, stellen Sie sicher, dass Sie Folgendes ausführen und dann vllm neu starten.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **DGX Spark mit NVFP4-Quantisierungen**

Um sicherzustellen, dass DGX Spark die richtigen Kerne hat (sonst erhalten Sie eine **2x LANGSAMERE Inferenz**), prüfen Sie zuerst:

{% code overflow="wrap" expandable="true" %}

```bash
python -c "
import torch; from vllm.utils.flashinfer import has_flashinfer_b12x_gemm as g, has_flashinfer_b12x_moe as m
cap = torch.cuda.get_device_capability(); print('cap', cap, '| b12x gemm', g(), '| b12x moe', m()); assert cap[0] == 12 and g() and m(), 'b12x unavailable: serving would degrade to marlin W4A16'\"
```

{% endcode %}

darf eigentlich keinen Fehler auslösen - falls doch, aktualisieren Sie bitte vllm oder installieren Sie es neu über:

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \\
    --torch-backend=auto
```

{% endcode %}

Dann, um in vLLM für DGX Spark zu servieren:

{% code overflow="wrap" expandable="true" %}

```shellscript
export CUTE_DSL_ARCH=sm_121a
vllm serve unsloth/gemma-4-26B-A4B-it-NVFP4 --moe-backend flashinfer_b12x
```

{% endcode %}

Wenn Sie Torchcodec-Probleme bekommen, stellen Sie sicher, dass Sie Folgendes ausführen und dann vllm neu starten.

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang-Tutorial:**

```bash
python -m sglang.launch_server --model-path unsloth/gemma-4-31B-it-NVFP4 --speculative-algorithm NEXTN \\
     --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4
```

### Ollama-Leitfaden

Ollama unterstützt Unsloth-GGUFs jetzt gut. Verwenden Sie `curl -fsSL https://ollama.com/install.sh | sh` um Ollama unter Linux zu installieren, oder `irm https://ollama.com/install.ps1 | iex` für Windows.\
\
Um eine einzelne Quant-Datei (unter 50 GB) zu verwenden, nutzen Sie:

{% code overflow="wrap" %}

```bash
ollama run hf.co/unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL
```

{% endcode %}

Für mehrere Shards wie größere BF16-Shards machen Sie Folgendes:

{% code overflow="wrap" %}

```bash
pip install -U huggingface_hub

# Laden Sie mmproj und BF16 in 2 Aufrufen herunter
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "BF16/*" \\
    --local-dir gemma4
hf download unsloth/gemma-4-26B-A4B-it-GGUF --include "mmproj-BF16.gguf" \\
    --local-dir gemma4

mv gemma4/mmproj-BF16.gguf gemma4/BF16/
echo "FROM ./gemma4/BF16" > Modelfile

ollama create unsloth-gemma4 -f Modelfile
ollama run unsloth-gemma4
```

{% endcode %}

<div data-with-frame="true"><figure><img src="/files/07a8d29a04146b11c4b97dc17a0e6b3a3fc4444d" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
Wenn Sie `Fehler: 500 Interner Serverfehler: Modell kann nicht geladen werden` aktualisieren Sie Ollama über `curl -fsSL https://ollama.com/install.sh | sh` oder verwenden Sie die PowerShell-Variante.
{% endhint %}

## Best Practices für Gemma 4

### Prompt-Beispiele

#### Einfacher Reasoning-Prompt

```
System:
<|think|>
Du bist ein präziser Reasoning-Assistent.

User:
Ein Zug fährt um 8:15 Uhr ab und kommt um 11:47 Uhr an. Wie lange dauerte die Reise?
```

#### OCR-/Dokumenten-Prompt

Für OCR verwenden Sie ein **hohes visuelles Token-Budget** wie **560** oder **1120**.

```
[Bild zuerst]
Extrahieren Sie den gesamten Text aus dieser Quittung. Geben Sie Positionen, Gesamtsumme, Händler und Datum als JSON zurück.
```

#### Multimodaler Vergleichs-Prompt

```
[Bild 1]
[Bild 2]
Vergleichen Sie diese beiden Screenshots und sagen Sie mir, welcher einen neuen Benutzer eher verwirren würde.
```

#### Audio-ASR-Prompt

```
Transkribieren Sie den folgenden Sprachabschnitt in {LANGUAGE} in {LANGUAGE}-Text.

Befolgen Sie diese spezifischen Anweisungen für die Formatierung der Antwort:
* Geben Sie nur die Transkription aus, ohne Zeilenumbrüche.
* Wenn Sie Zahlen transkribieren, schreiben Sie die Ziffern, d. h. schreiben Sie 1.7 und nicht one point seven, und schreiben Sie 3 statt three.
```

#### Audio-Übersetzungs-Prompt

```
Transkribieren Sie den folgenden Sprachabschnitt in {SOURCE_LANGUAGE} und übersetzen Sie ihn dann in {TARGET_LANGUAGE}. Beim Formatieren der Antwort geben Sie zuerst die Transkription in {SOURCE_LANGUAGE} aus, dann einen Zeilenumbruch, dann die Zeichenfolge '{TARGET_LANGUAGE}: ', dann die Übersetzung in {TARGET_LANGUAGE}.
```

### Multimodale Einstellungen

Für die besten Ergebnisse mit multimodalen Prompts platzieren Sie multimodale Inhalte zuerst:

* Platzieren Sie **Bild und/oder Audio vor dem Text**.
* Für Video übergeben Sie zuerst eine Folge von Frames und dann die Anweisung.

#### Audio- und Videolimits

* **Audio** ist verfügbar auf **12B**, **E2B** und **E4B** nur.
* Audio unterstützt maximal **30 Sekunden**.
* Video unterstützt maximal **60 Sekunden** vorausgesetzt **1 Bild pro Sekunde** Verarbeitung.

#### Audio-Prompt-Vorlagen

**ASR-Prompt**

```
Transkribieren Sie den folgenden Sprachabschnitt in {LANGUAGE} in {LANGUAGE}-Text.

Befolgen Sie diese spezifischen Anweisungen für die Formatierung der Antwort:
* Geben Sie nur die Transkription aus, ohne Zeilenumbrüche.
* Wenn Sie Zahlen transkribieren, schreiben Sie die Ziffern, d. h. schreiben Sie 1.7 und nicht one point seven, und schreiben Sie 3 statt three.
```

**Sprachübersetzungs-Prompt**

```
Transkribieren Sie den folgenden Sprachabschnitt in {SOURCE_LANGUAGE} und übersetzen Sie ihn dann in {TARGET_LANGUAGE}.
Beim Formatieren der Antwort geben Sie zuerst die Transkription in {SOURCE_LANGUAGE} aus, dann einen Zeilenumbruch, dann die Zeichenfolge '{TARGET_LANGUAGE}: ', dann die Übersetzung in {TARGET_LANGUAGE}.
```

## 📊 Benchmarks

### Unsloth-GGUF-Benchmarks

Wir haben Mean-KL-Divergenz-Benchmarks für Gemma-4-GGUFs über mehrere Anbieter hinweg durchgeführt, damit Sie die beste Quantisierung auswählen können (niedriger ist besser).

* Die KL-Divergenz bringt alle Unsloth-GGUFs an die SOTA-Pareto-Frontier
* KLD zeigt, wie gut ein quantisiertes Modell der ursprünglichen BF16-Ausgabeverteilung entspricht, und damit die erhaltene Genauigkeit.

<div data-with-frame="true"><figure><img src="/files/77a35e40de621cafc51c11dbb1812999ef4ffadf" alt=""><figcaption><p>26B A4B - KLD-Benchmarks (niedriger ist besser)</p></figcaption></figure></div>

### Offizielle Gemma-Benchmarks

**Text-/Code-Benchmarks**

| Benchmark            | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (ohne Think) |
| -------------------- | ----------- | --------------- | ------------------- | ----------- | ----------- | ------------------------ |
| MMLU Pro             | 85.2%       | 82.6%           | 77.2%               | 69.4%       | 60.0%       | 67.6%                    |
| AIME 2026 ohne Tools | 89.2%       | 88.3%           | 77.5%               | 42.5%       | 37.5%       | 20.8%                    |
| LiveCodeBench v6     | 80.0%       | 77.1%           | 72.0%               | 52.0%       | 44.0%       | 29.1%                    |
| Codeforces-Elo       | 2150        | 1718            | 1659                | 940         | 633         | 110                      |
| GPQA Diamond         | 84.3%       | 82.3%           | 78.8%               | 58.6%       | 43.4%       | 42.4%                    |
| Tau2                 | 76.9%       | 68.2%           | 69.0%               | 42.2%       | 24.5%       | 16.2%                    |
| HLE ohne Tools       | 19.5%       | 8.7%            | 5.2%                | -           | -           | -                        |
| HLE mit Suche        | 26.5%       | 17.2%           | -                   | -           | -           | -                        |
| BigBench Extra Hard  | 74.4%       | 64.8%           | 53.0%               | 33.1%       | 21.9%       | 19.3%                    |
| MMMLU                | 88.4%       | 86.3%           | 83.4%               | 76.6%       | 67.4%       | 70.7%                    |

**Vision Benchmarks**

| MMMU Pro                                | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% |
| --------------------------------------- | ----- | ----- | ----- | ----- | ----- | ----- |
| OmniDocBench 1.5 (niedriger ist besser) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
| MATH-Vision                             | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% |
| MedXPertQA MM                           | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | -     |

**Audio-Benchmarks**

| CoVoST                               | -     | -     | 38.5<sup>\*</sup>  | 35.54 | 33.47 | -     |
| ------------------------------------ | ----- | ----- | ------------------ | ----- | ----- | ----- |
| FLEURS (niedriger ist besser)        | -     | -     | 0.069<sup>\*</sup> | 0.08  | 0.09  | -     |
| **Langer Kontext**                   |       |       |                    |       |       |       |
| MRCR v2 8 needle 128k (Durchschnitt) | 66.4% | 44.1% | 43.4%              | 25.4% | 19.1% | 13.5% |

<div data-with-frame="true"><figure><img src="/files/b6dee250a47ad24ed4d941817e6871af979eaa1b" alt=""><figcaption></figcaption></figure></div>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/gemma-4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
