For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 - So führen Sie es lokal aus

Führen Sie Googles neue Gemma-4-Modelle lokal aus, einschließlich E2B, E4B, 26B A4B und 31B.

Gemma 4 ist die neue Familie offener Modelle von Google DeepMind, einschließlich 12B, E2B, E4B, 26B-A4B, und 31B. Die multimodalen Hybrid-Denkmodelle unterstützen über 140 Sprachen, bis zu 256K Kontext, und es gibt dichte sowie MoE-Varianten. Gemma 4 ist unter Apache-2.0 lizenziert und kann auf deinem lokalen Gerät ausgeführt werden.

Gemma-4-12B ist neu und bietet vereinheitlichte Unterstützung für Text, Bild und Audio. Es läuft auf 8 GB RAM (4-Bit) oder 14 GB (8-Bit). Gemma-4-E2B und E4B unterstützen ebenfalls Bild und Audio. Läuft auf 5 GB RAM (4-Bit) oder 15 GB (voll 16-Bit) über GGUF, MLX oder NVFP4-Quants.

Gemma 4 ausführenGemma 4 feinabstimmenGemma 4 QATGemma 4 MTP

Gemma-4-26B-A4B läuft auf 18 GB (4-Bit) oder 28 GB (8-Bit). Gemma-4-31B benötigt 20 GB RAM (4-Bit) oder 34 GB (8-Bit).

Du kannst jetzt alle GGUFs, MLX ausführen und Gemma 4 feinabstimmen in Unsloth Studio (siehe rechts).

QAT Varianten von Gemma 4 reduzieren den Speicherbedarf um etwa das 3-Fache, während die Modellqualität erhalten bleibt.

Nutzungsanleitung

Gemma 4 glänzt bei Schlussfolgern, Programmierung, Tool-Nutzung, Langkontext- und agentischen Workflows sowie multimodalen Aufgaben. Die kleineren Varianten E2B und E4B sind für Telefone und Laptops gedacht, während die größeren Modelle auf Systeme mit mittlerer bis hoher CPU-/VRAM-Leistung abzielen, etwa PCs mit NVIDIA-RTX-GPUs.

Gemma-4-Variante
Details
Am besten geeignet für

E2B

Dense + PLE (128K Kontext) Unterstützung: Text, Bild, Audio

Für Telefon-/Edge-Inferenz, ASR, Sprachübersetzung

E4B

Dense + PLE (128K Kontext) Unterstützung: Text, Bild, Audio

Kleines Modell für Laptops und schnelle lokale multimodale Nutzung

12B Unified

Dense (256K Kontext) Unterstützung: Text, Bild, Audio

Mittleres Modell für Laptops und lokale multimodale Nutzung

26B-A4B

MoE (256K Kontext) Unterstützung: Text, Bild

Bester Kompromiss aus Geschwindigkeit und Qualität für die Computernutzung

31B

Dense (256K Kontext) Unterstützung: Text, Bild

Stärkste Leistung bei langsamerer Inferenz

Siehe Gemma 4: Leistungs-Benchmarks und GGUF-Benchmarks.

Soll ich 26B-A4B oder 31B wählen?

  • 26B-A4B - balanciert Geschwindigkeit und Genauigkeit. Sein MoE-Design macht es schneller als 31B, mit 4B aktiven Parametern. Wähle es, wenn RAM knapp ist und du bereit bist, etwas Qualität gegen Geschwindigkeit einzutauschen.

  • 31B - derzeit das stärkste Gemma-4-Modell. Wähle es für maximale Qualität, wenn du genug Speicher hast und etwas langsamere Geschwindigkeiten akzeptieren kannst.

Hardware-Anforderungen

Tabelle: Empfohlene Hardwareanforderungen für Gemma 4 Inferenz GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher). Du kannst Gemma 4 auf MacOS, NVIDIA-RTX-GPUs usw. verwenden.

Gemma-4-Variante
4-Bit
8-Bit
BF16 / FP16

E2B

4 GB

5–8 GB

10 GB

E4B

5,5–6 GB

9–12 GB

16 GB

12B Unified

7–8 GB

13–14 GB

25 GB

26B A4B

16–18 GB

28–30 GB

52 GB

31B

17–20 GB

34–38 GB

62 GB

Als Faustregel gilt: Dein insgesamt verfügbarer Speicher sollte mindestens größer sein als die Größe des quantisierten Modells, das du herunterlädst. Wenn das nicht der Fall ist, kann llama.cpp zwar weiterhin mit teilweisem RAM-/Festplatten-Offload laufen, aber die Generierung wird langsamer sein. Je nach verwendetem Kontextfenster benötigst du außerdem mehr Rechenleistung.

Empfohlene Einstellungen

Es wird empfohlen, Googles Standardparameter für Gemma 4 zu verwenden:

  • temperature = 1,0

  • top_p = 0,95

  • top_k = 64

Der maximale Kontext von Gemma 4 ist 128K für E2B / E4B und 262,144 für 12B / 26B A4B / 31B.

Denkmodus

Im Vergleich zu älteren Gemma-Chat-Templates verwendet Gemma 4 die standardmäßigen System-, Assistent-, und Benutzer- Rollen und fügt eine explizite Denksteuerung hinzu.

So aktivierst du das Denken:

Füge das Token <|think|> am Anfang des System-Prompts hinzu.

Denken aktiviert

Denken deaktiviert

Ausgabeverhalten:

Wenn das Denken aktiviert ist, gibt das Modell vor der endgültigen Antwort seinen internen Denkkanal aus.

Wenn das Denken deaktiviert ist, können die größeren Modelle dennoch ein leeres Gedankenfeld vor der endgültigen Antwort ausgeben.

Zum Beispiel mit "Was ist die Hauptstadt von Frankreich?":

dann gibt es Folgendes aus:

Regel für Mehrfachdialoge:

Bei Unterhaltungen mit mehreren Runden nur die endgültige sichtbare Antwort im Chatverlauf behalten. Tue nicht frühere Gedankenblöcke in die nächste Runde zurückspeisen.

So deaktivierst du das Denken:

Hinweis llama-cli funktioniert möglicherweise nicht zuverlässig, verwende daher llama-server zum Deaktivieren des Schlussfolgerns:

Gemma-4-Tutorials ausführen

Da Gemma-4-GGUFs in mehreren Größen verfügbar sind, ist der empfohlene Ausgangspunkt für die kleineren Modelle 8-Bit und für die größeren Modelle Dynamisch 4-Bit. Gemma-4-GGUFs oder MLX oder NVFP4:

🦥 Unsloth-Desktop-Anleitung🦙 Llama.cpp-AnleitungNVFP4-Anleitung

Du kannst Gemma 4 kostenlos mit einer UI in unserem Unsloth Studio Notebook:

🦥 Unsloth-Anleitung

Gemma 4 kann jetzt ausgeführt und feinabgestimmt werden in Unsloth Desktop, unserer neuen Open-Source-Desktop-UI für lokale KI. Unsloth Studio ermöglicht es dir, Modelle lokal auszuführen auf MacOS, Windows, Linux und:

1

Unsloth installieren

Der einfachste Einstieg ist der Download der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, wenn du es lieber manuell installieren möchtest:

MacOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffne http://127.0.0.1:8888 oder deine spezifische URL in deinem Browser.

Unsloth sicher mit HTTPS und Cloudflare starten

NEU! Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS durch einen kostenlosen Cloudflare-Tunnel zu starten. Verwende das Folgende (funktioniert unter Windows, Mac & Linux):

3

Gemma 4 suchen und herunterladen

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.

Dann gehe zum Unsloth Chat Tab, suche in der Suchleiste nach Gemma 4 und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Unsloth unterstützt das neueste Gemma-4-12B-Unity-Modell.

4

Gemma 4 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Du kannst GGUF- und MLX-Dateien ausführen.

Für weitere Informationen kannst du unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung

Für diese Anleitung verwenden wir Dynamic 4-Bit für die 12B, 26B-A4B und 31B sowie 8-Bit für E2B und E4B. Siehe: Gemma-4-GGUF-Sammlung

Für diese Tutorials werden wir llama.cpp für schnelle lokale Inferenz verwenden, besonders wenn du eine CPU hast.

1

Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch die Build-Anweisungen unten befolgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn du verwenden möchtest llama.cpp direkt zum Laden von Modellen, kannst du den unten stehenden Befehlen folgen, je nach Modell. UD-Q4_K_XL ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um zu erzwingen llama.cpp dass in einem bestimmten Speicherort gespeichert wird. Es ist nicht nötig, die Kontextlänge festzulegen, da llama.cpp automatisch die exakt benötigte Menge verwendet.

12B:

26B-A4B:

31B:

E4B:

E2B:

3

Du kannst das Modell auch manuell über den unten stehenden Code herunterladen (nach der Installation von pip install huggingface_hub). Du kannst wählen UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 . Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führe das Modell im Konversationsmodus aus (mit Vision mmproj-F16):

5

Bereitstellung von Llama-server

Um Gemma-4 auf llama-server bereitzustellen, verwende:

MLX Dynamic Quants

Wir haben außerdem dynamische 4-Bit- und 8-Bit-Quants als ersten Test für MacOS-Geräte hochgeladen! Die MLX-Quants unterstützen Vision.

Gemma 4
4-Bit-MLX
8-Bit-MLX

Um sie auszuprobieren, verwenden Sie:

NVFP4-Anleitung

Wir haben Dynamisches NVFP4 Gemma-4-Quants für schnellere 4-Bit-Inferenz auf NVIDIA-Blackwell-GPUs. Dies sind die Hardwareanforderungen für Modelle, die Sie verwenden können, einschließlich Gemma 4. Sehen Sie sich auch den gesamten Geschwindigkeitszuwachs an, den Sie erzielen werden:

Gemma-4-Variante
Erforderlicher VRAM
Schneller als BF16

7 GB

1,12× schneller

9 GB

1,22× schneller

11 GB

1,26× schneller

26 GB

1,41× schneller

32 GB

1,45× schneller

vLLM-Anleitung:

Um NVFP4-Quants auszuführen, sehen Sie unten die Befehle zum Ausführen von Gemma-4-26B-A4B in vLLM und SGLang (Sie können den Modellnamen ändern zu gemma-4-31B-it-NVFP4 usw.) Wählen Sie außerdem KEIN MoE-Backend aus - lassen Sie vLLM es auswählen - z. B. ist Marlin 2,5x langsamer! Siehe Gemma 4Wenn Sie einen DGX Spark haben, siehe Gemma 4 Sie müssen --moe-backend flashinfer_b12x oder Sie erhalten eine viel langsamere Inferenz.

Um vLLM in einer separaten venv zu installieren:

Dann, um die 26B-MoE-Variante bereitzustellen:

Ändern Sie unsloth/gemma-4-26B-A4B-it-NVFP4 in jeden verfügbaren NVFP4- Quant-Namen!

Um MTP / spekulatives Decodieren zu aktivieren (schnelleres Decodieren, aber etwas geringerer Durchsatz), verwenden Sie:

Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.

DGX Spark mit NVFP4-Quants

Um sicherzustellen, dass DGX Spark die richtigen Kernel hat (sonst erhalten Sie 2x LANGSAMERE Inferenz), prüfen Sie zuerst:

was KEINEN Fehler auslösen sollte - falls doch, aktualisieren Sie bitte vllm oder installieren Sie es neu über:

Dann, um in vLLM für DGX Spark bereitzustellen:

Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.

SGLang-Anleitung:

Ollama-Anleitung

Ollama unterstützt Unsloth-GGUFs jetzt gut. Verwenden Sie curl -fsSL https://ollama.com/install.sh | sh um Ollama unter Linux zu installieren oder irm https://ollama.com/install.ps1 | iex für Windows. Um eine einzelne Quant-Datei (unter 50 GB) zu verwenden, nutzen Sie:

Für mehrere Shards, wie größere BF16-Shards, führen Sie Folgendes aus:

Wenn Sie Fehler: 500 Interner Serverfehler: Modell konnte nicht geladen werden aktualisieren Sie Ollama über curl -fsSL https://ollama.com/install.sh | sh oder verwenden Sie die PowerShell-Variante.

Best Practices für Gemma 4

Beispiel-Prompts

Einfacher Schlussfolgerungs-Prompt

OCR-/Dokumenten-Prompt

Für OCR verwenden Sie ein hohes visuelles Token-Budget wie 560 oder 1120.

Multimodaler Vergleichs-Prompt

Audio-ASR-Prompt

Audio-Übersetzungs-Prompt

Multimodale Einstellungen

Für beste Ergebnisse bei multimodalen Prompts platzieren Sie multimodale Inhalte zuerst:

  • Platzieren Sie Bild und/oder Audio vor Text.

  • Für Video übergeben Sie zuerst eine Sequenz von Frames, dann die Anweisung.

Audio- und Videolimits

  • Audio ist verfügbar auf 12B, E2B und E4B nur.

  • Audio unterstützt maximal 30 Sekunden.

  • Video unterstützt maximal 60 Sekunden bei Annahme von 1 Frame pro Sekunde Verarbeitung.

Audio-Promptvorlagen

ASR-Prompt

Sprachübersetzungs-Prompt

📊 Benchmarks

Unsloth GGUF-Benchmarks

Wir haben Mean-KL-Divergenz-Benchmarks für Gemma-4-GGUFs über verschiedene Anbieter hinweg durchgeführt, damit Sie den besten Quant auswählen können (niedriger ist besser).

  • KL-Divergenz bringt alle Unsloth-GGUFs auf die SOTA-Pareto-Frontier

  • KLD zeigt, wie gut ein quantisiertes Modell der ursprünglichen BF16-Ausgabeverteilung entspricht und damit die erhaltene Genauigkeit anzeigt.

26B A4B - KLD-Benchmarks (niedriger ist besser)

Offizielle Gemma-Benchmarks

Text-/Code-Benchmarks

Benchmark
Gemma 4 31B
Gemma 4 26B A4B
Gemma 4 12B Unified
Gemma 4 E4B
Gemma 4 E2B
Gemma 3 27B (ohne Denken)

MMLU Pro

85.2%

82.6%

77.2%

69.4%

60.0%

67.6%

AIME 2026 ohne Tools

89.2%

88.3%

77.5%

42.5%

37.5%

20.8%

LiveCodeBench v6

80.0%

77.1%

72.0%

52.0%

44.0%

29.1%

Codeforces-ELO

2150

1718

1659

940

633

110

GPQA Diamond

84.3%

82.3%

78.8%

58.6%

43.4%

42.4%

Tau2

76.9%

68.2%

69.0%

42.2%

24.5%

16.2%

HLE ohne Tools

19.5%

8.7%

5.2%

-

-

-

HLE mit Suche

26.5%

17.2%

-

-

-

-

BigBench Extra Hard

74.4%

64.8%

53.0%

33.1%

21.9%

19.3%

MMMLU

88.4%

86.3%

83.4%

76.6%

67.4%

70.7%

Vision-Benchmarks

MMMU Pro

76.9%

73.8%

69.1%

52.6%

44.2%

49.7%

OmniDocBench 1.5 (niedriger ist besser)

0.131

0.149

0.164

0.181

0.290

0.365

MATH-Vision

85.6%

82.4%

79.7%

59.5%

52.4%

46.0%

MedXPertQA MM

61.3%

58.1%

48.7%

28.7%

23.5%

-

Audio-Benchmarks

CoVoST

-

-

38.5*

35.54

33.47

-

FLEURS (niedriger ist besser)

-

-

0.069*

0.08

0.09

-

Langer Kontext

MRCR v2 8 needle 128k (Durchschnitt)

66.4%

44.1%

43.4%

25.4%

19.1%

13.5%

Zuletzt aktualisiert

War das hilfreich?