✨Gemma 4 - So führen Sie es lokal aus
Führen Sie Googles neue Gemma-4-Modelle lokal aus, einschließlich E2B, E4B, 26B A4B und 31B.
Gemma 4 ist die neue Familie offener Modelle von Google DeepMind, einschließlich 12B, E2B, E4B, 26B-A4B, und 31B. Die multimodalen Hybrid-Denkmodelle unterstützen über 140 Sprachen, bis zu 256K Kontext, und es gibt dichte sowie MoE-Varianten. Gemma 4 ist unter Apache-2.0 lizenziert und kann auf deinem lokalen Gerät ausgeführt werden.
Gemma-4-12B ist neu und bietet vereinheitlichte Unterstützung für Text, Bild und Audio. Es läuft auf 8 GB RAM (4-Bit) oder 14 GB (8-Bit). Gemma-4-E2B und E4B unterstützen ebenfalls Bild und Audio. Läuft auf 5 GB RAM (4-Bit) oder 15 GB (voll 16-Bit) über GGUF, MLX oder NVFP4-Quants.
Gemma 4 ausführenGemma 4 feinabstimmenGemma 4 QATGemma 4 MTP
NEU: Gemma 4 MTP ist da! MTP ermöglicht 1,4–2,2x schnellere Inferenz ohne Genauigkeitsverlust. Führe MTP direkt in Unsloth Studio.
Gemma-4-26B-A4B läuft auf 18 GB (4-Bit) oder 28 GB (8-Bit). Gemma-4-31B benötigt 20 GB RAM (4-Bit) oder 34 GB (8-Bit).
Du kannst jetzt alle GGUFs, MLX ausführen und Gemma 4 feinabstimmen in Unsloth Studio (siehe rechts).
QAT Varianten von Gemma 4 reduzieren den Speicherbedarf um etwa das 3-Fache, während die Modellqualität erhalten bleibt.

9. Jun: Gemma 4 MTP ist da.
5. Jun: Gemma 4 QAT ist veröffentlicht.
2. Jun: Gemma 4 12B Unified ist veröffentlicht.
20. Apr: Wir haben Gemma 4 GGUF-Benchmarks durchgeführt, um dir bei der Auswahl der besten Quant zu helfen.
Nutzungsanleitung
Gemma 4 glänzt bei Schlussfolgern, Programmierung, Tool-Nutzung, Langkontext- und agentischen Workflows sowie multimodalen Aufgaben. Die kleineren Varianten E2B und E4B sind für Telefone und Laptops gedacht, während die größeren Modelle auf Systeme mit mittlerer bis hoher CPU-/VRAM-Leistung abzielen, etwa PCs mit NVIDIA-RTX-GPUs.
E2B
Dense + PLE (128K Kontext) Unterstützung: Text, Bild, Audio
Für Telefon-/Edge-Inferenz, ASR, Sprachübersetzung
E4B
Dense + PLE (128K Kontext) Unterstützung: Text, Bild, Audio
Kleines Modell für Laptops und schnelle lokale multimodale Nutzung
12B Unified
Dense (256K Kontext) Unterstützung: Text, Bild, Audio
Mittleres Modell für Laptops und lokale multimodale Nutzung
26B-A4B
MoE (256K Kontext) Unterstützung: Text, Bild
Bester Kompromiss aus Geschwindigkeit und Qualität für die Computernutzung
31B
Dense (256K Kontext) Unterstützung: Text, Bild
Stärkste Leistung bei langsamerer Inferenz
Siehe Gemma 4: Leistungs-Benchmarks und GGUF-Benchmarks.
Soll ich 26B-A4B oder 31B wählen?
26B-A4B - balanciert Geschwindigkeit und Genauigkeit. Sein MoE-Design macht es schneller als 31B, mit 4B aktiven Parametern. Wähle es, wenn RAM knapp ist und du bereit bist, etwas Qualität gegen Geschwindigkeit einzutauschen.
31B - derzeit das stärkste Gemma-4-Modell. Wähle es für maximale Qualität, wenn du genug Speicher hast und etwas langsamere Geschwindigkeiten akzeptieren kannst.
Hardware-Anforderungen
Tabelle: Empfohlene Hardwareanforderungen für Gemma 4 Inferenz GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher). Du kannst Gemma 4 auf MacOS, NVIDIA-RTX-GPUs usw. verwenden.
E2B
4 GB
5–8 GB
10 GB
E4B
5,5–6 GB
9–12 GB
16 GB
12B Unified
7–8 GB
13–14 GB
25 GB
26B A4B
16–18 GB
28–30 GB
52 GB
31B
17–20 GB
34–38 GB
62 GB
Als Faustregel gilt: Dein insgesamt verfügbarer Speicher sollte mindestens größer sein als die Größe des quantisierten Modells, das du herunterlädst. Wenn das nicht der Fall ist, kann llama.cpp zwar weiterhin mit teilweisem RAM-/Festplatten-Offload laufen, aber die Generierung wird langsamer sein. Je nach verwendetem Kontextfenster benötigst du außerdem mehr Rechenleistung.
Empfohlene Einstellungen
Es wird empfohlen, Googles Standardparameter für Gemma 4 zu verwenden:
temperature = 1,0top_p = 0,95top_k = 64
Der maximale Kontext von Gemma 4 ist 128K für E2B / E4B und 262,144 für 12B / 26B A4B / 31B.
Denkmodus
Im Vergleich zu älteren Gemma-Chat-Templates verwendet Gemma 4 die standardmäßigen System-, Assistent-, und Benutzer- Rollen und fügt eine explizite Denksteuerung hinzu.
So aktivierst du das Denken:
Füge das Token <|think|> am Anfang des System-Prompts hinzu.
Denken aktiviert
Denken deaktiviert
Ausgabeverhalten:
Wenn das Denken aktiviert ist, gibt das Modell vor der endgültigen Antwort seinen internen Denkkanal aus.
Wenn das Denken deaktiviert ist, können die größeren Modelle dennoch ein leeres Gedankenfeld vor der endgültigen Antwort ausgeben.
Zum Beispiel mit "Was ist die Hauptstadt von Frankreich?":
dann gibt es Folgendes aus:
Regel für Mehrfachdialoge:
Bei Unterhaltungen mit mehreren Runden nur die endgültige sichtbare Antwort im Chatverlauf behalten. Tue nicht frühere Gedankenblöcke in die nächste Runde zurückspeisen.
So deaktivierst du das Denken:
Hinweis llama-cli funktioniert möglicherweise nicht zuverlässig, verwende daher llama-server zum Deaktivieren des Schlussfolgerns:
Um Denken / Schlussfolgern deaktivieren, verwende --chat-template-kwargs '{"enable_thinking":false}'
Wenn du auf Windows Powershell bist, verwende: --chat-template-kwargs "{\"enable_thinking\":false}"
Verwende 'true' und 'false' austauschbar.
Gemma-4-Tutorials ausführen
Da Gemma-4-GGUFs in mehreren Größen verfügbar sind, ist der empfohlene Ausgangspunkt für die kleineren Modelle 8-Bit und für die größeren Modelle Dynamisch 4-Bit. Gemma-4-GGUFs oder MLX oder NVFP4:
🦥 Unsloth-Desktop-Anleitung🦙 Llama.cpp-AnleitungNVFP4-Anleitung
Du kannst Gemma 4 kostenlos mit einer UI in unserem Unsloth Studio✨ Notebook:
🦥 Unsloth-Anleitung
Gemma 4 kann jetzt ausgeführt und feinabgestimmt werden in Unsloth Desktop, unserer neuen Open-Source-Desktop-UI für lokale KI. Unsloth Studio ermöglicht es dir, Modelle lokal auszuführen auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilung Tool-Aufruf + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Der einfachste Einstieg ist der Download der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.
Oder, wenn du es lieber manuell installieren möchtest:
MacOS, Linux, WSL:
Windows PowerShell:
Unsloth starten
MacOS, Linux, WSL und Windows:
Dann öffne http://127.0.0.1:8888 oder deine spezifische URL in deinem Browser.
Unsloth sicher mit HTTPS und Cloudflare starten
NEU! Unsloth bietet jetzt eine sichere Möglichkeit, Unsloth über HTTPS durch einen kostenlosen Cloudflare-Tunnel zu starten. Verwende das Folgende (funktioniert unter Windows, Mac & Linux):
Gemma 4 suchen und herunterladen
Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.
Dann gehe zum Unsloth Chat Tab, suche in der Suchleiste nach Gemma 4 und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Unsloth unterstützt das neueste Gemma-4-12B-Unity-Modell.

Gemma 4 ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Du kannst GGUF- und MLX-Dateien ausführen.
Für weitere Informationen kannst du unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung
Für diese Anleitung verwenden wir Dynamic 4-Bit für die 12B, 26B-A4B und 31B sowie 8-Bit für E2B und E4B. Siehe: Gemma-4-GGUF-Sammlung
Für diese Tutorials werden wir llama.cpp für schnelle lokale Inferenz verwenden, besonders wenn du eine CPU hast.
Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch die Build-Anweisungen unten befolgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Wenn du verwenden möchtest llama.cpp direkt zum Laden von Modellen, kannst du den unten stehenden Befehlen folgen, je nach Modell. UD-Q4_K_XL ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um zu erzwingen llama.cpp dass in einem bestimmten Speicherort gespeichert wird. Es ist nicht nötig, die Kontextlänge festzulegen, da llama.cpp automatisch die exakt benötigte Menge verwendet.
Um Denken / Schlussfolgern deaktivieren, verwende: --chat-template-kwargs '{"enable_thinking":false}'
Windows Powershell: --chat-template-kwargs "{\"enable_thinking\":false}"
Verwende 'true' und 'false' austauschbar.
12B:
26B-A4B:
31B:
E4B:
E2B:
Du kannst das Modell auch manuell über den unten stehenden Code herunterladen (nach der Installation von pip install huggingface_hub). Du kannst wählen UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 . Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führe das Modell im Konversationsmodus aus (mit Vision mmproj-F16):
MLX Dynamic Quants
Wir haben außerdem dynamische 4-Bit- und 8-Bit-Quants als ersten Test für MacOS-Geräte hochgeladen! Die MLX-Quants unterstützen Vision.
Alle MLX-Quants funktionieren jetzt in Unsloth Studio!
Um sie auszuprobieren, verwenden Sie:
NVFP4-Anleitung
Wir haben Dynamisches NVFP4 Gemma-4-Quants für schnellere 4-Bit-Inferenz auf NVIDIA-Blackwell-GPUs. Dies sind die Hardwareanforderungen für Modelle, die Sie verwenden können, einschließlich Gemma 4. Sehen Sie sich auch den gesamten Geschwindigkeitszuwachs an, den Sie erzielen werden:

vLLM-Anleitung:
Um NVFP4-Quants auszuführen, sehen Sie unten die Befehle zum Ausführen von Gemma-4-26B-A4B in vLLM und SGLang (Sie können den Modellnamen ändern zu gemma-4-31B-it-NVFP4 usw.) Wählen Sie außerdem KEIN MoE-Backend aus - lassen Sie vLLM es auswählen - z. B. ist Marlin 2,5x langsamer! Siehe Gemma 4Wenn Sie einen DGX Spark haben, siehe Gemma 4 Sie müssen --moe-backend flashinfer_b12x oder Sie erhalten eine viel langsamere Inferenz.
Um vLLM in einer separaten venv zu installieren:
Dann, um die 26B-MoE-Variante bereitzustellen:
Ändern Sie unsloth/gemma-4-26B-A4B-it-NVFP4 in jeden verfügbaren NVFP4- Quant-Namen!
Um MTP / spekulatives Decodieren zu aktivieren (schnelleres Decodieren, aber etwas geringerer Durchsatz), verwenden Sie:
Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.
DGX Spark mit NVFP4-Quants
Um sicherzustellen, dass DGX Spark die richtigen Kernel hat (sonst erhalten Sie 2x LANGSAMERE Inferenz), prüfen Sie zuerst:
was KEINEN Fehler auslösen sollte - falls doch, aktualisieren Sie bitte vllm oder installieren Sie es neu über:
Dann, um in vLLM für DGX Spark bereitzustellen:
Wenn Sie Torchcodec-Probleme haben, führen Sie bitte Folgendes aus und starten Sie dann vllm neu.
SGLang-Anleitung:
Ollama-Anleitung
Ollama unterstützt Unsloth-GGUFs jetzt gut. Verwenden Sie curl -fsSL https://ollama.com/install.sh | sh um Ollama unter Linux zu installieren oder irm https://ollama.com/install.ps1 | iex für Windows.
Um eine einzelne Quant-Datei (unter 50 GB) zu verwenden, nutzen Sie:
Für mehrere Shards, wie größere BF16-Shards, führen Sie Folgendes aus:

Wenn Sie Fehler: 500 Interner Serverfehler: Modell konnte nicht geladen werden aktualisieren Sie Ollama über curl -fsSL https://ollama.com/install.sh | sh oder verwenden Sie die PowerShell-Variante.
Best Practices für Gemma 4
Beispiel-Prompts
Einfacher Schlussfolgerungs-Prompt
OCR-/Dokumenten-Prompt
Für OCR verwenden Sie ein hohes visuelles Token-Budget wie 560 oder 1120.
Multimodaler Vergleichs-Prompt
Audio-ASR-Prompt
Audio-Übersetzungs-Prompt
Multimodale Einstellungen
Für beste Ergebnisse bei multimodalen Prompts platzieren Sie multimodale Inhalte zuerst:
Platzieren Sie Bild und/oder Audio vor Text.
Für Video übergeben Sie zuerst eine Sequenz von Frames, dann die Anweisung.
Audio- und Videolimits
Audio ist verfügbar auf 12B, E2B und E4B nur.
Audio unterstützt maximal 30 Sekunden.
Video unterstützt maximal 60 Sekunden bei Annahme von 1 Frame pro Sekunde Verarbeitung.
Audio-Promptvorlagen
ASR-Prompt
Sprachübersetzungs-Prompt
📊 Benchmarks
Unsloth GGUF-Benchmarks
Wir haben Mean-KL-Divergenz-Benchmarks für Gemma-4-GGUFs über verschiedene Anbieter hinweg durchgeführt, damit Sie den besten Quant auswählen können (niedriger ist besser).
KL-Divergenz bringt alle Unsloth-GGUFs auf die SOTA-Pareto-Frontier
KLD zeigt, wie gut ein quantisiertes Modell der ursprünglichen BF16-Ausgabeverteilung entspricht und damit die erhaltene Genauigkeit anzeigt.

Offizielle Gemma-Benchmarks
Text-/Code-Benchmarks
MMLU Pro
85.2%
82.6%
77.2%
69.4%
60.0%
67.6%
AIME 2026 ohne Tools
89.2%
88.3%
77.5%
42.5%
37.5%
20.8%
LiveCodeBench v6
80.0%
77.1%
72.0%
52.0%
44.0%
29.1%
Codeforces-ELO
2150
1718
1659
940
633
110
GPQA Diamond
84.3%
82.3%
78.8%
58.6%
43.4%
42.4%
Tau2
76.9%
68.2%
69.0%
42.2%
24.5%
16.2%
HLE ohne Tools
19.5%
8.7%
5.2%
-
-
-
HLE mit Suche
26.5%
17.2%
-
-
-
-
BigBench Extra Hard
74.4%
64.8%
53.0%
33.1%
21.9%
19.3%
MMMLU
88.4%
86.3%
83.4%
76.6%
67.4%
70.7%
Vision-Benchmarks
MMMU Pro
76.9%
73.8%
69.1%
52.6%
44.2%
49.7%
OmniDocBench 1.5 (niedriger ist besser)
0.131
0.149
0.164
0.181
0.290
0.365
MATH-Vision
85.6%
82.4%
79.7%
59.5%
52.4%
46.0%
MedXPertQA MM
61.3%
58.1%
48.7%
28.7%
23.5%
-
Audio-Benchmarks
CoVoST
-
-
38.5*
35.54
33.47
-
FLEURS (niedriger ist besser)
-
-
0.069*
0.08
0.09
-
Langer Kontext
MRCR v2 8 needle 128k (Durchschnitt)
66.4%
44.1%
43.4%
25.4%
19.1%
13.5%

Zuletzt aktualisiert
War das hilfreich?

