DiffusionGemma - So lokal ausführen
DiffusionGemma 26B-A4B ist Googles neues offenes multimodales Modell, aufgebaut auf der Gemma 4 MoE-Architektur. Mit Unterstützung für 256K-Kontext, 140+ Sprachen, ist DiffusionGemma für hochgeschwindigkeitsbasierte Textgenerierung über Text-, Video- und Bildeingaben hinweg konzipiert. DiffusionGemma kann lokal auf 18 GB RAM, und Feinabstimmung wird jetzt unterstützt über Unsloth.
Anstatt des standardmäßigen Token-für-Token-Decodings verwendet DiffusionGemma Diffusionsgenerierung um Ausgaben parallel zu erzeugen und sie schrittweise zu einer endgültigen Antwort zu verfeinern - ähnlich wie Diffusionsbildmodelle, aber für Text. Führe das Modell über Unsloth Studio oder llama.cpp aus. Auf einer RTX 6000 kann DiffusionGemma 2000+ Tokens/s. GGUF: diffusiongemma-26B-A4B-it-GGUF
DiffusionGemma ausführenDiffusionGemma feinabstimmen
12. Jun.: Du kannst DiffusionGemma jetzt über Unsloth Studio ✨ mit 1,8x schnellerer Inferenz ausführen!
Anleitung zur Nutzung
DiffusionGemma ist für Nutzer konzipiert, die schnellere Generierung als bei Standardmodellen benötigen. Es eignet sich für schnelle lokale Inferenz, Dokumentenanalyse mit langem Kontext, Bild-/Video-Verständnis, OCR und Dokumentenparsing, Codegenerierung, Tool-Nutzung, agentische Workflows und latenzarme Inferenz mit kleinen Batches.
Im Gegensatz zu standardmäßigen Gemma-4-Modellen benötigt DiffusionGemma eine Diffusions-Inferenzlaufzeit. Autoregressive Einstellungen wie Temperatur, top_p, und top_k allein reichen nicht aus, um das empfohlene Verhalten ohne den erforderlichen Diffusions-Sampler nachzubilden.

Hardwareanforderungen
Im Allgemeinen ist es am besten, mindestens 18 GB RAM zu haben, um das Modell in 4-Bit-Präzision auszuführen. GGUF: diffusiongemma-26B-A4B-it-GGUF
Tabelle: empfohlene Hardwareanforderungen für DiffusionGemma Inference GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory).
18 GB
20 GB
24 GB
28 GB
52 GB
Als Faustregel sollte dein gesamter verfügbarer Speicher die Größe des quantisierten Modells, das du herunterlädst, mindestens übersteigen. Falls nicht, kannst du es dennoch mit teilweisem RAM-/Festplatten-Offload ausführen, aber die Generierung wird langsamer sein. Du wirst außerdem mehr Rechenleistung benötigen, abhängig vom verwendeten Kontextfenster.
DiffusionGemma-Tutorials ausführen
Es ist am besten, mindestens 4-Bit-Präzision zu verwenden, also verwenden wir das 4-Bit Q4_K_M Quant, das 18 GB RAM benötigt. GGUF: diffusiongemma-26B-A4B-it-GGUF
🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung
🦥 Unsloth Studio-Anleitung
Du kannst DiffusionGemma jetzt über Unsloth Studio ✨ ausführen. Stelle sicher, dass du v0.1.463-beta oder 2026.6.6.
DiffusionGemma kann jetzt ausgeführt und trainiert werden in Unsloth Studioausgeführt und trainiert werden, unserer neuen Open-Source-Web-UI für lokale KI. Mit Unsloth Studio kannst du Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilend Tool-Calling + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Stelle sicher, dass du die neueste v0.1.463-beta oder 2026.6.6verwendest. Führe im Terminal aus:
macOS, Linux, WSL:
Windows PowerShell:
DiffusionGemma suchen und herunterladen
Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.
Gehen Sie dann zum Studio Chat Registerkarte und suche in der Suchleiste nach DiffusionGemma und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter.
DiffusionGemma ausführen
Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung
Für dieses Tutorial verwenden wir die dynamische 4-Bit Q4_K_M Quant, das 18 GB RAM benötigt und llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.
Erhalte den KONKRETEN llama.cpp PR auf GitHub hier. Sie können auch die folgenden Build-Anweisungen befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Lade das Modell über (nachdem du pip install huggingface_hubinstalliert hast). Du kannst Q4_K_M oder andere quantisierte Versionen wie Q8_0 wählen. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Mit DiffusionGemma chatten
Dann führe Folgendes aus:
Du wirst sehen:

Und wenn du eine Frage wie "Create a Flappy Bird Game" eingibst, wirst du die Schritte sehen:

Danach wirst du die Ausgabe sehen:

Du kannst auch weiterkonversieren!
Ändern -n 2048 als die Anzahl der Tokens, die du vorhersagen möchtest, sodass mehr längere Antworten erzeugt.
Live-Visualisierung der Diffusion
Um die Diffusion tatsächlich live zu sehen, verwende das Folgende - aktiviere speziell --diffusion-visual:
Du wirst erneut sehen:

Und wir erhalten:

Alle Parameter für llama.cpp unter Verwendung des Branches:
-n, --n-predict N- Ziel-Tokens; leitet ab--diffusion-blocksund wächst-ub/-b/-c.-ngl 99- alle Schichten auf die GPU auslagern (-ngl 0für CPU-only).-cnv- Modus für mehrstufige Konversation.--diffusion-visual- Live-Canvas-Entrauschungsansicht.Der Entropy-Bound-Sampler ist standardmäßig aktiviert (
--diffusion-eb auto). Optimiere ihn mit--diffusion-eb-max-steps(Standard 48),--diffusion-eb-t-max/--diffusion-eb-t-min(0.8 -> 0.4),--diffusion-eb-entropy-bound(0,1), und--diffusion-eb-confidence(0.005).--diffusion-kv-cache {auto,on,off}- KV-Cache für den Prompt-Präfix (auto = an bei einer einzelnen GPU).
DiffusionGemma feinabstimmen
Du kannst DiffusionGemma jetzt direkt mit Unsloth. In unserem Beispiel zeigen wir die Auswirkungen domänenspezifischen Trainings, indem wir das Modell auf Sudoku feinabstimmen. Das Basismodell schneidet bei Sudoku-Aufgaben zunächst schlecht ab, aber nach dem Training auf einem gezielten Datensatz lernt es, Sudoku tatsächlich zu lösen, und löst jedes Beispiel korrekt.
Du kannst unser Colab-Notebook (A100) verwenden, um DiffusionGemma feinabzustimmen mit:

Empfohlene Einstellungen
Unsloth Studio setzt automatisch die besten Inferenz-Einstellungen für dein Modell. Verwende bei Bedarf unten:
Sampling
Methode
diffusion_sampling
Sampling
Sampler
entropy_bounded_denoising
Sampling
Maximale Entrauschungsschritte
48
Temperatur
Temperaturplan
linear_decay
Temperatur
Temperaturstart
0.8
Temperatur
Temperaturende
0.4
Entropie
Entropie-Grenzwert
0.1
Adaptiver Stopp
Adaptiver Stopp aktiviert
wahr
Adaptiver Stopp
Entropieschwelle
0.005
Canvas
Canvas-Länge
256
Auslösebedingungen für adaptiven Stopp
Adaptiver Stopp sollte nur ausgelöst werden, wenn beide Bedingungen erfüllt sind:
Durchschnittliche Canvas-Entropie
< 0.005
Tokens mit der höchsten Wahrscheinlichkeit sind über 2 aufeinanderfolgende Schritte stabil
wahr
Bei jedem Entrauschungsschritt sollte der Sampler die Tokens mit der niedrigsten Entropie auswählen, deren gegenseitige Informationsgrenze weiterhin gilt: entropy_bound = 0.1. Nicht ausgewählte Tokens sollten vor dem nächsten Entrauschungsschritt vollständig erneut verrauscht werden.
Denken-Modus
DiffusionGemma unterstützt den Denkmodus im Stil von Gemma 4. Um das Denken zu aktivieren, füge das Denk-Token am Anfang des System-Prompts hinzu:
Wenn das Denken aktiviert ist, kann das Modell einen internen Denkkanal ausgeben, gefolgt von der endgültigen Antwort:
Um das Denken zu deaktivieren, entferne das <|think|> Token aus dem System-Prompt. Wenn das Denken deaktiviert ist, kann das Modell dennoch einen leeren Denkkanal ausgeben:
Für mehrstufige Gespräche nicht frühere verborgene Gedanken in den Gesprächsverlauf aufnehmen. Nimm nur die endgültige Assistentenantwort vor dem nächsten Nutzerzugang auf.
Best Practices für DiffusionGemma
Multimodales Prompting
DiffusionGemma unterstützt verschachtelte multimodale Eingaben, einschließlich Text und Bildern. Video kann als Sequenzen von Bildframes verarbeitet werden.
Für die besten Ergebnisse bei multimodalen Prompts platziere Bild- oder Frame-Inhalte vor den Textanweisungen. Beispiel:
Für Dokumentenparsing, OCR, Diagrammverständnis, UI-Verständnis oder kleine Textauszüge verwende ein höheres visuelles Token-Budget.
Unterstützte visuelle Token-Budgets:
70
Schnelle Klassifikation, einfache Bildunterschriften
140
Leichtgewichtige visuelle QA
280
Allgemeines Bildverständnis
560
OCR, Diagramme, UI-Screenshots
1120
Dichte Dokumente, kleiner Text, detaillierte Extraktion
Für Eingaben im Video-Stil kann DiffusionGemma bis zu 60 Sekunden verarbeiten, wenn mit 1 Frame pro Sekunde.
Hinweise zum Sampling
DiffusionGemma ist kein normales Nur-Nächstes-Token-Modell. Es generiert einen Block von Tokens, genannt Canvas, indem es verrauschte Token-Vorhersagen wiederholt verfeinert. Der Generierungsprozess funktioniert grob wie folgt:
Der Encoder verarbeitet den Prompt und baut einen Kontext-Cache auf.
Der Decoder erhält ein 256-Token-Generierungs-Canvas.
Der Diffusions-Sampler entrauscht das Canvas iterativ.
Tokens mit hoher Sicherheit werden ausgewählt und beibehalten.
Unsichere Tokens werden erneut verrauscht und weiter verfeinert.
Sobald das Canvas fertig ist, wird es an den Kontext angehängt.
Das Modell fährt mit dem nächsten Canvas fort.
Dieser block-autoregressive Ansatz ermöglicht es DiffusionGemma, viele Tokens in weniger Forward-Pässen zu erzeugen als ein standardmäßiges autoregressives Modell.
Benchmarks
DiffusionGemma ist auf Geschwindigkeit und multimodales Schlussfolgern optimiert, obwohl standardmäßiges Gemma 4 bei herkömmlichen Reasoning-Benchmarks stärker ist.
MMLU Pro
77.6%
82.6%
AIME 2026 ohne Tools
69.1%
88.3%
LiveCodeBench v6
69.1%
77.1%
Codeforces ELO
1429
1718
GPQA Diamond
73.2%
82.3%
Tau2-Durchschnitt
56.2%
68.2%
HLE ohne Tools
11.0%
8.7%
HLE mit Suche
11.9%
17.2%
BigBench Extra Hard
47.6%
64.8%
MMMLU
81.5%
86.3%
MRCR v2 8 Nadel 128K Durchschnitt
32.0%
44.1%
Vision-Benchmarks:
MMMU Pro
54.3%
73.8%
OmniDocBench 1.5, niedriger ist besser
0.319
0.149
MATH-Vision
70.5%
82.4%
MedXPertQA MM
49.0%
58.1%
Zuletzt aktualisiert
War das hilfreich?

