For the complete documentation index, see llms.txt. This page is also available as Markdown.

DiffusionGemma - So lokal ausführen

DiffusionGemma 26B-A4B ist Googles neues offenes multimodales Modell, aufgebaut auf der Gemma 4 MoE-Architektur. Mit Unterstützung für 256K-Kontext, 140+ Sprachen, ist DiffusionGemma für hochgeschwindigkeitsbasierte Textgenerierung über Text-, Video- und Bildeingaben hinweg konzipiert. DiffusionGemma kann lokal auf 18 GB RAM, und Feinabstimmung wird jetzt unterstützt über Unsloth.

Anstatt des standardmäßigen Token-für-Token-Decodings verwendet DiffusionGemma Diffusionsgenerierung um Ausgaben parallel zu erzeugen und sie schrittweise zu einer endgültigen Antwort zu verfeinern - ähnlich wie Diffusionsbildmodelle, aber für Text. Führe das Modell über Unsloth Studio oder llama.cpp aus. Auf einer RTX 6000 kann DiffusionGemma 2000+ Tokens/s. GGUF: diffusiongemma-26B-A4B-it-GGUF

DiffusionGemma ausführenDiffusionGemma feinabstimmen

Anleitung zur Nutzung

DiffusionGemma ist für Nutzer konzipiert, die schnellere Generierung als bei Standardmodellen benötigen. Es eignet sich für schnelle lokale Inferenz, Dokumentenanalyse mit langem Kontext, Bild-/Video-Verständnis, OCR und Dokumentenparsing, Codegenerierung, Tool-Nutzung, agentische Workflows und latenzarme Inferenz mit kleinen Batches.

Im Gegensatz zu standardmäßigen Gemma-4-Modellen benötigt DiffusionGemma eine Diffusions-Inferenzlaufzeit. Autoregressive Einstellungen wie Temperatur, top_p, und top_k allein reichen nicht aus, um das empfohlene Verhalten ohne den erforderlichen Diffusions-Sampler nachzubilden.

Hardwareanforderungen

Im Allgemeinen ist es am besten, mindestens 18 GB RAM zu haben, um das Modell in 4-Bit-Präzision auszuführen. GGUF: diffusiongemma-26B-A4B-it-GGUF

Tabelle: empfohlene Hardwareanforderungen für DiffusionGemma Inference GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory).

4-Bit
5-Bit
6-Bit
8-Bit
BF16 / FP16

18 GB

20 GB

24 GB

28 GB

52 GB

Als Faustregel sollte dein gesamter verfügbarer Speicher die Größe des quantisierten Modells, das du herunterlädst, mindestens übersteigen. Falls nicht, kannst du es dennoch mit teilweisem RAM-/Festplatten-Offload ausführen, aber die Generierung wird langsamer sein. Du wirst außerdem mehr Rechenleistung benötigen, abhängig vom verwendeten Kontextfenster.

DiffusionGemma-Tutorials ausführen

Es ist am besten, mindestens 4-Bit-Präzision zu verwenden, also verwenden wir das 4-Bit Q4_K_M Quant, das 18 GB RAM benötigt. GGUF: diffusiongemma-26B-A4B-it-GGUF

🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung

🦥 Unsloth Studio-Anleitung

DiffusionGemma kann jetzt ausgeführt und trainiert werden in Unsloth Studioausgeführt und trainiert werden, unserer neuen Open-Source-Web-UI für lokale KI. Mit Unsloth Studio kannst du Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Stelle sicher, dass du die neueste v0.1.463-beta oder 2026.6.6verwendest. Führe im Terminal aus:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

macOS, Linux, WSL und Windows:

Dann öffnen Sie http://127.0.0.1:8888 (oder deine spezifische URL) in deinem Browser.

3

DiffusionGemma suchen und herunterladen

Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.

Gehen Sie dann zum Studio Chat Registerkarte und suche in der Suchleiste nach DiffusionGemma und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter.

4

DiffusionGemma ausführen

Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Anleitung

Für dieses Tutorial verwenden wir die dynamische 4-Bit Q4_K_M Quant, das 18 GB RAM benötigt und llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.

1

Erhalte den KONKRETEN llama.cpp PR auf GitHub hier. Sie können auch die folgenden Build-Anweisungen befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Lade das Modell über (nachdem du pip install huggingface_hubinstalliert hast). Du kannst Q4_K_M oder andere quantisierte Versionen wie Q8_0 wählen. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

Mit DiffusionGemma chatten

Dann führe Folgendes aus:

Du wirst sehen:

Und wenn du eine Frage wie "Create a Flappy Bird Game" eingibst, wirst du die Schritte sehen:

Danach wirst du die Ausgabe sehen:

Du kannst auch weiterkonversieren!

Ändern -n 2048 als die Anzahl der Tokens, die du vorhersagen möchtest, sodass mehr längere Antworten erzeugt.

Live-Visualisierung der Diffusion

Um die Diffusion tatsächlich live zu sehen, verwende das Folgende - aktiviere speziell --diffusion-visual:

Du wirst erneut sehen:

Und wir erhalten:

Alle Parameter für llama.cpp unter Verwendung des Branches:

  • -n, --n-predict N - Ziel-Tokens; leitet ab --diffusion-blocks und wächst -ub / -b / -c.

  • -ngl 99 - alle Schichten auf die GPU auslagern (-ngl 0 für CPU-only).

  • -cnv - Modus für mehrstufige Konversation.

  • --diffusion-visual - Live-Canvas-Entrauschungsansicht.

  • Der Entropy-Bound-Sampler ist standardmäßig aktiviert (--diffusion-eb auto). Optimiere ihn mit --diffusion-eb-max-steps (Standard 48), --diffusion-eb-t-max / --diffusion-eb-t-min (0.8 -> 0.4), --diffusion-eb-entropy-bound (0,1), und --diffusion-eb-confidence (0.005).

  • --diffusion-kv-cache {auto,on,off} - KV-Cache für den Prompt-Präfix (auto = an bei einer einzelnen GPU).

DiffusionGemma feinabstimmen

Du kannst DiffusionGemma jetzt direkt mit Unsloth. In unserem Beispiel zeigen wir die Auswirkungen domänenspezifischen Trainings, indem wir das Modell auf Sudoku feinabstimmen. Das Basismodell schneidet bei Sudoku-Aufgaben zunächst schlecht ab, aber nach dem Training auf einem gezielten Datensatz lernt es, Sudoku tatsächlich zu lösen, und löst jedes Beispiel korrekt.

Du kannst unser Colab-Notebook (A100) verwenden, um DiffusionGemma feinabzustimmen mit:

Empfohlene Einstellungen

Unsloth Studio setzt automatisch die besten Inferenz-Einstellungen für dein Modell. Verwende bei Bedarf unten:

Kategorie
Einstellung
Wert

Sampling

Methode

diffusion_sampling

Sampling

Sampler

entropy_bounded_denoising

Sampling

Maximale Entrauschungsschritte

48

Temperatur

Temperaturplan

linear_decay

Temperatur

Temperaturstart

0.8

Temperatur

Temperaturende

0.4

Entropie

Entropie-Grenzwert

0.1

Adaptiver Stopp

Adaptiver Stopp aktiviert

wahr

Adaptiver Stopp

Entropieschwelle

0.005

Canvas

Canvas-Länge

256

Auslösebedingungen für adaptiven Stopp

Adaptiver Stopp sollte nur ausgelöst werden, wenn beide Bedingungen erfüllt sind:

Bedingung
Erforderlicher Wert

Durchschnittliche Canvas-Entropie

< 0.005

Tokens mit der höchsten Wahrscheinlichkeit sind über 2 aufeinanderfolgende Schritte stabil

wahr

Bei jedem Entrauschungsschritt sollte der Sampler die Tokens mit der niedrigsten Entropie auswählen, deren gegenseitige Informationsgrenze weiterhin gilt: entropy_bound = 0.1. Nicht ausgewählte Tokens sollten vor dem nächsten Entrauschungsschritt vollständig erneut verrauscht werden.

Denken-Modus

DiffusionGemma unterstützt den Denkmodus im Stil von Gemma 4. Um das Denken zu aktivieren, füge das Denk-Token am Anfang des System-Prompts hinzu:

Wenn das Denken aktiviert ist, kann das Modell einen internen Denkkanal ausgeben, gefolgt von der endgültigen Antwort:

Um das Denken zu deaktivieren, entferne das <|think|> Token aus dem System-Prompt. Wenn das Denken deaktiviert ist, kann das Modell dennoch einen leeren Denkkanal ausgeben:

Für mehrstufige Gespräche nicht frühere verborgene Gedanken in den Gesprächsverlauf aufnehmen. Nimm nur die endgültige Assistentenantwort vor dem nächsten Nutzerzugang auf.

Best Practices für DiffusionGemma

Multimodales Prompting

DiffusionGemma unterstützt verschachtelte multimodale Eingaben, einschließlich Text und Bildern. Video kann als Sequenzen von Bildframes verarbeitet werden.

Für die besten Ergebnisse bei multimodalen Prompts platziere Bild- oder Frame-Inhalte vor den Textanweisungen. Beispiel:

Für Dokumentenparsing, OCR, Diagrammverständnis, UI-Verständnis oder kleine Textauszüge verwende ein höheres visuelles Token-Budget.

Unterstützte visuelle Token-Budgets:

Visuelles Token-Budget
Am besten geeignet für

70

Schnelle Klassifikation, einfache Bildunterschriften

140

Leichtgewichtige visuelle QA

280

Allgemeines Bildverständnis

560

OCR, Diagramme, UI-Screenshots

1120

Dichte Dokumente, kleiner Text, detaillierte Extraktion

Für Eingaben im Video-Stil kann DiffusionGemma bis zu 60 Sekunden verarbeiten, wenn mit 1 Frame pro Sekunde.

Hinweise zum Sampling

DiffusionGemma ist kein normales Nur-Nächstes-Token-Modell. Es generiert einen Block von Tokens, genannt Canvas, indem es verrauschte Token-Vorhersagen wiederholt verfeinert. Der Generierungsprozess funktioniert grob wie folgt:

  1. Der Encoder verarbeitet den Prompt und baut einen Kontext-Cache auf.

  2. Der Decoder erhält ein 256-Token-Generierungs-Canvas.

  3. Der Diffusions-Sampler entrauscht das Canvas iterativ.

  4. Tokens mit hoher Sicherheit werden ausgewählt und beibehalten.

  5. Unsichere Tokens werden erneut verrauscht und weiter verfeinert.

  6. Sobald das Canvas fertig ist, wird es an den Kontext angehängt.

  7. Das Modell fährt mit dem nächsten Canvas fort.

Dieser block-autoregressive Ansatz ermöglicht es DiffusionGemma, viele Tokens in weniger Forward-Pässen zu erzeugen als ein standardmäßiges autoregressives Modell.

Benchmarks

DiffusionGemma ist auf Geschwindigkeit und multimodales Schlussfolgern optimiert, obwohl standardmäßiges Gemma 4 bei herkömmlichen Reasoning-Benchmarks stärker ist.

Benchmark
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MMLU Pro

77.6%

82.6%

AIME 2026 ohne Tools

69.1%

88.3%

LiveCodeBench v6

69.1%

77.1%

Codeforces ELO

1429

1718

GPQA Diamond

73.2%

82.3%

Tau2-Durchschnitt

56.2%

68.2%

HLE ohne Tools

11.0%

8.7%

HLE mit Suche

11.9%

17.2%

BigBench Extra Hard

47.6%

64.8%

MMMLU

81.5%

86.3%

Langkontext-Benchmark
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MRCR v2 8 Nadel 128K Durchschnitt

32.0%

44.1%

Vision-Benchmarks:

Vision-Benchmark
DiffusionGemma 26B-A4B
Gemma 4 26B-A4B

MMMU Pro

54.3%

73.8%

OmniDocBench 1.5, niedriger ist besser

0.319

0.149

MATH-Vision

70.5%

82.4%

MedXPertQA MM

49.0%

58.1%

Zuletzt aktualisiert

War das hilfreich?