Gemma 4 QAT
Führen Sie Google-Gemma-4-QAT-Modelle lokal aus, einschließlich E2B, E4B, 12B, 26B-A4B und 31B.
Gemma 4 QAT (Quantization-Aware Training) ist Googles DeepMinds neue Gemma 4 Varianten, die darauf ausgelegt sind, den Speicherbedarf zu reduzieren, während die Modellqualität erhalten bleibt. Dadurch ist es möglich, größere Modelle wie Gemma 4 26B-A4B, lokal auf Consumer-GPUs mit nur 16 GB RAM.
Gemma 4 QAT wird mit Blick auf Quantisierung trainiert, wodurch das 4-Bit-Format etwa72 % geringeren Speicherverbrauch bei nahezu ursprünglicher Leistung. Außerdem werden 2 spezielle mobile Quants für E2B und E4B bereitgestellt, die eine Mischung aus Quantisierungsbreiten verwenden.
Die Konvertierung zu Q4_0 aus QAT naiv konvertiert erreicht für 26B-A4B nur 70,2 % Top-1-Genauigkeit. Wir haben unsere Unsloth-Dynamic-Methode angewendet um es zu steigern auf 85,6 % (+15,6 %), während es zugleich 200 MB kleiner ist!
Gemma 4 QAT beinhaltet: E2B, E4B, 12B, 26B-A4B und 31B. Es sind multimodale Hybrid-Thinking-Modelle, die 140+ Sprachen und bis zu 256K Kontext unterstützen.
Gemma 4 QAT ausführenQAT-Analyse
Gemma-4-E2B QAT läuft mit 3 GB RAM, E4B mit 5 GB, 12B mit 7 GB, 26-A4B mit 15 GB und 31B mit 18 GB.
Wir bezeichnen unsere Gemma 4 QAT GGUFs als UD-Q4_K_XL da wir festgestellt haben, dass q4_0 die Genauigkeit verschlechtert, obwohl es größer ist. Siehe unsere Gemma 4 QAT GGUFs.
Zum Vergleich int4 Quantisierung, siehe unten die Größenunterschiede zwischen Original und QAT. QAT benötigt etwa 72 % weniger Speicher und behält dabei nahezu die gesamte ursprüngliche Genauigkeit:

E2B
2.62 GB
9.31 GB
71.86%
E4B
4.22 GB
15.1 GB
72.05%
12B
6.72 GB
23.8 GB
71.76%
26B A4B
14.2 GB
50.5 GB
71.88%
31B
17.3 GB
61.4 GB
71.82%
Anleitung
Die Gemma 4 QAT-Varianten für E2B und E4B sind für Smartphones und Laptops konzipiert, während die größeren 26B-A4B und 31B QAT Modelle nun auf Laptops laufen, statt nur auf leistungsstarken Heim-GPUs.
Es gibt nur eine GGUF-Datei für jedes Gemma-4-Modell, da wir festgestellt haben, dass Präzisionen höher als die hochgeladene UD-Q4_K_XL Version die Genauigkeit verschlechtern, statt sie zu verbessern. Verwenden Sie die ursprünglichen Nicht-QAT-Q4_0-Quants hier.

Hardware-Anforderungen
Tabelle: Empfohlene Hardware-Anforderungen für Gemma 4 QAT Inference GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher).
E2B QAT
3 GB
E4B QAT
5 GB
12B QAT
7 GB
26B A4B QAT
15 GB
31B QAT
18 GB
Empfohlene Einstellungen
Die QAT-Checkpoints verwenden dieselben empfohlenen Gemma-4-Einstellungen:
temperature = 1.0top_p = 0.95top_k = 64
Der maximale Kontext von Gemma 4 beträgt 128K für E2B, E4B und 256K für 12B, 26B A4B, 31B.
QAT-Analyse
Wir haben festgestellt, dass die naive Konvertierung des QAT-Q4_0-Checkpoints in das Q4_0-Format in der llama.cpp-Welt die Genauigkeit tatsächlich verschlechterte und in Wirklichkeit nicht mit dem BF16-QAT-Gitter für Q4_0 übereinstimmte. Wir haben unsere Unsloth-Dynamic-Methode angewendet, um eine bessere Übereinstimmung zwischen dem mit llama.cpp kompatiblen Q4_0-Format und dem echten BF16-QAT-Q4_0-Format zu erzwingen, und es geschafft, die Quants sowohl kleiner zu machen (Q6_K wurde für Embeddings nicht benötigt) als auch genauer!

Unten sehen Sie eine Tabelle mit KLD, Top-1-%-Genauigkeit und Speicherplatz. Sie können sehen, dass unsere Versionen 99,9 % KLD und den mittleren KLD drastisch verbessern. E2B hat zum Beispiel einen mittleren KLD von 0,00173 gegenüber 0,05109 (relativ 29x besser) bei einer naiven Q4_0-Quantisierung, und unsere ist sogar 22 % kleiner!
Das Hauptproblem ist, dass die Konvertierung von QAT-BF16 zu llama.cpps Q4_0-Format nicht verlustfrei ist. llama.cpp verwendet F16-Skalierungen, während QAT BF16 BF16-Skalierungen verwendet, und die Skalierungen werden in der llama.cpp-Welt nicht optimal bestimmt.
Die naive Konvertierung erreicht 24,77 % Byte-Exaktheit gegenüber BF16 QAT, während wir festgestellt haben, dass wir sie mit einigen Tricks auf 99,96 % steigern können!
E2B
Unsloth
2.62
0.0557
0.00173
98.16
E2B
Q4_0
3.35
1.0513
0.05109
89.29
E4B
Unsloth
4.22
0.0536
0.00121
98.54
E4B
Q4_0
5.15
0.6722
0.03778
90.94
26B
Unsloth
14.25
2.7087
0.09788
85.63
26B
Q4_0
14.44
4.5420
0.36094
70.20
31B
Unsloth
17.29
1.3659
0.01403
96.67
31B
Q4_0
17.65
3.0030
0.09349
87.91
12B
Unsloth
6.72
9.2740
0.13288
88.76
12B
Q4_0
6.98
14.7323
0.50702
74.08
Mobile Mixture QAT
Das Gemma-4-Team hat außerdem spezielle mobile Mixture-QAT-Versionen von Gemma-4-E2B-it und Gemma-4-E4B-it veröffentlicht. Wir haben sie ebenfalls getreu in ein mit llama.cpp kompatibles Format konvertiert und dabei nahezu die gesamte Genauigkeit wiederhergestellt. Für die 2-Bit-Schichten haben wir TQ2_0 verwendet und einen negativen Scaler eingesetzt.
Wir haben UD-Q2_K_XL-Quants für sowohl E2B als auch E4B erstellt.
Größe
2.19 GB
3.22 GB
2-Bit-(TQ2_0)-Tensoren
61 (inkl. tiefem MLP)
2 (nur Embeddings)
Mittlerer KLD vs. BF16
0.00409
0.00102
Top-1 %
97.82%
98.76%
Basis-PPL
~103
42.4
Siehe gemma-4-E2B-it-qat-GGUF und gemma-4-E4B-it-qat-GGUF für UD-Q2_K_XL.
Gemma-4-QAT-Tutorials ausführen
Da Gemma-4-GGUFs in mehreren Größen vorliegen, ist der empfohlene Ausgangspunkt für die kleinen Modelle 8-Bit und für die größeren Modelle ist dynamisch 4-Bit. Gemma 4 GGUFs:
🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung
Sie können Gemma 4 QAT kostenlos mit einer UI in unserem Unsloth Studio✨ Notizbuch ausführen:
🦥 Unsloth Studio-Anleitung
Gemma 4 QAT kann jetzt ausgeführt und trainiert werden in Unsloth Studio, unserer neuen Open-Source-Weboberfläche für lokale KI. Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilendes Tool-Calling + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp., Top-p usw.)
Schnelle CPU- und GPU-Inferenz via llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Gemma 4 QAT suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden.
Gehen Sie dann zum Studio Chat Tab und suchen Sie in der Suchleiste nach Gemma 4 und laden Sie das gewünschte Modell und den gewünschten Quant herunter.
Gemma 4 QAT ausführen
Die Inferenzparameter sollten in Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können außerdem die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Weitere Informationen finden Sie in unserem Unsloth Studio-Inferenzleitfaden.

🦙 Llama.cpp-Anleitung
Für diese Anleitung müssen Sie keinen Quantisierungstyp auswählen, da es nur einen gibt: UD-Q4_K_XL. Siehe: Gemma 4 QAT-Sammlung. Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.
Holen Sie sich die neueste llama.cpp auf hier auf GitHub. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie den folgenden Befehlen für jedes Modell entsprechend folgen. UD-Q4_K_XL ist der EINZIGE Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich zu ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen llama.cpp dass es an einem bestimmten Ort gespeichert wird.
26B-A4B:
31B:
E4B:
E2B:
Laden Sie das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können wählen UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 . Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Führen Sie das Modell dann im Konversationsmodus aus (mit Vision mmproj-F16):
Llama-Server-Bereitstellung
Um Gemma-4 auf llama-server bereitzustellen, verwenden Sie:
Zum Deaktivieren von Denken / Schlussfolgern, verwenden Sie --chat-template-kwargs '{"enable_thinking":false}'
Wenn Sie auf Windows PowerShell sind, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"
Verwenden Sie 'true' und 'false' austauschbar.
Zuletzt aktualisiert
War das hilfreich?

