For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 QAT

Führen Sie Google-Gemma-4-QAT-Modelle lokal aus, einschließlich E2B, E4B, 12B, 26B-A4B und 31B.

Gemma 4 QAT (Quantization-Aware Training) ist Googles DeepMinds neue Gemma 4 Varianten, die darauf ausgelegt sind, den Speicherbedarf zu reduzieren, während die Modellqualität erhalten bleibt. Dadurch ist es möglich, größere Modelle wie Gemma 4 26B-A4B, lokal auf Consumer-GPUs mit nur 16 GB RAM.

Gemma 4 QAT wird mit Blick auf Quantisierung trainiert, wodurch das 4-Bit-Format etwa72 % geringeren Speicherverbrauch bei nahezu ursprünglicher Leistung. Außerdem werden 2 spezielle mobile Quants für E2B und E4B bereitgestellt, die eine Mischung aus Quantisierungsbreiten verwenden.

Die Konvertierung zu Q4_0 aus QAT naiv konvertiert erreicht für 26B-A4B nur 70,2 % Top-1-Genauigkeit. Wir haben unsere Unsloth-Dynamic-Methode angewendet um es zu steigern auf 85,6 % (+15,6 %), während es zugleich 200 MB kleiner ist!

Gemma 4 QAT beinhaltet: E2B, E4B, 12B, 26B-A4B und 31B. Es sind multimodale Hybrid-Thinking-Modelle, die 140+ Sprachen und bis zu 256K Kontext unterstützen.

Gemma 4 QAT ausführenQAT-Analyse

Gemma-4-E2B QAT läuft mit 3 GB RAM, E4B mit 5 GB, 12B mit 7 GB, 26-A4B mit 15 GB und 31B mit 18 GB.

Wir bezeichnen unsere Gemma 4 QAT GGUFs als UD-Q4_K_XL da wir festgestellt haben, dass q4_0 die Genauigkeit verschlechtert, obwohl es größer ist. Siehe unsere Gemma 4 QAT GGUFs.

Zum Vergleich int4 Quantisierung, siehe unten die Größenunterschiede zwischen Original und QAT. QAT benötigt etwa 72 % weniger Speicher und behält dabei nahezu die gesamte ursprüngliche Genauigkeit:

Visualisierung, wie Gemma 4 Mobile QAT funktioniert.
Gemma 4
QAT (int4) GGUF
Original BF16
Prozentuale Änderung

E2B

2.62 GB

9.31 GB

71.86%

E4B

4.22 GB

15.1 GB

72.05%

12B

6.72 GB

23.8 GB

71.76%

26B A4B

14.2 GB

50.5 GB

71.88%

31B

17.3 GB

61.4 GB

71.82%

Anleitung

Die Gemma 4 QAT-Varianten für E2B und E4B sind für Smartphones und Laptops konzipiert, während die größeren 26B-A4B und 31B QAT Modelle nun auf Laptops laufen, statt nur auf leistungsstarken Heim-GPUs.

Es gibt nur eine GGUF-Datei für jedes Gemma-4-Modell, da wir festgestellt haben, dass Präzisionen höher als die hochgeladene UD-Q4_K_XL Version die Genauigkeit verschlechtern, statt sie zu verbessern. Verwenden Sie die ursprünglichen Nicht-QAT-Q4_0-Quants hier.

Hardware-Anforderungen

Tabelle: Empfohlene Hardware-Anforderungen für Gemma 4 QAT Inference GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder gemeinsamer Speicher).

Gemma 4 QAT
Anforderungen

E2B QAT

3 GB

E4B QAT

5 GB

12B QAT

7 GB

26B A4B QAT

15 GB

31B QAT

18 GB

Empfohlene Einstellungen

Die QAT-Checkpoints verwenden dieselben empfohlenen Gemma-4-Einstellungen:

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Der maximale Kontext von Gemma 4 beträgt 128K für E2B, E4B und 256K für 12B, 26B A4B, 31B.

QAT-Analyse

Wir haben festgestellt, dass die naive Konvertierung des QAT-Q4_0-Checkpoints in das Q4_0-Format in der llama.cpp-Welt die Genauigkeit tatsächlich verschlechterte und in Wirklichkeit nicht mit dem BF16-QAT-Gitter für Q4_0 übereinstimmte. Wir haben unsere Unsloth-Dynamic-Methode angewendet, um eine bessere Übereinstimmung zwischen dem mit llama.cpp kompatiblen Q4_0-Format und dem echten BF16-QAT-Q4_0-Format zu erzwingen, und es geschafft, die Quants sowohl kleiner zu machen (Q6_K wurde für Embeddings nicht benötigt) als auch genauer!

Unten sehen Sie eine Tabelle mit KLD, Top-1-%-Genauigkeit und Speicherplatz. Sie können sehen, dass unsere Versionen 99,9 % KLD und den mittleren KLD drastisch verbessern. E2B hat zum Beispiel einen mittleren KLD von 0,00173 gegenüber 0,05109 (relativ 29x besser) bei einer naiven Q4_0-Quantisierung, und unsere ist sogar 22 % kleiner!

Das Hauptproblem ist, dass die Konvertierung von QAT-BF16 zu llama.cpps Q4_0-Format nicht verlustfrei ist. llama.cpp verwendet F16-Skalierungen, während QAT BF16 BF16-Skalierungen verwendet, und die Skalierungen werden in der llama.cpp-Welt nicht optimal bestimmt.

Die naive Konvertierung erreicht 24,77 % Byte-Exaktheit gegenüber BF16 QAT, während wir festgestellt haben, dass wir sie mit einigen Tricks auf 99,96 % steigern können!

Modell
Methode
Datenträger (GB)
99,9 % KLD
Mittlerer KLD
Top-1 %

E2B

Unsloth

2.62

0.0557

0.00173

98.16

E2B

Q4_0

3.35

1.0513

0.05109

89.29

E4B

Unsloth

4.22

0.0536

0.00121

98.54

E4B

Q4_0

5.15

0.6722

0.03778

90.94

26B

Unsloth

14.25

2.7087

0.09788

85.63

26B

Q4_0

14.44

4.5420

0.36094

70.20

31B

Unsloth

17.29

1.3659

0.01403

96.67

31B

Q4_0

17.65

3.0030

0.09349

87.91

12B

Unsloth

6.72

9.2740

0.13288

88.76

12B

Q4_0

6.98

14.7323

0.50702

74.08

Mobile Mixture QAT

Das Gemma-4-Team hat außerdem spezielle mobile Mixture-QAT-Versionen von Gemma-4-E2B-it und Gemma-4-E4B-it veröffentlicht. Wir haben sie ebenfalls getreu in ein mit llama.cpp kompatibles Format konvertiert und dabei nahezu die gesamte Genauigkeit wiederhergestellt. Für die 2-Bit-Schichten haben wir TQ2_0 verwendet und einen negativen Scaler eingesetzt.

Wir haben UD-Q2_K_XL-Quants für sowohl E2B als auch E4B erstellt.

E2B mobil
E4B mobil

Größe

2.19 GB

3.22 GB

2-Bit-(TQ2_0)-Tensoren

61 (inkl. tiefem MLP)

2 (nur Embeddings)

Mittlerer KLD vs. BF16

0.00409

0.00102

Top-1 %

97.82%

98.76%

Basis-PPL

~103

42.4

Siehe gemma-4-E2B-it-qat-GGUF und gemma-4-E4B-it-qat-GGUF für UD-Q2_K_XL.

Gemma-4-QAT-Tutorials ausführen

Da Gemma-4-GGUFs in mehreren Größen vorliegen, ist der empfohlene Ausgangspunkt für die kleinen Modelle 8-Bit und für die größeren Modelle ist dynamisch 4-Bit. Gemma 4 GGUFs:

🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung

Sie können Gemma 4 QAT kostenlos mit einer UI in unserem Unsloth Studio Notizbuch ausführen:

🦥 Unsloth Studio-Anleitung

Gemma 4 QAT kann jetzt ausgeführt und trainiert werden in Unsloth Studio, unserer neuen Open-Source-Weboberfläche für lokale KI. Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und:

1

Unsloth installieren

Im Terminal ausführen:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

macOS, Linux, WSL und Windows:

Dann öffnen Sie http://127.0.0.1:8888 (oder Ihre spezifische URL) in Ihrem Browser.

3

Gemma 4 QAT suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden.

Gehen Sie dann zum Studio Chat Tab und suchen Sie in der Suchleiste nach Gemma 4 und laden Sie das gewünschte Modell und den gewünschten Quant herunter.

4

Gemma 4 QAT ausführen

Die Inferenzparameter sollten in Unsloth Studio automatisch gesetzt werden; Sie können sie jedoch weiterhin manuell ändern. Sie können außerdem die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserem Unsloth Studio-Inferenzleitfaden.

🦙 Llama.cpp-Anleitung

Für diese Anleitung müssen Sie keinen Quantisierungstyp auswählen, da es nur einen gibt: UD-Q4_K_XL. Siehe: Gemma 4 QAT-Sammlung. Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.

1

Holen Sie sich die neueste llama.cpp auf hier auf GitHub. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie den folgenden Befehlen für jedes Modell entsprechend folgen. UD-Q4_K_XL ist der EINZIGE Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Schritt 3). Das ist ähnlich zu ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen llama.cpp dass es an einem bestimmten Ort gespeichert wird.

26B-A4B:

31B:

E4B:

E2B:

3

Laden Sie das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können wählen UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 . Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Führen Sie das Modell dann im Konversationsmodus aus (mit Vision mmproj-F16):

5

Llama-Server-Bereitstellung

Um Gemma-4 auf llama-server bereitzustellen, verwenden Sie:

Zuletzt aktualisiert

War das hilfreich?