For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 QAT

Exécutez localement les modèles Gemma 4 QAT de Google, y compris E2B, E4B, 12B, 26B-A4B et 31B.

Gemma 4 QAT (Quantization-Aware Training) est la nouvelle Gemma 4 variantes conçues pour réduire les besoins en mémoire tout en préservant la qualité du modèle. Cela permet d’exécuter des modèles plus grands, comme Gemma 4 26B-A4B, localement sur des GPU grand public avec seulement 16 Go de RAM.

Gemma 4 QAT est entraîné en gardant la quantification à l’esprit, ce qui permet au format 4 bits d’avoir ~72 % d’utilisation de mémoire en moins avec des performances presque d’origine. 2 quants mobiles spéciaux de E2B et E4B sont également fournis, utilisant un mélange de largeurs de quantification.

Conversion vers Q4_0 depuis QAT n’obtient naïvement que 70,2 % de précision top-1 pour 26B-A4B. Nous avons appliqué notre méthode dynamique Unsloth pour la faire monter à 85,6 % (+15,6 %) tout en étant aussi 200 Mo plus petit!

Gemma 4 QAT comprend : E2B, E4B, 12B, 26B-A4B, et 31B. Ce sont des modèles multimodaux à raisonnement hybride qui prennent en charge plus de 140 langues et jusqu’à 256K de contexte.

Exécuter Gemma 4 QATAnalyse QAT

Gemma-4-E2B QAT fonctionne avec 3 Go de RAM, E4B sur 5 Go, 12B sur 7 Go, 26-A4B sur 15 Go et 31B sur 18 Go.

Nous nommons nos GGUF Gemma 4 QAT comme UD-Q4_K_XL car nous avons constaté que q4_0 dégrade la précision malgré une taille plus grande. Voir nos GGUF Gemma 4 QAT.

Pour comparer int4 la quantification, voir ci-dessous les différences de taille entre l’original et QAT. QAT utilise ~72 % de mémoire en moins tout en conservant presque toute sa précision d’origine :

Visualisation du fonctionnement de Gemma 4 Mobile QAT.
Gemma 4
QAT (int4) GGUF
BF16 d’origine
Variation en pourcentage

E2B

2,62 Go

9,31 Go

71.86%

E4B

4,22 Go

15,1 Go

72.05%

12B

6,72 Go

23,8 Go

71.76%

26B A4B

14,2 Go

50,5 Go

71.88%

31B

17,3 Go

61,4 Go

71.82%

Guide d'utilisation

Les variantes Gemma 4 QAT pour E2B et E4B sont conçues pour les téléphones et les ordinateurs portables, tandis que les plus grands 26B-A4B et 31B QAT modèles fonctionnent désormais sur des ordinateurs portables plutôt que seulement sur de puissants GPU domestiques.

Il y a un seul fichier GGUF pour chaque modèle Gemma 4, car nous avons constaté que les précisions supérieures à la UD-Q4_K_XL version téléchargée dégradent la précision au lieu de l’améliorer. Utilisez les quants Q4_0 originaux non QAT ici.

Exigences matérielles

Tableau : exigences matérielles recommandées pour l’inférence GGUF de Gemma 4 QAT (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée).

Gemma 4 QAT
Exigences

E2B QAT

3 Go

E4B QAT

5 Go

12B QAT

7 Go

26B A4B QAT

15 Go

31B QAT

18 Go

Paramètres recommandés

Les checkpoints QAT utilisent les mêmes paramètres Gemma 4 recommandés :

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Le contexte maximal de Gemma 4 est 128K pour E2B, E4B et 256K pour 12B, 26B A4B, 31B.

Analyse QAT

Nous avons constaté que la conversion naïve du checkpoint QAT Q4_0 en Q4_0 dans l’univers llama.cpp dégradait en fait la précision et n’était pas réellement alignée avec la grille BF16 QAT pour Q4_0. Nous avons appliqué notre méthode dynamique Unsloth pour forcer un meilleur accord entre le format Q4_0 compatible llama.cpp et le vrai format Q4_0 BF16 QAT, et avons réussi à rendre les quants à la fois plus petits (Q6_K n’était pas nécessaire pour les embeddings) et plus précis !

Ci-dessous se trouve un tableau du KLD, de la précision Top 1 % et de l’espace disque. Vous pouvez voir que nos versions améliorent considérablement le KLD à 99,9 % et le KLD moyen. E2B, par exemple, a un KLD moyen de 0,00173 contre 0,05109 (29 fois mieux relativement) pour une quantification Q4_0 naïve, et la nôtre est même 22 % plus petite !

Le principal problème est que la conversion de QAT BF16 vers le format Q4_0 de llama.cpp n’est pas sans perte. llama.cpp utilise des échelles F16, tandis que QAT BF16 utilise des échelles BF16, et les échelles ne sont pas déterminées de manière optimale dans l’univers llama.cpp.

La conversion naïve atteint 24,77 % d’exactitude octet par octet par rapport à BF16 QAT, tandis que nous avons constaté qu’on peut la faire monter à 99,96 % grâce à quelques astuces !

Modèle
Méthode
Disque (Go)
KLD à 99,9 %
KLD moyen
Top-1 %

E2B

Unsloth

2.62

0.0557

0.00173

98.16

E2B

Q4_0

3.35

1.0513

0.05109

89.29

E4B

Unsloth

4.22

0.0536

0.00121

98.54

E4B

Q4_0

5.15

0.6722

0.03778

90.94

26B

Unsloth

14.25

2.7087

0.09788

85.63

26B

Q4_0

14.44

4.5420

0.36094

70.20

31B

Unsloth

17.29

1.3659

0.01403

96.67

31B

Q4_0

17.65

3.0030

0.09349

87.91

12B

Unsloth

6.72

9.2740

0.13288

88.76

12B

Q4_0

6.98

14.7323

0.50702

74.08

QAT mobile à mélange

L’équipe Gemma-4 a également publié des versions QAT mobiles spéciales à mélange de Gemma-4-E2B-it et Gemma-4-E4B-it. Nous les avons aussi fidèlement converties au format compatible llama.cpp, tout en récupérant presque toute la précision. Nous avons utilisé TQ2_0 pour les couches 2 bits et appliqué un scaler négatif.

Nous avons créé des quants UD-Q2_K_XL pour E2B et E4B.

E2B mobile
E4B mobile

Taille

2,19 Go

3,22 Go

tenseurs 2 bits (TQ2_0)

61 (y compris le deep MLP)

2 (embeddings uniquement)

KLD moyen vs BF16

0.00409

0.00102

Top-1 %

97.82%

98.76%

PPL de base

~103

42.4

Voir gemma-4-E2B-it-qat-GGUF et gemma-4-E4B-it-qat-GGUF pour UD-Q2_K_XL.

Exécuter les tutoriels Gemma 4 QAT

Comme les GGUF Gemma 4 existent en plusieurs tailles, le point de départ recommandé pour les petits modèles est le 8 bits et pour les plus grands modèles 4 bits dynamique. GGUF Gemma 4:

🦥 Guide Unsloth Studio🦙 Guide Llama.cpp

Vous pouvez exécuter et entraîner Gemma 4 QAT gratuitement avec une interface utilisateur dans notre Unsloth Studio notebook :

🦥 Guide Unsloth Studio

Gemma 4 QAT peut désormais être exécuté et entraîné dans Unsloth Studio, notre nouvelle interface web open source pour l’IA locale. Unsloth Studio vous permet d’exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Exécutez dans votre terminal :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Ensuite ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

3

Rechercher et télécharger Gemma 4 QAT

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter.

Puis allez dans l’onglet Unsloth Chat et recherchez Gemma 4 dans la barre de recherche, puis téléchargez le modèle et le quant souhaités.

4

Exécuter Gemma 4 QAT

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

🦙 Guide Llama.cpp

Pour ce guide, il n’est pas nécessaire de sélectionner le type de quantification puisqu’il n’y en a qu’un : UD-Q4_K_XL. Voir : collection Gemma 4 QAT. Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.

1

Obtenez le dernier llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge de Metal est activée par défaut.

2

Si vous souhaitez utiliser llama.cpp directement pour charger les modèles, vous pouvez suivre les commandes ci-dessous, selon chaque modèle. UD-Q4_K_XL est le SEUL type de quantification. Vous pouvez également télécharger via Hugging Face (étape 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer à un emplacement spécifique.

26B-A4B :

31B :

E4B :

E2B :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir UD-Q4_K_XL ou d’autres versions quantifiées comme Q8_0 . Si les téléchargements restent bloqués, voir : Dépannage de Hugging Face Hub et XET

4

Ensuite, exécutez le modèle en mode conversation (avec vision mmproj-F16):

5

Déploiement avec Llama-server

Pour déployer Gemma-4 sur llama-server, utilisez :

Mis à jour

Ce contenu vous a-t-il été utile ?