✨Gemma 4 - comment exécuter localement
Exécutez localement les nouveaux modèles Gemma 4 de Google, y compris E2B, E4B, 26B A4B et 31B.
Gemma 4 est la nouvelle famille de modèles ouverts de Google DeepMind, comprenant 12B, E2B, E4B, 26B-A4Bet 31B. Les modèles multimodaux à raisonnement hybride prennent en charge plus de 140 langues, jusqu'à 256K de contexteet existent en variantes denses et MoE. Gemma 4 est sous licence Apache-2.0 et peut s'exécuter sur votre appareil local.
Gemma-4-12B est nouveau et offre une prise en charge unifiée du texte, de l'image et de l'audio. Il fonctionne sur 8 Go de RAM (4 bits) ou 14 Go (8 bits). Gemma-4-E2B et E4B prennent aussi en charge l'image et l'audio. Fonctionnent sur 5 Go de RAM (4 bits) ou 15 Go (16 bits complets).
Exécuter Gemma 4Affiner Gemma 4Gemma 4 QATGemma 4 MTP
NOUVEAU : Gemma 4 MTP est là ! MTP permet une inférence 1,4 à 2,2x plus rapide sans perte de précision. Exécutez MTP directement dans Unsloth Studio.
Gemma-4-26B-A4B fonctionne sur 18 Go (4 bits) ou 28 Go (8 bits). Gemma-4-31B nécessite 20 Go de RAM (4 bits) ou 34 Go (8 bits).
Vous pouvez désormais exécuter tous les GGUF, MLX et affiner Gemma 4 dans Unsloth Studio (voir à droite).
QAT variantes de Gemma 4 réduisent les besoins en mémoire d'environ 3x tout en préservant la qualité du modèle.

9 juin : Gemma 4 MTP est là.
5 juin : Gemma 4 QAT est sorti.
2 juin : Gemma 4 12B Unified est sorti.
20 avril : Nous avons effectué les benchmarks GGUF de Gemma 4 pour vous aider à choisir la meilleure quantification.
Guide d'utilisation
Gemma 4 excelle dans le raisonnement, le codage, l'utilisation d'outils, les workflows à long contexte et agentiques, ainsi que les tâches multimodales. Les variantes plus petites E2B et E4B sont conçues pour les téléphones et les ordinateurs portables, tandis que les modèles plus grands ciblent les systèmes à CPU / VRAM moyens à élevés, comme les PC équipés de GPU NVIDIA RTX.
E2B
Dense + PLE (contexte 128K) Prise en charge : texte, image, audio
Pour l'inférence sur téléphone / en périphérie, l'ASR, la traduction vocale
E4B
Dense + PLE (contexte 128K) Prise en charge : texte, image, audio
Petit modèle pour les ordinateurs portables et une utilisation multimodale locale rapide
12B Unified
Dense (contexte 256K) Prise en charge : texte, image, audio
Modèle moyen pour les ordinateurs portables et une utilisation multimodale locale
26B-A4B
MoE (contexte 256K) Prise en charge : texte, image
Meilleur compromis vitesse / qualité pour une utilisation sur ordinateur
31B
Dense (contexte 256K) Prise en charge : texte, image
Meilleures performances, avec une inférence plus lente
Voir Gemma 4 : Benchmarks de performance et Benchmarks GGUF.
Dois-je choisir 26B-A4B ou 31B ?
26B-A4B - équilibre vitesse et précision. Sa conception MoE le rend plus rapide que 31B, avec 4B de paramètres actifs. Choisissez-le si la RAM est limitée et que vous acceptez de sacrifier un peu de qualité au profit de la vitesse.
31B - est actuellement le modèle Gemma 4 le plus performant. Choisissez-le pour une qualité maximale si vous avez suffisamment de mémoire et pouvez accepter des vitesses légèrement plus lentes.
Configuration matérielle requise
Tableau : Configuration matérielle recommandée pour l'inférence Gemma 4 GGUF (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée). Vous pouvez utiliser Gemma 4 sur macOS, les GPU NVIDIA RTX, etc.
E2B
4 Go
5–8 Go
10 Go
E4B
5,5–6 Go
9–12 Go
16 Go
12B Unified
7–8 Go
13–14 Go
25 Go
26B A4B
16–18 Go
28–30 Go
52 Go
31B
17–20 Go
34–38 Go
62 Go
En règle générale, votre mémoire totale disponible devrait au moins dépasser la taille du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut quand même fonctionner en utilisant un déchargement partiel vers la RAM / le disque, mais la génération sera plus lente. Vous aurez aussi besoin de plus de calcul, selon la fenêtre de contexte utilisée.
Paramètres recommandés
Il est recommandé d'utiliser les paramètres par défaut de Gemma 4 de Google :
temperature = 1.0top_p = 0.95top_k = 64
Le contexte maximal de Gemma 4 est 128K pour E2B / E4B et 262,144 pour 12B / 26B A4B / 31B.
Mode réflexion
Par rapport aux anciens modèles de chat Gemma, Gemma 4 utilise les rôles standard système, assistantet utilisateur et ajoute un contrôle explicite de la réflexion.
Comment activer la réflexion :
Ajoutez le jeton <|think|> au début du prompt système.
Réflexion activée
Réflexion désactivée
Comportement de sortie :
Lorsque la réflexion est activée, le modèle affiche son canal de raisonnement interne avant la réponse finale.
Lorsque la réflexion est désactivée, les plus grands modèles peuvent tout de même émettre un bloc de pensée vide avant la réponse finale.
Par exemple, avec "Quelle est la capitale de la France ?":
puis il produit :
Règle de chat à plusieurs tours :
Pour les conversations à plusieurs tours, ne conservez que la réponse finale visible dans l'historique du chat. Ne pas réinjectez les blocs de réflexion précédents dans le tour suivant.
Comment désactiver la réflexion :
Remarque llama-cli pourrait ne pas fonctionner de manière fiable, utilisez donc llama-server pour désactiver le raisonnement :
Pour désactiver la réflexion / le raisonnement, utilisez --chat-template-kwargs '{"enable_thinking":false}'
Si vous êtes sur Windows PowerShell, utilisez : --chat-template-kwargs "{\"enable_thinking\":false}"
Utilisez indifféremment 'true' et 'false'.
Tutoriels pour exécuter Gemma 4
Comme les GGUF Gemma 4 existent en plusieurs tailles, le point de départ recommandé pour les petits modèles est le 8 bits et pour les plus grands modèles est Dynamique 4 bits. GGUF Gemma 4 ou MLX:
🦥 Guide d'Unsloth Studio🦙 Guide de Llama.cpp
Vous pouvez exécuter et entraîner Gemma 4 gratuitement avec une interface dans notre Unsloth Studio✨ notebook :
🦥 Guide d'Unsloth Studio
Gemma 4 peut désormais être exécuté et affiné dans Unsloth Studio, notre nouvelle interface web open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur macOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide CPU + GPU via llama.cpp
Entraînez des LLM 2x plus rapide avec 70 % de VRAM en moins

Recherchez et téléchargez Gemma 4
Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter.
Ensuite, allez dans le Studio Chat onglet et recherchez Gemma 4 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités. Unsloth prend en charge le dernier modèle unifié Gemma-4-12B.

Exécuter Gemma 4
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de chat et d'autres paramètres. Vous pouvez exécuter des fichiers GGUF et MLX.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio.

🦙 Guide de Llama.cpp
Pour ce guide, nous utiliserons Dynamic 4 bits pour les 12B, 26B-A4B et 31B, et 8 bits pour E2B et E4B. Voir : collection GGUF Gemma 4
Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Si vous souhaitez utiliser llama.cpp directement pour charger des modèles, vous pouvez suivre les commandes ci-dessous, selon le modèle. UD-Q4_K_XL est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (étape 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer à un emplacement spécifique. Il n'est pas nécessaire de définir la longueur de contexte, car llama.cpp utilise automatiquement la quantité exacte requise.
Pour désactiver la réflexion / le raisonnement, utilisez : --chat-template-kwargs '{"enable_thinking":false}'
Windows PowerShell : --chat-template-kwargs "{\"enable_thinking\":false}"
Utilisez 'true' et 'false' indifféremment.
12B :
26B-A4B :
31B :
E4B :
E2B :
Vous pouvez aussi télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub, XET
Puis exécutez le modèle en mode conversation (avec vision mmproj-F16):
Quantifications dynamiques MLX
Nous avons aussi téléchargé des quantifications dynamiques 4 bits et 8 bits à titre de premier essai pour les appareils MacOS ! Les quantifications MLX prennent en charge la vision.
Toutes les quantifications MLX fonctionnent désormais avec Unsloth Studio!
Pour les essayer, utilisez :
Guide Ollama
Ollama prend désormais bien en charge les GGUF Unsloth. Utilisez curl -fsSL https://ollama.com/install.sh | sh pour installer Ollama sous Linux ou irm https://ollama.com/install.ps1 | iex pour Windows.
Pour utiliser un seul fichier quant (de moins de 50 Go), utilisez :
Pour plusieurs shards, comme des shards BF16 plus volumineux, faites :

Si vous voyez Erreur : 500 Internal Server Error : impossible de charger le modèle mettez à jour Ollama via curl -fsSL https://ollama.com/install.sh | sh ou utilisez la version PowerShell.
Bonnes pratiques pour Gemma 4
Exemples de prompts
Prompt de raisonnement simple
Invite OCR / document
Pour l'OCR, utilisez un budget élevé de tokens visuels comme 560 ou 1120.
Invite de comparaison multimodale
Invite ASR audio
Invite de traduction audio
Paramètres multimodaux
Pour de meilleurs résultats avec les invites multimodales, placez le contenu multimodal en premier :
Placez l'image et/ou l'audio avant le texte.
Pour la vidéo, fournissez d'abord une séquence d'images, puis l'instruction.
Limites audio et vidéo
Audio est disponible sur 12B, E2B et E4B uniquement.
L'audio prend en charge un maximum de 30 secondes.
La vidéo prend en charge un maximum de 60 secondes en supposant 1 image par seconde de traitement.
Modèles d'invites audio
Invite ASR
Invite de traduction vocale
📊 Benchmarks
Benchmarks GGUF d'Unsloth
Nous avons mené des benchmarks de divergence KL moyenne pour les GGUF Gemma 4 chez différents fournisseurs afin de vous aider à choisir la meilleure quantification (plus bas est meilleur).
La divergence KL place tous les GGUF Unsloth sur la frontière de Pareto SOTA
La KLD montre dans quelle mesure un modèle quantifié correspond à la distribution de sortie BF16 d'origine, indiquant la précision conservée.

Benchmarks officiels de Gemma
Benchmarks texte/code
MMLU Pro
85.2%
82.6%
77.2%
69.4%
60.0%
67.6%
AIME 2026 sans outils
89.2%
88.3%
77.5%
42.5%
37.5%
20.8%
LiveCodeBench v6
80.0%
77.1%
72.0%
52.0%
44.0%
29.1%
ELO Codeforces
2150
1718
1659
940
633
110
GPQA Diamond
84.3%
82.3%
78.8%
58.6%
43.4%
42.4%
Tau2
76.9%
68.2%
69.0%
42.2%
24.5%
16.2%
HLE sans outils
19.5%
8.7%
5.2%
-
-
-
HLE avec recherche
26.5%
17.2%
-
-
-
-
BigBench Extra difficile
74.4%
64.8%
53.0%
33.1%
21.9%
19.3%
MMMLU
88.4%
86.3%
83.4%
76.6%
67.4%
70.7%
Benchmarks vision
MMMU Pro
76.9%
73.8%
69.1%
52.6%
44.2%
49.7%
OmniDocBench 1.5 (plus bas est meilleur)
0.131
0.149
0.164
0.181
0.290
0.365
MATH-Vision
85.6%
82.4%
79.7%
59.5%
52.4%
46.0%
MedXPertQA MM
61.3%
58.1%
48.7%
28.7%
23.5%
-
Benchmarks audio
CoVoST
-
-
38.5*
35.54
33.47
-
FLEURS (plus bas est meilleur)
-
-
0.069*
0.08
0.09
-
Contexte long
MRCR v2 8 needle 128k (moyenne)
66.4%
44.1%
43.4%
25.4%
19.1%
13.5%

Mis à jour
Ce contenu vous a-t-il été utile ?

