For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemma 4 - comment exécuter localement

Exécutez localement les nouveaux modèles Gemma 4 de Google, y compris E2B, E4B, 26B A4B et 31B.

Gemma 4 est la nouvelle famille de modèles ouverts de Google DeepMind, comprenant 12B, E2B, E4B, 26B-A4Bet 31B. Les modèles multimodaux à raisonnement hybride prennent en charge plus de 140 langues, jusqu'à 256K de contexteet existent en variantes denses et MoE. Gemma 4 est sous licence Apache-2.0 et peut s'exécuter sur votre appareil local.

Gemma-4-12B est nouveau et offre une prise en charge unifiée du texte, de l'image et de l'audio. Il fonctionne sur 8 Go de RAM (4 bits) ou 14 Go (8 bits). Gemma-4-E2B et E4B prennent aussi en charge l'image et l'audio. Fonctionnent sur 5 Go de RAM (4 bits) ou 15 Go (16 bits complets).

Exécuter Gemma 4Affiner Gemma 4Gemma 4 QATGemma 4 MTP

Gemma-4-26B-A4B fonctionne sur 18 Go (4 bits) ou 28 Go (8 bits). Gemma-4-31B nécessite 20 Go de RAM (4 bits) ou 34 Go (8 bits).

Vous pouvez désormais exécuter tous les GGUF, MLX et affiner Gemma 4 dans Unsloth Studio (voir à droite).

QAT variantes de Gemma 4 réduisent les besoins en mémoire d'environ 3x tout en préservant la qualité du modèle.

Guide d'utilisation

Gemma 4 excelle dans le raisonnement, le codage, l'utilisation d'outils, les workflows à long contexte et agentiques, ainsi que les tâches multimodales. Les variantes plus petites E2B et E4B sont conçues pour les téléphones et les ordinateurs portables, tandis que les modèles plus grands ciblent les systèmes à CPU / VRAM moyens à élevés, comme les PC équipés de GPU NVIDIA RTX.

Variante Gemma 4
Détails
Meilleure adéquation

E2B

Dense + PLE (contexte 128K) Prise en charge : texte, image, audio

Pour l'inférence sur téléphone / en périphérie, l'ASR, la traduction vocale

E4B

Dense + PLE (contexte 128K) Prise en charge : texte, image, audio

Petit modèle pour les ordinateurs portables et une utilisation multimodale locale rapide

12B Unified

Dense (contexte 256K) Prise en charge : texte, image, audio

Modèle moyen pour les ordinateurs portables et une utilisation multimodale locale

26B-A4B

MoE (contexte 256K) Prise en charge : texte, image

Meilleur compromis vitesse / qualité pour une utilisation sur ordinateur

31B

Dense (contexte 256K) Prise en charge : texte, image

Meilleures performances, avec une inférence plus lente

Voir Gemma 4 : Benchmarks de performance et Benchmarks GGUF.

Dois-je choisir 26B-A4B ou 31B ?

  • 26B-A4B - équilibre vitesse et précision. Sa conception MoE le rend plus rapide que 31B, avec 4B de paramètres actifs. Choisissez-le si la RAM est limitée et que vous acceptez de sacrifier un peu de qualité au profit de la vitesse.

  • 31B - est actuellement le modèle Gemma 4 le plus performant. Choisissez-le pour une qualité maximale si vous avez suffisamment de mémoire et pouvez accepter des vitesses légèrement plus lentes.

Configuration matérielle requise

Tableau : Configuration matérielle recommandée pour l'inférence Gemma 4 GGUF (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée). Vous pouvez utiliser Gemma 4 sur macOS, les GPU NVIDIA RTX, etc.

Variante Gemma 4
4 bits
8 bits
BF16 / FP16

E2B

4 Go

5–8 Go

10 Go

E4B

5,5–6 Go

9–12 Go

16 Go

12B Unified

7–8 Go

13–14 Go

25 Go

26B A4B

16–18 Go

28–30 Go

52 Go

31B

17–20 Go

34–38 Go

62 Go

En règle générale, votre mémoire totale disponible devrait au moins dépasser la taille du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut quand même fonctionner en utilisant un déchargement partiel vers la RAM / le disque, mais la génération sera plus lente. Vous aurez aussi besoin de plus de calcul, selon la fenêtre de contexte utilisée.

Paramètres recommandés

Il est recommandé d'utiliser les paramètres par défaut de Gemma 4 de Google :

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Le contexte maximal de Gemma 4 est 128K pour E2B / E4B et 262,144 pour 12B / 26B A4B / 31B.

Mode réflexion

Par rapport aux anciens modèles de chat Gemma, Gemma 4 utilise les rôles standard système, assistantet utilisateur et ajoute un contrôle explicite de la réflexion.

Comment activer la réflexion :

Ajoutez le jeton <|think|> au début du prompt système.

Réflexion activée

Réflexion désactivée

Comportement de sortie :

Lorsque la réflexion est activée, le modèle affiche son canal de raisonnement interne avant la réponse finale.

Lorsque la réflexion est désactivée, les plus grands modèles peuvent tout de même émettre un bloc de pensée vide avant la réponse finale.

Par exemple, avec "Quelle est la capitale de la France ?":

puis il produit :

Règle de chat à plusieurs tours :

Pour les conversations à plusieurs tours, ne conservez que la réponse finale visible dans l'historique du chat. Ne pas réinjectez les blocs de réflexion précédents dans le tour suivant.

Comment désactiver la réflexion :

Remarque llama-cli pourrait ne pas fonctionner de manière fiable, utilisez donc llama-server pour désactiver le raisonnement :

Tutoriels pour exécuter Gemma 4

Comme les GGUF Gemma 4 existent en plusieurs tailles, le point de départ recommandé pour les petits modèles est le 8 bits et pour les plus grands modèles est Dynamique 4 bits. GGUF Gemma 4 ou MLX:

🦥 Guide d'Unsloth Studio🦙 Guide de Llama.cpp

Vous pouvez exécuter et entraîner Gemma 4 gratuitement avec une interface dans notre Unsloth Studio notebook :

🦥 Guide d'Unsloth Studio

Gemma 4 peut désormais être exécuté et affiné dans Unsloth Studio, notre nouvelle interface web open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur macOS, Windows, Linux et :

1

Installer Unsloth

Exécutez dans votre terminal :

macOS, Linux, WSL :

Windows PowerShell :

2

Lancez Unsloth

macOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 dans votre navigateur.

3

Recherchez et téléchargez Gemma 4

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter.

Ensuite, allez dans le Studio Chat onglet et recherchez Gemma 4 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités. Unsloth prend en charge le dernier modèle unifié Gemma-4-12B.

4

Exécuter Gemma 4

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur de contexte, le modèle de chat et d'autres paramètres. Vous pouvez exécuter des fichiers GGUF et MLX.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio.

🦙 Guide de Llama.cpp

Pour ce guide, nous utiliserons Dynamic 4 bits pour les 12B, 26B-A4B et 31B, et 8 bits pour E2B et E4B. Voir : collection GGUF Gemma 4

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Si vous souhaitez utiliser llama.cpp directement pour charger des modèles, vous pouvez suivre les commandes ci-dessous, selon le modèle. UD-Q4_K_XL est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (étape 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer à un emplacement spécifique. Il n'est pas nécessaire de définir la longueur de contexte, car llama.cpp utilise automatiquement la quantité exacte requise.

12B :

26B-A4B :

31B :

E4B :

E2B :

3

Vous pouvez aussi télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub, XET

4

Puis exécutez le modèle en mode conversation (avec vision mmproj-F16):

5

Déploiement de llama-server

Pour déployer Gemma-4 sur llama-server, utilisez :

Quantifications dynamiques MLX

Nous avons aussi téléchargé des quantifications dynamiques 4 bits et 8 bits à titre de premier essai pour les appareils MacOS ! Les quantifications MLX prennent en charge la vision.

Gemma 4
MLX 4 bits
MLX 8 bits

Pour les essayer, utilisez :

Guide Ollama

Ollama prend désormais bien en charge les GGUF Unsloth. Utilisez curl -fsSL https://ollama.com/install.sh | sh pour installer Ollama sous Linux ou irm https://ollama.com/install.ps1 | iex pour Windows. Pour utiliser un seul fichier quant (de moins de 50 Go), utilisez :

Pour plusieurs shards, comme des shards BF16 plus volumineux, faites :

Si vous voyez Erreur : 500 Internal Server Error : impossible de charger le modèle mettez à jour Ollama via curl -fsSL https://ollama.com/install.sh | sh ou utilisez la version PowerShell.

Bonnes pratiques pour Gemma 4

Exemples de prompts

Prompt de raisonnement simple

Invite OCR / document

Pour l'OCR, utilisez un budget élevé de tokens visuels comme 560 ou 1120.

Invite de comparaison multimodale

Invite ASR audio

Invite de traduction audio

Paramètres multimodaux

Pour de meilleurs résultats avec les invites multimodales, placez le contenu multimodal en premier :

  • Placez l'image et/ou l'audio avant le texte.

  • Pour la vidéo, fournissez d'abord une séquence d'images, puis l'instruction.

Limites audio et vidéo

  • Audio est disponible sur 12B, E2B et E4B uniquement.

  • L'audio prend en charge un maximum de 30 secondes.

  • La vidéo prend en charge un maximum de 60 secondes en supposant 1 image par seconde de traitement.

Modèles d'invites audio

Invite ASR

Invite de traduction vocale

📊 Benchmarks

Benchmarks GGUF d'Unsloth

Nous avons mené des benchmarks de divergence KL moyenne pour les GGUF Gemma 4 chez différents fournisseurs afin de vous aider à choisir la meilleure quantification (plus bas est meilleur).

  • La divergence KL place tous les GGUF Unsloth sur la frontière de Pareto SOTA

  • La KLD montre dans quelle mesure un modèle quantifié correspond à la distribution de sortie BF16 d'origine, indiquant la précision conservée.

26B A4B - benchmarks KLD (plus bas est meilleur)

Benchmarks officiels de Gemma

Benchmarks texte/code

Benchmark
Gemma 4 31B
Gemma 4 26B A4B
Gemma 4 12B Unified
Gemma 4 E4B
Gemma 4 E2B
Gemma 3 27B (sans réflexion)

MMLU Pro

85.2%

82.6%

77.2%

69.4%

60.0%

67.6%

AIME 2026 sans outils

89.2%

88.3%

77.5%

42.5%

37.5%

20.8%

LiveCodeBench v6

80.0%

77.1%

72.0%

52.0%

44.0%

29.1%

ELO Codeforces

2150

1718

1659

940

633

110

GPQA Diamond

84.3%

82.3%

78.8%

58.6%

43.4%

42.4%

Tau2

76.9%

68.2%

69.0%

42.2%

24.5%

16.2%

HLE sans outils

19.5%

8.7%

5.2%

-

-

-

HLE avec recherche

26.5%

17.2%

-

-

-

-

BigBench Extra difficile

74.4%

64.8%

53.0%

33.1%

21.9%

19.3%

MMMLU

88.4%

86.3%

83.4%

76.6%

67.4%

70.7%

Benchmarks vision

MMMU Pro

76.9%

73.8%

69.1%

52.6%

44.2%

49.7%

OmniDocBench 1.5 (plus bas est meilleur)

0.131

0.149

0.164

0.181

0.290

0.365

MATH-Vision

85.6%

82.4%

79.7%

59.5%

52.4%

46.0%

MedXPertQA MM

61.3%

58.1%

48.7%

28.7%

23.5%

-

Benchmarks audio

CoVoST

-

-

38.5*

35.54

33.47

-

FLEURS (plus bas est meilleur)

-

-

0.069*

0.08

0.09

-

Contexte long

MRCR v2 8 needle 128k (moyenne)

66.4%

44.1%

43.4%

25.4%

19.1%

13.5%

Mis à jour

Ce contenu vous a-t-il été utile ?