IBM Granite 4.1 - comment exécuter en local
Exécutez IBM Granite-4.1 avec les GGUF d'Unsloth et découvrez comment le fine-tuner !
IBM publie les modèles Granite-4.1 en 3 tailles : 3B, 8B et 30B. Granite-4.1 est une famille de modèles denses à long contexte, conçue pour le suivi d’instructions, l’appel d’outils, le chat, les cas d’usage RAG et le codage. Les modèles sont très compétitifs pour leur taille et ont été entraînés sur 15T de jetons.
Découvrez comment exécuter les GGUF dynamiques Granite-4.1 d’Unsloth ou affiner/RL le modèle. Vous pouvez affiner Granite-4.1 avec notre notebook gratuit pour un cas d’usage d’agent de support.
Famille de modèles Granite-4.1 :
Granite-4.1-3B Dense : Léger et efficace pour les tâches locales, en périphérie et à fort volume. Idéal pour la classification rapide, l’extraction, le RAG simple, l’appel de fonctions et l’affinage sur des GPU plus petits.
Granite-4.1-8B Dense : Un modèle équilibré pour les assistants locaux, le RAG, le codage, le chat multilingue et les workflows d’utilisation d’outils. C’est un excellent choix par défaut si vous voulez une meilleure qualité tout en gardant une consommation de mémoire raisonnable.
Granite-4.1-30B Dense : Le modèle Granite-4.1 le plus puissant. Le meilleur pour les assistants d’entreprise plus exigeants, les tâches à long contexte, le RAG complexe, le codage, les workflows multilingues et les cas d’usage d’appel d’outils agentiques.
⚙️ Guide d’utilisation
Utilisez ces réglages pour des réponses déterministes suivant les instructions :
temperature=0.0, top_p=1.0, top_k=0
Température de
0.0Top_K =
0Top_P =
1.0Contexte minimal recommandé :
16,384Fenêtre maximale de longueur de contexte :
131,072jetons
Téléversements Unsloth Granite-4.1
Exécuter les tutoriels Granite-4.1
Exécuter dans Unsloth StudioExécuter dans llama.cpp
N’utilisez PAS CUDA 13.2 car vous pourriez obtenir des sorties incohérentes. NVIDIA travaille sur un correctif.
🦥 Guide Unsloth Studio
Pour ce tutoriel, nous utiliserons Unsloth Studio, notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir audio, des images et du texte localement sur Mac, Windows, et Linux, et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Comparer les modèles côte à côte
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Entraîner des LLM 2x plus vite avec 70 % de VRAM en moins

Configurer Unsloth Studio (une seule fois)
La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.
Utilisateurs WSL : il vous sera demandé votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).
Rechercher et télécharger Granite 4.1
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Allez ensuite dans l’onglet Studio Chat onglet puis recherchez Granite 4.1 dans la barre de recherche et téléchargez le modèle et la quantification souhaités.
Exécuter Granite 4.1
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.
🦙 Tutoriel Llama.cpp
Obtenez la dernière version
llama.cpp. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez-DGGML_CUDA=ONen-DGGML_CUDA=OFFsi vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez-DGGML_CUDA=OFFpuis continuez comme d’habitude — la prise en charge de Metal est activée par défaut.
Si vous souhaitez utiliser
llama.cpppour charger directement des modèles, vous pouvez faire ce qui suit.UD-Q4_K_XLest le type de quantification. Vous pouvez aussi le remplacer par d’autres versions quantifiées commeQ4_K_M,Q5_K_M,Q8_0ou BF16 en précision complète si disponible.
OU téléchargez le modèle via Hugging Face après avoir installé
huggingface_hubethf_transfer.
Exécutez le test Flappy Bird d’Unsloth.
Modifier --threads 32 pour le nombre de threads CPU, --ctx-size 16384 pour la longueur du contexte, et --n-gpu-layers 99 pour le déchargement sur GPU. Essayez d’ajuster les couches GPU si votre GPU manque de mémoire. Supprimez --n-gpu-layers si vous utilisez une inférence uniquement sur CPU.
En mode conversation :
Affinage de Granite-4.1 dans Unsloth
Unsloth prend en charge les modèles Granite-4.1, y compris 3B, 8B et 30B, pour l’affinage. L’entraînement est 2x plus rapide, utilise moins de VRAM et prend en charge des longueurs de contexte plus longues. Granite-4.1-3B et Granite-4.1-8B sont les meilleurs points de départ pour un affinage local, tandis que Granite-4.1-30B est le modèle le plus puissant pour des workflows d’entreprise à plus forte précision.
Granite-4.0 notebook gratuit de fine-tuning (changez le nom du modèle en Granite-4.1)
Ce notebook entraîne un modèle pour devenir un agent de support qui comprend les interactions avec les clients, avec analyse et recommandations. Cette configuration vous permet d’entraîner un bot qui fournit une assistance en temps réel aux agents de support. Nous vous montrons également comment entraîner un modèle à partir de données stockées dans une feuille Google.
Configuration Unsloth pour Granite-4.1
Si vous avez une ancienne version d’Unsloth et/ou que vous effectuez un affinage localement, installez la dernière version d’Unsloth :
Pour forcer la réinstallation de la dernière version d’Unsloth et d’Unsloth Zoo :
Vous pouvez changer le nom du modèle pour n’importe quel modèle Granite-4.1 :
Pour le modèle 30B, utilisez un GPU plus puissant ou une configuration multi-GPU, et réduisez max_seq_length ou augmentez la quantification si vous manquez de mémoire.
Mis à jour
Ce contenu vous a-t-il été utile ?


