For the complete documentation index, see llms.txt. This page is also available as Markdown.

IBM Granite 4.1 - comment exécuter en local

Exécutez IBM Granite-4.1 avec les GGUF d'Unsloth et découvrez comment le fine-tuner !

IBM publie les modèles Granite-4.1 en 3 tailles : 3B, 8B et 30B. Granite-4.1 est une famille de modèles denses à long contexte, conçue pour le suivi d’instructions, l’appel d’outils, le chat, les cas d’usage RAG et le codage. Les modèles sont très compétitifs pour leur taille et ont été entraînés sur 15T de jetons.

Découvrez comment exécuter les GGUF dynamiques Granite-4.1 d’Unsloth ou affiner/RL le modèle. Vous pouvez affiner Granite-4.1 avec notre notebook gratuit pour un cas d’usage d’agent de support.

Famille de modèles Granite-4.1 :

  • Granite-4.1-3B Dense : Léger et efficace pour les tâches locales, en périphérie et à fort volume. Idéal pour la classification rapide, l’extraction, le RAG simple, l’appel de fonctions et l’affinage sur des GPU plus petits.

  • Granite-4.1-8B Dense : Un modèle équilibré pour les assistants locaux, le RAG, le codage, le chat multilingue et les workflows d’utilisation d’outils. C’est un excellent choix par défaut si vous voulez une meilleure qualité tout en gardant une consommation de mémoire raisonnable.

  • Granite-4.1-30B Dense : Le modèle Granite-4.1 le plus puissant. Le meilleur pour les assistants d’entreprise plus exigeants, les tâches à long contexte, le RAG complexe, le codage, les workflows multilingues et les cas d’usage d’appel d’outils agentiques.

⚙️ Guide d’utilisation

Utilisez ces réglages pour des réponses déterministes suivant les instructions :

temperature=0.0, top_p=1.0, top_k=0

  • Température de 0.0

  • Top_K = 0

  • Top_P = 1.0

  • Contexte minimal recommandé : 16,384

  • Fenêtre maximale de longueur de contexte : 131,072 jetons

Téléversements Unsloth Granite-4.1

Exécuter les tutoriels Granite-4.1

Exécuter dans Unsloth StudioExécuter dans llama.cpp

🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons Unsloth Studio, notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir audio, des images et du texte localement sur Mac, Windows, et Linux, et :

1

Installer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

2

Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

Utilisateurs WSL : il vous sera demandé votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).

3

Lancer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

Puis ouvrez http://localhost:8888 dans votre navigateur.

4

Rechercher et télécharger Granite 4.1

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Allez ensuite dans l’onglet Studio Chat onglet puis recherchez Granite 4.1 dans la barre de recherche et téléchargez le modèle et la quantification souhaités.

5

Exécuter Granite 4.1

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de conversation et d’autres réglages.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth Studio.

🦙 Tutoriel Llama.cpp

  1. Obtenez la dernière version llama.cpp. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude — la prise en charge de Metal est activée par défaut.

  1. Si vous souhaitez utiliser llama.cpp pour charger directement des modèles, vous pouvez faire ce qui suit. UD-Q4_K_XL est le type de quantification. Vous pouvez aussi le remplacer par d’autres versions quantifiées comme Q4_K_M, Q5_K_M, Q8_0 ou BF16 en précision complète si disponible.

  1. OU téléchargez le modèle via Hugging Face après avoir installé huggingface_hub et hf_transfer.

  1. Exécutez le test Flappy Bird d’Unsloth.

Modifier --threads 32 pour le nombre de threads CPU, --ctx-size 16384 pour la longueur du contexte, et --n-gpu-layers 99 pour le déchargement sur GPU. Essayez d’ajuster les couches GPU si votre GPU manque de mémoire. Supprimez --n-gpu-layers si vous utilisez une inférence uniquement sur CPU.

  1. En mode conversation :

Affinage de Granite-4.1 dans Unsloth

Unsloth prend en charge les modèles Granite-4.1, y compris 3B, 8B et 30B, pour l’affinage. L’entraînement est 2x plus rapide, utilise moins de VRAM et prend en charge des longueurs de contexte plus longues. Granite-4.1-3B et Granite-4.1-8B sont les meilleurs points de départ pour un affinage local, tandis que Granite-4.1-30B est le modèle le plus puissant pour des workflows d’entreprise à plus forte précision.

Ce notebook entraîne un modèle pour devenir un agent de support qui comprend les interactions avec les clients, avec analyse et recommandations. Cette configuration vous permet d’entraîner un bot qui fournit une assistance en temps réel aux agents de support. Nous vous montrons également comment entraîner un modèle à partir de données stockées dans une feuille Google.

Configuration Unsloth pour Granite-4.1

Si vous avez une ancienne version d’Unsloth et/ou que vous effectuez un affinage localement, installez la dernière version d’Unsloth :

Pour forcer la réinstallation de la dernière version d’Unsloth et d’Unsloth Zoo :

Vous pouvez changer le nom du modèle pour n’importe quel modèle Granite-4.1 :

Pour le modèle 30B, utilisez un GPU plus puissant ou une configuration multi-GPU, et réduisez max_seq_length ou augmentez la quantification si vous manquez de mémoire.

Mis à jour

Ce contenu vous a-t-il été utile ?