> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/ibm-granite-4.1.md).

# IBM Granite 4.1 - Comment l'exécuter localement

IBM publie les modèles Granite-4.1 en 3 tailles : **3B**, **8B** et **30B**. Granite-4.1 est une famille de modèles denses à long contexte, conçue pour les cas d’usage de suivi d’instructions, d’appel d’outils, de chat, de RAG et de codage. Les modèles sont très compétitifs pour leur taille et ont été entraînés sur 15T de jetons.

Découvrez comment exécuter les GGUF dynamiques Granite-4.1 d’Unsloth ou affiner/renforcer par RL le modèle. Vous pouvez affiner Granite-4.1 avec notre notebook gratuit pour un cas d’usage d’agent de support.

**Famille de modèles Granite-4.1 :**

* **Granite-4.1-3B Dense :** Léger et efficace pour les tâches locales, en périphérie et à grand volume. Idéal pour la classification rapide, l’extraction, le RAG simple, l’appel de fonctions et l’affinage sur des GPU plus petits.
* **Granite-4.1-8B Dense :** Un modèle équilibré pour les assistants locaux, le RAG, le codage, le chat multilingue et les workflows d’utilisation d’outils. C’est un excellent choix par défaut si vous voulez une meilleure qualité tout en gardant une utilisation mémoire pratique.
* **Granite-4.1-30B Dense :** Le modèle Granite-4.1 le plus puissant. Le meilleur pour les assistants d’entreprise plus exigeants, les tâches à long contexte, le RAG complexe, le codage, les workflows multilingues et les cas d’usage d’appel d’outils agentique.

### ⚙️ Guide d'utilisation

Utilisez ces paramètres pour des réponses déterministes suivant les instructions :

`temperature=0.0`, `top_p=1.0`, `top_k=0`

* Température de `0.0`
* Top\_K = `0`
* Top\_P = `1.0`
* Contexte minimal recommandé : `16,384`
* Fenêtre de longueur de contexte maximale : `131,072` jetons

#### Téléversements Unsloth Granite-4.1

* [`unsloth/granite-4.1-3b-GGUF`](https://huggingface.co/unsloth/granite-4.1-3b-GGUF)
* [`unsloth/granite-4.1-8b-GGUF`](https://huggingface.co/unsloth/granite-4.1-8b-GGUF)
* [`unsloth/granite-4.1-30b-GGUF`](https://huggingface.co/unsloth/granite-4.1-30b-GGUF)

## Exécuter les tutoriels Granite-4.1

<a href="/pages/fde815ae4d911990aada6c1a07b4e1a825eb6650#unsloth-studio-guide" class="button primary">Exécuter dans Unsloth Studio</a><a href="https://unsloth.ai/docs/models/ibm-granite-4.1#llama.cpp-tutorial" class="button secondary">Exécuter dans llama.cpp</a>

{% hint style="warning" %}
N'utilisez PAS **CUDA 13.2** car vous pourriez obtenir des sorties incohérentes. NVIDIA travaille sur un correctif.
{% endhint %}

### 🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons [Unsloth Studio](/docs/fr/nouveau/studio.md), qui est notre nouvelle interface Web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir **audio**, image et texte localement sur **Mac, Windows**, et Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* **Comparer** les modèles **côte à côte**
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9d149ac4b773a56a635d40ab8347ea2896781ae6" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), construit le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

{% hint style="info" %}
**Utilisateurs WSL :** vous serez invité à saisir votre `sudo` mot de passe pour installer les dépendances de compilation (`cmake`, `git`, `libcurl4-openssl-dev`).
{% endhint %}
{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL :**

```bash
source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888
```

**Windows PowerShell :**

```bash
& .\unsloth_studio\Scripts\unsloth.exe studio -H 0.0.0.0 -p 8888
```

<div data-with-frame="true"><figure><img src="/files/fa3d706136ff9e7c9e614db9bb2d851ed981df1b" alt="" width="375"><figcaption></figcaption></figure></div>

**Puis ouvrez `http://localhost:8888` dans votre navigateur.**
{% endstep %}

{% step %}

#### Recherchez et téléchargez Granite 4.1

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l' [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet et recherchez Granite 4.1 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.
{% endstep %}

{% step %}

#### Exécuter Granite 4.1

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).
{% endstep %}
{% endstepper %}

### 🦙 Tutoriel Llama.cpp

1. Obtenez la dernière `llama.cpp`. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez `-DGGML_CUDA=OFF` puis continuez comme d’habitude — la prise en charge de Metal est activée par défaut.

```shell
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

2. Si vous souhaitez utiliser `llama.cpp` pour charger directement les modèles, vous pouvez faire ce qui suit. `UD-Q4_K_XL` est le type de quantification. Vous pouvez aussi le changer pour d’autres versions quantifiées comme `Q4_K_M`, `Q5_K_M`, `Q8_0` ou BF16 en précision complète si disponible.

```shell
./llama.cpp/llama-cli \\
    -hf unsloth/granite-4.1-30b-GGUF:UD-Q4_K_XL
```

3. OU téléchargez le modèle via Hugging Face après avoir installé `huggingface_hub` et `hf_transfer`.

```python
# !pip install huggingface_hub hf_transfer
import os
os.environ["HF_HUB_ENABLE_HF_TRANSFER"] = "1"

from huggingface_hub import snapshot_download

snapshot_download(
    repo_id = "unsloth/granite-4.1-30b-GGUF",
    local_dir = "unsloth/granite-4.1-30b-GGUF",
    allow_patterns = ["*UD-Q4_K_XL*"],
)
```

4. Exécutez le test Flappy Bird d’Unsloth.

```shell
./llama.cpp/llama-cli \\
    --model unsloth/granite-4.1-30b-GGUF/granite-4.1-30b-UD-Q4_K_XL.gguf \
    --n-gpu-layers 99 \
    --seed 3407 \\
    --prio 2 \\
    --temp 0.0 \
    --top-k 0 \
    --top-p 1.0 \
    -p "Create a single-file Python pygame implementation of Flappy Bird."
```

Modifier `--threads 32` pour le nombre de threads CPU, `--ctx-size 16384` pour la longueur du contexte, et `--n-gpu-layers 99` pour le déchargement sur GPU. Essayez d’ajuster les couches GPU si votre GPU manque de mémoire. Supprimez `--n-gpu-layers` si vous utilisez une inférence uniquement sur CPU.

5. Pour le mode conversation :

```shell
./llama.cpp/llama-cli \\
    --model unsloth/granite-4.1-30b-GGUF/granite-4.1-30b-UD-Q4_K_XL.gguf \
    --conversation \
    --n-gpu-layers 99 \
    --seed 3407 \\
    --prio 2 \\
    --temp 0.0 \
    --top-k 0 \
    --top-p 1.0
```

### Affinage de Granite-4.1 dans Unsloth

Unsloth prend en charge les modèles Granite-4.1, y compris 3B, 8B et 30B pour l’affinage. L’entraînement est 2x plus rapide, utilise moins de VRAM et prend en charge des longueurs de contexte plus longues. Granite-4.1-3B et Granite-4.1-8B sont les meilleurs points de départ pour un affinage local, tandis que Granite-4.1-30B est le modèle le plus puissant pour des workflows d’entreprise de plus grande précision.

* **Granite-4.0** [**notebook gratuit d’affinage**](https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/Granite4.0.ipynb) **(changez le nom du modèle en Granite-4.1)**

Ce notebook entraîne un modèle pour devenir un agent de support qui comprend les interactions clients, avec analyse et recommandations. Cette configuration vous permet d’entraîner un bot qui fournit une assistance en temps réel aux agents de support. Nous montrons aussi comment entraîner un modèle à l’aide de données stockées dans une feuille Google Sheet.

#### Configuration Unsloth pour Granite-4.1

Si vous avez une ancienne version d’Unsloth et/ou que vous affinez localement, installez la dernière version d’Unsloth :

```python
!pip install --upgrade unsloth
```

```python
from unsloth import FastLanguageModel
import torch

model, tokenizer = FastLanguageModel.from_pretrained(
    model_name = "unsloth/granite-4.1-8b",
    max_seq_length = 2048,   # Longueur de contexte - peut être plus longue, mais utilise plus de mémoire
    dtype = None,            # None pour détection automatique
    load_in_4bit = True,     # Le 4 bits utilise beaucoup moins de mémoire
    load_in_8bit = False,    # Un peu plus précis, utilise 2x plus de mémoire
    full_finetuning = False, # Nous avons maintenant l’affinage complet !
    # token = "hf_...",      # utilisez-en un si vous utilisez des modèles protégés
)
```

Pour réinstaller de force les dernières versions d’Unsloth et d’Unsloth Zoo :

```shell
pip install --upgrade --force-reinstall --no-cache-dir unsloth unsloth_zoo
```

Vous pouvez changer le nom du modèle pour n’importe quel modèle Granite-4.1 :

```python
model_name = "unsloth/granite-4.1-3b"
model_name = "unsloth/granite-4.1-8b"
model_name = "unsloth/granite-4.1-30b"
```

Pour le modèle 30B, utilisez un GPU plus grand ou une configuration multi-GPU, et réduisez `max_seq_length` ou augmentez la quantification si vous manquez de mémoire.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/ibm-granite-4.1.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
