> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/bases/codex.md).

# Comment exécuter des LLM locaux avec OpenAI Codex

Ce guide étape par étape vous montre comment connecter des LLM et des API open source à OpenAI Codex **entièrement en local**, avec captures d'écran. Codex n'a besoin que d'un point de terminaison local qui parle l'API OpenAI Responses. Exécutez-le avec n'importe quel modèle ouvert comme Qwen, DeepSeek, Gemma, et plus encore.

Pour ce tutoriel, nous utiliserons les modèles ouverts : [Gemma 4](/docs/fr/modeles/gemma-4.md) et [Qwen3.5](/docs/fr/modeles/qwen3.5.md) qui sont de solides modèles d'agent et de codage (fonctionnent sur un appareil avec 24 Go de RAM/mémoire unifiée). Pour l'inférence, nous utiliserons [Unsloth Studio](https://github.com/unslothai/unsloth) et [`llama.cpp`](https://github.com/ggml-org/llama.cpp) vous permet d'exécuter/de servir des LLM sur macOS, Linux et Windows. Vous pouvez le remplacer par n'importe quel autre modèle ; il suffit de mettre à jour les noms des modèles dans vos scripts et dans la configuration de Codex.

<a href="/pages/0bb2f0a13e244fd2f0ea640c96c4e297bf83db93#setup-codex" class="button primary" data-icon="openai">Configurer Codex</a><a href="/pages/0bb2f0a13e244fd2f0ea640c96c4e297bf83db93#quickstart-tutorials" class="button primary">📖 Tutoriel de configuration d'un modèle local</a>

Pour les quants de modèle, nous utiliserons Unsloth [**GGUF dynamiques**](/docs/fr/bases/unsloth-dynamic-2.0-ggufs.md) afin que vous puissiez exécuter des modèles GGUF quantifiés tout en conservant le plus de précision possible.

{% hint style="info" %}
Codex a pas mal changé depuis janv. 2026. Il utilise maintenant l' [**API OpenAI Responses**](https://platform.openai.com/docs/api-reference/responses) **exclusivement**, et la prise en charge de Chat Completions est désormais obsolète. [Unsloth Studio](#unsloth-tutorial) prend en charge les deux, nous utiliserons donc `wire_api = "responses"` tout au long de ce guide.
{% endhint %}

### <i class="fa-openai">:openai:</i> Configurer Codex

[Codex](https://github.com/openai/codex) est l'agent de codage officiel d'OpenAI qui s'exécute localement. Bien que conçu pour ChatGPT, il prend en charge **des points de terminaison API personnalisés**, ce qui le rend utilisable pour des LLM locaux. Nous le pointerons plus tard vers le point de terminaison `/v1/responses` d'Unsloth Studio une fois Unsloth démarré.

{% tabs %}
{% tab title="Linux / WSL" %}
Exécutez dans votre terminal :

```bash
apt update
sudo apt install nodejs npm -y
npm install -g @openai/codex
```

{% endtab %}

{% tab title="Windows" %}
Exécutez dans Windows PowerShell :

```powershell
winget install --id OpenAI.Codex
```

{% hint style="info" %}
**Vous préférez l'application de bureau Codex ?** Installez-la depuis le Microsoft Store :

```powershell
winget install --id 9PLM9XGG6VKS --source msstore
```

Ou via le [Microsoft Store](https://apps.microsoft.com/detail/9plm9xgg6vks). L'application lit le même `%USERPROFILE%\.codex\config.toml`, donc la configuration du fournisseur que nous mettrons en place plus tard s'applique dans les deux cas.
{% endhint %}

{% hint style="info" %}
**Vous préférez WSL ?** Ouvrez PowerShell en tant qu'administrateur, exécutez `wsl --install`, redémarrez, puis suivez l'onglet Linux ci-dessus dans Ubuntu. Vous aurez besoin d'une petite astuce réseau pour atteindre Unsloth sur l'hôte Windows - voir l'indication WSL dans Connect Codex to Unsloth.
{% endhint %}
{% endtab %}

{% tab title="macOS" %}
Exécutez dans votre terminal :

<pre class="language-bash"><code class="lang-bash"><strong>bash brew install --cask codex
</strong></code></pre>

{% endtab %}
{% endtabs %}

C'est tout pour l'installation - **n'exécutez pas `codex` encore**. L'exécuter tel quel vous place dans le sélecteur "Se connecter avec ChatGPT" d'OpenAI (qui est modal - il n'y a aucun moyen d'y échapper). Une fois que nous aurons configuré un profil local,\
`codex --oss --profile unsloth_api` ou `codex --oss --profile llama_cpp` saute entièrement cet écran parce que les fournisseurs personnalisés ont par défaut `requires_openai_auth = false`. Démarrez d'abord le serveur du modèle local, puis lancez Codex dessus.

## 📖 Tutoriels de démarrage rapide <a href="#quickstart-tutorials" id="quickstart-tutorials"></a>

Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons [Unsloth](https://unsloth.ai/docs/new/studio) (une interface web) et llama.cpp, qui sont des frameworks open source pour exécuter et servir des LLM sur vos appareils Mac, Linux et Windows.

{% columns %}
{% column %}
Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons [Unsloth](/docs/fr/nouveau/studio.md) (une interface web) et llama.cpp, qui sont des frameworks open source pour exécuter et servir des LLM sur vos appareils Mac, Linux et Windows.

Unsloth dispose également de capacités uniques d'auto-réparation [appel d'outils](/docs/fr/nouveau/studio/chat.md#auto-healing-tool-calling) et [recherche web](/docs/fr/nouveau/studio/chat.md#code-execution) Voir à droite Claude Code connecté à Unsloth :
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/118594d542737c787c92e9199010344ac1033dec" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

<a href="/pages/0bb2f0a13e244fd2f0ea640c96c4e297bf83db93#unsloth-tutorial" class="button primary">🦥 Tutoriel Unsloth</a><a href="/pages/0bb2f0a13e244fd2f0ea640c96c4e297bf83db93#llama.cpp-tutorial" class="button primary">🦙 Tutoriel llama.cpp</a>

## 🦥 Tutoriel Unsloth

Pour ce tutoriel, nous allons servir/connecter des modèles locaux à Claude Code via une interface utilisateur en utilisant [Unsloth](https://github.com/unslothai/unsloth). Unsloth fonctionne sous Windows, WSL, Linux et MacOS.

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* Inférence rapide CPU + GPU via llama.cpp
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins

Voir ci-dessous pour les instructions d'installation :
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/c1e3c98db9ff7047858e3dac518d5347113d27aa" alt=""><figcaption><p>Exemple de Qwen3.6 en 2 bits exécuté dans Unsloth.</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% tabs %}
{% tab title="macOS" %}

#### Étape 1 : configurer Unsloth

Lancez le `terminal` depuis votre Mac, puis installez Unsloth en saisissant la commande ci-dessous.

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Unsloth commencera à configurer l'environnement et à installer les paquets requis comme indiqué ci-dessous. Tapez **Y** et appuyez sur `Entrée` lorsqu'on vous demande si vous souhaitez autoriser Unsloth à démarrer maintenant. Cela lancera Unsloth sur votre **8888** port local.

<figure><img src="/files/00ed58c09f9f7e196ffec4cd2a6a281d68dd4280" alt="" width="375"><figcaption></figcaption></figure>

{% hint style="info" %}
Si vous avez choisi de ne pas démarrer Unsloth pendant le processus d'installation, vous pouvez toujours lancer l'application Unsloth à l'aide de `unsloth studio -p 8888` . Si vous souhaitez que votre instance Unsloth soit accessible par des clients en dehors de votre PC/ordinateur, ajoutez `-H 0.0.0.0` à la `unsloth studio` commande.
{% endhint %}

#### Étape 2 : démarrer Unsloth

Ouvrez le navigateur de votre choix et saisissez `http://127.0.0.1:8888` dans la barre d'adresse. Si c'est la première fois que vous installez Unsloth, vous serez redirigé vers la page du mot de passe où vous devrez créer un nouveau mot de passe. Ensuite, Unsloth devrait maintenant s'ouvrir sur la page de chat comme ci-dessous.

<figure><img src="/files/b66be28b24e0fe6f62367d4b52ae80b764d865ae" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}

{% tab title="Windows" %}

#### Étape 1 : configurer Unsloth

Ouvrez le menu Démarrer, recherchez `PowerShell`et lancez-le. Copiez et entrez la commande d'installation :

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

l'installation commencera automatiquement. Une fois l'installation terminée, PowerShell vous demandera si vous souhaitez démarrer Unsloth Studi&#x6F;**.**

<figure><img src="/files/00ed58c09f9f7e196ffec4cd2a6a281d68dd4280" alt="" width="375"><figcaption></figcaption></figure>

Vous pouvez également le lancer avec la commande suivante :

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

{% hint style="info" %}
Si vous souhaitez que votre instance soit accessible par des clients en dehors de votre PC/ordinateur.\
Ajoutez `-H 0.0.0.0` à la `unsloth studio` commande.
{% endhint %}

#### Étape 2 : démarrer Unsloth

Ouvrez `http://127.0.0.1:8888` dans votre navigateur. Au premier lancement, créez un nouveau mot de passe pour continuer vers la page de chat. **Unsloth Studio** est maintenant installé et prêt à être utilisé.

<figure><img src="/files/b66be28b24e0fe6f62367d4b52ae80b764d865ae" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}

{% tab title="Linux, WSL" %}

#### Étape 1 : configurer Unsloth

{% tabs %}
{% tab title="Linux" %}
Ouvrez votre application de terminal. Vous pouvez la lancer en appuyant sur `Ctrl + Alt + T`, ou en recherchant `Terminal` dans le menu des applications de votre système.
{% endtab %}

{% tab title="WSL" %}
Cliquez sur le menu Démarrer de Windows, tapez le nom de votre distribution installée (par ex. `Ubuntu`), puis ouvrez-la.

{% hint style="warning" %}
Sur **WSL**assurez-vous que vos **pilotes NVIDIA** sont installés sur **Windows** (pas dans WSL) et que le **kit d'outils CUDA** est installé dans votre distribution WSL. Consultez les exigences système ci-dessous pour plus de détails.
{% endhint %}
{% endtab %}
{% endtabs %}

Pour installer, copiez et exécutez la commande d'installation :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Puis :

1. Cliquez à l'intérieur de la fenêtre du terminal
2. Collez la commande avec `Ctrl + Maj + V`
3. Appuyez sur `Entrée`

Unsloth commencera à configurer l'environnement et à installer les paquets requis comme indiqué ci-dessous. Tapez **Y** et appuyez sur `Entrée` lorsqu'on vous demande si vous souhaitez autoriser Unsloth à démarrer maintenant. Cela lancera Unsloth sur votre **8888** port local.

<figure><img src="/files/3956161a3e04b5e69e31dce21ce02b7783a60dfb" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
Si vous avez choisi de ne pas démarrer Unsloth pendant le processus d'installation, vous pouvez toujours lancer l'application Unsloth à l'aide de `unsloth studio -p 8888` . Si vous souhaitez que votre instance Unsloth soit accessible par des clients en dehors de votre PC/ordinateur, ajoutez `-H 0.0.0.0` à la `unsloth studio` commande.
{% endhint %}

#### Étape 2 : démarrer Unsloth

Ouvrez le navigateur de votre choix et saisissez `http://127.0.0.1:8888` dans la barre d'adresse. Si c'est la première fois que vous installez Unsloth, vous serez redirigé vers la page du mot de passe où vous devrez créer un nouveau mot de passe. Ensuite, Unsloth devrait maintenant s'ouvrir sur la page de chat comme ci-dessous.

<figure><img src="/files/11b2aea44d2e2a1873a248975fd5b6ca451553cb" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}
{% endtabs %}

### Guide de chargement du modèle + API

{% stepper %}
{% step %}

#### Sélectionner un modèle

Avant d’utiliser l’API, chargez un modèle depuis le **menu déroulant Sélectionner un modèle** dans le coin supérieur gauche de la page Chat.

<figure><img src="/files/20a3e3fe38cf2dfd454794201dd3cc499546d855" alt=""><figcaption></figcaption></figure>

Dans ce guide, nous utiliserons : `unsloth/gemma-4-26B-A4B-it-GGUF` avec la `UD-Q4_K_XL` quantification recommandée.
{% endstep %}

{% step %}

#### Tester le modèle

Avant d’utiliser le client, envoyez un court message :

<div data-with-frame="true"><figure><img src="/files/55ba6f6b98ba57615a8791e0bec949b1a8cc9795" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
Cela confirme que le modèle s’est chargé correctement et qu’il est prêt à répondre.
{% endhint %}
{% endstep %}

{% step %}

#### **Clé API Unsloth**

Dans Unsloth, ouvrez **Paramètres → API** pour consulter ou créer votre clé API. Si vous démarrez Unsloth en mode headless avec `unsloth run`, la clé est également affichée dans la console sous la forme `sk-unsloth-...`.

<figure><img src="/files/4cfccdbce7d628cd17ae882bafd9d2a1c70743a3" alt=""><figcaption></figcaption></figure>

Traitez votre clé API comme un mot de passe et évitez de l’exposer dans des captures d’écran ou des dépôts.
{% endstep %}
{% endstepper %}

### Optionnel : ajuster les paramètres d'exécution

Vous pouvez transmettre des options d'exécution supplémentaires au démarrage d'un modèle avec `unsloth run`.

```bash
# Activer le raisonnement et utiliser une fenêtre de contexte plus grande
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \
  --reasoning on \\
  -c 131072
```

Les modèles capables de raisonnement peuvent être démarrés avec `--reasoning on` ou `--reasoning off`. Le `-c` argument contrôle la fenêtre de contexte disponible.

```bash
# Servir pour un agent de codage sur un port personnalisé
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \
  --disable-tools \
  -p 8888
```

Utilisez `-p` si vous avez besoin que l'API s'exécute sur un autre port.

{% hint style="info" %}
Lorsque vous pilotez un agent de codage externe, ajoutez `--disable-tools`. Cela bascule Unsloth Studio en mode passthrough afin que les outils propres à l'agent soient transmis et renvoyés sous forme d'appels d'outils pour l'agent, au lieu qu'Unsloth exécute ses outils intégrés côté serveur.
{% endhint %}

Pour une configuration d’exécution plus avancée, consultez la principale [optimisation de l’API](https://unsloth.ai/docs/basics/api#unsloth-run-command) section.

## ⚙️ Connecter Codex

Maintenant que nous avons configuré le LLM local pour Codex, nous configurons maintenant Codex pour fonctionner avec votre outil. Vous pouvez soit vous connecter facilement avec `unsloth start` ci-dessous ou le faire [manuellement](#connect-manually).

### ⚡ Exécuter OpenAI Codex avec `unsloth start`

Pour lancer Codex directement avec un modèle, exécutez :

```bash
unsloth start codex \\
  --model unsloth/gemma-4-E2B-it-GGUF:UD-Q4_K_XL \\
  --context-length 32768
```

Avec un modèle GGUF chargé dans Unsloth Studio, ouvrez le dossier de votre projet et exécutez :

```bash
unsloth start codex
```

Unsloth crée un répertoire personnel Codex isolé et un fournisseur Responses adossé à Unsloth pour le lancement. Votre configuration habituelle `~/.codex` reste intacte.

Par défaut, l'état de Codex est temporaire. Utilisez `--persist` lorsque vous souhaitez conserver sa configuration et ses sessions gérées par Unsloth :

```bash
unsloth start codex --persist
unsloth start codex --persist resume --last
```

<figure><img src="/files/fda26859be29f0161ed1d8ff8508e570c0994659" alt="OpenAI Codex running with a local GGUF model through Unsloth Studio"><figcaption><p>Codex connecté à un modèle GGUF local via le point de terminaison Responses d'Unsloth Studio.</p></figcaption></figure>

> Codex nécessite actuellement qu'un modèle GGUF soit servi via le `llama-server` backend.

Consultez la `unsloth start` référence pour le chargement du modèle, la persistance et toutes les options du wrapper.

Le reste de ce guide couvre une configuration manuelle complète du fournisseur Codex.

#### 🔌 Connexion manuelle

Cette section concerne la configuration manuelle ; c'est la même chose que vous ayez utilisé Unsloth Studio, llama.cpp ou un autre serveur local compatible OpenAI. Codex a besoin de trois valeurs : la **clé API**, la **URL de base**, et le **nom du modèle**. L'exemple ci-dessous utilise Unsloth Studio ; pour llama.cpp, utilisez la même structure avec le `llama_cpp` profil dans la section llama.cpp.

{% stepper %}
{% step %}

#### **Configurer le fournisseur Unsloth**

Codex recherche `~/.codex/config.toml` sur macOS/Linux/WSL ou `%USERPROFILE%\.codex\config.toml` sous Windows. Créez-le ou modifiez-le :

{% code title="\~/.codex/config.toml" overflow="wrap" %}

```toml
# Fournisseur local par défaut utilisé avec `codex --oss`
oss_provider = "unsloth_api"

[model_providers.unsloth_api]
name                  = "Unsloth Studio"
base_url              = "http://localhost:8888/v1"
env_key               = "UNSLOTH_STUDIO_AUTH_TOKEN"
wire_api              = "responses"
requires_openai_auth  = false
```

{% endcode %}

Ensuite, créez un profil Codex pour Unsloth :

{% code title="\~/.codex/unsloth\_api.config.toml" overflow="wrap" %}

```toml
model_provider = "unsloth_api"
model = "unsloth/gemma-4-26B-A4B-it-GGUF"
```

{% endcode %}

{% hint style="info" %}
`modèle` doit correspondre à l'identifiant que votre serveur renvoie à `GET http://localhost:8888/v1/models`. Unsloth Studio expose l'identifiant complet du dépôt (par exemple `unsloth/gemma-4-26B-A4B-it-GGUF`). La section llama.cpp ci-dessous utilise `--alias "unsloth/gemma-4-26B-A4B"`, utilisez donc cet identifiant plus court lorsque vous pointez Codex vers llama-server à la place.
{% endhint %}

{% hint style="info" %}
Cette configuration enregistre un fournisseur de modèle Codex `unsloth_api` pointant vers Unsloth Studio, et définit `unsloth_api` comme fournisseur local par défaut pour `codex --oss`. Le profil séparé `unsloth_api` sélectionne le fournisseur et le modèle Unsloth Studio uniquement lorsque vous lancez Codex avec `--profile unsloth_api`, donc votre configuration Codex habituelle n'est pas modifiée. Codex lit la clé API depuis une variable d'environnement nommée `UNSLOTH_STUDIO_AUTH_TOKEN`. Vous définirez la vraie clé à l'étape suivante.
{% endhint %}

| Champ                  | Ce qu'il fait                                                                                                                                               |
| ---------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `base_url`             | Votre point de terminaison du serveur local + `/v1`                                                                                                         |
| `env_key`              | **Nom** de la variable d'environnement dont Codex lit votre clé API. Ce n'est pas la clé elle-même.                                                         |
| `wire_api`             | `responses`. Codex utilise désormais exclusivement l'API Responses d'OpenAI.                                                                                |
| `requires_openai_auth` | `false` fait en sorte que Codex saute l'écran "Se connecter avec ChatGPT" pour ce fournisseur. La valeur par défaut est déjà `false`, mais soyez explicite. |
| `modèle`               | L'identifiant du modèle exposé par votre serveur. Interrogez `GET <base_url>/models` pour confirmer la chaîne exacte.                                       |
| `oss_provider`         | <p>Définit <code>unsloth\_api</code> comme fournisseur local par défaut lors du lancement de Codex avec<br><code>--oss</code>.</p>                          |
| `requires_openai_auth` | `false` fait en sorte que Codex saute l'écran "Se connecter avec ChatGPT" pour ce fournisseur.                                                              |

{% hint style="warning" %}
OpenAI a supprimé `wire_api = "chat"` la prise en charge. Utilisez toujours `wire_api = "responses"`. Si vous définissez `wire_api = "chat"`, Codex refuse de démarrer avec `` `wire_api = "chat"` n'est plus pris en charge. Comment corriger : définissez `wire_api = "responses"` dans la configuration de votre fournisseur. ``
{% endhint %}

{% hint style="info" %}
Vous pouvez créer plusieurs fichiers de profil, un pour chaque modèle Unsloth entre lesquels vous alternez. Lancez celui que vous voulez avec `codex --profile <profile-name>`.
{% endhint %}
{% endstep %}

{% step %}

#### Définir la variable d'environnement de la clé API

Utilisez le même nom de variable d'environnement que celui que vous avez écrit dans `env_key`. Dans l'exemple Unsloth Studio ci-dessus, `env_key = "UNSLOTH_STUDIO_AUTH_TOKEN"`, donc définissez `UNSLOTH_STUDIO_AUTH_TOKEN` dans le même terminal à partir duquel vous exécuterez Codex :

{% code title="macOS / Linux / WSL" %}

```bash
export UNSLOTH_STUDIO_AUTH_TOKEN=YOUR_TOKEN
```

{% endcode %}

{% code title="Windows PowerShell" %}

```powershell
$env:UNSLOTH_STUDIO_AUTH_TOKEN = "YOUR_TOKEN"
```

{% endcode %}

Si vous avez renommé `env_key`, renommez aussi la variable dans les commandes. Par exemple, un profil llama.cpp qui utilise `env_key = "LLAMA_CPP_API_KEY"` nécessite `LLAMA_CPP_API_KEY`, pas `UNSLOTH_STUDIO_AUTH_TOKEN`.

**Session ou persistant :** les commandes ci-dessus ne s'appliquent qu'au terminal actuel. Pour rendre cela persistant :

* **macOS / Linux / WSL :** ajoutez la `ligne` export `~/.bashrc` (bash) ou `~/.zshrc` (zsh).
* **Windows :** exécutez `setx UNSLOTH_STUDIO_AUTH_TOKEN "YOUR_TOKEN"` une fois, ou ajoutez la `$env:` ligne à votre PowerShell `$PROFILE`.

{% hint style="warning" %}
**Vous exécutez Codex dans WSL avec Unsloth sur Windows ?** WSL est un espace de noms réseau séparé, donc `localhost` depuis WSL n'atteint pas Unsloth. Modifiez votre `config.toml` pour utiliser à la place l'adresse IP de l'hôte Windows :

```bash
# Obtenez l'adresse IP de l'hôte Windows depuis WSL
ip route | grep default | awk '{print $3}'
```

Puis définissez `base_url = "http://<cette-ip>:8888/v1"`. Si vous avez activé le réseau miroir WSL2 (`.wslconfig` → `networkingMode=mirrored`), `localhost` fonctionne comme sur Windows natif.
{% endhint %}
{% endstep %}

{% step %}

#### **Lancer Codex**

```bash
mkdir my-project && cd my-project
codex --oss --profile unsloth_api
```

{% hint style="info" %}
**Premier lancement dans un nouveau répertoire** Codex demande *"Faites-vous confiance au contenu de ce répertoire ?"* - choisissez *Oui, continuer.* Ceci est l'invite de confiance par répertoire courant, et non la connexion ChatGPT (celle-ci est sautée à cause de \`requires\_openai\_auth = false\`). Les lancements suivants dans le même répertoire sautent cette invite.
{% endhint %}

<figure><img src="/files/e00bb9459a40d0ab23ad862e640250fadb27c384" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
**Vous voyez `Métadonnées du modèle pour` unsloth/gemma-4-26B-A4B `introuvables. Utilisation par défaut des métadonnées de repli`?** Codex est livré avec un tableau intégré des fenêtres de contexte, de la prise en charge des outils et des modalités d'entrée pour les modèles propres à OpenAI. Pour tout autre modèle, il retombe sur des valeurs sûres par défaut. L'avertissement se déclenche une fois par session pour chaque identifiant non OpenAI. Tout fonctionne quand même, vous pouvez l'ignorer.

**Pour le corriger :** ajoutez `model_context_window = 131072` en haut de `~/.codex/config.toml` afin que Codex utilise la vraie fenêtre de contexte 128K de Gemma 4 au lieu de son estimation de repli. Pour un contrôle complet sur la prise en charge des outils et les modalités d'entrée également, pointez `model_catalog_json` dans `[profiles.unsloth_api]` vers un fichier JSON contenant une entrée personnalisée `ModelInfo` pour votre identifiant.
{% endhint %}

Le `--profile unsloth_api` L'option indique à Codex de charger `~/.codex/unsloth_api.config.toml`, qui sélectionne le fournisseur et le modèle Unsloth Studio. Ajoutez `--oss` pour exécuter via le flux du fournisseur OSS local de Codex. Le nom du modèle apparaît dans la barre d'état de Codex.

<figure><img src="/files/7818126fbcab42128fefe6646130717527a39823" alt=""><figcaption></figcaption></figure>

Ajoutez `--search` pour activer la recherche web :

```bash
codex --oss --profile unsloth_api --search
```

Pour contourner toutes les invites d'approbation **(ATTENTION, cela fera que Codex fera et exécutera du code comme bon lui semble sans aucune approbation !)**:

{% code overflow="wrap" %}

```bash
codex --oss --profile unsloth_api --search --dangerously-bypass-approvals-and-sandbox
```

{% endcode %}
{% endstep %}
{% endstepper %}

### Essayez une vraie tâche

Essayez cette invite pour installer et lancer un simple fine-tuning Unsloth :

{% code overflow="wrap" %}

```
Vous ne pouvez travailler que dans le projet cwd/. Ne cherchez pas AGENTS.md — c'est ici.
Installez Unsloth via un environnement virtuel avec uv. Voir
https://unsloth.ai/docs/get-started/install/pip-install pour savoir comment faire (obtenez-le et lisez-le).
Puis effectuez une simple exécution de fine-tuning Unsloth décrite dans
https://github.com/unslothai/unsloth. Vous avez accès à 1 GPU.
```

{% endcode %}

et si nous attendons un peu plus longtemps, vous verrez un modèle fine-tuné avec succès avec Unsloth !

<figure><img src="/files/4fc42bbb0c456d64fe8c2c73cb5735622cd6bd7a" alt=""><figcaption></figcaption></figure>

### Déconnecter ou revenir en arrière

Lancez Codex sans `-p unsloth_api` et il utilisera son fournisseur par défaut. Ou supprimez les `[profiles.unsloth_api]` et `[model_providers.unsloth_api]` blocs de `~/.codex/config.toml`.

```bash
unset UNSLOTH_STUDIO_AUTH_TOKEN
```

Vous pouvez laisser Unsloth Studio en marche ou l'arrêter. Il n'intercepte rien lorsqu'il est arrêté.

### Dépannage

| Symptôme                                               | Cause probable                                                                                | Corriger                                                                                                                                                |
| ------------------------------------------------------ | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `Métadonnées du modèle pour ... introuvables`          | Identifiant non OpenAI, aucune métadonnée intégrée                                            | Avertissement sans danger. Pour en supprimer les effets secondaires, définissez `model_context_window = 131072` dans `~/.codex/config.toml`, ou pointez |
| Codex dit que c'est GPT                                | Codex injecte une invite système faisant référence à OpenAI ; les modèles locaux la reflètent | Ce n'est pas un bug de routage. Vérifiez via le panneau d'activité d'Unsloth. Remplacez l'invite système pour changer l'auto-déclaration.               |
| `Connexion refusée`                                    | Unsloth ne tourne pas ou mauvais port                                                         | Confirmez qu'Unsloth est actif à `http://localhost:8888`; vérifiez `base_url` dans `config.toml`                                                        |
| `wire_api = "chat" n'est plus pris en charge`          | Ancien `wire_api = "chat"` dans la configuration                                              | Passez à `wire_api = "responses"`                                                                                                                       |
| `modèle introuvable`                                   | Erreur de l'identifiant du modèle                                                             | `GET http://localhost:8888/v1/models` et copiez l'identifiant exact                                                                                     |
| OOM au milieu de la génération                         | Contexte trop grand pour la VRAM                                                              | Réduisez le contexte dans Unsloth **Paramètres → Inférence**, ou utilisez un quant plus petit                                                           |
| Codex affiche le sélecteur "Se connecter avec ChatGPT" | <p>Lancé tel quel <code>codex</code> (sans<br><code>--oss</code>)</p>                         | Quittez (Ctrl+C), puis relancez avec `codex --oss --profile unsloth_api`. Les fournisseurs personnalisés sautent cette étape                            |
| Appels d'outils peu fiables                            | Nécessite un repli d'auto-réparation                                                          | d’Unsloth [appels d'outils d'auto-réparation](file:///1382377/new/studio/#execute-code--heal-tool-calling) sont activés par défaut                      |
| WSL : `Connexion refusée` à `localhost`                | espace de noms réseau WSL                                                                     | Utilisez l'IP de l'hôte Windows dans `base_url`, ou activez le réseau miroir WSL2                                                                       |

## 🦙 Tutoriel Llama.cpp

Nous pouvons aussi utiliser `llama.cpp` directement. Nous devons déployer `llama-server` qui est un framework open source pour exécuter et servir efficacement des LLM sur des appareils Mac, Linux et Windows. Le modèle sera servi sur **le port 8001** avec tous les appels d’outils de l’agent acheminés via ce seul point de terminaison compatible OpenAI.

{% hint style="info" %}
Le point de terminaison llama.cpp sera sur **le port 8001** au lieu de `8888` (par défaut dans Unsloth Studio). Ajustez votre Codex `base_url` en conséquence dans `~/.codex/config.toml`.
{% endhint %}

{% stepper %}
{% step %}

#### **Installer llama.cpp**

Nous devons installer `llama.cpp` pour déployer/servir des LLM locaux à utiliser dans Codex. Nous suivons les instructions de compilation officielles pour des liaisons GPU correctes et des performances maximales. Modifiez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev git-all -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}

#### **Téléchargez et utilisez les modèles localement**

Téléchargez le modèle via le `hf` CLI (`pip install huggingface_hub hf_transfer`). Nous utilisons le **UD-Q4\_K\_XL** quant pour le meilleur équilibre taille/précision. Vous pouvez trouver tous les envois GGUF d’Unsloth dans notre [Collection ici](file:///1382377/get-started/unsloth-model-catalog.md). Si les téléchargements se bloquent, voir [https://hugging-face-hub-xet-debugging.md](https://hugging-face-hub-xet-debugging.md "mention").

```bash
hf download unsloth/gemma-4-26B-A4B-it-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-GGUF \\
    --include "*UD-Q4_K_XL*"
```

{% hint style="info" %}
**Vous voulez la prise en charge de la vision ?** Ajoutez `--include "*mmproj-BF16*"` pour récupérer aussi le projecteur de vision, puis passez `--mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf` à `llama-server`. Codex lui-même est en texte uniquement, donc c'est facultatif.
{% endhint %}

{% hint style="success" %}
Nous avons utilisé `unsloth/gemma-4-26B-A4B-it-GGUF`, mais vous pouvez utiliser n'importe quoi comme `unsloth/Qwen3.6-35B-A3B-GGUF` - voir [Qwen3.6-35B-A3B](/docs/fr/modeles/qwen3.6.md).
{% endhint %}
{% endstep %}

{% step %}

#### **Démarrer le serveur Llama**

Pour déployer Gemma-4-26B-A4B pour des charges de travail agentiques, nous utilisons `llama-server`. Nous appliquons les paramètres d'échantillonnage recommandés par Google (`temp 1.0`, `top_p 0.95`, `top_k 64`) et activons `--jinja` pour une prise en charge correcte des appels d'outils.

Exécutez cette commande dans un nouveau terminal (utilisez `tmux` ou ouvrez un nouveau terminal). Ce qui suit devrait **tenir confortablement dans un GPU de 24 Go (RTX 4090)** à environ 18 Go. `--fit sur` déchargera automatiquement aussi, mais si vous constatez de mauvaises performances, réduisez `--ctx-size`.

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --alias "unsloth/gemma-4-26B-A4B" \\
    --temp 1.0 \
    --top-p 0.95 \\
    --top-k 64 \\
    --port 8001 \\
    --kv-unified \\
    --cache-type-k q8_0 --cache-type-v q8_0 \\
    --batch-size 4096 --ubatch-size 1024
```

{% hint style="info" %}
Nous avons utilisé `--cache-type-k q8_0 --cache-type-v q8_0` pour la quantification du cache KV afin de réduire l'utilisation de la VRAM. Si vous constatez une qualité réduite, utilisez `bf16` à la place (`--cache-type-k bf16 --cache-type-v bf16`), mais la VRAM double.
{% endhint %}

{% hint style="success" %}
**Désactiver la réflexion** peut améliorer les performances pour les tâches de codage agentiques. Gemma 4 active la réflexion par défaut via le modèle de chat - pour la désactiver, ajoutez l'indicateur suivant à la commande llama-server :

**macOS / Linux / WSL :**

`--chat-template-kwargs '{"enable_thinking":false}'`

**Windows PowerShell :**

`--chat-template-kwargs "{\"enable_thinking\":false}"`
{% endhint %}
{% endstep %}

{% step %}

#### **Dirigez Codex vers le port 8001**

Modifiez votre `~/.codex/config.toml` pour utiliser le port du serveur llama-server :

{% code title="\~/.codex/config.toml" %}

```toml
[model_providers.llama_cpp]
name      = "llama.cpp"
base_url  = "http://localhost:8001/v1"
env_key   = "LLAMA_CPP_API_KEY"
wire_api  = "responses"
```

{% endcode %}

Puis lancez avec le nouveau profil :

```bash
codex --oss llama_cpp
```

Comme llama-server n'exige pas de vraie clé, vous pouvez définir le jeton d'authentification à n'importe quelle valeur :

{% code title="macOS / Linux / WSL" %}

```bash
export LLAMA_CPP_API_KEY=sk-no-key-required
```

{% endcode %}

{% code title="Windows PowerShell" %}

```powershell
$env:LLAMA_CPP_API_KEY = "sk-no-key-required"
```

{% endcode %}
{% endstep %}
{% endstepper %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/bases/codex.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
