> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/integrations/connections/vllm.md).

# Connecter vLLM à Unsloth pour l'inférence de chat locale

Apprenez à connecter **vLLM à** [**Unsloth**](https://github.com/unslothai/unsloth) en utilisant l’ **API compatible OpenAI** afin que vous puissiez servir des modèles et discuter avec eux localement dans une interface de chat open source. Ce guide vous accompagne dans l’installation de vLLM, le lancement d’un serveur vLLM local, la configuration de l’URL de base de l’API, le chargement des ID de modèles disponibles et la sélection de votre modèle vLLM hébergé.

À la fin, vos modèles servis par vLLM apparaîtront aux côtés des modèles locaux, vous offrant un moyen rapide et flexible d’exécuter l’inférence LLM externe depuis une interface de chat.

### Configuration

{% stepper %}
{% step %}

#### Installer vLLM

Installez d’abord vLLM afin de pouvoir exécuter la `commande vllm serve` . Suivez le [guide d’installation de vLLM](https://docs.vllm.ai/en/stable/getting_started/installation/) officiel pour votre plateforme et votre matériel.

Après l’installation, vérifiez que vLLM fonctionne dans votre terminal : `vllm --help`
{% endstep %}

{% step %}

#### Choisir un modèle

vLLM sert des modèles depuis Hugging Face.

Par exemple, démarrez un serveur vLLM avec un modèle Unsloth :

```bash
vllm serve unsloth/gemma-4-26B-A4B-it 
\ --dtype auto
```

Cela expose un point de terminaison d’API à :

`http://localhost:8000/v1`

Pour exiger une clé API, ajoutez :

```bash
--api-key token-abc123
```

{% endstep %}

{% step %}

#### Connecter vLLM à Unsloth

Ouvrez **Paramètres → Connexions**, puis cliquez sur **Ajouter la connexion**.

Sélectionnez **vLLM**, puis saisissez les détails de votre serveur.

<figure><img src="/files/4dcfd81ce4e1ffb19aab1cdbee3585021e680800" alt=""><figcaption></figcaption></figure>

Saisissez les détails de votre serveur vLLM :

* **Clé API :** laissez vide sauf si vous avez lancé vLLM avec --api-key
* **URL de base :** par exemple, <http://localhost:8000/v1>
* **Modèle de raisonnement :** activez cette option si le modèle servi prend en charge la réflexion
* **IDs de modèle :** cliquez sur **Charger les modèles**, ou saisissez les ID personnalisés manuellement

Après avoir cliqué sur **Ajouter la connexion**, les modèles que vous avez activés apparaîtront sous **Connexion** dans la liste déroulante des modèles.
{% endstep %}

{% step %}

#### Prêt à discuter

Après avoir enregistré la connexion, votre modèle vLLM apparaîtra sous **Connecté** dans la liste déroulante des modèles. Sélectionnez-le pour commencer à discuter via votre serveur vLLM.

<figure><img src="/files/8176f3b3cbdda16642ac8b5fdbcce5adbad3d1a0" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
Si votre serveur vLLM répond lentement (surtout pendant le chargement du modèle), vous pouvez ajuster le délai d’attente :

```bash
AIOHTTP_CLIENT_TIMEOUT_MODEL_LIST=30
```

{% endhint %}
{% endstep %}
{% endstepper %}

### Arguments vLLM courants

L’exemple ci-dessus utilise les paramètres de diffusion principaux. Vous pouvez ajouter d’autres arguments vllm serve selon votre modèle et votre matériel.

Les options courantes incluent :

```bash
vllm serve unsloth/gemma-4-26B-A4B-it \
  --dtype auto \
  --host 0.0.0.0 \
  --port 8000 \
  --api-key token-abc123 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.9
```

Pour la liste complète des arguments du serveur vLLM, consultez la documentation officielle du [serveur compatible OpenAI](https://docs.vllm.ai/en/stable/serving/openai_compatible_server/) vLLM.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/integrations/connections/vllm.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
