For the complete documentation index, see llms.txt. This page is also available as Markdown.

Connectez vLLM à Unsloth pour l’inférence de chat locale

Apprenez à connecter vLLM à Unsloth en utilisant l’ API compatible OpenAI afin que vous puissiez servir des modèles et discuter avec eux localement dans une interface de chat open source. Ce guide vous accompagne dans l’installation de vLLM, le lancement d’un serveur vLLM local, la configuration de l’URL de base de l’API, le chargement des ID de modèles disponibles et la sélection de votre modèle vLLM hébergé.

À la fin, vos modèles servis par vLLM apparaîtront aux côtés des modèles locaux, vous offrant un moyen rapide et flexible d’exécuter l’inférence LLM externe depuis une interface de chat.

Configuration

1

Installer vLLM

Installez d’abord vLLM afin de pouvoir exécuter la commande vllm serve . Suivez le guide d’installation de vLLM officiel pour votre plateforme et votre matériel.

Après l’installation, vérifiez que vLLM fonctionne dans votre terminal : vllm --help

2

Choisir un modèle

vLLM sert des modèles depuis Hugging Face.

Par exemple, démarrez un serveur vLLM avec un modèle Unsloth :

vllm serve unsloth/gemma-4-26B-A4B-it 
\ --dtype auto

Cela expose un point de terminaison d’API à :

http://localhost:8000/v1

Pour exiger une clé API, ajoutez :

--api-key token-abc123
3

Connecter vLLM à Unsloth

Ouvrez Paramètres → Connexions, puis cliquez sur Ajouter la connexion.

Sélectionnez vLLM, puis saisissez les détails de votre serveur.

Saisissez les détails de votre serveur vLLM :

  • Clé API : laissez vide sauf si vous avez lancé vLLM avec --api-key

  • URL de base : par exemple, http://localhost:8000/v1

  • Modèle de raisonnement : activez cette option si le modèle servi prend en charge la réflexion

  • IDs de modèle : cliquez sur Charger les modèles, ou saisissez les ID personnalisés manuellement

Après avoir cliqué sur Ajouter la connexion, les modèles que vous avez activés apparaîtront sous Connexion dans la liste déroulante des modèles.

4

Prêt à discuter

Après avoir enregistré la connexion, votre modèle vLLM apparaîtra sous Connecté dans la liste déroulante des modèles. Sélectionnez-le pour commencer à discuter via votre serveur vLLM.

Si votre serveur vLLM répond lentement (surtout pendant le chargement du modèle), vous pouvez ajuster le délai d’attente :

AIOHTTP_CLIENT_TIMEOUT_MODEL_LIST=30

Arguments vLLM courants

L’exemple ci-dessus utilise les paramètres de diffusion principaux. Vous pouvez ajouter d’autres arguments vllm serve selon votre modèle et votre matériel.

Les options courantes incluent :

vllm serve unsloth/gemma-4-26B-A4B-it \
  --dtype auto \
  --host 0.0.0.0 \
  --port 8000 \
  --api-key token-abc123 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.9

Pour la liste complète des arguments du serveur vLLM, consultez la documentation officielle du serveur compatible OpenAI vLLM.

Mis à jour

Ce contenu vous a-t-il été utile ?