Connectez vLLM à Unsloth pour l’inférence de chat locale
Mis à jour
Ce contenu vous a-t-il été utile ?
Apprenez à connecter vLLM à Unsloth en utilisant l’ API compatible OpenAI afin que vous puissiez servir des modèles et discuter avec eux localement dans une interface de chat open source. Ce guide vous accompagne dans l’installation de vLLM, le lancement d’un serveur vLLM local, la configuration de l’URL de base de l’API, le chargement des ID de modèles disponibles et la sélection de votre modèle vLLM hébergé.
À la fin, vos modèles servis par vLLM apparaîtront aux côtés des modèles locaux, vous offrant un moyen rapide et flexible d’exécuter l’inférence LLM externe depuis une interface de chat.
Installez d’abord vLLM afin de pouvoir exécuter la commande vllm serve . Suivez le guide d’installation de vLLM officiel pour votre plateforme et votre matériel.
Après l’installation, vérifiez que vLLM fonctionne dans votre terminal : vllm --help
Ouvrez Paramètres → Connexions, puis cliquez sur Ajouter la connexion.
Sélectionnez vLLM, puis saisissez les détails de votre serveur.

Saisissez les détails de votre serveur vLLM :
Clé API : laissez vide sauf si vous avez lancé vLLM avec --api-key
URL de base : par exemple, http://localhost:8000/v1
Modèle de raisonnement : activez cette option si le modèle servi prend en charge la réflexion
IDs de modèle : cliquez sur Charger les modèles, ou saisissez les ID personnalisés manuellement
Après avoir cliqué sur Ajouter la connexion, les modèles que vous avez activés apparaîtront sous Connexion dans la liste déroulante des modèles.
Après avoir enregistré la connexion, votre modèle vLLM apparaîtra sous Connecté dans la liste déroulante des modèles. Sélectionnez-le pour commencer à discuter via votre serveur vLLM.

Si votre serveur vLLM répond lentement (surtout pendant le chargement du modèle), vous pouvez ajuster le délai d’attente :
AIOHTTP_CLIENT_TIMEOUT_MODEL_LIST=30L’exemple ci-dessus utilise les paramètres de diffusion principaux. Vous pouvez ajouter d’autres arguments vllm serve selon votre modèle et votre matériel.
Les options courantes incluent :
vllm serve unsloth/gemma-4-26B-A4B-it \
--dtype auto \
--host 0.0.0.0 \
--port 8000 \
--api-key token-abc123 \
--max-model-len 8192 \
--gpu-memory-utilization 0.9Pour la liste complète des arguments du serveur vLLM, consultez la documentation officielle du serveur compatible OpenAI vLLM.
Mis à jour
Ce contenu vous a-t-il été utile ?
Ce contenu vous a-t-il été utile ?

