For the complete documentation index, see llms.txt. This page is also available as Markdown.

Connectez des fournisseurs d’API et des serveurs de modèles à Unsloth

Découvrez comment exécuter des modèles d’OpenAI, Anthropic, Ollama, llama.cpp, vLLM et d’autres fournisseurs via une seule interface utilisateur locale avec Unsloth, un dépôt open source pour exécuter et entraîner des LLM. Vous pouvez également connecter votre abonnement ChatGPT/Codex directement à Unsloth.

Que votre modèle s’exécute via l’inférence d’Unsloth ou via votre propre point de terminaison distant compatible OpenAI, vous pouvez lui donner accès à toute la suite d’outils d’Unsloth, notamment la recherche web, l’exécution de code, la recherche approfondie, et bien plus encore.

Une fois connecté, vous pouvez exécuter des modèles avec exécution de code, appel d’outils, génération d’images et d’autres fonctionnalités dans la même interface de chat Unsloth utilisée à la fois pour les modèles locaux et cloud.

Unsloth prend en charge de manière unique la mise en cache des prompts (pour vous faire économiser de nombreux tokens sans dégradation de la précision) tout en conservant l’accès aux capacités natives du fournisseur, telles que la fonction intégrée d’OpenAI recherche web et exécution de code.

Connexions

Les connexions se répartissent en deux groupes : les fournisseurs d’API hébergées qui exécutent des modèles pour vous, et les serveurs de modèles que vous exécutez ou contrôlez.

Fournisseurs cloud - API hébergées qui utilisent une clé API de compte :

Connexion
Fonctionnalités
Guide d’installation

ChatGPT / Codex

Image, recherche, code, réflexion

OpenAI

Image, recherche, code, réflexion

Anthropic

Image, recherche, code, réflexion

OpenRouter

De nombreux modèles hébergés via une seule clé API.

Serveurs de modèles - Serveurs d’inférence s’exécutant localement, sur votre réseau ou sur votre machine distante :

Serveur
Description
Guide

Llama.cpp

Service efficace de modèles GGUF

vLLM

Service à haut débit

Ollama

Serveur de modèles local simple

Démarrage rapide

Pour exécuter le modèle d’un fournisseur externe, ajoutez une clé API et sélectionnez les modèles qu’Unsloth doit afficher. Dans cet exemple, nous utiliserons OpenAI. La même configuration fonctionne pour Anthropic et d’autres fournisseurs.

1

Configurer Unsloth

Le moyen le plus simple de commencer est d’installer l’application Unsloth Desktop . Elle prend en charge macOS, Linux, Windows, NVIDIA, AMD, les configurations Intel et CPU.

Télécharger Unsloth

Ou, si vous préférez l’installation manuelle :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell :

irm https://unsloth.ai/install.ps1 | iex

Voir ici pour des instructions plus détaillées

2

Créer une API

Créez une nouvelle clé API depuis le tableau de bord du fournisseur et copiez-la.

3

Configurer Unsloth

Nous devons maintenant installer et configurer Unsloth, ce qui vous permettra d’exécuter les modèles cloud dans une interface utilisateur. Voir ici pour des instructions plus détaillées.

4

Configurer les connexions

Ensuite, connectez votre fournisseur à Unsloth.

  1. Ouvrez ParamètresConnexions, puis cliquez sur Ajouter une connexion.

  2. Sélectionnez le fournisseur que vous souhaitez ajouter, puis collez la clé API que vous avez copiée précédemment.

  3. Cliquez sur Recharger les modèles pour actualiser la liste avec les modèles disponibles pour votre compte.

  4. Choisissez les modèles que vous souhaitez activer, puis cliquez sur enregistrer.

5

Prêt à discuter

Les modèles que vous avez activés apparaîtront maintenant sous Connecté dans le menu déroulant Sélectionner un modèle .

Unsloth expose dynamiquement les niveaux de raisonnement compatibles et les contrôles de génération pour différents modèles.

Connecter un serveur de modèles

Utilisez ce flux pour llama.cpp, vLLM, et Ollama. Démarrez ou localisez le serveur que vous souhaitez connecter.

Démarrer llama-server avec le modèle que vous souhaitez servir :

Cela expose un point de terminaison API à : http://localhost:8080/v1

Pour exiger une clé API, ajoutez :

Démarrez le vLLM serveur avec le modèle que vous souhaitez servir :

Pour exiger une clé API, ajoutez :

Cela expose un point de terminaison API à : http://localhost:8000/v1

Démarrer Ollama, puis récupérez le modèle que vous souhaitez utiliser :

Cela expose un point de terminaison API à : http://localhost:11434/v1

Nous pouvons maintenant connecter le serveur de modèles. Ouvrez Paramètres → Connexions, puis cliquez sur Ajouter un fournisseur.

Sélectionnez llama.cpp, vLLM ou Ollama, puis collez le serveur URL de base.

  • Exemple llama.cpp : http://localhost:8080/v1

  • Exemple Ollama : http://localhost:11434/v1

Cliquez sur Charger les modèles pour récupérer les identifiants des modèles disponibles, ou saisissez-les manuellement si votre serveur n’expose pas /models.

Ensuite, après avoir cliqué sur Ajouter un fournisseur, Les modèles que vous avez activés apparaîtront maintenant sous Externe dans le menu déroulant Sélectionner un modèle .

Exécution de code

Lorsqu’elle est activée, les modèles OpenAI et Anthropic pris en charge peuvent exécuter du code dans un bac à sable du fournisseur pour résoudre des problèmes, analyser des données et travailler avec des fichiers.\n\nLes modèles Anthropic utilisent l’outil d’exécution de code côté fournisseur de Claude. OpenAI utilise des conteneurs réutilisables, que vous pouvez créer, supprimer et sélectionner dans Exécution de code les paramètres. Sélectionnez le même conteneur dans un nouveau fil pour continuer avec ses fichiers et son état.

Mise en cache des prompts

La mise en cache des prompts réduit la latence et le coût lorsque les requêtes réutilisent le même long préfixe. Elle est prise en charge par les fournisseurs et serveurs compatibles, notamment OpenAI, Anthropic et llama.cpp. Utilisez le paramètre de mise en cache des prompts dans le panneau latéral pour contrôler le comportement du cache pour les connexions prises en charge.

Pour llama.cpp, la mise en cache des prompts est activée par défaut et peut être désactivée au démarrage llama-server avec :

Recherche web et réflexion

La recherche web côté fournisseur est disponible pour les modèles pris en charge d’OpenAI, Anthropic, OpenRouter, Mistral, Gemini et Kimi. Le contrôle Think s’adapte au modèle sélectionné : certains modèles utilisent un interrupteur marche/arrêt, tandis que les modèles à effort de raisonnement utilisent des niveaux de réflexion spécifiques au modèle.

Génération d’images

Tout comme GPT et Gemini, Unsloth prend également en charge la génération d’images. Vous pouvez modifier directement une image en cliquant sur le bouton « Modifier l’image » et en saisissant un nouveau prompt pour l’affiner ou la régénérer. Les images sont générées automatiquement lorsqu’elles sont demandées, mais vous pouvez désactiver ce comportement. Un bouton de téléchargement est également disponible, vous permettant d’enregistrer l’image dans sa résolution d’origine complète.

Dépannage

Si un fournisseur ne parvient pas à se connecter, vérifiez que la clé API appartient au fournisseur sélectionné et qu’elle a accès au modèle que vous avez choisi.

Si un modèle n’apparaît pas après avoir cliqué sur Recharger les modèles, il se peut qu’il ne soit pas disponible pour votre compte. Vous pouvez toujours utiliser la liste de modèles par défaut d’Unsloth ou choisir un autre modèle.

Mis à jour

Ce contenu vous a-t-il été utile ?