Comment utiliser Unsloth comme point de terminaison API
Vous pouvez exécuter des LLM locaux avec des outils comme Claude Code et Codex en connectant ces outils au point de terminaison d’API compatible OpenAI d’Unsloth. Cela vous permet d’exécuter des modèles comme Qwen et Gemma localement pour du codage agentique. Unsloth dispose aussi de fonctionnalités utiles telles que l’appel d’outils à auto-réparation appel d’outils, exécution de code, et recherche web.
Unsloth facilite le déploiement d’un point de terminaison d’inférence API rapide qui offre :
Appel d’outils à auto-réparation, ce qui aide à réduire de 50 % les appels d’outils cassés ou mal formés
Exécution de code prise en charge, permettant l’exécution de Bash et Python pour des sorties de code plus précises.
Avancé Recherche web qui visite et lit réellement les pages web pour recueillir des informations approfondies.
Paramètres d’inférence automatique pour les modèles GGUF (temp, top-k, etc.)
Les modèles chargés dans Unsloth (y compris les GGUF) sont exposés en tant qu’ API authentifiée via llama-server. Une clé API longue est générée pour des raisons de sécurité, comme celle fournie par OpenAI.
Vos modèles locaux peuvent ensuite être utilisés directement dans votre agent IA, SDK ou client de chat préféré. Unsloth parle deux dialectes sur le même port. Les deux prennent en charge le streaming, l’appel d’outils (OpenAI outils / Anthropic outils), et les entrées visuelles :

Que votre modèle s’exécute via l’inférence d’Unsloth ou via votre propre point de terminaison distant compatible OpenAI, vous pouvez lui donner accès à la suite complète d’outils d’Unsloth, notamment la recherche web, l’exécution de code, la recherche approfondie et plus encore.
Compatible avec Anthropic
/v1/messagespour Claude Code, OpenClaw, le SDK Anthropic et tout client qui attend l’API Messages.Compatible avec OpenAI
/v1/chat/completionset/v1/responsespour le SDK OpenAI, OpenCode, Cursor, Continue, Cline, Open WebUI, SillyTavern et tout outil compatible OpenAI.
⚡ Démarrage rapide
Télécharger Unsloth
La façon la plus simple de commencer est d’installer l’ application Unsloth Desktop Elle prend en charge MacOS, Linux, Windows, NVIDIA, AMD, Intel et les configurations CPU.
Ou, si vous préférez une installation manuelle :
MacOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows PowerShell :
irm https://unsloth.ai/install.ps1 | iexUnsloth est maintenant prêt
Pour commencer à discuter, tapez un message et appuyez sur Entrée.
Créez une clé API. Cliquez sur votre avatar Unsloth en bas à gauche → Paramètres → API → saisissez un nom de clé → Créer. Copiez la
sk-unsloth-…valeur qui s’affiche. Unsloth ne l’affiche qu’une seule fois.Pointez votre client vers Unsloth. Utilisez
http://localhost:PORTcomme URL de base et votresk-unsloth-…clé pour l’authentification. Accédez au guide correspondant à votre outil ci-dessous.

🔑 Création d’une clé API
Ouvrez la barre latérale, cliquez sur votre avatar Unsloth avatar en bas à gauche.
Allez à Paramètres → API (globe 🌐 icône).
Entrez un nom convivial (par ex.
claude-code-macbook). Définissez une expiration (facultatif)Cliquez sur Créer.
Copier la clé. Unsloth ne stocke qu’un hachage et vous ne pourrez plus la consulter.

Toutes les clés commencent par le préfixe sk-unsloth- . Révoquez une clé à tout moment depuis la même page. Les requêtes effectuées avec une clé révoquée échoueront avec 401 Unauthorized.
Traitez votre clé API comme un mot de passe. Toute personne disposant de la clé et d’un accès réseau à votre instance Unsloth peut envoyer des requêtes à votre modèle chargé.
⏳ Chargement du modèle
Commande d’exécution Unsloth
Installez ou mettez à jour Unsloth Studio. Les versions antérieures n’exposent pas l’API externe. Voir Installation.
Chargez un modèle GGUF. chargez un modèle GGUF à l’aide de la commande d’exécution. Cela chargera également l’interface sur le port par défaut. L’URL du point de terminaison et la clé API seront imprimées dans la console, prêtes à être utilisées avec le client de votre choix.
Ajustez les paramètres si nécessaire.
Chargement d’un modèle depuis la CLI
Vous pouvez charger un modèle et obtenir automatiquement une clé API grâce à l’outil CLI unsloth Lorsque le chargement du modèle est terminé, l’URL du point de terminaison et la clé API sont imprimées dans votre console. Copiez-les dans le client de votre choix et vous êtes prêt à commencer.
Avant de commencer
Assurez-vous d’utiliser une version récente d’Unsloth Studio, car les versions antérieures n’exposent pas l’API externe. Voir installation.
La méthode rapide
Ouvrez un terminal et chargez un modèle GGUF :
Cela démarre le serveur sur le port par défaut, charge l’interface et affiche l’URL du point de terminaison et votre clé API.
Comment fonctionne le nom du modèle
Vous pouvez viser un modèle de plusieurs façons. Choisissez celle qui vous semble la plus simple :
Ajuster l’exécution (facultatif)
Vous n’avez besoin de rien de tout cela pour un chargement de base, mais unsloth run prend en charge de nombreux indicateurs d’exécution de llama-server pour personnaliser les performances, l’utilisation de la mémoire, la longueur du contexte, le comportement de génération, le réseau et l’accès aux outils.
Les indicateurs supplémentaires sont transmis directement au serveur d’inférence sous-jacent, et vos valeurs remplacent les paramètres par défaut d’Unsloth.
Ajuster le comportement de génération
Les paramètres d’échantillonnage contrôlent à quel point le modèle est créatif, ciblé ou déterministe pendant la génération.
Des valeurs de température plus faibles produisent généralement des sorties plus stables, tandis que les paramètres top-p, top-k, min-p et pénalité de répétition contrôlent davantage la sélection des jetons et les répétitions.
Augmenter la longueur du contexte et les threads CPU
Utile si vous travaillez sur de grands projets, de longues discussions ou des workflows agentiques qui nécessitent plus de mémoire.
Exposer l’API sur votre réseau local
Par défaut, Unsloth ne s’exécute que localement sur votre machine. Vous pouvez exposer l’API à d’autres appareils sur votre réseau en vous liant à 0.0.0.0.
Contrôler le comportement de raisonnement
Certains modèles capables de raisonnement prennent en charge des indicateurs supplémentaires pour contrôler la réflexion et le raisonnement.
La prise en charge du raisonnement dépend du modèle et des capacités du backend.
Activer ou désactiver les outils côté serveur
Contrôlez si des outils tels que la recherche web et l’exécution de code sont exposés par le serveur d’inférence.
Unsloth prend en charge la plupart des indicateurs d’exécution de llama-server, y compris la taille du contexte, les couches GPU, le threading, l’échantillonnage, le réseau et la configuration des outils.
Voir la llama-server documentation pour la liste complète des indicateurs d’exécution pris en charge.
Politique des outils côté serveur
unsloth run contrôle si les outils côté serveur (recherche web, exécution de code, etc.) sont exposés par le serveur d’inférence. Les valeurs par défaut dépendent de l’adresse de liaison :
127.0.0.1(localhost) — outils activés par défaut. Seule votre machine peut atteindre le serveur.0.0.0.0ou toute adresse non loopback — outils désactivés par défaut. Une clé API divulguée sur un serveur exposé au réseau signifie une exécution de code arbitraire sur l’hôte.
Indicateurs :
--enable-tools/--disable-tools— forcer l’activation ou la désactivation. Activé0.0.0.0,--enable-toolsaffiche une invite de sécurité y/N.--yes/-y— ignorer l’invite (pour l’automatisation).
La politique résolue est une surcharge forte au niveau du processus — les requêtes individuelles ne peuvent pas la contourner via enable_tools=true dans le corps de la requête.

🌐 Points de terminaison
Unsloth expose ces points de terminaison sur le port sur lequel il a démarré (généralement http://localhost:8000 ou http://localhost:8888):
POST /v1/messages
API Messages d’Anthropic
Claude Code, SDK Anthropic, OpenClaw, tout ce qui parle Anthropic
POST /v1/chat/completions
API de complétions de chat OpenAI
SDK OpenAI, opencode, Cursor, Continue, Cline, Open WebUI, curl, etc.
GET /v1/models
liste des modèles OpenAI
Lister les modèles actuellement chargés dans Unsloth
Authentifiez-vous avec un Authorization: Bearer sk-unsloth-… dans chaque requête.
Vous n’avez pas besoin d’exécuter des serveurs différents pour les deux formats. Unsloth gère les deux sur le même port.
🖇️ Connexion de votre client
Unsloth vous permet d’exécuter des LLM locaux via la plupart des frameworks, notamment Claude Code, Codex, OpenClaw, OpenCode et plus encore. Cliquez sur les outils spécifiques ci-dessous pour un guide :
Pour accéder à ce point de terminaison depuis une autre machine, lancez avec unsloth studio --secure. Unsloth reste lié à localhost et se publie sur une URL HTTPS Cloudflare gratuite ; utilisez cette URL à la place de http://127.0.0.1:8888 comme URL de base de votre client. Notez que les événements envoyés par le serveur ne survivent pas à un tunnel rapide Cloudflare, donc définissez stream: false lors d’un appel via celui-ci.
🧰 Appel d’outils
Les deux points de terminaison prennent en charge l’appel de fonctions / d’outils dans leur format natif, ainsi qu’un raccourci spécifique à Unsloth pour les outils intégrés d’Unsloth.
Outils à la manière d’OpenAI : envoyez outils et tool_choice à /v1/chat/completions exactement comme vous le feriez avec OpenAI. Claude Code (via /v1/messages), opencode, Cursor, Continue et Cline fonctionnent tous immédiatement.
Outils à la manière d’Anthropic : envoyez outils (avec input_schema) et tool_choice à /v1/messages exactement comme vous le feriez avec Claude.
Outils côté serveur Unsloth : Unsloth peut exécuter Python, la recherche web et bash côté serveur et renvoyer les résultats sous forme de tool_result événements. Activez-les en ajoutant ces champs supplémentaires à l’un ou l’autre point de terminaison :
Le modèle voit la sortie de chaque outil à son tour suivant. Pour une couverture plus approfondie (schémas, événements de streaming, chaînage), voir .
Si vous utilisez le point de terminaison Anthropic /v1/messages de l’API, tool_choice le mappage est simple : Anthropic auto → OpenAI auto, Anthropic any → OpenAI required, Anthropic {type: "tool", name: "x"} → OpenAI {type: "function", function: {name: "x"}}, Anthropic none → OpenAI none.
📈 Moniteur API
Chaque appel effectué via ce point de terminaison est affiché en direct dans Studio, à deux endroits :
Le panneau latéral du moniteur API s’ouvre automatiquement dans le coin dès que du trafic de clé API arrive. Il récapitule le modèle actif, les requêtes en direct, les erreurs et la latence moyenne.

Appuyez sur "Développer en moniteur complet" ou allez à Paramètres>API Monitor pour naviguer vers la page complète API où le chargement du modèle, les invites, les réponses, les comptes de jetons, le temps jusqu’au premier jeton, le débit et les messages d’erreur sont affichés dans le moniteur.

❔ Dépannage
401 Unauthorized : soit le Authorization en-tête est manquant, soit la clé est incorrecte. Les clés doivent être transmises comme Authorization: Bearer sk-unsloth-…. Si vous avez perdu la clé, créez-en une nouvelle depuis Paramètres → API. Unsloth n’affiche pas les anciennes clés après leur création.
Connexion perdue avec le serveur du modèle : Unsloth n'a pas pu atteindre le serveur llama.cpp sous-jacent. En général, le modèle a fini de se charger mais a planté, ou l'onglet du modèle a été fermé dans Unsloth. Rechargez le modèle depuis Nouvelle discussion et réessayez.
Claude Code affiche le modèle Anthropic par défaut, pas mon modèle local : vérifiez que les trois variables d'environnement sont exportées dans le même shell où vous exécutez claude:
Ensuite, exécutez /model dans Claude Code pour confirmer. Sous Windows PowerShell, utilisez $env:ANTHROPIC_BASE_URL etc.
stream: true renvoie un seul bloc JSON au lieu de SSE : assurez-vous d'atteindre le bon chemin (/v1/messages ou /v1/chat/completions) et que votre client HTTP consomme réellement la réponse en flux, sans la mettre en tampon.
Je n'arrive pas à trouver le nom du modèle à ajouter à opencode (ou OpenClaw / tout autre client) : demandez directement à Unsloth. GET /v1/models renvoie l'ID exact du modèle que vous devez renseigner dans le champ « Model ID » du client :
Vous obtiendrez en retour une charge JSON de la forme {"data": [{"id": "gemma-4-26B-A4B-it-GGUF", ...}]}. Copiez la id valeur, c'est la chaîne que le ID du modèle champ (colonne de gauche) et le models[].id attendent. Le nom d'affichage à droite est celui que vous voulez que les utilisateurs voient.
Les appels d'outils ne sont pas exécutés : le modèle doit prendre en charge l'appel d'outils pour les outils côté client (outils / tool_choice). Pour les outils intégrés d'Unsloth, pensez à définir enable_tools: true et listez ceux que vous voulez dans enabled_tools (p. ex. ["python", "web_search"]).
Mon client signale une erreur de connexion. Ouvrez le moniteur API. S'il n'y a aucune ligne pour l'appel, cela signifie qu'il n'a jamais atteint Unsloth ; comparez l'URL de base de votre client avec la URL de base affichée en haut de cette page.
La réponse est tronquée. Vérifiez Contexte utilisé sur la requête dans le moniteur API. Près de 100 %, ou un motif d'arrêt de
longueur, signifie que la fenêtre de contexte s'est remplie plutôt que le modèle ait échoué.
Mis à jour
Ce contenu vous a-t-il été utile ?





