For the complete documentation index, see llms.txt. This page is also available as Markdown.

Comment utiliser Unsloth comme point de terminaison API

Vous pouvez exécuter des LLM locaux avec des outils comme Claude Code et Codex en connectant ces outils au point de terminaison d’API compatible OpenAI d’Unsloth. Cela vous permet d’exécuter des modèles comme Qwen et Gemma localement pour du codage agentique. Unsloth dispose aussi de fonctionnalités utiles telles que l’appel d’outils à auto-réparation appel d’outils, exécution de code, et recherche web.

Unsloth facilite le déploiement d’un point de terminaison d’inférence API rapide qui offre :

Les modèles chargés dans Unsloth (y compris les GGUF) sont exposés en tant qu’ API authentifiée via llama-server. Une clé API longue est générée pour des raisons de sécurité, comme celle fournie par OpenAI.

Vos modèles locaux peuvent ensuite être utilisés directement dans votre agent IA, SDK ou client de chat préféré. Unsloth parle deux dialectes sur le même port. Les deux prennent en charge le streaming, l’appel d’outils (OpenAI outils / Anthropic outils), et les entrées visuelles :

Que votre modèle s’exécute via l’inférence d’Unsloth ou via votre propre point de terminaison distant compatible OpenAI, vous pouvez lui donner accès à la suite complète d’outils d’Unsloth, notamment la recherche web, l’exécution de code, la recherche approfondie et plus encore.

  • Compatible avec Anthropic /v1/messages pour Claude Code, OpenClaw, le SDK Anthropic et tout client qui attend l’API Messages.

  • Compatible avec OpenAI /v1/chat/completions et /v1/responses pour le SDK OpenAI, OpenCode, Cursor, Continue, Cline, Open WebUI, SillyTavern et tout outil compatible OpenAI.

⚡ Démarrage rapide

1

Télécharger Unsloth

La façon la plus simple de commencer est d’installer l’ application Unsloth Desktop Elle prend en charge MacOS, Linux, Windows, NVIDIA, AMD, Intel et les configurations CPU.

Télécharger Unsloth

Ou, si vous préférez une installation manuelle :

MacOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell :

irm https://unsloth.ai/install.ps1 | iex
2

Installer

  1. Ouvrez le programme d’installation Unsloth (.dmg, .exe fichiers)

  2. Faites glisser Unsloth vers Applications sur Mac ou terminez la configuration pour Windows.

  3. Lancez l’application et attendez la fin de l’installation

3

Choisissez un modèle

Ouvrez le menu déroulant 'Select model' en haut ou l’onglet 'Model hub', choisissez un modèle et une quantification adaptée à votre appareil, puis téléchargez-le. Une fois terminé, commencez à discuter - aucune configuration requise.

4

Unsloth est maintenant prêt

Pour commencer à discuter, tapez un message et appuyez sur Entrée.

  • Créez une clé API. Cliquez sur votre avatar Unsloth en bas à gauche → ParamètresAPI → saisissez un nom de clé → Créer. Copiez la sk-unsloth-… valeur qui s’affiche. Unsloth ne l’affiche qu’une seule fois.

  • Pointez votre client vers Unsloth. Utilisez http://localhost:PORT comme URL de base et votre sk-unsloth-… clé pour l’authentification. Accédez au guide correspondant à votre outil ci-dessous.

🔑 Création d’une clé API

  1. Ouvrez la barre latérale, cliquez sur votre avatar Unsloth avatar en bas à gauche.

  2. Allez à ParamètresAPI (globe 🌐 icône).

  3. Entrez un nom convivial (par ex. claude-code-macbook). Définissez une expiration (facultatif)

  4. Cliquez sur Créer.

  5. Copier la clé. Unsloth ne stocke qu’un hachage et vous ne pourrez plus la consulter.

Toutes les clés commencent par le préfixe sk-unsloth- . Révoquez une clé à tout moment depuis la même page. Les requêtes effectuées avec une clé révoquée échoueront avec 401 Unauthorized.

⏳ Chargement du modèle

1

Sélectionner un modèle

Avant d’utiliser l’API, chargez un modèle depuis le Select model menu déroulant dans le coin supérieur gauche de la page Chat.

Dans ce guide, nous utiliserons :

unsloth/gemma-4-26B-A4B-it-GGUF avec la quantification recommandée UD-Q4_K_XL .

2

Tester le modèle

Avant d’utiliser le client, envoyez un court message :

Cela confirme que le modèle a été chargé correctement et qu’il est prêt à répondre.

3

Clé API Unsloth

Dans Unsloth, ouvrez Paramètres → API pour afficher ou créer votre clé API.

Traitez votre clé API comme un mot de passe et évitez de l’exposer dans des captures d’écran ou des dépôts.

Commande d’exécution Unsloth

  1. Installez ou mettez à jour Unsloth Studio. Les versions antérieures n’exposent pas l’API externe. Voir Installation.

  2. Chargez un modèle GGUF. chargez un modèle GGUF à l’aide de la commande d’exécution. Cela chargera également l’interface sur le port par défaut. L’URL du point de terminaison et la clé API seront imprimées dans la console, prêtes à être utilisées avec le client de votre choix.

Ajustez les paramètres si nécessaire.

Chargement d’un modèle depuis la CLI

Vous pouvez charger un modèle et obtenir automatiquement une clé API grâce à l’outil CLI unsloth Lorsque le chargement du modèle est terminé, l’URL du point de terminaison et la clé API sont imprimées dans votre console. Copiez-les dans le client de votre choix et vous êtes prêt à commencer.

Avant de commencer

Assurez-vous d’utiliser une version récente d’Unsloth Studio, car les versions antérieures n’exposent pas l’API externe. Voir installation.

La méthode rapide

Ouvrez un terminal et chargez un modèle GGUF :

Cela démarre le serveur sur le port par défaut, charge l’interface et affiche l’URL du point de terminaison et votre clé API.

Comment fonctionne le nom du modèle

Vous pouvez viser un modèle de plusieurs façons. Choisissez celle qui vous semble la plus simple :

Ajuster l’exécution (facultatif)

Vous n’avez besoin de rien de tout cela pour un chargement de base, mais unsloth run prend en charge de nombreux indicateurs d’exécution de llama-server pour personnaliser les performances, l’utilisation de la mémoire, la longueur du contexte, le comportement de génération, le réseau et l’accès aux outils.

Les indicateurs supplémentaires sont transmis directement au serveur d’inférence sous-jacent, et vos valeurs remplacent les paramètres par défaut d’Unsloth.

Ajuster le comportement de génération

Les paramètres d’échantillonnage contrôlent à quel point le modèle est créatif, ciblé ou déterministe pendant la génération.

Des valeurs de température plus faibles produisent généralement des sorties plus stables, tandis que les paramètres top-p, top-k, min-p et pénalité de répétition contrôlent davantage la sélection des jetons et les répétitions.

Augmenter la longueur du contexte et les threads CPU

Utile si vous travaillez sur de grands projets, de longues discussions ou des workflows agentiques qui nécessitent plus de mémoire.

Exposer l’API sur votre réseau local

Par défaut, Unsloth ne s’exécute que localement sur votre machine. Vous pouvez exposer l’API à d’autres appareils sur votre réseau en vous liant à 0.0.0.0.

Contrôler le comportement de raisonnement

Certains modèles capables de raisonnement prennent en charge des indicateurs supplémentaires pour contrôler la réflexion et le raisonnement.

La prise en charge du raisonnement dépend du modèle et des capacités du backend.

Activer ou désactiver les outils côté serveur

Contrôlez si des outils tels que la recherche web et l’exécution de code sont exposés par le serveur d’inférence.

Unsloth prend en charge la plupart des indicateurs d’exécution de llama-server, y compris la taille du contexte, les couches GPU, le threading, l’échantillonnage, le réseau et la configuration des outils.

Voir la llama-server documentation pour la liste complète des indicateurs d’exécution pris en charge.

Politique des outils côté serveur

unsloth run contrôle si les outils côté serveur (recherche web, exécution de code, etc.) sont exposés par le serveur d’inférence. Les valeurs par défaut dépendent de l’adresse de liaison :

  • 127.0.0.1 (localhost) — outils activés par défaut. Seule votre machine peut atteindre le serveur.

  • 0.0.0.0 ou toute adresse non loopback — outils désactivés par défaut. Une clé API divulguée sur un serveur exposé au réseau signifie une exécution de code arbitraire sur l’hôte.

Indicateurs :

  • --enable-tools / --disable-tools — forcer l’activation ou la désactivation. Activé 0.0.0.0, --enable-tools affiche une invite de sécurité y/N.

  • --yes / -y — ignorer l’invite (pour l’automatisation).

La politique résolue est une surcharge forte au niveau du processus — les requêtes individuelles ne peuvent pas la contourner via enable_tools=true dans le corps de la requête.

🌐 Points de terminaison

Unsloth expose ces points de terminaison sur le port sur lequel il a démarré (généralement http://localhost:8000 ou http://localhost:8888):

Point de terminaison
Compatible avec
À utiliser depuis

POST /v1/messages

API Messages d’Anthropic

Claude Code, SDK Anthropic, OpenClaw, tout ce qui parle Anthropic

POST /v1/chat/completions

API de complétions de chat OpenAI

SDK OpenAI, opencode, Cursor, Continue, Cline, Open WebUI, curl, etc.

GET /v1/models

liste des modèles OpenAI

Lister les modèles actuellement chargés dans Unsloth

Authentifiez-vous avec un Authorization: Bearer sk-unsloth-… dans chaque requête.

Vous n’avez pas besoin d’exécuter des serveurs différents pour les deux formats. Unsloth gère les deux sur le même port.

🖇️ Connexion de votre client

Unsloth vous permet d’exécuter des LLM locaux via la plupart des frameworks, notamment Claude Code, Codex, OpenClaw, OpenCode et plus encore. Cliquez sur les outils spécifiques ci-dessous pour un guide :

Pour accéder à ce point de terminaison depuis une autre machine, lancez avec unsloth studio --secure. Unsloth reste lié à localhost et se publie sur une URL HTTPS Cloudflare gratuite ; utilisez cette URL à la place de http://127.0.0.1:8888 comme URL de base de votre client. Notez que les événements envoyés par le serveur ne survivent pas à un tunnel rapide Cloudflare, donc définissez stream: false lors d’un appel via celui-ci.

🧰 Appel d’outils

Les deux points de terminaison prennent en charge l’appel de fonctions / d’outils dans leur format natif, ainsi qu’un raccourci spécifique à Unsloth pour les outils intégrés d’Unsloth.

Outils à la manière d’OpenAI : envoyez outils et tool_choice à /v1/chat/completions exactement comme vous le feriez avec OpenAI. Claude Code (via /v1/messages), opencode, Cursor, Continue et Cline fonctionnent tous immédiatement.

Outils à la manière d’Anthropic : envoyez outils (avec input_schema) et tool_choice à /v1/messages exactement comme vous le feriez avec Claude.

Outils côté serveur Unsloth : Unsloth peut exécuter Python, la recherche web et bash côté serveur et renvoyer les résultats sous forme de tool_result événements. Activez-les en ajoutant ces champs supplémentaires à l’un ou l’autre point de terminaison :

Le modèle voit la sortie de chaque outil à son tour suivant. Pour une couverture plus approfondie (schémas, événements de streaming, chaînage), voir .

Si vous utilisez le point de terminaison Anthropic /v1/messages de l’API, tool_choice le mappage est simple : Anthropic auto → OpenAI auto, Anthropic any → OpenAI required, Anthropic {type: "tool", name: "x"} → OpenAI {type: "function", function: {name: "x"}}, Anthropic none → OpenAI none.

📈 Moniteur API

Chaque appel effectué via ce point de terminaison est affiché en direct dans Studio, à deux endroits :

Le panneau latéral du moniteur API s’ouvre automatiquement dans le coin dès que du trafic de clé API arrive. Il récapitule le modèle actif, les requêtes en direct, les erreurs et la latence moyenne.

Appuyez sur "Développer en moniteur complet" ou allez à Paramètres>API Monitor pour naviguer vers la page complète API où le chargement du modèle, les invites, les réponses, les comptes de jetons, le temps jusqu’au premier jeton, le débit et les messages d’erreur sont affichés dans le moniteur.

❔ Dépannage

401 Unauthorized : soit le Authorization en-tête est manquant, soit la clé est incorrecte. Les clés doivent être transmises comme Authorization: Bearer sk-unsloth-…. Si vous avez perdu la clé, créez-en une nouvelle depuis Paramètres → API. Unsloth n’affiche pas les anciennes clés après leur création.

Connexion perdue avec le serveur du modèle : Unsloth n'a pas pu atteindre le serveur llama.cpp sous-jacent. En général, le modèle a fini de se charger mais a planté, ou l'onglet du modèle a été fermé dans Unsloth. Rechargez le modèle depuis Nouvelle discussion et réessayez.

Claude Code affiche le modèle Anthropic par défaut, pas mon modèle local : vérifiez que les trois variables d'environnement sont exportées dans le même shell où vous exécutez claude:

Ensuite, exécutez /model dans Claude Code pour confirmer. Sous Windows PowerShell, utilisez $env:ANTHROPIC_BASE_URL etc.

stream: true renvoie un seul bloc JSON au lieu de SSE : assurez-vous d'atteindre le bon chemin (/v1/messages ou /v1/chat/completions) et que votre client HTTP consomme réellement la réponse en flux, sans la mettre en tampon.

Je n'arrive pas à trouver le nom du modèle à ajouter à opencode (ou OpenClaw / tout autre client) : demandez directement à Unsloth. GET /v1/models renvoie l'ID exact du modèle que vous devez renseigner dans le champ « Model ID » du client :

Vous obtiendrez en retour une charge JSON de la forme {"data": [{"id": "gemma-4-26B-A4B-it-GGUF", ...}]}. Copiez la id valeur, c'est la chaîne que le ID du modèle champ (colonne de gauche) et le models[].id attendent. Le nom d'affichage à droite est celui que vous voulez que les utilisateurs voient.

Les appels d'outils ne sont pas exécutés : le modèle doit prendre en charge l'appel d'outils pour les outils côté client (outils / tool_choice). Pour les outils intégrés d'Unsloth, pensez à définir enable_tools: true et listez ceux que vous voulez dans enabled_tools (p. ex. ["python", "web_search"]).

  • Mon client signale une erreur de connexion. Ouvrez le moniteur API. S'il n'y a aucune ligne pour l'appel, cela signifie qu'il n'a jamais atteint Unsloth ; comparez l'URL de base de votre client avec la URL de base affichée en haut de cette page.

  • La réponse est tronquée. Vérifiez Contexte utilisé sur la requête dans le moniteur API. Près de 100 %, ou un motif d'arrêt de longueur, signifie que la fenêtre de contexte s'est remplie plutôt que le modèle ait échoué.

Mis à jour

Ce contenu vous a-t-il été utile ?