For the complete documentation index, see llms.txt. This page is also available as Markdown.

Connecter llama.cpp à Unsloth : exécuter des GGUF avec llama-server

Llama.cpp est un moteur d’inférence open source pour exécuter efficacement des modèles GGUF sur du matériel local, et Unsloth facilite l’exécution de ces modèles directement dans une interface de chat UI open source. En démarrant un llama-server, vous pouvez diffuser un modèle GGUF depuis votre machine ou Hugging Face, le connecter à Unsloth et l’utiliser comme n’importe quel autre modèle de chat externe.

Ce guide explique comment installer llama.cpp, lancer llama-server, le connecter à Unsloth, activer votre modèle et configurer la mise en cache des prompts, la longueur du contexte, les clés API, FA et les modèles de chat.

Configuration

1

Installer llama.cpp

Installez d’abord llama.cpp afin de pouvoir exécuter la commande llama-server .

Utilisez l’une des options d’installation officielles :

Après l’installation, vérifiez que llama-server fonctionne dans votre terminal :

llama-server --help

2

Choisir un modèle GGUF

llama-server peut charger un fichier .gguf local ou télécharger un modèle GGUF depuis Hugging Face.

Pour diffuser directement un dépôt GGUF Hugging Face, utilisez le dépôt et le nom de quantification :

llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL

Si vous souhaitez charger un modèle local, vous pouvez aussi suivre les étapes ci-dessous.

Commencez llama-server avec le modèle que vous souhaitez diffuser :

Cela expose un point de terminaison API à : http://localhost:8080/v1

Pour exiger une clé API, ajoutez :

3

Connecter Llama.cpp à Unsloth

Ouvrez Paramètres → Connexions, puis cliquez sur Ajouter une connexion. Sélectionnez llama.cpp, puis saisissez les détails de votre serveur :

si vous n’avez pas démarré llama-server avec --api-key, laissez le champ de clé API vide. Saisissez l’URL de base de votre serveur, par exemple http://localhost:8080/v1 Cliquez sur Charger les modèles pour récupérer les identifiants de modèles disponibles, ou saisissez les identifiants de modèles manuellement si votre serveur n’expose pas /models.

Ensuite, après avoir cliqué sur Ajouter une connexion, Les modèles que vous avez activés apparaîtront désormais sous Connecté dans la liste déroulante Sélectionner le modèle .

4

Prêt à discuter

Après avoir enregistré la connexion, votre modèle llama.cpp apparaîtra sous Connexion dans la liste déroulante des modèles. Sélectionnez-le pour commencer à discuter via votr llama-server.

Mise en cache des prompts

La mise en cache des prompts réduit la latence et le coût lorsque les requêtes réutilisent le même long préfixe. Utilisez le paramètre Mise en cache des prompts dans le panneau latéral d’Unsloth pour contrôler le comportement de mise en cache pour les connexions prises en charge.

Avec llama.cpp, la mise en cache des prompts est activée par défaut et peut être désactivée au démarrage llama-server avec :

Arguments courants de llama-server

L’exemple ci-dessus n’utilise que les paramètres de connexion requis. Vous pouvez ajouter d’autres arguments llama-server en fonction de votre modèle et de votre matériel.

Les options courantes incluent :

Pour la liste complète des arguments du serveur, consultez le README du serveur llama.cpp officiel.

Mis à jour

Ce contenu vous a-t-il été utile ?