Connecter llama.cpp à Unsloth : exécuter des GGUF avec llama-server
Llama.cpp est un moteur d’inférence open source pour exécuter efficacement des modèles GGUF sur du matériel local, et Unsloth facilite l’exécution de ces modèles directement dans une interface de chat UI open source. En démarrant un llama-server, vous pouvez diffuser un modèle GGUF depuis votre machine ou Hugging Face, le connecter à Unsloth et l’utiliser comme n’importe quel autre modèle de chat externe.
Ce guide explique comment installer llama.cpp, lancer llama-server, le connecter à Unsloth, activer votre modèle et configurer la mise en cache des prompts, la longueur du contexte, les clés API, FA et les modèles de chat.

Configuration
Installer llama.cpp
Installez d’abord llama.cpp afin de pouvoir exécuter la commande llama-server .
Utilisez l’une des options d’installation officielles :
Télécharger un binaire llama.cpp
Compiler llama.cpp à partir du code source
Après l’installation, vérifiez que llama-server fonctionne dans votre terminal :
llama-server --help
Choisir un modèle GGUF
llama-server peut charger un fichier .gguf local ou télécharger un modèle GGUF depuis Hugging Face.
Pour diffuser directement un dépôt GGUF Hugging Face, utilisez le dépôt et le nom de quantification :
llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL
Si vous souhaitez charger un modèle local, vous pouvez aussi suivre les étapes ci-dessous.
Commencez llama-server avec le modèle que vous souhaitez diffuser :
Cela expose un point de terminaison API à : http://localhost:8080/v1
Pour exiger une clé API, ajoutez :
Connecter Llama.cpp à Unsloth
Ouvrez Paramètres → Connexions, puis cliquez sur Ajouter une connexion. Sélectionnez llama.cpp, puis saisissez les détails de votre serveur :

si vous n’avez pas démarré llama-server avec --api-key, laissez le champ de clé API vide. Saisissez l’URL de base de votre serveur, par exemple http://localhost:8080/v1
Cliquez sur Charger les modèles pour récupérer les identifiants de modèles disponibles, ou saisissez les identifiants de modèles manuellement si votre serveur n’expose pas /models.

Ensuite, après avoir cliqué sur Ajouter une connexion, Les modèles que vous avez activés apparaîtront désormais sous Connecté dans la liste déroulante Sélectionner le modèle .
Mise en cache des prompts
La mise en cache des prompts réduit la latence et le coût lorsque les requêtes réutilisent le même long préfixe. Utilisez le paramètre Mise en cache des prompts dans le panneau latéral d’Unsloth pour contrôler le comportement de mise en cache pour les connexions prises en charge.

Avec llama.cpp, la mise en cache des prompts est activée par défaut et peut être désactivée au démarrage
llama-server avec :
Arguments courants de llama-server
L’exemple ci-dessus n’utilise que les paramètres de connexion requis. Vous pouvez ajouter d’autres arguments llama-server en fonction de votre modèle et de votre matériel.
Les options courantes incluent :
Pour la liste complète des arguments du serveur, consultez le README du serveur llama.cpp officiel.
Mis à jour
Ce contenu vous a-t-il été utile ?

