For the complete documentation index, see llms.txt. This page is also available as Markdown.
Guide d'appel d'outils pour les LLM locaux
L’appel d’outils, c’est lorsqu’un LLM est autorisé à déclencher des fonctions spécifiques (comme « rechercher dans mes fichiers », « lancer une calculatrice » ou « appeler une API ») en émettant une requête structurée plutôt qu’en devinant la réponse en texte. Vous utilisez les appels d’outils parce qu’ils rendent les sorties plus fiables et à jour, et ils permettent au modèle d’effectuer de vraies actions (interroger des systèmes, valider des faits, appliquer des schémas) plutôt que d’halluciner.
Dans ce tutoriel, vous apprendrez à utiliser des LLM locaux via l’appel d’outils avec des exemples d’opérations mathématiques, de récit, de code Python et de fonctions terminal. L’inférence est effectuée localement via llama.cpp, llama-server et des points de terminaison OpenAI.
L’appel d’outils est automatiquement configuré lorsque vous utilisez Unsloth Studio. Sélectionnez simplement votre modèle et activez ou désactivez l’appel d’outils.
Voir à droite un exemple d’appel d’outils appliqué automatiquement pour Gemma 4. Unsloth propose également un appel d’outils auto-réparateur, garantissant que vous disposez toujours d’appels d’outils fonctionnels.
Notre première étape consiste à obtenir la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Dans un nouveau terminal (si vous utilisez tmux, utilisez CTRL+B+D), nous créons quelques outils comme l’ajout de 2 nombres, l’exécution de code Python, l’exécution de fonctions Linux et bien plus encore :
Nous utilisons ensuite les fonctions ci-dessous (copiez-collez puis exécutez) qui analyseront automatiquement les appels de fonction et appelleront l'endpoint OpenAI pour n'importe quel modèle :
Dans cet exemple, nous utilisons Devstral 2 ; lorsque vous changez de modèle, assurez-vous d’utiliser les bons paramètres d’échantillonnage. Vous pouvez tous les consulter dans nos guides ici.
Nous allons maintenant présenter ci-dessous plusieurs méthodes d’exécution de l’appel d’outils pour de nombreux cas d’utilisation différents :
Écrire une histoire :
Opérations mathématiques :
Exécuter le code Python généré
Exécuter des fonctions de terminal arbitraires
🌠 Appel d’outils Qwen3-Coder-Next
Dans un nouveau terminal, nous créons quelques outils comme l’ajout de 2 nombres, l’exécution de code Python, l’exécution de fonctions Linux et bien plus encore :
Nous utilisons ensuite les fonctions ci-dessous, qui analyseront automatiquement les appels de fonctions et appelleront le point de terminaison OpenAI pour n’importe quel LLM :
Nous allons maintenant présenter ci-dessous plusieurs méthodes d’exécution de l’appel d’outils pour de nombreux cas d’utilisation différents :
Exécuter le code Python généré
Exécuter des fonctions de terminal arbitraires
Nous confirmons que le fichier a été créé, et c’est bien le cas !
⚡ GLM-4.7-Flash + appel GLM 4.7
Nous téléchargeons d’abord GLM-4.7 ou GLM-4.7-Flash via du code Python, puis nous le lançons via llama-server dans un terminal séparé (comme avec tmux). Dans cet exemple, nous téléchargeons le grand modèle GLM-4.7 :
Si vous l’avez exécuté avec succès, vous devriez voir :
Lancez-le maintenant via llama-server dans un nouveau terminal. Utilisez tmux si vous le souhaitez :
Et vous obtiendrez :
Maintenant, dans un nouveau terminal et en exécutant du code Python, rappel de lancer Tool Calling Guide Nous utilisons les paramètres optimaux de GLM 4.7, à savoir temperature = 0.7 et top_p = 1.0
Appel d'outil pour les opérations mathématiques avec GLM 4.7
Appel d'outil pour exécuter du code Python généré pour GLM 4.7
📙 Appel d’outils Devstral 2
Nous téléchargeons d’abord Devstral 2 via du code Python, puis nous le lançons via llama-server dans un terminal séparé (comme avec tmux) :
Si vous l’avez exécuté avec succès, vous devriez voir :
Lancez-le maintenant via llama-server dans un nouveau terminal. Utilisez tmux si vous le souhaitez :
Vous verrez ce qui suit si cela a réussi :
Nous appelons ensuite le modèle avec le message suivant et uniquement avec les paramètres recommandés de Devstral, à savoir temperature = 0.15. Rappel de lancer Tool Calling Guide