For the complete documentation index, see llms.txt. This page is also available as Markdown.

Guide d'appel d'outils pour les LLM locaux

L’appel d’outils, c’est lorsqu’un LLM est autorisé à déclencher des fonctions spécifiques (comme « rechercher dans mes fichiers », « lancer une calculatrice » ou « appeler une API ») en émettant une requête structurée plutôt qu’en devinant la réponse en texte. Vous utilisez les appels d’outils parce qu’ils rendent les sorties plus fiables et à jour, et ils permettent au modèle d’effectuer de vraies actions (interroger des systèmes, valider des faits, appliquer des schémas) plutôt que d’halluciner.

Dans ce tutoriel, vous apprendrez à utiliser des LLM locaux via l’appel d’outils avec des exemples d’opérations mathématiques, de récit, de code Python et de fonctions terminal. L’inférence est effectuée localement via llama.cpp, llama-server et des points de terminaison OpenAI.

L’appel d’outils est automatiquement configuré lorsque vous utilisez Unsloth Studio. Sélectionnez simplement votre modèle et activez ou désactivez l’appel d’outils.

Voir à droite un exemple d’appel d’outils appliqué automatiquement pour Gemma 4. Unsloth propose également un appel d’outils auto-réparateur, garantissant que vous disposez toujours d’appels d’outils fonctionnels.

Notre guide devrait fonctionner pour presque n’importe quel modèle y compris :

Tutoriel Qwen3-Coder-NextTutoriel GLM-4.7-Flash

🔨Configuration de l’appel d’outils

Notre première étape consiste à obtenir la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp

Dans un nouveau terminal (si vous utilisez tmux, utilisez CTRL+B+D), nous créons quelques outils comme l’ajout de 2 nombres, l’exécution de code Python, l’exécution de fonctions Linux et bien plus encore :

Nous utilisons ensuite les fonctions ci-dessous (copiez-collez puis exécutez) qui analyseront automatiquement les appels de fonction et appelleront l'endpoint OpenAI pour n'importe quel modèle :

Dans cet exemple, nous utilisons Devstral 2 ; lorsque vous changez de modèle, assurez-vous d’utiliser les bons paramètres d’échantillonnage. Vous pouvez tous les consulter dans nos guides ici.

Nous allons maintenant présenter ci-dessous plusieurs méthodes d’exécution de l’appel d’outils pour de nombreux cas d’utilisation différents :

Écrire une histoire :

Opérations mathématiques :

Exécuter le code Python généré

Exécuter des fonctions de terminal arbitraires

🌠 Appel d’outils Qwen3-Coder-Next

Dans un nouveau terminal, nous créons quelques outils comme l’ajout de 2 nombres, l’exécution de code Python, l’exécution de fonctions Linux et bien plus encore :

Nous utilisons ensuite les fonctions ci-dessous, qui analyseront automatiquement les appels de fonctions et appelleront le point de terminaison OpenAI pour n’importe quel LLM :

Nous allons maintenant présenter ci-dessous plusieurs méthodes d’exécution de l’appel d’outils pour de nombreux cas d’utilisation différents :

Exécuter le code Python généré

Exécuter des fonctions de terminal arbitraires

Nous confirmons que le fichier a été créé, et c’est bien le cas !

GLM-4.7-Flash + appel GLM 4.7

Nous téléchargeons d’abord GLM-4.7 ou GLM-4.7-Flash via du code Python, puis nous le lançons via llama-server dans un terminal séparé (comme avec tmux). Dans cet exemple, nous téléchargeons le grand modèle GLM-4.7 :

Si vous l’avez exécuté avec succès, vous devriez voir :

Lancez-le maintenant via llama-server dans un nouveau terminal. Utilisez tmux si vous le souhaitez :

Et vous obtiendrez :

Maintenant, dans un nouveau terminal et en exécutant du code Python, rappel de lancer Tool Calling Guide Nous utilisons les paramètres optimaux de GLM 4.7, à savoir temperature = 0.7 et top_p = 1.0

Appel d'outil pour les opérations mathématiques avec GLM 4.7

Appel d'outil pour exécuter du code Python généré pour GLM 4.7

📙 Appel d’outils Devstral 2

Nous téléchargeons d’abord Devstral 2 via du code Python, puis nous le lançons via llama-server dans un terminal séparé (comme avec tmux) :

Si vous l’avez exécuté avec succès, vous devriez voir :

Lancez-le maintenant via llama-server dans un nouveau terminal. Utilisez tmux si vous le souhaitez :

Vous verrez ce qui suit si cela a réussi :

Nous appelons ensuite le modèle avec le message suivant et uniquement avec les paramètres recommandés de Devstral, à savoir temperature = 0.15. Rappel de lancer Tool Calling Guide

Mis à jour

Ce contenu vous a-t-il été utile ?