For the complete documentation index, see llms.txt. This page is also available as Markdown.

Comment exécuter des modèles d’IA locaux avec Hermes Agent

Guide d’utilisation locale des LLM ouverts avec Hermes Agent.

Ce guide vous permet d’exécuter localement des LLM ouverts avec Hermes Agent via Unsloth. Hermes Agent est un open source agent d’IA autonome qui se connecte à un point de terminaison de modèle, exécute des tâches et s’améliore avec le temps grâce à la mémoire et aux compétences apprises.

Il fonctionne avec n’importe quel modèle local exposé via l’ API compatible OpenAI, notamment : DeepSeek, Qwen, Gemma, et bien d’autres. Hermes agit comme client agent, tandis qu’Unsloth charge et sert les modèles via une API locale.

Après la configuration, chaque invite envoyée via Hermes sera exécutée sur votre modèle local au lieu d’un fournisseur distant.

Configurer Hermes🦥 Utiliser des modèles ouverts avec Unsloth

Dans ce tutoriel, vous installerez Hermes et le configurerez pour utiliser unsloth/Qwen3.6-27B-GGUF servi depuis Unsloth. Vous préférez un autre modèle ? Remplacez-le par n’importe quel autre modèle en le chargeant dans Unsloth et en mettant à jour la configuration.

Configurer Hermes Agent

Prérequis. Le programme d’installation les vérifie et s’arrête si l’un d’eux manque. Installez d’abord ce qui n’est pas déjà présent sur votre machine :

  • SE Linux, macOS ou Windows via WSL.

  • uv Gestionnaire de paquets Python. Installez-le avec curl -LsSf https://astral.sh/uv/install.sh | sh.

  • Python 3.11+ le programme d’installation peut le provisionner via uv s’il manque.

  • Git pour cloner le dépôt Hermes.

  • Node.js 18+ pour les outils de navigateur d’Hermes.

  • ripgrep (rg) pour une recherche rapide dans les fichiers.

  • ffmpeg pour les messages TTS/vocaux.

1. Exécutez le programme d’installation dans un terminal :

curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash

Le programme d’installation va :

  1. Détecter votre système d’exploitation.

  2. Vérifier chaque prérequis listé ci-dessus et afficher un ✓ ou un ✗ pour chacun.

  3. Cloner Hermes dans ~/.hermes/hermes-agent/ (via SSH si une clé SSH GitHub est configurée, sinon via HTTPS).

  4. Créer un environnement virtuel Python 3.11 dans ~/.hermes/hermes-agent/venv/.

  5. Installer Hermes et toutes les dépendances Python.

  6. Installer les dépendances Node.js pour les outils de navigateur.

  7. Installer le moteur Chromium de Playwright. Cette étape demande sudo afin que Playwright puisse installer des bibliothèques partagées. Hermes lui-même ne nécessite pas les privilèges root.

2. Rechargez votre shell pour que la commande hermes soit dans votre PATH:

3. Vérifiez l’installation :

Si la commande répond, Hermes est installé. Tout se trouve sous ~/.hermes/:

Chemin
Ce que c’est

~/.hermes/config.yaml

Paramètres principaux (modèle, fournisseur, outils, TTS, …)

~/.hermes/.env

Clés API et autres secrets

~/.hermes/hermes-agent/

Le code source d’Hermes + l’environnement virtuel

~/.hermes/cron/, sessions/, logs/

Données d’exécution

~/.hermes/skills/

Compétences installées (synchronisées depuis le Skills Hub)

Référence complète d’installation : hermes-agent.nousresearch.com/docs/getting-started/installation. Si le programme d’installation signale un prérequis manquant, installez-le et relancez la commande en une ligne. Le programme d’installation est idempotent.

⚡ Démarrage rapide

Après avoir installé Hermes, nous devrons installer Unsloth Studio pour permettre à Hermes de servir et d’exécuter l’inférence de modèles locaux.

  1. Installez ou mettez à jour Unsloth Studio. Les versions antérieures n’exposent pas l’API externe. Voir Installation.

  2. Lancez Unsloth. Notez que le port de démarrage est généralement 8000 ou 8888. Vous le verrez dans la sortie du terminal et dans l’URL du navigateur (http://localhost:PORT).

  3. Chargez un modèle. Cliquez sur Nouvelle discussion, choisissez ou recherchez un modèle (GGUF), puis attendez la fin du chargement.

  4. Connectez Hermes. Exécutez unsloth start hermes. Cela génère une clé API, écrit la configuration et lance Hermes sur votre modèle chargé.

⚡ Connecter avec unsloth start

La façon la plus rapide de pointer Hermes vers votre modèle local est la commande unsloth start . Avec Unsloth en cours d’exécution et un modèle chargé, exécutez :

Cela génère pour vous une clé API, écrit le fournisseur unsloth dans ~/.hermes/config.yamlet lance Hermes sur votre modèle chargé. Cela remplace l’assistant de configuration d’Hermes ci-dessous.

Par défaut, il utilise le modèle déjà chargé dans Unsloth. Pour charger et utiliser un modèle spécifique, passez --model:

Vous vous connectez à Unsloth sur une autre machine ? Créez une clé (ci-dessous) et passez-la avec --api-key, puis pointez UNSLOTH_STUDIO_URL vers le serveur.

Les étapes ci-dessous configurent la même chose manuellement avec l’ configuration d’Hermes assistant de configuration, si vous préférez ne pas utiliser unsloth start.

🔑 Création d’une clé API

  1. Ouvrez la barre latérale, cliquez sur votre Unsloth avatar en bas à gauche.

  2. Allez dans ParamètresAPI.

  3. Entrez un nom convivial (par ex. hermes-agent-macbook).

  4. (Facultatif) Définissez une date d’expiration.

  5. Cliquez sur Créer.

  6. Copiez immédiatement la clé. Unsloth ne stocke qu’un hachage et vous ne pourrez plus la consulter.

Toutes les clés commencent par le préfixe sk-unsloth- . Révoquez une clé depuis la même page à tout moment. Les requêtes effectuées avec une clé révoquée échoueront avec 401 Non autorisé.

🦥 Intégrer Hermes avec l’API Unsloth

Hermes envoie chaque tour de conversation à un fournisseur d’inférence configuré et se connecte à des points de terminaison compatibles OpenAI . Configurez le fournisseur pendant l’installation ou plus tard dans l’assistant de configuration.

1. Ouvrez l’assistant de configuration :

Choisissez Modèle et fournisseur dans le menu « Que souhaitez-vous faire ? » pour configurer uniquement le point de terminaison d’inférence, ou Configuration complète pour parcourir tout le processus (TTS, outils, passerelle de messagerie, paramètres de l’agent).

2. Sélectionnez le point de terminaison OpenAI-compatible personnalisé quand Hermes vous demande un fournisseur d’inférence.

3. Remplissez les invites au fur et à mesure qu’Hermes les présente :

Invite
Valeur

URL de base de l’API

http://localhost:8888/v1 (votre port Unsloth + /v1)

Clé API

Votre sk-unsloth-… clé

Modèle détecté : … Utiliser ce modèle ?

Y (Hermes détecte automatiquement le modèle via GET /v1/models)

Longueur du contexte en jetons

(laissez vide pour la détection automatique)

Nom d’affichage

N’importe quel nom, par ex. unsloth-api

Hermes vérifie le point de terminaison avec /v1/models et confirme le modèle détecté avant de continuer.

4. Acceptez les valeurs par défaut pour les invites restantes (TTS, outils, passerelle de messagerie, paramètres de l’agent) ; vous pourrez les reconfigurer plus tard. Hermes écrit tout dans ~/.hermes/config.yaml et ~/.hermes/.env.

5. Lancez Hermes :

La bannière de démarrage affiche le nom de votre modèle Unsloth dans la barre d’état (par ex. unsloth/Qwen3.6-27B-GGUF), et l’invite est prête à recevoir une entrée.

Pour reconfigurer uniquement le modèle plus tard, exécutez hermes setup model. Pour modifier directement le fichier de configuration, hermes config edit ouvre ~/.hermes/config.yaml dans votre $EDITOR.

Facultatif : ajuster le serveur Unsloth

unsloth run démarre le serveur API local et charge un modèle pour que votre application puisse s’y connecter. Vous pouvez aussi personnaliser le comportement du serveur au démarrage.

Utilisez --reasoning off pour désactiver la réflexion, ou --reasoning on pour l’activer pour les modèles qui prennent en charge le raisonnement.

Cela démarre le serveur sur 0.0.0.0:8888, ce qui permet à d’autres appareils de votre réseau local de se connecter. -p modifie le port sur lequel le serveur s’exécute. Si vous voulez que des téléphones, ordinateurs portables ou autres appareils de votre réseau se connectent au serveur API, démarrez-le avec -H 0.0.0.0.

Certaines applications peuvent encore remplacer les paramètres de génération pour des requêtes individuelles. Pour une configuration d’exécution plus avancée, consultez la principale Ajustement de l’API section.

Mis à jour

Ce contenu vous a-t-il été utile ?