For the complete documentation index, see llms.txt. This page is also available as Markdown.

Comment exécuter des LLM locaux avec Claude Code

Guide pour utiliser des modèles ouverts avec Claude Code sur votre appareil local.

Ce guide étape par étape vous montre comment connecter des LLMs ouverts et des API à Claude Code entièrement en local, avec captures d'écran. Exécutez-le avec n'importe quel modèle ouvert comme Qwen3.6, DeepSeek et Gemma.

Pour ce tutoriel, nous utiliserons les modèles ouverts : Gemma 4 et Qwen3.5 qui sont d'excellents modèles agentiques et de codage (fonctionne sur un appareil avec 24 Go de RAM/mémoire unifiée). Pour l'inférence, nous utiliserons Unsloth Studio et llama.cpp vous permet d'exécuter/diffuser des LLMs sur macOS, Linux et Windows. Vous pouvez remplacer par n'importe quel autre modèle, il suffit de mettre à jour les noms des modèles dans vos scripts.

Configuration de Claude Code📖 Tutoriel de configuration du modèle local

Pour les quants de modèle, nous utiliserons Unsloth GGUF dynamiques pour exécuter n'importe quel LLM quantifié, tout en conservant autant de précision que possible.

Configuration de Claude Code

Avant de configurer notre LLM local, nous devons installer Claude Code. Claude Code est un agent de codage basé sur le terminal qui comprend votre base de code et gère des workflows Git complexes en langage naturel.

Installez Claude Code :

Collez ceci dans votre terminal pour installer Claude Code :

curl -fsSL https://claude.ai/install.sh | bash

Après l'installation, accédez au dossier de votre projet. Puis tapez claude dans le shell pour commencer.

cd ~/projects/my-project 
claude

🕵️Corriger l'inférence 90 % plus lente dans Claude Code

L'attribution est une ligne ajoutée au préfixe du début du prompt système (x-anthropic-billing-header: cc_version=...; cch=...;) dont la valeur change à chaque requête, de sorte que tout le préfixe du prompt manque le cache KV à chaque tour.

La solution la plus simple consiste à le désactiver en ligne de commande lorsque vous lancez Claude Code, afin qu'il n'y ait aucun fichier à modifier :

Les versions récentes de Claude Code prennent aussi en charge export CLAUDE_CODE_ATTRIBUTION_HEADER=0; les anciennes versions ignoraient la variable du shell, donc le --settings formulaire ci-dessus (ou le fichier de paramètres ci-dessous) est le choix fiable.

Pour le rendre permanent, ajoutez CLAUDE_CODE_ATTRIBUTION_HEADER défini à 0 dans "env" dans ~/.claude/settings.json. Par exemple, faites cat > ~/.claude/settings.json puis ajoutez ci-dessous (une fois collé, appuyez sur ENTRÉE puis CTRL+D pour l'enregistrer). Si vous avez déjà un ~/.claude/settings.json fichier précédent, ajoutez simplement "CLAUDE_CODE_ATTRIBUTION_HEADER" : "0" à la section "env", et laissez le reste du fichier de paramètres inchangé.

📖 Tutoriels de démarrage rapide

Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons Unsloth (une interface web) et llama.cpp, qui sont des frameworks open source pour exécuter et servir des LLMs sur vos appareils Mac, Linux et Windows.

Unsloth dispose également d'un appel d'outils et recherche web des capacités. Voir à droite Claude Code connecté à Unsloth :

Connecter Claude Code🦥 Tutoriel Unsloth Tutoriel llama.cpp

🦥 Tutoriel Unsloth

Pour ce tutoriel, nous allons servir/connecter des modèles locaux à Claude Code via une interface en utilisant Unsloth. Unsloth fonctionne sous Windows, WSL, Linux et MacOS.

Voir ci-dessous pour les instructions d'installation :

Exemple de Qwen3.6 2 bits exécuté dans Unsloth.

Étape 1 : Configurer Unsloth

Lancez le terminal depuis Mac, puis installez Unsloth en saisissant la commande ci-dessous.

Unsloth commencera à configurer l'environnement et à installer les paquets requis comme indiqué ci-dessous. Tapez Y et appuyez sur Entrée lorsqu'on vous demande si vous souhaitez autoriser Studio à démarrer maintenant. Cela lancera Unsloth sur votre 8888 port.

Si vous avez choisi de ne pas démarrer Unsloth pendant le processus d'installation, vous pouvez toujours lancer l'application Unsloth en utilisant unsloth studio -p 8888 . Si vous souhaitez que votre instance Unsloth soit accessible par des clients en dehors de votre PC/ordinateur, ajoutez -H 0.0.0.0 à la commande unsloth studio .

Étape 2 : Démarrer Unsloth

Ouvrez le navigateur de votre choix et tapez http://127.0.0.1:8888 dans le champ URL. Si c'est votre première installation d'Unsloth, vous serez redirigé vers la page du mot de passe, où vous devrez créer un nouveau mot de passe. Ensuite, Unsloth devrait maintenant s'ouvrir sur la page Chat, comme indiqué ci-dessous.

Guide de chargement du modèle + API

1

Sélectionner un modèle

Avant d'utiliser l'API, chargez un modèle depuis le menu déroulant Sélectionner un modèle dans le coin supérieur gauche de la page Chat.

Dans ce guide, nous utiliserons : unsloth/gemma-4-26B-A4B-it-GGUF avec la quantification recommandée UD-Q4_K_XL quantification.

2

Tester le modèle

Avant d'utiliser le client, envoyez un court message :

Cela confirme que le modèle s'est chargé correctement et est prêt à répondre.

3

clé API Unsloth

Dans Studio, ouvrez Paramètres → API pour afficher ou créer votre clé API.

Traitez votre clé API comme un mot de passe et évitez de l'exposer dans des captures d'écran ou des dépôts.

⚙️ Connecter Claude Code

Maintenant que nous avons configuré le LLM local pour Claude Code, nous allons maintenant configurer Claude Code pour fonctionner avec votre outil. Vous pouvez soit vous connecter facilement avec unsloth start ci-dessous ou le faire manuellement.

⚡ Connexion avec unsloth start

La façon la plus rapide de pointer Claude Code vers votre modèle local est la unsloth start commande. Avec Unsloth en cours d'exécution et un modèle chargé, exécutez dans votre terminal :

Cette commande génère une clé API, définit les variables ANTHROPIC_BASE_URL, ANTHROPIC_AUTH_TOKEN, et ANTHROPIC_MODEL applique la correction du cache KV à ~/.claude/settings.json pour vous, et lance Claude Code sur votre modèle chargé. Vous n'avez rien à exporter ni à modifier settings.json à la main.

Par défaut, il utilise le modèle déjà chargé dans Unsloth. Pour charger et utiliser un modèle spécifique, passez --model:

Vous vous connectez à Unsloth sur une autre machine ? Créez une clé (Paramètres → API) et transmettez-la avec --api-key, puis pointez UNSLOTH_STUDIO_URL vers le serveur.

🔌 Connexion manuelle

Si vous préférez le configurer manuellement, vous pouvez commencer par définir les variables d'environnement suivantes. Par défaut, ces variables ne persisteront pas entre les sessions.

Configuration : Définissez l'URL de l'API locale :

Copiez votre clé depuis Unsloth Studio → Paramètres → API (ou depuis la console lorsque vous le lancez avec unsloth run, où elle est affichée comme sk-unsloth-...), puis définissez-la. Définissez également un ANTHROPIC_API_KEY vide afin que Claude Code ne vous demande pas de clé cloud :

Facultatif : utilisez le nom du modèle actuellement chargé dans Unsloth comme valeur par défaut.

Utilisez l'identifiant complet du modèle exactement comme il apparaît dans GET http://localhost:8888/v1/models (la même chaîne que vous transmettez à claude --model).

Démarrer Claude Code

Démarrez Claude Code avec le modèle actuellement chargé dans Unsloth.

Nous utiliserons gemma-4-26B-A4B-it-GGUF, mais vous pouvez utiliser n'importe quel modèle compatible avec Unsloth.

Pour un gain de vitesse supplémentaire sur les modèles locaux, vous pouvez également lancer avec --bare --exclude-dynamic-system-prompt-sections. Voir ci-dessous la section Facultatif : réduire le prompt système.

Claude Code devrait s'ouvrir et afficher le modèle sélectionné.

Essayez ce prompt pour rechercher et classer des jeux de données SFT de haute qualité :

Après avoir soumis le prompt, l'agent recherchera sur le web, évaluera les résultats et rédigera le rapport final. Cela peut prendre quelques minutes.

Certains flux de travail peuvent nécessiter que vous approuviez des actions ou répondiez à des invites de suivi.

Certains flux de travail peuvent nécessiter que vous approuviez des actions ou répondiez à des invites de suivi.

Une fois terminé, le fichier généré sft_report.md ressemblera à ceci.

Facultatif : réduire le prompt système

Claude Code a été conçu pour les modèles hébergés d'Anthropic, donc son prompt système par défaut est volumineux. Sur les modèles locaux, vous pouvez le réduire pour obtenir des réponses plus rapides et une meilleure réutilisation du cache KV en ajoutant deux drapeaux lorsque vous le lancez :

--bare ignore la découverte automatique des hooks, skills, plugins, serveurs MCP et CLAUDE.md (Claude conserve Bash et lecture/édition de fichiers), et --exclude-dynamic-system-prompt-sections déplace les sections spécifiques à la machine hors du préfixe du prompt. Les deux réduisent le prompt et améliorent la réutilisation du cache KV, ce qui rend les modèles locaux nettement plus rapides. Ils sont facultatifs et ne modifient pas la configuration de connexion ci-dessus.

Facultatif : ajuster le serveur Unsloth

Claude Code utilise le modèle exécuté dans Unsloth. Vous pouvez personnaliser le comportement du serveur lors de son démarrage.

Utilisez --reasoning off pour désactiver la réflexion, ou --reasoning on pour l'activer pour les modèles qui prennent en charge le raisonnement.

Cela démarre le serveur sur 0.0.0.0:8888, ce qui permet aux autres appareils de votre réseau local de se connecter.

Utilisez -p pour modifier le port sur lequel le serveur s'exécute. Utilisez -H 0.0.0.0 si vous souhaitez que des téléphones, ordinateurs portables ou autres appareils de votre réseau s'y connectent.

Pour une configuration d’exécution plus avancée, consultez le principal Réglages de l'API .

🦙 Tutoriel Llama.cpp

Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons llama.cpp qui est un framework open source pour exécuter des LLMs sur vos appareils Mac, Linux, Windows, etc. Llama.cpp contient llama-server qui vous permet de diffuser et déployer des LLMs efficacement. Le modèle sera servi sur le port 8001, tous les outils de l'agent étant acheminés via un seul point de terminaison compatible OpenAI.

Tutoriel Qwen3.5

Nous utiliserons Qwen3.5-35B-A3B et des paramètres spécifiques pour des tâches de codage rapides et précises. Si vous n'avez pas assez de VRAM et voulez un plus intelligent modèle, Qwen3.5-27B est un excellent choix, mais il sera environ 2x plus lent, ou vous pouvez utiliser d'autres variantes de Qwen3.5 comme 9B, 4B ou 2B.

Utilisez Qwen3.5-27B si vous voulez un plus intelligent modèle ou si vous n'avez pas assez de VRAM. Il sera toutefois environ 2x plus lent que 35B-A3B. Ou vous pouvez utiliser Qwen3-Coder-Next qui est fantastique si vous avez assez de VRAM.

1

Installer llama.cpp

Nous devons installer llama.cpp pour déployer/servir des LLMs locaux à utiliser dans Claude Code, etc. Nous suivons les instructions officielles de compilation pour obtenir les liaisons GPU correctes et des performances maximales. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n'avez pas de GPU ou souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge Metal est activée par défaut.

2

Télécharger et utiliser les modèles localement

Téléchargez le modèle via huggingface_hub en Python (après l'installation via pip install huggingface_hub hf_transfer). Nous utilisons le UD-Q4_K_XL quant pour le meilleur équilibre entre taille et précision. Vous pouvez trouver tous les téléchargements GGUF d'Unsloth dans notre Collection ici. Si les téléchargements restent bloqués, voir Hugging Face Hub, débogage XET

3

Démarrez le serveur Llama

Pour déployer Qwen3.5 pour des charges de travail agentiques, nous utilisons llama-server. Nous appliquons les paramètres d’échantillonnage recommandés par Qwen pour le mode de raisonnement : temp 0.6, top_p 0.95 , top-k 20. Gardez à l’esprit que ces valeurs changent si vous utilisez le mode sans raisonnement ou d’autres tâches.

Exécutez cette commande dans un nouveau terminal (utilisez tmux ou ouvrez un nouveau terminal). Ce qui suit devrait tenir parfaitement dans un GPU de 24 Go (RTX 4090) (utilise 23 Go) --fit sur effectuera également un déchargement automatique, mais si vous constatez de mauvaises performances, réduisez --ctx-size .

Nous avons utilisé --cache-type-k q8_0 --cache-type-v q8_0 pour la quantification du cache KV afin de réduire l’utilisation de la VRAM. Pour la précision complète, utilisez --cache-type-k bf16 --cache-type-v bf16 .Remarque : le cache KV bf16 peut être légèrement plus lent sur certaines machines.

Démarrez Claude Code avec llama-server

Rendez-vous dans le dossier de votre projet (mkdir project ; cd project) puis exécutez :

Pour utiliser Qwen3.6-35B-A3B, il suffit de le remplacer par :

Pour configurer Claude Code afin qu’il exécute les commandes sans aucune approbation, faites (ATTENTION : cela permettra à Claude Code d’agir et d’exécuter du code comme bon lui semble, sans aucune approbation !)

Essayez cette invite pour installer et exécuter un simple fine-tuning Unsloth :

Après avoir attendu un peu, Unsloth sera installé dans un venv via uv et chargé :

et enfin, vous verrez un modèle finement ajusté avec succès grâce à Unsloth !

Mis à jour

Ce contenu vous a-t-il été utile ?