Comment exécuter des LLM locaux avec Claude Code
Guide pour utiliser des modèles ouverts avec Claude Code sur votre appareil local.
Ce guide étape par étape vous montre comment connecter des LLMs ouverts et des API à Claude Code entièrement en local, avec captures d'écran. Exécutez-le avec n'importe quel modèle ouvert comme Qwen3.6, DeepSeek et Gemma.
Pour ce tutoriel, nous utiliserons les modèles ouverts : Gemma 4 et Qwen3.5 qui sont d'excellents modèles agentiques et de codage (fonctionne sur un appareil avec 24 Go de RAM/mémoire unifiée). Pour l'inférence, nous utiliserons Unsloth Studio et llama.cpp vous permet d'exécuter/diffuser des LLMs sur macOS, Linux et Windows. Vous pouvez remplacer par n'importe quel autre modèle, il suffit de mettre à jour les noms des modèles dans vos scripts.
Configuration de Claude Code📖 Tutoriel de configuration du modèle local
Pour les quants de modèle, nous utiliserons Unsloth GGUF dynamiques pour exécuter n'importe quel LLM quantifié, tout en conservant autant de précision que possible.
Configuration de Claude Code
Avant de configurer notre LLM local, nous devons installer Claude Code. Claude Code est un agent de codage basé sur le terminal qui comprend votre base de code et gère des workflows Git complexes en langage naturel.
🕵️Corriger l'inférence 90 % plus lente dans Claude Code
Claude Code ajoute récemment un en-tête d'attribution Claude Code en préfixe, ce qui invalide le KV Cache, rendant l'inférence 90 % plus lente avec les modèles locaux.
L'attribution est une ligne ajoutée au préfixe du début du prompt système (x-anthropic-billing-header: cc_version=...; cch=...;) dont la valeur change à chaque requête, de sorte que tout le préfixe du prompt manque le cache KV à chaque tour.
La solution la plus simple consiste à le désactiver en ligne de commande lorsque vous lancez Claude Code, afin qu'il n'y ait aucun fichier à modifier :
Les versions récentes de Claude Code prennent aussi en charge export CLAUDE_CODE_ATTRIBUTION_HEADER=0; les anciennes versions ignoraient la variable du shell, donc le --settings formulaire ci-dessus (ou le fichier de paramètres ci-dessous) est le choix fiable.
Pour le rendre permanent, ajoutez CLAUDE_CODE_ATTRIBUTION_HEADER défini à 0 dans "env" dans ~/.claude/settings.json. Par exemple, faites cat > ~/.claude/settings.json puis ajoutez ci-dessous (une fois collé, appuyez sur ENTRÉE puis CTRL+D pour l'enregistrer). Si vous avez déjà un ~/.claude/settings.json fichier précédent, ajoutez simplement "CLAUDE_CODE_ATTRIBUTION_HEADER" : "0" à la section "env", et laissez le reste du fichier de paramètres inchangé.
📖 Tutoriels de démarrage rapide
Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons Unsloth (une interface web) et llama.cpp, qui sont des frameworks open source pour exécuter et servir des LLMs sur vos appareils Mac, Linux et Windows.
Unsloth dispose également d'un appel d'outils et recherche web des capacités. Voir à droite Claude Code connecté à Unsloth :

Connecter Claude Code🦥 Tutoriel Unsloth Tutoriel llama.cpp
🦥 Tutoriel Unsloth
Pour ce tutoriel, nous allons servir/connecter des modèles locaux à Claude Code via une interface en utilisant Unsloth. Unsloth fonctionne sous Windows, WSL, Linux et MacOS.
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Sélection automatique des paramètres d'inférence (temp, top-p, etc.)
Inférence CPU + GPU rapide via llama.cpp
Entraîner des LLMs 2x plus rapide avec 70 % de VRAM en moins
Voir ci-dessous pour les instructions d'installation :

Étape 1 : Configurer Unsloth
Lancez le terminal depuis Mac, puis installez Unsloth en saisissant la commande ci-dessous.
Unsloth commencera à configurer l'environnement et à installer les paquets requis comme indiqué ci-dessous. Tapez Y et appuyez sur Entrée lorsqu'on vous demande si vous souhaitez autoriser Studio à démarrer maintenant. Cela lancera Unsloth sur votre 8888 port.

Si vous avez choisi de ne pas démarrer Unsloth pendant le processus d'installation, vous pouvez toujours lancer l'application Unsloth en utilisant unsloth studio -p 8888 . Si vous souhaitez que votre instance Unsloth soit accessible par des clients en dehors de votre PC/ordinateur, ajoutez -H 0.0.0.0 à la commande unsloth studio .
Étape 2 : Démarrer Unsloth
Ouvrez le navigateur de votre choix et tapez http://127.0.0.1:8888 dans le champ URL. Si c'est votre première installation d'Unsloth, vous serez redirigé vers la page du mot de passe, où vous devrez créer un nouveau mot de passe. Ensuite, Unsloth devrait maintenant s'ouvrir sur la page Chat, comme indiqué ci-dessous.

Étape 1 : Configurer Unsloth
Ouvrez le menu Démarrer, recherchez PowerShell, et lancez-le. Copiez et saisissez la commande d'installation :
l'installation commencera automatiquement. Une fois l'installation terminée, PowerShell vous demandera si vous souhaitez démarrer Unsloth Studio.

Vous pouvez également le lancer avec la commande suivante :
Si vous souhaitez que votre instance soit accessible par des clients en dehors de votre PC/ordinateur.
Ajoutez -H 0.0.0.0 à la commande unsloth studio .
Étape 2 : Démarrer Unsloth
Ouvrez http://127.0.0.1:8888 dans votre navigateur. Lors du premier lancement, créez un nouveau mot de passe pour continuer vers la page Chat. Unsloth Studio est maintenant installé et prêt à l'emploi.

Étape 1 : Configurer Unsloth
Ouvrez votre application de terminal. Vous pouvez la lancer en appuyant sur Ctrl + Alt + T, ou en recherchant Terminal dans le menu des applications de votre système.
Cliquez sur le menu Démarrer de Windows, tapez le nom de votre distribution installée (par ex. Ubuntu), puis ouvrez-la.
Sur WSL, assurez-vous que vos pilotes NVIDIA sont installés sur Windows (pas dans WSL) et que le kit d'outils CUDA est installé dans votre distribution WSL. Voir les exigences système ci-dessous pour plus de détails.
Pour installer, copiez et exécutez la commande d'installation :
Puis :
Cliquez à l'intérieur de la fenêtre du terminal
Collez la commande avec
Ctrl + Shift + VAppuyez sur
Entrée
Unsloth commencera à configurer l'environnement et à installer les paquets requis comme indiqué ci-dessous. Tapez Y et appuyez sur Entrée lorsqu'on vous demande si vous souhaitez autoriser Studio à démarrer maintenant. Cela lancera Unsloth sur votre 8888 port.

Si vous avez choisi de ne pas démarrer Unsloth pendant le processus d'installation, vous pouvez toujours lancer l'application Unsloth en utilisant unsloth studio -p 8888 . Si vous souhaitez que votre instance Unsloth soit accessible par des clients en dehors de votre PC/ordinateur, ajoutez -H 0.0.0.0 à la commande unsloth studio .
Étape 2 : Démarrer Unsloth
Ouvrez le navigateur de votre choix et tapez http://127.0.0.1:8888 dans le champ URL. Si c'est votre première installation d'Unsloth, vous serez redirigé vers la page du mot de passe, où vous devrez créer un nouveau mot de passe. Ensuite, Unsloth devrait maintenant s'ouvrir sur la page Chat, comme indiqué ci-dessous.

Guide de chargement du modèle + API
⚙️ Connecter Claude Code
Maintenant que nous avons configuré le LLM local pour Claude Code, nous allons maintenant configurer Claude Code pour fonctionner avec votre outil. Vous pouvez soit vous connecter facilement avec unsloth start ci-dessous ou le faire manuellement.
⚡ Connexion avec unsloth start
unsloth startLa façon la plus rapide de pointer Claude Code vers votre modèle local est la unsloth start commande. Avec Unsloth en cours d'exécution et un modèle chargé, exécutez dans votre terminal :
Cette commande génère une clé API, définit les variables ANTHROPIC_BASE_URL, ANTHROPIC_AUTH_TOKEN, et ANTHROPIC_MODEL applique la correction du cache KV à ~/.claude/settings.json pour vous, et lance Claude Code sur votre modèle chargé. Vous n'avez rien à exporter ni à modifier settings.json à la main.
Par défaut, il utilise le modèle déjà chargé dans Unsloth. Pour charger et utiliser un modèle spécifique, passez --model:
Vous vous connectez à Unsloth sur une autre machine ? Créez une clé (Paramètres → API) et transmettez-la avec --api-key, puis pointez UNSLOTH_STUDIO_URL vers le serveur.
🔌 Connexion manuelle
Si vous préférez le configurer manuellement, vous pouvez commencer par définir les variables d'environnement suivantes. Par défaut, ces variables ne persisteront pas entre les sessions.
Configuration : Définissez l'URL de l'API locale :
Copiez votre clé depuis Unsloth Studio → Paramètres → API (ou depuis la console lorsque vous le lancez avec unsloth run, où elle est affichée comme sk-unsloth-...), puis définissez-la. Définissez également un ANTHROPIC_API_KEY vide afin que Claude Code ne vous demande pas de clé cloud :
Facultatif : utilisez le nom du modèle actuellement chargé dans Unsloth comme valeur par défaut.
Utilisez l'identifiant complet du modèle exactement comme il apparaît dans GET http://localhost:8888/v1/models (la même chaîne que vous transmettez à claude --model).
Configuration : Définissez l'URL de l'API locale dans Powershell :
Copiez votre clé depuis Unsloth Studio → Paramètres → API, puis définissez-la :
Facultatif : Utilisez le nom du modèle actuellement chargé dans Unsloth comme valeur par défaut.
Le nom du modèle doit être celui qui est actuellement chargé dans Unsloth Studio.
Démarrer Claude Code
Démarrez Claude Code avec le modèle actuellement chargé dans Unsloth.
Nous utiliserons gemma-4-26B-A4B-it-GGUF, mais vous pouvez utiliser n'importe quel modèle compatible avec Unsloth.
Pour un gain de vitesse supplémentaire sur les modèles locaux, vous pouvez également lancer avec --bare --exclude-dynamic-system-prompt-sections. Voir ci-dessous la section Facultatif : réduire le prompt système.
Claude Code devrait s'ouvrir et afficher le modèle sélectionné.

Voir Claude Code d'abord pour corriger le ralentissement de 90 % des modèles ouverts dû à l'invalidation du cache KV.
Essayez ce prompt pour rechercher et classer des jeux de données SFT de haute qualité :
Après avoir soumis le prompt, l'agent recherchera sur le web, évaluera les résultats et rédigera le rapport final. Cela peut prendre quelques minutes.
Certains flux de travail peuvent nécessiter que vous approuviez des actions ou répondiez à des invites de suivi.

Certains flux de travail peuvent nécessiter que vous approuviez des actions ou répondiez à des invites de suivi.
Une fois terminé, le fichier généré sft_report.md ressemblera à ceci.

Si vous voyez Impossible de se connecter à l'API (ConnectionRefused) , n'oubliez pas de désactiver ANTHROPIC_BASE_URL via unset ANTHROPIC_BASE_URL
Si vous trouvez que les modèles ouverts sont 90 % plus lents, voir ici d'abord pour corriger l'invalidation du cache KV.
Facultatif : réduire le prompt système
Claude Code a été conçu pour les modèles hébergés d'Anthropic, donc son prompt système par défaut est volumineux. Sur les modèles locaux, vous pouvez le réduire pour obtenir des réponses plus rapides et une meilleure réutilisation du cache KV en ajoutant deux drapeaux lorsque vous le lancez :
--bare ignore la découverte automatique des hooks, skills, plugins, serveurs MCP et CLAUDE.md (Claude conserve Bash et lecture/édition de fichiers), et --exclude-dynamic-system-prompt-sections déplace les sections spécifiques à la machine hors du préfixe du prompt. Les deux réduisent le prompt et améliorent la réutilisation du cache KV, ce qui rend les modèles locaux nettement plus rapides. Ils sont facultatifs et ne modifient pas la configuration de connexion ci-dessus.
Facultatif : ajuster le serveur Unsloth
Claude Code utilise le modèle exécuté dans Unsloth. Vous pouvez personnaliser le comportement du serveur lors de son démarrage.
Utilisez --disable-tools lors de l'utilisation de Claude Code (ou de tout agent de codage externe). Par défaut, Unsloth Studio exécute ses propres outils côté serveur, ce qui absorbe les appels d'outils de l'agent, donc Claude Code répond mais ne modifie jamais les fichiers. --disable-tools bascule en mode passthrough, de sorte que les outils Write/Edit/Bash propres à Claude Code sont utilisés.
Utilisez --reasoning off pour désactiver la réflexion, ou --reasoning on pour l'activer pour les modèles qui prennent en charge le raisonnement.
Cela démarre le serveur sur 0.0.0.0:8888, ce qui permet aux autres appareils de votre réseau local de se connecter.
Utilisez -p pour modifier le port sur lequel le serveur s'exécute. Utilisez -H 0.0.0.0 si vous souhaitez que des téléphones, ordinateurs portables ou autres appareils de votre réseau s'y connectent.
Pour une configuration d’exécution plus avancée, consultez le principal Réglages de l'API .
🦙 Tutoriel Llama.cpp
Avant de commencer, nous devons d'abord terminer la configuration du modèle spécifique que vous allez utiliser. Nous utilisons llama.cpp qui est un framework open source pour exécuter des LLMs sur vos appareils Mac, Linux, Windows, etc. Llama.cpp contient llama-server qui vous permet de diffuser et déployer des LLMs efficacement. Le modèle sera servi sur le port 8001, tous les outils de l'agent étant acheminés via un seul point de terminaison compatible OpenAI.
Tutoriel Qwen3.5
Nous utiliserons Qwen3.5-35B-A3B et des paramètres spécifiques pour des tâches de codage rapides et précises. Si vous n'avez pas assez de VRAM et voulez un plus intelligent modèle, Qwen3.5-27B est un excellent choix, mais il sera environ 2x plus lent, ou vous pouvez utiliser d'autres variantes de Qwen3.5 comme 9B, 4B ou 2B.
Utilisez Qwen3.5-27B si vous voulez un plus intelligent modèle ou si vous n'avez pas assez de VRAM. Il sera toutefois environ 2x plus lent que 35B-A3B. Ou vous pouvez utiliser Qwen3-Coder-Next qui est fantastique si vous avez assez de VRAM.
Installer llama.cpp
Nous devons installer llama.cpp pour déployer/servir des LLMs locaux à utiliser dans Claude Code, etc. Nous suivons les instructions officielles de compilation pour obtenir les liaisons GPU correctes et des performances maximales. Modifiez -DGGML_CUDA=ON à -DGGML_CUDA=OFF si vous n'avez pas de GPU ou souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez normalement - la prise en charge Metal est activée par défaut.

Télécharger et utiliser les modèles localement
Téléchargez le modèle via huggingface_hub en Python (après l'installation via pip install huggingface_hub hf_transfer). Nous utilisons le UD-Q4_K_XL quant pour le meilleur équilibre entre taille et précision. Vous pouvez trouver tous les téléchargements GGUF d'Unsloth dans notre Collection ici. Si les téléchargements restent bloqués, voir Hugging Face Hub, débogage XET

Nous avons utilisé unsloth/Qwen3.5-35B-A3B-GGUF , mais vous pouvez utiliser une autre variante comme 27B ou n'importe quel autre modèle comme unsloth/Qwen3-Coder-Next-GGUF.

Démarrez le serveur Llama
Pour déployer Qwen3.5 pour des charges de travail agentiques, nous utilisons llama-server. Nous appliquons les paramètres d’échantillonnage recommandés par Qwen pour le mode de raisonnement : temp 0.6, top_p 0.95 , top-k 20. Gardez à l’esprit que ces valeurs changent si vous utilisez le mode sans raisonnement ou d’autres tâches.
Exécutez cette commande dans un nouveau terminal (utilisez tmux ou ouvrez un nouveau terminal). Ce qui suit devrait tenir parfaitement dans un GPU de 24 Go (RTX 4090) (utilise 23 Go) --fit sur effectuera également un déchargement automatique, mais si vous constatez de mauvaises performances, réduisez --ctx-size .
Nous avons utilisé --cache-type-k q8_0 --cache-type-v q8_0 pour la quantification du cache KV afin de réduire l’utilisation de la VRAM. Pour la précision complète, utilisez --cache-type-k bf16 --cache-type-v bf16 .Remarque : le cache KV bf16 peut être légèrement plus lent sur certaines machines.
Vous pouvez aussi désactiver le raisonnement pour Qwen3.5, ce qui peut améliorer les performances pour les tâches de codage agentique. Pour désactiver le raisonnement avec llama.cpp, ajoutez ceci à la commande llama-server :
--chat-template-kwargs "{\"enable_thinking\": false}"

Démarrez Claude Code avec llama-server
Nous avons utilisé unsloth/GLM-4.7-Flash-GGUF , mais vous pouvez utiliser n’importe quoi comme unsloth/Qwen3.6-27B-GGUF.
Voir Claude Code d'abord pour corriger le ralentissement de 90 % des modèles ouverts dû à l'invalidation du cache KV.
Rendez-vous dans le dossier de votre projet (mkdir project ; cd project) puis exécutez :
Pour utiliser Qwen3.6-35B-A3B, il suffit de le remplacer par :

Pour configurer Claude Code afin qu’il exécute les commandes sans aucune approbation, faites (ATTENTION : cela permettra à Claude Code d’agir et d’exécuter du code comme bon lui semble, sans aucune approbation !)
Essayez cette invite pour installer et exécuter un simple fine-tuning Unsloth :

Après avoir attendu un peu, Unsloth sera installé dans un venv via uv et chargé :

et enfin, vous verrez un modèle finement ajusté avec succès grâce à Unsloth !

Si vous voyez Impossible de se connecter à l'API (ConnectionRefused) , n'oubliez pas de désactiver ANTHROPIC_BASE_URL via unset ANTHROPIC_BASE_URL
Si vous trouvez que les modèles ouverts sont 90 % plus lents, voir ici d'abord pour corriger l'invalidation du cache KV.
Mis à jour
Ce contenu vous a-t-il été utile ?





