Comment exécuter des modèles avec Unsloth Studio
Exécutez des modèles d'IA, des LLM et des GGUF localement avec Unsloth Studio.
Unsloth Studio vous permet d'exécuter des modèles d'IA 100 % hors ligne sur votre ordinateur. Exécutez des formats de modèle comme GGUF et safetensors depuis Hugging Face ou depuis vos fichiers locaux.
Fonctionne sur toutes les configurations MacOS, CPU, Windows, Linux, WSL ! Aucun GPU requis
Utilisez Unsloth comme une inférence compatible OpenAI point de terminaison API ou connectez un fournisseur
Recherche + Téléchargement + Exécution + Comparer n'importe quel modèle comme des GGUF, des adaptateurs LoRA, des safetensors, etc.
Paramètre d'inférence automatique réglage (temp, top-p etc.) et modifiez les templates de chat
Téléchargez des images, de l'audio, des PDF, du code, des fichiers DOCX et bien d'autres types de fichiers avec lesquels discuter.

Utilisation de Unsloth Studio Chat
Unsloth Studio Chat fonctionne automatiquement sur des configurations multi-GPU pour l'inférence.
Exécution de code
Unsloth Studio permet aux LLM d'exécuter Bash et Python, pas seulement JavaScript. Il met aussi en bac à sable des programmes comme Claude Artifacts afin que les modèles puissent tester du code, générer des fichiers et vérifier les réponses avec de vrais calculs.
Cela rend les réponses des modèles plus fiables et plus précises.

Appel d'outils auto-réparateur
Unsloth Studio ne permet pas seulement l'appel d'outils, mais corrige aussi automatiquement les appels d'outils mal formés ou cassés de 50 %.
Cela signifie que vous obtiendrez toujours des sorties d'inférence sans appels d'outils cassés.
Par ex. Qwen3.5-4B a recherché plus de 20 sites web et cité des sources, la recherche web se déroulant à l'intérieur de sa trace de réflexion.

Recherche web avancée
La recherche web illimitée et sécurisée d'Unsloth visite réellement les pages directement pour collecter des informations et des données pertinentes, et ne se contente pas de parcourir les résumés des sites web. Cela fournit des résultats avec des informations et un contexte bien plus précis / approfondis. La recherche utilise l'API privée et sécurisée de DuckDuckGo.

Utilisez Unsloth comme un point de terminaison API
Vous pouvez maintenant utiliser des LLM locaux via des outils comme Claude Code et Codex en le connectant au point de terminaison API.

Paramètres d'inférence automatiques
Les paramètres d'inférence comme la température, le top-p, le top-k, MTP sont automatiquement préconfigurés pour les nouveaux modèles comme Qwen3.5 afin que vous puissiez obtenir les meilleurs résultats sans vous soucier des réglages. Vous pouvez aussi ajuster les paramètres manuellement et modifier le prompt système.
L'ajustement de la longueur du contexte n'est plus nécessaire avec le contexte automatique intelligent de llama.cpp, qui n'utilise que le contexte dont vous avez besoin sans charger quoi que ce soit en plus.

Connecter des fournisseurs
Unsloth se connecte à OpenAI, Anthropic, Ollama, llama.cpp, vLLM et à d'autres.
Ajoutez des clés API ou des URL de serveurs de modèles, puis utilisez des modèles externes dans la même interface de chat que les modèles locaux + cloud. Exécutez avec la mise en cache des prompts, l'appel d'outils, le raisonnement, et des fonctionnalités natives du fournisseur comme OpenAI's recherche web et exécution de code.

Rechercher et exécuter des modèles
Vous pouvez rechercher et télécharger n'importe quel modèle via Hugging Face ou utiliser des fichiers locaux.
Unsloth prend en charge un large éventail de types de modèles, notamment GGUF, les modèles vision-langage et de synthèse vocale. Exécutez les derniers modèles comme Qwen3.5 ou NVIDIA Nemotron 3.
Téléchargez des images, de l'audio, des PDF, du code, des fichiers DOCX et bien d'autres types de fichiers avec lesquels discuter.


+50 % de précision dans l'appel d'outils
Unsloth offre plusieurs fonctionnalités uniques qui améliorent l'appel d'outils, notamment :
Les appels d'outils sur tous les modèles dans Unsloth sont 30 % à 80 % plus précis.
La recherche web récupère le contenu web réel au lieu de seulement des résumés.
Le nombre maximal d'appels d'outils autorisés est supérieur à 25.
Les appels d'outils se terminent de manière plus fiable, réduisant les boucles et les appels répétés.
Une logique améliorée de réparation et de déduplication des appels d'outils aide à empêcher les fuites de XML dans les sorties.
Voir les résultats des tests avec unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) avec la recherche web, l'exécution de code et la réflexion activées :
Fuites de XML dans la réponse
10/10
0/10
Récupérations d'URL utilisées
0
4/10 exécutions
Exécutions avec les noms de chansons corrects
0/10
2/10
Moy. d'appels d'outils
5.5
3.8
Temps de réponse moyen
12,3 s
9,8 s
Arène des modèles
Unsloth Chat vous permet de comparer côte à côte n'importe quels deux modèles avec le même prompt. Par ex. comparez le modèle de base et l'adaptateur LoRA. L'inférence chargera d'abord un modèle, puis le second (l'inférence parallèle est en cours de développement).

Après l'entraînement, vous pouvez comparer le modèle de base et le modèle fine-tuned côte à côte avec le même prompt pour voir ce qui a changé et si les résultats se sont améliorés.
Ce flux de travail facilite l'observation de la manière dont votre fine-tuning a modifié les réponses du modèle et de savoir s'il a amélioré les résultats pour votre cas d'utilisation.

Unsloth Studio Chat fonctionne automatiquement sur des configurations multi-GPU pour l'inférence.
Utilisation d'anciens modèles GGUF / existants
Mise à jour du 1er avril : Vous pouvez maintenant sélectionner un dossier existant à partir duquel Unsloth doit détecter.
Mise à jour du 27 mars : Unsloth Studio détecte désormais automatiquement les modèles plus anciens / déjà existants téléchargés depuis Hugging Face, LM Studio, etc.

Instructions manuelles : Unsloth Studio détecte les modèles téléchargés dans le cache de votre Hugging Face Hub (C:\Users{your_username}.cache\huggingface\hub). Si vous avez téléchargé des modèles GGUF via LM Studio, notez qu'ils sont stockés dans C:\Users\{your_username}.cache\lm-studio\models OU C:\Users{your_username}\lm-studio\models et ne sont pas visibles par défaut par llama.cpp - vous devrez déplacer ou copier ces fichiers .gguf dans le répertoire de cache de votre Hugging Face Hub (ou dans un autre chemin accessible à llama.cpp) pour qu'Unsloth Studio les charge.
Après avoir fine-tuné un modèle ou un adaptateur dans Unsloth, vous pouvez l'exporter en GGUF et exécuter l'inférence locale avec llama.cpp directement dans Unsloth Chat. Unsloth Studio est propulsé par llama.cpp et Hugging Face.
Ajouter des fichiers comme contexte
Unsloth Chat prend en charge directement les entrées multimodales dans la conversation. Vous pouvez joindre des documents, des images ou de l'audio comme contexte supplémentaire pour un prompt.

Cela permet de tester facilement comment un modèle gère des entrées réelles telles que des PDF, des captures d'écran ou du matériel de référence. Les fichiers sont traités localement et inclus comme contexte pour le modèle.
Suppression des fichiers de modèle
Vous pouvez supprimer d'anciens fichiers de modèle soit depuis l'icône de la corbeille dans la recherche de modèles, soit en supprimant le dossier de cache du modèle concerné du répertoire de cache Hugging Face par défaut. Par défaut, Hugging Face utilise ~/.cache/huggingface/hub/ sur macOS/Linux/WSL et C:\Users\<username>\.cache\huggingface\hub\ sur Windows.
MacOS, Linux, WSL :
~/.cache/huggingface/hub/Windows :
%USERPROFILE%\.cache\huggingface\hub\
Si HF_HUB_CACHE ou HF_HOME est défini, utilisez cet emplacement à la place. Sur Linux et WSL, XDG_CACHE_HOME peut également modifier la racine du cache par défaut.
Unsloth ne détecte pas ou n'utilise pas mon GPU
Si le modèle n'utilise pas spécifiquement votre GPU pour Docker, essayez :
Tirez manuellement la dernière image :
Démarrez le conteneur avec l'accès au GPU :
docker run:--gpus allDocker Compose :
capabilities: [gpu]
Sur Linux, assurez-vous que le NVIDIA Container Toolkit est installé.
Sur Windows :
Vérifiez que
nvcc --versioncorrespond à la version CUDA indiquée dansnvidia-smi
Mis à jour
Ce contenu vous a-t-il été utile ?

