For the complete documentation index, see llms.txt. This page is also available as Markdown.

Entraîner et exécuter des modèles sur GPU AMD avec Unsloth

Unsloth prend désormais officiellement en charge le matériel AMD, ce qui facilite l’exécution, l’entraînement, le fine-tuning, l’apprentissage par renforcement et le déploiement de modèles localement sur des GPU AMD. Entièrement open source, Unsloth Studio fonctionne sous Windows, WSL et Linux, avec prise en charge des Radeon RX 9000 d’AMD, des GPU de centre de données Instinct MI350 et MI300, de Vulkan, des systèmes Ryzen AI Max propulsés par Strix Halo, et plus encore.

Nous avons collaboré avec AMD et notre communauté pour permettre un entraînement jusqu’à 2x plus rapide et 70 % de VRAM en moins pour tous les modèles, sans perte de précision. Si vous n’avez pas de GPU, Unsloth prend toujours en charge l’inférence native AMD pour Qwen3.6, Gemma 4, DeepSeek-V4, GLM 5.2, DiffusionGemma, Kimi K2.7 et d’autres modèles.

Démarrage rapideFonctionnalitésGitHub

Pour installer Unsloth Studio sur AMD, exécutez :

MacOS, Linux, WSL :

Windows PowerShell :

irm https://unsloth.ai/install.ps1 | iex 
Exemple de GLM-5.2 en 1 bit exécuté avec Unsloth

⭐ Fonctionnalités

Unsloth prend en charge à la fois l’inférence et l’entraînement pour AMD, donc si vous n’avez pas de GPU et seulement un CPU, vous pouvez quand même exécuter des modèles avec Unsloth. En utilisant Unsloth, vous obtenez :

  • Réparation des appels d’outils pour l’inférence afin d’augmenter la précision de 50 %, gratuit et illimité recherche web, canevas HTML, déploiement HTTPS sécurisé via Cloudflare et exécution de code tout fonctionne.

  • Entraînez des modèles Gemma 4 dans 8 Go de VRAM ou Qwen3.5 dans 3 Go de VRAM. Les noyaux Triton, les algorithmes mathématiques et les astuces mémoire permettent de réduire de 70 % l’utilisation de la VRAM pour AMD, sans perte de précision.

  • Jusqu’à 80 % de VRAM en moins pour l’apprentissage par renforcement comme GRPO. Et le partage des poids avec vLLM pour économiser 50 % d’utilisation mémoire.

  • Prise en charge optimisée de RDNA 3 et des GPU plus récents ainsi que des GPU de niveau centre de données. Strix Halo est également optimisé pour Linux, WSL et Windows.

  • Connectez vos modèles locaux à n’importe quel framework d’agent: Claude Code, Codex, Hermes, OpenClaw et plus encore.

  • Prise en charge de l’inférence et de l’entraînement pour presque tous les modèles, y compris les plus récents DeepSeek-V4, GLM-5.2, Kimi-K2.7, MiniMax M3, DiffusionGemma, Inkling et plus encore !

  • Prise en charge multi-GPU AMD + suivi de la VRAM/RAM. llama.cpp Les précompilés ROCm sont fournis chaque jour, afin que vous disposiez toujours des dernières mises à jour des modèles !

DiffusionGemma exécuté sur des GPU AMD

⚡Démarrage rapide

Unsloth installe automatiquement les meilleures versions ROCm pour PyTorch, les précompilés llama.cpp, bitsandbytes, les noyaux optimisés ROCm et Triton. Nous livrons aussi ensemble nos optimisations et correctifs AMD. Vous pouvez lire notre guide plus guide détaillé ici pour plus de détails.

Nous avons rendu les installations d’Unsloth fluides pour les personnes sur Windows et WSL — mais nous recommandons généralement d’utiliser directement Linux, car il offrira la prise en charge la plus large. Unsloth prend en charge MacOS, Linux, Windows, NVIDIA, Intel et les configurations CPU. Voir : Exigences d’Unsloth. Les commandes de mise à jour sont les mêmes !

MacOS, Linux, WSL :

Windows PowerShell :

Unsloth installera automatiquement ROCm, PyTorch, des précompilés personnalisés de llama.cpp et bien plus encore !

Accéder à Unsloth à distance

Nous avons aussi activé le tunneling HTTPS Cloudflare gratuitement — afin que vous puissiez accéder à Unsloth en toute sécurité via HTTPS à distance.

Installer Unsloth sur des machines Windows AMD

📥 Installer les notebooks Unsloth et l’installation pip

Si vous voulez des notebooks Unsloth simples, consultez le AMD guide d’installation général. Assurez-vous de lireAMD le guide d’installation ! Après l’avoir suivi pour installer PyTorch et ROCm, faites alors :

⏯️Unsloth Start

Unsloth Start vous permet de connecter Claude Code, Codex et d’autres agents à des modèles locaux via le unsloth start commande.

Démarrez Unsloth, ouvrez le dossier de votre projet, et exécutez :

Remplacez claude par l’un des agents ci-dessous :

Claude Code exécuté avec Qwen3.5 en local.
Agent
Commande

Claude Code

unsloth start claude

OpenAI Codex

unsloth start codex

Agent Hermes

unsloth start hermes

OpenClaw

unsloth start openclaw

OpenCode

unsloth start opencode

Les instances Claude sont toutes isolées
Codex exécutant unsloth/gemma-4-E2B-it dynamique en 4 bits

📊 Analyse AMD

Nous avons transféré bon nombre de nos optimisations développées pour les GPU non AMD afin de faire briller les GPU AMD ! Faire fonctionner l’entraînement AMD sur des appareils Windows et garantir la compatibilité avec presque tous les appareils AMD a demandé beaucoup de travail, mais nous sommes satisfaits de l’état actuel. Nous travaillons encore activement à rendre les GPU AMD encore meilleurs ! Ci-dessous figurent quelques analyses/benchmarks que nous avons menés sur un AMD MI300X.

Apprentissage par renforcement : LoRA et QLoRA plus précis

Lors de l’apprentissage par renforcement sur AMD, Unsloth prend en charge le partage des poids avec vLLM comme présenté dans RL économe en mémoire. Nous réduisons de moitié l’utilisation de la mémoire en accédant directement à l’allocation du modèle par vLLM.

Lors de LoRA et QLoRA, nous ne faisons pas non plus de fusion et de dé-fusion des poids LoRA comme ci-dessous :

W=W+sABinference=XWW=WsABW = W + sAB \\ \text{inference} = XW \\ W = W - sAB

Ce qui précède pose problème car les flottants IEEE ne sont pas associatifs en raison de l’arrondi. Lorsque W est en BF16, cela provoque de subtiles différences lors de la soustraction, comme dans d’autres moteurs RL. Cela signifie que, dans le monde IEEE :

W(W+sAB)(sAB)W \ne(W + sAB) - (sAB)

Et lorsque W est en bfloat16 avec peu de bits de mantisse, il arrondit les petits nombres à zéro. Comme A et B sont en float32 pendant LoRA, cela signifie que W peut dériver au fil du temps après fusion et dé-fusion. Unsloth utilise directement le chemin LoRA de vLLM, nous évitons donc cela. Les poids de base ne sont jamais modifiés et ne dériveront jamais.

Apprentissage par renforcement plus rapide

Nous avons comparé d’autres configurations avec FA2 et vLLM co-localisés. Les deux utilisent vLLM pour la génération, Unsloth déplace une plus grande partie de l’étape vers la génération tout en rendant l’entraînement environ 2x plus rapide.

Les trois benchmarks sont reproductibles : mêmes graines, mêmes budgets de jetons, et les courbes de perte correspondent entre les deux piles.

Entraînement plus rapide et plus économe en mémoire

Sur le LoRA SFT Llama-3.1-8B (batch 2 x grad-accum 4 x 2048 = 16 384 jetons/étape, empaqueté), Unsloth s’entraîne à 2.07 s/étape contre 2.87 s/étape pour TRL + FA2, et atteint un pic à 18.3 Go contre 24.3 Go. Cela représente 1.39x plus rapide et 1.33x moins d’utilisation mémoire, sans changement de précision. Nous prévoyons d’améliorer encore cela !

Les économies de mémoire ne se limitent pas à un pic plus bas, elles se maintiennent pendant toute l’exécution. En échantillonnant la VRAM allouée toutes les 0.1 s, Unsloth reste plat et bas tout du long, tandis que d’autres configurations + FA2 montent jusqu’à 22.8 Go à presque chaque étape et mettent plus de temps à finir (75 s contre 56 s pour les mêmes 25 étapes).

Matériel AMD pris en charge

La prise en charge AMD d’Unsloth se concentre sur les GPU grand public, workstation et centre de données les plus courants. La prise en charge de l’entraînement, d’Unsloth Studio et de l’inférence GGUF/llama.cpp peut varier selon l’architecture, donc le tableau ci-dessous sépare la prise en charge optimisée des chemins de compatibilité.

Architecture
Série
gfx
Prise en charge
Plateforme

RDNA 4

Série Radeon™ RX 9000

gfx1200, gfx1201

Complète

Windows + WSL + Linux

RDNA 3.5

Ryzen AI 300 / Ryzen AI MAX (Strix Halo)

gfx1150, gfx1151, gfx1152

Complète

Windows + WSL + Linux

RDNA 3

Série Radeon™ RX 7000

gfx1100, gfx1101, gfx1102

Complète

Windows + WSL + Linux

RDNA 2

Série Radeon™ RX 6000

gfx1030 uniquement

Presque

Windows + WSL + Linux

CDNA 4

GPU de la série Instinct™ MI350

gfx950

Complète

Linux uniquement

CDNA 3

GPU de la série Instinct™ MI300

gfx940, gfx941, gfx942

Complète

Linux uniquement

CDNA 2

GPU de la série Instinct™ MI200

gfx90a

Complète

Linux uniquement

Nous travaillons activement à prendre en charge davantage de GPU AMD, cependant les plus anciens n’ont malheureusement pas la prise en charge matérielle requise pour que nous puissions travailler dessus.

🖥️ Guide d’utilisation d’Unsloth sur AMD

Après l’installation, vous pouvez ouvrir Unsloth Studio dans votre navigateur. À partir de là, vous pouvez exécuter et affiner automatiquement des LLM locaux sur du matériel AMD. Voir ci-dessous pour des instructions d’installation détaillées :

Guide d’installation AMDInstaller Unsloth Studio

Sélectionnez votre modèle, votre jeu de données et vos paramètres d’entraînement pour commencer. Par exemple, vous pouvez exécuter un fine-tuning QLoRA 4 bits sur Gemma 4 12B avec une longueur de contexte d’environ 16k, un rang LoRA de 16, un taux d’apprentissage de 0.0002 et 30 étapes max.

L’écran de fine-tuning d’Unsloth Studio est entièrement personnalisable, vous permettant de configurer votre modèle, votre jeu de données et vos paramètres d’entraînement. Pendant l’entraînement, Unsloth suit la progression en temps réel, y compris la perte, l’utilisation de la RAM et de la VRAM, ainsi que la prise en charge du multi-GPU. Une fois l’entraînement commencé, vous verrez la progression tracée en temps réel.

Après l’entraînement, vous pouvez consulter votre historique pour voir les sessions d’entraînement passées et actives. Sélectionnez l’un de vos modèles affinés pour voir les journaux d’entraînement passés :

Lorsque l’entraînement est terminé, exportez votre modèle au format GGUF, en safetensors pour modèle fusionné, ou en adaptateur LoRA pour un déploiement avec Hugging Face, llama.cpp, vLLM ou Unsloth. Pour les exports GGUF, Unsloth utilise des précompilés llama.cpp ROCm adaptés à votre architecture gfx, avec une compilation depuis les sources en solution de repli lorsqu’aucun précompilé n’est disponible. Une fois l’export terminé, vous verrez « Export terminé avec succès ». Vous pouvez aussi pousser votre modèle directement vers le Hub Hugging Face.

Exportez votre modèle dans le format de votre choix et déployez-le partout. Après l’export, chargez votre modèle affiné depuis la section Affiné du menu déroulant des modèles dans Nouvelle discussion ou Récents.

Sélectionnez votre modèle affiné dans le menu déroulant et discutez directement avec lui dans Unsloth. Vous pouvez désormais utiliser vos modèles entraînés ou téléchargés dans Nouvelle discussion, Récents ou Projets. Activez les bascules think, code et search pour une meilleure expérience, et consultez le Unsloth Studio Chat la documentation pour plus de détails.

Et enfin, vous pouvez discuter directement dans Unsloth avec votre modèle nouvellement affiné !

Vous pouvez également surveiller le débit et les jetons de génération / s dans le terminal, comme avec la journalisation vLLM. Vous verrez "gen_tok_s" qui correspond aux jetons / s et "prompt_tok_s" qui correspond au traitement du prompt.

📱Unsloth sur les téléphones et le tunneling HTTPS à distance

Nous avons ajouté gratuit des tunnels HTTPS Cloudflare gratuits pour Unsloth (similaires à LM Link), afin que vous puissiez discuter / entraîner des modèles à distance avec Unsloth sur votre téléphone (iPhone, Android - n’importe quel téléphone !) via un lien ou n’importe quel autre ordinateur ! Cela fonctionne sur les appareils Mac, Linux, WSL et Windows.

  • Entraînez et affineez depuis votre téléphone / à distance avec des journaux de perte d’entraînement en direct - annulez ou réentraînez !

  • Discutez dans le navigateur depuis n’importe où avec appels d’outils et streaming en direct.

  • Réel canevas HTML interactif affichés directement sur votre téléphone - jouez à des jeux créés par des LLM !

Discutez à distance !
Inférence en direct + appels d’outils
Journaux d’entraînement à distance !
Exécutez du HTML en direct sur le téléphone

Pour la configuration, d’abord dans le terminal après avoir installé Unsloth, tapez unsloth studio --secure . Définissez un mot de passe afin que personne non autorisée ne puisse accéder au lien HTTPS !

Puis dans les journaux - utilisez le lien Cloudflare vert et saisissez-le sur votre téléphone ou sur n’importe quel appareil distant !

Et vous y êtes ! Vous pouvez toujours surveiller / annuler le lien HTTPS en direct en faisant CTRL+C dans le terminal où Unsloth Studio a été lancé !

Modifier les paramètres d’inférence
Modifier temp, top_p, longueur ctx
Le canevas rend automatiquement le HTML !

Comment la prise en charge AMD a été développée pour Unsloth

Les noyaux personnalisés d’Unsloth ont été portés sur AMD en étroite collaboration avec l’équipe AMD. Cela a nécessité des modifications dans l’installeur, la détection du matériel, l’aiguillage à l’exécution, la surveillance et la sélection des ressources précompilées.

  • Noyaux ROCm : Ports HIP/Triton ajustés pour RDNA et CDNA, avec des correctifs de précision, de performances et de stabilité spécifiques à l’architecture. (#2520)

  • Entraînement 4 bits : Prise en charge QLoRA basée sur bitsandbytes pour les GPU Radeon et CDNA. (#3748)

  • Configuration automatique : détection robuste des GPU AMD et installation du bon wheel PyTorch ROCm, y compris des garde-fous de réparation et de plateforme. (#4770)

  • Windows et Strix Halo : installation native de ROCm sous Windows, correctifs de compatibilité à l’exécution, rapport de mémoire unifiée et prise en charge de WSL. (#5301, #6227)

  • Inférence ROCm : précompilés llama.cpp spécifiques à l’architecture, solution de repli de compilation depuis les sources, détection de la VRAM AMD et surveillance. (#5172)

🕐 Travaux futurs

Merci infiniment à l’équipe AMD d’avoir collaboré avec nous pour faire fonctionner AMD correctement ! Les priorités à venir incluent :

  • Poursuite du développement et de l’engagement avec l’équipe AMD.

  • CI/CD matériel élargie en utilisant le matériel AMD Strix Halo et Radeon Lab.

  • Prise en charge des nouvelles cartes GPU AMD et des nouvelles architectures à leur sortie.

  • Conseils multi-GPU plus clairs : l’entraînement distribué AMD est actuellement uniquement disponible sous Linux. Sous Linux, ROCm utilise RCCL, donc l’entraînement distribué fonctionne. Sous Windows, AMD ROCm ne fournit pas encore de backend de collectifs GPU, avec une prise en charge GLOO/CPU uniquement à la date de TheRock #5694, utilisez Linux si vous prévoyez de faire de l’entraînement multi-GPU AMD.

  • Optimisations de vitesse supplémentaires concernant la pile ROCm.

💌 Merci à AMD d’avoir collaboré !

Merci infiniment à l’équipe AMD et à notre incroyable communauté Unsloth d’avoir collaboré avec nous sur cette version. Nous remercions Strahinja Stamenkovic, Filip Jankovic, Iswarya Alex, Yue Yuan Bill He, Eda Zhou, Mahdi Ghodsi, Guruprasad et toute l’équipe AMD pour avoir collaboré à faire en sorte que la prise en charge d’AMD fonctionne parfaitement avec Unsloth ! Un grand merci également aux membres de la communauté : Nate, UBER6, AiwendilOfMirk..., Gene, Jimster480, VELICAN, Vintheboy, archmaker, BichonFriseMax, Calandracas, Chigoma333, Edd, electroglyph, jslowbell, mk 27B UD-, Satyam, snapcast3r, TotoMC pour les tests et le débogage avec nous.

Une façon simple d’utiliser Unsloth sur AMD est via AMD Developer Cloud, avec des notebooks en un clic propulsés par des GPU MI300X avec 192 Go de VRAM. AMD offre également des crédits gratuits via le AMD AI Developer Program. Pour exécuter un notebook Unsloth, utilisez n’importe quel notebook AMD de unslothai/notebooks et remplacez le domaine GitHub par l’URL du AMD Developer Cloud, puisque les chemins des notebooks sont les mêmes.

Besoin d’aide ou envie de partager vos retours ? Vous pouvez rejoindre notre Discord, lisez les docs AMD, ouvrez un ticket ou une PR sur GitHub, ou publiez sur notre Reddit r/unsloth.

Mis à jour

Ce contenu vous a-t-il été utile ?