Ajuster des LLMs sur des GPU Intel avec Unsloth
Découvrez comment entraîner et ajuster de grands modèles de langage sur des GPU Intel.
Vous pouvez maintenant affiner des LLMs sur votre appareil Intel local avec Unsloth ! Lisez notre guide pour savoir exactement comment commencer à entraîner votre propre modèle personnalisé.
Avant de commencer, assurez-vous d'avoir :
GPU Intel : Data Center GPU Max Series, Arc Series ou Intel Ultra AIPC
OS : Linux (Ubuntu 22.04+ recommandé) ou Windows 11 (recommandé)
Windows uniquement : Installez Intel oneAPI Base Toolkit 2025.2.1 (sélectionnez la version 2025.2.1)
Pilote graphique Intel : Dernier pilote recommandé pour Windows/Linux
Python : 3.10+
Construire Unsloth avec le support Intel
Commencez l'affinage.
Vous pouvez utiliser directement nos carnets ou consulter notre guide d'affinage ou apprentissage par renforcement guides.
Windows uniquement - Configurations d'exécution
Dans l'invite de commandes avec les privilèges Administrateur, activez la prise en charge des chemins longs dans le registre Windows :
powershell -Command "Set-ItemProperty -Path "HKLM:\\SYSTEM\\CurrentControlSet\\Control\\FileSystem" -Name "LongPathsEnabled" -Value 1Cette commande n'a besoin d'être définie qu'une seule fois sur une machine. Elle n'a pas besoin d'être configurée avant chaque exécution. Ensuite :
Téléchargez level-zero-win-sdk-1.20.2.zip depuis GitHub
Décompressez le level-zero-win-sdk-1.20.2.zip
Dans l'invite de commandes, sous l'environnement conda unsloth-xpu :
Exemple 1 : Affinage QLoRA avec SFT
Cet exemple montre comment affiner un modèle Qwen3-32B en utilisant QLoRA 4 bits sur un GPU Intel. QLoRA réduit considérablement les besoins en mémoire, ce qui rend possible l'affinage de grands modèles sur du matériel grand public.
Exemple 2 : Apprentissage par renforcement GRPO
GRPO est une apprentissage par renforcement technique pour aligner les modèles de langage sur les préférences humaines. Cet exemple montre comment entraîner un modèle à suivre un format de sortie XML spécifique en utilisant plusieurs fonctions de récompense.
Qu'est-ce que GRPO ?
GRPO améliore le RLHF traditionnel en :
Utilisant une normalisation basée sur des groupes pour un entraînement plus stable
Prenant en charge plusieurs fonctions de récompense pour une optimisation multi-objectifs
Étant plus économe en mémoire que PPO
Dépannage
Erreurs de manque de mémoire (OOM)
Si vous manquez de mémoire, essayez ces solutions :
Réduire la taille du lot : Réduire
per_device_train_batch_size.Utiliser un modèle plus petit : Commencez par un modèle plus petit pour réduire les besoins en mémoire.
Réduire la longueur de séquence : Réduire
max_seq_length.Réduire le rang LoRA : Utiliser
r=8au lieu der=16our=32.Pour GRPO, réduisez le nombre de générations : Réduire
num_generations.
(Windows uniquement) Mémoire partagée iGPU Intel Ultra AIPC
Pour Intel Ultra AIPC avec des pilotes GPU récents sous Windows, la mémoire GPU partagée pour le GPU intégré est généralement définie par défaut sur 57% de la mémoire système. Pour des modèles plus grands (par ex., Qwen3-32B), ou lors de l'utilisation d'une longueur de séquence maximale plus longue, d'une taille de lot plus grande, d'adaptateurs LoRA avec un rang LoRA plus élevé, etc., pendant l'affinage, vous pouvez augmenter la VRAM disponible en augmentant le pourcentage de mémoire système alloué à l'iGPU.
Vous pouvez ajuster cela en modifiant le registre :
Chemin :
Computer\HKEY_LOCAL_MACHINE\SYSTEM\CurrentControlSet\Control\GraphicsDrivers\MemoryManagerClé à modifier :
SystemPartitionCommitLimitPercentage(définir sur un pourcentage plus élevé)
Mis à jour
Ce contenu vous a-t-il été utile ?

