> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/nouveau/changelog.md).

# Mises à jour d'Unsloth

Journal des modifications Unsloth pour nos dernières versions, améliorations et correctifs.

Pour utiliser les dernières modifications, [mettez à jour Unsloth](/docs/fr/nouveau/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-09-17" tags="new-releases" %}

## Docker + prise en charge Multiutilisateur + AMD

Nous publions notre nouvelle image Docker mise à jour, ainsi que des comptes multiutilisateurs, la prise en charge des diffusions FP8/INT8 pour RDNA1+2, la prise en charge CUDA Windows ARM64 et de nombreuses améliorations de l’entraînement, du GRPO et de l’inférence

#### Points forts :

* Docker mis à jour avec prise en charge NVIDIA et AMD : [Guide](https://unsloth.ai/docs/get-started/install/docker)
* Comptes multiutilisateurs avec isolation : **Paramètres > Comptes**
* Inférence de diffusion d’images INT8/FP8 : 2x plus rapide
* Prise en charge CUDA Windows ARM64 pour l’entraînement et l’inférence
* GRPO : prise en charge de Qwen3.5 et des dernières versions de TRL/vLLM
* Prise en charge AMD RDNA1 et RDNA2
* Meilleure détection et récupération des GPU NVIDIA sous Windows

#### Image Docker mise à jour

* Image CUDA mise à jour et configuration de Studio, caches intégrés supprimés et correctifs d’entraînement d’Unsloth restaurés sur les hôtes GPU.
* Les données de Studio persistent sur un volume sans figer le code de l’application. Mises à jour améliorées, mots de passe générés, ports configurables et préservation des paquets.
* Une image AMD ROCm a été ajoutée pour les hôtes Linux pris en charge.

#### Comptes multiutilisateurs

* Créez des comptes dans **Paramètres > Comptes** avec des codes de configuration à usage unique et des mots de passe individuels.
* Les comptes gardent le travail séparé tout en partageant un modèle chargé lorsque les paramètres correspondent. Le comportement d’un seul compte reste inchangé.

#### Chat + raisonnement

* Modifiez, réordonnez et dirigez les prompts en file d’attente, même pendant le chargement d’un modèle local.
* Ajout des budgets de raisonnement GGUF, de la largeur de chat ajustable, de la mise à l’échelle du bureau et d’un compositeur compact.
* Amélioration de la réactivité lors des raisonnements longs, de la conservation de l’historique du chat et de la gestion des fichiers et images générés par les outils.

#### Matériel + inférence

* MLX gagne la prise en charge des entrées vidéo, des optimisations MoE et de décodage optionnelles, ainsi que des chats multimodaux plus fiables.
* Estimations mémoire GGUF améliorées, gestion de DGX Spark, détection NVIDIA, vérifications NVLink et ordre des GPU sélectionné par l’utilisateur améliorés.
* Ajout de l’empaquetage natif du bureau Windows ARM64, de Qwen3.5 `fast_inference` et de la détection de NPU Ascend.

#### Recherche + API

* Deep Research préserve mieux les rapports inachevés, gère la sortie JSON et signale les exécutions sans preuve. Les téléversements de PDF numérisés bénéficient d’un repli OCR local.
* Contrôles de raisonnement des fournisseurs améliorés, compatibilité MCP, appel d’outils et signalement d’erreurs en flux améliorés.
* Ajout de `/v1/chat/completions` l’entrée vidéo et l’accès API aux modèles Ollama installés.

#### Entraînement + installation

* Ajout des téléchargements de jeux de données Data Recipes et correction des exports de fine-tuning 16 bits, des sauvegardes LoRA et de Push to Hub.
* Gestion des jeux de données améliorée, estimations mémoire d’entraînement et sauvegardes de points de contrôle à l’arrêt du conteneur. Les corrections de base couvrent la normalisation, RoPE, Q-GaLore et la sélection distribuée des périphériques.
* Installations Windows améliorées, réparation des paquets GPU, mise en cache des dépendances et installations hors ligne vérifiées.

#### Sécurité + exécution d’outils

* Protection des identifiants et validation des appels d’outils renforcées, avec demandes d’approbation pour l’accès aux fichiers en dehors du sandbox.
* Ajout d’un sandboxage préliminaire des outils au niveau du système d’exploitation sur les hôtes Linux et macOS pris en charge. L’accès réseau reste non restreint ; le mode automatique conserve les protections existantes lorsque l’isolation du système d’exploitation n’est pas disponible.

<a href="/docs/fr/commencer/install/docker.md" class="button primary">Guide Docker</a>
{% endupdate %}

{% update date="2026-09-02" tags="new-releases" %}

## Qwen3.8-Flash + GLM-5.3 2x plus rapides

Exécuter [**Qwen3.8-Flash-Next**](/docs/fr/modeles/qwen3.8-next.md) et [**GLM-5.3-Flash**](/docs/fr/modeles/glm-5.3-flash.md) jusqu’à **2× plus rapide** avec un décodage plus rapide et MTP bonus, désormais activé par défaut. Cette version inclut également **plus de 170 améliorations** dans l’entraînement, le chat, la prise en charge matérielle, les API et les performances.

* Génération Qwen et GLM plus rapide avec MTP, ainsi qu’une meilleure utilisation des outils et des paramètres Qwen recommandés.
* UI/UX beaucoup moins lente pour tous les chats, en particulier les longues conversations
* Nouvelle prise en charge de **MiniMax-Music3, Higgs et MOSS** modèles audio, y compris le suivi de progression et la gestion des clips.
* Chargement de modèles plus fiable sur les serveurs locaux et les fournisseurs connectés.
* Édition de chat plus sûre qui préserve les appels d’outils, les réponses, les médias et les branches de conversation.
* Entraînement multi-GPU, ajustement mémoire, placement des modèles et exports GGUF améliorés.
* Installation AMD/ROCm, détection et compatibilité GPU renforcées.
* MCP, Deep Research, OAuth, appels d’outils parallèles et workflows d’agent plus fiables.
* Nouvelles API compatibles OpenAI pour **les modèles vidéo, audio et servis via MLX**.
* Mises à jour du bureau, contrôles de port LAN, téléchargements et nettoyage de la mémoire GPU améliorés.

<a href="/docs/fr/modeles/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/fr/modeles/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/fr/modeles/glm-5.3.md" class="button primary">GLM-5.3</a>
{% endupdate %}

{% update date="2026-08-27" tags="new-releases" %}

## Qwen3.8-Flash-Next + GLM-5.3

[Qwen3.8-Flash-Next](/docs/fr/modeles/qwen3.8-next.md), [GLM-5.3-Flash](/docs/fr/modeles/glm-5.3-flash.md) + [GLM-5.3](/docs/fr/modeles/glm-5.3.md) peut désormais s’exécuter localement dans Unsloth !

* Qwen3.8-Flash s’exécute avec 75 Go de RAM
* GLM-5.3-Flash s’exécute avec 102 Go de RAM + VRAM
* Jusqu’à 5x plus rapide pour le déchargement de la RAM
* La compaction automatique répétée fonctionne désormais de manière fiable
* Plus de 100 améliorations du chat, de la fiabilité et des performances

<a href="/docs/fr/modeles/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/fr/modeles/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/fr/modeles/glm-5.3.md" class="button primary">GLM-5.3</a>

<div align="left"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1YneA51oWzaIiwep9H5I%2F1000024423.gif?alt=media&amp;token=40a169cc-12f1-403a-898c-b310f81ff52a" alt="" width="375"><figcaption></figcaption></figure></div>

#### Qwen3.8-Flash-Next

Modèle de raisonnement multimodal 125B et aperçu initial de l’architecture de Qwen4.

* Le GGUF dynamique 1 bit s’exécute avec 75 Go de RAM ou une mémoire unifiée
* Jusqu’à 262K de contexte avec du texte et des images
* Modes de raisonnement Aucun, Faible, Moyen et Très élevé
* Le Thinking conservé améliore la cohérence dans les longues conversations

#### GLM-5.3-Flash

Modèle multimodal 320B avec 18B de paramètres actifs.

* Le modèle 1 bit s’exécute avec 102 Go de RAM + VRAM combinées
* Jusqu’à 1M de contexte pour le texte, les images et les documents
* Modes de raisonnement Faible, Élevé et Max
* Performances améliorées en codage, agent et vision

#### Améliorations d’Unsloth

* Les gros GGUF sont automatiquement répartis entre le GPU et la RAM système
* Voir les estimations mémoire avant le chargement
* Les chats se rétablissent après les déconnexions
* Meilleure prise en charge de la vision multi-image et des images MCP
* Exporter les chats au format JSONL
* Contrôles de compaction automatique améliorés
* Correctifs pour Linux, NVIDIA Wayland, AMD et Windows

Pour exécuter ou entraîner les nouveaux modèles, vous pouvez télécharger Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-20" tags="new-releases" %}

## Compaction automatique + accès LAN

Merci pour votre soutien à Qwen3.8-27B et à Unsloth Desktop la semaine dernière ! Pour notre [nouvelle `v0.1.801-beta` version](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta), nous avons fusionné plus de 200 PR pour introduire de nombreuses nouvelles fonctionnalités et corrections, notamment :

* **Compaction automatique (expérimental)** pour les conversations plus longues au-delà des limites de contexte
* [**Accès à distance et LAN (aperçu)**](/docs/fr/notions-de-base/lan.md) pour un accès réseau facile sans liens Cloudflare
* **Chat plus rapide** - Amélioration des performances de streaming, réduction du lag de l’interface et conversations longues plus fluides.
* Prise en charge de **compilations personnalisées de llama.cpp**. Bascule pour Cache RAM, Mmap, Mlock, Checkpoints, Spe Decoding KV Cache, Vision activée / désactivée
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) est publié. Les nouveaux GGUF dynamiques v3.0 de Qwen3.8-27B offrent une précision top-1 supérieure de plus de 10 % par rapport à tous les autres. Compatible avec Unsloth.

#### Compaction automatique (expérimental)

Les longues conversations peuvent désormais dépasser les limites de contexte en déplaçant les anciens tours dans une archive consultable.

* Les anciens tours ne sont supprimés qu’en cas de besoin et restent consultables.
* De nouveaux époques de contexte améliorent la restitution sans tronquer définitivement les conversations.
* Utilise la recherche plutôt que la synthèse pour une meilleure précision.

#### Accès à distance et LAN (aperçu)

Accédez à Unsloth depuis d’autres appareils sur votre réseau.

* Nouveaux paramètres d’accès à distance.
* Contrôle LAN, codes QR et options de démarrage automatique.
* Désactivé par défaut pour des raisons de sécurité.

#### Améliorations du chat

* Conversations longues plus rapides et threading amélioré.
* Les projets organisent les chats, les fichiers et les espaces de travail.
* Ajout de la mise en file d’attente des prompts, de raccourcis, `edit_file` et d’une meilleure prise en charge des outils.

#### Matériel, inférence, API

* Prise en charge de compilations personnalisées de llama.cpp et d’Intel XPU.
* Plus de contrôles d’inférence (cache, mmap, mlock, points de contrôle, décodage spéculatif, vision).
* Validation GPU, gestion de la VRAM et compatibilité améliorées.
* Sorties structurées dans l’API Responses.
* Meilleure reprise de llama-server.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B et Qwen3.8-2.4T peuvent désormais être exécutés localement dans Unsloth !

Exécution sur 17 Go de RAM via les GGUF dynamiques Unsloth. Vous pouvez également affiner Qwen3.8-27B dans Unsloth. Qwen3.8-27B est de loin le modèle le plus puissant pour sa taille. Nous avons également téléversé les quants NVFP4.

<a href="/docs/fr/modeles/qwen3.8.md" class="button primary">Guide pour exécuter Qwen3.8</a><a href="/docs/fr/modeles/muse-glimmer/train.md" class="button secondary">Affiner Muse Glimmer</a>

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FSqxs6NjShWrLfRKhDy1m%2Fvolcano%202.gif?alt=media&amp;token=395274a0-b437-403a-8a01-8e8502f9d225" alt="" width="375"><figcaption></figcaption></figure>

Les autres mises à jour d’Unsloth incluent :

* Qwen3.8-27B + arguments supplémentaires de llama-server autorisés + bascule VRAM personnalisée
* Le fournisseur externe dispose de l’appel d’outils + prise en charge des outils + connexion avec Codex
* Inférence MiniMax-H3 10x plus rapide grâce à FP8 rapide (3 minutes contre 30)
* Inférence 10 % plus rapide pour les GGUF + contournement des autorisations corrigé
* Connectés [Fournisseurs d’API](/docs/fr/integrations/connections.md) peuvent utiliser leur propre Search ou la recherche et les outils intégrés d’Unsloth Desktop. Les résultats des outils sont renvoyés au modèle afin qu’il puisse poursuivre des tâches en plusieurs étapes.
* Connectez-vous avec un abonnement Codex et utilisez les outils Codex dans Chat.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## Présentation d’Unsloth Desktop

Présentation d’Unsloth Desktop 🦥 - la première application de bureau permettant d’exécuter et d’entraîner des modèles localement.\
Open source. Fonctionne sur Mac, Windows et Linux

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FyUdniXManojk20Q3M5Lf%2Fintroducing%20unsloth%20desktop%20thumb.png?alt=media&amp;token=5ecd2f25-b996-4749-8242-ffd21b080ae7" alt=""><figcaption></figcaption></figure>

• Prend en charge MLX, la diffusion d’images/vidéos, l’audio, GGUF\
• Connectez Claude Code et Codex aux LLM locaux\
• Appels d’outils 50 % plus précis, avec auto-réparation + exécution de code dans un bac à sable\
• Fonctionne sur les configurations CPU + multiGPU - NVIDIA, AMD, Intel, Mac\
• Entraînez des modèles 2× plus vite avec 70 % de VRAM en moins\
• Recherche web privée, recherche approfondie, RAG, MCP + exports (NVFP4, GGUF)\
• Utilisez l’API compatible OpenAI d’Unsloth et les modèles cloud\
• Déployez des LLM à distance en toute sécurité et accédez-y partout

Vous pouvez télécharger Unsloth Desktop dès maintenant :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer est arrivé !

Meta a publié Muse Glimmer, le premier modèle ouvert de Meta Superintelligence Labs. Muse Glimmer est un modèle dense de 30B paramètres de Meta, conçu pour les workflows locaux d’agent et de codage. Publié sous licence Apache 2.0, vous pouvez exécuter Muse Glimmer 30B via Unsloth et les quantifications dynamiques Unsloth pour les meilleures performances.

<a href="/docs/fr/modeles/muse-glimmer.md" class="button primary">Exécuter Muse Glimmer</a><a href="/docs/fr/modeles/muse-glimmer/train.md" class="button secondary">Affiner Muse Glimmer</a>

Muse Glimmer 30B peut s’exécuter localement sur **20 Go de RAM/VRAM** des configurations, y compris Mac et GPU. Vous pouvez également entraîner et affiner Muse Glimmer 30B avec Unsloth sur **20 Go de VRAM**.

Vous pouvez exécuter et affiner Muse Glimmer via l’application Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + Deep Research + Chat parallèle

Salut tout le monde ! [Kimi K3](/docs/fr/modeles/kimi-k3.md) peut désormais s’exécuter localement avec les GGUF dynamiques Unsloth, Unsloth peut conserver plusieurs chats en génération parallèle, et le nouveau mode Deep Research planifie, lit et cite les sources à l’aide de votre modèle local.

Cette version apporte également de meilleures [AMD](/docs/fr/notions-de-base/amd.md) et la prise en charge des GPU Intel, l’entraînement DoRA, ainsi que de nombreux correctifs pour l’installateur, MLX, l’export et l’inférence.

#### Kimi K3

de Moonshot AI **Kimi K3** est un modèle MoE de 2,8T de paramètres avec 104B de paramètres actifs, la prise en charge native de la vision et une fenêtre de contexte de 1M. Kimi K3 pense uniquement, et Unsloth prend en charge les efforts de raisonnement faibles, élevés et maximaux.

Vous pouvez exécuter nos [GGUF dynamiques Kimi K3](https://huggingface.co/unsloth/Kimi-K3-GGUF) via Unsloth. Unsloth détecte automatiquement les configurations multi-GPU et peut décharger les couches du modèle vers la mémoire système.

Kimi K3 est un modèle très volumineux, alors planifiez votre matériel en conséquence :

* `UD-IQ1_S` occupe 595 Go d’espace disque.
* `UD-Q4_K_XL` occupe 1,51 To d’espace disque.
* Pour une inférence sans perte, utilisez `UD-Q8_K_XL`, qui occupe 1,56 To d’espace disque.

Lisez notre guide complet [pour Kimi K3](https://unsloth.ai/docs/models/kimi-k3) et en savoir plus sur [les GGUF dynamiques Unsloth 2.0](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### Chat parallèle

Unsloth peut désormais exécuter plusieurs conversations à la fois. Le lancement d’un **Nouveau chat** laisse la réponse précédente en génération, et chaque conversation active reçoit son propre indicateur de progression et son propre contrôle Stop.

* 4 emplacements llama-server par défaut, ajustables dans l’interface web.
* Les outils, téléversements, auto-réparation et agents restent isolés entre les chats.
* Arrêtez un chat sans interrompre les autres ni redémarrer le serveur.
* Unsloth réduit le nombre d’emplacements lorsque la mémoire est limitée.
* Le rechargement du modèle arrête toujours les chats actifs après confirmation.

#### Deep Research

Deep Research transforme un modèle local en un workflow de recherche complet. Donnez-lui une question et il créera un plan, cherchera sur le web, organisera les preuves et produira un rapport cité.

* Révisez et modifiez le plan avant le début de la recherche.
* Suivez sa progression et les sources collectées pendant qu’il travaille.
* Reprenez ou annulez sans perdre les recherches déjà effectuées.
* Autorisez ou bloquez des sites web pour contrôler la sélection des sources.
* Les sources et les citations restent enregistrées avec chaque exécution.
* Avant d’écrire, Unsloth vérifie les affirmations non prises en charge, les contradictions et les lacunes non résolues. Les recommandations sans preuve directe sont marquées comme des inférences testables.

Une seule exécution peut être active par chat. Deep Research fonctionne actuellement avec des modèles locaux. Un grounding optionnel sur page entière peut lire les principaux résultats de recherche dans un RAG temporaire avant la synthèse ; activez-le avec `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`. Il reste désactivé par défaut car il ajoute du temps de scraping et nécessite un contexte supplémentaire.

#### Prise en charge AMD améliorée

Cette mise à jour s’appuie sur notre [guide de lancement et de configuration AMD](https://unsloth.ai/docs/basics/amd) initial avec la prise en charge de davantage de GPU et une inférence et un entraînement ROCm plus fiables.

* Détection améliorée des GPU RDNA2, Radeon, Ryzen, Strix Halo et station de travail.
* MI50 et Radeon VII prennent en charge le LoRA 16 bits et le fine-tuning complet sous Linux.
* Correction des NaN 4 bits, des conflits de bibliothèques et des longs blocages au démarrage RDNA.
* Les GPU HIP Windows non pris en charge peuvent se replier sur Vulkan.
* Les périphériques Vulkan affichent leurs vrais noms et peuvent être sélectionnés individuellement.
* Les installations Windows propres ne nécessitent plus Winget ni d’outils de développement.

#### Mises à jour de l’entraînement, des modèles et de la plateforme

* Intel XPU permet le chat local et l’entraînement sur les GPU Intel Arc et Data Center.
* DoRA est disponible en plus de LoRA et du fine-tuning complet.
* Les gros exports peuvent utiliser tous les GPU visibles pour éviter les limites de mémoire du GPU 0.
* MLX ajoute des jeux de données en streaming, le préentraînement continu, des callbacks et une meilleure prise en charge de VLM et LoRA.
* Correction d’un `flash_attention_2` sortie du modèle.
* Unsloth et les utilitaires de sauvegarde fonctionnent désormais sans bitsandbytes.
* Correction de `.json` jeux de données et configuration du notebook Qwen3.5/3.6 MoE et GRPO.
* Les dossiers de téléchargement Hub sont plus faciles à trouver et à ouvrir.
* Les notes de version sont disponibles dans la fenêtre contextuelle de mise à jour d’Unsloth.
* `unsloth start --as-subagent` permet à Codex, Claude Code et Pi de déléguer des tâches à un modèle Unsloth local.
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## La prise en charge AMD est là !

Salut tout le monde ! Cette version apporte l’entraînement et l’inférence LLM locaux sur [les GPU AMD](/docs/fr/notions-de-base/amd.md) sous Windows, WSL et Linux.

<a href="/docs/fr/notions-de-base/amd.md#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Démarrage rapide</a><a href="/docs/fr/notions-de-base/amd.md#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Fonctionnalités</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

À partir d’aujourd’hui, notre collaboration AMD, les noyaux Triton personnalisés et les algorithmes mathématiques vous permettent d’entraîner et d’exécuter plus de 500 modèles sur les GPU Radeon, Instinct, Vulkan, Ryzen et data center d’AMD, jusqu’à 2× plus vite avec 70 % de VRAM en moins et sans perte de précision. Les builds ROCm optimisés prennent également en charge l’inférence GGUF et Safetensors.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Mise à jour du 23 juillet

1. Ajout de **RDNA2, Gorgon Halo, prise en charge Vulkan** + correction de l’installation AMD ne détectant pas les GPU sur Strix Halo / autres GPU AMD
2. Meilleur RDNA4, correction automatique et capture des échecs HIP / ROCm
3. **mémoire unifiée 2x plus rapide** Chargement safetensors AMD + checkpointing de gradient beaucoup plus rapide pour les périphériques à mémoire unifiée
4. Ajout de **dictée vocale / whisper.cpp** prise en charge préliminaire de la synthèse vocale rapide
5. Correction des environnements de rollback lors des installations qui engloutissaient 5 Go d’espace disque - désormais nettoyage automatique

#### Entraîner des LLM localement sur AMD

* Entraînez, exécutez du RL, discutez avec des modèles et déployez-les localement sur les GPU AMD.
* Détection et installation des GPU AMD plus fiables sous Windows, WSL et Linux.
* Compatibilité ROCm améliorée pour les GPU AMD MI300X et MI325X.
* Accéder à distance à Unsloth via `unsloth studio --secure` via HTTPS gratuit grâce à Cloudflare

#### Exécutez des modèles plus grands sur votre matériel

* Utilisez le placement automatique sur GPU ou choisissez précisément quels GPU et couches du modèle utiliser.
* Déplacez les couches d’experts MoE dans la mémoire système pour aider les modèles plus grands à tenir.
* Répartissez les modèles sur plusieurs GPU ou utilisez le parallélisme tensoriel.
* Enregistrez séparément les paramètres matériels pour chaque modèle et quantification.

#### Redémarrages de chat plus rapides et téléchargements plus fiables

* Reprenez les longues conversations sans reconstruire toute la conversation après qu’un modèle inactif ait libéré sa VRAM.
* Les téléchargements Hugging Face XET bloqués retentent automatiquement via HTTP standard.
* Les fichiers GGUF existants sont réutilisés au lieu d’être retéléchargés à chaque chargement de modèle.

#### Meilleure recherche, outils et agents

* La recherche web peut désormais lire les articles PDF, les manuels et autres résultats PDF.
* Les appels d’outils parallèles, la sortie de raisonnement et les nouvelles tentatives d’outils fonctionnent plus fiablement.
* Un nouvel endpoint MCP optionnel permet aux clients IA compatibles d’inspecter les modèles et l’historique d’entraînement, de démarrer ou d’arrêter l’entraînement, de charger des points de contrôle, de valider les recettes et d’exporter des GGUF.
  * Activez-le avec `UNSLOTH_STUDIO_ENABLE_MCP=1` et définissez le jeton bearer requis avec `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Corrections d’entraînement et d’export

* L’entraînement texte uniquement avec des modèles multimodaux ne tronque plus les longs exemples avant l’assemblage.
* Les modèles Qwen3.5 et Qwen3.6 MTP affinés s’exportent désormais correctement vers GGUF.
* Correction d’une erreur d’autorisation Windows qui pouvait arrêter les exports GGUF lors de l’étape d’écriture finale.

#### Au cas où vous l’auriez manqué

Notre précédente version de Studio a ajouté les modèles Dynamic NVFP4, une personnalisation plus poussée, sept nouvelles langues d’affichage, des agents plus sûrs et l’accélération GPU Vulkan.

**Dynamic NVFP4 :**

Unsloth Dynamic NVFP4 conserve les couches sensibles à la précision en FP8 ou BF16 tout en exécutant le reste en W4A4. Sur les GPU NVIDIA Blackwell, cela permet une inférence jusqu’à 2,5x plus rapide, tandis que les caches KV FP8 calibrés offrent jusqu’à 2x plus de contexte.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) et explorez notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4), y compris Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

**Personnalisez votre Studio :**

Choisissez entre les palettes de couleurs Standard, Classique et Minimaliste, chacune avec des modes clair et sombre. Vous pouvez également personnaliser les couleurs, importer des polices et ajuster la taille des polices, le contraste, la réduction des mouvements et plus encore.

Unsloth comprend également un onglet de paramètres vocaux pour la dictée, les réglages de dictionnaire personnalisé et la lecture à voix haute.

**Nouvelles langues :**

Unsloth Studio est désormais disponible en français, allemand, espagnol, hindi, arabe, russe et coréen, en plus du chinois (simplifié), du japonais et du portugais (Brésil). La détection automatique de la langue du navigateur est désormais la valeur par défaut.

**Agents plus sûrs :**

Un sélecteur d’autorisation pour les appels d’outils à quatre niveaux -**Demander**, **Approuver pour moi**, **Désactivé** et **Accès complet**-permet un contrôle plus fin des agents. L'isolation de l'espace de travail des agents et des vérifications d'installation plus sûres réduisent aussi le risque de modifications involontaires.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personnalisation, NVFP4, langues

Salut les gars, nous avons plein de nouvelles mises à jour pour Unsloth, surtout en matière de personnalisation. Unsloth est désormais à vous pour être personnalisé : trois palettes de couleurs, plus des couleurs et polices personnalisées, sept nouvelles langues d'affichage, et un nouvel onglet Paramètres vocaux pour la dictée et la lecture à voix haute. Les agents gagnent en sécurité avec un sélecteur d'autorisation d'appels d'outils à quatre niveaux (Demander, Approuver pour moi, Désactivé, Accès complet) et l'isolation de l'espace de travail, et les GPU Intel bénéficient enfin d'une inférence accélérée par GPU grâce au nouveau Vulkan `llama.cpp` prise en charge.

Nous avons également ajouté la prise en charge native de [Inkling](https://unsloth.ai/docs/models/inkling), un modèle ouvert de 975 milliards de paramètres avec 41 milliards de paramètres actifs et une fenêtre de contexte allant jusqu'à 1 million de jetons. Sous licence Apache 2.0, il accepte du texte, des images et de l'audio et génère du texte.

#### NVFP4 dynamique

Nous avons étendu notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4) avec des versions quantifiées de Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) pour plus de détails.

Personnalisez votre Unsloth

Unsloth n'est plus limité aux modes clair et sombre :

* Choisissez parmi **Standard**, **Classique**et **Minimal** palettes, chacune avec des variantes claires et sombres.
* Personnalisez les couleurs d'accent, d'arrière-plan et de premier plan.
* Importez vos propres polices pour l'interface, les titres, le chat et le code.
* Ajustez la taille de police, le contraste, les animations, le comportement du curseur et le lissage des polices.
* Recherchez les paramètres et synchronisez vos préférences sur tous vos appareils.

Les modes clair et sombre conservent leurs propres valeurs de personnalisation.

#### Sept nouvelles langues

Unsloth prend désormais en charge le français, l'allemand, l'espagnol, l'hindi, l'arabe, le russe et le coréen, en plus du chinois, du japonais et du portugais. La détection automatique de la langue du navigateur est désormais le réglage par défaut.

#### Paramètres vocaux

Un nouvel onglet Voix ajoute des contrôles pour la dictée, les dictionnaires de prononciation et la lecture à voix haute. La prise en charge de la conversion de la parole en texte et du texte en parole arrive bientôt ; les conversations vocales complètes sont encore en développement.

#### Agents et appels d'outils plus sûrs

L'ancien bouton de contournement est désormais un sélecteur d'autorisations à quatre niveaux :

* **Demander :** approuver chaque appel d'outil.
* **Approuver pour moi :** exécuter automatiquement les actions en lecture seule et suspendre pour celles potentiellement dangereuses.
* **Désactivé :** désactiver les appels d'outils.
* **Accès complet :** autoriser tous les appels et désactiver le bac à sable.

Ces contrôles couvrent les outils terminal, Python, recherche web, RAG et MCP. Les agents bénéficient également d'espaces de travail isolés, de sessions reprenables avec `--persist`, de avertissements d'installation à distance plus sûrs, du flux en direct des sorties d'outils et d'une extraction web améliorée.

#### Vulkan et `llama.cpp`

Le nouveau Vulkan `llama.cpp` backend permet aux GPU Intel d'utiliser une inférence accélérée par GPU au lieu de retomber sur le CPU. Il prend en charge la gestion existante de la VRAM, le dimensionnement automatique du contexte, la sélection multi-GPU et le déchargement de couches.

Les utilisateurs AMD peuvent l'activer avec :

```bash
UNSLOTH_FORCE_VULKAN=1
```

Nous avons aussi amélioré la fiabilité des mises à jour, la récupération de l'état du modèle et l'interruption des générations bloquées.

#### Modèles et entraînement

Cette version inclut également :

* Prise en charge native d'Inkling et améliorations multi-GPU B200.
* attention eager DeepSeek-V4 et experts groupés FP8 entraînables.
* Entraînement fiable en mode completion-only grâce à la détection automatique des marqueurs de modèle de chat.
* Gestion correcte du gradient checkpointing désactivé.
* Mise à l'échelle RoPE et extension de contexte améliorées.
* Forçage de l'arrêt des exécutions d'entraînement bloquées.
* Routage automatique pour les nouvelles architectures de modèles et les versions plus récentes de Transformers.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth peut désormais exporter des GGUF NVFP4, FP8 et imatrix après l'entraînement ; agir comme un système API llama-swap ; ajouter la prise en charge du japonais et du portugais brésilien ; et inclut MLX, safetensors, l'appel d'outils, la prise en charge de la réparation, et plus encore. Le noyau Unsloth rend GRPO 1,3x plus rapide, ajoute un repli HTTP pour les téléchargements bloqués, améliore le mode hors ligne, accélère l'entraînement MoE de 3 à 5x et corrige de nombreux bugs. Cette série de versions utilise `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/fr/modeles/deepseek-v4.md) est désormais pris en charge avec les bascules Thinking et nos corrections améliorées du modèle de chat.

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FChQx2DGoDLyhf7mp8G2d%2Fdeepseek%20v4%20flashhh.png?alt=media&amp;token=a84f2fbc-8ab0-44cf-a3a8-0bdaaf80a2a7" alt="" width="375"><figcaption></figcaption></figure></div>

#### Serveur d'API compatible OpenAI plus intelligent

Exécutez un seul point de terminaison d'API local avec un basculement de modèle plus sûr et une meilleure récupération des agents-outils.

* Les requêtes API peuvent opter pour un basculement automatique entre des GGUF locaux téléchargés, tandis que les noms de modèles inconnus continuent en toute sécurité d'utiliser le modèle actuel.
* `/v1/models` renvoie désormais des identifiants de modèle propres et le catalogue GGUF local au lieu des chemins locaux `.gguf` chemins.
* Le déchargement automatique à l'inactivité peut libérer la VRAM après une période d'inactivité, et la réparation des appels d'outils peut désormais être contrôlée par requête.

#### Améliorations de l'exportation

Les exportations sont plus flexibles et évitent les téléchargements inutiles.

* Sélectionnez plusieurs formats d'exportation à la fois, notamment FP8/INT8 portable, GGUF LoRA, les exportations correspondant à la source, imatrix GGUF et FP8/FP4 compressé.
* Les exportations avec plusieurs checkpoints évitent davantage de téléchargements répétés du modèle de base.
* Les exportations FP8, INT8 et GGUF-LoRA respectent désormais `trust_remote_code`et l'exportation GGUF gère plus fiablement les paramètres de quantification manquants.

#### RAG et Chat de fichiers

Le chat de fichiers est plus utile sur de vrais documents.

* Les pièces jointes RAG peuvent désormais utiliser le contexte de l'ensemble du document, avec des modèles d'intégration personnalisables et la recherche Hugging Face.
* Le chat de fichiers lit correctement davantage de PDF et de documents Word, y compris le texte de droite à gauche, le texte indic, et les tableaux DOCX.
* Les vérifications RAG locales sont plus fiables derrière des configurations de proxy.

#### Peaufinage et fiabilité d'Unsloth

L'utilisation quotidienne devrait être plus fluide et plus stable.

* Les longues exécutions d'entraînement et de chat ont moins de risques de se figer silencieusement.
* Le mode comparaison, le changement de modèle, l'annulation de modèle, la navigation Hub et Hub Discover sont plus fiables.
* Les exportations de projet, les exportations de chat, les paramètres, les visites guidées, les boîtes de dialogue de fichiers, les écrans de mise à jour et l'interface de raisonnement sont plus propres et plus cohérents.

#### Corrections de l'installateur, du matériel et de la plateforme

Unsloth s'installe et s'exécute plus fiablement sur toutes les plateformes.

* Les installations macOS n'exigent plus CMake ou Homebrew lorsqu'un précompilé `llama.cpp` est disponible, et la prise en charge d'Apple Silicon gère mieux les chemins contenant des espaces et le dimensionnement de la mémoire unifiée.
* Le démarrage sous Windows, la gestion UTF-8, l'intégration RAG ROCm et la prise en charge GPU de ROCm sur WSL ont été améliorés.
* La sélection des précompilés pour les GPU Blackwell, les vérifications d'adéquation GGUF, le parallélisme de tenseurs pour les GGUF vision/mmproj et la réutilisation locale `llama.cpp` sont désormais plus fiables.

#### Entraînement, modèles et noyaux

L'entraînement et le chargement des modèles sont plus fiables sur davantage de configurations.

* GRPO prend désormais en charge l'empaquetage de séquence par défaut, évite les invites partagées répétées et gère correctement la mise à l'échelle des logits en DDP.
* L'entraînement complet, les paramètres de précision RL, le gradient checkpointing, les tampons RoPE DDP et la détection MoE LoRA ont été corrigés.
* La quantification/déquantification FP8, la mise à l'échelle RoPE de Llama 3 avec Transformers v5, les rechargements LoRA de PEFT 0.19, et `fast_generate` les messages d'erreur ont été améliorés.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + contextes 3x plus longs

[GLM-5.2](/docs/fr/modeles/glm-5.2.md) est désormais pris en charge dans Unsloth Studio ! Tous les niveaux de raisonnement sont pris en charge. **longueurs de contexte 3x plus longues** sont désormais possibles grâce à notre nouvel algorithme d'ajustement automatique avec MTP, permettant des conversations plus longues. Mode d'autorisation de contournement, chats bifurcables, chats mise en file d'attente, un nouveau hub pour la découverte de modèles, modules parallèles + prise en charge HTTPS Cloudflare et plus encore ! Utilisez `unsloth studio --secure` pour un accès global HTTPS sécurisé !

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Meilleur algorithme de longueur de contexte

Selon [PR 1](https://github.com/unslothai/unsloth/pull/6312) et [PR 2](https://github.com/unslothai/unsloth/pull/6447), nous avons considérablement amélioré la détermination de l'utilisation mémoire et de la longueur de contexte dans Unsloth Studio, obtenant au total des contextes 3x plus longs :

| Scénario                           | KV               | avant   | après   |
| ---------------------------------- | ---------------- | ------- | ------- |
| Pipeline 1x 32 Go (\~31 Go libres) | f16              | 23,040  | 64,000  |
|                                    | q8\_0            | 43,520  | 114,944 |
|                                    | q4\_0            | 82,432  | 199,680 |
| Pipeline 2x 32 Go                  | n'importe lequel | 262,144 | 262,144 |
| Tenseur 2x 24 Go (\~23 Go libres)  | f16              | 134,049 | 262,144 |
|                                    | q8\_0            | 252,329 | 262,144 |

#### Canvas de chat, bifurcation et mise en file d'attente

* Modifiez les messages de l'assistant sur place et relancez à partir de n'importe quel point du fil.
* Bifurquez un fil pour créer une branche de conversation sans perdre l'original.
* Chats temporaires (incognito) qui ne laissent aucune trace.
* Mettez de nouveaux prompts en file d'attente pendant qu'une génération est encore en cours au lieu d'attendre.
* Les « artefacts » de chat sont désormais **canvas**avec des **cartes HTML canvas** intégrées qui s'affichent automatiquement, une vue Code, et DiffusionGemma conserve son code brut visible en ligne au lieu de se réduire.
* La recherche dans le chat couvre désormais chaque message et affiche d'abord vos propres messages.

#### Hub (reconçu)

* Hub pleine page avec un fil d'actualité tendance, une recherche et la prise en charge des chemins de modèles personnalisés.
* Aperçu README dans un flux en vue fractionnée afin que vous puissiez lire avant de télécharger.
* Les téléchargements utilisent par défaut le plus rapide **Xet** transport, avec repli HTTP automatique si un transfert se bloque.
* Nouvelle bascule « Charger à la sélection » pour définir les options de chargement avant qu'un modèle ne se charge.
* Logo Google affiché pour DiffusionGemma et les futurs dérivés de Gemma.

#### Modèles et inférence

* DeepSeek-OCR et davantage de modèles vision se chargent et s'exécutent désormais sans erreur.
* Correction de l'inférence rapide sur le dernier vLLM (0.22+) afin que les gains de vitesse fonctionnent à nouveau.
* Le parallélisme de tenseurs est plus fiable : si le chemin MTP plus rapide échoue, il se rétablit désormais tout seul au lieu de planter.
* DiffusionGemma affiche désormais l'image en cours de formation en direct pendant le débruitage, avec des statistiques de vitesse précises.

#### Sécurité et studios Cloudflare chiffrés

* Nouveau `--secure` mode Cloudflare uniquement pour les studios chiffrés de bout en bout, avec les outils côté serveur restant activés sous `--secure`. Utilisez `unsloth studio --secure`!
* le mode Contournement des autorisations pour ignorer les confirmations et désactiver le bac à sable des outils quand vous le souhaitez.
* Détection automatique de l'analyse antivirus Hugging Face + des fichiers dangereux dans les dépôts.

#### Journalisation et API

* Nouveau **moniteur du serveur API** dans Unsloth.
* Appels d'API plus rapides et latence réduite
* Des journaux beaucoup plus épurés - désormais avec débit et latence, et beaucoup de journaux superflus supprimés.

#### Matériel et backend

* Meilleure prise en charge des GPU Blackwell RTX 50X et 60X
* Correction de la rétrogradation silencieuse vers le CPU au lieu du GPU
* La version de torchao est désormais sélectionnée en fonction du torch installé.
* L'installateur répare désormais automatiquement une installation PyTorch cassée ou CPU uniquement et avertit d'un repli silencieux sur CPU, sur NVIDIA + AMD sous Win/Linux/Mac/WSL.
* Libère la VRAM du modèle de chat lorsque l'entraînement commence, mais seulement lorsque le GPU est réellement à court de mémoire (sinon, aucun rechargement inutile).
* Si llama-server plante brutalement au démarrage, Unsloth suit désormais une série d'étapes de récupération au lieu d'échouer simplement.

#### Corrections d'entraînement, générales et modules parallèles

* Mises à jour de l'entraînement MLX.
* Fiabilité améliorée de l'entraînement GRPO avec vLLM.
* Le démarrage de l'entraînement est devenu plus fiable, avec des erreurs plus claires pour les lots VLM invalides.
* Unsloth nettoie désormais plus fiablement les processus backend restants après des plantages, des redémarrages ou des arrêts interrompus.
* L'export, le chat, l'entraînement et les recettes sont désormais tous individualisés / compartimentalisés ! Cela signifie que vous pouvez faire les 4 en parallèle maintenant ! Vous pouvez chatter / faire de l'inférence pendant que vous attendez une exécution d'entraînement ou une exportation !

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Assurez-vous d'installer le dernier [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) et [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) sont désormais tous pris en charge.

* Exécuter et entraîner [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) via [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) est là ! Exécutez [Gemma 4](https://unsloth.ai/docs/models/gemma-4) environ 2x plus vite avec MTP.
* La conversation audio est désormais prise en charge pour Gemma 4 (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Conserver Think ajouté à Gemma 4.

<figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fszoidwwj70dLm5vBjpmL%2Fdiffusiongemma.gif?alt=media&amp;token=8ce359fd-f92c-4cf8-a491-06b04c505cb7" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Gestionnaire de téléchargements (expérimental)

* Ajout d'un nouveau **Hub** page pour parcourir, télécharger et gérer les modèles et ensembles de données Hugging Face.
* Unsloth peut désormais détecter les modèles et ensembles de données déjà sur votre machine et les afficher à côté des éléments téléchargés.
* Téléchargé [modèles GGUF](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) ont désormais des actions directes **Exécuter / Nouveau chat** actions.

#### RAG / Chat avec des fichiers (expérimental)

* Ajout de [**Chat avec des fichiers**](https://unsloth.ai/docs/new/studio/chat) dans Unsloth, vous permettant de poser des questions sur vos propres documents et bases de connaissances.
* Prend en charge la recherche hybride, les citations, les aperçus PDF, les documents par fil et un `search_knowledge_base` outil intégré.

#### Nouveau bouton de mise à jour + prise en charge matérielle

* Unsloth utilise désormais constamment des précompilés à jour [llama.cpp](https://unsloth.ai/docs/new/changelog) sur CUDA, ROCm, Windows, Linux et macOS.
* Ajout d'un **Mettre à jour llama.cpp** bouton afin que les utilisateurs puissent mettre à jour le backend local sans réinstaller Unsloth.
* Meilleure prise en charge d'AMD sous Windows / WSL, [prise en charge ROCm de Strix Halo](https://unsloth.ai/docs/get-started/install/amd), [sélection CUDA Blackwell](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)et des messages d'installation plus clairs.

#### Chat local, outils et compatibilité API

* Local [appel d'outils](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) est plus fiable, avec un meilleur ordre des cartes d'outils, moins de boucles d'outils dupliquées, et la prise en charge de l'utilisation d'outils avec les modèles vision GGUF.
* Amélioration du comportement de l'API [compatible OpenAI](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) et de l'API compatible Anthropic pour les serveurs locaux Unsloth, y compris de meilleures erreurs, l'utilisation des jetons, les raisons d'arrêt et la [compatibilité Claude Code](https://unsloth.ai/docs/basics/claude-code).

#### Entraînement et corrections

* Amélioration du comportement de l'API [Prise en charge MLX](https://unsloth.ai/docs/new/studio/install) avec de meilleures étiquettes de modèle, des statistiques de vitesse de génération, et des corrections pour [l'entraînement VLM](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Plusieurs cas limites [d'entraînement](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) et [de jeu de données](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) ont été corrigés, y compris les caches Hugging Face non inscriptibles et les mappages de jeux de données personnalisés.
* De nombreuses corrections de finition de l'interface ont été ajoutées au chat, aux menus, au sélecteur de modèle, au mode sombre, à l'import/export et aux paramètres.

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, nouvelle UI, MCP, projets

Cette mise à jour se concentre principalement sur Gemma 4 12B, MCP, Projets, Canvas, CUDA 13.3 et la nouvelle interface de chat. La semaine prochaine, nous aurons une mise à jour encore plus importante.

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FoRn2YEPb9lJ81kP3GQQh%2Fwhats%20on%20ur%20mind.png?alt=media&amp;token=f388e42a-bb05-4a09-9cbf-ec699a6baf6b" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google publie [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4), un nouveau modèle qui s'exécute localement avec 8 Go de RAM. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Guide](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified prend en charge l'image, l'audio et un contexte de 256K. Exécutez et entraînez le modèle via Unsloth Studio.

#### MCP

* Prise en charge des serveurs distants `MCP` y compris les en-têtes personnalisés et OAuth
* Prise en charge des serveurs locaux basés sur des commandes `MCP` peut désormais être activée depuis le compositeur de chat
* `MCP` peuvent maintenant être activés depuis le compositeur de chat
* Préréglages intégrés pour les `MCP` serveurs courants

#### Nouvelle interface de chat

* Projets, Canvas, `MCP`, RAG et contrôles de comparaison sont désormais dans le menu plus
* Les contrôles de recherche et de code sont plus faciles d'accès depuis le compositeur
* Les menus, superpositions, icônes et contrôles cliquables sont plus cohérents dans tout Unsloth

#### Projets

* Organisez les chats liés dans des espaces de travail de projet dédiés
* Déplacez des chats existants dans des projets
* Créez et gérez des projets directement depuis la barre latérale

#### Canvas / artefacts expérimentaux

* Ouvre le HTML généré dans un panneau canvas dédié à l'intérieur d'Unsloth Studio
* Prend en charge les sorties interactives, y compris les visualisations basées sur le navigateur et les packages chargés via CDN
* Vous permet de basculer entre l'aperçu rendu et le code source

#### Installation, runtime et matériel

* Les installations précompilées Windows ne nécessitent plus le `Toolkit CUDA` contrôle
* Linux `llama.cpp` les précompilés correspondent désormais au runtime détecté `cudart` majeur
* `ROCm` la détection gfx est transmise à la sélection des précompilés
* `Blackwell`, `B300` et `ARM64` mises à jour de la prise en charge Linux

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NE PAS UTILISER `mise à jour d'unsloth studio` désormais, car l'empaquetage ne recevra pas les dernières mises à jour !**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :**

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NE PAS UTILISER `mise à jour d'unsloth studio` désormais, car l'empaquetage ne recevra pas les dernières mises à jour !**
{% endhint %}

#### Mises à jour Mac

* Réactivé `llama.cpp` les binaires précompilés pour Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Mac OS 13 (Ventura) sur Apple Silicon est compilé à partir des sources
* Intel (x86\_64) pour Mac OS 13.3 / 14 / 15 / 26 (Tahoe) utilise `llama.cpp` binaires précompilés
* Intel pour Mac 13.0 - 13.2 est compilé à partir des sources

#### Mises à jour Windows

* CUDA 13.3 `llama.cpp` les binaires précompilés fonctionnent désormais pour Windows
* Pour CUDA 13.2, CUDA 13.1 et versions antérieures, les appareils Windows utilisent le repli CUDA 12.4 - nous travaillerons bientôt sur les binaires CUDA 13.1.

#### Mise à jour CUDA 13.3

* Les binaires non Linux de CUDA 13.3 fonctionnent. Nous utiliserons encore CUDA 13.1 pour l’instant
* CUDA 13.3 résout le problème de charabia de CUDA 13.2 - voir <https://github.com/unslothai/unsloth/issues/4849>

#### Mise à jour des GPU Blackwell

* Pour l’instant, Blackwell aura des versions retardées de `llama.cpp` binaires précompilés, car CUDA 12.4 ne fonctionne pas - nous travaillons à résoudre cela bientôt.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Une mise à jour avant la refonte.

Salut tout le monde, nous faisons encore une dernière petite mise à jour avant une refonte majeure qui devrait arriver cette semaine ou la semaine prochaine. Notre refonte va changer beaucoup de choses, surtout avec de nouvelles fonctionnalités majeures et beaucoup de changements de design.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NOUVEAU : [**Prise en charge de l’appel d’API**](https://unsloth.ai/docs/integrations/connections) maintenant avec génération + édition d’images, vraie recherche web, exécution de code, mise en cache automatique des prompts. Connectez [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) et plus encore.
* Prise en charge adéquate des **langues non anglaises** par ex. japonais, chinois, indien, etc.

Beaucoup d’entre vous ont peut-être manqué notre précédente version, qui n’a duré qu’une journée. Nous avons introduit :

* Connexion à des backends d’inférence externes : [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Améliorations de sécurité**
* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; obtenez les meilleurs paramètres personnalisés pour votre matériel.

#### Appels au fournisseur d’API et connexions externes

* Vous pouvez maintenant connecter Unsloth à n’importe quel fournisseur cloud d’API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés d’un tour à l’autre)
* La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, ce qui réduit les coûts de 50 à 90 %.
* Génération + édition d’images
* Clé API désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

#### Autres mises à jour d’Unsloth Studio

* Pièces jointes de chat OpenDocument
* charge utile de résumé du raisonnement o3
* L’envoi/la saisie de langues non anglaises (par ex. japonais, chinois) fonctionne maintenant correctement
* Durcissement du compositeur IME, RTL `dir="auto"`, correction du tronquage des longues lignes de log
* Rendu de la trace de raisonnement des outils dans l’interface
* Prise en charge hors ligne complète : découverte GGUF mise en cache et détection automatique DNS hors ligne pour l’inférence et l’entraînement

#### Améliorations de sécurité d’Unsloth Studio

* Limitation du taux d’authentification, compatible avec les proxys pour que les reverse proxies ne puissent pas la contourner
* Worker sandboxé avec une blocklist renforcée (bash, `upload hf`, `NOFILE`)
* Confinement des chemins pour que les workers ne puissent pas sortir de leurs répertoires tmp en cours d’utilisation
* Validation stricte du schéma sur l’ensemble de l’API Unsloth
* Renforcement du CSP / des en-têtes de sécurité (seuls les hôtes de favicon légitimes sont autorisés)
* Suppression du `torch.load` repli sur `training_args.bin` afin que les pickles non fiables ne puissent jamais s’exécuter au chargement du modèle
* Flux de publication Tauri Desktop renforcé
* Authentification frontend : rafraîchissement du jeton en singleflight, saisie du mot de passe actuel lors des modifications, déconnexion fonctionnelle, aide 422 partagée
* Le nettoyage à l’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin de ne jamais supprimer l’état utilisateur
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## Corrections MTP + Unsloth

Beaucoup de corrections de bugs, de corrections UI/UX pour Unsloth ! Pour obtenir les dernières mises à jour, faites :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Corrections

1. Corriger `mise à jour d'unsloth studio` ne fonctionne pas bien
2. Corriger le blocage sur `réinitialiser le mot de passe` page
3. Davantage de prise en charge du mode hors ligne
4. Améliorer le fait que MTP ne soit pas plus rapide sur Mac, CPU et GPU - maintenant c’est bien mieux !
5. Corriger le raccourci bureau qui ne fonctionnait pas après la mise à jour
6. Beaucoup, beaucoup de corrections de bugs UI/UX
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + connexions API

Nous avons de nombreuses nouvelles mises à jour pour Unsloth `v0.1.41-beta`:

* **inférence GGUF \~2x plus rapide** avec activation automatique de [MTP](/docs/fr/modeles/qwen3.6.md#mtp-guide)
* [**Prise en charge de l’appel d’API**](/docs/fr/integrations/connections.md) pour [OpenAI](/docs/fr/integrations/connections/openai.md), [Anthropic](/docs/fr/integrations/connections/anthropic-claude.md) etc. avec mise en cache automatique des prompts, recherche web, exécution de code
* Connexion à des backends d’inférence externes : [vLLM](/docs/fr/integrations/connections/vllm.md), [Ollama](/docs/fr/integrations/connections/ollama.md), [llama-server](/docs/fr/integrations/connections/connecter-llama.cpp-a-unsloth-executez-des-gguf-avec-llama-server.md)
* Expérimental **inférence MLX**
* Prise en charge adéquate des **langues non anglaises**
* **Sécurité** améliorations

<a href="/pages/4a2b83ac4bf0233da80a1e3b6ab9fb218108742c#qwen3.6-inference-tutorials" class="button primary">Lancer les tutoriels Qwen3.6</a><a href="/docs/fr/modeles/qwen3.6.md#mtp-guide" class="button primary">Guide MTP</a>

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F0abq31rgj0gOSH9vnpQ6%2Fmtp.gif?alt=media&amp;token=c66ec3f5-91f0-4617-824c-c537a2dde8b0" alt="" width="375"><figcaption></figcaption></figure></div>

#### Prise en charge du décodage spéculatif MTP : inférence 1,4 à 2x plus rapide !

* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; avertir lorsque le précompilé llama.cpp inclus est obsolète ou trop ancien pour MTP
* Nouveaux binaires précompilés de llama.cpp pour la prise en charge de MTP !

#### Appels au fournisseur d’API et connexions externes

* Vous pouvez maintenant connecter Unsloth à n’importe quel fournisseur cloud d’API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés d’un tour à l’autre)
* La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, ce qui réduit les coûts de 50 à 90 %.
* Clé API désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

#### Inférence MLX (expérimental)

* Les quantifications et modèles MLX peuvent maintenant s’exécuter localement sur vos machines Mac !
* Nous ajouterons bientôt le raisonnement, les outils et la recherche web !

#### Autres mises à jour d’Unsloth Studio

* L’envoi/la saisie de langues non anglaises (par ex. japonais, chinois) fonctionne maintenant correctement
* Pièces jointes de chat OpenDocument
* charge utile de résumé du raisonnement o3
* Durcissement du compositeur IME, RTL `dir="auto"`, correction du tronquage des longues lignes de log
* Rendu de la trace de raisonnement des outils dans l’interface
* Prise en charge hors ligne complète : découverte GGUF mise en cache et détection automatique DNS hors ligne pour l’inférence et l’entraînement
* Beaucoup de finitions UI/UX : refonte du thème sombre, redesign de la barre latérale droite, mascotte paresseux selon l’heure de la journée, toasts copiables et fermables, compositeur de chat plus grand, finitions de la configuration d’exécution de code, style des boutons-pastilles d’action du compositeur, bouton Discord plus étroit

#### Mises à jour de l’entraînement

* Corrections du masque d’attention Gemma
* GRPO multi-image
* Expériences de retour d’état caché GRPO
* Nouvelle méthode d’entraînement Continued Pretraining (CPT) comme option de premier plan
* Extracteur LoRA Gemma-4 MoE enregistré pour corriger `grouped_mm` crash de contraction
* Fusionnée en option `lm_head` + passe avant cross-entropy, avec chemin à un seul matmul sous `UNSLOTH_RETURN_LOGITS=1`
* Passer la taille du batch pour l’évaluation
* Les chemins d’évaluation/entraînement respectent maintenant `HF_DATASETS_OFFLINE` avec `HF_HUB_OFFLINE`

#### Améliorations de sécurité d’Unsloth Studio

* Limitation du taux d’authentification, compatible avec les proxys pour que les reverse proxies ne puissent pas la contourner
* Worker sandboxé avec une blocklist renforcée (bash, `upload hf`, `NOFILE`)
* Confinement des chemins pour que les workers ne puissent pas sortir de leurs répertoires tmp en cours d’utilisation
* Validation stricte du schéma sur l’ensemble de l’API Unsloth
* Renforcement du CSP / des en-têtes de sécurité (seuls les hôtes de favicon légitimes sont autorisés)
* Suppression du `torch.load` repli sur `training_args.bin` afin que les pickles non fiables ne puissent jamais s’exécuter au chargement du modèle
* Flux de publication Tauri Desktop renforcé
* Authentification frontend : rafraîchissement du jeton en singleflight, saisie du mot de passe actuel lors des modifications, déconnexion fonctionnelle, aide 422 partagée
* Le nettoyage à l’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin de ne jamais supprimer l’état utilisateur
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## point de terminaison API Unsloth

#### ***correction de bug v0.1.39-beta*** **5 mai 2026**

Corrige l’absence d’affichage de l’historique de chat (l’historique existant n’est pas perdu) et les pièces jointes qui ne s’attachent pas correctement. Le bug n’était que visuel - utilisez `2026.5.2` ou appelez directement `curl -fsSL https://unsloth.ai/install.sh | sh`  pour mettre à jour

Vous pouvez utiliser des LLM locaux avec des outils comme [Claude Code](https://unsloth.ai/docs/basics/claude-code) et [Codex](https://unsloth.ai/docs/basics/codex) en les connectant au point de terminaison API d’Unsloth. Cela vous permet d’exécuter localement des modèles comme [Qwen](https://unsloth.ai/docs/models/qwen3.6) et [Gemma](https://unsloth.ai/docs/models/gemma-4) localement, avec des fonctionnalités supplémentaires telles que l’appel d’outils auto-réparateur, l’exécution de code et la recherche web.

Utiliser Unsloth comme point de terminaison d’inférence API est avantageux non seulement parce qu’il est facile à configurer et rapide, mais aussi parce qu’Unsloth fournit :

* [Appel d’outils auto-réparateur](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), ce qui aide à réduire de 50 % les appels d’outils cassés ou mal formés
* [Exécution de code](https://unsloth.ai/docs/new/studio/chat#code-execution) prise en charge, permettant l’exécution de Bash et Python pour des sorties de code plus précises.
* Avancé [Recherche web](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) qui visite et lit réellement les pages web pour recueillir des informations approfondies.
* [Paramètres d’inférence automatiques](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) pour les modèles GGUF (temp, top-k, etc.)

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1s98Id9xclzwMfxjXw2O%2Funsloth%20api%20cropped.png?alt=media&amp;token=64fac263-ca5b-4447-a740-41f58ec94904" alt="" width="375"><figcaption></figcaption></figure></div>

#### Nouveaux modèles

Nous avons aussi quelques nouveaux modèles à exécuter, notamment NVIDIA [Nemotron 3 Nano Omni](/docs/fr/modeles/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/fr/modeles/ibm-granite-4.1.md) et [Mistral 3.5](/docs/fr/modeles/mistral-3.5.md) Medium. Nous avons aidé Mistral à résoudre certains problèmes d’implémentation dans transformers et les GGUF.

#### Mises à jour d’Unsloth

* Les entraînements Unsloth arrêtés peuvent maintenant reprendre à partir des checkpoints.
* Les threads de chat s’enregistrent désormais automatiquement et persistent de manière plus fiable.
* Les blocages de l’entraînement DPO dans les configurations multiprocessus ont été corrigés.
* La prise en charge VLM GRPO a été améliorée avec les mises à jour MROPE.
* Le bouton d’arrêt d’Unsloth arrête maintenant correctement la génération.
* Correction de la disparition du modèle de chat après un rafraîchissement du navigateur.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Toute nouvelle refonte de l’interface

Salut tout le monde, nous avons refait toute l’expérience UI et UX d’Unsloth Studio pour mettre l’accent sur le chat et l’entraînement :

* Ajout d’une barre latérale rétractable basée sur les retours de la communauté

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FKoonE97b0H3RioMwVohd%2Fstudio%20new%20ui.gif?alt=media&amp;token=e37f2839-914e-48b8-8c81-2dac3ade9408" alt="" width="375"><figcaption></figcaption></figure></div>

* Vous pouvez maintenant supprimer des chats et rechercher dans les conversations passées

<div><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fm6se3dOmBZH9d9Wlif4W%2FScreenshot%202026-04-23%20at%206.15.38%E2%80%AFAM.png?alt=media&amp;token=e83fe246-1f88-4bf7-aa15-baf7d3356676" alt=""><figcaption></figcaption></figure> <figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fa4EGTdaWQ6EA81PeC3JZ%2FScreenshot%202026-04-23%20at%206.01.36%E2%80%AFAM.png?alt=media&amp;token=1a1cc50d-e0e0-47cd-9c1a-80583a887794" alt=""><figcaption></figcaption></figure></div>

* Nouveau bouton bascule Preserve Thinking pour les modèles qui le prennent en charge comme Qwen3.6
* Design plus propre et plus cohérent avec une navigation plus simple
* Page Paramètres étendue avec des options pour changer votre photo de profil, votre nom, et plus encore

<div data-with-frame="true"><figure><img src="https://550366147-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FvMtRDH8cVXCu08OZ4TRf%2FScreenshot%202026-04-23%20at%206.18.35%E2%80%AFAM.png?alt=media&amp;token=d989c4b5-6293-402c-981c-3209b7e7d750" alt="" width="375"><figcaption></figcaption></figure></div>

* Plus besoin de saisir votre jeton Hugging Face deux fois
* gpt-oss dispose maintenant de bascules de réflexion faible, moyenne et élevée.
* Utilise maintenant le dernier précompilé llama.cpp, même sur Linux CUDA
* Beaucoup de corrections de bugs, de cohérence et de stabilité
* Kimi-K2.6 peut maintenant être exécuté !
* Nous avons aussi ajouté une prise en charge API expérimentale. Des guides, annonces, etc. arriveront la semaine prochaine.

Qwen3.6 était aussi déjà pris en charge auparavant dans Unsloth Studio pour l’exécution et l’entraînement. Vous pouvez entraîner et exécuter Qwen3.6-27B dès maintenant !
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/fr/modeles/qwen3.6.md) peut maintenant s’exécuter (18 Go de RAM) et être affiné dans Unsloth Studio. Kimi K2.6 peut aussi être exécuté dans Unsloth (350 Go de RAM).

Unsloth Studio a reçu de nombreuses nouvelles mises à jour, veuillez donc mettre à jour. Les détails et l’article explicatif arriveront dans les prochains jours.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/fr/modeles/qwen3.6.md) peut maintenant s’exécuter et être affiné dans Unsloth Studio. Le modèle fonctionne avec 23 Go de RAM et est le meilleur LLM de taille moyenne sur presque tous les benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Mise à jour Gemma 4 + MiniMax-M2.7**

[GGUF Gemma 4](https://huggingface.co/collections/unsloth/gemma-4) sont maintenant mis à jour avec les corrections officielles du template de chat de Google (ce qui a corrigé/amélioré l’appel d’outils), ainsi que les dernières corrections de llama.cpp. Mettez à jour vers la dernière version de llama.cpp, retéléchargez les quantifications et vous ne devriez pas voir `jeton inutilisé` de problèmes supplémentaires.\
\
[MiniMax-M2.7](/docs/fr/modeles/tutorials/minimax-m27.md) est disponible maintenant ! Vous pouvez exécuter le modèle localement avec nos GGUF en quantification 4 bits sur 128 Go de RAM / mémoire unifiée. [**GGUF MiniMax-M2.7**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Corrections Gemma 4**

Nous avons mis à jour Gemma 4 [avec de nombreuses corrections](/docs/fr/modeles/gemma-4/train.md). Ces bugs sont universels et ont affecté tous les packages et implémentations d’entraînement et **ne proviennent pas d’Unsloth**. Nous avons identifié les bugs, les avons corrigés, et l’entraînement Gemma 4 fonctionne maintenant correctement dans Unsloth.

Vous n’avez besoin que de **8 Go de VRAM** pour entraîner **Gemma-4-E2B** localement. Unsloth entraîne Gemma 4 **environ 1,5x plus vite tout en utilisant environ 60 % de VRAM en moins** que les configurations FA2. Pour le guide complet et les notebooks sur l’entraînement Gemma 4, [consultez notre blog](/docs/fr/modeles/gemma-4/train.md).

#### Corrections de l’entraînement Gemma 4

1. **L’accumulation de gradients** ne provoque plus d’explosions de perte. Auparavant, les pertes pouvaient grimper à **300–400**; la perte attendue est d’environ **10–15**.
2. Correction de l’ **IndexError** affectant **26B** et **31B** l’inférence dans `transformers`.
3. Corrections des sorties de charabia pour **E2B/E4B** quand `use_cache=False`. Voir [problème #45242](https://github.com/huggingface/transformers/issues/45242).
4. Correction de **audio float16** débordement à partir de `-1e9` valeurs.

Si vous voyez des pertes au-dessus de **13–15,** par exemple **100** ou **300** - l’accumulation de gradients est probablement gérée incorrectement. Cela est corrigé dans **Unsloth** et **Unsloth Studio**.

#### Ré-téléversements de quantifications Gemma 4

Nous avons également mis à jour nos GGUF Gemma 4, vous devrez donc les retélécharger. Encore une fois, ces problèmes de quantification ne sont **pas liés à Unsloth ni causés par Unsloth**:

1. CUDA : vérifier le chevauchement des buffers avant la fusion - correction critique pour `<unused24>` jetons - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`: prise en charge de la rotation de l’attention pour iSWA hétérogène - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `vocab`: ajouter la gestion des jetons octets au détokeniseur BPE pour Gemma 4 - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `convertir`: définir `"add bos" == True` pour Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `commun`: ajouter un analyseur spécialisé Gemma 4 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lire `final_logit_softcapping` pour Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: ajouter une coupure personnalisée des nouvelles lignes pour Gemma 4 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Mises à jour d’Unsloth Studio

* Ajouter **décodage spéculatif** prise en charge (ngram-mod, activée par défaut)
* Llama.cpp mis à jour pour utiliser la dernière version avec toutes les corrections Gemma 4
* Corriger les problèmes d’entraînement de Qwen3.5 et Gemma 4
* Activer l’exportation et l’enregistrement des modèles Gemma 4
* Renforcer la sécurité du sandbox pour les outils terminal et python
* Permettre aux recettes d’utiliser le modèle chargé dans Chat
* Corriger les threads de chat vides lors de la navigation (et lors du changement d’onglet) et stabiliser le nouveau flux de chat
* Autoriser l’exécution des recettes non LLM et mettre l’onglet Data en premier dans les exécutions
* Réutiliser la casse du dépôt mise en cache par HF pour éviter les téléchargements en double
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Vous pouvez maintenant exécuter et entraîner les [Gemma 4](/docs/fr/modeles/gemma-4.md) modèles dans Unsloth.
* Intel Mac fonctionne maintenant
* Binaires précompilés pour llama.cpp pour 2 corrections Gemma-4 :
  * vocab : corriger le tokenizer Gemma4 ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * corriger : template gemma 4 ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Les appels d’outils pour les plus petits modèles sont maintenant plus stables et ne se coupent plus
* Binaires précompilés pour Windows, Linux, Mac, appareils WSL - CPU et GPU
* Le décodage spéculatif a été ajouté pour les modèles sans vision (Gemma-4 est malheureusement vision et Qwen3.5)
* La longueur de contexte est maintenant correctement appliquée.
* La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés
* 90 % d’appels API HF en moins - moins de limites de débit
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % de précision des appels d’outils + davantage de prise en charge**

* Les appels d’outils pour tous les modèles sont maintenant **de +30 % à +80 % plus précis.**
* La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés
* Le nombre d’appels d’outils autorisés passe de 10 à 25
* Les appels d’outils se terminent maintenant beaucoup mieux, donc les boucles / répétitions seront réduites
* Davantage de **réparation des appels d’outils** et logique de déduplication pour empêcher aussi les appels d’outils de laisser fuiter du XML
* Testé avec `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), recherche web + exécution de code + réflexion activées.

| Métrique                                 | Avant  | Après           |
| ---------------------------------------- | ------ | --------------- |
| Fuites XML dans la réponse               | 10/10  | 0/10            |
| Récupérations d’URL utilisées            | 0      | 4/10 exécutions |
| Exécutions avec les bons noms de chanson | 0/10   | 2/10            |
| Nombre moyen d’appels d’outils           | 5.5    | 3.8             |
| Temps moyen de réponse                   | 12,3 s | 9,8 s           |

#### Nouvelles fonctionnalités

* Ajout de **dossiers personnalisés** pour que vous puissiez utiliser n’importe quels GGUF dans n’importe quel dossier - pour l’instant, accès dans les Paramètres avancés du Chat et Dossiers personnalisés
* **Bouton de mise à jour** désormais visible
* Style du script d’installation entièrement mis à jour !
* Préliminaire **Prise en charge automatique multi-GPU pour l’inférence et l’entraînement** - utile pour les grands modèles qui ne tiennent pas sur 1 GPU - Unsloth allouera automatiquement les ressources GPU
* Les Mac Intel devraient fonctionner immédiatement

Unsloth beaucoup plus fluide et plus rapide

* **Correction des expirations de délai lors du téléchargement de grands modèles** - plus aucune expiration de délai observée.
* **Correction de la limitation de débit de Hugging Face - les appels à l'API HF ont été réduits de 90 %**
* Correction de bun sous Windows et installations plus rapides
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Nouvelles mises à jour importantes**

Cela ne fait que 2 jours depuis notre précédente version, mais nous avons des mises à jour plus importantes :

* **L'inférence est maintenant 20 à 30 % plus rapide.** Auparavant, l'appel d'outils et la pénalité de répétition pouvaient ralentir l'inférence en dessous des vitesses normales. Les tokens/s d'inférence devraient maintenant fonctionner de la même manière que `llama-server` / `llama.cpp`.
* **Détecte désormais automatiquement les modèles plus anciens ou déjà existants** téléchargés depuis **LM Studio, Hugging Face,** et des sources similaires.
* **La vitesse des tokens/s d'inférence est désormais calculée correctement.** Auparavant, les tokens/s incluaient le temps de démarrage, ce qui donnait l'impression que la vitesse affichée était plus lente qu'elle ne l'était réellement. Elle devrait désormais refléter la « vraie » vitesse d'inférence.
* **L'utilisation du CPU ne monte plus en flèche.** Auparavant, l'identité du requêteur intégré changeait à chaque rendu, provoquant `useLiveQuery` des réabonnements continus.
* **Unsloth Studio dispose désormais d'un bouton X de fermeture et se ferme correctement.** Auparavant, le fermer après l'avoir ouvert depuis l'icône du bureau ne le fermait pas correctement. Désormais, le lancement depuis le raccourci ouvre aussi le terminal, et la fermeture de ce terminal quitte complètement Unsloth Studio. S'il est encore ouvert depuis une session précédente, vous pouvez redémarrer votre ordinateur ou exécuter `lsof -i :8888` puis `kill -9 <PID>`.
* **Appel d'outils et recherche web encore meilleurs** avec moins d'erreurs.
* Documentation mise à jour avec beaucoup de nouvelles informations sur [la suppression de modèles, la désinstallation](/docs/fr/nouveau/studio/install.md#uninstall) etc.
* **Journalisation d'installation et de configuration plus propre et plus intelligente sur Windows et Linux.** La sortie est désormais plus facile à lire grâce à un formatage cohérent, plus discrète par défaut pour une expérience plus fluide, et prend en charge des diagnostics plus riches `--verbose` lorsque vous souhaitez le détail technique complet.
* Vous pouvez désormais consulter votre historique d'entraînement !
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Première version après Unsloth Studio

Salut les gars, il s'agit de notre première version depuis le lancement d'Unsloth Studio. Beaucoup de nouvelles fonctionnalités et de corrections :

* **Vous pouvez désormais mettre à jour Unsloth Studio !** Veuillez effectuer la mise à jour avec les mêmes commandes d'installation.
* **Windows** Le CPU ou le GPU fonctionne désormais sans accroc. Veuillez réinstaller !
* **Raccourcis d'application**. Une fois installé, vous pouvez désormais le lancer sous Windows, MacOS et Linux via une icône de raccourci dans Démarrer / Lancer et sur le Bureau.
* **Précompilés `llama.cpp` binaires** et `mamba_ssm` - installations 6 fois plus rapides ! Les binaires font aussi moins de 300 Mo.
* **tailles d'installation réduites de 50 %** (économies de 7 Go ou plus), installations 2 fois plus rapides et résolution plus rapide. Tailles PyPI réduites de 50 %.
* **Appel d'outils amélioré.** Meilleure analyse de llama.cpp, plus de balisage brut d'outil dans le chat, inférence plus rapide, un nouveau panneau de sorties d'outils, des minuteries.
* MacOS et le CPU disposent désormais de [Recettes de données](/docs/fr/nouveau/studio/data-recipe.md) activées avec le téléversement de plusieurs fichiers.
* **Prise en charge préliminaire d'AMD pour Linux** machines uniquement - détection automatique.
* **Refonte de la barre latérale des paramètres.** Les paramètres sont désormais regroupés en **Modèle, Échantillonnage, Outils et Préférences**
* **Longueur du contexte** désormais réglable. Gardez à l'esprit que ce n'est pas nécessaire, car llama.cpp utilise intelligemment le contexte exact dont vous avez besoin via `--fit on`
* **Téléversement de plusieurs fichiers.** Les recettes de données prennent désormais en charge plusieurs téléversements par glisser-déposer pour PDF, DOCX, TXT et MD, avec extraction côté serveur, téléversements enregistrés et aperçus améliorés.
* **Colab** avec des GPU T4 gratuits avec Unsloth Studio, c'est désormais corrigé ! [Essayez-le ici](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Grâce aux binaires précompilés, c'est aussi 20 fois plus rapide !
* **Meilleure observabilité du chat.** Unsloth affiche désormais `llama-server` les temps et l'utilisation, une barre d'utilisation de la fenêtre de contexte et des cartes contextuelles de source plus riches.
* **Meilleure expérience utilisateur globale** - liens cliquables, meilleure analyse LaTeX, info-bulles outils / code / web pour les cartes par défaut, et bien plus encore !
* **LiteLLM -** Unsloth Studio et Unsloth ont été **PAS** affectés par la récente compromission de LiteLLM. Nemo Data Designer n'utilisait LiteLLM que jusqu'à `1.80`, pas la version affectée `1.82.7` ou `1.82.8`, et l'a depuis entièrement supprimé.
* Nous avons maintenant une nouvelle commande d'installation en une seule ligne, il suffit d'exécuter :&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Corrections :**

* **Améliorations de Windows / de la configuration.** Correction des fermetures silencieuses de Windows, des plantages au démarrage d'Anaconda/conda-forge, des installations Windows non-NVIDIA défectueuses et des vérifications de configuration CUDA précoces / venv obsolète manquantes.
* **Corrections des prompts système.** Ils fonctionnent à nouveau pour l'inférence texte et vision non-GGUF.
* **Prompts système et préréglages persistants.** Les prompts système personnalisés et les préréglages de chat persistent désormais à travers les rechargements et les changements de page.
* **Export GGUF étendu.** Les fine-tunes complets, pas seulement LoRA/PEFT, peuvent désormais être exportés en GGUF. La résolution du modèle de base est plus fiable, et les options d'exportation non prises en charge sont désactivées dans l'interface.
* **Corrections du défilement et de la mise en page du chat.** Correction des problèmes de position de défilement pendant la génération, du décalage de mise en page du panneau de réflexion et des sauts de la fenêtre d'affichage lors de la réduction des panneaux de raisonnement.
* **Détection plus intelligente des conflits de ports.** Unsloth détecte désormais les conflits de boucle locale, peut identifier le processus bloquant lorsque c'est possible, et fournit des messages de port de secours plus clairs.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Nouvel appel d'outils + stabilité de Windows

* Claude Artifacts fonctionne, de sorte que le HTML peut être exécuté comme un jeu Snake dans le chat
* +30 % d'appels d'outils plus précis, surtout pour les petits modèles + Minuterie pour les appels d'outils
* Les sorties des outils + de la recherche web peuvent être enregistrées + Activer/désactiver l'outil d'auto-réparation
* De nombreuses corrections de bugs - le CPU Windows fonctionne, Mac est plus fluide, installations plus rapides et plus petites
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/nouveau/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
