> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/nouveau/changelog.md).

# Mises à jour d’Unsloth

Pour utiliser les dernières modifications, [mettez à jour Unsloth](/docs/fr/nouveau/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## La prise en charge d'AMD est là !

Salut tout le monde ! Cette version apporte l'entraînement et l'inférence locales de LLM à [des GPU AMD](/docs/fr/bases/amd.md) sur Windows, WSL et Linux.

<a href="/pages/7a3835192ce3c923a337ace4fb5e0396c6bb2b8f#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Démarrage rapide</a><a href="/pages/7a3835192ce3c923a337ace4fb5e0396c6bb2b8f#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Fonctionnalités</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

À partir d'aujourd'hui, notre collaboration avec AMD, nos noyaux Triton personnalisés et nos algorithmes mathématiques vous permettent d'entraîner et d'exécuter plus de 500 modèles sur les GPU Radeon, Instinct, Vulkan, Ryzen et de centre de données d'AMD, jusqu'à 2× plus vite avec 70 % de VRAM en moins et sans perte de précision. Les versions ROCm optimisées prennent également en charge l'inférence GGUF et Safetensors.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Mise à jour du 23 juillet

1. Ajouté **RDNA2, Gorgon Halo, prise en charge de Vulkan** + correction du fait que l'installation AMD ne détectait pas les GPU sur Strix Halo / autres GPU AMD
2. Meilleur RDNA4, correction automatique et gestion des échecs HIP / ROCm
3. **mémoire unifiée 2x plus rapide** Chargement de safetensors AMD + point de contrôle des gradients beaucoup plus rapide pour les périphériques à mémoire unifiée
4. Ajouté **dictée vocale / whisper.cpp** prise en charge préliminaire de la synthèse vocale rapide
5. Correction des environnements de rollback pendant les installations qui engloutissaient 5 Go d'espace disque - nettoyage automatique désormais

#### Entraînez des LLM localement sur AMD

* Entraînez, exécutez du RL, discutez et déployez des modèles localement sur des GPU AMD.
* Détection et installation plus fiables des GPU AMD sur Windows, WSL et Linux.
* Compatibilité ROCm améliorée pour les GPU AMD MI300X et MI325X.
* Accédez à distance à Unsloth via `unsloth studio --secure` via HTTPS gratuit grâce à Cloudflare

#### Exécutez des modèles plus grands sur votre matériel

* Utilisez le placement automatique sur le GPU ou choisissez exactement quels GPU et quelles couches du modèle utiliser.
* Déplacez les couches d'experts MoE dans la mémoire système pour aider les modèles plus grands à tenir.
* Répartissez les modèles sur plusieurs GPU ou utilisez le parallélisme tensoriel.
* Enregistrez séparément les paramètres matériels pour chaque modèle et quantification.

#### Redémarrages de chat plus rapides et téléchargements plus fiables

* Reprenez de longues conversations sans reconstruire l'intégralité de l'échange après qu'un modèle inactif ait libéré sa VRAM.
* Les téléchargements XET de Hugging Face bloqués réessaient automatiquement via HTTP standard.
* Les fichiers GGUF existants sont réutilisés au lieu d'être téléchargés à nouveau à chaque chargement d'un modèle.

#### Meilleure recherche, outils et agents

* La recherche web peut désormais lire des articles PDF, des manuels et d'autres résultats PDF.
* Les appels d'outils parallèles, la sortie de raisonnement et les nouvelles tentatives d'outils fonctionnent de manière plus fiable.
* Un nouveau point de terminaison MCP opt-in permet aux clients IA compatibles d'inspecter les modèles et l'historique d'entraînement, de démarrer ou d'arrêter l'entraînement, de charger des checkpoints, de valider des recettes et d'exporter des GGUF.
  * Activez-le avec `UNSLOTH_STUDIO_ENABLE_MCP=1` et définissez le jeton Bearer requis avec `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Corrections d'entraînement et d'exportation

* L'entraînement textuel uniquement avec les modèles multimodaux ne tronque plus les longs exemples avant le packing.
* Les modèles MTP Qwen3.5 et Qwen3.6 affinés s'exportent désormais correctement vers GGUF.
* Correction d'une erreur d'autorisation Windows qui pouvait arrêter les exports GGUF pendant l'étape finale d'écriture.

#### Au cas où vous l'auriez manqué

Notre précédente version Studio a ajouté des modèles Dynamic NVFP4, une personnalisation plus poussée, sept nouvelles langues d'affichage, des agents plus sûrs et l'accélération GPU Vulkan.

**Dynamic NVFP4 :**

Unsloth Dynamic NVFP4 conserve les couches sensibles à la précision en FP8 ou BF16 tout en exécutant le reste en W4A4. Sur les GPU NVIDIA Blackwell, cela permet une inférence jusqu'à 2,5x plus rapide, tandis que les caches KV FP8 calibrés offrent un contexte jusqu'à 2x plus long.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) et découvrez notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4), élargie, notamment avec Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

**Personnalisez votre Studio :**

Choisissez entre les palettes de couleurs Standard, Classique et Minimal, chacune en mode clair et sombre. Vous pouvez également personnaliser les couleurs, importer des polices et ajuster la taille de la police, le contraste, le mouvement réduit et plus encore.

Unsloth inclut également un onglet Paramètres vocaux pour la dictée, les paramètres de dictionnaire personnalisé et la lecture à voix haute.

**Nouvelles langues :**

Unsloth Studio est désormais disponible en français, allemand, espagnol, hindi, arabe, russe et coréen, en plus du chinois (simplifié), du japonais et du portugais (Brésil). La détection automatique de la langue du navigateur est désormais activée par défaut.

**Agents plus sûrs :**

Un sélecteur d'autorisation des appels d'outils à quatre niveaux-**Demander**, **Approuver pour moi**, **Désactivé** et **Accès complet**- offre un contrôle plus fin sur les agents. L'isolation de l'espace de travail de l'agent et des vérifications d'installation plus sûres réduisent également le risque de modifications involontaires.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personnalisation, NVFP4, langues

Salut les gars, nous avons beaucoup de nouvelles mises à jour pour Unsloth, en particulier la personnalisation. Unsloth est maintenant à vous de personnaliser : trois palettes de couleurs plus des couleurs et polices personnalisées, sept nouvelles langues d'affichage et un nouvel onglet Paramètres vocaux pour la dictée et la lecture à voix haute. Les agents sont plus sûrs avec un sélecteur d'autorisation des appels d'outils à quatre niveaux (Demander, Approuver pour moi, Désactivé, Accès complet) et l'isolation de l'espace de travail, et les GPU Intel obtiennent enfin l'inférence accélérée par GPU via le nouveau Vulkan `llama.cpp` prise en charge.

Nous avons également ajouté une prise en charge native de [Inkling](https://unsloth.ai/docs/models/inkling), un modèle ouvert de 975B paramètres avec 41B paramètres actifs et une fenêtre de contexte allant jusqu'à 1M jetons. Sous licence Apache 2.0, il accepte du texte, des images et de l'audio, et génère du texte.

#### Dynamic NVFP4

Nous avons élargi notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4) avec des versions quantifiées de Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) pour plus de détails.

Personnalisez votre Unsloth

Unsloth n'est plus limité au mode clair et sombre :

* Choisissez parmi les palettes **Standard**, **Classique**, et **Minimal** chacune avec des variantes claires et sombres.
* Personnalisez les couleurs d'accentuation, d'arrière-plan et de premier plan.
* Importez vos propres polices pour l'interface, les titres, le chat et le code.
* Ajustez la taille de la police, le contraste, le mouvement, le comportement du curseur et l'anticrénelage des polices.
* Recherchez dans les paramètres et synchronisez les préférences entre les appareils.

Les modes clair et sombre conservent chacun leurs propres valeurs de personnalisation.

#### Sept nouvelles langues

Unsloth prend désormais en charge le français, l'allemand, l'espagnol, l'hindi, l'arabe, le russe et le coréen, en plus du chinois, du japonais et du portugais. La détection automatique de la langue du navigateur est désormais la valeur par défaut.

#### Paramètres vocaux

Un nouvel onglet Voix ajoute des commandes pour la dictée, les dictionnaires de prononciation et la lecture à voix haute. La prise en charge de la conversion speech-to-text et text-to-speech arrive bientôt ; les conversations vocales complètes sont encore en développement.

#### Agents et appels d'outils plus sûrs

L'ancien bouton de contournement est désormais un sélecteur d'autorisation à quatre niveaux :

* **Demander :** approuver chaque appel d'outil.
* **Approuver pour moi :** exécuter automatiquement les actions en lecture seule et faire une pause pour celles potentiellement dangereuses.
* **Désactivé :** désactiver les appels d'outils.
* **Accès complet :** autoriser tous les appels et désactiver le sandbox.

Ces contrôles couvrent le terminal, Python, la recherche web, RAG et les outils MCP. Les agents bénéficient également d'espaces de travail isolés, de sessions reprenables avec `--persist`, d'avertissements plus sûrs pour l'installateur distant, d'un streaming en direct des sorties d'outils et d'une extraction web améliorée.

#### Vulkan et `llama.cpp`

Le nouveau Vulkan `llama.cpp` backend donne aux GPU Intel une inférence accélérée par GPU au lieu de basculer vers le CPU. Il prend en charge la gestion de la VRAM existante, le dimensionnement automatique du contexte, la sélection multi-GPU et le déchargement des couches.

Les utilisateurs AMD peuvent activer l'option avec :

```bash
UNSLOTH_FORCE_VULKAN=1
```

Nous avons également amélioré la fiabilité des mises à jour, la récupération de l'état du modèle et l'interruption des générations bloquées.

#### Modèles et entraînement

Cette version inclut également :

* Prise en charge native d'Inkling et améliorations multi-GPU B200.
* Attention eager DeepSeek-V4 et experts groupés FP8 entraînables.
* Entraînement fiable « completion-only » grâce à la détection automatique des marqueurs de modèle de chat.
* Gestion correcte de la désactivation du gradient checkpointing.
* Amélioration du RoPE scaling et de l'extension du contexte.
* Arrêt forcé des exécutions d'entraînement bloquées.
* Routage automatique pour les nouvelles architectures de modèles et les versions plus récentes de Transformers.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth peut désormais exporter des GGUF NVFP4, FP8 et imatrix après l'entraînement ; servir comme système d'API llama-swap ; ajouter la prise en charge du japonais et du portugais brésilien ; et inclut MLX, safetensors, l'appel d'outils, la prise en charge de healing, et plus encore. Le cœur d'Unsloth rend GRPO 1,3x plus rapide, ajoute un repli HTTP pour les téléchargements bloqués, améliore le mode hors ligne, accélère l'entraînement MoE de 3 à 5x et corrige de nombreux bugs. Cette série de versions utilise `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/fr/modeles/deepseek-v4.md) est désormais pris en charge avec des bascules de réflexion et nos corrections améliorées du modèle de chat.

<div data-with-frame="true"><figure><img src="/files/cb40f0febe9a3ba462b7ebbb2c67036bc9068421" alt="" width="375"><figcaption></figcaption></figure></div>

#### Service d'API compatible OpenAI plus intelligent

Exécutez un point de terminaison API local avec un changement de modèle plus sûr et une meilleure récupération des outils d'agent.

* Les requêtes API peuvent opter pour une bascule automatique entre des GGUF locaux téléchargés, tandis que les noms de modèles inconnus continuent d'utiliser en toute sécurité le modèle actuel.
* `/v1/models` renvoie désormais des identifiants de modèles propres et le catalogue GGUF local au lieu des chemins locaux `.gguf` .
* Le déchargement automatique à l'inactivité peut libérer de la VRAM après une période d'inactivité, et la correction des appels d'outils peut désormais être contrôlée par requête.

#### Améliorations de l'exportation

Les exportations sont plus flexibles et évitent les téléchargements inutiles.

* Sélectionnez plusieurs formats d'exportation à la fois, notamment FP8/INT8 portable, GGUF LoRA, exportations correspondant à la source, imatrix GGUF, et FP8/FP4 compressé.
* Les exportations multi-checkpoints évitent davantage de téléchargements répétés du modèle de base.
* Les exportations FP8, INT8 et GGUF-LoRA respectent désormais `trust_remote_code`, et l'exportation GGUF gère plus fiablement les paramètres de quantification manquants.

#### RAG et chat avec des fichiers

Le chat avec des fichiers est plus utile sur de vrais documents.

* Les pièces jointes RAG peuvent désormais utiliser le contexte de document entier, avec des modèles d'embedding personnalisables et la recherche Hugging Face.
* Le chat avec des fichiers lit correctement davantage de PDF et de documents Word, y compris le texte de droite à gauche, le texte indic, et les tableaux DOCX.
* Les vérifications RAG locales sont plus fiables derrière des configurations de proxy.

#### Améliorations et fiabilité d'Unsloth

L'utilisation quotidienne devrait sembler plus fluide et plus stable.

* Les longues exécutions d'entraînement et de chat sont moins susceptibles de se figer silencieusement.
* Le mode comparaison, le changement de modèle, l'annulation de modèle, la navigation Hub et Hub Discover sont plus fiables.
* Les exportations de projet, les exportations de chat, les paramètres, les visites guidées, les boîtes de dialogue de fichiers, les écrans de mise à jour et l'interface de raisonnement sont plus propres et plus cohérents.

#### Corrections de l'installateur, du matériel et de la plateforme

Unsloth s'installe et s'exécute plus fiablement sur toutes les plateformes.

* Les installations macOS ne nécessitent plus CMake ou Homebrew lorsqu'un précompilé `llama.cpp` est disponible, et la prise en charge d'Apple Silicon gère mieux les chemins avec des espaces et le dimensionnement de la mémoire unifiée.
* Le démarrage sous Windows, la gestion UTF-8, l'intégration RAG ROCm et la prise en charge GPU de ROCm sur WSL ont été améliorés.
* La sélection des précompilés pour GPU Blackwell, les vérifications d'adéquation GGUF, le parallélisme tensoriel pour les GGUF vision/mmproj, et la réutilisation locale de `llama.cpp` sont désormais plus fiables.

#### Entraînement, modèles et noyaux

L'entraînement et le chargement des modèles sont plus fiables dans davantage de configurations.

* GRPO prend désormais en charge le packing des séquences par défaut, évite les invites partagées répétées et gère correctement la mise à l'échelle des logits en DDP.
* Le fine-tuning complet, les paramètres de précision RL, le gradient checkpointing, les tampons RoPE DDP et la détection de MoE LoRA ont été corrigés.
* La quantification/déquantification FP8, le RoPE scaling de Llama 3 avec Transformers v5, les rechargements LoRA de PEFT 0.19, et `fast_generate` messages d'erreur ont été améliorés.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + contextes 3x plus longs

[GLM-5.2](/docs/fr/modeles/glm-5.2.md) est désormais pris en charge dans Unsloth Studio ! Tous les niveaux de raisonnement sont pris en charge. **Des longueurs de contexte 3x plus longues** sont désormais possibles grâce à notre nouvel algorithme d'ajustement automatique avec MTP, permettant des conversations plus longues. Mode de contournement des autorisations, conversations pouvant être forkées, conversations en file d'attente, un nouveau hub pour la découverte de modèles, modules parallèles + prise en charge HTTPS Cloudflare et plus encore ! Utilisez `unsloth studio --secure` pour un accès HTTPS mondial sécurisé !

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Meilleur algorithme de longueur de contexte

Conformément à [PR 1](https://github.com/unslothai/unsloth/pull/6312) et [PR 2](https://github.com/unslothai/unsloth/pull/6447), nous avons considérablement amélioré la détermination par Unsloth Studio de l'utilisation mémoire et de la longueur de contexte, obtenant un contexte global 3x plus long :

| Scénario                           | KV         | avant   | après   |
| ---------------------------------- | ---------- | ------- | ------- |
| pipeline 1x 32 Go (\~31 Go libres) | f16        | 23,040  | 64,000  |
|                                    | q8\_0      | 43,520  | 114,944 |
|                                    | q4\_0      | 82,432  | 199,680 |
| pipeline 2x 32 Go                  | quelconque | 262,144 | 262,144 |
| tensor 2x 24 Go (\~23 Go libres)   | f16        | 134,049 | 262,144 |
|                                    | q8\_0      | 252,329 | 262,144 |

#### Chat Canvas, bifurcation et mise en file d'attente

* Modifiez les messages de l'assistant sur place et relancez depuis n'importe quel point du fil.
* Bifurquez un fil pour créer une branche de conversation sans perdre l'original.
* Chats temporaires (incognito) qui ne laissent aucune trace.
* Mettez de nouvelles invites en file d'attente pendant qu'une génération est encore en cours au lieu d'attendre.
* Les « artefacts » de chat sont désormais **canvas**, avec des **cartes HTML canvas** en ligne qui se rendent automatiquement, une vue Code, et DiffusionGemma conserve son code brut visible en ligne au lieu de le réduire.
* La recherche dans le chat couvre désormais tous les messages et affiche d'abord vos propres messages.

#### Hub (repensé)

* Hub pleine page avec un flux tendance, une recherche et la prise en charge de chemins de modèles personnalisés.
* Aperçu du README dans un flux en vue partagée afin que vous puissiez lire avant de télécharger.
* Les téléchargements utilisent par défaut le transport plus rapide **Xet** , avec repli automatique vers HTTP si un transfert bloque.
* Nouvel interrupteur « Charger à la sélection » pour définir les options de chargement avant qu'un modèle ne se charge.
* Logo Google affiché pour DiffusionGemma et les futurs dérivés Gemma.

#### Modèles et inférence

* DeepSeek-OCR et davantage de modèles de vision se chargent et s'exécutent désormais sans erreur.
* Correction de l'inférence rapide sur la dernière version de vLLM (0.22+) afin que les accélérations fonctionnent à nouveau.
* Le parallélisme tensoriel est plus fiable : si le chemin MTP plus rapide échoue, il se rétablit désormais tout seul au lieu de planter.
* DiffusionGemma montre désormais l'image en formation en direct pendant le débruitage, avec des statistiques de vitesse précises.

#### Sécurité et studios chiffrés Cloudflare

* Nouveau `--secure` mode Cloudflare uniquement pour les studios chiffrés de bout en bout, avec les outils côté serveur restant activés sous `--secure`. Utilisez `unsloth studio --secure`!
* le mode Bypass Permissions pour ignorer les confirmations et désactiver le sandbox des outils lorsque vous le souhaitez.
* Détection automatique de l'analyse antivirus de Hugging Face + des fichiers dangereux dans les dépôts.

#### Journalisation et API

* Nouveau **moniteur du serveur API** dans Unsloth.
* Appels API plus rapides et latence réduite
* Journaux beaucoup plus épurés - désormais avec le débit et la latence, et suppression de nombreux journaux verbeux.

#### Matériel et backend

* Meilleure prise en charge des GPU Blackwell RTX 50X et 60X
* Correction du basculement silencieux vers le CPU au lieu du GPU
* La version de torchao est désormais choisie à partir de torch installé.
* L'installateur répare désormais automatiquement une installation PyTorch cassée ou CPU-only et avertit en cas de repli silencieux vers le CPU, sur NVIDIA + AMD sous Win/Linux/Mac/WSL.
* Libère la VRAM du modèle de chat lorsque l'entraînement commence, mais uniquement lorsque le GPU est réellement à l'étroit (sinon, aucun rechargement inutile).
* Si llama-server plante brutalement au démarrage, Unsloth passe désormais par une séquence de récupération au lieu d'échouer simplement.

#### Corrections d'entraînement et générales et modules parallèles

* Mises à jour de l'entraînement MLX.
* Fiabilité améliorée de l'entraînement GRPO avec vLLM.
* Le démarrage de l'entraînement a été rendu plus fiable, avec des erreurs plus claires pour les lots VLM invalides.
* Unsloth nettoie désormais plus fiablement les processus backend restants après des plantages, des redémarrages ou des extinctions interrompues.
* Export, chat, entraînement, recettes sont tous individualisés / compartimentés ! Cela signifie que vous pouvez faire les 4 en parallèle maintenant ! Vous pouvez discuter / faire de l'inférence pendant que vous attendez une exécution d'entraînement ou un export !

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Assurez-vous d'installer le dernier [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) et [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) sont désormais tous pris en charge.

* Exécutez et entraînez [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) via [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) est là ! Exécutez [Gemma 4](https://unsloth.ai/docs/models/gemma-4) environ 2x plus vite avec MTP.
* Le chat audio est désormais pris en charge pour Gemma 4 (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Préserver le raisonnement ajouté à Gemma 4.

<figure><img src="/files/608ef824be87e674df7b205a47c03ae2281fb5dc" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + gestionnaire de téléchargements (expérimental)

* Ajout d'une nouvelle **Hub** page pour parcourir, télécharger et gérer les modèles et ensembles de données Hugging Face.
* Unsloth peut désormais détecter les modèles et ensembles de données déjà présents sur votre machine et les afficher à côté des éléments téléchargés.
* Téléchargés [modèles GGUF](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) disposent désormais d'actions directes **Exécuter / Nouveau chat** .

#### RAG / Chat avec des fichiers (expérimental)

* Ajouté [**Chat avec des fichiers**](https://unsloth.ai/docs/new/studio/chat) dans Unsloth, vous permettant de poser des questions sur vos propres documents et bases de connaissances.
* Prend en charge la recherche hybride, les citations, les aperçus PDF, les documents par fil de discussion, et un outil intégré `search_knowledge_base` .

#### Nouveau bouton de mise à jour + prise en charge du matériel

* Unsloth utilise désormais constamment des précompilés llama.cpp [à jour](https://unsloth.ai/docs/new/changelog) sur CUDA, ROCm, Windows, Linux et macOS.
* Ajout d'un **Mettre à jour llama.cpp** bouton dans l'application afin que les utilisateurs puissent mettre à jour le backend local sans réinstaller Unsloth.
* Prise en charge améliorée de Windows / WSL AMD, [prise en charge ROCm de Strix Halo](https://unsloth.ai/docs/get-started/install/amd), [sélection Blackwell CUDA](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth), et messages d'installation plus clairs.

#### Compatibilité locale du chat, des outils et de l'API

* Local [appel d'outils](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) est plus fiable, avec un meilleur ordre des cartes d'outils, moins de boucles d'outils en double, et la prise en charge de l'utilisation d'outils avec les modèles de vision GGUF.
* Améliorée [API compatible OpenAI](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) et comportement d’API compatible Anthropic pour les serveurs Unsloth locaux, y compris de meilleures erreurs, l’utilisation des jetons, les raisons d’arrêt, et [compatibilité avec Claude Code](https://unsloth.ai/docs/basics/claude-code).

#### Entraînement et correctifs

* Améliorée [Prise en charge de MLX](https://unsloth.ai/docs/new/studio/install) avec de meilleurs libellés de modèles, des statistiques de vitesse de génération, et des correctifs pour [l’entraînement VLM](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Corrigé plusieurs [d’entraînement](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) et [jeu de données](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) cas limites, y compris des caches Hugging Face non inscriptibles et des mappages de jeux de données personnalisés.
* Ajout de nombreux correctifs de finition de l’interface dans le chat, les menus, le sélecteur de modèle, le mode sombre, l’import/export et les paramètres.

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, nouvelle interface, MCP, projets

Cette mise à jour se concentre principalement sur Gemma 4 12B, MCP, Projets, Canvas, CUDA 13.3 et la nouvelle interface de chat. La semaine prochaine, nous aurons une mise à jour encore plus importante.

<div data-with-frame="true"><figure><img src="/files/e39215578eb5aa4f1238786b6475c3aec5e52345" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Sorties de Google [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4), un nouveau modèle qui fonctionne localement sur 8 Go de RAM. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Guide](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified prend en charge l’image, l’audio et un contexte de 256K. Exécutez et entraînez le modèle via Unsloth Studio.

#### MCP

* Distant `MCP` prise en charge du serveur, y compris les en-têtes personnalisés et OAuth
* Local basé sur des commandes `MCP` prise en charge du serveur
* `MCP` peut désormais être activé depuis le compositeur de chat
* Préréglages intégrés pour les serveurs courants `MCP` serveurs

#### Nouvelle interface de chat

* Projets, Canvas, `MCP`, RAG et les contrôles de comparaison se trouvent désormais dans le menu plus
* Les contrôles de recherche et de code sont plus faciles d’accès depuis le compositeur
* Les menus, superpositions, icônes et contrôles cliquables sont plus cohérents dans tout Unsloth

#### Projets

* Organisez les conversations liées dans des espaces de travail dédiés à un projet
* Déplacer des conversations existantes vers des projets
* Créer et gérer des projets directement depuis la barre latérale

#### Canvas / Artefacts expérimentaux

* Ouvre le HTML généré dans un panneau Canvas dédié dans Unsloth Studio
* Prend en charge les sorties interactives, y compris les visualisations basées sur le navigateur et les packages chargés via CDN
* Vous permet de basculer entre l’aperçu rendu et le code source

#### Installation, exécution et matériel

* Les installations précompilées Windows ne nécessitent plus la vérification initiale de `kit d’outils CUDA` du
* Linux `llama.cpp` les versions précompilées correspondent désormais à l’environnement d’exécution détecté `cudart` majeur
* `ROCm` la détection gfx est transmise à la sélection des précompilés
* `Blackwell`, `B300` et `ARM64` Mises à jour de la prise en charge Linux

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**À NE PAS UTILISER `mise à jour d’Unsloth Studio` car le packaging ne recevra plus les dernières mises à jour !**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :**

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**À NE PAS UTILISER `mise à jour d’Unsloth Studio` car le packaging ne recevra plus les dernières mises à jour !**
{% endhint %}

#### Mises à jour Mac

* Réactivés `llama.cpp` les binaires précompilés pour Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Mac OS 13 (Ventura) sur Apple Silicon est compilé à partir des sources
* Intel (x86\_64) pour Mac OS 13.3 / 14 / 15 / 26 (Tahoe) utilise `llama.cpp` des binaires précompilés
* Intel pour Max 13.0 - 13.2 est compilé à partir des sources

#### Mises à jour Windows

* CUDA 13.3 `llama.cpp` les binaires précompilés fonctionnent désormais pour Windows
* Pour CUDA 13.2, CUDA 13.1 et versions antérieures, les appareils Windows utilisent le repli vers CUDA 12.4 - nous travaillerons bientôt sur des binaires CUDA 13.1.

#### Mise à jour CUDA 13.3

* Les binaires non Linux de CUDA 13.3 fonctionnent. Nous utiliserons encore CUDA 13.1 pour l’instant
* CUDA 13.3 résout le problème de charabia de CUDA 13.2 - voir <https://github.com/unslothai/unsloth/issues/4849>

#### Mise à jour des GPU Blackwell

* Pour l’instant, Blackwell aura des sorties retardées de `llama.cpp` binaires précompilés, car CUDA 12.4 ne fonctionne pas - nous travaillons à résoudre cela bientôt.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Une mise à jour avant le remaniement.

Salut les gars, nous faisons encore une dernière petite mise à jour avant un remaniement majeur qui devrait arriver cette semaine ou la semaine prochaine. Notre remaniement changera beaucoup de choses, surtout avec de nouvelles fonctionnalités majeures et beaucoup de changements de design.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NOUVEAU : [**prise en charge des appels API**](https://unsloth.ai/docs/integrations/connections) désormais avec génération + édition d’images, recherche web appropriée, exécution de code, mise en cache automatique des prompts. Connectez [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) et plus encore.
* Prise en charge correcte des **langues non anglaises** par ex. japonais, chinois, indien, etc.

Beaucoup d’entre vous ont peut-être manqué notre précédente publication qui n’a duré qu’un jour. Nous avons introduit :

* Connexion à des backends d’inférence externes : [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Améliorations de la sécurité**
* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; obtenez les meilleurs paramètres personnalisés pour votre matériel.

#### Appel au fournisseur d’API et connexions externes

* Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud d’API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)
* La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, ce qui permet d’économiser 50 à 90 % des coûts.
* Génération + édition d’images
* La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

#### Autres mises à jour d’Unsloth Studio

* Pièces jointes de chat OpenDocument
* charge utile du résumé de raisonnement o3
* L’envoi/la saisie dans des langues non anglaises (par ex. japonais, chinois) fonctionne désormais correctement
* Renforcement du compositeur IME, RTL `dir="auto"`correction du tronquage des longues lignes de journal
* Rendu de la trace de raisonnement de l’outil dans l’interface
* Prise en charge entièrement hors ligne : découverte GGUF mise en cache et auto-détection DNS hors ligne pour l’inférence et l’entraînement

#### Améliorations de la sécurité d’Unsloth Studio

* Limitation du débit d’authentification, adaptée aux proxys pour que les reverse proxies ne la contournent pas
* Travailleur sandboxé avec une liste de blocage renforcée (bash, `téléversement hf`, `NOFILE`)
* Confinement des chemins pour que les travailleurs ne puissent pas sortir de leurs répertoires tmp en cours
* Validation stricte du schéma dans toute l’API Unsloth
* En-têtes CSP / de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)
* Supprimé le `torch.load` repli sur `training_args.bin` afin que les pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèle
* Flux de publication Tauri desktop renforcé
* Authentification frontend : actualisation de jeton en singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, aide 422 partagée
* L’annulation du nettoyage est désormais strictement limitée aux répertoires tmp en cours afin qu’elle ne puisse jamais supprimer l’état utilisateur
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## Correctifs MTP + Unsloth

Beaucoup de correctifs de bugs et d’interface UX pour Unsloth ! Pour obtenir les dernières mises à jour, faites :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Correctifs

1. Correction `mise à jour d’Unsloth Studio` ne fonctionne pas bien
2. Correction du blocage sur `reset-password` page
3. Plus de prise en charge du mode hors ligne
4. Améliorer le fait que MTP ne soit pas plus rapide sur Mac, CPU et GPU - c’est maintenant bien mieux !
5. Correction du raccourci bureau qui ne fonctionnait pas après la mise à jour
6. Beaucoup, beaucoup de correctifs de bugs UI/UX
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + connexions API

Nous avons beaucoup de nouvelles mises à jour pour Unsloth `v0.1.41-beta`:

* **\~2x inférence GGUF plus rapide** avec activation automatique de [MTP](/docs/fr/modeles/qwen3.6.md#mtp-guide)
* [**prise en charge des appels API**](/docs/fr/integrations/connections.md) pour [OpenAI](/docs/fr/integrations/connections/openai.md), [Anthropic](/docs/fr/integrations/connections/anthropic-claude.md) etc. avec mise en cache automatique des prompts, recherche web, exécution de code
* Connexion à des backends d’inférence externes : [vLLM](/docs/fr/integrations/connections/vllm.md), [Ollama](/docs/fr/integrations/connections/ollama.md), [llama-server](/docs/fr/integrations/connections/connecter-llama.cpp-a-unsloth-executer-des-gguf-avec-llama-server.md)
* Expérimental **inférence MLX**
* Prise en charge correcte des **langues non anglaises**
* **Sécurité** améliorations

<a href="/pages/4a2b83ac4bf0233da80a1e3b6ab9fb218108742c#qwen3.6-inference-tutorials" class="button primary">Exécuter les tutoriels Qwen3.6</a><a href="/pages/4a2b83ac4bf0233da80a1e3b6ab9fb218108742c#mtp-guide" class="button primary">Guide MTP</a>

<div data-with-frame="true"><figure><img src="/files/75019f5e946025018cbbe6a126c414cb70114bdd" alt="" width="375"><figcaption></figcaption></figure></div>

#### Prise en charge du décodage spéculatif MTP : inférence de 1,4 à 2x plus rapide !

* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; avertir lorsque le précompilé llama.cpp inclus est obsolète ou trop ancien pour MTP
* Nouveaux binaires précompilés llama.cpp pour la prise en charge de MTP !

#### Appel au fournisseur d’API et connexions externes

* Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud d’API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)
* La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, ce qui permet d’économiser 50 à 90 % des coûts.
* La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

#### Inférence MLX (expérimental)

* Les quantifications et modèles MLX peuvent désormais s’exécuter localement sur vos machines Mac !
* Nous ajouterons bientôt la réflexion, les outils et la recherche web !

#### Autres mises à jour d’Unsloth Studio

* L’envoi/la saisie dans des langues non anglaises (par ex. japonais, chinois) fonctionne désormais correctement
* Pièces jointes de chat OpenDocument
* charge utile du résumé de raisonnement o3
* Renforcement du compositeur IME, RTL `dir="auto"`correction du tronquage des longues lignes de journal
* Rendu de la trace de raisonnement de l’outil dans l’interface
* Prise en charge entièrement hors ligne : découverte GGUF mise en cache et auto-détection DNS hors ligne pour l’inférence et l’entraînement
* Beaucoup de peaufinage UI/UX : refonte du thème sombre, redesign de la barre latérale droite, mascotte paresseux selon l’heure de la journée, toasts copiables et rejetables, compositeur de chat plus grand, peaufinage de la config d’exécution de code, style des pastilles d’action du compositeur, bouton Discord plus étroit

#### Mises à jour de l’entraînement

* Correctifs du masque d’attention Gemma
* GRPO multi-image
* Expériences de retour d’état caché GRPO
* Nouvelle méthode d’entraînement Continued Pretraining (CPT) comme option de premier ordre
* extracteur Gemma-4 MoE LoRA enregistré pour corriger `grouped_mm` crash de contraction
* Fusionné en option `lm_head` + entropie croisée en avant, avec chemin à une seule multiplication matricielle sous `UNSLOTH_RETURN_LOGITS=1`
* Passer la taille du lot pour l’évaluation
* Les chemins d’évaluation/entraînement respectent désormais `HF_DATASETS_OFFLINE` ainsi que `HF_HUB_OFFLINE`

#### Améliorations de la sécurité d’Unsloth Studio

* Limitation du débit d’authentification, adaptée aux proxys pour que les reverse proxies ne la contournent pas
* Travailleur sandboxé avec une liste de blocage renforcée (bash, `téléversement hf`, `NOFILE`)
* Confinement des chemins pour que les travailleurs ne puissent pas sortir de leurs répertoires tmp en cours
* Validation stricte du schéma dans toute l’API Unsloth
* En-têtes CSP / de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)
* Supprimé le `torch.load` repli sur `training_args.bin` afin que les pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèle
* Flux de publication Tauri desktop renforcé
* Authentification frontend : actualisation de jeton en singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, aide 422 partagée
* L’annulation du nettoyage est désormais strictement limitée aux répertoires tmp en cours afin qu’elle ne puisse jamais supprimer l’état utilisateur
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## point de terminaison de l’API Unsloth

#### ***correctif de bug v0.1.39-beta*** **5 mai 2026**

Corrige le fait que l’historique du chat ne s’affiche pas (l’historique de chat existant n’est pas perdu) et que les pièces jointes ne s’attachent pas correctement. Le bug ne concernait que l’affichage - utilisez `2026.5.2` ou appelez directement `curl -fsSL https://unsloth.ai/install.sh | sh`  pour mettre à jour

Vous pouvez utiliser des LLM locaux avec des outils comme [Claude Code](https://unsloth.ai/docs/basics/claude-code) et [Codex](https://unsloth.ai/docs/basics/codex) en les connectant au point de terminaison API d’Unsloth. Cela vous permet d’exécuter des modèles comme [Qwen](https://unsloth.ai/docs/models/qwen3.6) et [Gemma](https://unsloth.ai/docs/models/gemma-4) localement, avec des fonctionnalités supplémentaires telles que l’appel d’outils auto-réparateur, l’exécution de code et la recherche web.

Utiliser Unsloth comme point de terminaison d’inférence API est avantageux non seulement parce qu’il est facile à configurer et rapide, mais aussi parce qu’Unsloth fournit :

* [Appel d’outils auto-réparateur](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), ce qui aide à réduire de 50 % les appels d’outils cassés ou mal formés
* [Exécution de code](https://unsloth.ai/docs/new/studio/chat#code-execution) prise en charge, permettant l’exécution de Bash et de Python pour des sorties de code plus précises.
* Avancée [Recherche web](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) qui visite et lit réellement les pages web pour recueillir des informations approfondies.
* [Paramètres d’inférence automatiques](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) pour les modèles GGUF (temp, top-k, etc.)

<div data-with-frame="true"><figure><img src="/files/1a2d152a014c5c542c774dac8c97d657a9f4124f" alt="" width="375"><figcaption></figcaption></figure></div>

#### Nouveaux modèles

Nous avons aussi quelques nouveaux modèles à exécuter, notamment NVIDIA [Nemotron 3 Nano Omni](/docs/fr/modeles/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/fr/modeles/ibm-granite-4.1.md) et [Mistral 3.5](/docs/fr/modeles/mistral-3.5.md) Medium. Nous avons aidé Mistral à résoudre certains problèmes d’implémentation dans transformers et les GGUFs.

#### Mises à jour d’Unsloth

* Les exécutions d’entraînement Unsloth interrompues peuvent désormais reprendre à partir des checkpoints.
* Les fils de chat se sauvegardent désormais automatiquement et persistent de manière plus fiable.
* Les blocages de l’entraînement DPO dans les configurations multiprocessus ont été corrigés.
* La prise en charge de GRPO pour VLM a été améliorée avec les mises à jour MROPE.
* Le bouton d’arrêt d’Unsloth arrête désormais correctement la génération.
* Correction de la disparition du modèle de chat après l’actualisation du navigateur.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Nouvelle refonte complète de l’interface

Salut les gars, nous avons remanié toute l’interface et l’expérience UX d’Unsloth Studio pour mettre l’accent sur le chat et l’entraînement :

* Ajout d’une barre latérale rétractable basée sur les retours de la communauté

<div data-with-frame="true"><figure><img src="/files/31c38c07670d49aecd1964d6f1124e2d504c41ae" alt="" width="375"><figcaption></figcaption></figure></div>

* Vous pouvez désormais supprimer des chats et rechercher dans les conversations passées

<div><figure><img src="/files/d13eab37745a36ab2562ab8d5d4e5afd42b30afd" alt=""><figcaption></figcaption></figure> <figure><img src="/files/90974e54b4cebb79cf9737ae3a9a6830d4e4bcf5" alt=""><figcaption></figcaption></figure></div>

* Nouvel interrupteur « Préserver la réflexion » pour les modèles qui le prennent en charge comme Qwen3.6
* Design plus épuré et cohérent avec une navigation plus facile
* Page Paramètres enrichie avec des options pour changer votre photo de profil, votre nom, et plus encore

<div data-with-frame="true"><figure><img src="/files/5f2a85c3a62bc7867c8fd3c4335ee75b3f94f769" alt="" width="375"><figcaption></figcaption></figure></div>

* Plus besoin de saisir votre jeton Hugging Face deux fois
* gpt-oss dispose désormais d’interrupteurs de réflexion faible, moyenne et élevée.
* Utilise désormais le dernier précompilé llama.cpp, même sur Linux CUDA
* Beaucoup de correctifs de bugs, de cohérence et de stabilité
* Kimi-K2.6 peut désormais être exécuté !
* Nous avons aussi ajouté une prise en charge API expérimentale. Des guides, annonces, etc. arriveront la semaine prochaine.

Qwen3.6 était également déjà pris en charge dans Unsloth Studio pour l’exécution et l’entraînement. Vous pouvez entraîner et exécuter Qwen3.6-27B dès maintenant !
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/fr/modeles/qwen3.6.md) peut désormais être exécuté (18 Go de RAM) et ajusté finement dans Unsloth Studio. Kimi K2.6 peut aussi être exécuté dans Unsloth (350 Go de RAM).

Unsloth Studio a reçu de nombreuses nouvelles mises à jour, alors veuillez mettre à jour. Détails et article à venir dans les prochains jours.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/fr/modeles/qwen3.6.md) peut désormais être exécuté et ajusté finement dans Unsloth Studio. Le modèle fonctionne sur 23 Go de RAM et est le plus puissant LLM de taille moyenne sur presque tous les benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Mise à jour Gemma 4 + MiniMax-M2.7**

[GGUF Gemma 4](https://huggingface.co/collections/unsloth/gemma-4) sont désormais mis à jour avec les correctifs officiels de Google pour le modèle de chat (ce qui a corrigé/amélioré l’appel d’outils), ainsi que les derniers correctifs de llama.cpp. Mettez à jour vers la dernière version de llama.cpp, retéléchargez les quantifs et vous ne devriez pas voir `jeton inutilisé` de problèmes désormais.\
\
[MiniMax-M2.7](/docs/fr/modeles/tutorials/minimax-m27.md) est disponible dès maintenant ! Vous pouvez exécuter le modèle localement avec nos GGUF en quantification 4 bits sur 128 Go de RAM / mémoire unifiée. [**GGUF MiniMax-M2.7**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Correctifs Gemma 4**

Nous avons mis à jour Gemma 4 [avec de nombreux correctifs](/docs/fr/modeles/gemma-4/train.md). Ces bugs sont universels et ont affecté tous les packages et implémentations d’entraînement et **ne proviennent pas d’Unsloth**. Nous avons identifié les bugs, les avons corrigés, et l’entraînement de Gemma 4 fonctionne désormais correctement dans Unsloth.

Vous n’avez besoin que de **8 Go de VRAM** pour entraîner **Gemma-4-E2B** localement. Unsloth entraîne Gemma 4 **environ 1,5x plus vite tout en utilisant environ 60 % de VRAM en moins** que les configurations FA2. Pour le guide complet et les notebooks sur l’entraînement de Gemma 4, [consultez notre blog](/docs/fr/modeles/gemma-4/train.md).

#### Correctifs d’entraînement Gemma 4

1. **L’accumulation de gradients** ne provoque plus d’explosions de perte. Auparavant, les pertes pouvaient grimper à **300–400**; la perte attendue est d’environ **10–15**.
2. Corrigé le **IndexError** affectant **26B** et **31B** l’inférence dans `transformers`.
3. Corrigé les sorties incohérentes pour **E2B/E4B** lorsque `use_cache=False`. Voir [problème n° 45242](https://github.com/huggingface/transformers/issues/45242).
4. Corrigé **l’audio float16** le dépassement de `-1e9` valeurs.

Si vous voyez des pertes supérieures à **13–15,** par exemple **100** ou **300** - l’accumulation de gradients est probablement gérée incorrectement. Cela est corrigé dans les deux **Unsloth** et **Unsloth Studio**.

#### Réupload des quantifs Gemma 4

Nous avons également mis à jour nos GGUF Gemma 4, vous devrez donc les retélécharger. Là encore, ces problèmes de quantification ne sont **pas liés à Unsloth ni causés par lui**:

1. CUDA : vérifier le chevauchement des tampons avant la fusion - correctif critique pour `<unused24>` les jetons - [PR n° 21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`: prise en charge de la rotation d’attention pour iSWA hétérogène - [PR n° 21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `vocab`: ajouter la gestion des jetons d’octets au détokeniseur BPE pour Gemma 4 - [PR n° 21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `convertir`: définir `"add bos" == True` pour Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `commun`: ajouter un analyseur spécialisé Gemma 4 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lire `final_logit_softcapping` pour Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: ajouter un découpage personnalisé des retours à la ligne pour Gemma 4 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Mises à jour d’Unsloth Studio

* Ajouter **décodage spéculatif** prise en charge (ngram-mod, activée par défaut)
* Llama.cpp mis à jour pour utiliser la dernière version avec toutes les corrections de Gemma 4
* Corriger les problèmes d’entraînement de Qwen3.5 et Gemma 4
* Activer l’exportation et l’enregistrement des modèles Gemma 4
* Renforcer la sécurité du bac à sable pour les outils terminal et Python
* Permettre aux recettes d’utiliser le modèle chargé dans Chat
* Corriger les fils de discussion vides lors de la navigation (et lors du changement d’onglet) et stabiliser le nouveau flux de chat
* Autoriser l’exécution des recettes non-LLM et placer l’onglet Données en premier dans les exécutions
* Réutiliser la casse du dépôt mise en cache par HF pour éviter les téléchargements en double
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Vous pouvez maintenant exécuter et entraîner les [Gemma 4](/docs/fr/modeles/gemma-4.md) modèles dans Unsloth.
* Les Mac Intel fonctionnent désormais
* Binaires précompilés pour llama.cpp pour 2 corrections de Gemma-4 :
  * vocab : corriger le tokenizer Gemma4 ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * corriger : modèle Gemma 4 ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Les appels d’outils pour les modèles plus petits sont maintenant plus stables et ne s’interrompent plus
* Binaires précompilés pour Windows, Linux, Mac, appareils WSL - CPU et GPU
* Le décodage spéculatif a été ajouté pour les modèles sans vision (Gemma-4 est malheureusement un modèle vision et Qwen3.5)
* La longueur de contexte est maintenant correctement appliquée.
* La recherche Web obtient désormais réellement du contenu Web et pas seulement des résumés
* 90 % d’appels API HF en moins - moins de limitations de débit
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % de précision des appels d’outils + plus de prise en charge**

* Les appels d’outils pour tous les modèles sont maintenant **de +30 % à +80 % plus précis.**
* La recherche Web obtient désormais réellement du contenu Web et pas seulement des résumés
* Le nombre d’appels d’outils autorisés passe de 10 à 25
* Les appels d’outils se terminent maintenant bien mieux, donc les boucles / répétitions seront réduites
* Plus **réparation des appels d’outils** et logique de déduplication pour empêcher les appels d’outils de laisser fuiter du XML également
* Testé avec `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), recherche Web + exécution de code + réflexion activées.

| Métrique                                  | Avant  | Après           |
| ----------------------------------------- | ------ | --------------- |
| Fuites XML dans la réponse                | 10/10  | 0/10            |
| Récupérations d’URL utilisées             | 0      | 4/10 exécutions |
| Exécutions avec les bons noms de chansons | 0/10   | 2/10            |
| Nb moyen d’appels d’outils                | 5.5    | 3.8             |
| Temps de réponse moyen                    | 12,3 s | 9,8 s           |

#### Nouvelles fonctionnalités

* Ajouté **dossiers personnalisés** afin que vous puissiez utiliser n’importe quels GGUF dans n’importe quel dossier - pour le moment, accès dans les Paramètres avancés dans Chat et Dossiers personnalisés
* **Bouton de mise à jour** maintenant visible
* Le style du script d’installation a été entièrement mis à jour !
* Préliminaire **Prise en charge automatique de plusieurs GPU pour l’inférence et l’entraînement** - utile pour les grands modèles qui ne tiennent pas sur 1 GPU - Unsloth auto allouera les ressources GPU
* Les Mac Intel devraient fonctionner dès le départ

Unsloth beaucoup plus fluide et plus rapide

* **Correction des délais d’attente pour les téléchargements de grands modèles** - plus aucun délai d’attente observé.
* **Correction de la limitation de débit Hugging Face - appels API HF réduits de 90 %**
* Correction de bun sur Windows et installations plus rapides
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Nouvelles mises à jour importantes**

Cela ne fait que 2 jours depuis notre précédente version, mais nous avons des mises à jour plus importantes :

* **L’inférence est maintenant 20 à 30 % plus rapide.** Auparavant, les appels d’outils et la pénalité de répétition pouvaient ralentir l’inférence en dessous des vitesses normales. Les jetons/s d’inférence devraient maintenant être identiques à `llama-server` / `llama.cpp`.
* **Détecte désormais automatiquement les modèles plus anciens ou déjà existants** téléchargés depuis **LM Studio, Hugging Face,** et des sources similaires.
* **La vitesse des jetons/s d’inférence est maintenant calculée correctement.** Auparavant, les jetons/s incluaient le temps de démarrage, ce qui rendait la vitesse affichée plus lente qu’elle ne l’était réellement. Elle devrait maintenant refléter la vitesse d’inférence « réelle ».
* **L’utilisation du CPU ne monte plus en flèche.** Auparavant, l’identité de l’interrogateur en ligne changeait à chaque rendu, ce qui provoquait `useLiveQuery` à se réabonner en continu.
* **Unsloth Studio a maintenant un bouton de fermeture x et se ferme correctement.** Auparavant, le fermer après l’ouverture depuis l’icône du bureau ne le fermait pas correctement. Désormais, le lancement depuis le raccourci ouvre aussi le terminal, et la fermeture de ce terminal quitte complètement Unsloth Studio. Si vous l’avez encore ouvert depuis une session précédente, vous pouvez redémarrer votre ordinateur ou exécuter `lsof -i :8888` puis `kill -9 <PID>`.
* **Un appel d’outils et une recherche Web encore meilleurs** avec moins d’erreurs.
* Documentation mise à jour avec beaucoup de nouvelles informations sur [la suppression de modèles, la désinstallation](/docs/fr/nouveau/studio/install.md#uninstall) etc.
* **Journalisation d’installation et de configuration plus propre et plus intelligente sur Windows et Linux.** La sortie est désormais plus facile à lire grâce à un formatage cohérent, plus silencieuse par défaut pour une expérience plus fluide, et prend en charge des `--verbose` diagnostics plus riches lorsque vous voulez tous les détails techniques.
* Vous pouvez désormais consulter votre historique d’entraînement !
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Premier billet de sortie après Unsloth Studio

Salut tout le monde, voici notre première sortie depuis le lancement d’Unsloth Studio. Beaucoup de nouvelles fonctionnalités et corrections :

* **Vous pouvez maintenant mettre à jour Unsloth Studio !** Veuillez mettre à jour via les mêmes commandes d’installation.
* **Windows** Le CPU ou le GPU fonctionne désormais sans problème. Veuillez réinstaller !
* **Raccourcis de l’application**. Une fois installé, vous pouvez désormais lancer sous Windows, MacOS et Linux via une icône de raccourci dans le menu Démarrer / Lancement et sur le Bureau.
* **Précompilés `llama.cpp` binaires** et `mamba_ssm` - installations 6x plus rapides ! Aussi <300 Mo pour les binaires.
* **tailles d’installation réduites de 50 %** (-7 Go ou plus économisés), installations 2x plus rapides et résolution plus rapide. Tailles pypi 50 % plus petites.
* **Les appels d’outils se sont améliorés.** Meilleur parsing de llama.cpp, plus de balisage brut d’outils dans le chat, inférence plus rapide, nouveau panneau de sorties d’outils, minuteurs.
* MacOS et CPU ont maintenant [Recettes de données](/docs/fr/nouveau/studio/data-recipe.md) activées avec le téléversement de plusieurs fichiers.
* **Prise en charge AMD préliminaire pour les** machines Linux uniquement - détection automatique.
* **Refonte de la barre latérale des paramètres.** Les paramètres sont maintenant regroupés en **Modèle, Échantillonnage, Outils et Préférences**
* **Longueur de contexte** désormais ajustable. Gardez à l’esprit que ce n’est pas nécessaire car llama.cpp utilise intelligemment le contexte exact dont vous avez besoin via `--fit on`
* **Téléversement de plusieurs fichiers.** Les recettes de données prennent désormais en charge plusieurs téléversements par glisser-déposer pour PDF, DOCX, TXT et MD, avec extraction côté backend, téléversements enregistrés et aperçus améliorés.
* **Colab** avec les GPU T4 gratuits avec Unsloth Studio est maintenant corrigé ! [Essayez-le ici](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Grâce aux binaires précompilés, c’est aussi 20x plus rapide !
* **Meilleure observabilité du chat.** Unsloth affiche maintenant `llama-server` les timings et l’utilisation, une barre d’utilisation de la fenêtre de contexte, et des cartes de survol de source plus riches.
* **Meilleure UX dans l’ensemble** - liens cliquables, meilleur parsing LaTeX, info-bulles outils / code / web pour les cartes par défaut et bien plus encore !
* **LiteLLM -** Unsloth Studio et Unsloth n’étaient **PAS** affectés par la récente compromission de LiteLLM. Nemo Data Designer n’a utilisé LiteLLM que jusqu’à `1.80`, pas la version affectée `1.82.7` ou `1.82.8`, et l’a depuis entièrement supprimé.
* Nous avons maintenant une nouvelle commande d’installation sur une ligne, il suffit d’exécuter :&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Corrections :**

* **Améliorations pour Windows/configuration.** Correction des fermetures silencieuses de Windows, des plantages au démarrage d’Anaconda/conda-forge, des installations Windows non-NVIDIA cassées et des vérifications manquantes de configuration CUDA initiale / venv obsolète.
* **Prompts système corrigés.** Ils fonctionnent à nouveau pour l’inférence de texte et de vision non-GGUF.
* **Prompts système et préréglages persistants.** Les prompts système personnalisés et les préréglages de chat persistent désormais entre les rechargements et les changements de page.
* **Export GGUF étendu.** Les fine-tunes complets, et pas seulement LoRA/PEFT, peuvent maintenant être exportés en GGUF. La résolution du modèle de base est plus fiable, et les options d’exportation non prises en charge sont désactivées dans l’interface.
* **Corrections du défilement / de la mise en page du chat.** Correction des problèmes de position de défilement pendant la génération, du décalage de mise en page du panneau de réflexion, et des sauts de fenêtre lors du repli des panneaux de raisonnement.
* **Détection plus intelligente des conflits de ports.** Unsloth détecte désormais les conflits de loopback, peut identifier le processus bloquant lorsque c’est possible, et fournit des messages plus clairs pour le port de secours.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Nouvel appel d’outils + stabilité Windows

* Claude Artifacts fonctionne, donc du HTML peut être exécuté comme un jeu de serpent dans le chat
* +30 % d’appels d’outils plus précis, surtout pour les petits modèles + minuteur pour les appels d’outils
* Les sorties des outils + de la recherche Web peuvent être enregistrées + bascule de l’outil d’auto-réparation activée/désactivée
* Nombreuses corrections de bugs - Windows CPU fonctionne, Mac plus fluide, installations plus rapides et plus petites
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/nouveau/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
