> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/nouveau/changelog.md).

# Mises à jour d’Unsloth

Pour utiliser les dernières modifications, [mettez à jour Unsloth](/docs/fr/nouveau/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-08-20" tags="new-releases" %}

## Compaction automatique + accès LAN

Merci pour votre soutien à Qwen3.8-27B et à Unsloth Desktop la semaine dernière ! Pour notre [nouvelle `v0.1.801-beta` version](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta), nous avons fusionné plus de 200 PR afin d’introduire de nombreuses nouvelles fonctionnalités et corrections, notamment :

* **Compaction automatique (expérimental)** pour les conversations plus longues au-delà des limites de contexte
* **Accès distant et LAN (aperçu)** pour un accès réseau facile sans liens Cloudflare
* **Chat plus rapide** - Performances de diffusion améliorées, latence de l’interface réduite et conversations longues plus fluides.
* Prise en charge de **constructions personnalisées de llama.cpp**. Bascule pour Cache RAM, Mmap, Mlock, Checkpoints, Spe Decoding KV Cache, Vision activée / désactivée
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) est disponible. Les nouveaux GGUF Qwen3.8-27B Dynamic v3.0 offrent une précision top-1 supérieure de plus de 10 % par rapport à tous les autres. Fonctionne avec Unsloth.

#### Compaction automatique (expérimental)

Les longues conversations peuvent désormais dépasser les limites de contexte en déplaçant les anciens échanges vers une archive consultable.

* Les anciens échanges ne sont supprimés qu’en cas de besoin et restent consultables.
* Des époques de contexte fraîches améliorent le rappel sans tronquer définitivement les conversations.
* Utilise la récupération plutôt que la synthèse pour une meilleure précision.

#### Accès distant et LAN (aperçu)

Accédez à Unsloth depuis d’autres appareils sur votre réseau.

* Nouveaux paramètres d’accès distant.
* Contrôle LAN, codes QR et options de démarrage automatique.
* Désactivé par défaut pour des raisons de sécurité.

#### Améliorations du chat

* Chats longs plus rapides et gestion des fils améliorée.
* Les projets organisent les chats, les fichiers et les espaces de travail.
* Ajout de la mise en file d’attente des invites, des raccourcis, `edit_file`, et d’une meilleure prise en charge des outils.

#### Matériel, inférence, API

* Prise en charge de constructions personnalisées de llama.cpp et d’Intel XPU.
* Davantage de contrôles d’inférence (cache, mmap, mlock, checkpoints, décodage spéculatif, vision).
* Validation GPU, gestion de la VRAM et compatibilité améliorées.
* Sorties structurées dans l’API Responses.
* Meilleure récupération de llama-server.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B et Qwen3.8-2.4T peuvent désormais être exécutés localement dans Unsloth !

Fonctionne avec 17 Go de RAM via les GGUF dynamiques d’Unsloth. Vous pouvez également affiner Qwen3.8-27B dans Unsloth. Qwen3.8-27B est de loin le modèle le plus puissant pour sa taille. Nous avons aussi mis en ligne des quantifications NVFP4.

<a href="/pages/901b8ef66232f3df49c12342d74d59aa06381de8" class="button primary">Guide d’exécution de Qwen3.8</a><a href="/pages/d256c0aa0ec67d0dd906259123c82c0076e76e95" class="button secondary">Affiner Muse Glimmer</a>

<figure><img src="/files/f5ecc7024f10c3256c61c0b6368bf4929351d675" alt="" width="375"><figcaption></figcaption></figure>

Les autres mises à jour d’Unsloth incluent :

* Qwen3.8-27B + arguments supplémentaires de llama-server autorisés + bascule VRAM personnalisée
* Le fournisseur externe propose l’appel d’outils + la prise en charge d’outils + la connexion avec Codex
* Inférence MiniMax-H3 FP8 rapide, 10x plus rapide (3 minutes contre 30)
* Inférence 10 % plus rapide pour les GGUF + contournement des autorisations corrigé
* Connecté [Les fournisseurs d’API](/docs/fr/integrations/connections.md) peuvent utiliser leur propre recherche ou la recherche et les outils intégrés d’Unsloth Desktop. Les résultats des outils sont renvoyés au modèle afin qu’il puisse poursuivre les tâches multi-étapes.
* Connectez-vous avec un abonnement Codex et utilisez les outils Codex dans Chat.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## Présentation d’Unsloth Desktop

Présentation d’Unsloth Desktop 🦥 - la première application de bureau pour exécuter et entraîner des modèles localement.\
Open-source. Fonctionne sur Mac, Windows et Linux

<figure><img src="/files/bd1056cd0f42970298b045b62398e6074e2c50a0" alt=""><figcaption></figcaption></figure>

• Prend en charge MLX, l’image/vidéo par diffusion, l’audio, GGUF\
• Connectez Claude Code et Codex aux LLM locaux\
• Appels d’outils 50 % plus précis, auto-réparateurs + exécution de code en bac à sable\
• Fonctionne sur les configurations CPU + multiGPU - NVIDIA, AMD, Intel, Mac\
• Entraînez les modèles 2× plus vite avec 70 % de VRAM en moins\
• Recherche web privée, recherche approfondie, RAG, MCP + exports (NVFP4, GGUF)\
• Utilisez l’API compatible OpenAI d’Unsloth et des modèles cloud\
• Déployez des LLM à distance de manière sécurisée et accédez-y partout

Vous pouvez télécharger Unsloth Desktop dès maintenant :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer est là !

Meta a publié Muse Glimmer, le premier modèle ouvert de Meta Superintelligence Labs. Muse Glimmer est un modèle dense de 30 milliards de paramètres de Meta, conçu pour des workflows locaux d’agent et de codage. Publié sous la licence Apache 2.0, vous pouvez exécuter Muse Glimmer 30B via Unsloth et les quantifications dynamiques Unsloth pour les meilleures performances.

<a href="/pages/d32dbabf6b92a421d130c5afc1758f41eb521195" class="button primary">Exécuter Muse Glimmer</a><a href="/pages/d256c0aa0ec67d0dd906259123c82c0076e76e95" class="button secondary">Affiner Muse Glimmer</a>

Muse Glimmer 30B peut être exécuté localement sur **20 Go de RAM/VRAM** des configurations, y compris Mac et GPU. Vous pouvez également entraîner et affiner Muse Glimmer 30B à l’aide d’Unsloth sur **20 Go de VRAM**.

Vous pouvez exécuter et affiner Muse Glimmer via l’application Unsloth Desktop :

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + recherche approfondie + chat parallèle

Salut tout le monde ! [Kimi K3](/docs/fr/modeles/kimi-k3.md) peut désormais s’exécuter localement avec les GGUF dynamiques Unsloth, Unsloth peut garder plusieurs chats en génération parallèle, et le nouveau mode Deep Research planifie, lit et cite des sources en utilisant votre modèle local.

Cette version apporte aussi une meilleure [AMD](/docs/fr/bases/amd.md) et la prise en charge des GPU Intel, l’entraînement DoRA, ainsi que de nombreuses corrections pour l’installateur, MLX, l’export et l’inférence.

#### Kimi K3

de Moonshot AI **Kimi K3** est un modèle MoE de 2,8 T de paramètres avec 104 milliards de paramètres actifs, une prise en charge native de la vision et une fenêtre de contexte de 1 M. Kimi K3 est uniquement orienté raisonnement et Unsloth prend en charge les niveaux de raisonnement faible, élevé et maximal.

Vous pouvez exécuter nos [GGUF dynamiques Kimi K3](https://huggingface.co/unsloth/Kimi-K3-GGUF) via Unsloth. Unsloth détecte automatiquement les configurations multi-GPU et peut décharger des couches du modèle vers la mémoire système.

Kimi K3 est un très grand modèle, alors planifiez votre matériel en conséquence :

* `UD-IQ1_S` occupe 595 Go d’espace disque.
* `UD-Q4_K_XL` occupe 1,51 To d’espace disque.
* Pour une inférence sans perte, utilisez `UD-Q8_K_XL`, qui occupe 1,56 To d’espace disque.

Lisez notre guide complet [de Kimi K3](https://unsloth.ai/docs/models/kimi-k3) et découvrez-en plus sur [les GGUF Unsloth Dynamic 2.0](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### Chat parallèle

Unsloth peut désormais exécuter plusieurs conversations à la fois. Le lancement d’un **Nouveau chat** laisse l’ancienne réponse continuer à se générer, et chaque conversation active dispose de son propre indicateur de progression et de son propre contrôle Arrêter.

* 4 emplacements llama-server par défaut, ajustables dans l’interface Web.
* Les outils, envois, l’auto-réparation et les agents restent isolés entre les chats.
* Arrêtez un chat sans interrompre les autres ni redémarrer le serveur.
* Unsloth réduit le nombre d’emplacements lorsque la mémoire est limitée.
* Le rechargement du modèle arrête toujours les chats actifs après confirmation.

#### Deep Research

Deep Research transforme un modèle local en un workflow de recherche complet. Donnez-lui une question et il créera un plan, recherchera sur le web, organisera les preuves et produira un rapport cité.

* Relisez et modifiez le plan avant le début de la recherche.
* Suivez sa progression et les sources collectées pendant qu’il travaille.
* Reprenez ou annulez sans perdre la recherche déjà effectuée.
* Autorisez ou bloquez des sites web pour contrôler la sélection des sources.
* Les sources et les citations restent enregistrées avec chaque exécution.
* Avant d’écrire, Unsloth vérifie les affirmations non prises en charge, les contradictions et les lacunes non résolues. Les recommandations sans preuve directe sont marquées comme des inférences testables.

Une seule exécution peut être active par chat. Deep Research fonctionne actuellement avec des modèles locaux. Un ancrage optionnel sur page entière peut lire les meilleurs résultats de recherche dans un RAG temporaire avant la synthèse ; activez-le avec `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`. Il reste désactivé par défaut car il ajoute du temps de scraping et nécessite du contexte supplémentaire.

#### Prise en charge AMD améliorée

Cette mise à jour s’appuie sur notre première [version AMD et guide d’installation](https://unsloth.ai/docs/basics/amd) avec la prise en charge de davantage de GPU et une inférence et un entraînement ROCm plus fiables.

* Détection améliorée pour les GPU RDNA2, Radeon, Ryzen, Strix Halo et postes de travail.
* Les MI50 et Radeon VII prennent en charge le LoRA 16 bits et l’affinage complet sous Linux.
* Correction des NaN 4 bits, des conflits de bibliothèques et des longs blocages au démarrage sur RDNA.
* Les GPU HIP Windows non pris en charge peuvent se rabattre sur Vulkan.
* Les périphériques Vulkan affichent leurs vrais noms et peuvent être sélectionnés individuellement.
* Les installations Windows propres ne nécessitent plus Winget ni les outils de développement.

#### Mises à jour du matériel, de l’entraînement et de la plateforme

* Intel XPU permet le chat et l’entraînement locaux sur les GPU Intel Arc et Data Center.
* DoRA est disponible aux côtés de LoRA et de l’affinage complet.
* Les grands exports peuvent utiliser tous les GPU visibles afin d’éviter les limites de mémoire du GPU 0.
* MLX ajoute des ensembles de données en streaming, la poursuite du pré-entraînement, des callbacks et une meilleure prise en charge de VLM et de LoRA.
* Correction de `flash_attention_2` sortie du modèle.
* Unsloth et les utilitaires d’enregistrement fonctionnent désormais sans bitsandbytes.
* Corrigé `.json` jeux de données et configuration des notebooks Qwen3.5/3.6 MoE et GRPO.
* Les dossiers de téléchargement du Hub sont plus faciles à trouver et à ouvrir.
* Les notes de version sont disponibles dans la fenêtre contextuelle de mise à jour d’Unsloth.
* `unsloth start --as-subagent` permet à Codex, Claude Code et Pi de déléguer des tâches à un modèle local Unsloth.
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## La prise en charge AMD est là !

Salut tout le monde ! Cette version apporte l’entraînement et l’inférence LLM locaux sur [les GPU AMD](/docs/fr/bases/amd.md) sous Windows, WSL et Linux.

<a href="/pages/7a3835192ce3c923a337ace4fb5e0396c6bb2b8f#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Démarrage rapide</a><a href="/pages/7a3835192ce3c923a337ace4fb5e0396c6bb2b8f#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Fonctionnalités</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">Github</a>

À partir d’aujourd’hui, notre collaboration AMD, les noyaux Triton personnalisés et les algorithmes mathématiques vous permettent d’entraîner et d’exécuter plus de 500 modèles sur les GPU Radeon, Instinct, Vulkan, Ryzen et centres de données d’AMD, jusqu’à 2× plus vite avec 70 % de VRAM en moins et sans perte de précision. Les versions ROCm optimisées prennent également en charge l’inférence GGUF et Safetensors.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Mise à jour du 23 juillet

1. Ajouté **Prise en charge de RDNA2, Gorgon Halo, Vulkan** + correction du problème d’installation AMD ne détectant pas les GPU sur Strix Halo / autres GPU AMD
2. Meilleure correction automatique et meilleure détection des échecs RDNA4, HIP / ROCm
3. **Mémoire unifiée 2x plus rapide** Chargement AMD safetensors + checkpointing de gradients beaucoup plus rapide pour les périphériques à mémoire unifiée
4. Ajouté **dictée vocale / whisper.cpp** prise en charge préliminaire d’une synthèse vocale rapide
5. Correction des environnements de rollback pendant les installations qui consommaient 5 Go d’espace disque - nettoyage automatique désormais

#### Entraîner des LLM localement sur AMD

* Entraînez, exécutez du RL, discutez et déployez des modèles localement sur les GPU AMD.
* Détection et installation plus fiables des GPU AMD sous Windows, WSL et Linux.
* Compatibilité ROCm améliorée pour les GPU AMD MI300X et MI325X.
* Accéder à distance à Unsloth via `unsloth studio --secure` via HTTPS gratuit par Cloudflare

#### Exécutez des modèles plus grands sur votre matériel

* Utilisez le placement automatique des GPU ou choisissez exactement quels GPU et quelles couches du modèle utiliser.
* Déplacez les couches experts MoE vers la mémoire système pour aider les modèles plus grands à tenir.
* Répartissez les modèles sur plusieurs GPU ou utilisez le parallélisme de tenseurs.
* Enregistrez séparément les paramètres matériels pour chaque modèle et quantification.

#### Redémarrages de chat plus rapides et téléchargements plus fiables

* Reprenez de longues conversations sans reconstruire toute la conversation après qu’un modèle inactif libère sa VRAM.
* Les téléchargements Hugging Face XET bloqués réessaient automatiquement via HTTP standard.
* Les fichiers GGUF existants sont réutilisés au lieu d’être téléchargés à nouveau chaque fois qu’un modèle se charge.

#### Meilleure recherche, outils et agents

* La recherche web peut désormais lire les articles PDF, les manuels et autres résultats PDF.
* Les appels d’outils parallèles, la sortie de raisonnement et les tentatives de reprise d’outils fonctionnent de manière plus fiable.
* Un nouvel endpoint MCP optionnel permet aux clients IA compatibles d’inspecter les modèles et l’historique d’entraînement, de lancer ou d’arrêter l’entraînement, de charger des checkpoints, de valider des recettes et d’exporter des GGUF.
  * Activez-le avec `UNSLOTH_STUDIO_ENABLE_MCP=1` et définissez le jeton Bearer requis avec `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Corrections d’entraînement et d’export

* L’entraînement textuel seul avec des modèles multimodaux ne tronque plus les longs exemples avant l’assemblage.
* Les modèles Qwen3.5 et Qwen3.6 MTP affinés s’exportent désormais correctement en GGUF.
* Correction d’une erreur d’autorisation Windows pouvant arrêter les exports GGUF lors de l’étape finale d’écriture.

#### Au cas où vous l’auriez manqué

Notre précédente version Studio a ajouté les modèles Dynamic NVFP4, une personnalisation plus poussée, sept nouvelles langues d’affichage, des agents plus sûrs et l’accélération GPU Vulkan.

**Dynamic NVFP4 :**

Unsloth Dynamic NVFP4 conserve les couches sensibles à la précision en FP8 ou BF16 tout en exécutant le reste en W4A4. Sur les GPU NVIDIA Blackwell, cela permet une inférence jusqu’à 2,5x plus rapide, tandis que les caches KV FP8 calibrés offrent jusqu’à 2x plus de contexte.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) et explorez notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4), y compris Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

**Personnalisez votre Studio :**

Choisissez entre les palettes de couleurs Standard, Classique et Minimale, chacune avec des modes clair et sombre. Vous pouvez également personnaliser les couleurs, importer des polices et ajuster la taille de police, le contraste, la réduction des animations et plus encore.

Unsloth inclut également un onglet Paramètres vocaux pour la dictée, les paramètres de dictionnaire personnalisé et la lecture à voix haute.

**Nouvelles langues :**

Unsloth Studio est désormais disponible en français, allemand, espagnol, hindi, arabe, russe et coréen, ainsi qu’en chinois (simplifié), japonais et portugais (Brésil). La détection automatique de la langue du navigateur est désormais la valeur par défaut.

**Agents plus sûrs :**

Un sélecteur d’autorisation d’appel d’outil à quatre niveaux-**Demander**, **Approuver pour moi**, **Désactivé** et **Accès complet**- offre un contrôle plus fin des agents. L’isolation des espaces de travail des agents et des vérifications d’installation plus sûres réduisent également le risque de modifications involontaires.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personnalisation, NVFP4, langues

Salut les gars, nous avons beaucoup de nouvelles mises à jour pour Unsloth, surtout côté personnalisation. Unsloth est désormais personnalisable à votre goût : trois palettes de couleurs plus des couleurs et polices personnalisées, sept nouvelles langues d’affichage, et un nouvel onglet Paramètres vocaux pour la dictée et la lecture à voix haute. Les agents gagnent en sécurité avec un sélecteur d’autorisation d’appel d’outil à quatre niveaux (Demander, Approuver pour moi, Désactivé, Accès complet) et l’isolation des espaces de travail, et les GPU Intel bénéficient enfin d’une inférence accélérée par GPU grâce au nouveau Vulkan `llama.cpp` support.

Nous avons aussi ajouté une prise en charge native de [Inkling](https://unsloth.ai/docs/models/inkling), un modèle ouvert de 975 milliards de paramètres avec 41 milliards de paramètres actifs et une fenêtre de contexte allant jusqu’à 1 million de tokens. Sous licence Apache 2.0, il accepte du texte, des images et de l’audio, et génère du texte.

#### Dynamic NVFP4

Nous avons élargi notre [collection NVFP4](https://huggingface.co/collections/unsloth/nvfp4) avec des versions quantifiées de Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

Lisez le [guide Dynamic NVFP4](https://unsloth.ai/docs/basics/nvfp4) pour plus de détails.

Personnalisez votre Unsloth

Unsloth n’est plus limité aux modes clair et sombre :

* Choisissez parmi **Standard**, **Classique**, et **Minimal** des palettes, chacune avec des variantes claires et sombres.
* Personnalisez les couleurs d’accent, de fond et de premier plan.
* Importez vos propres polices pour l’UI, les titres, le chat et le code.
* Ajustez la taille de police, le contraste, les animations, le comportement du curseur et le lissage des polices.
* Recherchez les paramètres et synchronisez les préférences entre les appareils.

Les modes clair et sombre conservent leurs propres valeurs de personnalisation.

#### Sept nouvelles langues

Unsloth prend désormais en charge le français, l’allemand, l’espagnol, l’hindi, l’arabe, le russe et le coréen, ainsi que le chinois, le japonais et le portugais. La détection automatique de la langue du navigateur est désormais la valeur par défaut.

#### Paramètres vocaux

Un nouvel onglet Voix ajoute des contrôles pour la dictée, les dictionnaires de prononciation et la lecture à voix haute. La prise en charge de la reconnaissance vocale et de la synthèse vocale arrive bientôt ; les conversations vocales complètes sont encore en développement.

#### Agents et appels d’outils plus sûrs

L’ancien interrupteur de contournement est désormais un sélecteur d’autorisation à quatre niveaux :

* **Demander :** approuver chaque appel d’outil.
* **Approuver pour moi :** exécuter automatiquement les actions en lecture seule et mettre en pause pour les actions potentiellement dangereuses.
* **Désactivé :** désactiver les appels d’outils.
* **Accès complet :** autoriser tous les appels et désactiver le bac à sable.

Ces contrôles couvrent le terminal, Python, la recherche web, RAG et les outils MCP. Les agents bénéficient aussi d’espaces de travail isolés, de sessions reprenables avec `--persist`, d’avertissements plus sûrs de l’installeur distant, d’un flux en direct de la sortie des outils et d’une extraction web améliorée.

#### Vulkan et `llama.cpp`

Le nouveau Vulkan `llama.cpp` backend donne aux GPU Intel une inférence accélérée par GPU au lieu d’un repli sur le CPU. Il prend en charge la gestion existante de la VRAM, le dimensionnement automatique du contexte, la sélection multi-GPU et le déchargement de couches.

Les utilisateurs AMD peuvent activer cette option avec :

```bash
UNSLOTH_FORCE_VULKAN=1
```

Nous avons également amélioré la fiabilité des mises à jour, la récupération de l’état du modèle et l’interruption des générations bloquées.

#### Modèles et entraînement

Cette version inclut aussi :

* Prise en charge native d’Inkling et améliorations multi-GPU B200.
* DeepSeek-V4 eager attention et experts groupés FP8 entraînables.
* Entraînement fiable en mode completion-only grâce à la détection automatique des marqueurs du modèle de chat.
* Gestion correcte de la désactivation du checkpointing des gradients.
* Mise à l’échelle RoPE et extension du contexte améliorées.
* Arrêt forcé pour les entraînements bloqués.
* Routage automatique pour les nouvelles architectures de modèles et les versions plus récentes de Transformers.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth peut désormais exporter des GGUF NVFP4, FP8 et imatrix après l’entraînement ; agir comme un système API llama-swap ; ajouter la prise en charge du japonais et du portugais brésilien ; et inclut MLX, safetensors, l’appel d’outils, la prise en charge de la correction, et plus encore. Unsloth core rend GRPO 1,3x plus rapide, ajoute un repli HTTP pour les téléchargements bloqués, améliore le mode hors ligne, accélère l’entraînement MoE de 3 à 5x, et corrige de nombreux bugs. Cette série de versions utilise `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/fr/modeles/deepseek-v4.md) est désormais pris en charge avec des bascules Thinking et nos corrections améliorées du modèle de conversation.

<div data-with-frame="true"><figure><img src="/files/cb40f0febe9a3ba462b7ebbb2c67036bc9068421" alt="" width="375"><figcaption></figcaption></figure></div>

#### Service d’API compatible OpenAI plus intelligent

Exécutez un seul point de terminaison API local avec un changement de modèle plus sûr et une meilleure récupération des outils d’agent.

* Les requêtes API peuvent activer le basculement automatique entre les GGUF locaux téléchargés, tandis que les noms de modèle inconnus continuent en toute sécurité d’utiliser le modèle actuel.
* `/v1/models` renvoie désormais des ID de modèles propres et le catalogue local de GGUF au lieu des chemins locaux `.gguf` paths.
* Le déchargement automatique en veille peut libérer de la VRAM après une période d’inactivité, et la correction des appels d’outils peut désormais être contrôlée par requête.

#### Améliorations de l’export

Les exports sont plus flexibles et évitent les téléchargements inutiles.

* Sélectionnez plusieurs formats d’export à la fois, y compris FP8/INT8 portable, LoRA GGUF, exports correspondant aux sources, imatrix GGUF et FP8/FP4 compressé.
* Les exports multi-checkpoints évitent davantage de téléchargements répétés du modèle de base.
* Les exports FP8, INT8 et GGUF-LoRA respectent désormais `trust_remote_code`, et l’export GGUF gère plus fiablement les paramètres de quantification manquants.

#### RAG et chat de fichiers

Le chat de fichiers est plus utile sur les documents réels.

* Les pièces jointes RAG peuvent désormais utiliser le contexte du document entier, avec des modèles d’intégration personnalisables et la recherche Hugging Face.
* Le chat de fichiers lit correctement davantage de PDF et de documents Word, y compris le texte de droite à gauche, le texte indic ou les tableaux DOCX.
* Les vérifications RAG locales sont plus fiables derrière des configurations proxy.

#### Finition et fiabilité d’Unsloth

L’utilisation quotidienne devrait sembler plus fluide et plus stable.

* Les longues sessions d’entraînement et de chat ont moins de chances de se figer silencieusement.
* Le mode comparaison, le changement de modèle, l’annulation de modèle, la navigation dans le Hub et Hub Discover sont plus fiables.
* Les exports de projet, les exports de chat, les paramètres, les visites guidées, les boîtes de dialogue de fichiers, les écrans de mise à jour et l’interface de raisonnement sont plus propres et plus cohérents.

#### Corrections de l’installateur, du matériel et de la plateforme

Unsloth s’installe et s’exécute plus fiablement sur toutes les plateformes.

* Les installations macOS ne nécessitent plus CMake ni Homebrew lorsqu’un `llama.cpp` précompilé est disponible, et la prise en charge d’Apple Silicon gère mieux les chemins avec des espaces et le dimensionnement de la mémoire unifiée.
* Le démarrage de Windows, la gestion UTF-8, l'intégration RAG ROCm et la prise en charge GPU ROCm sous WSL ont été améliorés.
* La sélection des prébuilds pour les GPU Blackwell, les vérifications d'ajustement GGUF, le parallélisme des tenseurs pour les GGUF vision/mmproj, et la réutilisation locale `llama.cpp` sont désormais plus fiables.

#### Entraînement, modèles et noyaux

L'entraînement et le chargement des modèles sont plus fiables sur davantage de configurations.

* GRPO prend désormais en charge par défaut l'empaquetage des séquences, évite les invites partagées répétées et gère correctement la mise à l'échelle des logits en DDP.
* Le réglage fin complet, les paramètres de précision RL, le checkpointing des gradients, les tampons RoPE DDP et la détection de MoE LoRA ont été corrigés.
* La quantification/déquantification FP8, la mise à l'échelle RoPE de Llama 3 avec Transformers v5, les rechargements LoRA de PEFT 0.19, et `fast_generate` les messages d'erreur ont été améliorés.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + contextes 3x plus longs

[GLM-5.2](/docs/fr/modeles/glm-5.2.md) est désormais pris en charge dans Unsloth Studio ! Tous les niveaux de raisonnement sont pris en charge. **Longueurs de contexte 3x plus longues** sont désormais possibles grâce à notre nouvel algorithme d'ajustement automatique avec MTP, permettant des conversations plus longues. Mode contournement des permissions, conversations bifurcables, conversations en file d'attente, nouveau hub pour la découverte de modèles, modules parallèles + prise en charge HTTPS Cloudflare et plus encore ! Utilisez `unsloth studio --secure` pour un accès global HTTPS sécurisé !

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Meilleur algorithme de longueur de contexte

D'après [PR 1](https://github.com/unslothai/unsloth/pull/6312) et [PR 2](https://github.com/unslothai/unsloth/pull/6447), nous avons considérablement amélioré la détermination de l'utilisation de la mémoire et de la longueur de contexte dans Unsloth Studio, obtenant au total des contextes 3x plus longs :

| Scénario                                     | KV               | avant   | après   |
| -------------------------------------------- | ---------------- | ------- | ------- |
| pipeline 1x 32 Go (\~31 Go libres)           | f16              | 23,040  | 64,000  |
|                                              | q8\_0            | 43,520  | 114,944 |
|                                              | q4\_0            | 82,432  | 199,680 |
| pipeline 2x 32 Go                            | n'importe lequel | 262,144 | 262,144 |
| pipeline tensoriel 2x 24 Go (\~23 Go libres) | f16              | 134,049 | 262,144 |
|                                              | q8\_0            | 252,329 | 262,144 |

#### Canvas de chat, bifurcation et mise en file d'attente

* Modifiez les messages de l'assistant sur place et relancez à partir de n'importe quel point du fil.
* Bifurquez un fil pour faire diverger une conversation sans perdre l'original.
* Chats temporaires (incognito) qui ne laissent aucune trace.
* Mettez de nouvelles invites en file d'attente pendant qu'une génération est encore en cours au lieu d'attendre.
* Les « artefacts » de chat sont désormais **canvas**, avec des **cartes canvas HTML** qui se rendent automatiquement, une vue Code, et DiffusionGemma garde son code brut visible en ligne au lieu d'être réduit.
* La recherche dans le chat couvre désormais chaque message et affiche d'abord vos propres messages.

#### Hub (reconçu)

* Hub plein écran avec un flux tendance, la recherche et la prise en charge des chemins de modèles personnalisés.
* Aperçu README dans un flux en vue fractionnée afin que vous puissiez lire avant de télécharger.
* Les téléchargements utilisent par défaut le plus rapide **Xet** transport, avec repli HTTP automatique si un transfert se bloque.
* Nouvel interrupteur « Charger à la sélection » pour définir les options de chargement avant qu'un modèle ne se charge.
* Le logo Google est affiché pour DiffusionGemma et les futurs dérivés Gemma.

#### Modèles et inférence

* DeepSeek-OCR et davantage de modèles de vision se chargent et s'exécutent désormais sans erreur.
* Correction de l'inférence rapide sur la dernière version de vLLM (0.22+) afin que les accélérations fonctionnent à nouveau.
* Le parallélisme des tenseurs est plus fiable : si le chemin MTP plus rapide échoue, il se rétablit désormais tout seul au lieu de planter.
* DiffusionGemma affiche désormais l'image en formation en direct pendant le débruitage, avec des statistiques de vitesse précises.

#### Sécurité et studios chiffrés Cloudflare

* Nouveau `--secure` mode Cloudflare uniquement pour les studios chiffrés de bout en bout, avec les outils côté serveur restant activés sous `--secure`. Utilisez `unsloth studio --secure`!
* le mode Contournement des permissions pour sauter les confirmations et désactiver le sandbox des outils quand vous le souhaitez.
* Détection automatique de l'analyse antivirus Hugging Face + des fichiers dangereux dans les dépôts.

#### Journalisation et API

* Nouveau **moniteur du serveur API** dans Unsloth.
* Appels API plus rapides et latence réduite
* Journaux beaucoup plus épurés - maintenant avec débit et latence, et suppression de nombreux journaux superflus.

#### Matériel et backend

* Meilleure prise en charge des GPU Blackwell RTX 50X et 60X
* Corriger la rétrogradation silencieuse vers le CPU et non le GPU
* La version de torchao est désormais sélectionnée à partir de torch installé.
* L'installateur répare désormais automatiquement une installation PyTorch cassée ou CPU uniquement et avertit en cas de repli silencieux sur le CPU, sur NVIDIA + AMD sous Win/Linux/Mac/WSL.
* Libère la VRAM du modèle de chat lorsque l'entraînement commence, mais seulement lorsque le GPU est réellement à l'étroit (aucun rechargement inutile sinon).
* Si llama-server plante brutalement au démarrage, Unsloth passe désormais par une séquence de récupération au lieu d'échouer simplement.

#### Corrections générales et d'entraînement et modules parallèles

* Mises à jour de l'entraînement MLX.
* Fiabilité améliorée de l'entraînement GRPO avec vLLM.
* Le démarrage de l'entraînement est devenu plus fiable, avec des erreurs plus claires pour les lots VLM invalides.
* Unsloth nettoie désormais plus fiablement les processus backend restants après des plantages, des redémarrages ou des arrêts interrompus.
* Exportation, chat, entraînement, recettes sont tous individualisés / compartimentalisés ! Cela signifie que vous pouvez désormais faire les 4 en parallèle ! Vous pouvez discuter / faire de l'inférence pendant que vous attendez une exécution d'entraînement ou un export !

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Assurez-vous d'installer la dernière [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) ou `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) et [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) sont désormais tous pris en charge.

* Exécuter et entraîner [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) via [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) est là ! Exécutez [Gemma 4](https://unsloth.ai/docs/models/gemma-4) environ 2x plus rapide avec MTP.
* Le chat audio est désormais pris en charge pour Gemma 4 (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Préserver Think ajouté à Gemma 4.

<figure><img src="/files/608ef824be87e674df7b205a47c03ae2281fb5dc" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Gestionnaire de téléchargements (expérimental)

* Ajout d'une nouvelle **page Hub** pour parcourir, télécharger et gérer les modèles et jeux de données Hugging Face.
* Unsloth peut désormais détecter les modèles et jeux de données déjà sur votre machine et les afficher à côté des éléments téléchargés.
* Téléchargés [modèles GGUF](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) ont désormais des actions directes **Exécuter / Nouveau chat** .

#### RAG / Chat avec des fichiers (expérimental)

* Ajouté [**Chat avec des fichiers**](https://unsloth.ai/docs/new/studio/chat) dans Unsloth, vous permettant de poser des questions sur vos propres documents et bases de connaissances.
* Prend en charge la recherche hybride, les citations, les aperçus PDF, les documents par fil et un outil intégré `search_knowledge_base` .

#### Nouveau bouton de mise à jour + prise en charge matérielle

* Unsloth utilise désormais en permanence des [prébuilds llama.cpp](https://unsloth.ai/docs/new/changelog) à jour sur CUDA, ROCm, Windows, Linux et macOS.
* Ajout d'un **Mettre à jour llama.cpp** bouton afin que les utilisateurs puissent mettre à jour le backend local sans réinstaller Unsloth.
* Prise en charge améliorée de Windows / WSL AMD, [prise en charge ROCm de Strix Halo](https://unsloth.ai/docs/get-started/install/amd), [sélection CUDA Blackwell](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth), et messages d'installation plus clairs.

#### Chat local, outils et compatibilité API

* L'appel d'outils local [est plus fiable, avec un meilleur ordre des cartes d'outils, moins de boucles d'outils en double, et la prise en charge de l'utilisation des outils avec les modèles de vision GGUF.](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) est plus fiable, avec un meilleur ordre des cartes d'outils, moins de boucles d'outils en double, et la prise en charge de l'utilisation des outils avec les modèles de vision GGUF.
* Compatibilité API [compatible OpenAI](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) et comportement d'API compatible Anthropic pour les serveurs Unsloth locaux, y compris de meilleures erreurs, l'utilisation des jetons, les raisons d'arrêt, et [la compatibilité Claude Code](https://unsloth.ai/docs/basics/claude-code).

#### Entraînement et corrections

* Compatibilité API [Prise en charge MLX](https://unsloth.ai/docs/new/studio/install) avec de meilleures étiquettes de modèles, des statistiques de vitesse de génération, et des corrections pour [l'entraînement VLM](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Plusieurs [cas limites](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) et [de jeux de données](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) ont été corrigés, y compris les caches Hugging Face non inscriptibles et les mappages de jeux de données personnalisés.
* De nombreuses corrections de finition de l'interface ont été ajoutées dans le chat, les menus, le sélecteur de modèles, le mode sombre, l'import/export et les paramètres.

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, nouvelle interface, MCP, projets

Cette mise à jour se concentre principalement sur Gemma 4 12B, MCP, Projets, Canvas, CUDA 13.3 et la nouvelle interface de chat. La semaine prochaine, nous aurons une mise à jour encore plus grande.

<div data-with-frame="true"><figure><img src="/files/e39215578eb5aa4f1238786b6475c3aec5e52345" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google publie [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4), un nouveau modèle qui s'exécute localement sur 8 Go de RAM. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Guide](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified prend en charge l'image, l'audio et un contexte de 256K. Exécutez et entraînez le modèle via Unsloth Studio.

#### MCP

* Serveur distant `MCP` prise en charge du serveur, y compris les en-têtes personnalisés et OAuth
* local basé sur des commandes `MCP` prise en charge du serveur
* `MCP` peut désormais être activée depuis le compositeur de chat
* Préréglages intégrés pour les `MCP` serveurs

#### Nouvelle interface de chat

* Projets, Canvas, `MCP`, les contrôles RAG et Compare se trouvent désormais dans le menu plus
* Les contrôles de recherche et de code sont plus faciles à atteindre depuis le compositeur
* Les menus, superpositions, icônes et contrôles cliquables sont plus cohérents dans tout Unsloth

#### Projets

* Organisez des chats liés dans des espaces de travail de projet dédiés
* Déplacez les chats existants dans des projets
* Créez et gérez des projets directement depuis la barre latérale

#### Canvas / artefacts expérimental

* Ouvre le HTML généré dans un panneau canvas dédié dans Unsloth Studio
* Prend en charge les sorties interactives, y compris les visualisations basées sur navigateur et les packages chargés via CDN
* Vous permet de basculer entre l'aperçu rendu et le code source

#### Installation, runtime et matériel

* Les installations prébuilds Windows ne nécessitent plus le contrôle initial `CUDA Toolkit` vérification
* Linux `llama.cpp` les prébuilds correspondent désormais au runtime détecté `cudart` principal
* `ROCm` la détection gfx est répercutée dans la sélection des prébuilds
* `Blackwell`, `B300` et `ARM64` mises à jour de la prise en charge Linux

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**À NE PAS UTILISER `mise à jour d'Unsloth Studio` désormais, car le packaging n'obtiendra pas les dernières mises à jour !**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :**

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**À NE PAS UTILISER `mise à jour d'Unsloth Studio` désormais, car le packaging n'obtiendra pas les dernières mises à jour !**
{% endhint %}

#### Mises à jour Mac

* Réactivé `llama.cpp` les binaires précompilés pour Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Mac OS 13 (Ventura) sur Apple Silicon est une compilation à partir des sources
* Intel (x86\_64) pour Mac OS 13.3 / 14 / 15 / 26 (Tahoe) utilise `llama.cpp` des binaires précompilés
* Intel pour Max 13.0 - 13.2 est une compilation à partir des sources

#### Mises à jour Windows

* CUDA 13.3 `llama.cpp` les binaires précompilés fonctionnent désormais pour Windows
* Pour CUDA 13.2, CUDA 13.1 et versions antérieures, les appareils Windows utilisent le repli CUDA 12.4 - nous travaillerons bientôt sur les binaires CUDA 13.1.

#### Mise à jour CUDA 13.3

* Les binaires non Linux CUDA 13.3 fonctionnent. Nous utiliserons encore CUDA 13.1 pour le moment
* CUDA 13.3 résout le problème de charabia de CUDA 13.2 - voir <https://github.com/unslothai/unsloth/issues/4849>

#### Mise à jour des GPU Blackwell

* Pour l'instant, Blackwell aura des sorties retardées de `llama.cpp` binaires précompilés puisque CUDA 12.4 ne fonctionne pas - nous travaillons à résoudre cela bientôt.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Une mise à jour avant le remaniement.

Salut les gars, nous faisons encore une dernière mise à jour avant un remaniement majeur qui devrait arriver cette semaine ou la semaine prochaine. Notre remaniement changera beaucoup de choses, en particulier avec de nouvelles fonctionnalités majeures et beaucoup de changements de conception.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NOUVEAU : [**prise en charge de l'appel API**](https://unsloth.ai/docs/integrations/connections) maintenant avec génération + édition d'images, recherche web appropriée, exécution de code, mise en cache automatique des invites. Connectez [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) et plus encore.
* Prise en charge appropriée des **langues non anglaises** par ex. japonais, chinois, indien, etc.

Beaucoup d'entre vous ont peut-être manqué notre sortie précédente, qui n'a duré qu'un jour. Nous avons introduit :

* Se connecter à des backends d'inférence externes : [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Améliorations de sécurité**
* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; obtenez les meilleurs réglages adaptés à votre matériel.

#### Appel de fournisseur API et connexions externes

* Vous pouvez désormais connecter Unsloth à n'importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés d'un tour à l'autre)
* La mise en cache des invites est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.
* Génération + édition d'images
* La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l'ajout d'un fournisseur cloud

#### Autres mises à jour d'Unsloth Studio

* Pièces jointes de chat OpenDocument
* charge utile du résumé de raisonnement o3
* L'envoi / l'invite dans des langues non anglaises (par ex. japonais, chinois) fonctionne désormais correctement
* Durcissement du compositeur IME, RTL `dir="auto"`, correction du tronquage des longues lignes de journal
* Rendu de la trace de raisonnement des outils dans l'interface
* Prise en charge entièrement hors ligne : découverte GGUF mise en cache et détection automatique DNS hors ligne pour l'inférence et l'entraînement

#### Améliorations de sécurité d'Unsloth Studio

* Limitation du débit d'authentification, sensible au proxy pour que les reverse proxies ne la contournent pas
* Worker isolé avec une liste de blocage renforcée (bash, `upload hf`, `NOFILE`)
* Confinement des chemins pour que les workers ne puissent pas sortir de leurs répertoires tmp en cours d'exécution
* Validation stricte du schéma dans toute l'API Unsloth
* En-têtes CSP / de sécurité renforcés (seuls les hôtes favicon légitimes sont autorisés)
* Supprimé le `repli de torch.load` sur `training_args.bin` afin que des pickles non approuvés ne puissent jamais s'exécuter au chargement du modèle
* Flux de publication desktop Tauri renforcé
* Auth frontend : actualisation des jetons en singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, aide partagée 422
* Le nettoyage d'annulation est désormais strictement limité aux répertoires tmp en cours d'exécution afin qu'il ne puisse jamais supprimer l'état utilisateur
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## Corrections MTP + Unsloth

Beaucoup de corrections de bugs, d'interface et d'UX pour Unsloth ! Pour obtenir les dernières mises à jour, faites :

**macOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows :**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Corrections

1. Correction `mise à jour d'Unsloth Studio` ne fonctionne pas bien
2. Correction du blocage sur `reset-password` page
3. Plus de prise en charge du mode hors ligne
4. Améliorer le fait que MTP ne soit pas plus rapide sur Mac, CPU et GPU - maintenant c'est bien mieux !
5. Correction du raccourci bureau qui ne fonctionnait pas après la mise à jour
6. Beaucoup, beaucoup de corrections de bugs UI/UX
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + connexions API

Nous avons beaucoup de nouvelles mises à jour pour Unsloth `v0.1.41-beta`:

* **inférence GGUF \~2x plus rapide** avec activation automatique de [MTP](/docs/fr/modeles/qwen3.6.md#mtp-guide)
* [**prise en charge de l'appel API**](/docs/fr/integrations/connections.md) pour [OpenAI](/docs/fr/integrations/connections/openai.md), [Anthropic](/docs/fr/integrations/connections/anthropic-claude.md) etc. avec mise en cache automatique des invites, recherche web, exécution de code
* Se connecter à des backends d'inférence externes : [vLLM](/docs/fr/integrations/connections/vllm.md), [Ollama](/docs/fr/integrations/connections/ollama.md), [llama-server](/docs/fr/integrations/connections/connectez-llama.cpp-a-unsloth-executez-des-gguf-avec-llama-server.md)
* Expérimental **inférence MLX**
* Prise en charge appropriée des **langues non anglaises**
* **Sécurité** améliorations

<a href="/pages/4a2b83ac4bf0233da80a1e3b6ab9fb218108742c#qwen3.6-inference-tutorials" class="button primary">Exécuter les tutoriels Qwen3.6</a><a href="/pages/4a2b83ac4bf0233da80a1e3b6ab9fb218108742c#mtp-guide" class="button primary">Guide MTP</a>

<div data-with-frame="true"><figure><img src="/files/75019f5e946025018cbbe6a126c414cb70114bdd" alt="" width="375"><figcaption></figcaption></figure></div>

#### Prise en charge du décodage spéculatif MTP, inférence 1,4 à 2x plus rapide !

* **Décodage spéculatif MTP automatique** pour les GGUF MTP ; avertir lorsque le précompilé llama.cpp fourni est obsolète ou trop ancien pour MTP
* Nouveaux binaires llama.cpp précompilés pour la prise en charge MTP !

#### Appel de fournisseur API et connexions externes

* Vous pouvez désormais connecter Unsloth à n'importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)
* **Recherche web intégrée** pour OpenAI, Anthropic, OpenRouter et Kimi
* **Exécution de code intégrée** pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés d'un tour à l'autre)
* La mise en cache des invites est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.
* La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
* Chargement automatique des modèles lors de l'ajout d'un fournisseur cloud

#### Inférence MLX (expérimental)

* Les quants et modèles MLX peuvent désormais s'exécuter localement sur vos machines Mac !
* Nous ajouterons bientôt le raisonnement, les outils et la recherche web !

#### Autres mises à jour d'Unsloth Studio

* L'envoi / l'invite dans des langues non anglaises (par ex. japonais, chinois) fonctionne désormais correctement
* Pièces jointes de chat OpenDocument
* charge utile du résumé de raisonnement o3
* Durcissement du compositeur IME, RTL `dir="auto"`, correction du tronquage des longues lignes de journal
* Rendu de la trace de raisonnement des outils dans l'interface
* Prise en charge entièrement hors ligne : découverte GGUF mise en cache et détection automatique DNS hors ligne pour l'inférence et l'entraînement
* Beaucoup de finitions UI/UX : refonte du thème sombre, refonte de la barre latérale droite, mascotte paresseux selon l'heure de la journée, notifications copiables et fermables, éditeur de chat plus grand, peaufinage de la configuration d’exécution de code, style des pastilles d’action du compositeur, bouton Discord plus étroit

#### Mises à jour de l'entraînement

* Correctifs du masque d'attention Gemma
* GRPO multi-image
* Expériences de retour des états cachés GRPO
* Nouvelle méthode d'entraînement de pré-entraînement continu (CPT) en option de premier ordre
* Extracteur LoRA MoE Gemma-4 enregistré pour corriger `grouped_mm` plantage de contraction
* Fusionné en option `lm_head` + passe avant de l'entropie croisée, avec chemin à matrice unique sous `UNSLOTH_RETURN_LOGITS=1`
* Passer la taille de lot pour l'évaluation
* Les chemins d'évaluation/d'entraînement respectent désormais `HF_DATASETS_OFFLINE` ainsi que `HF_HUB_OFFLINE`

#### Améliorations de sécurité d'Unsloth Studio

* Limitation du débit d'authentification, sensible au proxy pour que les reverse proxies ne la contournent pas
* Worker isolé avec une liste de blocage renforcée (bash, `upload hf`, `NOFILE`)
* Confinement des chemins pour que les workers ne puissent pas sortir de leurs répertoires tmp en cours d'exécution
* Validation stricte du schéma dans toute l'API Unsloth
* En-têtes CSP / de sécurité renforcés (seuls les hôtes favicon légitimes sont autorisés)
* Supprimé le `repli de torch.load` sur `training_args.bin` afin que des pickles non approuvés ne puissent jamais s'exécuter au chargement du modèle
* Flux de publication desktop Tauri renforcé
* Auth frontend : actualisation des jetons en singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, aide partagée 422
* Le nettoyage d'annulation est désormais strictement limité aux répertoires tmp en cours d'exécution afin qu'il ne puisse jamais supprimer l'état utilisateur
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## point de terminaison API d'Unsloth

#### ***Correctif de bogue v0.1.39-beta*** **5 mai 2026**

Corrige l'absence d'affichage de l'historique de chat (l'historique existant n'est pas perdu) et les pièces jointes qui ne s'attachaient pas correctement. Le bug ne concernait que le rendu - utilisez `2026.5.2` ou appelez directement `curl -fsSL https://unsloth.ai/install.sh | sh`  pour mettre à jour

Vous pouvez utiliser des LLM locaux avec des outils comme [Claude Code](https://unsloth.ai/docs/basics/claude-code) et [Codex](https://unsloth.ai/docs/basics/codex) en les connectant au point de terminaison API d’Unsloth. Cela vous permet d’exécuter des modèles comme [Qwen](https://unsloth.ai/docs/models/qwen3.6) et [Gemma](https://unsloth.ai/docs/models/gemma-4) localement, avec des fonctionnalités supplémentaires telles que l’appel d’outils auto-réparateur, l’exécution de code et la recherche web.

Utiliser Unsloth comme point de terminaison d’inférence API est avantageux non seulement parce qu’il est facile à configurer et rapide, mais aussi parce qu’Unsloth fournit :

* [Appel d’outils auto-réparateur](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), ce qui aide à réduire de 50 % les appels d’outils cassés ou mal formés
* [Exécution de code](https://unsloth.ai/docs/new/studio/chat#code-execution) prise en charge, permettant l’exécution de Bash et de Python pour des sorties de code plus précises.
* Avancé [Recherche web](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) qui visite et lit réellement les pages web pour recueillir des informations détaillées.
* [Paramètres d’inférence automatiques](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) pour les modèles GGUF (temp, top-k, etc.)

<div data-with-frame="true"><figure><img src="/files/1a2d152a014c5c542c774dac8c97d657a9f4124f" alt="" width="375"><figcaption></figcaption></figure></div>

#### Nouveaux modèles

Nous avons aussi quelques nouveaux modèles à exécuter, notamment NVIDIA [Nemotron 3 Nano Omni](/docs/fr/modeles/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/fr/modeles/ibm-granite-4.1.md) et [Mistral 3.5](/docs/fr/modeles/mistral-3.5.md) Medium. Nous avons aidé Mistral à résoudre certains problèmes d’implémentation dans transformers et les GGUF.

#### Mises à jour d’Unsloth

* Les entraînements Unsloth arrêtés peuvent désormais reprendre à partir des checkpoints.
* Les fils de discussion se sauvegardent désormais automatiquement et persistent plus fiablement.
* Les blocages de l’entraînement DPO dans les configurations multiprocessus ont été corrigés.
* La prise en charge de GRPO VLM a été améliorée grâce aux mises à jour de MROPE.
* Le bouton d’arrêt d’Unsloth arrête désormais correctement la génération.
* Correction de la disparition du modèle de chat après le rafraîchissement du navigateur.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Nouvelle refonte complète de l’interface

Salut tout le monde, nous avons repensé toute l’expérience UI et UX d’Unsloth Studio pour mettre l’accent sur le chat et l’entraînement :

* Ajout d’une barre latérale repliable basée sur les retours de la communauté

<div data-with-frame="true"><figure><img src="/files/31c38c07670d49aecd1964d6f1124e2d504c41ae" alt="" width="375"><figcaption></figcaption></figure></div>

* Vous pouvez maintenant supprimer des chats et rechercher dans les conversations passées

<div><figure><img src="/files/d13eab37745a36ab2562ab8d5d4e5afd42b30afd" alt=""><figcaption></figcaption></figure> <figure><img src="/files/90974e54b4cebb79cf9737ae3a9a6830d4e4bcf5" alt=""><figcaption></figcaption></figure></div>

* Nouveau bouton bascule Conserver le raisonnement pour les modèles qui le prennent en charge comme Qwen3.6
* Design plus épuré et plus cohérent avec une navigation plus simple
* Page Paramètres enrichie avec des options pour changer votre photo de profil, votre nom et plus encore

<div data-with-frame="true"><figure><img src="/files/5f2a85c3a62bc7867c8fd3c4335ee75b3f94f769" alt="" width="375"><figcaption></figcaption></figure></div>

* Plus besoin de saisir votre jeton Hugging Face deux fois
* gpt-oss dispose désormais de bascules de raisonnement faible, moyen et élevé.
* Utilise désormais la dernière version précompilée de llama.cpp, même sous Linux CUDA
* Nombreux correctifs de bogues, de cohérence et de stabilité
* Kimi-K2.6 peut désormais être exécuté !
* Nous avons aussi ajouté la prise en charge expérimentale de l’API. Guides, annonce, etc. arriveront la semaine prochaine.

Qwen3.6 était également déjà pris en charge dans Unsloth Studio pour l’exécution et l’entraînement. Vous pouvez entraîner et exécuter Qwen3.6-27B dès maintenant !
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/fr/modeles/qwen3.6.md) peut désormais s’exécuter (18 Go de RAM) et être affiné dans Unsloth Studio. Kimi K2.6 peut aussi être exécuté dans Unsloth (350 Go de RAM).

Unsloth Studio a reçu de nombreuses nouvelles mises à jour, veuillez donc le mettre à jour. Les détails et un article explicatif arriveront dans les prochains jours.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/fr/modeles/qwen3.6.md) peut désormais s’exécuter et être affiné dans Unsloth Studio. Le modèle fonctionne avec 23 Go de RAM et est le LLM de taille moyenne le plus puissant sur presque tous les benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Mise à jour Gemma 4 + MiniMax-M2.7**

[GGUF Gemma 4](https://huggingface.co/collections/unsloth/gemma-4) sont désormais mis à jour avec les correctifs officiels de Google pour le modèle de chat (qui ont corrigé/amélioré l’appel d’outils), ainsi que les derniers correctifs de llama.cpp. Mettez à jour vers la dernière version de llama.cpp, retéléchargez les quantifications et vous ne devriez pas voir `jeton inutilisé` de problèmes.\
\
[MiniMax-M2.7](/docs/fr/modeles/tutorials/minimax-m27.md) est désormais disponible ! Vous pouvez exécuter le modèle localement avec nos GGUF en quantification 4 bits sur 128 Go de RAM / mémoire unifiée. [**GGUF MiniMax-M2.7**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Correctifs Gemma 4**

Nous avons mis à jour Gemma 4 [avec de nombreux correctifs](/docs/fr/modeles/gemma-4/train.md). Ces bogues sont universels et ont affecté tous les packages et implémentations d’entraînement et **ne proviennent pas d’Unsloth**. Nous avons identifié les bogues, les avons corrigés, et l’entraînement de Gemma 4 fonctionne désormais correctement dans Unsloth.

Vous n’avez besoin que de **8 Go de VRAM** pour entraîner **Gemma-4-E2B** localement. Unsloth entraîne Gemma 4 **environ 1,5× plus vite tout en utilisant environ 60 % de VRAM en moins** que les configurations FA2. Pour le guide complet et les notebooks sur l’entraînement de Gemma 4, [consultez notre blog](/docs/fr/modeles/gemma-4/train.md).

#### Correctifs d’entraînement Gemma 4

1. **L’accumulation de gradients** ne provoque plus d’explosions de la perte. Auparavant, la perte pouvait grimper jusqu’à **300–400**; la perte attendue est d’environ **10–15**.
2. Correction de **IndexError** affectant **26B** et **31B** l’inférence dans `transformers`.
3. Correction des sorties incohérentes pour **E2B/E4B** lorsque `use_cache=False`. Voir [le problème n° 45242](https://github.com/huggingface/transformers/issues/45242).
4. Corrigé **audio float16** dépassement de capacité à partir de `-1e9` valeurs.

Si vous voyez des pertes supérieures à **13–15,** par exemple **100** ou **300** - l’accumulation de gradients est probablement gérée incorrectement. C’est corrigé à la fois dans **Unsloth** et **Unsloth Studio**.

#### Réenvois des quantifications Gemma 4

Nous avons aussi mis à jour nos GGUF Gemma 4, vous devrez donc les retélécharger. Encore une fois, ces problèmes de quantification sont **sans rapport avec Unsloth et ne sont pas causés par lui**:

1. CUDA : vérifier le chevauchement des tampons avant la fusion - correctif critique pour `<unused24>` jetons - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `cache KV`: prise en charge de la rotation d’attention pour iSWA hétérogène - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `vocabulaire`: ajout de la gestion des jetons d’octet au détokeniseur BPE pour Gemma 4 - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `convertir`: définir `"add bos" == True` pour Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `commun`: ajout d’un analyseur spécialisé Gemma 4 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lire `final_logit_softcapping` pour Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: ajout d’un découpage de nouvelle ligne personnalisé pour Gemma 4 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Mises à jour d’Unsloth Studio

* Ajouter **décodage spéculatif** prise en charge (ngram-mod, activé par défaut)
* Llama.cpp mis à jour pour utiliser la dernière version avec tous les correctifs Gemma 4
* Corriger les problèmes d’entraînement de Qwen3.5 et Gemma 4
* Activer l’exportation et l’enregistrement des modèles Gemma 4
* Renforcer la sécurité du bac à sable pour les outils terminal et Python
* Permettre aux recettes d’utiliser le modèle chargé dans Chat
* Corriger les fils de discussion vides lors de la navigation (et à chaque changement d’onglet) et stabiliser le nouveau flux de chat
* Autoriser l’exécution des recettes non-LLM et placer l’onglet Données en premier dans les exécutions
* Réutiliser la casse du dépôt mis en cache par HF pour éviter les téléchargements en double
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Vous pouvez désormais exécuter et entraîner les [Gemma 4](/docs/fr/modeles/gemma-4.md) modèles dans Unsloth.
* Les Mac Intel fonctionnent désormais
* Binaires précompilés de llama.cpp pour 2 correctifs Gemma-4 :
  * vocab : correction du tokenizer Gemma4 ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * correctif : modèle Gemma 4 ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Les appels d’outils pour les petits modèles sont désormais plus stables et ne se coupent plus
* Binaires précompilés pour Windows, Linux, Mac, appareils WSL - CPU et GPU
* Le décodage spéculatif a été ajouté pour les modèles non vision (Gemma-4 est vision, malheureusement, et Qwen3.5)
* La longueur de contexte est désormais appliquée correctement.
* La recherche web récupère désormais réellement le contenu des pages web et pas seulement des résumés
* 90 % de réduction des appels API HF - moins de limitations de débit
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % de précision des appels d’outils + plus de prise en charge**

* Les appels d’outils pour tous les modèles sont désormais **de 30 % à 80 % plus précis.**
* La recherche web récupère désormais réellement le contenu des pages web et pas seulement des résumés
* Le nombre d’appels d’outils autorisés passe de 10 à 25
* Les appels d’outils se terminent désormais beaucoup mieux, donc les boucles/répétitions seront réduites
* Plus **de réparation des appels d’outils** et de logique de déduplication pour empêcher également les appels d’outils de laisser fuiter du XML
* Testé avec `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), recherche web + exécution de code + raisonnement activés.

| Indicateur                                    | Avant  | Après           |
| --------------------------------------------- | ------ | --------------- |
| Fuites de XML dans la réponse                 | 10/10  | 0/10            |
| Récupérations d’URL utilisées                 | 0      | 4/10 exécutions |
| Exécutions avec les noms de chansons corrects | 0/10   | 2/10            |
| Moy. d’appels d’outils                        | 5.5    | 3.8             |
| Temps de réponse moyen                        | 12,3 s | 9,8 s           |

#### Nouvelles fonctionnalités

* Ajouté **dossiers personnalisés** afin que vous puissiez utiliser n’importe quels GGUF dans n’importe quel dossier - pour l’instant, accès dans les paramètres avancés de Chat et Dossiers personnalisés
* **Bouton de mise à jour** désormais visible
* Style du script d’installation entièrement mis à jour !
* Préliminaire **Prise en charge automatique multi-GPU pour l’inférence et l’entraînement** - utile pour les grands modèles qui ne tiennent pas sur 1 GPU - Unsloth auto allouera les ressources GPU
* Les Mac Intel devraient fonctionner immédiatement

Unsloth beaucoup plus fluide et plus rapide

* **Correction des délais d’attente lors du téléchargement de grands modèles** - plus aucun délai d’attente observé.
* **Correction du bridage de débit Hugging Face - appels API HF réduits de 90 %**
* Correction de bun sur Windows et installations plus rapides
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Nouvelles mises à jour importantes**

Cela fait seulement 2 jours depuis notre précédente version, mais nous avons des mises à jour plus importantes :

* **L’inférence est désormais 20 à 30 % plus rapide.** Auparavant, l’appel d’outils et la pénalité de répétition pouvaient ralentir l’inférence en dessous des vitesses normales. Les jetons/s d’inférence devraient désormais être identiques à `llama-server` / `llama.cpp`.
* **Détecte automatiquement désormais les modèles plus anciens ou déjà existants** téléchargés depuis **LM Studio, Hugging Face,** et des sources similaires.
* **La vitesse d’inférence en jetons/s est désormais calculée correctement.** Auparavant, les jetons/s incluaient le temps de démarrage, ce qui rendait la vitesse affichée plus lente qu’elle ne l’était réellement. Elle devrait désormais refléter la vitesse d’inférence « réelle ».
* **L’utilisation du CPU ne monte plus en pic.** Auparavant, l’identité du requêteur en ligne changeait à chaque rendu, provoquant `useLiveQuery` des réabonnements continus.
* **Unsloth Studio dispose désormais d’un bouton x d’arrêt et s’arrête correctement.** Auparavant, le fermer après l’avoir ouvert depuis l’icône du bureau ne le fermait pas correctement. Désormais, le lancement depuis le raccourci ouvre aussi le terminal, et fermer ce terminal quitte complètement Unsloth Studio. Si vous l’avez encore ouvert depuis une session précédente, vous pouvez redémarrer votre ordinateur ou exécuter `lsof -i :8888` puis `kill -9 <PID>`.
* **Un appel d’outils et une recherche web encore meilleurs** avec moins d’erreurs.
* Documentation mise à jour avec beaucoup de nouvelles informations sur [la suppression de modèles, la désinstallation](/docs/fr/nouveau/studio/install.md#uninstall) etc.
* **Journalisation d’installation et de configuration plus claire et plus intelligente sur Windows et Linux.** La sortie est désormais plus facile à lire grâce à un formatage cohérent, plus discrète par défaut pour une expérience plus fluide, et prend en charge des `--verbose` diagnostics plus détaillés lorsque vous souhaitez tous les détails techniques.
* Vous pouvez désormais consulter votre historique d’entraînement !
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Première version après Unsloth Studio

Salut tout le monde, voici notre première version depuis le lancement d’Unsloth Studio. Beaucoup de nouvelles fonctionnalités et correctifs :

* **Vous pouvez désormais mettre à jour Unsloth Studio !** Veuillez mettre à jour via les mêmes commandes d’installation.
* **Windows** Le CPU ou le GPU fonctionne désormais sans accroc. Veuillez réinstaller !
* **Raccourcis d’application**. Une fois installé, vous pouvez désormais lancer sous Windows, MacOS et Linux via une icône de raccourci dans Démarrer / Lancer et sur le bureau.
* **Précompilés `llama.cpp` binaires** et `mamba_ssm` - installations 6 fois plus rapides ! Aussi moins de 300 Mo pour les binaires.
* **Tailles d’installation réduites de 50 %** (économie de 7 Go ou plus), installations 2 fois plus rapides et résolution plus rapide. Tailles PyPI réduites de 50 %.
* **Appel d’outils amélioré.** Meilleur parsing de llama.cpp, pas de balisage brut des outils dans le chat, inférence plus rapide, un nouveau panneau Sorties d’outils, minuteries.
* MacOS et CPU ont désormais [Recettes de données](/docs/fr/nouveau/studio/data-recipe.md) activées avec le téléversement de plusieurs fichiers.
* **Prise en charge AMD préliminaire pour Linux** uniquement - détection automatique.
* **Refonte de la barre latérale des paramètres.** Les paramètres sont désormais regroupés en **Modèle, Échantillonnage, Outils et Préférences**
* **Longueur de contexte** désormais ajustable. Gardez à l’esprit que ce n’est pas nécessaire, car llama.cpp utilise intelligemment le contexte exact dont vous avez besoin via `--fit sur`
* **Téléversement de plusieurs fichiers.** Les recettes de données prennent désormais en charge plusieurs téléversements par glisser-déposer pour PDF, DOCX, TXT et MD, avec extraction côté backend, téléversements enregistrés et aperçus améliorés.
* **Colab** avec des GPU T4 gratuits avec Unsloth Studio est désormais corrigé ! [Essayez ici](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Grâce aux binaires précompilés, c’est aussi 20 fois plus rapide !
* **Meilleure observabilité du chat.** Unsloth affiche désormais `llama-server` les timings et l’utilisation, une barre d’utilisation de la fenêtre de contexte, ainsi que des infobulles de source plus riches.
* **Meilleure UX globale** - liens cliquables, meilleur parsing LaTeX, infobulles pour outils / code / web pour les cartes par défaut, et bien plus encore !
* **LiteLLM -** Unsloth Studio et Unsloth n’ont pas été **PAS** touchés par la récente compromission de LiteLLM. Nemo Data Designer n’utilisait LiteLLM que jusqu’à `1.80`, pas la version touchée `1.82.7` ou `1.82.8`, et l’a depuis entièrement supprimé.
* Nous avons désormais une nouvelle commande d’installation en une ligne, exécutez simplement :&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Correctifs :**

* **Améliorations Windows/configuration.** Correction des sorties silencieuses sous Windows, des plantages au démarrage avec Anaconda/conda-forge, des installations Windows non-NVIDIA cassées, et de l’absence des vérifications précoces de configuration CUDA/venv obsolète.
* **Correctifs des prompts système.** Ils fonctionnent à nouveau pour l’inférence texte et vision non-GGUF.
* **Prompts système et préréglages persistants.** Les prompts système personnalisés et les préréglages de chat persistent désormais entre les rechargements et les changements de page.
* **Export GGUF élargi.** Les fine-tunes complets, pas seulement LoRA/PEFT, peuvent désormais être exportés en GGUF. La résolution du modèle de base est plus fiable, et les options d’exportation non prises en charge sont désactivées dans l’interface.
* **Correctifs du défilement/mise en page du chat.** Correction des problèmes de position de défilement pendant la génération, du décalage de mise en page du panneau de réflexion et des sauts de la fenêtre d’affichage lors de la réduction des panneaux de raisonnement.
* **Détection plus intelligente des conflits de ports.** Unsloth détecte désormais les conflits de loopback, peut identifier le processus bloquant lorsque c’est possible, et fournit des messages de port de secours plus clairs.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Nouveaux appels d’outils + stabilité sous Windows

* Claude Artifacts fonctionne désormais, ce qui permet d’exécuter du HTML, comme un jeu du serpent, directement dans le chat
* +30 % d’appels d’outils plus précis, surtout pour les petits modèles + minuteur pour les appels d’outils
* Les sorties des outils + de la recherche Web peuvent être enregistrées + bascule de l’outil d’auto-réparation activée/désactivée
* De nombreux correctifs de bugs — le CPU Windows fonctionne, Mac est plus fluide, et les installations sont plus rapides et plus légères
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/nouveau/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
