Mises à jour d'Unsloth
Journal des modifications d'Unsloth pour nos dernières versions, améliorations et correctifs.
Pour utiliser les dernières modifications, mettez à jour Unsloth.
Qwen3.8-Flash + GLM-5.3 2x plus rapides
Exécuter Qwen3.8-Flash-Next et GLM-5.3-Flash jusqu'à 2× plus rapide avec un décodage plus rapide et le bonus MTP, désormais activé par défaut. Cette version inclut aussi 170+ améliorations dans l'entraînement, le chat, la prise en charge matérielle, les API et les performances.
Génération Qwen et GLM plus rapide avec MTP, ainsi qu'une meilleure utilisation des outils et des paramètres Qwen recommandés.
Interface utilisateur/expérience beaucoup moins lente pour tous les chats, surtout sur les longues conversations
Nouveau support pour MiniMax-Music3, Higgs et MOSS modèles audio, y compris le suivi de progression et la gestion des clips.
Chargement des modèles plus fiable sur les serveurs locaux et chez les fournisseurs connectés.
Édition de chat plus sûre qui préserve les appels d'outils, les réponses, les médias et les branches de conversation.
Entraînement multi-GPU, ajustement mémoire, placement des modèles et exports GGUF améliorés.
Installation, détection et compatibilité GPU AMD/ROCm renforcées.
MCP, Deep Research, OAuth, appels d'outils parallèles et workflows d'agent plus fiables.
Nouvelles API compatibles OpenAI pour les modèles vidéo, audio et servis par MLX.
Mises à jour du bureau, contrôles des ports LAN, téléchargements et nettoyage de la mémoire GPU améliorés.
Qwen3.8-Flash-Next + GLM-5.3
Qwen3.8-Flash-Next, GLM-5.3-Flash + GLM-5.3 peuvent désormais s'exécuter localement dans Unsloth !
Qwen3.8-Flash fonctionne sur 75 Go de RAM
GLM-5.3-Flash fonctionne sur 102 Go de RAM + VRAM
Déchargement de la RAM jusqu'à 5x plus rapide
La compaction automatique répétée fonctionne désormais de manière fiable
100+ améliorations du chat, de la fiabilité et des performances

Qwen3.8-Flash-Next
Modèle de raisonnement multimodal 125B et aperçu précoce de l'architecture de Qwen4.
Le GGUF dynamique 1-bit fonctionne sur 75 Go de RAM ou une mémoire unifiée
Contexte jusqu'à 262K avec texte et images
Modes de raisonnement Aucun, Faible, Moyen et Très élevé
Le Thinking préservé améliore la cohérence dans les longues conversations
GLM-5.3-Flash
Modèle multimodal 320B avec 18B de paramètres actifs.
Le modèle 1-bit fonctionne sur 102 Go de RAM + VRAM combinées
Contexte jusqu'à 1M pour le texte, les images et les documents
Modes de raisonnement Faible, Élevé et Max
Performances améliorées en codage, en agents et en vision
Améliorations d'Unsloth
Les grands GGUF sont automatiquement répartis entre le GPU et la RAM système
Voir les estimations de mémoire avant le chargement
Les chats se rétablissent après les déconnexions
Meilleure vision multi-image et prise en charge des images MCP
Exporter les chats en JSONL
Contrôles de compaction automatique améliorés
Correctifs pour Linux, NVIDIA Wayland, AMD et Windows
Pour exécuter ou entraîner les nouveaux modèles, vous pouvez télécharger Unsloth Desktop :
Compaction automatique + accès LAN
Merci pour le soutien concernant Qwen3.8-27B et Unsloth Desktop la semaine dernière ! Pour notre nouvelle v0.1.801-beta version, nous avons fusionné plus de 200 PR pour introduire de nombreuses nouvelles fonctionnalités et corrections, notamment :
Compaction automatique (expérimental) pour les chats plus longs au-delà des limites de contexte
Accès à distance et LAN (aperçu) pour un accès réseau facile sans liens Cloudflare
Chat plus rapide - Performances de streaming améliorées, latence de l'interface réduite et conversations longues plus fluides.
Prise en charge de compilations personnalisées de llama.cpp. Bascule pour Cache RAM, Mmap, Mlock, Checkpoints, Spe Decoding KV Cache, Vision activée / désactivée
Unsloth Dynamic v3.0 est publié. Les nouveaux GGUF dynamiques v3.0 de Qwen3.8-27B offrent une précision top-1 supérieure de plus de 10 % par rapport à tous les autres. Fonctionne avec Unsloth.
Compaction automatique (expérimental)
Les longues conversations peuvent désormais dépasser les limites de contexte en déplaçant les tours plus anciens vers une archive consultable.
Les tours plus anciens ne sont supprimés qu'en cas de besoin et restent consultables.
De nouveaux époques de contexte améliorent la mémorisation sans raccourcir définitivement les chats.
Utilise la récupération au lieu de la synthèse pour une meilleure précision.
Accès à distance et LAN (aperçu)
Accédez à Unsloth depuis d'autres appareils sur votre réseau.
Nouveaux paramètres d'accès à distance.
Contrôle LAN, codes QR et options de démarrage automatique.
Désactivé par défaut pour des raisons de sécurité.
Améliorations du chat
Chats longs plus rapides et meilleur fil de discussion.
Les projets organisent les chats, les fichiers et les espaces de travail.
Ajout de la mise en file d'attente des prompts, de raccourcis,
edit_fileet d'une meilleure prise en charge des outils.
Matériel, inférence, API
Prise en charge des compilations personnalisées de llama.cpp et d'Intel XPU.
Plus de contrôles d'inférence (cache, mmap, mlock, points de contrôle, décodage spéculatif, vision).
Validation GPU, gestion de la VRAM et compatibilité améliorées.
Sorties structurées dans l'API Responses.
Meilleure récupération de llama-server.
Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :
Qwen3.8
Qwen3.8-27B et Qwen3.8-2.4T peuvent désormais être exécutés localement dans Unsloth !
Fonctionne sur 17 Go de RAM via les GGUF dynamiques Unsloth. Vous pouvez aussi ajuster finement Qwen3.8-27B dans Unsloth. Qwen3.8-27B est de loin le modèle le plus puissant pour sa taille. Nous avons aussi mis en ligne des quantifications NVFP4.

Autres mises à jour d'Unsloth incluent :
Qwen3.8-27B + arguments supplémentaires de llama-server autorisés + bascule VRAM personnalisée
Le fournisseur externe prend en charge l'appel d'outils + le support d'outils + la connexion avec Codex
Inférence MiniMax-H3 en FP8 rapide 10x plus rapide (3 minutes contre 30)
Inférence sur GGUF 10 % plus rapide + contournement des permissions corrigé
Connecté fournisseurs d'API peuvent utiliser leur propre Search ou la Search intégrée et les outils d'Unsloth Desktop. Les résultats des outils sont renvoyés au modèle afin qu'il puisse poursuivre des tâches en plusieurs étapes.
Connectez-vous avec un abonnement Codex et utilisez les outils Codex dans Chat.
Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :
Présentation d'Unsloth Desktop
Présentation d'Unsloth Desktop 🦥 - la première application de bureau à exécuter et entraîner des modèles localement. Open source. Fonctionne sur Mac, Windows et Linux
• Prend en charge MLX, diffusion image/vidéo, audio, GGUF • Connecte Claude Code et Codex aux LLM locaux • Appels d'outils 50 % plus précis, auto-réparateurs + exécution de code en bac à sable • Fonctionne pour les configurations CPU + multiGPU - NVIDIA, AMD, Intel, Mac • Entraînez des modèles 2× plus vite avec 70 % de VRAM en moins • Recherche web privée, deep research, RAG, MCP + exports (NVFP4, GGUF) • Utilisez l'API compatible OpenAI d'Unsloth et les modèles cloud • Déployez en toute sécurité des LLM à distance et accédez-y partout
Vous pouvez télécharger Unsloth Desktop dès maintenant :
Meta Muse Glimmer est là !
Meta a publié Muse Glimmer, le premier modèle ouvert de Meta Superintelligence Labs. Muse Glimmer est un modèle dense de 30B paramètres de Meta, conçu pour des workflows locaux d'agents et de codage. Publié sous licence Apache 2.0, vous pouvez exécuter Muse Glimmer 30B via Unsloth et les quantifications dynamiques Unsloth pour de meilleures performances.
Muse Glimmer 30B peut s'exécuter localement sur 20 Go de RAM/VRAM des configurations, y compris Mac et GPU. Vous pouvez aussi entraîner et ajuster finement Muse Glimmer 30B avec Unsloth sur 20 Go de VRAM.
Vous pouvez exécuter et ajuster finement Muse Glimmer via l'application Unsloth Desktop :
Kimi K3 + Deep Research + Chat parallèle
Bonjour à tous ! Kimi K3 peut désormais s'exécuter localement avec les GGUF dynamiques Unsloth, Unsloth peut faire générer plusieurs chats en parallèle, et le nouveau mode Deep Research planifie, lit et cite des sources à l'aide de votre modèle local.
Cette version apporte aussi une meilleure AMD et prise en charge des GPU Intel, l'entraînement DoRA, ainsi que de nombreux correctifs pour l'installateur, MLX, l'export et l'inférence.
Kimi K3
de Moonshot AI Kimi K3 est un modèle MoE de 2,8T de paramètres avec 104B de paramètres actifs, la prise en charge native de la vision et une fenêtre de contexte de 1M. Kimi K3 est uniquement orienté réflexion, et Unsloth prend en charge les efforts de raisonnement faible, élevé et maximal.
Vous pouvez exécuter nos GGUF dynamiques Kimi K3 via Unsloth. Unsloth détecte automatiquement les configurations multi-GPU et peut décharger les couches du modèle vers la mémoire système.
Kimi K3 est un modèle très volumineux, donc planifiez votre matériel en conséquence :
UD-IQ1_Soccupe 595 Go d'espace disque.UD-Q4_K_XLoccupe 1,51 To d'espace disque.Pour une inférence sans perte, utilisez
UD-Q8_K_XL, qui occupe 1,56 To d'espace disque.
Lisez notre guide complet sur Kimi K3 et apprenez-en davantage sur les GGUF dynamiques Unsloth 2.0.
Chat parallèle
Unsloth peut désormais exécuter plusieurs conversations à la fois. Démarrer un Nouveau chat laisse la réponse précédente continuer à se générer, et chaque conversation active obtient son propre indicateur de progression et son contrôle Stop.
4 emplacements llama-server par défaut, ajustables dans l'interface web.
Les outils, les fichiers téléversés, l'auto-réparation et les agents restent isolés d'un chat à l'autre.
Arrêtez un chat sans interrompre les autres ni redémarrer le serveur.
Unsloth réduit le nombre d'emplacements lorsque la mémoire est limitée.
Le rechargement du modèle arrête toujours les chats actifs après confirmation.
Deep Research
Deep Research transforme un modèle local en flux de travail de recherche complet. Donnez-lui une question et il créera un plan, cherchera sur le web, organisera les preuves et produira un rapport cité.
Relisez et modifiez le plan avant le début de la recherche.
Suivez sa progression et les sources collectées pendant son travail.
Reprenez ou annulez sans perdre la recherche déjà effectuée.
Autorisez ou bloquez des sites web pour contrôler la sélection des sources.
Les sources et les citations restent enregistrées avec chaque exécution.
Avant d'écrire, Unsloth vérifie les affirmations non prises en charge, les contradictions et les lacunes non résolues. Les recommandations sans preuve directe sont marquées comme des inférences testables.
Une seule exécution peut être active par chat. Deep Research fonctionne actuellement avec les modèles locaux. Un ancrage optionnel en page complète peut lire les meilleurs résultats de recherche dans un RAG temporaire avant la synthèse ; activez-le avec UNSLOTH_RESEARCH_AUTO_SCRAPE=1. Il reste désactivé par défaut car il ajoute du temps de scraping et nécessite du contexte supplémentaire.
Prise en charge AMD améliorée
Cette mise à jour s'appuie sur notre version AMD et guide de configuration initiaux avec le support de davantage de GPU et une inférence et un entraînement ROCm plus fiables.
Détection améliorée pour les GPU RDNA2, Radeon, Ryzen, Strix Halo et workstation.
Les MI50 et Radeon VII prennent en charge le LoRA 16 bits et l'ajustement complet sur Linux.
NaN 4 bits, conflits de bibliothèques et longs blocages au démarrage RDNA corrigés.
Les GPU HIP Windows non pris en charge peuvent se replier sur Vulkan.
Les périphériques Vulkan affichent leurs vrais noms et peuvent être sélectionnés individuellement.
Les installations Windows propres ne nécessitent plus Winget ni les outils de développement.
Mises à jour de l'entraînement, des modèles et de la plateforme
Intel XPU permet le chat local et l'entraînement sur les GPU Intel Arc et Data Center.
DoRA est disponible aux côtés de LoRA et de l'ajustement complet.
Les grands exports peuvent utiliser tous les GPU visibles pour éviter les limites de mémoire du GPU 0.
MLX ajoute les ensembles de données en streaming, le pré-entraînement continu, les callbacks et une meilleure prise en charge des VLM et de LoRA.
Correction de
flash_attention_2sortie du modèle.Unsloth et les utilitaires de sauvegarde fonctionnent désormais sans bitsandbytes.
Correction de
.jsonles ensembles de données et la configuration des notebooks Qwen3.5/3.6 MoE et GRPO.Les dossiers de téléchargement du Hub sont plus faciles à trouver et à ouvrir.
Les notes de version sont disponibles dans la fenêtre contextuelle de mise à jour d'Unsloth.
unsloth start --as-subagentpermet à Codex, Claude Code et Pi de déléguer des tâches à un modèle local Unsloth.
La prise en charge AMD est là !
Bonjour à tous ! Cette version apporte l'entraînement et l'inférence de LLM locaux sur GPU AMD sur Windows, WSL et Linux.
À partir d'aujourd'hui, notre collaboration AMD, les noyaux Triton personnalisés et les algorithmes mathématiques vous permettent d'entraîner et d'exécuter plus de 500 modèles sur les GPU Radeon, Instinct, Vulkan, Ryzen et data center d'AMD, jusqu'à 2× plus rapidement avec 70 % de VRAM en moins et sans perte de précision. Les compilations ROCm optimisées prennent également en charge l'inférence GGUF et Safetensors.
Mise à jour du 23 juillet
Ajouté Prise en charge de RDNA2, Gorgon Halo, Vulkan + correction du fait que l'installation AMD ne détectait pas les GPU sur Strix Halo / autres GPU AMD
Meilleure correction automatique et meilleure capture des échecs RDNA4, HIP / ROCm
Mémoire unifiée 2x plus rapide Chargement AMD safetensors + checkpointing des gradients beaucoup plus rapide pour les périphériques à mémoire unifiée
Ajouté dictée vocale / whisper.cpp prise en charge préliminaire de la synthèse vocale rapide
Correction d'environnements de retour en arrière lors des installations qui consommaient 5 Go d'espace disque - nettoyage automatique maintenant
Entraîner des LLM localement sur AMD
Entraînez, exécutez du RL, discutez avec les modèles et déployez-les localement sur les GPU AMD.
Détection et installation plus fiables des GPU AMD sur Windows, WSL et Linux.
Compatibilité ROCm améliorée pour les GPU AMD MI300X et MI325X.
Accédez à Unsloth à distance via
unsloth studio --securevia HTTPS gratuit grâce à Cloudflare
Exécuter des modèles plus grands sur votre matériel
Utilisez le placement automatique des GPU ou choisissez exactement quels GPU et quelles couches du modèle utiliser.
Déplacez les couches d'experts MoE dans la mémoire système pour aider les modèles plus grands à tenir.
Répartissez les modèles sur plusieurs GPU ou utilisez le parallélisme tensoriel.
Enregistrez séparément les paramètres matériels pour chaque modèle et quantification.
Redémarrages de chat plus rapides et téléchargements plus fiables
Reprenez de longues conversations sans reconstruire toute la conversation après qu'un modèle inactif a libéré sa VRAM.
Les téléchargements Hugging Face XET bloqués réessaient automatiquement via HTTP standard.
Les fichiers GGUF existants sont réutilisés au lieu d'être retéléchargés chaque fois qu'un modèle se charge.
Meilleure recherche, meilleurs outils et meilleurs agents
La recherche web peut désormais lire des articles PDF, des manuels et d'autres résultats PDF.
Les appels d'outils parallèles, la sortie de raisonnement et les nouvelles tentatives d'outils fonctionnent plus fiablement.
Un nouveau point de terminaison MCP facultatif permet aux clients IA compatibles d'inspecter les modèles et l'historique d'entraînement, de démarrer ou d'arrêter l'entraînement, de charger des points de contrôle, de valider des recettes et d'exporter des GGUF.
Activez-le avec
UNSLOTH_STUDIO_ENABLE_MCP=1et définissez le jeton bearer requis avecUNSLOTH_STUDIO_MCP_TOKEN.
Correctifs d'entraînement et d'export
L'entraînement texte seul avec des modèles multimodaux ne tronque plus les longs exemples avant le packing.
Les modèles Qwen3.5 et Qwen3.6 MTP ajustés finement s'exportent désormais correctement vers GGUF.
Correction d'une erreur d'autorisation Windows qui pouvait arrêter les exports GGUF lors de la dernière étape d'écriture.
Au cas où vous l'auriez manqué
Notre version précédente de Studio a ajouté les modèles Dynamic NVFP4, une personnalisation plus poussée, sept nouvelles langues d'affichage, des agents plus sûrs et l'accélération GPU Vulkan.
Dynamic NVFP4 :
Unsloth Dynamic NVFP4 conserve les couches sensibles à la précision en FP8 ou BF16 tout en exécutant le reste en W4A4. Sur les GPU NVIDIA Blackwell, cela permet une inférence jusqu'à 2,5x plus rapide, tandis que les caches KV FP8 calibrés offrent jusqu'à 2x plus de contexte.
Lisez le guide Dynamic NVFP4 et découvrez notre collection NVFP4élargie, incluant Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.
Personnalisez votre Studio :
Choisissez entre les palettes de couleurs Standard, Classic et Minimal, chacune avec des modes clair et sombre. Vous pouvez aussi personnaliser les couleurs, importer des polices et ajuster la taille de police, le contraste, la réduction des mouvements et plus encore.
Unsloth inclut également un onglet de paramètres vocaux pour la dictée, les paramètres de dictionnaire personnalisé et la lecture à voix haute.
Nouvelles langues :
Unsloth Studio est désormais disponible en français, allemand, espagnol, hindi, arabe, russe et coréen, en plus du chinois (simplifié), du japonais et du portugais (Brésil). La détection automatique de la langue du navigateur est désormais la valeur par défaut.
Agents plus sûrs :
Un sélecteur d'autorisation d'appels d'outils à quatre niveaux-Demander, Approuver pour moi, Désactivé et Accès complet- offre un contrôle plus fin sur les agents. L'isolation des espaces de travail des agents et des vérifications d'installation plus sûres réduisent également le risque de modifications involontaires.
Personnalisation, NVFP4, langues
Salut les gars, nous avons beaucoup de nouvelles mises à jour pour Unsloth, surtout en matière de personnalisation. Unsloth est désormais à personnaliser selon vos envies : trois palettes de couleurs plus des couleurs et polices personnalisées, sept nouvelles langues d'affichage, et un nouvel onglet de paramètres vocaux pour la dictée et la lecture à voix haute. Les agents deviennent plus sûrs avec un sélecteur d'autorisation d'appels d'outils à quatre niveaux (Demander, Approuver pour moi, Désactivé, Accès complet) et l'isolation des espaces de travail, et les GPU Intel bénéficient enfin d'une inférence accélérée par GPU grâce au nouveau Vulkan llama.cpp support.
Nous avons aussi ajouté la prise en charge native de Inkling, un modèle ouvert de 975B de paramètres avec 41B de paramètres actifs et une fenêtre de contexte allant jusqu'à 1M jetons. Sous licence Apache 2.0, il accepte du texte, des images et de l'audio, et génère du texte.
Dynamic NVFP4
Nous avons élargi notre collection NVFP4 avec des versions quantifiées de Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.
Lisez le guide Dynamic NVFP4 pour plus de détails.
Personnalisez votre Unsloth
Unsloth n'est plus limité aux modes clair et sombre :
Choisissez parmi Standard, Classicet Minimal palettes, chacune avec des variantes claires et sombres.
Personnalisez les couleurs d'accent, d'arrière-plan et de premier plan.
Importez vos propres polices pour l'interface, les titres, le chat et le code.
Ajustez la taille de police, le contraste, les mouvements, le comportement du curseur et le lissage des polices.
Recherchez les paramètres et synchronisez les préférences sur tous les appareils.
Les modes clair et sombre conservent leurs propres valeurs de personnalisation.
Sept nouvelles langues
Unsloth prend désormais en charge le français, l'allemand, l'espagnol, l'hindi, l'arabe, le russe et le coréen, en plus du chinois, du japonais et du portugais. La détection automatique de la langue du navigateur est désormais la valeur par défaut.
Paramètres vocaux
Un nouvel onglet Voix ajoute des contrôles pour la dictée, les dictionnaires de prononciation et la lecture à voix haute. La prise en charge de la reconnaissance vocale et de la synthèse vocale arrive bientôt ; les conversations vocales complètes sont encore en développement.
Agents et appels d'outils plus sûrs
L'ancien bouton de contournement est désormais un sélecteur d'autorisation à quatre niveaux :
Demander : approuver chaque appel d'outil.
Approuver pour moi : exécuter automatiquement les actions en lecture seule et faire une pause pour les actions potentiellement dangereuses.
Désactivé : désactiver les appels d'outils.
Accès complet : autoriser tous les appels et désactiver le bac à sable.
Ces contrôles couvrent les outils terminal, Python, recherche web, RAG et MCP. Les agents gagnent aussi des espaces de travail isolés, des sessions reprenables avec --persist, des avertissements plus sûrs pour l'installateur distant, un streaming en direct de la sortie des outils, et une meilleure extraction web.
Vulkan et llama.cpp
Le nouveau Vulkan llama.cpp Le backend donne aux GPU Intel une inférence accélérée par GPU au lieu de retomber sur le CPU. Il prend en charge la gestion existante de la VRAM, le dimensionnement automatique du contexte, la sélection multi-GPU et le déchargement des couches.
Les utilisateurs AMD peuvent l’activer avec :
UNSLOTH_FORCE_VULKAN=1Nous avons également amélioré la fiabilité des mises à jour, la récupération de l’état du modèle et l’interruption des générations bloquées.
Modèles et entraînement
Cette version inclut également :
Prise en charge native d’Inkling et améliorations multi-GPU B200.
Attention anticipée DeepSeek-V4 et experts groupés FP8 entraînables.
Entraînement fiable en mode completion-only grâce à la détection automatique des marqueurs de template de chat.
Gestion correcte de la désactivation du gradient checkpointing.
Amélioration de la mise à l’échelle RoPE et de l’extension du contexte.
Arrêt forcé des exécutions d’entraînement bloquées.
Routage automatique pour les nouvelles architectures de modèles et les versions plus récentes de Transformers.
DeepSeek-V4 + NVFP4
Unsloth peut désormais exporter des GGUF NVFP4, FP8 et imatrix après l’entraînement ; servir de système API llama-swap ; ajouter la prise en charge du japonais et du portugais brésilien ; et inclut MLX, safetensors, l’appel d’outils, la prise en charge de healing, et plus encore. Unsloth core rend GRPO 1,3x plus rapide, ajoute un repli HTTP pour les téléchargements bloqués, améliore le mode hors ligne, accélère l’entraînement MoE de 3 à 5x, et corrige de nombreux bugs. Cette série de versions utilise unsloth>=2026.7.1.
DeepSeek-V4-Flash est désormais pris en charge avec des bascules Thinking et nos améliorations de correction du template de chat.

Service d’API compatible OpenAI plus intelligent
Exécutez un seul point de terminaison API local avec un échange de modèle plus sûr et une meilleure récupération outil-agent.
Les requêtes API peuvent choisir le basculement automatique entre les GGUF locaux téléchargés, tandis que les noms de modèles inconnus continuent en toute sécurité d’utiliser le modèle actuel.
/v1/modelsrenvoie désormais des ID de modèles propres et le catalogue GGUF local au lieu des chemins.gguflocaux.Le déchargement automatique en veille peut libérer de la VRAM après une période d’inactivité, et le healing des appels d’outils peut désormais être नियंत्रlé par requête.
Améliorations des exports
Les exports sont plus flexibles et évitent les téléchargements inutiles.
Sélectionnez plusieurs formats d’export à la fois, y compris FP8/INT8 portable, GGUF LoRA, les exports correspondant à la source, imatrix GGUF et les FP8/FP4 compressés.
Les exports multi-checkpoint évitent davantage de téléchargements répétés du modèle de base.
Les exports FP8, INT8 et GGUF-LoRA respectent désormais
trust_remote_codeet l’export GGUF gère plus fiablement les paramètres de quantification manquants.
RAG et chat avec des fichiers
Le chat avec des fichiers est plus utile sur de vrais documents.
Les pièces jointes RAG peuvent désormais utiliser le contexte de tout le document, avec des modèles d’embedding personnalisables et la recherche Hugging Face.
Le chat avec des fichiers lit correctement davantage de PDF et de documents Word, y compris le texte de droite à gauche, les textes indiens et les tableaux DOCX.
Les vérifications RAG locales sont plus fiables derrière des configurations proxy.
Peaufinage et fiabilité d’Unsloth
L’utilisation quotidienne devrait sembler plus fluide et plus stable.
Les longues exécutions d’entraînement et de chat ont moins de chances de se figer silencieusement.
Le mode Comparer, le changement de modèle, l’annulation de modèle, la navigation Hub et Hub Discover sont plus fiables.
Les exports de projet, les exports de chat, les paramètres, les visites guidées, les boîtes de dialogue de fichiers, les écrans de mise à jour et l’UI de raisonnement sont plus propres et plus cohérents.
Correctifs de l’installeur, du matériel et de la plateforme
Unsloth s’installe et s’exécute plus fiablement sur toutes les plateformes.
Les installations macOS ne nécessitent plus CMake ou Homebrew lorsqu’un binaire précompilé
llama.cppest disponible, et la prise en charge d’Apple Silicon gère mieux les chemins avec des espaces et le dimensionnement de la mémoire unifiée.Le démarrage sous Windows, la gestion UTF-8, l’embedding RAG ROCm et la prise en charge GPU de ROCm sous WSL ont été améliorés.
La sélection des binaires précompilés pour les GPU Blackwell, les vérifications d’adéquation GGUF, le parallélisme de tenseurs pour les GGUF vision/mmproj et la réutilisation locale
llama.cppsont désormais plus fiables.
Entraînement, modèles et kernels
L’entraînement et le chargement des modèles sont plus fiables dans davantage de configurations.
GRPO prend désormais en charge le packing de séquences par défaut, évite les prompts partagés répétés et gère correctement la mise à l’échelle des logits en DDP.
Le fine-tuning complet, les paramètres de précision RL, le gradient checkpointing, les tampons RoPE DDP et la détection LoRA MoE ont été corrigés.
La quantification/déquantification FP8, la mise à l’échelle RoPE de Llama 3 avec Transformers v5, les rechargements LoRA de PEFT 0.19, et
fast_generateles messages d’erreur ont été améliorés.
GLM 5.2 + Hub + contextes 3x plus longs
GLM-5.2 est désormais pris en charge dans Unsloth Studio ! Tous les niveaux de raisonnement sont pris en charge. Des longueurs de contexte 3x plus longues sont désormais possibles grâce à notre nouvel algorithme d’ajustement automatique avec MTP, permettant des chats plus longs. Mode de contournement des permissions, chats bifurcables, chats mis en file d’attente, nouveau hub pour la découverte de modèles, modules parallèles + prise en charge HTTPS Cloudflare et plus encore ! Utilisez unsloth studio --secure pour un accès global HTTPS sécurisé !
Meilleur algorithme de longueur de contexte
Selon PR 1 et PR 2, nous avons considérablement amélioré la détermination par Unsloth Studio de l’utilisation mémoire et de la longueur du contexte, obtenant au total des contextes 3x plus longs :
pipeline 1x 32 Go (~31 Go libres)
f16
23,040
64,000
q8_0
43,520
114,944
q4_0
82,432
199,680
pipeline 2x 32 Go
n’importe lequel
262,144
262,144
tensor 2x 24 Go (~23 Go libres)
f16
134,049
262,144
q8_0
252,329
262,144
Canvas de chat, bifurcation et mise en file d’attente
Modifiez les messages de l’assistant sur place et relancez depuis n’importe quel point du fil.
Bifurquez un fil pour créer une branche de conversation sans perdre l’original.
Chats temporaires (incognito) qui ne laissent aucune trace.
Mettez de nouveaux prompts en file d’attente pendant qu’une génération est encore en cours au lieu d’attendre.
Les « artefacts » de chat sont désormais canvas, avec cartes HTML canvas intégrées qui se rendent automatiquement, une vue Code, et DiffusionGemma conserve son code brut visible en ligne au lieu d’être replié.
La recherche dans le chat couvre désormais chaque message et affiche d’abord vos propres messages.
Hub (repensé)
Hub plein écran avec un fil tendance, une recherche et la prise en charge de chemins de modèles personnalisés.
Aperçu README dans un flux à vue partagée afin que vous puissiez lire avant de télécharger.
Les téléchargements utilisent par défaut le transport plus rapide Xet avec repli HTTP automatique si un transfert se bloque.
Nouveau bouton « Charger à la sélection » pour définir les options de chargement avant qu’un modèle ne se charge.
Logo Google affiché pour DiffusionGemma et les futurs dérivés de Gemma.
Modèles et inférence
DeepSeek-OCR et d’autres modèles vision se chargent et s’exécutent désormais sans erreur.
L’inférence rapide a été corrigée sur la dernière version de vLLM (0.22+) afin que les accélérations fonctionnent à nouveau.
Le parallélisme de tenseurs est plus fiable : si le chemin MTP plus rapide échoue, il se rétablit désormais tout seul au lieu de planter.
DiffusionGemma affiche désormais l’image en formation en direct pendant le débruitage, avec des statistiques de vitesse précises.
Sécurité et studios chiffrés Cloudflare
Nouveau
--securemode Cloudflare uniquement pour des studios chiffrés de bout en bout, avec les outils côté serveur restant activés sous--secure. Utilisezunsloth studio --secure!le mode Bypass Permissions pour ignorer les confirmations et désactiver le sandbox d’outils quand vous le souhaitez.
Détection automatique de l’analyse antivirus Hugging Face + des fichiers dangereux dans les dépôts.
Journalisation et API
Nouveau Moniteur du serveur API dans Unsloth.
Appels API plus rapides et latence réduite
Journaux beaucoup mieux rationalisés - désormais avec débit et latence, et suppression d’une grande partie des journaux superflus.
Matériel et backend
Meilleure prise en charge des GPU Blackwell RTX 50X et 60X
Correction du basculement silencieux vers le CPU au lieu du GPU
La version de torchao est désormais sélectionnée à partir de torch installé.
L’installeur répare désormais automatiquement une installation PyTorch cassée ou CPU-only et avertit en cas de repli silencieux sur le CPU, sur NVIDIA + AMD sous Win/Linux/Mac/WSL.
Libère la VRAM du modèle de chat lorsque l’entraînement commence, mais uniquement lorsque le GPU est réellement à court d’espace (sinon aucun rechargement inutile).
Si llama-server plante brutalement au démarrage, Unsloth suit désormais une séquence de récupération au lieu d’échouer simplement.
Correctifs entraînement & généraux & modules parallèles
Mises à jour de l’entraînement MLX.
Fiabilité améliorée de l’entraînement GRPO avec vLLM.
Le démarrage de l’entraînement est rendu plus fiable, avec des erreurs plus claires pour les lots VLM invalides.
Unsloth nettoie désormais plus fiablement les processus backend restants après des plantages, des redémarrages ou des arrêts interrompus.
Export, chat, entraînement et recettes sont tous individualisés / compartimentés ! Cela signifie que vous pouvez faire les 4 en parallèle maintenant ! Vous pouvez chatter / faire de l’inférence pendant que vous attendez une exécution d’entraînement ou un export !
Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :
macOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows :
irm https://unsloth.ai/install.ps1 | iexDiffusionGemma + Gemma 4 MTP
Assurez-vous d’installer la dernière v0.1.464-beta ou 2026.6.7. DiffusionGemma, Gemma 4 MTP et MiniMax-M3 sont désormais tous pris en charge.
Exécutez et entraînez DiffusionGemma via Unsloth Studio.
Gemma 4 MTP est arrivé ! Exécutez Gemma 4 environ 2x plus vite avec MTP.
Le chat audio est désormais pris en charge pour Gemma 4 (
wav,mp3,m4a,flac,webm).Conserver Think a été ajouté à Gemma 4.

Hub + gestionnaire de téléchargements (expérimental)
Ajout d’une nouvelle page Hub pour parcourir, télécharger et gérer les modèles et ensembles de données Hugging Face.
Unsloth peut désormais détecter les modèles et ensembles de données déjà présents sur votre machine et les afficher à côté des éléments téléchargés.
Téléchargé modèles GGUF ont désormais des actions directes Exécuter / Nouveau chat .
RAG / Chat avec des fichiers (expérimental)
Ajouté Chat avec des fichiers dans Unsloth, vous permettant de poser des questions sur vos propres documents et bases de connaissances.
Prend en charge la recherche hybride, les citations, les aperçus PDF, les documents par fil et un outil intégré
search_knowledge_base.
Nouveau bouton de mise à jour + prise en charge matérielle
Unsloth utilise désormais constamment les précompilés llama.cpp à jour les plus récents sur CUDA, ROCm, Windows, Linux et macOS.
Ajout d’un Mettre à jour llama.cpp bouton dans l’application pour que les utilisateurs puissent mettre à jour le backend local sans réinstaller Unsloth.
Prise en charge AMD améliorée sous Windows / WSL, prise en charge ROCm Strix Halo, sélection CUDA Blackwellet messages d’installeur plus clairs.
Chat local, outils et compatibilité API
L’appel d’outils local est plus fiable, avec un meilleur ordre des cartes d’outils, moins de boucles d’outils en double et la prise en charge de l’utilisation d’outils avec les modèles vision GGUF. Amélioration du comportement de l’API
compatible OpenAI et de l’API compatible Anthropic pour les serveurs locaux Unsloth, y compris de meilleures erreurs, l’utilisation des jetons, les raisons d’arrêt, et la compatibilité Claude Code Compatibilité Claude Code.
Entraînement et correctifs
compatible OpenAI Prise en charge MLX avec de meilleures étiquettes de modèles, des statistiques de vitesse de génération et des correctifs pour l’entraînement VLM.
Plusieurs cas limites et de jeu de données ont été corrigés, y compris les caches Hugging Face non inscriptibles et les mappages de jeu de données personnalisés.
De nombreux correctifs de finition UI ont été ajoutés dans le chat, les menus, le sélecteur de modèle, le mode sombre, l’import/export et les paramètres.
Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :
macOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows :
irm https://unsloth.ai/install.ps1 | iexGemma 4 12B, nouvelle UI, MCP, projets
Cette mise à jour se concentre principalement sur Gemma 4 12B, MCP, Projets, Canvas, CUDA 13.3 et la nouvelle UI de chat. La semaine prochaine, nous aurons une mise à jour encore plus importante.

Gemma 4 12B
Google publie Gemma 4 12B, un nouveau modèle qui s’exécute localement sur 8 Go de RAM. GGUF / Guide
Gemma 4 12B Unified prend en charge l’image, l’audio et un contexte 256K. Exécutez et entraînez le modèle via Unsloth Studio.
MCP
Prise en charge
MCPdu serveur distant, y compris les en-têtes personnalisés et OAuthbasé sur des commandes local
MCPprise en charge du serveurMCPpeut désormais être activée depuis le compositeur de chatPréréglages intégrés pour les
MCPserveurs
Nouvelle UI de chat
Projets, Canvas,
MCP, les contrôles RAG et Compare vivent désormais dans le menu plusLes contrôles de recherche et de code sont plus faciles d’accès depuis le compositeur
Les menus, superpositions, icônes et contrôles cliquables sont plus cohérents dans tout Unsloth
Projets
Organisez les chats liés dans des espaces de projet dédiés
Déplacez les chats existants vers des projets
Créez et gérez des projets directement depuis la barre latérale
Canvas / artefacts expérimentaux
Ouvre le HTML généré dans un panneau canvas dédié à l’intérieur d’Unsloth Studio
Prend en charge les sorties interactives, y compris les visualisations basées sur le navigateur et les paquets chargés depuis un CDN
Permet de basculer entre l’aperçu rendu et le code source
Installation, runtime et matériel
Les installations précompilées Windows ne nécessitent plus le
CUDA ToolkitcontrôleLinux
llama.cpples précompilés correspondent désormais au runtime détectécudartprincipalROCmla détection gfx est transmise à la sélection des précompilésBlackwell,B300etARM64Mises à jour de la prise en charge Linux
Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :
macOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows :
irm https://unsloth.ai/install.ps1 | iexNE PAS UTILISER mise à jour d’unsloth studio car le packaging n’obtiendra plus les dernières mises à jour !
CUDA 13.3, Windows, Mac
Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :
macOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows :
irm https://unsloth.ai/install.ps1 | iexNE PAS UTILISER mise à jour d’unsloth studio car le packaging n’obtiendra plus les dernières mises à jour !
Mises à jour Mac
Réactivé
llama.cpples binaires précompilés pour Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)Mac OS 13 (Ventura) sur Apple Silicon utilise une compilation à partir des sources
Intel (x86_64) pour Mac OS 13.3 / 14 / 15 / 26 (Tahoe) utilise
llama.cppdes binaires précompilésIntel pour Max 13.0 - 13.2 utilise une compilation à partir des sources
Mises à jour Windows
CUDA 13.3
llama.cpples binaires précompilés fonctionnent désormais pour WindowsPour CUDA 13.2, CUDA 13.1 et versions antérieures, les appareils Windows utilisent le repli CUDA 12.4 - nous travaillerons bientôt sur des binaires CUDA 13.1.
Mise à jour CUDA 13.3
Les binaires non Linux CUDA 13.3 fonctionnent. Nous utiliserons encore CUDA 13.1 pour le moment
CUDA 13.3 résout le problème de charabia de CUDA 13.2 - voir https://github.com/unslothai/unsloth/issues/4849
Mise à jour des GPU Blackwell
Pour le moment, Blackwell aura des sorties retardées de
llama.cppbinaires précompilés puisque CUDA 12.4 ne fonctionne pas - nous travaillons à résoudre cela bientôt.
Une mise à jour avant la refonte.
Salut tout le monde, nous faisons une dernière mise à jour avant une refonte majeure qui devrait arriver cette semaine ou la suivante. Notre refonte changera beaucoup de choses, surtout avec de nouvelles fonctionnalités majeures et beaucoup de changements de design.
NOUVEAU : prise en charge des appels API désormais avec génération + édition d’images, recherche web correcte, exécution de code, mise en cache automatique des prompts. Connectez OpenAI, Anthropic et plus encore.
Prise en charge correcte des langues non anglaises p. ex. japonais, chinois, indien, etc.
Beaucoup d’entre vous ont peut-être manqué notre version précédente qui n’a duré qu’une journée. Nous avons introduit :
Connectez-vous à des backends d’inférence externes : vLLM, Ollama, llama-server
Améliorations de sécurité
Décodage spéculatif Auto MTP pour les GGUF MTP ; obtenez les meilleurs paramètres adaptés à votre matériel.
Appels aux fournisseurs d’API et connexions externes
Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)
Recherche web intégrée pour OpenAI, Anthropic, OpenRouter et Kimi
Exécution de code intégrée pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)
La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.
Génération + édition d’images
La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud
Autres mises à jour d’Unsloth Studio
Pièces jointes OpenDocument pour le chat
charge utile du résumé de raisonnement o3
L’envoi / le prompting dans des langues non anglaises (p. ex. japonais, chinois) fonctionne désormais correctement
Durcissement du compositeur IME, RTL
dir="auto"correction du tronquage des longues lignes de journalRendu de la trace de raisonnement de l’outil dans l’interface
Prise en charge entièrement hors ligne : découverte GGUF mise en cache et autodétection DNS hors ligne pour l’inférence et l’entraînement
Améliorations de sécurité d’Unsloth Studio
Limitation du débit d’authentification, compatible avec les proxys afin que les reverse proxies ne puissent pas la contourner
Worker sandboxé avec une liste de blocage renforcée (bash,
envoi hf,NOFILE)Contenance du chemin afin que les workers ne puissent pas s’échapper de leurs répertoires tmp en cours d’utilisation
Validation stricte du schéma sur toute l’API Unsloth
CSP / en-têtes de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)
Supprimé le
torch.loadrepli surtraining_args.binafin que des pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèleFlux de publication desktop Tauri renforcé
Auth frontend : rafraîchissement de jeton singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, helper 422 partagé
Le nettoyage d’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin qu’il ne puisse jamais supprimer l’état utilisateur
Corrections MTP + Unsloth
Beaucoup de corrections de bugs, de corrections UI/UX pour Unsloth ! Pour obtenir les dernières mises à jour, faites :
macOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows :
irm https://unsloth.ai/install.ps1 | iexCorrections
Corriger
mise à jour d’unsloth studione fonctionne pas bienCorrection d’un blocage sur
reset-passwordpagePlus de prise en charge du mode hors ligne
Amélioration du fait que MTP n’était pas plus rapide sur Mac, CPU et GPU - maintenant c’est bien mieux !
Correction du raccourci Desktop qui ne fonctionnait pas après la mise à jour
Très nombreuses corrections de bugs UI/UX
Qwen3.6 MTP + connexions API
Nous avons plein de nouvelles mises à jour pour Unsloth v0.1.41-beta:
inférence GGUF ~2x plus rapide avec activation automatique de MTP
prise en charge des appels API pour OpenAI, Anthropic etc. avec cache de prompt automatique, recherche web, exécution de code
Connectez-vous à des backends d’inférence externes : vLLM, Ollama, llama-server
Expérimental inférence MLX
Prise en charge correcte des langues non anglaises
Sécurité améliorations

Prise en charge du décodage spéculatif MTP : inférence 1,4 à 2x plus rapide !
Décodage spéculatif Auto MTP pour les GGUF MTP ; avertir lorsque le binaire précompilé llama.cpp fourni est obsolète ou trop ancien pour MTP
Nouveaux binaires llama.cpp précompilés pour la prise en charge de MTP !
Appels aux fournisseurs d’API et connexions externes
Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)
Recherche web intégrée pour OpenAI, Anthropic, OpenRouter et Kimi
Exécution de code intégrée pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)
La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.
La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)
Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud
inférence MLX (expérimental)
Les quantifications et modèles MLX peuvent désormais s’exécuter localement sur vos machines Mac !
Nous ajouterons bientôt le raisonnement, les outils et la recherche web !
Autres mises à jour d’Unsloth Studio
L’envoi / le prompting dans des langues non anglaises (p. ex. japonais, chinois) fonctionne désormais correctement
Pièces jointes OpenDocument pour le chat
charge utile du résumé de raisonnement o3
Durcissement du compositeur IME, RTL
dir="auto"correction du tronquage des longues lignes de journalRendu de la trace de raisonnement de l’outil dans l’interface
Prise en charge entièrement hors ligne : découverte GGUF mise en cache et autodétection DNS hors ligne pour l’inférence et l’entraînement
Beaucoup de peaufinage UI/UX : refonte du thème sombre, redesign de la barre latérale droite, mascotte paresseux selon l’heure de la journée, toasts supprimables et copiable, éditeur de chat plus grand, peaufinage de la configuration d’exécution de code, style des boutons d’action de l’éditeur, bouton Discord plus étroit
Mises à jour de l’entraînement
Corrections du masque d’attention Gemma
GRPO multi-image
Expériences de retour d’état caché GRPO
Nouvelle méthode d’entraînement Continued Pretraining (CPT) proposée comme option de premier rang
Extracteur LoRA Gemma-4 MoE enregistré pour corriger
grouped_mmcrash de contractionFusionné en option
lm_head+ propagation avant de l’entropie croisée, avec chemin mono-matmul sousUNSLOTH_RETURN_LOGITS=1Passer la taille du lot pour l’évaluation
Les chemins d’évaluation / d’entraînement respectent désormais
HF_DATASETS_OFFLINEavecHF_HUB_OFFLINE
Améliorations de sécurité d’Unsloth Studio
Limitation du débit d’authentification, compatible avec les proxys afin que les reverse proxies ne puissent pas la contourner
Worker sandboxé avec une liste de blocage renforcée (bash,
envoi hf,NOFILE)Contenance du chemin afin que les workers ne puissent pas s’échapper de leurs répertoires tmp en cours d’utilisation
Validation stricte du schéma sur toute l’API Unsloth
CSP / en-têtes de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)
Supprimé le
torch.loadrepli surtraining_args.binafin que des pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèleFlux de publication desktop Tauri renforcé
Auth frontend : rafraîchissement de jeton singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, helper 422 partagé
Le nettoyage d’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin qu’il ne puisse jamais supprimer l’état utilisateur
point de terminaison API Unsloth
correctif de bug v0.1.39-beta 5 mai 2026
Corrige le fait que l’historique du chat ne s’affiche pas (l’historique existant n’est pas perdu) et que les pièces jointes ne s’attachent pas correctement. Le bug ne concernait que le rendu - utilisez 2026.5.2 ou appelez directement curl -fsSL https://unsloth.ai/install.sh | sh pour mettre à jour
Vous pouvez utiliser des LLM locaux avec des outils comme Claude Code et Codex en les connectant au point de terminaison API d’Unsloth. Cela vous permet d’exécuter localement des modèles comme Qwen et Gemma , avec des fonctionnalités supplémentaires telles que l’appel d’outils auto-réparant, l’exécution de code et la recherche web.
Utiliser Unsloth comme point de terminaison d’inférence API est avantageux non seulement parce qu’il est facile à configurer et rapide, mais aussi parce qu’Unsloth fournit :
Appel d’outils auto-réparant, ce qui aide à réduire de 50 % les appels d’outils cassés ou mal formés
Exécution de code prise en charge, permettant l’exécution de Bash et Python pour des sorties de code plus précises.
Avancé Recherche web qui visite et lit réellement les pages web pour recueillir des informations détaillées.
Paramètres d’inférence automatiques pour les modèles GGUF (temp, top-k, etc.)

Nouveaux modèles
Nous avons aussi quelques nouveaux modèles à exécuter, notamment NVIDIA Nemotron 3 Nano Omni, IBM Granite 4.1 et Mistral 3.5 Medium. Nous avons aidé Mistral à résoudre certains problèmes d’implémentation dans transformers et les GGUFs.
Mises à jour d’Unsloth
Les exécutions d’entraînement Unsloth arrêtées peuvent désormais reprendre à partir des checkpoints.
Les fils de discussion se sauvegardent désormais automatiquement et persistent plus fiablement.
Les blocages de l’entraînement DPO dans les configurations multi-processus ont été corrigés.
La prise en charge de VLM GRPO a été améliorée avec les mises à jour MROPE.
Le bouton d’arrêt d’Unsloth arrête désormais correctement la génération.
Correction de la disparition du modèle de chat après un rafraîchissement du navigateur.
Toute nouvelle refonte de l’interface
Salut tout le monde, nous avons repensé toute l’interface et l’expérience UX d’Unsloth Studio afin de mettre l’accent sur le chat et l’entraînement :
Ajout d’une barre latérale repliable basé sur les retours de la communauté

Vous pouvez désormais supprimer des chats et rechercher dans les conversations passées


Nouveau bascule « Preserve Thinking » pour les modèles qui le prennent en charge comme Qwen3.6
Design plus propre, plus cohérent, avec une navigation plus facile
Page Paramètres enrichie avec des options pour changer votre photo de profil, votre nom, et plus encore

Plus besoin de saisir deux fois votre jeton Hugging Face
gpt-oss dispose désormais de bascules de réflexion faible, moyenne et élevée.
Utilise désormais le dernier binaire précompilé llama.cpp, même sur Linux CUDA
Beaucoup de corrections de bugs, de cohérence et de stabilité
Kimi-K2.6 peut désormais être exécuté !
Nous avons également ajouté une prise en charge expérimentale de l’API. Des guides, annonces, etc. arriveront la semaine prochaine.
Qwen3.6 était aussi déjà pris en charge dans Unsloth Studio pour l’exécution et l’entraînement. Vous pouvez entraîner et exécuter Qwen3.6-27B dès maintenant !
Qwen3.6-27B + Kimi K2.6
Qwen3.6-27B peut désormais être exécuté (18 Go de RAM) et affiné dans Unsloth Studio. Kimi K2.6 peut également être exécuté dans Unsloth (350 Go de RAM).
Unsloth Studio a reçu de nombreuses nouvelles mises à jour, veuillez donc mettre à jour. Les détails et un article arriveront dans les prochains jours.
Qwen3.6
Qwen3.6 peut désormais être exécuté et affiné dans Unsloth Studio. Le modèle fonctionne avec 23 Go de RAM et est le LLM de taille moyenne le plus puissant sur presque tous les benchmarks.
Mise à jour Gemma 4 + MiniMax-M2.7
GGUF Gemma 4 sont désormais mis à jour avec les correctifs officiels de Google pour le modèle de chat (qui ont corrigé/amélioré l’appel d’outils), ainsi qu’avec les derniers correctifs de llama.cpp. Mettez à jour vers la dernière version de llama.cpp, retéléchargez les quantifications et vous ne devriez plus voir jeton inutilisé de problèmes.
MiniMax-M2.7 est disponible maintenant ! Vous pouvez exécuter le modèle localement avec nos GGUF en quantification 4 bits sur 128 Go de RAM / mémoire unifiée. GGUF MiniMax-M2.7
Corrections Gemma 4
Nous avons mis à jour Gemma 4 avec de nombreuses corrections. Ces bugs sont universels et ont affecté tous les packages et implémentations d’entraînement et ne proviennent pas d’Unsloth. Nous avons identifié les bugs, les avons corrigés, et l’entraînement Gemma 4 fonctionne désormais correctement dans Unsloth.
Vous n’avez besoin que de 8 Go de VRAM pour entraîner Gemma-4-E2B localement. Unsloth entraîne Gemma 4 environ 1,5x plus vite tout en utilisant environ 60 % de VRAM en moins que les configurations FA2. Pour le guide complet et les notebooks sur l’entraînement de Gemma 4, voir notre blog.
Corrections d’entraînement Gemma 4
L’accumulation de gradient ne provoque plus d’explosions de perte. Auparavant, les pertes pouvaient monter à 300–400; la perte attendue est d’environ 10–15.
Correction du IndexError affectant 26B et 31B l’inférence dans
transformers.Correction des sorties incohérentes pour E2B/E4B quand
use_cache=False. Voir le problème #45242.Correction de audio float16 débordement à partir de
-1e9valeurs.
Si vous voyez des pertes supérieures à 13–15, par exemple 100 ou 300 - l’accumulation de gradient est probablement gérée incorrectement. Cela est corrigé dans Unsloth et Unsloth Studio.
Téléversements quantifiés Gemma 4
Nous avons également mis à jour nos GGUF Gemma 4, vous devrez donc les retélécharger. Là encore, ces problèmes de quantification ne sont pas liés à Unsloth et ne sont pas causés par lui:
CUDA : vérifier le chevauchement des tampons avant la fusion - correctif critique pour
<unused24>tokens - PR #21566kv-cache: prise en charge de la rotation de l’attention pour iSWA hétérogène - PR #21513vocab: ajout de la gestion des jetons d’octet au détokenizer BPE pour Gemma 4 - PR #21488convertir: définir"add bos" == Truepour Gemma 4 - PR #21500commun: ajout d’un analyseur spécialisé Gemma 4 - PR #21418llama-model: lirefinal_logit_softcappingpour Gemma 4 - PR #21390llama: ajout d’un découpage personnalisé des nouvelles lignes pour Gemma 4 - PR #21406
Mises à jour d’Unsloth Studio
Ajouter le décodage spéculatif prise en charge (ngram-mod, activé par défaut)
Llama.cpp mis à jour pour utiliser la dernière version avec tous les correctifs Gemma 4
Corriger les problèmes d’entraînement Qwen3.5 et Gemma 4
Autoriser l’exportation et l’enregistrement des modèles Gemma 4
Renforcer la sécurité du sandbox pour le terminal et les outils Python
Permettre aux recettes d’utiliser le modèle chargé dans Chat
Corriger les fils de discussion vides lors de la navigation (et lors du changement d’onglet) et stabiliser le nouveau flux de chat
Autoriser l’exécution des recettes non-LLM et déplacer l’onglet Data en premier dans les exécutions
Réutiliser la casse du dépôt en cache de HF pour éviter les téléchargements en double
Google - Gemma 4
Vous pouvez désormais exécuter et entraîner les Gemma 4 modèles dans Unsloth.
Intel Mac fonctionne désormais
Les appels d’outils pour les petits modèles sont désormais plus stables et ne se coupent plus
Binaires précompilés pour Windows, Linux, Mac, appareils WSL - CPU et GPU
Décodage spéculatif ajouté pour les modèles non vision (Gemma-4 est vision malheureusement et Qwen3.5)
La longueur de contexte est maintenant correctement appliquée.
La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés
90 % d’appels à l’API HF en moins - moins de limitations de débit
+50 % de précision des appels d’outils + plus de prise en charge
Les appels d’outils pour tous les modèles sont désormais de +30 % à +80 % plus précis.
La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés
Le nombre d’appels d’outils autorisés passe de 10 à 25
Les appels d’outils se terminent désormais bien mieux, donc les boucles / répétitions seront réduites
Plus de réparation d’appels d’outils et de logique de déduplication pour empêcher aussi les appels d’outils de laisser fuir du XML
Testé avec
unsloth/Qwen3.5-4B-GGUF(UD-Q4_K_XL), recherche web + exécution de code + réflexion activées.
Fuites XML dans la réponse
10/10
0/10
Récupérations d’URL utilisées
0
4 exécutions sur 10
Exécutions avec noms de chansons corrects
0/10
2/10
Moy. appels d’outils
5.5
3.8
Temps de réponse moyen
12,3 s
9,8 s
Nouvelles fonctionnalités
Ajouté dossiers personnalisés afin que vous puissiez utiliser n’importe quel GGUF dans n’importe quel dossier - pour l’instant accès dans les Paramètres avancés du Chat et Dossiers personnalisés
Bouton Mettre à jour désormais visible
Style du script d’installation entièrement mis à jour !
Préliminaire Prise en charge automatique multi-GPU pour l’inférence et l’entraînement - utile pour les grands modèles qui ne tiennent pas sur 1 GPU - Unsloth auto allouera les ressources GPU
Les Mac Intel devraient fonctionner immédiatement
Unsloth beaucoup plus fluide et plus rapide
Correction des délais d’expiration lors du téléchargement de grands modèles - plus aucun délai d’expiration constaté.
Correction de la limitation de débit Hugging Face - appels API HF réduits de 90 %
Correction de bun sur Windows et installations plus rapides
Nouvelles mises à jour importantes
Il ne s’est écoulé que 2 jours depuis notre précédente version, mais nous avons des mises à jour plus importantes :
L’inférence est désormais 20 à 30 % plus rapide. Auparavant, l’appel d’outils et la pénalité de répétition pouvaient ralentir l’inférence en dessous des vitesses normales. Les tokens/s d’inférence devraient désormais être identiques à
llama-server/llama.cpp.Détecte désormais automatiquement les anciens modèles ou les modèles préexistants téléchargés depuis LM Studio, Hugging Face, et des sources similaires.
La vitesse des tokens/s d’inférence est désormais calculée correctement. Auparavant, les tokens/s incluaient le temps de démarrage, ce qui faisait paraître la vitesse affichée plus lente qu’elle ne l’était réellement. Elle devrait désormais refléter la « vraie » vitesse d’inférence.
L’utilisation du CPU ne monte plus en pic. Auparavant, l’identité du queryer inline changeait à chaque rendu, ce qui provoquait
useLiveQueryde se réabonner en continu.Unsloth Studio dispose désormais d’un bouton x de fermeture et s’arrête correctement. Auparavant, le fermer après l’avoir ouvert depuis l’icône du bureau ne le fermait pas correctement. Désormais, le lancement depuis le raccourci ouvre aussi le terminal, et la fermeture de ce terminal quitte complètement Unsloth Studio. Si vous l’avez encore ouvert depuis une session précédente, vous pouvez redémarrer votre ordinateur ou exécuter
lsof -i :8888puiskill -9 <PID>.Appel d’outils et recherche web encore meilleurs avec moins d’erreurs.
Documentation mise à jour avec beaucoup de nouvelles informations sur la suppression de modèles, la désinstallation etc.
Journalisation d’installation et de configuration plus propre et plus intelligente sur Windows et Linux. La sortie est désormais plus facile à lire avec un formatage cohérent, plus silencieuse par défaut pour une expérience plus fluide, et prend en charge des diagnostics enrichis
--verbosequand vous voulez tous les détails techniques.Vous pouvez désormais consulter votre historique d’entraînement !
Premier post de publication après Unsloth Studio
Salut tout le monde, voici notre première version depuis le lancement d’Unsloth Studio. Beaucoup de nouvelles fonctionnalités et corrections :
Vous pouvez désormais mettre à jour Unsloth Studio ! Veuillez mettre à jour via les mêmes commandes d’installation.
Windows CPU ou GPU fonctionne désormais de manière transparente. Veuillez réinstaller !
Raccourcis d’application. Une fois installé, vous pouvez désormais le lancer sous Windows, MacOS et Linux via une icône de raccourci dans le menu Démarrer / Launch et sur le bureau.
Précompilés
llama.cppbinaires etmamba_ssm- installations 6x plus rapides ! Également <300 Mo pour les binaires.Tailles d’installation réduites de 50 % (économie de 7 Go ou plus), installations 2x plus rapides et résolution plus rapide. Tailles PyPI réduites de 50 %.
Appel d’outils amélioré. Meilleur parsing de llama.cpp, aucun balisage brut des outils dans le chat, inférence plus rapide, un nouveau panneau de sorties d’outils, des minuteries.
MacOS et le CPU ont maintenant Recettes de données activé avec le téléversement de plusieurs fichiers.
Prise en charge AMD préliminaire pour Linux pour les machines uniquement - détection automatique.
Refonte de la barre latérale des paramètres. Les paramètres sont désormais regroupés en Modèle, échantillonnage, outils et préférences
Longueur du contexte désormais réglable. Gardez à l’esprit que ce n’est pas nécessaire, car llama.cpp utilise intelligemment le contexte exact dont vous avez besoin via
--fit activéTéléversement de plusieurs fichiers. Les recettes de données prennent désormais en charge plusieurs téléversements par glisser-déposer pour PDF, DOCX, TXT et MD, avec extraction côté serveur, téléversements enregistrés et aperçus améliorés.
Colab avec des GPU T4 gratuits avec Unsloth Studio, c’est désormais corrigé ! Essayez-le ici. Grâce aux binaires précompilés, c’est aussi 20x plus rapide !
Meilleure observabilité du chat. Unsloth affiche désormais
llama-serverles temps et l’utilisation, une barre d’utilisation de la fenêtre de contexte et des infobulles de source plus riches.Une meilleure UX globale - liens cliquables, meilleur parsing LaTeX, infobulles d’outils / code / web pour les cartes par défaut, et bien plus encore !
LiteLLM - Unsloth Studio et Unsloth ont été PAS touchés par la récente compromission de LiteLLM. Nemo Data Designer n’a utilisé LiteLLM que jusqu’à
1.80, et non la version touchée1.82.7ou1.82.8, et l’a depuis entièrement supprimée.Nous avons désormais une nouvelle commande d’installation en une seule ligne, exécutez simplement :
Corrections :
Améliorations de Windows et de l’installation. Correction des fermetures silencieuses de Windows, des plantages au démarrage d’Anaconda/conda-forge, des installations Windows non-NVIDIA défaillantes et des vérifications de configuration CUDA précoces/venv obsolète manquantes.
Corrections des prompts système. Ils fonctionnent à nouveau pour l’inférence texte et vision hors GGUF.
Prompts système et préréglages persistants. Les prompts système personnalisés et les préréglages de chat persistent désormais après les rechargements et les changements de page.
Export GGUF élargi. Les fine-tunes complets, pas seulement LoRA/PEFT, peuvent désormais être exportés en GGUF. La résolution du modèle de base est plus fiable, et les options d’exportation non prises en charge sont désactivées dans l’interface.
Corrections du défilement / de la mise en page du chat. Correction des problèmes de position de défilement pendant la génération, du décalage de mise en page du panneau de réflexion et des sauts de viewport lors de la réduction des panneaux de raisonnement.
Détection plus intelligente des conflits de ports. Unsloth détecte désormais les conflits de loopback, peut identifier le processus bloquant lorsque c’est possible, et fournit des messages de port de repli plus clairs.
Nouvel appel d’outils + stabilité de Windows
Claude Artifacts fonctionne, de sorte que le HTML peut être exécuté comme un jeu du serpent dans le chat
+30 % d’appels d’outils plus précis, surtout pour les petits modèles + minuteur pour les appels d’outils
Les sorties d’outils + recherche web peuvent être enregistrées + activer/désactiver l’outil d’auto-réparation
Nombreuses corrections de bugs - le CPU Windows fonctionne, Mac est plus fluide, installations plus rapides et plus légères
Mis à jour
Ce contenu vous a-t-il été utile ?

