For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mises à jour d'Unsloth

Journal des modifications d'Unsloth pour nos dernières versions, améliorations et correctifs.

Pour utiliser les dernières modifications, mettez à jour Unsloth.

Qwen3.8-Flash + GLM-5.3 2x plus rapides

Exécuter Qwen3.8-Flash-Next et GLM-5.3-Flash jusqu'à 2× plus rapide avec un décodage plus rapide et le bonus MTP, désormais activé par défaut. Cette version inclut aussi 170+ améliorations dans l'entraînement, le chat, la prise en charge matérielle, les API et les performances.

  • Génération Qwen et GLM plus rapide avec MTP, ainsi qu'une meilleure utilisation des outils et des paramètres Qwen recommandés.

  • Interface utilisateur/expérience beaucoup moins lente pour tous les chats, surtout sur les longues conversations

  • Nouveau support pour MiniMax-Music3, Higgs et MOSS modèles audio, y compris le suivi de progression et la gestion des clips.

  • Chargement des modèles plus fiable sur les serveurs locaux et chez les fournisseurs connectés.

  • Édition de chat plus sûre qui préserve les appels d'outils, les réponses, les médias et les branches de conversation.

  • Entraînement multi-GPU, ajustement mémoire, placement des modèles et exports GGUF améliorés.

  • Installation, détection et compatibilité GPU AMD/ROCm renforcées.

  • MCP, Deep Research, OAuth, appels d'outils parallèles et workflows d'agent plus fiables.

  • Nouvelles API compatibles OpenAI pour les modèles vidéo, audio et servis par MLX.

  • Mises à jour du bureau, contrôles des ports LAN, téléchargements et nettoyage de la mémoire GPU améliorés.

Qwen3.8-Flash-NextGLM-5.3-FlashGLM-5.3

Qwen3.8-Flash-Next + GLM-5.3

Qwen3.8-Flash-Next, GLM-5.3-Flash + GLM-5.3 peuvent désormais s'exécuter localement dans Unsloth !

  • Qwen3.8-Flash fonctionne sur 75 Go de RAM

  • GLM-5.3-Flash fonctionne sur 102 Go de RAM + VRAM

  • Déchargement de la RAM jusqu'à 5x plus rapide

  • La compaction automatique répétée fonctionne désormais de manière fiable

  • 100+ améliorations du chat, de la fiabilité et des performances

Qwen3.8-Flash-NextGLM-5.3-FlashGLM-5.3

Qwen3.8-Flash-Next

Modèle de raisonnement multimodal 125B et aperçu précoce de l'architecture de Qwen4.

  • Le GGUF dynamique 1-bit fonctionne sur 75 Go de RAM ou une mémoire unifiée

  • Contexte jusqu'à 262K avec texte et images

  • Modes de raisonnement Aucun, Faible, Moyen et Très élevé

  • Le Thinking préservé améliore la cohérence dans les longues conversations

GLM-5.3-Flash

Modèle multimodal 320B avec 18B de paramètres actifs.

  • Le modèle 1-bit fonctionne sur 102 Go de RAM + VRAM combinées

  • Contexte jusqu'à 1M pour le texte, les images et les documents

  • Modes de raisonnement Faible, Élevé et Max

  • Performances améliorées en codage, en agents et en vision

Améliorations d'Unsloth

  • Les grands GGUF sont automatiquement répartis entre le GPU et la RAM système

  • Voir les estimations de mémoire avant le chargement

  • Les chats se rétablissent après les déconnexions

  • Meilleure vision multi-image et prise en charge des images MCP

  • Exporter les chats en JSONL

  • Contrôles de compaction automatique améliorés

  • Correctifs pour Linux, NVIDIA Wayland, AMD et Windows

Pour exécuter ou entraîner les nouveaux modèles, vous pouvez télécharger Unsloth Desktop :

Télécharger Unsloth Desktop

Compaction automatique + accès LAN

Merci pour le soutien concernant Qwen3.8-27B et Unsloth Desktop la semaine dernière ! Pour notre nouvelle v0.1.801-beta version, nous avons fusionné plus de 200 PR pour introduire de nombreuses nouvelles fonctionnalités et corrections, notamment :

  • Compaction automatique (expérimental) pour les chats plus longs au-delà des limites de contexte

  • Accès à distance et LAN (aperçu) pour un accès réseau facile sans liens Cloudflare

  • Chat plus rapide - Performances de streaming améliorées, latence de l'interface réduite et conversations longues plus fluides.

  • Prise en charge de compilations personnalisées de llama.cpp. Bascule pour Cache RAM, Mmap, Mlock, Checkpoints, Spe Decoding KV Cache, Vision activée / désactivée

  • Unsloth Dynamic v3.0 est publié. Les nouveaux GGUF dynamiques v3.0 de Qwen3.8-27B offrent une précision top-1 supérieure de plus de 10 % par rapport à tous les autres. Fonctionne avec Unsloth.

Compaction automatique (expérimental)

Les longues conversations peuvent désormais dépasser les limites de contexte en déplaçant les tours plus anciens vers une archive consultable.

  • Les tours plus anciens ne sont supprimés qu'en cas de besoin et restent consultables.

  • De nouveaux époques de contexte améliorent la mémorisation sans raccourcir définitivement les chats.

  • Utilise la récupération au lieu de la synthèse pour une meilleure précision.

Accès à distance et LAN (aperçu)

Accédez à Unsloth depuis d'autres appareils sur votre réseau.

  • Nouveaux paramètres d'accès à distance.

  • Contrôle LAN, codes QR et options de démarrage automatique.

  • Désactivé par défaut pour des raisons de sécurité.

Améliorations du chat

  • Chats longs plus rapides et meilleur fil de discussion.

  • Les projets organisent les chats, les fichiers et les espaces de travail.

  • Ajout de la mise en file d'attente des prompts, de raccourcis, edit_fileet d'une meilleure prise en charge des outils.

Matériel, inférence, API

  • Prise en charge des compilations personnalisées de llama.cpp et d'Intel XPU.

  • Plus de contrôles d'inférence (cache, mmap, mlock, points de contrôle, décodage spéculatif, vision).

  • Validation GPU, gestion de la VRAM et compatibilité améliorées.

  • Sorties structurées dans l'API Responses.

  • Meilleure récupération de llama-server.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

Télécharger Unsloth Desktop

Qwen3.8

Qwen3.8-27B et Qwen3.8-2.4T peuvent désormais être exécutés localement dans Unsloth !

Fonctionne sur 17 Go de RAM via les GGUF dynamiques Unsloth. Vous pouvez aussi ajuster finement Qwen3.8-27B dans Unsloth. Qwen3.8-27B est de loin le modèle le plus puissant pour sa taille. Nous avons aussi mis en ligne des quantifications NVFP4.

Guide d'exécution de Qwen3.8Ajuster finement Muse Glimmer

Autres mises à jour d'Unsloth incluent :

  • Qwen3.8-27B + arguments supplémentaires de llama-server autorisés + bascule VRAM personnalisée

  • Le fournisseur externe prend en charge l'appel d'outils + le support d'outils + la connexion avec Codex

  • Inférence MiniMax-H3 en FP8 rapide 10x plus rapide (3 minutes contre 30)

  • Inférence sur GGUF 10 % plus rapide + contournement des permissions corrigé

  • Connecté fournisseurs d'API peuvent utiliser leur propre Search ou la Search intégrée et les outils d'Unsloth Desktop. Les résultats des outils sont renvoyés au modèle afin qu'il puisse poursuivre des tâches en plusieurs étapes.

  • Connectez-vous avec un abonnement Codex et utilisez les outils Codex dans Chat.

Pour exécuter ou entraîner Qwen3.8, vous pouvez télécharger Unsloth Desktop :

Télécharger Unsloth Desktop

Présentation d'Unsloth Desktop

Présentation d'Unsloth Desktop 🦥 - la première application de bureau à exécuter et entraîner des modèles localement. Open source. Fonctionne sur Mac, Windows et Linux

• Prend en charge MLX, diffusion image/vidéo, audio, GGUF • Connecte Claude Code et Codex aux LLM locaux • Appels d'outils 50 % plus précis, auto-réparateurs + exécution de code en bac à sable • Fonctionne pour les configurations CPU + multiGPU - NVIDIA, AMD, Intel, Mac • Entraînez des modèles 2× plus vite avec 70 % de VRAM en moins • Recherche web privée, deep research, RAG, MCP + exports (NVFP4, GGUF) • Utilisez l'API compatible OpenAI d'Unsloth et les modèles cloud • Déployez en toute sécurité des LLM à distance et accédez-y partout

Vous pouvez télécharger Unsloth Desktop dès maintenant :

Télécharger Unsloth Desktop

Meta Muse Glimmer est là !

Meta a publié Muse Glimmer, le premier modèle ouvert de Meta Superintelligence Labs. Muse Glimmer est un modèle dense de 30B paramètres de Meta, conçu pour des workflows locaux d'agents et de codage. Publié sous licence Apache 2.0, vous pouvez exécuter Muse Glimmer 30B via Unsloth et les quantifications dynamiques Unsloth pour de meilleures performances.

Exécuter Muse GlimmerAjuster finement Muse Glimmer

Muse Glimmer 30B peut s'exécuter localement sur 20 Go de RAM/VRAM des configurations, y compris Mac et GPU. Vous pouvez aussi entraîner et ajuster finement Muse Glimmer 30B avec Unsloth sur 20 Go de VRAM.

Vous pouvez exécuter et ajuster finement Muse Glimmer via l'application Unsloth Desktop :

Télécharger Unsloth Desktop

Kimi K3 + Deep Research + Chat parallèle

Bonjour à tous ! Kimi K3 peut désormais s'exécuter localement avec les GGUF dynamiques Unsloth, Unsloth peut faire générer plusieurs chats en parallèle, et le nouveau mode Deep Research planifie, lit et cite des sources à l'aide de votre modèle local.

Cette version apporte aussi une meilleure AMD et prise en charge des GPU Intel, l'entraînement DoRA, ainsi que de nombreux correctifs pour l'installateur, MLX, l'export et l'inférence.

Kimi K3

de Moonshot AI Kimi K3 est un modèle MoE de 2,8T de paramètres avec 104B de paramètres actifs, la prise en charge native de la vision et une fenêtre de contexte de 1M. Kimi K3 est uniquement orienté réflexion, et Unsloth prend en charge les efforts de raisonnement faible, élevé et maximal.

Vous pouvez exécuter nos GGUF dynamiques Kimi K3 via Unsloth. Unsloth détecte automatiquement les configurations multi-GPU et peut décharger les couches du modèle vers la mémoire système.

Kimi K3 est un modèle très volumineux, donc planifiez votre matériel en conséquence :

  • UD-IQ1_S occupe 595 Go d'espace disque.

  • UD-Q4_K_XL occupe 1,51 To d'espace disque.

  • Pour une inférence sans perte, utilisez UD-Q8_K_XL, qui occupe 1,56 To d'espace disque.

Lisez notre guide complet sur Kimi K3 et apprenez-en davantage sur les GGUF dynamiques Unsloth 2.0.

Chat parallèle

Unsloth peut désormais exécuter plusieurs conversations à la fois. Démarrer un Nouveau chat laisse la réponse précédente continuer à se générer, et chaque conversation active obtient son propre indicateur de progression et son contrôle Stop.

  • 4 emplacements llama-server par défaut, ajustables dans l'interface web.

  • Les outils, les fichiers téléversés, l'auto-réparation et les agents restent isolés d'un chat à l'autre.

  • Arrêtez un chat sans interrompre les autres ni redémarrer le serveur.

  • Unsloth réduit le nombre d'emplacements lorsque la mémoire est limitée.

  • Le rechargement du modèle arrête toujours les chats actifs après confirmation.

Deep Research

Deep Research transforme un modèle local en flux de travail de recherche complet. Donnez-lui une question et il créera un plan, cherchera sur le web, organisera les preuves et produira un rapport cité.

  • Relisez et modifiez le plan avant le début de la recherche.

  • Suivez sa progression et les sources collectées pendant son travail.

  • Reprenez ou annulez sans perdre la recherche déjà effectuée.

  • Autorisez ou bloquez des sites web pour contrôler la sélection des sources.

  • Les sources et les citations restent enregistrées avec chaque exécution.

  • Avant d'écrire, Unsloth vérifie les affirmations non prises en charge, les contradictions et les lacunes non résolues. Les recommandations sans preuve directe sont marquées comme des inférences testables.

Une seule exécution peut être active par chat. Deep Research fonctionne actuellement avec les modèles locaux. Un ancrage optionnel en page complète peut lire les meilleurs résultats de recherche dans un RAG temporaire avant la synthèse ; activez-le avec UNSLOTH_RESEARCH_AUTO_SCRAPE=1. Il reste désactivé par défaut car il ajoute du temps de scraping et nécessite du contexte supplémentaire.

Prise en charge AMD améliorée

Cette mise à jour s'appuie sur notre version AMD et guide de configuration initiaux avec le support de davantage de GPU et une inférence et un entraînement ROCm plus fiables.

  • Détection améliorée pour les GPU RDNA2, Radeon, Ryzen, Strix Halo et workstation.

  • Les MI50 et Radeon VII prennent en charge le LoRA 16 bits et l'ajustement complet sur Linux.

  • NaN 4 bits, conflits de bibliothèques et longs blocages au démarrage RDNA corrigés.

  • Les GPU HIP Windows non pris en charge peuvent se replier sur Vulkan.

  • Les périphériques Vulkan affichent leurs vrais noms et peuvent être sélectionnés individuellement.

  • Les installations Windows propres ne nécessitent plus Winget ni les outils de développement.

Mises à jour de l'entraînement, des modèles et de la plateforme

  • Intel XPU permet le chat local et l'entraînement sur les GPU Intel Arc et Data Center.

  • DoRA est disponible aux côtés de LoRA et de l'ajustement complet.

  • Les grands exports peuvent utiliser tous les GPU visibles pour éviter les limites de mémoire du GPU 0.

  • MLX ajoute les ensembles de données en streaming, le pré-entraînement continu, les callbacks et une meilleure prise en charge des VLM et de LoRA.

  • Correction de flash_attention_2 sortie du modèle.

  • Unsloth et les utilitaires de sauvegarde fonctionnent désormais sans bitsandbytes.

  • Correction de .json les ensembles de données et la configuration des notebooks Qwen3.5/3.6 MoE et GRPO.

  • Les dossiers de téléchargement du Hub sont plus faciles à trouver et à ouvrir.

  • Les notes de version sont disponibles dans la fenêtre contextuelle de mise à jour d'Unsloth.

  • unsloth start --as-subagent permet à Codex, Claude Code et Pi de déléguer des tâches à un modèle local Unsloth.

La prise en charge AMD est là !

Bonjour à tous ! Cette version apporte l'entraînement et l'inférence de LLM locaux sur GPU AMD sur Windows, WSL et Linux.

Démarrage rapideFonctionnalitésGitHub

À partir d'aujourd'hui, notre collaboration AMD, les noyaux Triton personnalisés et les algorithmes mathématiques vous permettent d'entraîner et d'exécuter plus de 500 modèles sur les GPU Radeon, Instinct, Vulkan, Ryzen et data center d'AMD, jusqu'à 2× plus rapidement avec 70 % de VRAM en moins et sans perte de précision. Les compilations ROCm optimisées prennent également en charge l'inférence GGUF et Safetensors.

Mise à jour du 23 juillet

  1. Ajouté Prise en charge de RDNA2, Gorgon Halo, Vulkan + correction du fait que l'installation AMD ne détectait pas les GPU sur Strix Halo / autres GPU AMD

  2. Meilleure correction automatique et meilleure capture des échecs RDNA4, HIP / ROCm

  3. Mémoire unifiée 2x plus rapide Chargement AMD safetensors + checkpointing des gradients beaucoup plus rapide pour les périphériques à mémoire unifiée

  4. Ajouté dictée vocale / whisper.cpp prise en charge préliminaire de la synthèse vocale rapide

  5. Correction d'environnements de retour en arrière lors des installations qui consommaient 5 Go d'espace disque - nettoyage automatique maintenant

Entraîner des LLM localement sur AMD

  • Entraînez, exécutez du RL, discutez avec les modèles et déployez-les localement sur les GPU AMD.

  • Détection et installation plus fiables des GPU AMD sur Windows, WSL et Linux.

  • Compatibilité ROCm améliorée pour les GPU AMD MI300X et MI325X.

  • Accédez à Unsloth à distance via unsloth studio --secure via HTTPS gratuit grâce à Cloudflare

Exécuter des modèles plus grands sur votre matériel

  • Utilisez le placement automatique des GPU ou choisissez exactement quels GPU et quelles couches du modèle utiliser.

  • Déplacez les couches d'experts MoE dans la mémoire système pour aider les modèles plus grands à tenir.

  • Répartissez les modèles sur plusieurs GPU ou utilisez le parallélisme tensoriel.

  • Enregistrez séparément les paramètres matériels pour chaque modèle et quantification.

Redémarrages de chat plus rapides et téléchargements plus fiables

  • Reprenez de longues conversations sans reconstruire toute la conversation après qu'un modèle inactif a libéré sa VRAM.

  • Les téléchargements Hugging Face XET bloqués réessaient automatiquement via HTTP standard.

  • Les fichiers GGUF existants sont réutilisés au lieu d'être retéléchargés chaque fois qu'un modèle se charge.

Meilleure recherche, meilleurs outils et meilleurs agents

  • La recherche web peut désormais lire des articles PDF, des manuels et d'autres résultats PDF.

  • Les appels d'outils parallèles, la sortie de raisonnement et les nouvelles tentatives d'outils fonctionnent plus fiablement.

  • Un nouveau point de terminaison MCP facultatif permet aux clients IA compatibles d'inspecter les modèles et l'historique d'entraînement, de démarrer ou d'arrêter l'entraînement, de charger des points de contrôle, de valider des recettes et d'exporter des GGUF.

    • Activez-le avec UNSLOTH_STUDIO_ENABLE_MCP=1 et définissez le jeton bearer requis avec UNSLOTH_STUDIO_MCP_TOKEN.

Correctifs d'entraînement et d'export

  • L'entraînement texte seul avec des modèles multimodaux ne tronque plus les longs exemples avant le packing.

  • Les modèles Qwen3.5 et Qwen3.6 MTP ajustés finement s'exportent désormais correctement vers GGUF.

  • Correction d'une erreur d'autorisation Windows qui pouvait arrêter les exports GGUF lors de la dernière étape d'écriture.

Au cas où vous l'auriez manqué

Notre version précédente de Studio a ajouté les modèles Dynamic NVFP4, une personnalisation plus poussée, sept nouvelles langues d'affichage, des agents plus sûrs et l'accélération GPU Vulkan.

Dynamic NVFP4 :

Unsloth Dynamic NVFP4 conserve les couches sensibles à la précision en FP8 ou BF16 tout en exécutant le reste en W4A4. Sur les GPU NVIDIA Blackwell, cela permet une inférence jusqu'à 2,5x plus rapide, tandis que les caches KV FP8 calibrés offrent jusqu'à 2x plus de contexte.

Lisez le guide Dynamic NVFP4 et découvrez notre collection NVFP4élargie, incluant Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

Personnalisez votre Studio :

Choisissez entre les palettes de couleurs Standard, Classic et Minimal, chacune avec des modes clair et sombre. Vous pouvez aussi personnaliser les couleurs, importer des polices et ajuster la taille de police, le contraste, la réduction des mouvements et plus encore.

Unsloth inclut également un onglet de paramètres vocaux pour la dictée, les paramètres de dictionnaire personnalisé et la lecture à voix haute.

Nouvelles langues :

Unsloth Studio est désormais disponible en français, allemand, espagnol, hindi, arabe, russe et coréen, en plus du chinois (simplifié), du japonais et du portugais (Brésil). La détection automatique de la langue du navigateur est désormais la valeur par défaut.

Agents plus sûrs :

Un sélecteur d'autorisation d'appels d'outils à quatre niveaux-Demander, Approuver pour moi, Désactivé et Accès complet- offre un contrôle plus fin sur les agents. L'isolation des espaces de travail des agents et des vérifications d'installation plus sûres réduisent également le risque de modifications involontaires.

Personnalisation, NVFP4, langues

Salut les gars, nous avons beaucoup de nouvelles mises à jour pour Unsloth, surtout en matière de personnalisation. Unsloth est désormais à personnaliser selon vos envies : trois palettes de couleurs plus des couleurs et polices personnalisées, sept nouvelles langues d'affichage, et un nouvel onglet de paramètres vocaux pour la dictée et la lecture à voix haute. Les agents deviennent plus sûrs avec un sélecteur d'autorisation d'appels d'outils à quatre niveaux (Demander, Approuver pour moi, Désactivé, Accès complet) et l'isolation des espaces de travail, et les GPU Intel bénéficient enfin d'une inférence accélérée par GPU grâce au nouveau Vulkan llama.cpp support.

Nous avons aussi ajouté la prise en charge native de Inkling, un modèle ouvert de 975B de paramètres avec 41B de paramètres actifs et une fenêtre de contexte allant jusqu'à 1M jetons. Sous licence Apache 2.0, il accepte du texte, des images et de l'audio, et génère du texte.

Dynamic NVFP4

Nous avons élargi notre collection NVFP4 avec des versions quantifiées de Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash et Gemma 4.

Lisez le guide Dynamic NVFP4 pour plus de détails.

Personnalisez votre Unsloth

Unsloth n'est plus limité aux modes clair et sombre :

  • Choisissez parmi Standard, Classicet Minimal palettes, chacune avec des variantes claires et sombres.

  • Personnalisez les couleurs d'accent, d'arrière-plan et de premier plan.

  • Importez vos propres polices pour l'interface, les titres, le chat et le code.

  • Ajustez la taille de police, le contraste, les mouvements, le comportement du curseur et le lissage des polices.

  • Recherchez les paramètres et synchronisez les préférences sur tous les appareils.

Les modes clair et sombre conservent leurs propres valeurs de personnalisation.

Sept nouvelles langues

Unsloth prend désormais en charge le français, l'allemand, l'espagnol, l'hindi, l'arabe, le russe et le coréen, en plus du chinois, du japonais et du portugais. La détection automatique de la langue du navigateur est désormais la valeur par défaut.

Paramètres vocaux

Un nouvel onglet Voix ajoute des contrôles pour la dictée, les dictionnaires de prononciation et la lecture à voix haute. La prise en charge de la reconnaissance vocale et de la synthèse vocale arrive bientôt ; les conversations vocales complètes sont encore en développement.

Agents et appels d'outils plus sûrs

L'ancien bouton de contournement est désormais un sélecteur d'autorisation à quatre niveaux :

  • Demander : approuver chaque appel d'outil.

  • Approuver pour moi : exécuter automatiquement les actions en lecture seule et faire une pause pour les actions potentiellement dangereuses.

  • Désactivé : désactiver les appels d'outils.

  • Accès complet : autoriser tous les appels et désactiver le bac à sable.

Ces contrôles couvrent les outils terminal, Python, recherche web, RAG et MCP. Les agents gagnent aussi des espaces de travail isolés, des sessions reprenables avec --persist, des avertissements plus sûrs pour l'installateur distant, un streaming en direct de la sortie des outils, et une meilleure extraction web.

Vulkan et llama.cpp

Le nouveau Vulkan llama.cpp Le backend donne aux GPU Intel une inférence accélérée par GPU au lieu de retomber sur le CPU. Il prend en charge la gestion existante de la VRAM, le dimensionnement automatique du contexte, la sélection multi-GPU et le déchargement des couches.

Les utilisateurs AMD peuvent l’activer avec :

UNSLOTH_FORCE_VULKAN=1

Nous avons également amélioré la fiabilité des mises à jour, la récupération de l’état du modèle et l’interruption des générations bloquées.

Modèles et entraînement

Cette version inclut également :

  • Prise en charge native d’Inkling et améliorations multi-GPU B200.

  • Attention anticipée DeepSeek-V4 et experts groupés FP8 entraînables.

  • Entraînement fiable en mode completion-only grâce à la détection automatique des marqueurs de template de chat.

  • Gestion correcte de la désactivation du gradient checkpointing.

  • Amélioration de la mise à l’échelle RoPE et de l’extension du contexte.

  • Arrêt forcé des exécutions d’entraînement bloquées.

  • Routage automatique pour les nouvelles architectures de modèles et les versions plus récentes de Transformers.

DeepSeek-V4 + NVFP4

Unsloth peut désormais exporter des GGUF NVFP4, FP8 et imatrix après l’entraînement ; servir de système API llama-swap ; ajouter la prise en charge du japonais et du portugais brésilien ; et inclut MLX, safetensors, l’appel d’outils, la prise en charge de healing, et plus encore. Unsloth core rend GRPO 1,3x plus rapide, ajoute un repli HTTP pour les téléchargements bloqués, améliore le mode hors ligne, accélère l’entraînement MoE de 3 à 5x, et corrige de nombreux bugs. Cette série de versions utilise unsloth>=2026.7.1.

DeepSeek-V4-Flash est désormais pris en charge avec des bascules Thinking et nos améliorations de correction du template de chat.

Service d’API compatible OpenAI plus intelligent

Exécutez un seul point de terminaison API local avec un échange de modèle plus sûr et une meilleure récupération outil-agent.

  • Les requêtes API peuvent choisir le basculement automatique entre les GGUF locaux téléchargés, tandis que les noms de modèles inconnus continuent en toute sécurité d’utiliser le modèle actuel.

  • /v1/models renvoie désormais des ID de modèles propres et le catalogue GGUF local au lieu des chemins .gguf locaux.

  • Le déchargement automatique en veille peut libérer de la VRAM après une période d’inactivité, et le healing des appels d’outils peut désormais être नियंत्रlé par requête.

Améliorations des exports

Les exports sont plus flexibles et évitent les téléchargements inutiles.

  • Sélectionnez plusieurs formats d’export à la fois, y compris FP8/INT8 portable, GGUF LoRA, les exports correspondant à la source, imatrix GGUF et les FP8/FP4 compressés.

  • Les exports multi-checkpoint évitent davantage de téléchargements répétés du modèle de base.

  • Les exports FP8, INT8 et GGUF-LoRA respectent désormais trust_remote_codeet l’export GGUF gère plus fiablement les paramètres de quantification manquants.

RAG et chat avec des fichiers

Le chat avec des fichiers est plus utile sur de vrais documents.

  • Les pièces jointes RAG peuvent désormais utiliser le contexte de tout le document, avec des modèles d’embedding personnalisables et la recherche Hugging Face.

  • Le chat avec des fichiers lit correctement davantage de PDF et de documents Word, y compris le texte de droite à gauche, les textes indiens et les tableaux DOCX.

  • Les vérifications RAG locales sont plus fiables derrière des configurations proxy.

Peaufinage et fiabilité d’Unsloth

L’utilisation quotidienne devrait sembler plus fluide et plus stable.

  • Les longues exécutions d’entraînement et de chat ont moins de chances de se figer silencieusement.

  • Le mode Comparer, le changement de modèle, l’annulation de modèle, la navigation Hub et Hub Discover sont plus fiables.

  • Les exports de projet, les exports de chat, les paramètres, les visites guidées, les boîtes de dialogue de fichiers, les écrans de mise à jour et l’UI de raisonnement sont plus propres et plus cohérents.

Correctifs de l’installeur, du matériel et de la plateforme

Unsloth s’installe et s’exécute plus fiablement sur toutes les plateformes.

  • Les installations macOS ne nécessitent plus CMake ou Homebrew lorsqu’un binaire précompilé llama.cpp est disponible, et la prise en charge d’Apple Silicon gère mieux les chemins avec des espaces et le dimensionnement de la mémoire unifiée.

  • Le démarrage sous Windows, la gestion UTF-8, l’embedding RAG ROCm et la prise en charge GPU de ROCm sous WSL ont été améliorés.

  • La sélection des binaires précompilés pour les GPU Blackwell, les vérifications d’adéquation GGUF, le parallélisme de tenseurs pour les GGUF vision/mmproj et la réutilisation locale llama.cpp sont désormais plus fiables.

Entraînement, modèles et kernels

L’entraînement et le chargement des modèles sont plus fiables dans davantage de configurations.

  • GRPO prend désormais en charge le packing de séquences par défaut, évite les prompts partagés répétés et gère correctement la mise à l’échelle des logits en DDP.

  • Le fine-tuning complet, les paramètres de précision RL, le gradient checkpointing, les tampons RoPE DDP et la détection LoRA MoE ont été corrigés.

  • La quantification/déquantification FP8, la mise à l’échelle RoPE de Llama 3 avec Transformers v5, les rechargements LoRA de PEFT 0.19, et fast_generate les messages d’erreur ont été améliorés.

GLM 5.2 + Hub + contextes 3x plus longs

GLM-5.2 est désormais pris en charge dans Unsloth Studio ! Tous les niveaux de raisonnement sont pris en charge. Des longueurs de contexte 3x plus longues sont désormais possibles grâce à notre nouvel algorithme d’ajustement automatique avec MTP, permettant des chats plus longs. Mode de contournement des permissions, chats bifurcables, chats mis en file d’attente, nouveau hub pour la découverte de modèles, modules parallèles + prise en charge HTTPS Cloudflare et plus encore ! Utilisez unsloth studio --secure pour un accès global HTTPS sécurisé !

Meilleur algorithme de longueur de contexte

Selon PR 1 et PR 2, nous avons considérablement amélioré la détermination par Unsloth Studio de l’utilisation mémoire et de la longueur du contexte, obtenant au total des contextes 3x plus longs :

Scénario
KV
avant
après

pipeline 1x 32 Go (~31 Go libres)

f16

23,040

64,000

q8_0

43,520

114,944

q4_0

82,432

199,680

pipeline 2x 32 Go

n’importe lequel

262,144

262,144

tensor 2x 24 Go (~23 Go libres)

f16

134,049

262,144

q8_0

252,329

262,144

Canvas de chat, bifurcation et mise en file d’attente

  • Modifiez les messages de l’assistant sur place et relancez depuis n’importe quel point du fil.

  • Bifurquez un fil pour créer une branche de conversation sans perdre l’original.

  • Chats temporaires (incognito) qui ne laissent aucune trace.

  • Mettez de nouveaux prompts en file d’attente pendant qu’une génération est encore en cours au lieu d’attendre.

  • Les « artefacts » de chat sont désormais canvas, avec cartes HTML canvas intégrées qui se rendent automatiquement, une vue Code, et DiffusionGemma conserve son code brut visible en ligne au lieu d’être replié.

  • La recherche dans le chat couvre désormais chaque message et affiche d’abord vos propres messages.

Hub (repensé)

  • Hub plein écran avec un fil tendance, une recherche et la prise en charge de chemins de modèles personnalisés.

  • Aperçu README dans un flux à vue partagée afin que vous puissiez lire avant de télécharger.

  • Les téléchargements utilisent par défaut le transport plus rapide Xet avec repli HTTP automatique si un transfert se bloque.

  • Nouveau bouton « Charger à la sélection » pour définir les options de chargement avant qu’un modèle ne se charge.

  • Logo Google affiché pour DiffusionGemma et les futurs dérivés de Gemma.

Modèles et inférence

  • DeepSeek-OCR et d’autres modèles vision se chargent et s’exécutent désormais sans erreur.

  • L’inférence rapide a été corrigée sur la dernière version de vLLM (0.22+) afin que les accélérations fonctionnent à nouveau.

  • Le parallélisme de tenseurs est plus fiable : si le chemin MTP plus rapide échoue, il se rétablit désormais tout seul au lieu de planter.

  • DiffusionGemma affiche désormais l’image en formation en direct pendant le débruitage, avec des statistiques de vitesse précises.

Sécurité et studios chiffrés Cloudflare

  • Nouveau --secure mode Cloudflare uniquement pour des studios chiffrés de bout en bout, avec les outils côté serveur restant activés sous --secure. Utilisez unsloth studio --secure!

  • le mode Bypass Permissions pour ignorer les confirmations et désactiver le sandbox d’outils quand vous le souhaitez.

  • Détection automatique de l’analyse antivirus Hugging Face + des fichiers dangereux dans les dépôts.

Journalisation et API

  • Nouveau Moniteur du serveur API dans Unsloth.

  • Appels API plus rapides et latence réduite

  • Journaux beaucoup mieux rationalisés - désormais avec débit et latence, et suppression d’une grande partie des journaux superflus.

Matériel et backend

  • Meilleure prise en charge des GPU Blackwell RTX 50X et 60X

  • Correction du basculement silencieux vers le CPU au lieu du GPU

  • La version de torchao est désormais sélectionnée à partir de torch installé.

  • L’installeur répare désormais automatiquement une installation PyTorch cassée ou CPU-only et avertit en cas de repli silencieux sur le CPU, sur NVIDIA + AMD sous Win/Linux/Mac/WSL.

  • Libère la VRAM du modèle de chat lorsque l’entraînement commence, mais uniquement lorsque le GPU est réellement à court d’espace (sinon aucun rechargement inutile).

  • Si llama-server plante brutalement au démarrage, Unsloth suit désormais une séquence de récupération au lieu d’échouer simplement.

Correctifs entraînement & généraux & modules parallèles

  • Mises à jour de l’entraînement MLX.

  • Fiabilité améliorée de l’entraînement GRPO avec vLLM.

  • Le démarrage de l’entraînement est rendu plus fiable, avec des erreurs plus claires pour les lots VLM invalides.

  • Unsloth nettoie désormais plus fiablement les processus backend restants après des plantages, des redémarrages ou des arrêts interrompus.

  • Export, chat, entraînement et recettes sont tous individualisés / compartimentés ! Cela signifie que vous pouvez faire les 4 en parallèle maintenant ! Vous pouvez chatter / faire de l’inférence pendant que vous attendez une exécution d’entraînement ou un export !

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows :

irm https://unsloth.ai/install.ps1 | iex

DiffusionGemma + Gemma 4 MTP

Assurez-vous d’installer la dernière v0.1.464-beta ou 2026.6.7. DiffusionGemma, Gemma 4 MTP et MiniMax-M3 sont désormais tous pris en charge.

  • Exécutez et entraînez DiffusionGemma via Unsloth Studio.

  • Gemma 4 MTP est arrivé ! Exécutez Gemma 4 environ 2x plus vite avec MTP.

  • Le chat audio est désormais pris en charge pour Gemma 4 (wav, mp3, m4a, flac, webm).

  • Conserver Think a été ajouté à Gemma 4.

Hub + gestionnaire de téléchargements (expérimental)

  • Ajout d’une nouvelle page Hub pour parcourir, télécharger et gérer les modèles et ensembles de données Hugging Face.

  • Unsloth peut désormais détecter les modèles et ensembles de données déjà présents sur votre machine et les afficher à côté des éléments téléchargés.

  • Téléchargé modèles GGUF ont désormais des actions directes Exécuter / Nouveau chat .

RAG / Chat avec des fichiers (expérimental)

  • Ajouté Chat avec des fichiers dans Unsloth, vous permettant de poser des questions sur vos propres documents et bases de connaissances.

  • Prend en charge la recherche hybride, les citations, les aperçus PDF, les documents par fil et un outil intégré search_knowledge_base .

Nouveau bouton de mise à jour + prise en charge matérielle

  • Unsloth utilise désormais constamment les précompilés llama.cpp à jour les plus récents sur CUDA, ROCm, Windows, Linux et macOS.

  • Ajout d’un Mettre à jour llama.cpp bouton dans l’application pour que les utilisateurs puissent mettre à jour le backend local sans réinstaller Unsloth.

  • Prise en charge AMD améliorée sous Windows / WSL, prise en charge ROCm Strix Halo, sélection CUDA Blackwellet messages d’installeur plus clairs.

Chat local, outils et compatibilité API

Entraînement et correctifs

  • compatible OpenAI Prise en charge MLX avec de meilleures étiquettes de modèles, des statistiques de vitesse de génération et des correctifs pour l’entraînement VLM.

  • Plusieurs cas limites et de jeu de données ont été corrigés, y compris les caches Hugging Face non inscriptibles et les mappages de jeu de données personnalisés.

  • De nombreux correctifs de finition UI ont été ajoutés dans le chat, les menus, le sélecteur de modèle, le mode sombre, l’import/export et les paramètres.

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows :

irm https://unsloth.ai/install.ps1 | iex

Gemma 4 12B, nouvelle UI, MCP, projets

Cette mise à jour se concentre principalement sur Gemma 4 12B, MCP, Projets, Canvas, CUDA 13.3 et la nouvelle UI de chat. La semaine prochaine, nous aurons une mise à jour encore plus importante.

Gemma 4 12B

Google publie Gemma 4 12B, un nouveau modèle qui s’exécute localement sur 8 Go de RAM. GGUF / Guide

Gemma 4 12B Unified prend en charge l’image, l’audio et un contexte 256K. Exécutez et entraînez le modèle via Unsloth Studio.

MCP

  • Prise en charge MCP du serveur distant, y compris les en-têtes personnalisés et OAuth

  • basé sur des commandes local MCP prise en charge du serveur

  • MCP peut désormais être activée depuis le compositeur de chat

  • Préréglages intégrés pour les MCP serveurs

Nouvelle UI de chat

  • Projets, Canvas, MCP, les contrôles RAG et Compare vivent désormais dans le menu plus

  • Les contrôles de recherche et de code sont plus faciles d’accès depuis le compositeur

  • Les menus, superpositions, icônes et contrôles cliquables sont plus cohérents dans tout Unsloth

Projets

  • Organisez les chats liés dans des espaces de projet dédiés

  • Déplacez les chats existants vers des projets

  • Créez et gérez des projets directement depuis la barre latérale

Canvas / artefacts expérimentaux

  • Ouvre le HTML généré dans un panneau canvas dédié à l’intérieur d’Unsloth Studio

  • Prend en charge les sorties interactives, y compris les visualisations basées sur le navigateur et les paquets chargés depuis un CDN

  • Permet de basculer entre l’aperçu rendu et le code source

Installation, runtime et matériel

  • Les installations précompilées Windows ne nécessitent plus le CUDA Toolkit contrôle

  • Linux llama.cpp les précompilés correspondent désormais au runtime détecté cudart principal

  • ROCm la détection gfx est transmise à la sélection des précompilés

  • Blackwell, B300 et ARM64 Mises à jour de la prise en charge Linux

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows :

irm https://unsloth.ai/install.ps1 | iex

CUDA 13.3, Windows, Mac

Pour mettre à jour Unsloth ou installer un nouvel Unsloth Studio, vous devez utiliser :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows :

irm https://unsloth.ai/install.ps1 | iex

Mises à jour Mac

  • Réactivé llama.cpp les binaires précompilés pour Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)

  • Mac OS 13 (Ventura) sur Apple Silicon utilise une compilation à partir des sources

  • Intel (x86_64) pour Mac OS 13.3 / 14 / 15 / 26 (Tahoe) utilise llama.cpp des binaires précompilés

  • Intel pour Max 13.0 - 13.2 utilise une compilation à partir des sources

Mises à jour Windows

  • CUDA 13.3 llama.cpp les binaires précompilés fonctionnent désormais pour Windows

  • Pour CUDA 13.2, CUDA 13.1 et versions antérieures, les appareils Windows utilisent le repli CUDA 12.4 - nous travaillerons bientôt sur des binaires CUDA 13.1.

Mise à jour CUDA 13.3

  • Les binaires non Linux CUDA 13.3 fonctionnent. Nous utiliserons encore CUDA 13.1 pour le moment

  • CUDA 13.3 résout le problème de charabia de CUDA 13.2 - voir https://github.com/unslothai/unsloth/issues/4849

Mise à jour des GPU Blackwell

  • Pour le moment, Blackwell aura des sorties retardées de llama.cpp binaires précompilés puisque CUDA 12.4 ne fonctionne pas - nous travaillons à résoudre cela bientôt.

Une mise à jour avant la refonte.

Salut tout le monde, nous faisons une dernière mise à jour avant une refonte majeure qui devrait arriver cette semaine ou la suivante. Notre refonte changera beaucoup de choses, surtout avec de nouvelles fonctionnalités majeures et beaucoup de changements de design.

  • NOUVEAU : prise en charge des appels API désormais avec génération + édition d’images, recherche web correcte, exécution de code, mise en cache automatique des prompts. Connectez OpenAI, Anthropic et plus encore.

  • Prise en charge correcte des langues non anglaises p. ex. japonais, chinois, indien, etc.

Beaucoup d’entre vous ont peut-être manqué notre version précédente qui n’a duré qu’une journée. Nous avons introduit :

  • Connectez-vous à des backends d’inférence externes : vLLM, Ollama, llama-server

  • Améliorations de sécurité

  • Décodage spéculatif Auto MTP pour les GGUF MTP ; obtenez les meilleurs paramètres adaptés à votre matériel.

Appels aux fournisseurs d’API et connexions externes

  • Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)

  • Recherche web intégrée pour OpenAI, Anthropic, OpenRouter et Kimi

  • Exécution de code intégrée pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)

  • La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.

  • Génération + édition d’images

  • La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)

  • Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

Autres mises à jour d’Unsloth Studio

  • Pièces jointes OpenDocument pour le chat

  • charge utile du résumé de raisonnement o3

  • L’envoi / le prompting dans des langues non anglaises (p. ex. japonais, chinois) fonctionne désormais correctement

  • Durcissement du compositeur IME, RTL dir="auto"correction du tronquage des longues lignes de journal

  • Rendu de la trace de raisonnement de l’outil dans l’interface

  • Prise en charge entièrement hors ligne : découverte GGUF mise en cache et autodétection DNS hors ligne pour l’inférence et l’entraînement

Améliorations de sécurité d’Unsloth Studio

  • Limitation du débit d’authentification, compatible avec les proxys afin que les reverse proxies ne puissent pas la contourner

  • Worker sandboxé avec une liste de blocage renforcée (bash, envoi hf, NOFILE)

  • Contenance du chemin afin que les workers ne puissent pas s’échapper de leurs répertoires tmp en cours d’utilisation

  • Validation stricte du schéma sur toute l’API Unsloth

  • CSP / en-têtes de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)

  • Supprimé le torch.load repli sur training_args.bin afin que des pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèle

  • Flux de publication desktop Tauri renforcé

  • Auth frontend : rafraîchissement de jeton singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, helper 422 partagé

  • Le nettoyage d’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin qu’il ne puisse jamais supprimer l’état utilisateur

Corrections MTP + Unsloth

Beaucoup de corrections de bugs, de corrections UI/UX pour Unsloth ! Pour obtenir les dernières mises à jour, faites :

macOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows :

irm https://unsloth.ai/install.ps1 | iex

Corrections

  1. Corriger mise à jour d’unsloth studio ne fonctionne pas bien

  2. Correction d’un blocage sur reset-password page

  3. Plus de prise en charge du mode hors ligne

  4. Amélioration du fait que MTP n’était pas plus rapide sur Mac, CPU et GPU - maintenant c’est bien mieux !

  5. Correction du raccourci Desktop qui ne fonctionnait pas après la mise à jour

  6. Très nombreuses corrections de bugs UI/UX

Qwen3.6 MTP + connexions API

Nous avons plein de nouvelles mises à jour pour Unsloth v0.1.41-beta:

  • inférence GGUF ~2x plus rapide avec activation automatique de MTP

  • prise en charge des appels API pour OpenAI, Anthropic etc. avec cache de prompt automatique, recherche web, exécution de code

  • Connectez-vous à des backends d’inférence externes : vLLM, Ollama, llama-server

  • Expérimental inférence MLX

  • Prise en charge correcte des langues non anglaises

  • Sécurité améliorations

Lancer les tutoriels Qwen3.6Guide MTP

Prise en charge du décodage spéculatif MTP : inférence 1,4 à 2x plus rapide !

  • Décodage spéculatif Auto MTP pour les GGUF MTP ; avertir lorsque le binaire précompilé llama.cpp fourni est obsolète ou trop ancien pour MTP

  • Nouveaux binaires llama.cpp précompilés pour la prise en charge de MTP !

Appels aux fournisseurs d’API et connexions externes

  • Vous pouvez désormais connecter Unsloth à n’importe quel fournisseur cloud API (OpenAI, Anthropic, OpenRouter, etc.)

  • Recherche web intégrée pour OpenAI, Anthropic, OpenRouter et Kimi

  • Exécution de code intégrée pour OpenAI et Anthropic (les conteneurs Anthropic persistent et sont réutilisés entre les tours)

  • La mise en cache des prompts est activée pour les modèles OpenAI et Anthropic, économisant 50 à 90 % des coûts.

  • La clé API est désormais facultative pour les fournisseurs locaux (llama.cpp / vLLM / Ollama)

  • Chargement automatique des modèles lors de l’ajout d’un fournisseur cloud

inférence MLX (expérimental)

  • Les quantifications et modèles MLX peuvent désormais s’exécuter localement sur vos machines Mac !

  • Nous ajouterons bientôt le raisonnement, les outils et la recherche web !

Autres mises à jour d’Unsloth Studio

  • L’envoi / le prompting dans des langues non anglaises (p. ex. japonais, chinois) fonctionne désormais correctement

  • Pièces jointes OpenDocument pour le chat

  • charge utile du résumé de raisonnement o3

  • Durcissement du compositeur IME, RTL dir="auto"correction du tronquage des longues lignes de journal

  • Rendu de la trace de raisonnement de l’outil dans l’interface

  • Prise en charge entièrement hors ligne : découverte GGUF mise en cache et autodétection DNS hors ligne pour l’inférence et l’entraînement

  • Beaucoup de peaufinage UI/UX : refonte du thème sombre, redesign de la barre latérale droite, mascotte paresseux selon l’heure de la journée, toasts supprimables et copiable, éditeur de chat plus grand, peaufinage de la configuration d’exécution de code, style des boutons d’action de l’éditeur, bouton Discord plus étroit

Mises à jour de l’entraînement

  • Corrections du masque d’attention Gemma

  • GRPO multi-image

  • Expériences de retour d’état caché GRPO

  • Nouvelle méthode d’entraînement Continued Pretraining (CPT) proposée comme option de premier rang

  • Extracteur LoRA Gemma-4 MoE enregistré pour corriger grouped_mm crash de contraction

  • Fusionné en option lm_head + propagation avant de l’entropie croisée, avec chemin mono-matmul sous UNSLOTH_RETURN_LOGITS=1

  • Passer la taille du lot pour l’évaluation

  • Les chemins d’évaluation / d’entraînement respectent désormais HF_DATASETS_OFFLINE avec HF_HUB_OFFLINE

Améliorations de sécurité d’Unsloth Studio

  • Limitation du débit d’authentification, compatible avec les proxys afin que les reverse proxies ne puissent pas la contourner

  • Worker sandboxé avec une liste de blocage renforcée (bash, envoi hf, NOFILE)

  • Contenance du chemin afin que les workers ne puissent pas s’échapper de leurs répertoires tmp en cours d’utilisation

  • Validation stricte du schéma sur toute l’API Unsloth

  • CSP / en-têtes de sécurité renforcés (seuls les hôtes de favicon légitimes sont autorisés)

  • Supprimé le torch.load repli sur training_args.bin afin que des pickles non fiables ne puissent jamais s’exécuter lors du chargement du modèle

  • Flux de publication desktop Tauri renforcé

  • Auth frontend : rafraîchissement de jeton singleflight, saisie du mot de passe actuel lors des changements, déconnexion fonctionnelle, helper 422 partagé

  • Le nettoyage d’annulation est désormais strictement limité aux répertoires tmp en cours d’utilisation afin qu’il ne puisse jamais supprimer l’état utilisateur

point de terminaison API Unsloth

correctif de bug v0.1.39-beta 5 mai 2026

Corrige le fait que l’historique du chat ne s’affiche pas (l’historique existant n’est pas perdu) et que les pièces jointes ne s’attachent pas correctement. Le bug ne concernait que le rendu - utilisez 2026.5.2 ou appelez directement curl -fsSL https://unsloth.ai/install.sh | sh pour mettre à jour

Vous pouvez utiliser des LLM locaux avec des outils comme Claude Code et Codex en les connectant au point de terminaison API d’Unsloth. Cela vous permet d’exécuter localement des modèles comme Qwen et Gemma , avec des fonctionnalités supplémentaires telles que l’appel d’outils auto-réparant, l’exécution de code et la recherche web.

Utiliser Unsloth comme point de terminaison d’inférence API est avantageux non seulement parce qu’il est facile à configurer et rapide, mais aussi parce qu’Unsloth fournit :

Nouveaux modèles

Nous avons aussi quelques nouveaux modèles à exécuter, notamment NVIDIA Nemotron 3 Nano Omni, IBM Granite 4.1 et Mistral 3.5 Medium. Nous avons aidé Mistral à résoudre certains problèmes d’implémentation dans transformers et les GGUFs.

Mises à jour d’Unsloth

  • Les exécutions d’entraînement Unsloth arrêtées peuvent désormais reprendre à partir des checkpoints.

  • Les fils de discussion se sauvegardent désormais automatiquement et persistent plus fiablement.

  • Les blocages de l’entraînement DPO dans les configurations multi-processus ont été corrigés.

  • La prise en charge de VLM GRPO a été améliorée avec les mises à jour MROPE.

  • Le bouton d’arrêt d’Unsloth arrête désormais correctement la génération.

  • Correction de la disparition du modèle de chat après un rafraîchissement du navigateur.

Toute nouvelle refonte de l’interface

Salut tout le monde, nous avons repensé toute l’interface et l’expérience UX d’Unsloth Studio afin de mettre l’accent sur le chat et l’entraînement :

  • Ajout d’une barre latérale repliable basé sur les retours de la communauté

  • Vous pouvez désormais supprimer des chats et rechercher dans les conversations passées

  • Nouveau bascule « Preserve Thinking » pour les modèles qui le prennent en charge comme Qwen3.6

  • Design plus propre, plus cohérent, avec une navigation plus facile

  • Page Paramètres enrichie avec des options pour changer votre photo de profil, votre nom, et plus encore

  • Plus besoin de saisir deux fois votre jeton Hugging Face

  • gpt-oss dispose désormais de bascules de réflexion faible, moyenne et élevée.

  • Utilise désormais le dernier binaire précompilé llama.cpp, même sur Linux CUDA

  • Beaucoup de corrections de bugs, de cohérence et de stabilité

  • Kimi-K2.6 peut désormais être exécuté !

  • Nous avons également ajouté une prise en charge expérimentale de l’API. Des guides, annonces, etc. arriveront la semaine prochaine.

Qwen3.6 était aussi déjà pris en charge dans Unsloth Studio pour l’exécution et l’entraînement. Vous pouvez entraîner et exécuter Qwen3.6-27B dès maintenant !

Qwen3.6-27B + Kimi K2.6

Qwen3.6-27B peut désormais être exécuté (18 Go de RAM) et affiné dans Unsloth Studio. Kimi K2.6 peut également être exécuté dans Unsloth (350 Go de RAM).

Unsloth Studio a reçu de nombreuses nouvelles mises à jour, veuillez donc mettre à jour. Les détails et un article arriveront dans les prochains jours.

Qwen3.6

Qwen3.6 peut désormais être exécuté et affiné dans Unsloth Studio. Le modèle fonctionne avec 23 Go de RAM et est le LLM de taille moyenne le plus puissant sur presque tous les benchmarks.

Mise à jour Gemma 4 + MiniMax-M2.7

GGUF Gemma 4 sont désormais mis à jour avec les correctifs officiels de Google pour le modèle de chat (qui ont corrigé/amélioré l’appel d’outils), ainsi qu’avec les derniers correctifs de llama.cpp. Mettez à jour vers la dernière version de llama.cpp, retéléchargez les quantifications et vous ne devriez plus voir jeton inutilisé de problèmes. MiniMax-M2.7 est disponible maintenant ! Vous pouvez exécuter le modèle localement avec nos GGUF en quantification 4 bits sur 128 Go de RAM / mémoire unifiée. GGUF MiniMax-M2.7

Corrections Gemma 4

Nous avons mis à jour Gemma 4 avec de nombreuses corrections. Ces bugs sont universels et ont affecté tous les packages et implémentations d’entraînement et ne proviennent pas d’Unsloth. Nous avons identifié les bugs, les avons corrigés, et l’entraînement Gemma 4 fonctionne désormais correctement dans Unsloth.

Vous n’avez besoin que de 8 Go de VRAM pour entraîner Gemma-4-E2B localement. Unsloth entraîne Gemma 4 environ 1,5x plus vite tout en utilisant environ 60 % de VRAM en moins que les configurations FA2. Pour le guide complet et les notebooks sur l’entraînement de Gemma 4, voir notre blog.

Corrections d’entraînement Gemma 4

  1. L’accumulation de gradient ne provoque plus d’explosions de perte. Auparavant, les pertes pouvaient monter à 300–400; la perte attendue est d’environ 10–15.

  2. Correction du IndexError affectant 26B et 31B l’inférence dans transformers.

  3. Correction des sorties incohérentes pour E2B/E4B quand use_cache=False. Voir le problème #45242.

  4. Correction de audio float16 débordement à partir de -1e9 valeurs.

Si vous voyez des pertes supérieures à 13–15, par exemple 100 ou 300 - l’accumulation de gradient est probablement gérée incorrectement. Cela est corrigé dans Unsloth et Unsloth Studio.

Téléversements quantifiés Gemma 4

Nous avons également mis à jour nos GGUF Gemma 4, vous devrez donc les retélécharger. Là encore, ces problèmes de quantification ne sont pas liés à Unsloth et ne sont pas causés par lui:

  1. CUDA : vérifier le chevauchement des tampons avant la fusion - correctif critique pour <unused24> tokens - PR #21566

  2. kv-cache: prise en charge de la rotation de l’attention pour iSWA hétérogène - PR #21513

  3. vocab: ajout de la gestion des jetons d’octet au détokenizer BPE pour Gemma 4 - PR #21488

  4. convertir: définir "add bos" == True pour Gemma 4 - PR #21500

  5. commun: ajout d’un analyseur spécialisé Gemma 4 - PR #21418

  6. llama-model: lire final_logit_softcapping pour Gemma 4 - PR #21390

  7. llama: ajout d’un découpage personnalisé des nouvelles lignes pour Gemma 4 - PR #21406

Mises à jour d’Unsloth Studio

  • Ajouter le décodage spéculatif prise en charge (ngram-mod, activé par défaut)

  • Llama.cpp mis à jour pour utiliser la dernière version avec tous les correctifs Gemma 4

  • Corriger les problèmes d’entraînement Qwen3.5 et Gemma 4

  • Autoriser l’exportation et l’enregistrement des modèles Gemma 4

  • Renforcer la sécurité du sandbox pour le terminal et les outils Python

  • Permettre aux recettes d’utiliser le modèle chargé dans Chat

  • Corriger les fils de discussion vides lors de la navigation (et lors du changement d’onglet) et stabiliser le nouveau flux de chat

  • Autoriser l’exécution des recettes non-LLM et déplacer l’onglet Data en premier dans les exécutions

  • Réutiliser la casse du dépôt en cache de HF pour éviter les téléchargements en double

Google - Gemma 4

  • Vous pouvez désormais exécuter et entraîner les Gemma 4 modèles dans Unsloth.

  • Intel Mac fonctionne désormais

  • Binaires précompilés pour llama.cpp pour 2 correctifs Gemma-4 :

    • vocab : correction du tokenizer Gemma4 (#21343)

    • corriger : modèle Gemma 4 (#21326)

  • Les appels d’outils pour les petits modèles sont désormais plus stables et ne se coupent plus

  • Binaires précompilés pour Windows, Linux, Mac, appareils WSL - CPU et GPU

  • Décodage spéculatif ajouté pour les modèles non vision (Gemma-4 est vision malheureusement et Qwen3.5)

  • La longueur de contexte est maintenant correctement appliquée.

  • La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés

  • 90 % d’appels à l’API HF en moins - moins de limitations de débit

+50 % de précision des appels d’outils + plus de prise en charge

  • Les appels d’outils pour tous les modèles sont désormais de +30 % à +80 % plus précis.

  • La recherche web récupère maintenant réellement le contenu web et pas seulement des résumés

  • Le nombre d’appels d’outils autorisés passe de 10 à 25

  • Les appels d’outils se terminent désormais bien mieux, donc les boucles / répétitions seront réduites

  • Plus de réparation d’appels d’outils et de logique de déduplication pour empêcher aussi les appels d’outils de laisser fuir du XML

  • Testé avec unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL), recherche web + exécution de code + réflexion activées.

Métrique
Avant
Après

Fuites XML dans la réponse

10/10

0/10

Récupérations d’URL utilisées

0

4 exécutions sur 10

Exécutions avec noms de chansons corrects

0/10

2/10

Moy. appels d’outils

5.5

3.8

Temps de réponse moyen

12,3 s

9,8 s

Nouvelles fonctionnalités

  • Ajouté dossiers personnalisés afin que vous puissiez utiliser n’importe quel GGUF dans n’importe quel dossier - pour l’instant accès dans les Paramètres avancés du Chat et Dossiers personnalisés

  • Bouton Mettre à jour désormais visible

  • Style du script d’installation entièrement mis à jour !

  • Préliminaire Prise en charge automatique multi-GPU pour l’inférence et l’entraînement - utile pour les grands modèles qui ne tiennent pas sur 1 GPU - Unsloth auto allouera les ressources GPU

  • Les Mac Intel devraient fonctionner immédiatement

Unsloth beaucoup plus fluide et plus rapide

  • Correction des délais d’expiration lors du téléchargement de grands modèles - plus aucun délai d’expiration constaté.

  • Correction de la limitation de débit Hugging Face - appels API HF réduits de 90 %

  • Correction de bun sur Windows et installations plus rapides

Nouvelles mises à jour importantes

Il ne s’est écoulé que 2 jours depuis notre précédente version, mais nous avons des mises à jour plus importantes :

  • L’inférence est désormais 20 à 30 % plus rapide. Auparavant, l’appel d’outils et la pénalité de répétition pouvaient ralentir l’inférence en dessous des vitesses normales. Les tokens/s d’inférence devraient désormais être identiques à llama-server / llama.cpp.

  • Détecte désormais automatiquement les anciens modèles ou les modèles préexistants téléchargés depuis LM Studio, Hugging Face, et des sources similaires.

  • La vitesse des tokens/s d’inférence est désormais calculée correctement. Auparavant, les tokens/s incluaient le temps de démarrage, ce qui faisait paraître la vitesse affichée plus lente qu’elle ne l’était réellement. Elle devrait désormais refléter la « vraie » vitesse d’inférence.

  • L’utilisation du CPU ne monte plus en pic. Auparavant, l’identité du queryer inline changeait à chaque rendu, ce qui provoquait useLiveQuery de se réabonner en continu.

  • Unsloth Studio dispose désormais d’un bouton x de fermeture et s’arrête correctement. Auparavant, le fermer après l’avoir ouvert depuis l’icône du bureau ne le fermait pas correctement. Désormais, le lancement depuis le raccourci ouvre aussi le terminal, et la fermeture de ce terminal quitte complètement Unsloth Studio. Si vous l’avez encore ouvert depuis une session précédente, vous pouvez redémarrer votre ordinateur ou exécuter lsof -i :8888 puis kill -9 <PID>.

  • Appel d’outils et recherche web encore meilleurs avec moins d’erreurs.

  • Documentation mise à jour avec beaucoup de nouvelles informations sur la suppression de modèles, la désinstallation etc.

  • Journalisation d’installation et de configuration plus propre et plus intelligente sur Windows et Linux. La sortie est désormais plus facile à lire avec un formatage cohérent, plus silencieuse par défaut pour une expérience plus fluide, et prend en charge des diagnostics enrichis --verbose quand vous voulez tous les détails techniques.

  • Vous pouvez désormais consulter votre historique d’entraînement !

Premier post de publication après Unsloth Studio

Salut tout le monde, voici notre première version depuis le lancement d’Unsloth Studio. Beaucoup de nouvelles fonctionnalités et corrections :

  • Vous pouvez désormais mettre à jour Unsloth Studio ! Veuillez mettre à jour via les mêmes commandes d’installation.

  • Windows CPU ou GPU fonctionne désormais de manière transparente. Veuillez réinstaller !

  • Raccourcis d’application. Une fois installé, vous pouvez désormais le lancer sous Windows, MacOS et Linux via une icône de raccourci dans le menu Démarrer / Launch et sur le bureau.

  • Précompilés llama.cpp binaires et mamba_ssm - installations 6x plus rapides ! Également <300 Mo pour les binaires.

  • Tailles d’installation réduites de 50 % (économie de 7 Go ou plus), installations 2x plus rapides et résolution plus rapide. Tailles PyPI réduites de 50 %.

  • Appel d’outils amélioré. Meilleur parsing de llama.cpp, aucun balisage brut des outils dans le chat, inférence plus rapide, un nouveau panneau de sorties d’outils, des minuteries.

  • MacOS et le CPU ont maintenant Recettes de données activé avec le téléversement de plusieurs fichiers.

  • Prise en charge AMD préliminaire pour Linux pour les machines uniquement - détection automatique.

  • Refonte de la barre latérale des paramètres. Les paramètres sont désormais regroupés en Modèle, échantillonnage, outils et préférences

  • Longueur du contexte désormais réglable. Gardez à l’esprit que ce n’est pas nécessaire, car llama.cpp utilise intelligemment le contexte exact dont vous avez besoin via --fit activé

  • Téléversement de plusieurs fichiers. Les recettes de données prennent désormais en charge plusieurs téléversements par glisser-déposer pour PDF, DOCX, TXT et MD, avec extraction côté serveur, téléversements enregistrés et aperçus améliorés.

  • Colab avec des GPU T4 gratuits avec Unsloth Studio, c’est désormais corrigé ! Essayez-le ici. Grâce aux binaires précompilés, c’est aussi 20x plus rapide !

  • Meilleure observabilité du chat. Unsloth affiche désormais llama-server les temps et l’utilisation, une barre d’utilisation de la fenêtre de contexte et des infobulles de source plus riches.

  • Une meilleure UX globale - liens cliquables, meilleur parsing LaTeX, infobulles d’outils / code / web pour les cartes par défaut, et bien plus encore !

  • LiteLLM - Unsloth Studio et Unsloth ont été PAS touchés par la récente compromission de LiteLLM. Nemo Data Designer n’a utilisé LiteLLM que jusqu’à 1.80, et non la version touchée 1.82.7 ou 1.82.8, et l’a depuis entièrement supprimée.

  • Nous avons désormais une nouvelle commande d’installation en une seule ligne, exécutez simplement :

Corrections :

  • Améliorations de Windows et de l’installation. Correction des fermetures silencieuses de Windows, des plantages au démarrage d’Anaconda/conda-forge, des installations Windows non-NVIDIA défaillantes et des vérifications de configuration CUDA précoces/venv obsolète manquantes.

  • Corrections des prompts système. Ils fonctionnent à nouveau pour l’inférence texte et vision hors GGUF.

  • Prompts système et préréglages persistants. Les prompts système personnalisés et les préréglages de chat persistent désormais après les rechargements et les changements de page.

  • Export GGUF élargi. Les fine-tunes complets, pas seulement LoRA/PEFT, peuvent désormais être exportés en GGUF. La résolution du modèle de base est plus fiable, et les options d’exportation non prises en charge sont désactivées dans l’interface.

  • Corrections du défilement / de la mise en page du chat. Correction des problèmes de position de défilement pendant la génération, du décalage de mise en page du panneau de réflexion et des sauts de viewport lors de la réduction des panneaux de raisonnement.

  • Détection plus intelligente des conflits de ports. Unsloth détecte désormais les conflits de loopback, peut identifier le processus bloquant lorsque c’est possible, et fournit des messages de port de repli plus clairs.

Nouvel appel d’outils + stabilité de Windows

  • Claude Artifacts fonctionne, de sorte que le HTML peut être exécuté comme un jeu du serpent dans le chat

  • +30 % d’appels d’outils plus précis, surtout pour les petits modèles + minuteur pour les appels d’outils

  • Les sorties d’outils + recherche web peuvent être enregistrées + activer/désactiver l’outil d’auto-réparation

  • Nombreuses corrections de bugs - le CPU Windows fonctionne, Mac est plus fluide, installations plus rapides et plus légères

Mis à jour

Ce contenu vous a-t-il été utile ?