Unsloth-Updates
Unsloth-Changelog für unsere neuesten Releases, Verbesserungen und Fehlerbehebungen.
Um die neuesten Änderungen zu verwenden, Unsloth aktualisieren.
DeepSeek-V4 + NVFP4
Unsloth kann nach dem Training jetzt NVFP4-, FP8- und imatrix-GGUFs exportieren; als llama-swap-API-System fungieren; Unterstützung für Japanisch und brasilianisches Portugiesisch hinzufügen; und beinhaltet MLX, safetensors, Tool-Calling, Healing-Unterstützung und mehr. Der Unsloth-Kern macht GRPO 1,3x schneller, fügt einen HTTP-Fallback für festhängende Downloads hinzu, verbessert den Offline-Modus, beschleunigt das MoE-Training um 3–5x und behebt viele Fehler. Diese Release-Reihe verwendet unsloth>=2026.7.1.
DeepSeek-V4-Flash wird jetzt mit Thinking-Schaltern und unseren verbesserten Chat-Template-Fixes unterstützt.

Intelligentere OpenAI-kompatible API-Bereitstellung
Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agent-Tools.
API-Anfragen können zwischen heruntergeladenen lokalen GGUFs automatisch umschalten, während unbekannte Modellnamen weiterhin sicher das aktuelle Modell verwenden.
/v1/modelsgibt jetzt saubere Modell-IDs und den lokalen GGUF-Katalog statt lokaler.gguf-Pfade zurück.Automatisches Entladen im Leerlauf kann nach Inaktivität VRAM freigeben, und Tool-Call-Healing kann jetzt pro Anfrage gesteuert werden.
Exportverbesserungen
Exporte sind flexibler und vermeiden unnötige Downloads.
Wähle mehrere Exportformate auf einmal aus, darunter portables FP8/INT8, GGUF LoRA, quellcodeangepasste Exporte, imatrix GGUF und komprimiertes FP8/FP4.
Multi-Checkpoint-Exporte vermeiden weitere wiederholte Basis-Modell-Downloads.
FP8-, INT8- und GGUF-LoRA-Exporte respektieren jetzt
trust_remote_codeund der GGUF-Export geht zuverlässiger mit fehlenden Quantisierungseinstellungen um.
RAG und Datei-Chat
Datei-Chat ist bei echten Dokumenten nützlicher.
RAG-Anhänge können jetzt den Kontext des gesamten Dokuments verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.
Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich Text von rechts nach links, indischen Text und DOCX-Tabellen.
Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.
Unsloth-Politur und Zuverlässigkeit
Der tägliche Gebrauch sollte sich flüssiger und stabiler anfühlen.
Lange Trainings- und Chat-Läufe frieren weniger wahrscheinlich still ein.
Der Vergleichsmodus, der Modellwechsel, das Modellabbrechen, das Hub-Browsing und Hub Discover sind zuverlässiger.
Projekt-Exporte, Chat-Exporte, Einstellungen, geführte Rundgänge, Dateidialoge, Aktualisierungsbildschirme und die Reasoning-Oberfläche sind sauberer und konsistenter.
Installer-, Hardware- und Plattform-Fixes
Unsloth installiert und läuft plattformübergreifend zuverlässiger.
macOS-Installationen benötigen kein CMake oder Homebrew mehr, wenn ein vorgefertigtes
llama.cppverfügbar ist, und die Unterstützung für Apple Silicon behandelt Pfade mit Leerzeichen und die Größe des Unified Memory besser.Der Windows-Start, die UTF-8-Behandlung, ROCm-RAG-Embedding und die ROCm-unter-WSL-GPU-Unterstützung wurden verbessert.
Die Auswahl vorgefertigter Blackwell-GPUs, GGUF-Passformprüfungen, Tensor Parallelism für Vision-/mmproj-GGUFs und die lokale
llama.cppWiederverwendung sind jetzt zuverlässiger.
Training, Modelle und Kernel
Training und Modellladen sind in mehr Setups zuverlässiger.
GRPO unterstützt jetzt standardmäßig Sequence Packing, vermeidet wiederholte gemeinsame Prompts und behandelt DDP-Logit-Skalierung korrekt.
Full Fine-Tuning, RL-Präzisionseinstellungen, Gradient Checkpointing, DDP-RoPE-Puffer und MoE-LoRA-Erkennung wurden behoben.
FP8-Quantisierung/Dequantisierung, Llama-3-RoPE-Skalierung mit Transformers v5, PEFT-0.19-LoRA-Neuladevorgänge und
fast_generateFehlermeldungen wurden verbessert.
GLM 5.2 + Hub + 3x längere Kontexte
GLM-5.2 wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. 3x längere Kontextlängen sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP erreichbar, was längere Chats ermöglicht. Bypass-Permissions-Modus, verzweigte Chats, einreihbare Chats, ein neuer Hub zur Modellerkennung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende unsloth studio --secure für sicheren globalen HTTPS-Zugriff!
Besserer Algorithmus für Kontextlänge
Gemäß PR 1 und PR 2haben wir die Bestimmung des Speicherverbrauchs und der Kontextlänge in Unsloth Studio deutlich verbessert und insgesamt 3x längere Kontexte erreicht:
1x 32GB-Pipeline (~31 GB frei)
f16
23,040
64,000
q8_0
43,520
114,944
q4_0
82,432
199,680
2x 32GB-Pipeline
beliebig
262,144
262,144
2x 24GB-Tensor (~23 GB frei)
f16
134,049
262,144
q8_0
252,329
262,144
Chat-Canvas, Verzweigung & Warteschlange
Bearbeite Assistentennachrichten direkt und führe sie von jedem Punkt im Thread erneut aus.
Verzweige einen Thread, um ein Gespräch aufzuteilen, ohne das Original zu verlieren.
Temporäre (Inkognito-)Chats, die nichts hinterlassen.
Neue Prompts in die Warteschlange stellen, während eine Generierung noch läuft, statt zu warten.
Chat-„Artefakte“ sind jetzt Canvas, mit eingebetteten HTML-Canvas-Karten die automatisch gerendert werden, einer Code-Ansicht, und DiffusionGemma zeigt seinen Rohcode weiterhin direkt sichtbar statt eingeklappt.
Die Chat-Suche umfasst jetzt jede Nachricht und zeigt zuerst deine eigenen Nachrichten an.
Hub (neu gestaltet)
Vollseiten-Hub mit Trend-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.
README-Vorschau in einem Split-View-Feed, damit du vor dem Download lesen kannst.
Downloads verwenden standardmäßig das schnellere Xet -Transportprotokoll, mit automatischem HTTP-Fallback, falls eine Übertragung stockt.
Neuer Schalter „Beim Auswählen laden“, um Ladeoptionen festzulegen, bevor ein Modell geladen wird.
Google-Logo für DiffusionGemma und zukünftige Gemma-Derivate angezeigt.
Modelle & Inferenz
DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.
Schnelle Inferenz in der neuesten vLLM (0.22+) behoben, damit Beschleunigungen wieder funktionieren.
Tensor Parallelism ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, stellt er sich jetzt selbst wieder her, statt abzustürzen.
DiffusionGemma zeigt jetzt live das entstehende Bild, während es entrauscht wird, mit genauen Geschwindigkeitsstatistiken.
Sicherheit & Cloudflare-verschlüsselte Studios
Neu
--securenur-Cloudflare-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter--secureweiterhin aktiviert bleiben. Verwendeunsloth studio --secure!Bypass-Permissions-Modus, um Bestätigungen zu überspringen und die Tool-Sandbox bei Bedarf zu deaktivieren.
Automatische Erkennung von Hugging-Face-Virenprüfung + gefährlichen Dateien in Repos.
Protokollierung und API
Neu API-Server-Monitor in Studio.
Schnellere API-Aufrufe und geringere Latenz
Deutlich bessere, schlankere Logs - jetzt mit Durchsatz und Latenz und viele aufgeblähte Logs entfernt.
Hardware & Backend
Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs
Stilles Herabstufen auf CPU statt GPU beheben
Die torchao-Version wird jetzt aus dem installierten torch ausgewählt.
Der Installer repariert jetzt automatisch eine defekte oder nur-CPU-PyTorch-Installation und warnt vor stillem CPU-Fallback, auf NVIDIA + AMD unter Win/Linux/Mac/WSL.
Gibt den VRAM des Chat-Modells frei, wenn das Training startet, aber nur, wenn die GPU tatsächlich knapp ist (sonst keine unnötigen Neuladungen).
Wenn llama-server beim Start hart abstürzt, geht Studio jetzt eine Wiederherstellungsleiter durch, statt einfach zu scheitern.
Training & allgemeine Fixes & parallele Module
MLX-Trainingsupdates.
Verbesserte Zuverlässigkeit des GRPO-Trainings mit vLLM.
Trainingsstart zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.
Studio bereinigt übrig gebliebene Backend-Prozesse nach Abstürzen, Neustarts oder unterbrochenen Herunterfahrvorgängen jetzt zuverlässiger.
Export, Chat, Training und Rezepte sind alle individualisiert / isoliert! Das bedeutet, dass du jetzt alle 4 parallel machen kannst! Du kannst chatten / Inferenz durchführen, während du auf einen Trainingslauf oder einen Export wartest!
Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexDiffusionGemma + Gemma 4 MTP
Stelle sicher, dass du die neueste v0.1.464-beta oder 2026.6.7. DiffusionGemma, Gemma 4 MTP und MiniMax-M3 werden jetzt alle unterstützt.
Ausführen und trainieren DiffusionGemma über Unsloth Studio.
Gemma 4 MTP ist da! Ausführen Gemma 4 ~2x schneller mit MTP.
Audio-Chat wird jetzt für Gemma 4 unterstützt (
wav,mp3,m4a,flac,webm).Preserve Think wurde zu Gemma 4 hinzugefügt.

Hub + Download-Manager (experimentell)
Eine neue Hub Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging-Face-Modellen und -Datensätzen hinzugefügt.
Unsloth kann jetzt Modelle und Datensätze auf deinem Rechner erkennen und sie neben heruntergeladenen Assets anzeigen.
Heruntergeladene GGUF-Modelle haben jetzt direkte Ausführen / Neuer Chat -Aktionen.
RAG / Mit Dateien chatten (experimentell)
Hinzugefügt Mit Dateien chatten in Studio, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.
Unterstützt hybrides Suchen, Zitate, PDF-Vorschauen, dokumente pro Thread und ein integriertes
search_knowledge_base-Tool.
Neue Aktualisieren-Schaltfläche + Hardware-Unterstützung
Unsloth verwendet jetzt ständig frische, aktuelle llama.cpp-Vorab-Builds über CUDA, ROCm, Windows, Linux und macOS hinweg.
Eine integrierte llama.cpp aktualisieren -Schaltfläche hinzugefügt, damit Benutzer das lokale Backend aktualisieren können, ohne Studio neu zu installieren.
Verbesserte Windows-/WSL-AMD-Unterstützung, Strix-Halo-ROCm-Unterstützung, Blackwell-CUDA-Auswahlund klarere Installationsmeldungen.
Lokaler Chat, Tools & API-Kompatibilität
Lokales Tool-Calling ist zuverlässiger, mit besserer Sortierung der Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.
Verbesserte OpenAI-kompatible API und Anthropic-kompatibles API-Verhalten für lokale Studio-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und Claude-Code-Kompatibilität.
Training & Fixes
Verbesserte MLX-Unterstützung mit besseren Modellbezeichnungen, Statistiken zur Generierungsgeschwindigkeit und Fixes für VLM-Training.
Mehrere Trainings- und Datensatz- Randfälle wurden behoben, einschließlich nicht beschreibbarer Hugging-Face-Caches und benutzerdefinierter Datensatzzuordnungen.
Viele UI-Polish-Fixes über Chat, Menüs, Modellauswahl, Dark Mode, Import/Export und Einstellungen hinweg hinzugefügt.
Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexGemma 4 12B, neue UI, MCP, Projekte
Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

Gemma 4 12B
Google veröffentlicht Gemma 4 12B, ein neues Modell, das lokal auf 8 GB RAM läuft. GGUF / Anleitung
Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führe das Modell über Unsloth Studio aus und trainiere es.
MCP
Entfernter
MCPServer-Support, einschließlich benutzerdefinierter Header und OAuthLokaler befehlsbasierter
MCPServer-SupportMCPkann jetzt im Chat-Composer eingeschaltet werdenIntegrierte Voreinstellungen für gängige
MCPServer
Neue Chat-UI
Projekte, Canvas,
MCP, RAG- und Vergleichssteuerungen befinden sich jetzt im Plus-MenüSuche- und Code-Steuerelemente sind vom Composer aus leichter zugänglich
Menüs, Overlays, Symbole und anklickbare Steuerelemente sind in Studio konsistenter
Projekte
Verwandte Chats in dedizierten Projekt-Arbeitsbereichen organisieren
Bestehende Chats in Projekte verschieben
Projekte direkt über die Seitenleiste erstellen und verwalten
Experimentelles Canvas / Artefakte
Öffnet generiertes HTML in einem dedizierten Canvas-Bereich innerhalb von Unsloth Studio
Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und per CDN geladener Pakete
Ermöglicht den Wechsel zwischen gerenderter Vorschau und Quellcode
Installation, Laufzeit und Hardware
Windows-Vorabinstallationen erfordern die frühe
CUDA Toolkit-Prüfung nicht mehrLinux
llama.cpp-Vorab-Builds stimmen jetzt mit der erkannten Laufzeitcudart-HauptversionROCmgfx-Erkennung wird in die Auswahl vorgefertigter Builds weitergeleitetBlackwell,B300undARM64Linux-Unterstützungsupdates
Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexNICHT VERWENDEN Unsloth Studio Update nicht mehr, da das Paket nicht die neuesten Updates erhält!
CUDA 13.3, Windows, Mac
Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexNICHT VERWENDEN Unsloth Studio Update nicht mehr, da das Paket nicht die neuesten Updates erhält!
Mac-Updates
Wieder aktiviert
llama.cppvorgefertigte Binärdateien für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)Apple Silicon Mac OS 13 (Ventura) ist ein Source-Build
Intel (x86_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet
llama.cppvorgefertigte BinärdateienIntel für Max 13.0 - 13.2 ist ein Source-Build
Windows-Updates
CUDA 13.3
llama.cppvorgefertigte Binärdateien funktionieren jetzt für WindowsFür CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte den CUDA-12.4-Fallback - wir arbeiten bald an CUDA-13.1-Binärdateien.
CUDA 13.3-Update
CUDA-13.3-Binärdateien außerhalb von Linux funktionieren. Wir werden vorerst weiterhin CUDA 13.1 verwenden
CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 - siehe https://github.com/unslothai/unsloth/issues/4849
Blackwell-GPU-Update
Vorerst wird Blackwell verzögerte Veröffentlichungen von
llama.cppvorgefertigten Binärdateien haben, da CUDA 12.4 nicht funktioniert - wir arbeiten daran, dies bald zu beheben.
Ein Update vor dem Revamp.
Hey Leute, wir machen noch ein weiteres Update vor einem größeren Revamp, der wahrscheinlich diese Woche oder nächste Woche kommt. Unser Revamp wird vieles ändern, besonders mit neuen wichtigen Funktionen und vielen Designänderungen.
NEU: API-Calling-Unterstützung jetzt mit Bilderzeugung + Bearbeitung, richtiger Websuche, Code-Ausführung, automatischem Prompt-Caching. Verbinde OpenAI, Anthropic und mehr.
Ordentliche Unterstützung für nicht-englische Sprachen z. B. Japanisch, Chinesisch, Indisch usw.
Viele von euch haben vielleicht unseren vorherigen Release verpasst, der nur einen Tag lang verfügbar war. Wir haben eingeführt:
Mit externen Inferenz-Backends verbinden: vLLM, Ollama, llama-server
Sicherheitsverbesserungen
Automatisches MTP-Speculative-Decoding für MTP-GGUFs; erhalte die besten Einstellungen, angepasst an deine Hardware.
API-Provider-Calling & externe Verbindungen
Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
Integrierte Websuche für OpenAI, Anthropic, OpenRouter und Kimi
Integrierte Code-Ausführung für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
Bilderzeugung + Bearbeitung
API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)
Modelle automatisch laden, wenn ein Cloud-Anbieter hinzugefügt wird
Weitere Unsloth-Studio-Updates
OpenDocument-Chat-Anhänge
o3-Reasoning-Zusammenfassungs-Payload
Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
IME-Composer-Härtung, RTL
dir="auto", Fix für das Abschneiden langer LogzeilenRendering von Tool-Reasoning-Traces in der UI
Vollständig offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training
Sicherheitsverbesserungen in Unsloth Studio
Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen
Sandboxed Worker mit einer verschärften Blockliste (bash,
hf upload,NOFILE)Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
Strikte Schema-Validierung über die gesamte Studio-API hinweg
Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
Entfernt den
torch.loadFallback auftraining_args.binsodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden könnenAbgesicherter Tauri-Desktop-Release-Flow
Frontend-Auth: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfsfunktion
Die Abbruchbereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals den Benutzerstatus löschen kann
MTP- und Unsloth-Fixes
Viele Bugfixes sowie UI-/UX-Fixes für Studio! Um die neuesten Updates zu erhalten, mache Folgendes:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexFehlerbehebungen
Beheben
Unsloth Studio Updatenicht gut funktionierenBehebung des Hängenbleibens bei
reset-passwordSeiteMehr Unterstützung für den Offline-Modus
Verbessere, dass MTP auf Macs, CPUs und GPUs nicht schneller ist - jetzt ist es viel besser!
Behebung, dass die Desktop-Verknüpfung nach dem Update nicht funktioniert
Sehr, sehr viele UI-/UX-Bugfixes
Qwen3.6 MTP + API-Verbindungen
Wir haben viele neue Updates für Unsloth v0.1.41-beta:
~2x schnellere GGUF-Inferenz mit automatisch aktiviertem MTP
API-Calling-Unterstützung für OpenAI, Anthropic usw. mit automatischem Prompt-Caching, Websuche, Codeausführung
Mit externen Inferenz-Backends verbinden: vLLM, Ollama, llama-server
Experimentell MLX-Inferenz
Ordentliche Unterstützung für nicht-englische Sprachen
Sicherheit Verbesserungen
Qwen3.6-Tutorials ausführenMTP-Leitfaden

Unterstützung für spekulatives Decodieren mit MTP: 1,4- bis 2-fach schnellere Inferenz!
Automatisches MTP-Speculative-Decoding für MTP-GGUFs; Warnung, wenn das mitgelieferte llama.cpp-Prebuild veraltet oder zu alt für MTP ist
Neue vorgefertigte llama.cpp-Binaries für MTP-Unterstützung!
API-Provider-Calling & externe Verbindungen
Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
Integrierte Websuche für OpenAI, Anthropic, OpenRouter und Kimi
Integrierte Code-Ausführung für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)
Modelle automatisch laden, wenn ein Cloud-Anbieter hinzugefügt wird
MLX-Inferenz (experimentell)
MLX-Quants und Modelle können jetzt lokal auf deinen Mac-Rechnern ausgeführt werden!
Wir werden bald Thinking, Tools und Websuche hinzufügen!
Weitere Unsloth-Studio-Updates
Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
OpenDocument-Chat-Anhänge
o3-Reasoning-Zusammenfassungs-Payload
IME-Composer-Härtung, RTL
dir="auto", Fix für das Abschneiden langer LogzeilenRendering von Tool-Reasoning-Traces in der UI
Vollständig offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training
Viele UI/UX-Feinschliffe: Refactoring des dunklen Themes, Neugestaltung der rechten Seitenleiste, Faultier-Maskottchen für die Tageszeit, wegklickbare kopierbare Toasts, größerer Chat-Composer, Feinschliff an der Konfiguration der Codeausführung, Styling der Composer-Aktions-Pills, schmalerer Discord-Button
Trainings-Updates
Gemma-Attention-Masken-Fixes
GRPO mit mehreren Bildern
Experimente zur Rückgabe von GRPO-Hidden-States
Neue Continued-Pretraining-(CPT)-Trainingsmethode als erstklassige Option
Gemma-4-MoE-LoRA-Extractor registriert, um
grouped_mmContraction-AbsturzOptional aktiviertes gefused
lm_head+ Cross-Entropy-Forward, mit Single-Matmul-Pfad unterUNSLOTH_RETURN_LOGITS=1Batchgröße für Eval übergeben
Eval-/Trainingspfade berücksichtigen jetzt
HF_DATASETS_OFFLINEzusammen mitHF_HUB_OFFLINE
Sicherheitsverbesserungen in Unsloth Studio
Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen
Sandboxed Worker mit einer verschärften Blockliste (bash,
hf upload,NOFILE)Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
Strikte Schema-Validierung über die gesamte Studio-API hinweg
Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
Entfernt den
torch.loadFallback auftraining_args.binsodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden könnenAbgesicherter Tauri-Desktop-Release-Flow
Frontend-Auth: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfsfunktion
Die Abbruchbereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals den Benutzerstatus löschen kann
Unsloth-API-Endpunkt
v0.1.39-beta-Bugfix 5. Mai 2026
Behebt, dass der Chatverlauf nicht angezeigt wird (vorhandener Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler betraf nur das Rendering – verwende 2026.5.2 oder rufe direkt curl -fsSL https://unsloth.ai/install.sh | sh auf, um zu aktualisieren
Du kannst lokale LLMs mit Tools wie Claude Code und Codex verwenden, indem du sie mit Unsloths API-Endpunkt verbindest. So kannst du Modelle wie Qwen und Gemma lokal ausführen, mit zusätzlichen Funktionen wie selbstheilendem Tool-Calling, Codeausführung und Websuche.
Unsloth als API-Inferenz-Endpunkt zu verwenden ist nicht nur wegen der einfachen Einrichtung und der Geschwindigkeit vorteilhaft, sondern auch, weil Unsloth Folgendes bietet:
Selbstheilendes Tool-Calling, was hilft, fehlerhafte oder missgebildete Tool-Calls um 50 % zu reduzieren
Codeausführung Unterstützung, die Bash- und Python-Ausführung für genauere Code-Ausgaben ermöglicht.
Erweitert Websuche die Webseiten besucht und tatsächlich liest, um ausführliche Informationen zu sammeln.
Automatische Inferenz-Einstellungen für GGUF-Modelle (temp, top-k usw.)

Neue Modelle
Wir haben auch einige neue Modelle zum Ausführen, darunter NVIDIA Nemotron 3 Nano Omni, IBM Granite 4.1 und Mistral 3.5 Medium. Wir haben Mistral bei der Behebung einiger Probleme mit der Implementierung in transformers und GGUFs geholfen.
Unsloth-Updates
Gestoppte Studio-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.
Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.
DPO-Trainings-Hänger in Multi-Prozess-Setups wurden behoben.
VLM-GRPO-Unterstützung mit MROPE-Updates verbessert.
Der Stopp-Button in Studio stoppt die Generierung jetzt korrekt.
Behebt, dass die Chat-Vorlage nach dem Browser-Refresh verschwindet.
Brandneues UI-Redesign
Hey Leute, wir haben die gesamte UI- und UX-Erfahrung von Unsloth Studio überarbeitet, um den Fokus auf Chat und Training zu legen:
Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

Du kannst jetzt Chats löschen und frühere Unterhaltungen durchsuchen


Neuer Schalter „Preserve Thinking“ für Modelle, die dies unterstützen, wie Qwen3.6
Saubereres, konsistenteres Design mit einfacher Navigation
Erweiterte Einstellungsseite mit Optionen zum Ändern von Profilbild, Namen und mehr

Kein doppeltes Eingeben deines Hugging-Face-Tokens mehr
gpt-oss hat jetzt Schalter für niedriges, mittleres und hohes Thinking.
Verwendet jetzt das neueste llama.cpp-Prebuild, sogar unter Linux CUDA
Viele Bugfixes sowie Verbesserungen bei Konsistenz und Stabilität
Kimi-K2.6 kann jetzt ausgeführt werden!
Wir haben außerdem experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. kommen nächste Woche.
Qwen3.6 wurde außerdem schon zuvor in Unsloth Studio für Ausführung und Training unterstützt. Du kannst Qwen3.6-27B jetzt sofort trainieren und ausführen!
Qwen3.6-27B + Kimi K2.6
Qwen3.6-27B kann jetzt in Unsloth Studio ausgeführt (18 GB RAM) und feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).
Unsloth Studio hat viele neue Updates erhalten, bitte aktualisieren. Details und ein ausführlicher Beitrag folgen in den nächsten Tagen.
Qwen3.6
Qwen3.6 kann jetzt in Unsloth Studio ausgeführt und feinabgestimmt werden. Das Modell läuft mit 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.
Gemma-4-Update + MiniMax-M2.7
Gemma-4-GGUFs wurden jetzt mit Googles offiziellen Chat-Vorlagen-Fixes aktualisiert (wodurch das Tool-Calling behoben/verbessert wurde), zusammen mit den neuesten llama.cpp-Fixes. Aktualisiere auf die neueste llama.cpp-Version, lade die Quants erneut herunter und du solltest kein unused token mehr sehen.
MiniMax-M2.7 ist jetzt verfügbar! Du kannst das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. MiniMax-M2.7 GGUF
Gemma-4-Fixes
Wir haben Gemma 4 aktualisiert mit vielen Fixes. Diese Bugs sind universell und betrafen alle Trainingspakete und Implementierungen und stammen nicht von Unsloth. Wir haben die Bugs identifiziert, behoben, und das Training von Gemma 4 funktioniert jetzt in Unsloth korrekt.
Du brauchst nur 8 GB VRAM um zu trainieren Gemma-4-E2B lokal. Unsloth trainiert Gemma 4 ~1,5x schneller bei ~60 % weniger VRAM als FA2-Setups. Den vollständigen Leitfaden und Notebooks zum Training von Gemma 4, siehe unseren Blog.
Gemma-4-Trainingsfixes
Gradientenakkumulation verursacht keine Loss-Explosionen mehr. Früher konnten die Losses auf 300–400ansteigen; der erwartete Loss liegt bei etwa 10–15.
Behoben wurde der IndexError der 26B und 31B Inferenz in
transformers.Behobene Kauderwelsch-Ausgaben für E2B/E4B wenn
use_cache=False. Siehe Issue #45242.Behoben float16-Audio Überlauf von
-1e9Werten.
Wenn du Losses über 13–15 siehst, zum Beispiel 100 oder 300 - wird die Gradientenakkumulation wahrscheinlich falsch gehandhabt. Das ist behoben in sowohl Unsloth und Unsloth Studio.
Gemma-4-Quant-Reuploads
Wir haben auch unsere Gemma-4-GGUFs aktualisiert, daher musst du sie erneut herunterladen. Auch diese Quantisierungsprobleme stehen nicht im Zusammenhang mit Unsloth und werden nicht von Unsloth verursacht:
CUDA: vor dem Fusen auf Pufferüberlappung prüfen – kritischer Fix für
<unused24>Tokens - PR #21566kv-Cache: Unterstützung für Attention-Rotation bei heterogenem iSWA - PR #21513Vokabular: Byte-Token-Behandlung zum BPE-Detokenizer für Gemma 4 hinzufügen - PR #21488konvertieren: setzen"add bos" == Truefür Gemma 4 - PR #21500allgemein: Gemma-4-spezifischen Parser hinzufügen - PR #21418llama-model: lesenfinal_logit_softcappingfür Gemma 4 - PR #21390llama: benutzerdefinierten Zeilenumbruch-Split für Gemma 4 hinzufügen - PR #21406
Unsloth-Studio-Updates
Hinzufügen spekulatives Decodieren Unterstützung (ngram-mod, standardmäßig aktiviert)
Llama.cpp auf die neueste Version mit allen Gemma-4-Fixes aktualisiert
Qwen3.5- und Gemma-4-Trainingsprobleme beheben
Export und Speichern von Gemma-4-Modellen aktivieren
Sandbox-Sicherheit für Terminal- und Python-Tools absichern
Rezepte das in Chat geladene Modell verwenden lassen
Leere Chat-Threads bei Navigation (und beim Wechseln von Tabs) beheben und den neuen Chat-Flow stabilisieren
Nicht-LLM-Rezepte ausführen lassen und den Daten-Tab bei Ausführungen an erste Stelle verschieben
Groß-/Kleinschreibung des zwischengespeicherten HF-Repos wiederverwenden, um doppelte Downloads zu verhindern
Google - Gemma 4
Du kannst jetzt die Gemma 4 Modelle in Unsloth ausführen und trainieren.
Intel-Mac funktioniert jetzt
Tool-Calls für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten
Vorgefertigte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU
Spekulatives Decodieren wurde für Nicht-Vision-Modelle hinzugefügt (Gemma-4 ist leider Vision und Qwen3.5)
Die Kontextlänge wird jetzt korrekt angewendet.
Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
90 % weniger HF-API-Aufrufe - weniger Rate-Limits
+50 % Genauigkeit beim Tool-Calling + mehr Unterstützung
Tool-Calls für alle Modelle sind jetzt +30 % bis +80 % genauer.
Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
Die Anzahl erlaubter Tool-Calls wurde von 10 auf 25 erhöht
Tool-Calls enden jetzt viel besser, sodass Schleifen/Wiederholungen reduziert werden
Mehr Tool-Call-Healing und Duplikatentfernungslogik, um zu verhindern, dass Tool-Calls ebenfalls XML auslaufen lassen
Getestet mit
unsloth/Qwen3.5-4B-GGUF(UD-Q4_K_XL), Websuche + Codeausführung + Thinking aktiviert.
XML-Leaks in der Antwort
10/10
0/10
Verwendete URL-Abrufe
0
4/10 Durchläufe
Durchläufe mit korrekten Songnamen
0/10
2/10
Durchschnittliche Anzahl von Tool-Calls
5.5
3.8
Durchschnittliche Antwortzeit
12,3 s
9,8 s
Neue Funktionen
Hinzugefügt benutzerdefinierte Ordner sodass du jede GGUF in jedem beliebigen Ordner verwenden kannst - vorerst Zugriff unter Erweiterte Einstellungen in Chat und Benutzerdefinierte Ordner
Update-Button jetzt sichtbar
Installationsskript-Design komplett aktualisiert!
Vorläufige Automatische Multi-GPU-Unterstützung für Inferenz und Training - nützlich für große Modelle, die nicht auf 1 GPU passen - Studio Auto weist GPU-Ressourcen zu
Intel-Macs sollten direkt nach der Installation funktionieren
Deutlich flüssigeres und schnelleres Studio
Zeitüberschreitungen beim Herunterladen großer Modelle behoben - keine Zeitüberschreitungen mehr sichtbar.
Rate-Limiting bei Hugging Face behoben - HF-API-Aufrufe um 90 % reduziert
bun unter Windows behoben und Installationen beschleunigt
Neue wichtige Updates
Es sind erst 2 Tage seit unserer vorherigen Version vergangen, aber wir haben wichtigere Updates:
Die Inferenz ist jetzt 20–30 % schneller. Zuvor konnten Tool-Calling und Repetition Penalty die Inferenz unter die normale Geschwindigkeit verlangsamen. Tokens/s der Inferenz sollten jetzt genauso gut performen wie
llama-server/llama.cpp.Erkennt jetzt automatisch ältere oder bereits vorhandene Modelle heruntergeladen von LM Studio, Hugging Face, und ähnlichen Quellen.
Die Geschwindigkeit der Inferenz-Tokens/s wird jetzt korrekt berechnet. Zuvor beinhaltete tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer wirkte, als sie tatsächlich war. Sie sollte jetzt die „echte“ Inferenzgeschwindigkeit widerspiegeln.
Die CPU-Auslastung steigt nicht mehr sprunghaft an. Zuvor änderte sich die Identität des Inline-Queryers bei jedem Rendern, wodurch
useLiveQuerysich kontinuierlich neu abonnieren konnte.Unsloth Studio hat jetzt eine Schließen-×-Schaltfläche und fährt korrekt herunter. Zuvor wurde es nach dem Öffnen über das Desktop-Symbol durch Schließen nicht korrekt beendet. Jetzt öffnet das Starten über die Verknüpfung auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Wenn es aus einer früheren Sitzung noch geöffnet ist, kannst du deinen Computer neu starten oder
lsof -i :8888dannkill -9 <PID>.Noch besseres Tool-Calling und Websuche mit reduzierten Fehlern.
Aktualisierte Dokumentation mit vielen neuen Informationen zu dem Löschen von Modellen, der Deinstallation usw.
Sauberere, intelligentere Installations- und Setup-Logs unter Windows und Linux. Die Ausgabe ist jetzt dank konsistenter Formatierung leichter lesbar, standardmäßig leiser für ein flüssigeres Erlebnis, und unterstützt ausführlichere
--verboseDiagnosen, wenn du vollständige technische Details möchtest.Du kannst jetzt deinen Trainingsverlauf ansehen!
Erster Release-Post nach Unsloth Studio
Hey Leute, dies ist unser erster Release seit dem Start von Unsloth Studio. Viele neue Funktionen und Fixes:
Du kannst Unsloth Studio jetzt aktualisieren! Bitte über dieselben Installationsbefehle aktualisieren.
Windows CPU oder GPU funktionieren jetzt nahtlos. Bitte neu installieren!
App-Verknüpfungen. Nach der Installation kannst du jetzt unter Windows, MacOS und Linux über ein Verknüpfungssymbol im Startmenü / Launch und auf dem Desktop starten.
Vorcompilierte
llama.cppBinärdateien undmamba_ssm- 6x schnellere Installationen! Außerdem <300 MB groß für Binärdateien.50 % kleinere Installationsgrößen (-7 GB oder mehr Einsparung), 2x schnellere Installationen und schnellere Auflösung. 50 % kleinere PyPI-Größen.
Tool-Aufrufe verbessert. Bessere llama.cpp-Analyse, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Panel für Tool-Ausgaben, Timer.
MacOS und CPU haben jetzt Datenrezepte mit Upload mehrerer Dateien aktiviert.
Vorläufige AMD-Unterstützung für Linux nur Maschinen - automatische Erkennung.
Neugestaltung der Einstellungs-Seitenleiste. Einstellungen sind jetzt gruppiert in Modell, Sampling, Tools und Einstellungen
Kontextlänge jetzt anpassbar. Beachten Sie, dass dies nicht nötig ist, da llama.cpp den genauen Kontext, den Sie benötigen, intelligent über
--fit onUpload mehrerer Dateien. Datenrezepte unterstützen jetzt mehrere Drag-and-Drop-Uploads für PDF, DOCX, TXT und MD, mit Extraktion im Backend, gespeicherten Uploads und verbesserten Vorschauen.
Colab mit kostenlosen T4-GPUs mit Unsloth Studio jetzt behoben! Hier ausprobieren. Durch vorkompilierte Binärdateien ist es außerdem 20x schneller!
Bessere Chat-Observability. Studio zeigt jetzt
llama-serverZeitmessungen und Nutzung, eine Nutzungsleiste für das Kontextfenster und umfangreichere Hover-Karten für Quellen.Insgesamt bessere UX - anklickbare Links, bessere LaTeX-Analyse, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!
LiteLLM - Unsloth Studio und Unsloth waren NICHT vom jüngsten LiteLLM-Kompromiss betroffen. Nemo Data Designer verwendete LiteLLM nur bis
1.80, nicht die betroffene1.82.7oder1.82.8, und hat es inzwischen vollständig entfernt.Wir haben jetzt einen neuen Einzeilen-Installationsbefehl, führen Sie einfach aus:
Fehlerbehebungen:
Verbesserungen für Windows/Setup. Stille Windows-Beendigungen, Startabstürze von Anaconda/conda-forge, fehlerhafte Windows-Installationen ohne NVIDIA und fehlende frühe CUDA-/stale-venv-Setup-Prüfungen behoben.
System-Prompts behoben. Sie funktionieren wieder für Text- und Vision-Inferenz ohne GGUF.
Persistente System-Prompts und Presets. Benutzerdefinierte System-Prompts und Chat-Presets bleiben jetzt über Neuladungen und Seitenwechsel hinweg erhalten.
GGUF-Export erweitert. Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportiert werden. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der Benutzeroberfläche deaktiviert.
Fehlerbehebungen für Scrollen/Layout im Chat. Probleme mit der Scrollposition während der Generierung, Layoutverschiebungen des Thinking-Panels und Sprünge des Viewports beim Einklappen von Reasoning-Panels behoben.
Intelligentere Erkennung von Portkonflikten. Studio erkennt jetzt Loopback-Konflikte, kann nach Möglichkeit den blockierenden Prozess identifizieren und gibt klarere Meldungen zum Ersatzport aus.
Neues Tool-Calling + Windows-Stabilität
Claude Artifacts funktioniert, sodass HTML im Chat wie ein Snake-Spiel ausgeführt werden kann
+30 % genauere Tool-Aufrufe, besonders für kleine Modelle + Timer für Tool-Aufrufe
Tool- und Websuchausgaben können gespeichert werden + Auto-Healing-Tool ein-/ausschalten
Viele Fehlerbehebungen - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen
Zuletzt aktualisiert
War das hilfreich?

