For the complete documentation index, see llms.txt. This page is also available as Markdown.

Unsloth-Updates

Unsloth-Changelog für unsere neuesten Releases, Verbesserungen und Fehlerbehebungen.

Um die neuesten Änderungen zu verwenden, Unsloth aktualisieren.

DeepSeek-V4 + NVFP4

Unsloth kann nach dem Training jetzt NVFP4-, FP8- und imatrix-GGUFs exportieren; als llama-swap-API-System fungieren; Unterstützung für Japanisch und brasilianisches Portugiesisch hinzufügen; und beinhaltet MLX, safetensors, Tool-Calling, Healing-Unterstützung und mehr. Der Unsloth-Kern macht GRPO 1,3x schneller, fügt einen HTTP-Fallback für festhängende Downloads hinzu, verbessert den Offline-Modus, beschleunigt das MoE-Training um 3–5x und behebt viele Fehler. Diese Release-Reihe verwendet unsloth>=2026.7.1.

DeepSeek-V4-Flash wird jetzt mit Thinking-Schaltern und unseren verbesserten Chat-Template-Fixes unterstützt.

Intelligentere OpenAI-kompatible API-Bereitstellung

Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agent-Tools.

  • API-Anfragen können zwischen heruntergeladenen lokalen GGUFs automatisch umschalten, während unbekannte Modellnamen weiterhin sicher das aktuelle Modell verwenden.

  • /v1/models gibt jetzt saubere Modell-IDs und den lokalen GGUF-Katalog statt lokaler .gguf -Pfade zurück.

  • Automatisches Entladen im Leerlauf kann nach Inaktivität VRAM freigeben, und Tool-Call-Healing kann jetzt pro Anfrage gesteuert werden.

Exportverbesserungen

Exporte sind flexibler und vermeiden unnötige Downloads.

  • Wähle mehrere Exportformate auf einmal aus, darunter portables FP8/INT8, GGUF LoRA, quellcodeangepasste Exporte, imatrix GGUF und komprimiertes FP8/FP4.

  • Multi-Checkpoint-Exporte vermeiden weitere wiederholte Basis-Modell-Downloads.

  • FP8-, INT8- und GGUF-LoRA-Exporte respektieren jetzt trust_remote_codeund der GGUF-Export geht zuverlässiger mit fehlenden Quantisierungseinstellungen um.

RAG und Datei-Chat

Datei-Chat ist bei echten Dokumenten nützlicher.

  • RAG-Anhänge können jetzt den Kontext des gesamten Dokuments verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.

  • Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich Text von rechts nach links, indischen Text und DOCX-Tabellen.

  • Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.

Unsloth-Politur und Zuverlässigkeit

Der tägliche Gebrauch sollte sich flüssiger und stabiler anfühlen.

  • Lange Trainings- und Chat-Läufe frieren weniger wahrscheinlich still ein.

  • Der Vergleichsmodus, der Modellwechsel, das Modellabbrechen, das Hub-Browsing und Hub Discover sind zuverlässiger.

  • Projekt-Exporte, Chat-Exporte, Einstellungen, geführte Rundgänge, Dateidialoge, Aktualisierungsbildschirme und die Reasoning-Oberfläche sind sauberer und konsistenter.

Installer-, Hardware- und Plattform-Fixes

Unsloth installiert und läuft plattformübergreifend zuverlässiger.

  • macOS-Installationen benötigen kein CMake oder Homebrew mehr, wenn ein vorgefertigtes llama.cpp verfügbar ist, und die Unterstützung für Apple Silicon behandelt Pfade mit Leerzeichen und die Größe des Unified Memory besser.

  • Der Windows-Start, die UTF-8-Behandlung, ROCm-RAG-Embedding und die ROCm-unter-WSL-GPU-Unterstützung wurden verbessert.

  • Die Auswahl vorgefertigter Blackwell-GPUs, GGUF-Passformprüfungen, Tensor Parallelism für Vision-/mmproj-GGUFs und die lokale llama.cpp Wiederverwendung sind jetzt zuverlässiger.

Training, Modelle und Kernel

Training und Modellladen sind in mehr Setups zuverlässiger.

  • GRPO unterstützt jetzt standardmäßig Sequence Packing, vermeidet wiederholte gemeinsame Prompts und behandelt DDP-Logit-Skalierung korrekt.

  • Full Fine-Tuning, RL-Präzisionseinstellungen, Gradient Checkpointing, DDP-RoPE-Puffer und MoE-LoRA-Erkennung wurden behoben.

  • FP8-Quantisierung/Dequantisierung, Llama-3-RoPE-Skalierung mit Transformers v5, PEFT-0.19-LoRA-Neuladevorgänge und fast_generate Fehlermeldungen wurden verbessert.

GLM 5.2 + Hub + 3x längere Kontexte

GLM-5.2 wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. 3x längere Kontextlängen sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP erreichbar, was längere Chats ermöglicht. Bypass-Permissions-Modus, verzweigte Chats, einreihbare Chats, ein neuer Hub zur Modellerkennung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende unsloth studio --secure für sicheren globalen HTTPS-Zugriff!

Besserer Algorithmus für Kontextlänge

Gemäß PR 1 und PR 2haben wir die Bestimmung des Speicherverbrauchs und der Kontextlänge in Unsloth Studio deutlich verbessert und insgesamt 3x längere Kontexte erreicht:

Szenario
KV
vorher
nachher

1x 32GB-Pipeline (~31 GB frei)

f16

23,040

64,000

q8_0

43,520

114,944

q4_0

82,432

199,680

2x 32GB-Pipeline

beliebig

262,144

262,144

2x 24GB-Tensor (~23 GB frei)

f16

134,049

262,144

q8_0

252,329

262,144

Chat-Canvas, Verzweigung & Warteschlange

  • Bearbeite Assistentennachrichten direkt und führe sie von jedem Punkt im Thread erneut aus.

  • Verzweige einen Thread, um ein Gespräch aufzuteilen, ohne das Original zu verlieren.

  • Temporäre (Inkognito-)Chats, die nichts hinterlassen.

  • Neue Prompts in die Warteschlange stellen, während eine Generierung noch läuft, statt zu warten.

  • Chat-„Artefakte“ sind jetzt Canvas, mit eingebetteten HTML-Canvas-Karten die automatisch gerendert werden, einer Code-Ansicht, und DiffusionGemma zeigt seinen Rohcode weiterhin direkt sichtbar statt eingeklappt.

  • Die Chat-Suche umfasst jetzt jede Nachricht und zeigt zuerst deine eigenen Nachrichten an.

Hub (neu gestaltet)

  • Vollseiten-Hub mit Trend-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.

  • README-Vorschau in einem Split-View-Feed, damit du vor dem Download lesen kannst.

  • Downloads verwenden standardmäßig das schnellere Xet -Transportprotokoll, mit automatischem HTTP-Fallback, falls eine Übertragung stockt.

  • Neuer Schalter „Beim Auswählen laden“, um Ladeoptionen festzulegen, bevor ein Modell geladen wird.

  • Google-Logo für DiffusionGemma und zukünftige Gemma-Derivate angezeigt.

Modelle & Inferenz

  • DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.

  • Schnelle Inferenz in der neuesten vLLM (0.22+) behoben, damit Beschleunigungen wieder funktionieren.

  • Tensor Parallelism ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, stellt er sich jetzt selbst wieder her, statt abzustürzen.

  • DiffusionGemma zeigt jetzt live das entstehende Bild, während es entrauscht wird, mit genauen Geschwindigkeitsstatistiken.

Sicherheit & Cloudflare-verschlüsselte Studios

  • Neu --secure nur-Cloudflare-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter --secureweiterhin aktiviert bleiben. Verwende unsloth studio --secure!

  • Bypass-Permissions-Modus, um Bestätigungen zu überspringen und die Tool-Sandbox bei Bedarf zu deaktivieren.

  • Automatische Erkennung von Hugging-Face-Virenprüfung + gefährlichen Dateien in Repos.

Protokollierung und API

  • Neu API-Server-Monitor in Studio.

  • Schnellere API-Aufrufe und geringere Latenz

  • Deutlich bessere, schlankere Logs - jetzt mit Durchsatz und Latenz und viele aufgeblähte Logs entfernt.

Hardware & Backend

  • Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs

  • Stilles Herabstufen auf CPU statt GPU beheben

  • Die torchao-Version wird jetzt aus dem installierten torch ausgewählt.

  • Der Installer repariert jetzt automatisch eine defekte oder nur-CPU-PyTorch-Installation und warnt vor stillem CPU-Fallback, auf NVIDIA + AMD unter Win/Linux/Mac/WSL.

  • Gibt den VRAM des Chat-Modells frei, wenn das Training startet, aber nur, wenn die GPU tatsächlich knapp ist (sonst keine unnötigen Neuladungen).

  • Wenn llama-server beim Start hart abstürzt, geht Studio jetzt eine Wiederherstellungsleiter durch, statt einfach zu scheitern.

Training & allgemeine Fixes & parallele Module

  • MLX-Trainingsupdates.

  • Verbesserte Zuverlässigkeit des GRPO-Trainings mit vLLM.

  • Trainingsstart zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.

  • Studio bereinigt übrig gebliebene Backend-Prozesse nach Abstürzen, Neustarts oder unterbrochenen Herunterfahrvorgängen jetzt zuverlässiger.

  • Export, Chat, Training und Rezepte sind alle individualisiert / isoliert! Das bedeutet, dass du jetzt alle 4 parallel machen kannst! Du kannst chatten / Inferenz durchführen, während du auf einen Trainingslauf oder einen Export wartest!

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

DiffusionGemma + Gemma 4 MTP

Stelle sicher, dass du die neueste v0.1.464-beta oder 2026.6.7. DiffusionGemma, Gemma 4 MTP und MiniMax-M3 werden jetzt alle unterstützt.

  • Ausführen und trainieren DiffusionGemma über Unsloth Studio.

  • Gemma 4 MTP ist da! Ausführen Gemma 4 ~2x schneller mit MTP.

  • Audio-Chat wird jetzt für Gemma 4 unterstützt (wav, mp3, m4a, flac, webm).

  • Preserve Think wurde zu Gemma 4 hinzugefügt.

Hub + Download-Manager (experimentell)

  • Eine neue Hub Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging-Face-Modellen und -Datensätzen hinzugefügt.

  • Unsloth kann jetzt Modelle und Datensätze auf deinem Rechner erkennen und sie neben heruntergeladenen Assets anzeigen.

  • Heruntergeladene GGUF-Modelle haben jetzt direkte Ausführen / Neuer Chat -Aktionen.

RAG / Mit Dateien chatten (experimentell)

  • Hinzugefügt Mit Dateien chatten in Studio, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.

  • Unterstützt hybrides Suchen, Zitate, PDF-Vorschauen, dokumente pro Thread und ein integriertes search_knowledge_base -Tool.

Neue Aktualisieren-Schaltfläche + Hardware-Unterstützung

  • Unsloth verwendet jetzt ständig frische, aktuelle llama.cpp-Vorab-Builds über CUDA, ROCm, Windows, Linux und macOS hinweg.

  • Eine integrierte llama.cpp aktualisieren -Schaltfläche hinzugefügt, damit Benutzer das lokale Backend aktualisieren können, ohne Studio neu zu installieren.

  • Verbesserte Windows-/WSL-AMD-Unterstützung, Strix-Halo-ROCm-Unterstützung, Blackwell-CUDA-Auswahlund klarere Installationsmeldungen.

Lokaler Chat, Tools & API-Kompatibilität

  • Lokales Tool-Calling ist zuverlässiger, mit besserer Sortierung der Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.

  • Verbesserte OpenAI-kompatible API und Anthropic-kompatibles API-Verhalten für lokale Studio-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und Claude-Code-Kompatibilität.

Training & Fixes

  • Verbesserte MLX-Unterstützung mit besseren Modellbezeichnungen, Statistiken zur Generierungsgeschwindigkeit und Fixes für VLM-Training.

  • Mehrere Trainings- und Datensatz- Randfälle wurden behoben, einschließlich nicht beschreibbarer Hugging-Face-Caches und benutzerdefinierter Datensatzzuordnungen.

  • Viele UI-Polish-Fixes über Chat, Menüs, Modellauswahl, Dark Mode, Import/Export und Einstellungen hinweg hinzugefügt.

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Gemma 4 12B, neue UI, MCP, Projekte

Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

Gemma 4 12B

Google veröffentlicht Gemma 4 12B, ein neues Modell, das lokal auf 8 GB RAM läuft. GGUF / Anleitung

Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führe das Modell über Unsloth Studio aus und trainiere es.

MCP

  • Entfernter MCP Server-Support, einschließlich benutzerdefinierter Header und OAuth

  • Lokaler befehlsbasierter MCP Server-Support

  • MCP kann jetzt im Chat-Composer eingeschaltet werden

  • Integrierte Voreinstellungen für gängige MCP Server

Neue Chat-UI

  • Projekte, Canvas, MCP, RAG- und Vergleichssteuerungen befinden sich jetzt im Plus-Menü

  • Suche- und Code-Steuerelemente sind vom Composer aus leichter zugänglich

  • Menüs, Overlays, Symbole und anklickbare Steuerelemente sind in Studio konsistenter

Projekte

  • Verwandte Chats in dedizierten Projekt-Arbeitsbereichen organisieren

  • Bestehende Chats in Projekte verschieben

  • Projekte direkt über die Seitenleiste erstellen und verwalten

Experimentelles Canvas / Artefakte

  • Öffnet generiertes HTML in einem dedizierten Canvas-Bereich innerhalb von Unsloth Studio

  • Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und per CDN geladener Pakete

  • Ermöglicht den Wechsel zwischen gerenderter Vorschau und Quellcode

Installation, Laufzeit und Hardware

  • Windows-Vorabinstallationen erfordern die frühe CUDA Toolkit -Prüfung nicht mehr

  • Linux llama.cpp -Vorab-Builds stimmen jetzt mit der erkannten Laufzeit cudart -Hauptversion

  • ROCm gfx-Erkennung wird in die Auswahl vorgefertigter Builds weitergeleitet

  • Blackwell, B300 und ARM64 Linux-Unterstützungsupdates

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

CUDA 13.3, Windows, Mac

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Mac-Updates

  • Wieder aktiviert llama.cpp vorgefertigte Binärdateien für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)

  • Apple Silicon Mac OS 13 (Ventura) ist ein Source-Build

  • Intel (x86_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet llama.cpp vorgefertigte Binärdateien

  • Intel für Max 13.0 - 13.2 ist ein Source-Build

Windows-Updates

  • CUDA 13.3 llama.cpp vorgefertigte Binärdateien funktionieren jetzt für Windows

  • Für CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte den CUDA-12.4-Fallback - wir arbeiten bald an CUDA-13.1-Binärdateien.

CUDA 13.3-Update

  • CUDA-13.3-Binärdateien außerhalb von Linux funktionieren. Wir werden vorerst weiterhin CUDA 13.1 verwenden

  • CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 - siehe https://github.com/unslothai/unsloth/issues/4849

Blackwell-GPU-Update

  • Vorerst wird Blackwell verzögerte Veröffentlichungen von llama.cpp vorgefertigten Binärdateien haben, da CUDA 12.4 nicht funktioniert - wir arbeiten daran, dies bald zu beheben.

Ein Update vor dem Revamp.

Hey Leute, wir machen noch ein weiteres Update vor einem größeren Revamp, der wahrscheinlich diese Woche oder nächste Woche kommt. Unser Revamp wird vieles ändern, besonders mit neuen wichtigen Funktionen und vielen Designänderungen.

  • NEU: API-Calling-Unterstützung jetzt mit Bilderzeugung + Bearbeitung, richtiger Websuche, Code-Ausführung, automatischem Prompt-Caching. Verbinde OpenAI, Anthropic und mehr.

  • Ordentliche Unterstützung für nicht-englische Sprachen z. B. Japanisch, Chinesisch, Indisch usw.

Viele von euch haben vielleicht unseren vorherigen Release verpasst, der nur einen Tag lang verfügbar war. Wir haben eingeführt:

  • Mit externen Inferenz-Backends verbinden: vLLM, Ollama, llama-server

  • Sicherheitsverbesserungen

  • Automatisches MTP-Speculative-Decoding für MTP-GGUFs; erhalte die besten Einstellungen, angepasst an deine Hardware.

API-Provider-Calling & externe Verbindungen

  • Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)

  • Integrierte Websuche für OpenAI, Anthropic, OpenRouter und Kimi

  • Integrierte Code-Ausführung für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)

  • Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.

  • Bilderzeugung + Bearbeitung

  • API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)

  • Modelle automatisch laden, wenn ein Cloud-Anbieter hinzugefügt wird

Weitere Unsloth-Studio-Updates

  • OpenDocument-Chat-Anhänge

  • o3-Reasoning-Zusammenfassungs-Payload

  • Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt

  • IME-Composer-Härtung, RTL dir="auto", Fix für das Abschneiden langer Logzeilen

  • Rendering von Tool-Reasoning-Traces in der UI

  • Vollständig offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training

Sicherheitsverbesserungen in Unsloth Studio

  • Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen

  • Sandboxed Worker mit einer verschärften Blockliste (bash, hf upload, NOFILE)

  • Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können

  • Strikte Schema-Validierung über die gesamte Studio-API hinweg

  • Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)

  • Entfernt den torch.load Fallback auf training_args.bin sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können

  • Abgesicherter Tauri-Desktop-Release-Flow

  • Frontend-Auth: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfsfunktion

  • Die Abbruchbereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals den Benutzerstatus löschen kann

MTP- und Unsloth-Fixes

Viele Bugfixes sowie UI-/UX-Fixes für Studio! Um die neuesten Updates zu erhalten, mache Folgendes:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Fehlerbehebungen

  1. Beheben Unsloth Studio Update nicht gut funktionieren

  2. Behebung des Hängenbleibens bei reset-password Seite

  3. Mehr Unterstützung für den Offline-Modus

  4. Verbessere, dass MTP auf Macs, CPUs und GPUs nicht schneller ist - jetzt ist es viel besser!

  5. Behebung, dass die Desktop-Verknüpfung nach dem Update nicht funktioniert

  6. Sehr, sehr viele UI-/UX-Bugfixes

Qwen3.6 MTP + API-Verbindungen

Wir haben viele neue Updates für Unsloth v0.1.41-beta:

  • ~2x schnellere GGUF-Inferenz mit automatisch aktiviertem MTP

  • API-Calling-Unterstützung für OpenAI, Anthropic usw. mit automatischem Prompt-Caching, Websuche, Codeausführung

  • Mit externen Inferenz-Backends verbinden: vLLM, Ollama, llama-server

  • Experimentell MLX-Inferenz

  • Ordentliche Unterstützung für nicht-englische Sprachen

  • Sicherheit Verbesserungen

Qwen3.6-Tutorials ausführenMTP-Leitfaden

Unterstützung für spekulatives Decodieren mit MTP: 1,4- bis 2-fach schnellere Inferenz!

  • Automatisches MTP-Speculative-Decoding für MTP-GGUFs; Warnung, wenn das mitgelieferte llama.cpp-Prebuild veraltet oder zu alt für MTP ist

  • Neue vorgefertigte llama.cpp-Binaries für MTP-Unterstützung!

API-Provider-Calling & externe Verbindungen

  • Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)

  • Integrierte Websuche für OpenAI, Anthropic, OpenRouter und Kimi

  • Integrierte Code-Ausführung für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)

  • Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.

  • API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)

  • Modelle automatisch laden, wenn ein Cloud-Anbieter hinzugefügt wird

MLX-Inferenz (experimentell)

  • MLX-Quants und Modelle können jetzt lokal auf deinen Mac-Rechnern ausgeführt werden!

  • Wir werden bald Thinking, Tools und Websuche hinzufügen!

Weitere Unsloth-Studio-Updates

  • Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt

  • OpenDocument-Chat-Anhänge

  • o3-Reasoning-Zusammenfassungs-Payload

  • IME-Composer-Härtung, RTL dir="auto", Fix für das Abschneiden langer Logzeilen

  • Rendering von Tool-Reasoning-Traces in der UI

  • Vollständig offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training

  • Viele UI/UX-Feinschliffe: Refactoring des dunklen Themes, Neugestaltung der rechten Seitenleiste, Faultier-Maskottchen für die Tageszeit, wegklickbare kopierbare Toasts, größerer Chat-Composer, Feinschliff an der Konfiguration der Codeausführung, Styling der Composer-Aktions-Pills, schmalerer Discord-Button

Trainings-Updates

  • Gemma-Attention-Masken-Fixes

  • GRPO mit mehreren Bildern

  • Experimente zur Rückgabe von GRPO-Hidden-States

  • Neue Continued-Pretraining-(CPT)-Trainingsmethode als erstklassige Option

  • Gemma-4-MoE-LoRA-Extractor registriert, um grouped_mm Contraction-Absturz

  • Optional aktiviertes gefused lm_head + Cross-Entropy-Forward, mit Single-Matmul-Pfad unter UNSLOTH_RETURN_LOGITS=1

  • Batchgröße für Eval übergeben

  • Eval-/Trainingspfade berücksichtigen jetzt HF_DATASETS_OFFLINE zusammen mit HF_HUB_OFFLINE

Sicherheitsverbesserungen in Unsloth Studio

  • Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen

  • Sandboxed Worker mit einer verschärften Blockliste (bash, hf upload, NOFILE)

  • Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können

  • Strikte Schema-Validierung über die gesamte Studio-API hinweg

  • Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)

  • Entfernt den torch.load Fallback auf training_args.bin sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können

  • Abgesicherter Tauri-Desktop-Release-Flow

  • Frontend-Auth: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfsfunktion

  • Die Abbruchbereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals den Benutzerstatus löschen kann

Unsloth-API-Endpunkt

v0.1.39-beta-Bugfix 5. Mai 2026

Behebt, dass der Chatverlauf nicht angezeigt wird (vorhandener Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler betraf nur das Rendering – verwende 2026.5.2 oder rufe direkt curl -fsSL https://unsloth.ai/install.sh | sh auf, um zu aktualisieren

Du kannst lokale LLMs mit Tools wie Claude Code und Codex verwenden, indem du sie mit Unsloths API-Endpunkt verbindest. So kannst du Modelle wie Qwen und Gemma lokal ausführen, mit zusätzlichen Funktionen wie selbstheilendem Tool-Calling, Codeausführung und Websuche.

Unsloth als API-Inferenz-Endpunkt zu verwenden ist nicht nur wegen der einfachen Einrichtung und der Geschwindigkeit vorteilhaft, sondern auch, weil Unsloth Folgendes bietet:

Neue Modelle

Wir haben auch einige neue Modelle zum Ausführen, darunter NVIDIA Nemotron 3 Nano Omni, IBM Granite 4.1 und Mistral 3.5 Medium. Wir haben Mistral bei der Behebung einiger Probleme mit der Implementierung in transformers und GGUFs geholfen.

Unsloth-Updates

  • Gestoppte Studio-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.

  • Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.

  • DPO-Trainings-Hänger in Multi-Prozess-Setups wurden behoben.

  • VLM-GRPO-Unterstützung mit MROPE-Updates verbessert.

  • Der Stopp-Button in Studio stoppt die Generierung jetzt korrekt.

  • Behebt, dass die Chat-Vorlage nach dem Browser-Refresh verschwindet.

Brandneues UI-Redesign

Hey Leute, wir haben die gesamte UI- und UX-Erfahrung von Unsloth Studio überarbeitet, um den Fokus auf Chat und Training zu legen:

  • Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

  • Du kannst jetzt Chats löschen und frühere Unterhaltungen durchsuchen

  • Neuer Schalter „Preserve Thinking“ für Modelle, die dies unterstützen, wie Qwen3.6

  • Saubereres, konsistenteres Design mit einfacher Navigation

  • Erweiterte Einstellungsseite mit Optionen zum Ändern von Profilbild, Namen und mehr

  • Kein doppeltes Eingeben deines Hugging-Face-Tokens mehr

  • gpt-oss hat jetzt Schalter für niedriges, mittleres und hohes Thinking.

  • Verwendet jetzt das neueste llama.cpp-Prebuild, sogar unter Linux CUDA

  • Viele Bugfixes sowie Verbesserungen bei Konsistenz und Stabilität

  • Kimi-K2.6 kann jetzt ausgeführt werden!

  • Wir haben außerdem experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. kommen nächste Woche.

Qwen3.6 wurde außerdem schon zuvor in Unsloth Studio für Ausführung und Training unterstützt. Du kannst Qwen3.6-27B jetzt sofort trainieren und ausführen!

Qwen3.6-27B + Kimi K2.6

Qwen3.6-27B kann jetzt in Unsloth Studio ausgeführt (18 GB RAM) und feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).

Unsloth Studio hat viele neue Updates erhalten, bitte aktualisieren. Details und ein ausführlicher Beitrag folgen in den nächsten Tagen.

Qwen3.6

Qwen3.6 kann jetzt in Unsloth Studio ausgeführt und feinabgestimmt werden. Das Modell läuft mit 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.

Gemma-4-Update + MiniMax-M2.7

Gemma-4-GGUFs wurden jetzt mit Googles offiziellen Chat-Vorlagen-Fixes aktualisiert (wodurch das Tool-Calling behoben/verbessert wurde), zusammen mit den neuesten llama.cpp-Fixes. Aktualisiere auf die neueste llama.cpp-Version, lade die Quants erneut herunter und du solltest kein unused token mehr sehen. MiniMax-M2.7 ist jetzt verfügbar! Du kannst das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. MiniMax-M2.7 GGUF

Gemma-4-Fixes

Wir haben Gemma 4 aktualisiert mit vielen Fixes. Diese Bugs sind universell und betrafen alle Trainingspakete und Implementierungen und stammen nicht von Unsloth. Wir haben die Bugs identifiziert, behoben, und das Training von Gemma 4 funktioniert jetzt in Unsloth korrekt.

Du brauchst nur 8 GB VRAM um zu trainieren Gemma-4-E2B lokal. Unsloth trainiert Gemma 4 ~1,5x schneller bei ~60 % weniger VRAM als FA2-Setups. Den vollständigen Leitfaden und Notebooks zum Training von Gemma 4, siehe unseren Blog.

Gemma-4-Trainingsfixes

  1. Gradientenakkumulation verursacht keine Loss-Explosionen mehr. Früher konnten die Losses auf 300–400ansteigen; der erwartete Loss liegt bei etwa 10–15.

  2. Behoben wurde der IndexError der 26B und 31B Inferenz in transformers.

  3. Behobene Kauderwelsch-Ausgaben für E2B/E4B wenn use_cache=False. Siehe Issue #45242.

  4. Behoben float16-Audio Überlauf von -1e9 Werten.

Wenn du Losses über 13–15 siehst, zum Beispiel 100 oder 300 - wird die Gradientenakkumulation wahrscheinlich falsch gehandhabt. Das ist behoben in sowohl Unsloth und Unsloth Studio.

Gemma-4-Quant-Reuploads

Wir haben auch unsere Gemma-4-GGUFs aktualisiert, daher musst du sie erneut herunterladen. Auch diese Quantisierungsprobleme stehen nicht im Zusammenhang mit Unsloth und werden nicht von Unsloth verursacht:

  1. CUDA: vor dem Fusen auf Pufferüberlappung prüfen – kritischer Fix für <unused24> Tokens - PR #21566

  2. kv-Cache: Unterstützung für Attention-Rotation bei heterogenem iSWA - PR #21513

  3. Vokabular: Byte-Token-Behandlung zum BPE-Detokenizer für Gemma 4 hinzufügen - PR #21488

  4. konvertieren: setzen "add bos" == True für Gemma 4 - PR #21500

  5. allgemein: Gemma-4-spezifischen Parser hinzufügen - PR #21418

  6. llama-model: lesen final_logit_softcapping für Gemma 4 - PR #21390

  7. llama: benutzerdefinierten Zeilenumbruch-Split für Gemma 4 hinzufügen - PR #21406

Unsloth-Studio-Updates

  • Hinzufügen spekulatives Decodieren Unterstützung (ngram-mod, standardmäßig aktiviert)

  • Llama.cpp auf die neueste Version mit allen Gemma-4-Fixes aktualisiert

  • Qwen3.5- und Gemma-4-Trainingsprobleme beheben

  • Export und Speichern von Gemma-4-Modellen aktivieren

  • Sandbox-Sicherheit für Terminal- und Python-Tools absichern

  • Rezepte das in Chat geladene Modell verwenden lassen

  • Leere Chat-Threads bei Navigation (und beim Wechseln von Tabs) beheben und den neuen Chat-Flow stabilisieren

  • Nicht-LLM-Rezepte ausführen lassen und den Daten-Tab bei Ausführungen an erste Stelle verschieben

  • Groß-/Kleinschreibung des zwischengespeicherten HF-Repos wiederverwenden, um doppelte Downloads zu verhindern

Google - Gemma 4

  • Du kannst jetzt die Gemma 4 Modelle in Unsloth ausführen und trainieren.

  • Intel-Mac funktioniert jetzt

  • Vorcompilierte Binärdateien für llama.cpp für 2 Gemma-4-Fixes:

    • vocab: Gemma4-Tokenizer fixen (#21343)

    • fix: Gemma-4-Vorlage (#21326)

  • Tool-Calls für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten

  • Vorgefertigte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU

  • Spekulatives Decodieren wurde für Nicht-Vision-Modelle hinzugefügt (Gemma-4 ist leider Vision und Qwen3.5)

  • Die Kontextlänge wird jetzt korrekt angewendet.

  • Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen

  • 90 % weniger HF-API-Aufrufe - weniger Rate-Limits

+50 % Genauigkeit beim Tool-Calling + mehr Unterstützung

  • Tool-Calls für alle Modelle sind jetzt +30 % bis +80 % genauer.

  • Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen

  • Die Anzahl erlaubter Tool-Calls wurde von 10 auf 25 erhöht

  • Tool-Calls enden jetzt viel besser, sodass Schleifen/Wiederholungen reduziert werden

  • Mehr Tool-Call-Healing und Duplikatentfernungslogik, um zu verhindern, dass Tool-Calls ebenfalls XML auslaufen lassen

  • Getestet mit unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL), Websuche + Codeausführung + Thinking aktiviert.

Metrik
Vorher
Nachher

XML-Leaks in der Antwort

10/10

0/10

Verwendete URL-Abrufe

0

4/10 Durchläufe

Durchläufe mit korrekten Songnamen

0/10

2/10

Durchschnittliche Anzahl von Tool-Calls

5.5

3.8

Durchschnittliche Antwortzeit

12,3 s

9,8 s

Neue Funktionen

  • Hinzugefügt benutzerdefinierte Ordner sodass du jede GGUF in jedem beliebigen Ordner verwenden kannst - vorerst Zugriff unter Erweiterte Einstellungen in Chat und Benutzerdefinierte Ordner

  • Update-Button jetzt sichtbar

  • Installationsskript-Design komplett aktualisiert!

  • Vorläufige Automatische Multi-GPU-Unterstützung für Inferenz und Training - nützlich für große Modelle, die nicht auf 1 GPU passen - Studio Auto weist GPU-Ressourcen zu

  • Intel-Macs sollten direkt nach der Installation funktionieren

Deutlich flüssigeres und schnelleres Studio

  • Zeitüberschreitungen beim Herunterladen großer Modelle behoben - keine Zeitüberschreitungen mehr sichtbar.

  • Rate-Limiting bei Hugging Face behoben - HF-API-Aufrufe um 90 % reduziert

  • bun unter Windows behoben und Installationen beschleunigt

Neue wichtige Updates

Es sind erst 2 Tage seit unserer vorherigen Version vergangen, aber wir haben wichtigere Updates:

  • Die Inferenz ist jetzt 20–30 % schneller. Zuvor konnten Tool-Calling und Repetition Penalty die Inferenz unter die normale Geschwindigkeit verlangsamen. Tokens/s der Inferenz sollten jetzt genauso gut performen wie llama-server / llama.cpp.

  • Erkennt jetzt automatisch ältere oder bereits vorhandene Modelle heruntergeladen von LM Studio, Hugging Face, und ähnlichen Quellen.

  • Die Geschwindigkeit der Inferenz-Tokens/s wird jetzt korrekt berechnet. Zuvor beinhaltete tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer wirkte, als sie tatsächlich war. Sie sollte jetzt die „echte“ Inferenzgeschwindigkeit widerspiegeln.

  • Die CPU-Auslastung steigt nicht mehr sprunghaft an. Zuvor änderte sich die Identität des Inline-Queryers bei jedem Rendern, wodurch useLiveQuery sich kontinuierlich neu abonnieren konnte.

  • Unsloth Studio hat jetzt eine Schließen-×-Schaltfläche und fährt korrekt herunter. Zuvor wurde es nach dem Öffnen über das Desktop-Symbol durch Schließen nicht korrekt beendet. Jetzt öffnet das Starten über die Verknüpfung auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Wenn es aus einer früheren Sitzung noch geöffnet ist, kannst du deinen Computer neu starten oder lsof -i :8888 dann kill -9 <PID>.

  • Noch besseres Tool-Calling und Websuche mit reduzierten Fehlern.

  • Aktualisierte Dokumentation mit vielen neuen Informationen zu dem Löschen von Modellen, der Deinstallation usw.

  • Sauberere, intelligentere Installations- und Setup-Logs unter Windows und Linux. Die Ausgabe ist jetzt dank konsistenter Formatierung leichter lesbar, standardmäßig leiser für ein flüssigeres Erlebnis, und unterstützt ausführlichere --verbose Diagnosen, wenn du vollständige technische Details möchtest.

  • Du kannst jetzt deinen Trainingsverlauf ansehen!

Erster Release-Post nach Unsloth Studio

Hey Leute, dies ist unser erster Release seit dem Start von Unsloth Studio. Viele neue Funktionen und Fixes:

  • Du kannst Unsloth Studio jetzt aktualisieren! Bitte über dieselben Installationsbefehle aktualisieren.

  • Windows CPU oder GPU funktionieren jetzt nahtlos. Bitte neu installieren!

  • App-Verknüpfungen. Nach der Installation kannst du jetzt unter Windows, MacOS und Linux über ein Verknüpfungssymbol im Startmenü / Launch und auf dem Desktop starten.

  • Vorcompilierte llama.cpp Binärdateien und mamba_ssm - 6x schnellere Installationen! Außerdem <300 MB groß für Binärdateien.

  • 50 % kleinere Installationsgrößen (-7 GB oder mehr Einsparung), 2x schnellere Installationen und schnellere Auflösung. 50 % kleinere PyPI-Größen.

  • Tool-Aufrufe verbessert. Bessere llama.cpp-Analyse, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Panel für Tool-Ausgaben, Timer.

  • MacOS und CPU haben jetzt Datenrezepte mit Upload mehrerer Dateien aktiviert.

  • Vorläufige AMD-Unterstützung für Linux nur Maschinen - automatische Erkennung.

  • Neugestaltung der Einstellungs-Seitenleiste. Einstellungen sind jetzt gruppiert in Modell, Sampling, Tools und Einstellungen

  • Kontextlänge jetzt anpassbar. Beachten Sie, dass dies nicht nötig ist, da llama.cpp den genauen Kontext, den Sie benötigen, intelligent über --fit on

  • Upload mehrerer Dateien. Datenrezepte unterstützen jetzt mehrere Drag-and-Drop-Uploads für PDF, DOCX, TXT und MD, mit Extraktion im Backend, gespeicherten Uploads und verbesserten Vorschauen.

  • Colab mit kostenlosen T4-GPUs mit Unsloth Studio jetzt behoben! Hier ausprobieren. Durch vorkompilierte Binärdateien ist es außerdem 20x schneller!

  • Bessere Chat-Observability. Studio zeigt jetzt llama-server Zeitmessungen und Nutzung, eine Nutzungsleiste für das Kontextfenster und umfangreichere Hover-Karten für Quellen.

  • Insgesamt bessere UX - anklickbare Links, bessere LaTeX-Analyse, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!

  • LiteLLM - Unsloth Studio und Unsloth waren NICHT vom jüngsten LiteLLM-Kompromiss betroffen. Nemo Data Designer verwendete LiteLLM nur bis 1.80, nicht die betroffene 1.82.7 oder 1.82.8, und hat es inzwischen vollständig entfernt.

  • Wir haben jetzt einen neuen Einzeilen-Installationsbefehl, führen Sie einfach aus:

Fehlerbehebungen:

  • Verbesserungen für Windows/Setup. Stille Windows-Beendigungen, Startabstürze von Anaconda/conda-forge, fehlerhafte Windows-Installationen ohne NVIDIA und fehlende frühe CUDA-/stale-venv-Setup-Prüfungen behoben.

  • System-Prompts behoben. Sie funktionieren wieder für Text- und Vision-Inferenz ohne GGUF.

  • Persistente System-Prompts und Presets. Benutzerdefinierte System-Prompts und Chat-Presets bleiben jetzt über Neuladungen und Seitenwechsel hinweg erhalten.

  • GGUF-Export erweitert. Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportiert werden. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der Benutzeroberfläche deaktiviert.

  • Fehlerbehebungen für Scrollen/Layout im Chat. Probleme mit der Scrollposition während der Generierung, Layoutverschiebungen des Thinking-Panels und Sprünge des Viewports beim Einklappen von Reasoning-Panels behoben.

  • Intelligentere Erkennung von Portkonflikten. Studio erkennt jetzt Loopback-Konflikte, kann nach Möglichkeit den blockierenden Prozess identifizieren und gibt klarere Meldungen zum Ersatzport aus.

Neues Tool-Calling + Windows-Stabilität

  • Claude Artifacts funktioniert, sodass HTML im Chat wie ein Snake-Spiel ausgeführt werden kann

  • +30 % genauere Tool-Aufrufe, besonders für kleine Modelle + Timer für Tool-Aufrufe

  • Tool- und Websuchausgaben können gespeichert werden + Auto-Healing-Tool ein-/ausschalten

  • Viele Fehlerbehebungen - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen

Zuletzt aktualisiert

War das hilfreich?