> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/changelog.md).

# Unsloth-Updates

Unsloth-Changelog für unsere neuesten Releases, Verbesserungen und Fehlerbehebungen.

Um die neuesten Änderungen zu verwenden, [Unsloth aktualisieren](/docs/de/neu/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-09-17" tags="new-releases" %}

## Docker + Multiuser + AMD-Unterstützung

Wir veröffentlichen unser neues, aktualisiertes Docker-Image zusammen mit Multiuser-Konten, RDNA1+2, FP8/INT8-Diffusionsunterstützung, ARM64-CUDA-Windows-Unterstützung und vielen Verbesserungen beim Training, GRPO und der Inferenz

#### Highlights:

* Aktualisiertes Docker mit NVIDIA- und AMD-Unterstützung: [Anleitung](https://unsloth.ai/docs/get-started/install/docker)
* Multiuser-Konten mit Isolierung: **Settings > Accounts**
* INT8/FP8-Bild-Diffusionsinferenz: 2x schneller
* ARM64-Windows-CUDA-Unterstützung für Training und Inferenz
* GRPO: Unterstützung für Qwen3.5 und die neueste TRL/vLLM
* AMD RDNA1- und RDNA2-Unterstützung
* Bessere Erkennung und Wiederherstellung von NVIDIA-GPUs unter Windows

#### Aktualisiertes Docker-Image

* Aktualisiertes CUDA-Image und Studio-Setup, gebündelte Caches entfernt und Unsloths Trainings-Patches auf GPU-Hosts wiederhergestellt.
* Studio-Daten bleiben auf einem Volume erhalten, ohne den App-Code zu fixieren. Verbesserte Updates, generierte Passwörter, konfigurierbare Ports und Beibehaltung von Paketen.
* Ein AMD-ROCm-Image für unterstützte Linux-Hosts hinzugefügt.

#### Multiuser-Konten

* Konten erstellen in **Settings > Accounts** mit einmaligen Einrichtungs-Codes und individuellen Passwörtern.
* Konten halten Arbeit getrennt, während sie ein geladenes Modell gemeinsam nutzen, wenn die Einstellungen übereinstimmen. Das Verhalten für Einzelkonten bleibt unverändert.

#### Chat + Reasoning

* Wartende Prompts bearbeiten, neu anordnen und steuern, selbst während ein lokales Modell lädt.
* GGUF-Reasoning-Budgets, anpassbare Chat-Breite, Desktop-Skalierung und ein kompakter Composer hinzugefügt.
* Reaktionsfähigkeit bei langem Reasoning, Beibehaltung des Chat-Verlaufs und Umgang mit durch Tools erzeugten Dateien und Bildern verbessert.

#### Hardware + Inferenz

* MLX erhält Videoeingaben, optionale MoE- und Dekodierungsoptimierungen sowie zuverlässigere multimodale Chats.
* GGUF-Speicherschätzungen, DGX-Spark-Verarbeitung, NVIDIA-Erkennung, NVLink-Prüfungen und die vom Benutzer gewählte GPU-Reihenfolge verbessert.
* Native Windows-ARM64-Desktop-Paketierung hinzugefügt, Qwen3.5 `fast_inference`und Ascend-NPU-Erkennung.

#### Research + API

* Deep Research bewahrt unvollständige Berichte besser, verarbeitet JSON-Ausgabe und kennzeichnet Durchläufe ohne Belege. Gescannte PDF-Uploads erhalten einen lokalen OCR-Fallback.
* Provider-Steuerungen für Reasoning, MCP-Kompatibilität, Tool-Calling und gestreamte Fehlerberichte verbessert.
* Hinzugefügt `/v1/chat/completions` Videoeingabe und API-Zugriff auf installierte Ollama-Modelle.

#### Training + Installation

* Data-Recipes-Datensatz-Downloads hinzugefügt und 16-Bit-Fine-Tune-Exporte, LoRA-Speicherungen und Push to Hub behoben.
* Datensatzbehandlung, Trainings-Speicherschätzungen und Checkpoint-Speicherungen beim Herunterfahren des Containers verbessert. Kernkorrekturen betreffen Normalisierung, RoPE, Q-GaLore und die verteilte Geräteauswahl.
* Windows-Installationen, Reparatur von GPU-Paketen, Abhängigkeits-Cache und verifizierte Offline-Installationen verbessert.

#### Sicherheit + Tool-Ausführung

* Schutz von Anmeldedaten und Validierung von Tool-Aufrufen verstärkt, mit Genehmigungsanfragen für Dateizugriff außerhalb der Sandbox.
* Vorschau auf Sandboxierung von Tools auf Betriebssystemebene auf unterstützten Linux- und macOS-Hosts hinzugefügt. Netzwerkzugriff bleibt uneingeschränkt; der automatische Modus behält bestehende Schutzmaßnahmen bei, wenn OS-Isolierung nicht verfügbar ist.

<a href="/docs/de/erste-schritte/install/docker.md" class="button primary">Docker-Anleitung</a>
{% endupdate %}

{% update date="2026-09-02" tags="new-releases" %}

## 2x schnelleres Qwen3.8-Flash + GLM-5.3

Ausführen [**Qwen3.8-Flash-Next**](/docs/de/modelle/qwen3.8-next.md) und [**GLM-5.3-Flash**](/docs/de/modelle/glm-5.3-flash.md) bis zu **2× schneller** mit schnellerem Decoding und Bonus-MTP, jetzt standardmäßig aktiviert. Diese Veröffentlichung enthält außerdem **170+ Verbesserungen** über Training, Chat, Hardware-Unterstützung, APIs und Leistung hinweg.

* Schnellere Qwen- und GLM-Generierung mit MTP, plus verbesserte Tool-Nutzung und empfohlene Qwen-Einstellungen.
* Deutlich weniger träge UI/UX für alle Chats, besonders bei langen Unterhaltungen
* Neue Unterstützung für **MiniMax-Music3, Higgs und MOSS** Audio-Modelle, einschließlich Fortschrittsverfolgung und Clip-Verwaltung.
* Zuverlässigeres Laden von Modellen über lokale Server und verbundene Anbieter hinweg.
* Sichereres Bearbeiten von Chats, das Tool-Aufrufe, Antworten, Medien und Gesprächsverzweigungen beibehält.
* Verbesserte Multi-GPU-Trainings, Speicheranpassung, Modellplatzierung und GGUF-Exporte.
* Stärkere AMD/ROCm-Installation, Erkennung und GPU-Kompatibilität.
* Zuverlässigeres MCP, Deep Research, OAuth, parallele Tool-Aufrufe und Agenten-Workflows.
* Neue OpenAI-kompatible APIs für **Video-, Audio- und von MLX bereitgestellte Modelle**.
* Desktop-Updates, LAN-Port-Steuerung, Downloads und Bereinigung des GPU-Speichers verbessert.

<a href="/docs/de/modelle/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/de/modelle/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/de/modelle/glm-5.3.md" class="button primary">GLM-5.3</a>
{% endupdate %}

{% update date="2026-08-27" tags="new-releases" %}

## Qwen3.8-Flash-Next + GLM-5.3

[Qwen3.8-Flash-Next](/docs/de/modelle/qwen3.8-next.md), [GLM-5.3-Flash](/docs/de/modelle/glm-5.3-flash.md) + [GLM-5.3](/docs/de/modelle/glm-5.3.md) kann jetzt lokal in Unsloth ausgeführt werden!

* Qwen3.8-Flash läuft mit 75 GB RAM
* GLM-5.3-Flash läuft mit 102 GB RAM + VRAM
* Bis zu 5x schnelleres RAM-Offloading
* Wiederholte Auto-Compaction funktioniert jetzt zuverlässig
* 100+ Verbesserungen bei Chat, Zuverlässigkeit und Leistung

<a href="/docs/de/modelle/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/de/modelle/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/de/modelle/glm-5.3.md" class="button primary">GLM-5.3</a>

<div align="left"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1YneA51oWzaIiwep9H5I%2F1000024423.gif?alt=media&amp;token=40a169cc-12f1-403a-898c-b310f81ff52a" alt="" width="375"><figcaption></figcaption></figure></div>

#### Qwen3.8-Flash-Next

125B multimodales Reasoning-Modell und frühe Vorschau auf die Architektur von Qwen4.

* 1-Bit Dynamic GGUF läuft mit 75 GB RAM oder Unified Memory
* Bis zu 262K Kontext mit Text und Bildern
* Reasoning-Modi: Keine, Niedrig, Mittel und Sehr hoch
* Erhaltenes Denken verbessert die Konsistenz in langen Chats

#### GLM-5.3-Flash

320B multimodales Modell mit 18B aktiven Parametern.

* 1-Bit-Modell läuft mit 102 GB kombinierter RAM + VRAM
* Bis zu 1M Kontext für Text, Bilder und Dokumente
* Reasoning-Modi: Niedrig, Hoch und Max
* Verbesserte Leistung bei Coding, Agenten und Vision

#### Unsloth-Verbesserungen

* Große GGUFs werden automatisch auf GPU- und Systemspeicher aufgeteilt
* Speicherschätzungen vor dem Laden anzeigen
* Chats stellen sich nach Verbindungsabbrüchen wieder her
* Bessere Multi-Bild-Vision und MCP-Bildunterstützung
* Chats als JSONL exportieren
* Verbesserte Auto-Compaction-Steuerung
* Fehlerbehebungen für Linux, NVIDIA Wayland, AMD und Windows

Um die neuen Modelle auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-20" tags="new-releases" %}

## Auto-Compaction + LAN-Zugriff

Danke für die Unterstützung für Qwen3.8-27B und Unsloth Desktop letzte Woche! Für unsere [neue `v0.1.801-beta` Veröffentlichung](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta)haben wir 200+ PRs zusammengeführt, um viele neue Funktionen und Fehlerbehebungen einzuführen, darunter:

* **Auto-Compaction (experimentell)** für längere Chats jenseits der Kontextgrenzen
* [**Remote- & LAN-Zugriff (Vorschau)**](/docs/de/grundlagen/lan.md) für einfachen Netzwerkzugriff ohne Cloudflare-Links
* **Schnellerer Chat** - Verbesserte Streaming-Leistung, reduzierte UI-Latenz und flüssigere lange Unterhaltungen.
* Unterstützung für **benutzerdefinierte llama.cpp-Builds**. Umschalter für Cache-RAM, Mmap, Mlock, Checkpoints, Spe-Decoding, KV-Cache, Vision Ein / Aus
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) ist veröffentlicht. Neue Qwen3.8-27B Dynamic v3.0 GGUFs liefern >10 % höhere Top-1-Genauigkeit als alle anderen. Funktioniert mit Unsloth.

#### Auto-Compaction (experimentell)

Lange Chats können nun Kontextgrenzen überschreiten, indem ältere Gesprächszüge in ein durchsuchbares Archiv verschoben werden.

* Ältere Gesprächszüge werden nur bei Bedarf entfernt und bleiben durchsuchbar.
* Frische Kontext-Epochen verbessern das Abrufen, ohne Chats dauerhaft zu kürzen.
* Verwendet Retrieval statt Zusammenfassung für höhere Genauigkeit.

#### Remote- & LAN-Zugriff (Vorschau)

Greife von anderen Geräten in deinem Netzwerk auf Unsloth zu.

* Neue Einstellungen für den Fernzugriff.
* LAN-Steuerung, QR-Codes und Auto-Start-Optionen.
* Aus Sicherheitsgründen standardmäßig deaktiviert.

#### Chat-Verbesserungen

* Schnellere lange Chats und verbesserte Threading-Unterstützung.
* Projekte organisieren Chats, Dateien und Arbeitsbereiche.
* Prompt-Warteschlange, Tastenkürzel, `edit_file`und bessere Tool-Unterstützung hinzugefügt.

#### Hardware, Inferenz, API

* Unterstützung für benutzerdefinierte llama.cpp-Builds und Intel XPU.
* Mehr Inferenz-Steuerungen (Cache, mmap, mlock, Checkpoints, spekulatives Decoding, Vision).
* GPU-Validierung, VRAM-Verarbeitung und Kompatibilität verbessert.
* Strukturierte Ausgaben in der Responses API.
* Bessere Wiederherstellung von llama-server.

Um Qwen3.8 auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B und Qwen3.8-2.4T können jetzt lokal in Unsloth ausgeführt werden!

Mit Unsloth Dynamic GGUFs auf 17 GB RAM ausführbar. Du kannst Qwen3.8-27B auch in Unsloth feinabstimmen. Qwen3.8-27B ist mit großem Abstand das stärkste Modell seiner Größe. Wir haben außerdem NVFP4-Quants hochgeladen.

<a href="/docs/de/modelle/qwen3.8.md" class="button primary">Qwen3.8-Anleitung ausführen</a><a href="/docs/de/modelle/muse-glimmer/train.md" class="button secondary">Muse Glimmer feinabstimmen</a>

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FSqxs6NjShWrLfRKhDy1m%2Fvolcano%202.gif?alt=media&amp;token=395274a0-b437-403a-8a01-8e8502f9d225" alt="" width="375"><figcaption></figcaption></figure>

Weitere Unsloth-Updates umfassen:

* Qwen3.8-27B + zusätzliche llama-server-Argumente erlaubt + benutzerdefinierter VRAM-Schalter
* Externer Anbieter mit Tool-Calling + Tool-Unterstützung + Anmeldung mit Codex
* Schnelles FP8, 10x schnellere MiniMax-H3-Inferenz (3 Minuten statt 30)
* 10 % schnellere Inferenz für GGUFs + Umgehung von Berechtigungen behoben
* Verbunden [API-Anbieter](/docs/de/integrationen/connections.md) können ihre eigene Suche oder die integrierte Suche und Tools von Unsloth Desktop verwenden. Tool-Ergebnisse werden an das Modell zurückgegeben, damit es mehrstufige Aufgaben fortsetzen kann.
* Melde dich mit einem Codex-Abonnement an und verwende Codex-Tools in Chat.

Um Qwen3.8 auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## Einführung von Unsloth Desktop

Einführung von Unsloth Desktop 🦥 - die erste Desktop-App, um Modelle lokal auszuführen und zu trainieren.\
Open Source. Läuft auf Mac, Windows und Linux

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FyUdniXManojk20Q3M5Lf%2Fintroducing%20unsloth%20desktop%20thumb.png?alt=media&amp;token=5ecd2f25-b996-4749-8242-ffd21b080ae7" alt=""><figcaption></figcaption></figure>

• Unterstützt MLX, Diffusionsbilder/-videos, Audio, GGUF\
• Verbinde Claude Code und Codex mit lokalen LLMs\
• 50 % genauere, selbstheilende Tool-Aufrufe + isolierte Codeausführung in der Sandbox\
• Funktioniert für CPU- und Multi-GPU-Setups - NVIDIA, AMD, Intel, Mac\
• Modelle 2× schneller mit 70 % weniger VRAM trainieren\
• Private Websuche, Deep Research, RAG, MCP + Exporte (NVFP4, GGUF)\
• Verwende Unsloths OpenAI-kompatible API und Cloud-Modelle\
• LLMs sicher remote bereitstellen und von überall zugreifen

Du kannst Unsloth Desktop jetzt herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer ist da!

Meta hat Muse Glimmer veröffentlicht, das erste offene Modell aus den Meta Superintelligence Labs. Muse Glimmer ist ein dichtes Modell mit 30B Parametern von Meta, entwickelt für lokale agentische und Coding-Workflows. Veröffentlicht unter der Apache-2.0-Lizenz kannst du Muse Glimmer 30B über Unsloth und Unsloth-Dynamic-Quants für die beste Leistung ausführen.

<a href="/docs/de/modelle/muse-glimmer.md" class="button primary">Muse Glimmer ausführen</a><a href="/docs/de/modelle/muse-glimmer/train.md" class="button secondary">Muse Glimmer feinabstimmen</a>

Muse Glimmer 30B kann lokal laufen auf **20 GB RAM/VRAM** Setups, einschließlich Mac und GPUs. Du kannst Muse Glimmer 30B auch mit Unsloth auf **20 GB VRAM**.

ausführen und feinabstimmen über die Unsloth-Desktop-App:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + Deep Research + Parallel Chat

Hallo zusammen! [Kimi K3](/docs/de/modelle/kimi-k3.md) kann jetzt lokal mit Unsloth Dynamic GGUFs ausgeführt werden, Unsloth kann mehrere Chats parallel generieren lassen, und der neue Deep-Research-Modus plant, liest und zitiert Quellen mithilfe deines lokalen Modells.

Diese Veröffentlichung bringt außerdem bessere [AMD](/docs/de/grundlagen/amd.md) - und Intel-GPU-Unterstützung, DoRA-Training und viele Fehlerbehebungen bei Installer, MLX, Export und Inferenz.

#### Kimi K3

Moonshot AI **Kimi K3** ist ein MoE-Modell mit 2,8 Billionen Parametern und 104 Milliarden aktiven Parametern, nativer Vision-Unterstützung und einem Kontextfenster von 1 Mio. Kimi K3 denkt nur und Unsloth unterstützt niedrigen, hohen und maximalen Reasoning-Aufwand.

Du kannst unsere [Kimi K3 Dynamic GGUFs](https://huggingface.co/unsloth/Kimi-K3-GGUF) über Unsloth ausführen. Unsloth erkennt Multi-GPU-Setups automatisch und kann Modellschichten in den Systemspeicher auslagern.

Kimi K3 ist ein sehr großes Modell, plane deine Hardware also entsprechend:

* `UD-IQ1_S` belegt 595 GB Speicherplatz.
* `UD-Q4_K_XL` belegt 1,51 TB Speicherplatz.
* Für verlustfreie Inferenz verwende `UD-Q8_K_XL`, das 1,56 TB Speicherplatz benötigt.

Lies unsere vollständige [Kimi K3-Anleitung](https://unsloth.ai/docs/models/kimi-k3) und erfahre mehr über [Unsloth Dynamic 2.0 GGUFs](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### Parallel Chat

Unsloth kann jetzt mehrere Unterhaltungen gleichzeitig ausführen. Das Starten eines **Neuen Chats** lässt die vorherige Antwort weiter generieren, und jede aktive Unterhaltung erhält ihre eigene Fortschrittsanzeige und Stop-Steuerung.

* Standardmäßig 4 llama-server-Slots, im Web-UI anpassbar.
* Tools, Uploads, Selbstheilung und Agenten bleiben zwischen Chats isoliert.
* Stoppe einen Chat, ohne andere zu unterbrechen oder den Server neu zu starten.
* Unsloth reduziert die Slot-Anzahl, wenn der Speicher begrenzt ist.
* Das Neuladen des Modells stoppt aktive Chats nach Bestätigung weiterhin.

#### Deep Research

Deep Research verwandelt ein lokales Modell in einen vollständigen Research-Workflow. Gib ihm eine Frage, und es erstellt einen Plan, sucht im Web, organisiert die Belege und erstellt einen zitierten Bericht.

* Überprüfe und bearbeite den Plan, bevor die Recherche beginnt.
* Verfolge den Fortschritt und die gesammelten Quellen, während es arbeitet.
* Fortsetzen oder abbrechen, ohne abgeschlossene Recherche zu verlieren.
* Websites erlauben oder blockieren, um die Quellenauswahl zu steuern.
* Quellen und Zitate bleiben mit jedem Lauf gespeichert.
* Vor dem Schreiben prüft Unsloth auf nicht unterstützte Behauptungen, Widersprüche und ungelöste Lücken. Empfehlungen ohne direkte Belege werden als überprüfbare Schlussfolgerungen markiert.

Pro Chat kann nur ein Lauf aktiv sein. Deep Research funktioniert derzeit mit lokalen Modellen. Optionales Grounding über die gesamte Seite kann die Top-Suchergebnisse vor der Synthese in temporäres RAG einlesen; aktiviere es mit `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`. Es bleibt standardmäßig deaktiviert, weil es zusätzliche Scraping-Zeit hinzufügt und weiteren Kontext benötigt.

#### Verbesserte AMD-Unterstützung

Dieses Update baut auf unserem ursprünglichen [AMD-Release und Einrichtungsleitfaden](https://unsloth.ai/docs/basics/amd) mit Unterstützung für mehr GPUs und zuverlässigerer ROCm-Inferenz und -Training auf.

* Verbesserte Erkennung für RDNA2-, Radeon-, Ryzen-, Strix-Halo- und Workstation-GPUs.
* MI50 und Radeon VII unterstützen 16-Bit-LoRA und vollständiges Fine-Tuning unter Linux.
* 4-Bit-NaNs, Bibliothekskonflikte und lange RDNA-Startverzögerungen behoben.
* Nicht unterstützte Windows-HIP-GPUs können auf Vulkan zurückfallen.
* Vulkan-Geräte zeigen ihre echten Namen an und können einzeln ausgewählt werden.
* Saubere Windows-Installationen benötigen Winget oder Entwickler-Tools nicht mehr.

#### Training, Modelle und Plattform-Updates

* Intel XPU ermöglicht lokalen Chat und Training auf Intel-Arc- und Data-Center-GPUs.
* DoRA ist neben LoRA und vollständigem Fine-Tuning verfügbar.
* Große Exporte können alle sichtbaren GPUs nutzen, um Speicherlimits von GPU 0 zu vermeiden.
* MLX fügt Streaming-Datensätze, fortgesetztes Pretraining, Callbacks und bessere VLM- und LoRA-Unterstützung hinzu.
* Falsch korrigiert `flash_attention_2` Modellausgabe.
* Unsloth und Speicherwerkzeuge funktionieren jetzt ohne bitsandbytes.
* Behoben `.json` Datensätze und Qwen3.5/3.6 MoE- und GRPO-Notebook-Setup.
* Hub-Download-Ordner sind leichter zu finden und zu öffnen.
* Versionshinweise sind im Unsloth-Update-Popup verfügbar.
* `unsloth start --as-subagent` ermöglicht es Codex, Claude Code und Pi, Aufgaben an ein lokales Unsloth-Modell zu delegieren.
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD-Unterstützung ist da!

Hallo zusammen! Diese Veröffentlichung bringt lokales LLM-Training und Inferenz auf [AMD-GPUs](/docs/de/grundlagen/amd.md) unter Windows, WSL und Linux.

<a href="/docs/de/grundlagen/amd.md#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Schnellstart</a><a href="/docs/de/grundlagen/amd.md#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Funktionen</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

Ab heute ermöglichen unsere AMD-Zusammenarbeit, benutzerdefinierte Triton-Kernels und mathematische Algorithmen das Trainieren und Ausführen von 500+ Modellen auf AMDs Radeon-, Instinct-, Vulkan-, Ryzen- und Data-Center-GPUs, bis zu 2× schneller mit 70 % weniger VRAM und ohne Genauigkeitsverlust. Optimierte ROCm-Builds unterstützen außerdem GGUF- und Safetensors-Inferenz.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Update vom 23. Juli

1. Hinzugefügt **RDNA2-, Gorgon-Halo-, Vulkan-Unterstützung** + behoben, dass die AMD-Installation GPUs auf Strix Halo / anderen AMD-GPUs nicht erkennt
2. Besseres RDNA4 sowie automatisches Beheben und Erkennen von HIP-/ROCm-Fehlern
3. **2x schnellerer Unified Memory** AMD-Safetensors-Laden + deutlich schnelleres Gradient Checkpointing für Unified-Memory-Geräte
4. Hinzugefügt **Sprachdiktat / whisper.cpp** vorläufige Unterstützung für schnelles Text-to-Speech
5. Behoben, dass Rollback-Umgebungen bei Installationen 5 GB Speicherplatz verbrauchen - werden jetzt automatisch bereinigt

#### LLMs lokal auf AMD trainieren

* Modelle lokal auf AMD-GPUs trainieren, ausführen, mit RL chatten und bereitstellen.
* Zuverlässigere AMD-GPU-Erkennung und -Installation unter Windows, WSL und Linux.
* Verbesserte ROCm-Kompatibilität für AMD-MI300X- und MI325X-GPUs.
* Remote-Zugriff auf Unsloth über `unsloth studio --secure` über kostenloses HTTPS via Cloudflare

#### Größere Modelle auf deiner Hardware ausführen

* Verwende automatische GPU-Platzierung oder wähle genau aus, welche GPUs und Modellschichten verwendet werden sollen.
* Verschiebe MoE-Expertenschichten in den Systemspeicher, damit größere Modelle passen.
* Teile Modelle auf mehrere GPUs auf oder verwende Tensor Parallelism.
* Speichere Hardware-Einstellungen getrennt für jedes Modell und jede Quantisierung.

#### Schnellere Chat-Neustarts und zuverlässigere Downloads

* Setze lange Chats fort, ohne die gesamte Unterhaltung neu aufzubauen, nachdem ein untätiges Modell seinen VRAM freigegeben hat.
* Hängende Hugging-Face-XET-Downloads versuchen automatisch erneut über standardmäßiges HTTP.
* Vorhandene GGUF-Dateien werden wiederverwendet, statt bei jedem Laden eines Modells erneut heruntergeladen zu werden.

#### Bessere Suche, Tools und Agenten

* Die Websuche kann jetzt PDF-Papiere, Handbücher und andere PDF-Ergebnisse lesen.
* Parallele Tool-Aufrufe, Reasoning-Ausgabe und Tool-Wiederholungen funktionieren zuverlässiger.
* Ein neuer optionaler MCP-Endpunkt erlaubt kompatiblen KI-Clients, Modelle und Trainingsverlauf zu prüfen, Training zu starten oder zu stoppen, Checkpoints zu laden, Rezepte zu validieren und GGUFs zu exportieren.
  * Aktiviere es mit `UNSLOTH_STUDIO_ENABLE_MCP=1` und setze das erforderliche Bearer-Token mit `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Fehlerbehebungen für Training und Export

* Textbasiertes Training mit multimodalen Modellen kürzt lange Beispiele vor dem Packing nicht mehr.
* Feinabgestimmte Qwen3.5- und Qwen3.6-MTP-Modelle exportieren jetzt korrekt nach GGUF.
* Ein Windows-Berechtigungsfehler behoben, der GGUF-Exporte während des letzten Schreibschritts stoppen konnte.

#### Falls du es verpasst hast

Unsere vorherige Studio-Version fügte Dynamic-NVFP4-Modelle, tiefere Personalisierung, sieben neue Anzeigesprachen, sicherere Agenten und Vulkan-GPU-Beschleunigung hinzu.

**Dynamic NVFP4:**

Unsloth Dynamic NVFP4 belässt genauigkeitskritische Schichten in FP8 oder BF16, während der Rest in W4A4 ausgeführt wird. Auf NVIDIA-Blackwell-GPUs ermöglicht dies bis zu 2,5x schnellere Inferenz, während kalibrierte FP8-KV-Caches bis zu 2x längeren Kontext bieten.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) und entdecke unsere erweiterte [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4), einschließlich Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4.

**Personalisiere dein Studio:**

Wähle zwischen den Farbpaletten Standard, Classic und Minimal, jeweils mit hellen und dunklen Modi. Du kannst außerdem Farben anpassen, Schriftarten importieren und Schriftgröße, Kontrast, reduzierte Bewegung und mehr einstellen.

Unsloth enthält außerdem einen Reiter für Spracheinstellungen für Diktat, benutzerdefinierte Wörterbuch-Einstellungen und Vorlesen.

**Neue Sprachen:**

Unsloth Studio ist jetzt auf Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch verfügbar, zusätzlich zu Chinesisch (vereinfacht), Japanisch und Portugiesisch (Brasilien). Die automatische Erkennung der Browsersprache ist jetzt der Standard.

**Sicherere Agenten:**

Ein vierstufiger Berechtigungswähler für Tool-Aufrufe-**Fragen**, **Für mich genehmigen**, **Aus** und **Vollzugriff**-bietet feinere Kontrolle über Agents. Die Isolierung des Agent-Arbeitsbereichs und sicherere Installationsprüfungen verringern außerdem das Risiko unbeabsichtigter Änderungen.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personalisierung, NVFP4, Sprachen

Hey Leute, wir haben viele neue Updates für Unsloth, besonders zur Anpassung. Unsloth ist jetzt ganz nach deinen Wünschen anpassbar: drei Farbpaletten plus benutzerdefinierte Farben und Schriftarten, sieben neue Anzeigesprachen und ein neuer Tab für Spracheinstellungen für Diktat und Vorlesen. Agents werden sicherer mit einem vierstufigen Berechtigungswähler für Tool-Aufrufe (Fragen, Für mich genehmigen, Aus, Vollzugriff) und Arbeitsbereichsisolierung, und Intel-GPUs erhalten endlich GPU-beschleunigte Inferenz durch das neue Vulkan `llama.cpp` Unterstützung.

Wir haben außerdem native Unterstützung für [Inkling](https://unsloth.ai/docs/models/inkling)hinzugefügt, ein offenes Modell mit 975 Mrd. Parametern, 41 Mrd. aktiven Parametern und einem Kontextfenster von bis zu 1 Mio. Tokens. Unter Apache 2.0 lizenziert, akzeptiert es Text, Bilder und Audio und erzeugt Text.

#### Dynamisches NVFP4

Wir haben unser [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4) um quantisierte Versionen von Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4 erweitert.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) für Details.

Personalisiere dein Unsloth

Unsloth ist nicht mehr auf Hell- und Dunkelmodus beschränkt:

* Wähle aus **Standard**, **Klassisch**und **Minimal** Paletten, jeweils mit hellen und dunklen Varianten.
* Passe Akzent-, Hintergrund- und Vordergrundfarben an.
* Importiere deine eigenen Schriftarten für UI, Überschriften, Chat und Code.
* Passe Schriftgröße, Kontrast, Bewegung, Cursorverhalten und Schriftglättung an.
* Suche in den Einstellungen und synchronisiere Präferenzen geräteübergreifend.

Helle und dunkle Modi behalten ihre eigenen Anpassungswerte.

#### Sieben neue Sprachen

Unsloth unterstützt jetzt Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch sowie Chinesisch, Japanisch und Portugiesisch. Die automatische Erkennung der Browsersprache ist jetzt Standard.

#### Spracheinstellungen

Ein neuer Tab „Voice“ fügt Steuerungen für Diktat, Aussprachewörterbücher und Vorlesen hinzu. Unterstützung für Spracherkennung und Text-zu-Sprache kommt bald; vollständige Sprachgespräche befinden sich noch in Entwicklung.

#### Sicherere Agents und Tool-Aufrufe

Der alte Bypass-Schalter ist jetzt ein vierstufiger Berechtigungswähler:

* **Nachfragen:** jeden Tool-Aufruf genehmigen.
* **Für mich genehmigen:** schreibgeschützte Aktionen automatisch ausführen und bei potenziell unsicheren anhalten.
* **Aus:** Tool-Aufrufe deaktivieren.
* **Vollzugriff:** alle Aufrufe zulassen und die Sandbox deaktivieren.

Diese Steuerungen gelten für Terminal-, Python-, Websuche-, RAG- und MCP-Tools. Agents erhalten außerdem isolierte Arbeitsbereiche, fortsetzbare Sitzungen mit `--persist`, sicherere Warnungen des Remote-Installers, Live-Streaming von Tool-Ausgaben und verbesserte Web-Extraktion.

#### Vulkan und `llama.cpp`

Das neue Vulkan `llama.cpp` Backend gibt Intel-GPUs GPU-beschleunigte Inferenz statt eines Fallbacks auf die CPU. Es unterstützt vorhandenes VRAM-Management, automatische Kontextgröße, Multi-GPU-Auswahl und Layer-Auslagerung.

AMD-Nutzer können dies aktivieren mit:

```bash
UNSLOTH_FORCE_VULKAN=1
```

Wir haben außerdem die Aktualisierungszuverlässigkeit, die Wiederherstellung des Modellzustands und das Unterbrechen festhängender Generierungen verbessert.

#### Modelle und Training

Diese Veröffentlichung enthält außerdem:

* Native Inkling-Unterstützung und Verbesserungen für Multi-GPU B200.
* DeepSeek-V4-Eager-Attention und trainierbare FP8-Gruppenspezialisten.
* Zuverlässiges Training nur auf Abschluss über automatische Erkennung von Chat-Template-Markierungen.
* Korrekte Behandlung deaktivierter Gradient-Checkpointing-Funktion.
* Verbessertes RoPE-Scaling und Kontexterweiterung.
* Erzwungenes Stoppen für festhängende Trainingsläufe.
* Automatisches Routing für neue Modellarchitekturen und neuere Transformers-Versionen.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth kann jetzt nach dem Training NVFP4-, FP8- und imatrix-GGUFs exportieren; als llama-swap-API-System dienen; Unterstützung für Japanisch und brasilianisches Portugiesisch hinzufügen; und enthält MLX, safetensors, Tool Calling, Healing-Unterstützung und mehr. Der Unsloth-Core macht GRPO 1,3x schneller, fügt einen HTTP-Fallback für festhängende Downloads hinzu, verbessert den Offline-Modus, beschleunigt das MoE-Training um das 3- bis 5-Fache und behebt viele Fehler. Diese Veröffentlichungsreihe verwendet `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/de/modelle/deepseek-v4.md) wird jetzt mit Thinking-Schaltern und unseren verbesserten Korrekturen für das Chat-Template unterstützt.

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FChQx2DGoDLyhf7mp8G2d%2Fdeepseek%20v4%20flashhh.png?alt=media&amp;token=a84f2fbc-8ab0-44cf-a3a8-0bdaaf80a2a7" alt="" width="375"><figcaption></figcaption></figure></div>

#### Intelligentere API-Bereitstellung kompatibel mit OpenAI

Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agent-Tools.

* API-Anfragen können den automatischen Wechsel zwischen heruntergeladenen lokalen GGUFs aktivieren, während unbekannte Modellnamen sicher weiterhin das aktuelle Modell verwenden.
* `/v1/models` gibt jetzt saubere Modell-IDs und den lokalen GGUF-Katalog zurück statt lokaler `.gguf` Pfade.
* Das automatische Entladen bei Inaktivität kann VRAM nach einer Pause freigeben, und das Heilen von Tool-Aufrufen kann jetzt pro Anfrage gesteuert werden.

#### Exportverbesserungen

Exporte sind flexibler und vermeiden unnötige Downloads.

* Wähle mehrere Exportformate gleichzeitig aus, darunter portables FP8/INT8, GGUF-LoRA, quellpassende Exporte, imatrix GGUF und komprimiertes FP8/FP4.
* Exporte mit mehreren Checkpoints vermeiden weitere wiederholte Downloads des Basismodells.
* FP8-, INT8- und GGUF-LoRA-Exporte respektieren jetzt `trust_remote_code`und der GGUF-Export behandelt fehlende Quantisierungseinstellungen zuverlässiger.

#### RAG und Datei-Chat

Der Datei-Chat ist bei echten Dokumenten nützlicher.

* RAG-Anhänge können jetzt den gesamten Dokumentenkontext verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.
* Der Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich Text von rechts nach links, indischem Text und DOCX-Tabellen.
* Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.

#### Unsloth-Politur und Zuverlässigkeit

Die tägliche Nutzung sollte sich flüssiger und stabiler anfühlen.

* Lange Trainings- und Chat-Läufe frieren seltener stillschweigend ein.
* Der Vergleichsmodus, der Modellwechsel, das Abbrechen von Modellen, das Hub-Browsing und Hub Discover sind zuverlässiger.
* Projekt-Exporte, Chat-Exporte, Einstellungen, geführte Touren, Dateidialoge, Update-Bildschirme und die Reasoning-UI sind sauberer und konsistenter.

#### Installer-, Hardware- und Plattformkorrekturen

Unsloth installiert und läuft plattformübergreifend zuverlässiger.

* macOS-Installationen benötigen CMake oder Homebrew nicht mehr, wenn ein vorgefertigtes `llama.cpp` verfügbar ist, und die Unterstützung für Apple Silicon behandelt Pfade mit Leerzeichen und die Größe des Unified Memory besser.
* Der Windows-Start, die UTF-8-Behandlung, ROCm-RAG-Embedding und die ROCm-on-WSL-GPU-Unterstützung wurden verbessert.
* Die Auswahl vorgefertigter Blackwell-GPUs, GGUF-Passprüfungen, Tensorparallelismus für Vision-/mmproj-GGUFs und lokale `llama.cpp` Wiederverwendung sind jetzt zuverlässiger.

#### Training, Modelle und Kerne

Training und Modellladen sind über mehr Setups hinweg zuverlässiger.

* GRPO unterstützt jetzt standardmäßig Sequence Packing, vermeidet wiederholte gemeinsame Prompts und behandelt DDP-Logit-Skalierung korrekt.
* Full Fine-Tuning, RL-Präzisionseinstellungen, Gradient-Checkpointing, DDP-RoPE-Puffer und MoE-LoRA-Erkennung wurden behoben.
* FP8-Quantisierung/Dekquantisierung, Llama-3-RoPE-Scaling mit Transformers v5, PEFT-0.19-LoRA-Neuladen und `fast_generate` Fehlermeldungen wurden verbessert.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3x längere Kontexte

[GLM-5.2](/docs/de/modelle/glm-5.2.md) wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. **3x längere Kontextlängen** sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP erreichbar, was längere Chats ermöglicht. Bypass-Berechtigungsmodus, verzweigte Chats, warteschlangenfähige Chats, ein neues Hub zur Modellerkennung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende `unsloth studio --secure` für sicheren globalen HTTPS-Zugriff!

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Besserer Algorithmus für die Kontextlänge

Gemäß [PR 1](https://github.com/unslothai/unsloth/pull/6312) und [PR 2](https://github.com/unslothai/unsloth/pull/6447)haben wir die Ermittlung der Speichernutzung und Kontextlänge in Unsloth Studio deutlich verbessert und insgesamt 3x längere Kontexte erreicht:

| Szenario                        | KV       | vorher  | nachher |
| ------------------------------- | -------- | ------- | ------- |
| 1x 32GB Pipeline (\~31 GB frei) | f16      | 23,040  | 64,000  |
|                                 | q8\_0    | 43,520  | 114,944 |
|                                 | q4\_0    | 82,432  | 199,680 |
| 2x 32GB Pipeline                | beliebig | 262,144 | 262,144 |
| 2x 24GB Tensor (\~23 GB frei)   | f16      | 134,049 | 262,144 |
|                                 | q8\_0    | 252,329 | 262,144 |

#### Chat-Canvas, Verzweigung & Warteschlangen

* Bearbeite Assistenten-Nachrichten direkt und starte von jedem Punkt im Thread erneut.
* Verzweige einen Thread, um ein Gespräch aufzuspalten, ohne das Original zu verlieren.
* Temporäre (Inkognito-)Chats, die nichts hinterlassen.
* Neue Prompts in die Warteschlange stellen, während eine Generierung noch läuft, statt zu warten.
* Chat-„Artefakte“ sind jetzt **Canvas**mit eingebetteten **HTML-Canvas-Karten** die automatisch gerendert werden, einer Code-Ansicht, und DiffusionGemma zeigt seinen Rohcode weiterhin direkt eingebettet an statt ihn einzuklappen.
* Die Chat-Suche erfasst jetzt jede Nachricht und zeigt deine eigenen Nachrichten zuerst an.

#### Hub (neu gestaltet)

* Vollseiten-Hub mit Trend-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.
* README-Vorschau in einem geteilten Feed, damit du vor dem Download lesen kannst.
* Downloads verwenden standardmäßig das schnellere **Xet** Transportprotokoll, mit automatischem HTTP-Fallback, wenn eine Übertragung stockt.
* Neuer Schalter „Beim Auswählen laden“, um Ladeoptionen vor dem Laden eines Modells festzulegen.
* Google-Logo wird für DiffusionGemma und künftige Gemma-Derivate angezeigt.

#### Modelle & Inferenz

* DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.
* Schnelle Inferenz auf dem neuesten vLLM (0.22+) behoben, sodass Beschleunigungen wieder funktionieren.
* Tensorparallelismus ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, stellt er sich jetzt selbst wieder her, statt abzustürzen.
* DiffusionGemma zeigt jetzt live, wie das Bild beim Entrauschen entsteht, mit genauen Geschwindigkeitsstatistiken.

#### Sicherheit & Cloudflare-verschlüsselte Studios

* Neu `--secure` Cloudflare-only-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter `--secure`aktiviert bleiben. Verwende `unsloth studio --secure`!
* den Modus „Berechtigungen umgehen“, um Bestätigungen zu überspringen und die Tool-Sandbox zu deaktivieren, wenn du das möchtest.
* Automatische Erkennung von Hugging-Face-Virenprüfung + gefährlichen Dateien in Repos.

#### Protokollierung und API

* Neu **API-Server-Monitor** in Unsloth.
* Schnellere API-Aufrufe und geringere Latenz
* Deutlich besser gestraffte Logs – jetzt mit Durchsatz und Latenz und viele aufgeblähte Logs entfernt.

#### Hardware & Backend

* Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs
* Stille Umstellung auf CPU statt GPU beheben
* Die torchao-Version wird jetzt anhand des installierten torch ausgewählt.
* Der Installer repariert jetzt automatisch eine beschädigte oder nur-CPU-PyTorch-Installation und warnt vor stillem CPU-Fallback, auf NVIDIA + AMD unter Win/Linux/Mac/WSL.
* Gibt den VRAM des Chat-Modells frei, wenn das Training startet, aber nur wenn die GPU tatsächlich knapp bemessen ist (sonst keine unnötigen Neuladungen).
* Wenn llama-server beim Start hart abstürzt, geht Unsloth jetzt eine Wiederherstellungsleiter durch, statt einfach zu scheitern.

#### Training & allgemeine Korrekturen & parallele Module

* MLX-Training-Updates.
* Verbesserte Zuverlässigkeit des GRPO-Trainings mit vLLM.
* Der Trainingsstart wurde zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.
* Unsloth räumt übrig gebliebene Backend-Prozesse nach Abstürzen, Neustarts oder unterbrochenem Herunterfahren jetzt zuverlässiger auf.
* Export, Chat, Training, Rezepte sind jetzt alle individuell / abgeschottet! Das bedeutet, dass du jetzt alle 4 parallel ausführen kannst! Du kannst chatten / Inferenz machen, während du auf einen Trainingslauf oder einen Export wartest!

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Stelle sicher, dass du das neueste installierst [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) und [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) werden jetzt alle unterstützt.

* Ausführen und trainieren [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) über [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) ist da! Führe [Gemma 4](https://unsloth.ai/docs/models/gemma-4) mit MTP etwa 2x schneller aus.
* Audio-Chat wird jetzt für Gemma 4 unterstützt (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Preserve Think wurde zu Gemma 4 hinzugefügt.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fszoidwwj70dLm5vBjpmL%2Fdiffusiongemma.gif?alt=media&amp;token=8ce359fd-f92c-4cf8-a491-06b04c505cb7" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Download-Manager (experimentell)

* Eine neue **Hub** Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging-Face-Modellen und Datensätzen hinzugefügt.
* Unsloth kann jetzt Modelle und Datensätze erkennen, die bereits auf deinem Gerät vorhanden sind, und sie zusammen mit heruntergeladenen Assets anzeigen.
* Heruntergeladene [GGUF-Modelle](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) haben jetzt direkte **Ausführen / Neuer Chat** Aktionen.

#### RAG / Mit Dateien chatten (experimentell)

* Hinzugefügt [**Mit Dateien chatten**](https://unsloth.ai/docs/new/studio/chat) in Unsloth, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.
* Unterstützt Hybrid-Suche, Zitate, PDF-Vorschauen, threadbezogene Dokumente und ein integriertes `search_knowledge_base` Tool.

#### Neue Update-Schaltfläche + Hardware-Unterstützung

* Unsloth verwendet jetzt ständig frische, aktuelle [llama.cpp-Vorabbauten](https://unsloth.ai/docs/new/changelog) über CUDA, ROCm, Windows, Linux und macOS hinweg.
* Ein neues **llama.cpp aktualisieren** Buttons im Programm hinzugefügt, damit Nutzer das lokale Backend aktualisieren können, ohne Unsloth neu zu installieren.
* Verbesserte Windows-/WSL-AMD-Unterstützung, [Strix-Halo-ROCm-Unterstützung](https://unsloth.ai/docs/get-started/install/amd), [Blackwell-CUDA-Auswahl](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)und klarere Installationsmeldungen.

#### Lokaler Chat, Tools & API-Kompatibilität

* Lokales [Tool Calling](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) ist zuverlässiger, mit besserer Anordnung der Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.
* Verbesserte [OpenAI-kompatible API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) und Anthropic-kompatibles API-Verhalten für lokale Unsloth-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und [Claude-Code-Kompatibilität](https://unsloth.ai/docs/basics/claude-code).

#### Training & Korrekturen

* Verbesserte [MLX-Unterstützung](https://unsloth.ai/docs/new/studio/install) mit besseren Modellbezeichnungen, Geschwindigkeitsstatistiken für die Generierung und Korrekturen für [VLM-Training](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Mehrere [Trainings-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) und [Datensatz-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) Randfälle wurden behoben, einschließlich nicht beschreibbarer Hugging-Face-Caches und benutzerdefinierter Datensatzzuordnungen.
* Viele UI-Polish-Korrekturen in Chat, Menüs, Modellauswahl, Dunkelmodus, Import/Export und Einstellungen hinzugefügt.

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, neue UI, MCP, Projekte

Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FoRn2YEPb9lJ81kP3GQQh%2Fwhats%20on%20ur%20mind.png?alt=media&amp;token=f388e42a-bb05-4a09-9cbf-ec699a6baf6b" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google veröffentlicht [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4)ein neues Modell, das lokal auf 8 GB RAM läuft. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Anleitung](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führe das Modell über Unsloth Studio aus und trainiere es.

#### MCP

* Entfernter `MCP` Server-Unterstützung, einschließlich benutzerdefinierter Header und OAuth
* Lokale befehlsbasierte `MCP` Server-Unterstützung
* `MCP` kann jetzt im Chat-Composer aktiviert werden
* Integrierte Voreinstellungen für gängige `MCP` Server

#### Neue Chat-UI

* Projekte, Canvas, `MCP`RAG- und Vergleichssteuerungen sind jetzt im Plus-Menü verfügbar
* Suche- und Code-Steuerungen sind im Composer leichter zugänglich
* Menüs, Overlays, Symbole und anklickbare Steuerelemente sind in Unsloth konsistenter

#### Projekte

* Ordne zusammengehörige Chats in eigenen Projekt-Arbeitsbereichen an
* Verschiebe bestehende Chats in Projekte
* Projekte direkt über die Seitenleiste erstellen und verwalten

#### Experimentelles Canvas / Artefakte

* Öffnet generiertes HTML in einem eigenen Canvas-Bereich innerhalb von Unsloth Studio
* Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und über CDN geladener Pakete
* Ermöglicht den Wechsel zwischen gerenderter Vorschau und Quellcode

#### Installation, Laufzeit und Hardware

* Windows-Vorinstallationen benötigen jetzt nicht mehr die frühe `CUDA Toolkit` Prüfung
* Linux `llama.cpp` Vorabbauten passen jetzt zur erkannten Laufzeit `cudart` major
* `ROCm` gfx-Erkennung wird in die Auswahl des Vorab-Builds übernommen
* `Blackwell`, `B300` und `ARM64` Linux-Unterstützungsupdates

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Paket nicht die neuesten Updates erhält!**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:**

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Paket nicht die neuesten Updates erhält!**
{% endhint %}

#### Mac-Updates

* Wieder aktiviert `llama.cpp` vorgefertigte Binärdateien für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Apple Silicon Mac OS 13 (Ventura) ist ein Quellcode-Build
* Intel (x86\_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet `llama.cpp` vorgefertigte Binärdateien
* Intel für Mac OS 13.0 - 13.2 ist ein Quellcode-Build

#### Windows-Updates

* CUDA 13.3 `llama.cpp` vorgefertigte Binärdateien funktionieren jetzt für Windows
* Für CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte das CUDA-12.4-Fallback - wir arbeiten bald an CUDA-13.1-Binärdateien.

#### CUDA-13.3-Update

* CUDA-13.3-Binärdateien für Nicht-Linux-Systeme funktionieren. Wir verwenden vorerst weiterhin CUDA 13.1
* CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 - siehe <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell-GPU-Update

* Für den Moment wird es für Blackwell verzögerte Veröffentlichungen von `llama.cpp` vorab kompilierten Binärdateien geben, da CUDA 12.4 nicht funktioniert - wir arbeiten daran, dies bald zu beheben.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Ein Update vor dem Revamp.

Hey Leute, wir machen noch ein weiteres oder so Update vor einem großen Revamp, der wahrscheinlich diese oder nächste Woche kommt. Unser Revamp wird viele Dinge ändern, besonders mit neuen großen Funktionen und vielen Designänderungen.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NEU: [**Unterstützung für API-Aufrufe**](https://unsloth.ai/docs/integrations/connections) jetzt mit Bilderzeugung + Bearbeitung, richtiger Websuche, Codeausführung, automatischem Prompt-Caching. Verbinde [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) und mehr.
* Richtige Unterstützung für **nicht-englische Sprachen** z. B. Japanisch, Chinesisch, Indisch usw.

Viele von euch haben möglicherweise unsere vorherige Veröffentlichung verpasst, die nur einen Tag lang verfügbar war. Wir haben eingeführt:

* Verbinde dich mit externen Inferenz-Backends: [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Sicherheitsverbesserungen**
* **Automatisches MTP-Spekulatives Decoding** für MTP-GGUFs; erhalte die besten, auf deine Hardware zugeschnittenen Einstellungen.

#### API-Anbieter-Aufrufe und externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über mehrere Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* Bilderzeugung + Bearbeitung
* API-Schlüssel jetzt optional für lokale Anbieter (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### Weitere Unsloth Studio-Updates

* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Das Senden/Prompten in nicht-englischen Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* Härtung des IME-Compilers, RTL `dir="auto"`, Behebung der Trunkierung langer Logzeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständige Offline-Unterstützung: gecachte GGUF-Erkennung und automatische Offline-DNS-Erkennung sowohl für Inferenz als auch Training

#### Sicherheitsverbesserungen in Unsloth Studio

* Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfadbegrenzung, damit Worker ihren laufenden tmp-Ordner nicht verlassen können
* Strikte Schema-Validierung in der gesamten Unsloth-API
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback auf `training_args.bin` sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Aktualisierung, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfe
* Die Abbruchbereinigung ist jetzt streng auf laufende tmp-Ordner beschränkt, sodass sie niemals den Zustand des Benutzers löschen kann
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP- und Unsloth-Fixes

Viele Bugfixes sowie UI- und UX-Fixes für Unsloth! Um die neuesten Updates zu erhalten, mache Folgendes:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Behebungen

1. Beheben `Unsloth-Studio-Update` funktioniert nicht gut
2. Hängenbleiben beheben bei `reset-password` Seite
3. Mehr Unterstützung für den Offline-Modus
4. Verbessere, dass MTP auf Macs, CPUs und GPUs nicht schneller ist - jetzt ist es viel besser!
5. Fix, dass die Desktop-Verknüpfung nach dem Update nicht funktioniert
6. Viele, viele UI-/UX-Bugfixes
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API-Verbindungen

Wir haben viele neue Updates für Unsloth `v0.1.41-beta`:

* **\~2x schnellere GGUF-Inferenz** mit automatisch aktiviertem [MTP](/docs/de/modelle/qwen3.6.md#mtp-guide)
* [**Unterstützung für API-Aufrufe**](/docs/de/integrationen/connections.md) für [OpenAI](/docs/de/integrationen/connections/openai.md), [Anthropic](/docs/de/integrationen/connections/anthropic-claude.md) usw. mit automatischem Prompt-Caching, Websuche, Codeausführung
* Verbinde dich mit externen Inferenz-Backends: [vLLM](/docs/de/integrationen/connections/vllm.md), [Ollama](/docs/de/integrationen/connections/ollama.md), [llama-server](/docs/de/integrationen/connections/llama.cpp-mit-unsloth-verbinden-ggufs-mit-llama-server-ausfuhren.md)
* Experimentell **MLX-Inferenz**
* Richtige Unterstützung für **nicht-englische Sprachen**
* **Sicherheit** Verbesserungen

<a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#qwen3.6-inference-tutorials" class="button primary">Qwen3.6-Tutorials ausführen</a><a href="/docs/de/modelle/qwen3.6.md#mtp-guide" class="button primary">MTP-Anleitung</a>

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F0abq31rgj0gOSH9vnpQ6%2Fmtp.gif?alt=media&amp;token=c66ec3f5-91f0-4617-824c-c537a2dde8b0" alt="" width="375"><figcaption></figcaption></figure></div>

#### MTP-Unterstützung für spekulatives Decoding: 1,4- bis 2-fach schnellere Inferenz!

* **Automatisches MTP-Spekulatives Decoding** für MTP-GGUFs; warnt, wenn die mitgelieferte llama.cpp-Vorabversion veraltet oder zu alt für MTP ist
* Neue vorgefertigte llama.cpp-Binärdateien für MTP-Unterstützung!

#### API-Anbieter-Aufrufe und externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über mehrere Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* API-Schlüssel jetzt optional für lokale Anbieter (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### MLX-Inferenz (experimentell)

* MLX-Quants und -Modelle können jetzt lokal auf deinen Mac-Rechnern ausgeführt werden!
* Wir werden bald Denken, Tools und Websuche hinzufügen!

#### Weitere Unsloth Studio-Updates

* Das Senden/Prompten in nicht-englischen Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Härtung des IME-Compilers, RTL `dir="auto"`, Behebung der Trunkierung langer Logzeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständige Offline-Unterstützung: gecachte GGUF-Erkennung und automatische Offline-DNS-Erkennung sowohl für Inferenz als auch Training
* Viele UI/UX-Feinarbeiten: Überarbeitung des Dark Themes, Neugestaltung der rechten Seitenleiste, Sloth-Maskottchen je nach Tageszeit, wegklickbare kopierbare Toasts, größerer Chat-Composer, Feinschliff an der Konfiguration für Codeausführung, Styling der Composer-Aktions-Pills, schmalerer Discord-Button

#### Trainings-Updates

* Gemma-Fehlerbehebungen für den Attention-Mask
* Multi-Image-GRPO
* Experimente zur Rückgabe von GRPO-Hidden-States
* Neue Continued-Pretraining-(CPT)-Trainingsmethode als erstklassige Option
* Gemma-4-MoE-LoRA-Extraktor registriert, um `grouped_mm` Absturz bei der Kontraktion
* Optionales gefused `lm_head` + Cross-Entropy-Forward, mit Single-Matmul-Pfad unter `UNSLOTH_RETURN_LOGITS=1`
* Batchgröße für Eval übergeben
* Eval-/Trainingspfade beachten jetzt `HF_DATASETS_OFFLINE` zusammen mit `HF_HUB_OFFLINE`

#### Sicherheitsverbesserungen in Unsloth Studio

* Authentifizierungs-Rate-Limiting, proxy-bewusst, damit Reverse Proxies es nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfadbegrenzung, damit Worker ihren laufenden tmp-Ordner nicht verlassen können
* Strikte Schema-Validierung in der gesamten Unsloth-API
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback auf `training_args.bin` sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Aktualisierung, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsame 422-Hilfe
* Die Abbruchbereinigung ist jetzt streng auf laufende tmp-Ordner beschränkt, sodass sie niemals den Zustand des Benutzers löschen kann
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth-API-Endpunkt

#### ***Fehlerbehebung für v0.1.39-beta*** **5. Mai 2026**

Behebt, dass der Chatverlauf nicht angezeigt wird (vorhandener Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler war nur bei der Darstellung - verwende `2026.5.2` oder rufe direkt `curl -fsSL https://unsloth.ai/install.sh | sh`  auf, um zu aktualisieren

Du kannst lokale LLMs mit Tools wie [Claude Code](https://unsloth.ai/docs/basics/claude-code) und [Codex](https://unsloth.ai/docs/basics/codex) verwenden, indem du sie mit dem API-Endpunkt von Unsloth verbindest. Dadurch kannst du Modelle wie [Qwen](https://unsloth.ai/docs/models/qwen3.6) und [Gemma](https://unsloth.ai/docs/models/gemma-4) lokal ausführen, mit zusätzlichen Funktionen wie selbstheilendem Tool Calling, Codeausführung und Websuche.

Unsloth als API-Inferenz-Endpunkt zu verwenden ist nicht nur deshalb nützlich, weil es einfach einzurichten und schnell ist, sondern auch weil Unsloth Folgendes bietet:

* [Selbstheilendes Tool Calling](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), wodurch fehlerhafte oder falsch formatierte Tool-Aufrufe um 50 % reduziert werden
* [Codeausführung](https://unsloth.ai/docs/new/studio/chat#code-execution) Unterstützung, die Bash- und Python-Ausführung für genauere Code-Ausgaben ermöglicht.
* Erweitert [Websuche](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) die Webseiten besucht und tatsächlich liest, um detaillierte Informationen zu sammeln.
* [Automatische Inferenz-Einstellungen](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) für GGUF-Modelle (Temp, Top-k usw.)

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1s98Id9xclzwMfxjXw2O%2Funsloth%20api%20cropped.png?alt=media&amp;token=64fac263-ca5b-4447-a740-41f58ec94904" alt="" width="375"><figcaption></figcaption></figure></div>

#### Neue Modelle

Wir haben außerdem eine Reihe neuer Modelle zur Ausführung, darunter NVIDIA [Nemotron 3 Nano Omni](/docs/de/modelle/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/de/modelle/ibm-granite-4.1.md) und [Mistral 3.5](/docs/de/modelle/mistral-3.5.md) Medium. Wir haben Mistral dabei geholfen, einige Probleme bei der Implementierung in Transformers und GGUFs zu lösen.

#### Unsloth-Updates

* Gestoppte Unsloth-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.
* Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.
* Hänger beim DPO-Training in Multi-Prozess-Setups wurden behoben.
* Die VLM-GRPO-Unterstützung wurde mit MROPE-Updates verbessert.
* Der Stop-Button von Unsloth stoppt die Generierung jetzt korrekt.
* Fix, dass die Chat-Vorlage nach einem Browser-Refresh verschwindet.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Brandneues UI-Redesign

Hey Leute, wir haben die gesamte UI- und UX-Erfahrung von Unsloth Studio überarbeitet, um den Schwerpunkt auf Chat und Training zu legen:

* Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FKoonE97b0H3RioMwVohd%2Fstudio%20new%20ui.gif?alt=media&amp;token=e37f2839-914e-48b8-8c81-2dac3ade9408" alt="" width="375"><figcaption></figcaption></figure></div>

* Du kannst jetzt Chats löschen und frühere Unterhaltungen durchsuchen

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fm6se3dOmBZH9d9Wlif4W%2FScreenshot%202026-04-23%20at%206.15.38%E2%80%AFAM.png?alt=media&amp;token=e83fe246-1f88-4bf7-aa15-baf7d3356676" alt=""><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fa4EGTdaWQ6EA81PeC3JZ%2FScreenshot%202026-04-23%20at%206.01.36%E2%80%AFAM.png?alt=media&amp;token=1a1cc50d-e0e0-47cd-9c1a-80583a887794" alt=""><figcaption></figcaption></figure></div>

* Neuer Schalter „Thinking beibehalten“ für Modelle, die es unterstützen, wie Qwen3.6
* Saubereres, konsistenteres Design mit einfacherer Navigation
* Erweiterte Einstellungsseite mit Optionen zum Ändern deines Profilbilds, Namens und mehr

<div data-with-frame="true"><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FvMtRDH8cVXCu08OZ4TRf%2FScreenshot%202026-04-23%20at%206.18.35%E2%80%AFAM.png?alt=media&amp;token=d989c4b5-6293-402c-981c-3209b7e7d750" alt="" width="375"><figcaption></figcaption></figure></div>

* Kein zweimaliges Eingeben deines Hugging-Face-Tokens mehr
* gpt-oss hat jetzt Umschalter für niedriges, mittleres und hohes Denken.
* Verwendet jetzt die neueste llama.cpp-Vorabversion, sogar unter Linux CUDA
* Viele Fehler-, Konsistenz- und Stabilitätsfixes
* Kimi-K2.6 kann jetzt ausgeführt werden!
* Wir haben auch experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. kommen nächste Woche.

Qwen3.6 wurde in Unsloth Studio außerdem bereits zuvor für Ausführung und Training unterstützt. Du kannst Qwen3.6-27B jetzt sofort trainieren und ausführen!
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/de/modelle/qwen3.6.md) kann jetzt in Unsloth Studio ausgeführt (18 GB RAM) und feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).

Unsloth Studio hat viele neue Updates erhalten, bitte aktualisieren. Details und ein ausführlicher Beitrag folgen in den nächsten Tagen.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/de/modelle/qwen3.6.md) kann jetzt in Unsloth Studio ausgeführt und feinabgestimmt werden. Das Modell läuft mit 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma-4-Update + MiniMax-M2.7**

[Gemma-4-GGUFs](https://huggingface.co/collections/unsloth/gemma-4) wurden jetzt mit Googles offiziellen Fixes für die Chat-Vorlage aktualisiert (was Tool-Calling behoben/verbessert hat), zusammen mit den neuesten llama.cpp-Fixes. Aktualisiere auf die neueste llama.cpp, lade die Quants erneut herunter und du solltest kein `ungenutztes Token` mehr sehen.\
\
[MiniMax-M2.7](/docs/de/modelle/tutorials/minimax-m27.md) ist jetzt da! Du kannst das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma-4-Fixes**

Wir haben Gemma 4 aktualisiert [mit vielen Fehlerbehebungen](/docs/de/modelle/gemma-4/train.md). Diese Fehler sind universell und betrafen alle Trainingspakete und Implementierungen und **stammen nicht von Unsloth**. Wir haben die Fehler identifiziert, behoben, und das Training von Gemma 4 funktioniert jetzt in Unsloth korrekt.

Du brauchst nur **8 GB VRAM** um **Gemma-4-E2B** lokal zu trainieren. Unsloth trainiert Gemma 4 **\~1,5x schneller bei etwa 60 % weniger VRAM** als FA2-Setups. Für die vollständige Anleitung und Notebooks zum Training von Gemma 4, [siehe unseren Blog](/docs/de/modelle/gemma-4/train.md).

#### Gemma-4-Trainingsfixes

1. **Gradient Accumulation** führt nicht mehr zu Verlustexplosionen. Zuvor konnten die Verluste auf **300–400**ansteigen; der erwartete Verlust liegt bei etwa **10–15**.
2. Behoben wurde der **IndexError** der **26B** und **31B** Inferenz in `Transformers`.
3. Fehlerhafte Ausgaben behoben für **E2B/E4B** wenn `use_cache=False`. Siehe [Issue #45242](https://github.com/huggingface/transformers/issues/45242).
4. Behoben **Float16-Audio** Überlauf von `-1e9` Werten.

Wenn du Verluste über **13–15** siehst, zum Beispiel **100** oder **300** - wird die Gradient Accumulation wahrscheinlich falsch behandelt. Dies ist behoben in both **Unsloth** und **Unsloth Studio**.

#### Gemma-4-Quant-Reuploads

Wir haben auch unsere Gemma-4-GGUFs aktualisiert, daher musst du sie erneut herunterladen. Auch diese Quantisierungsprobleme haben **nichts mit Unsloth zu tun und werden nicht von Unsloth verursacht**:

1. CUDA: vor dem Fusionieren auf Pufferüberlappung prüfen - kritischer Fix für `<unused24>` Tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`: Unterstützung für Attention-Rotation für heterogenes iSWA - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `Vokabular`: Byte-Token-Behandlung zum BPE-Detokenizer für Gemma 4 hinzufügen - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `konvertieren`: setzen `"add bos" == True` für Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `gemeinsam`: spezialisierten Gemma-4-Parser hinzufügen - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lesen `final_logit_softcapping` für Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: benutzerdefinierten Zeilenumbruch-Split für Gemma 4 hinzufügen - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio-Updates

* Hinzufügen von **spekulativem Decoding** Unterstützung (ngram-mod, standardmäßig aktiviert)
* Llama.cpp wurde auf die neueste Version mit allen Gemma-4-Fixes aktualisiert
* Probleme beim Training von Qwen3.5 und Gemma 4 beheben
* Exportieren und Speichern von Gemma-4-Modellen aktivieren
* Sandbox-Sicherheit für Terminal- und Python-Tools härten
* Rezepte das in Chat geladene Modell verwenden lassen
* Leere Chat-Threads bei der Navigation beheben (und immer beim Wechseln von Tabs) und neuen Chat-Ablauf stabilisieren
* Nicht-LLM-Rezepte ausführen lassen und den Daten-Tab bei Ausführungen an erste Stelle verschieben
* Das zwischengespeicherte HF-Repo-Casing wiederverwenden, um doppelte Downloads zu verhindern
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Du kannst jetzt die [Gemma 4](/docs/de/modelle/gemma-4.md) Modelle in Unsloth ausführen und trainieren.
* Intel Mac funktioniert jetzt
* Vorcompilierte Binärdateien für llama.cpp für 2 Gemma-4-Fixes:
  * Vokabular: Gemma4-Tokenizer beheben ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * Fix: Gemma-4-Vorlage ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Tool-Aufrufe für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten
* Vorcompilierte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU
* Spekulatives Decoding für Nicht-Vision-Modelle hinzugefügt (Gemma-4 ist leider Vision und Qwen3.5)
* Die Kontextlänge wird jetzt korrekt angewendet.
* Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* 90 % weniger HF-API-Aufrufe - weniger Rate Limits
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % genauere Tool-Aufrufe + mehr Unterstützung**

* Tool-Aufrufe für alle Modelle sind jetzt **+30 % bis +80 % genauer.**
* Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* Die Anzahl der erlaubten Tool-Aufrufe wird von 10 auf 25 erhöht
* Tool-Aufrufe enden jetzt viel besser, sodass Schleifen/Wiederholungen reduziert werden
* Mehr **Heilung von Tool-Aufrufen** und Deduplizierungslogik, um auch zu verhindern, dass Tool-Aufrufe XML durchsickern lassen
* Getestet mit `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), Websuche + Codeausführung + Thinking aktiviert.

| Metrik                        | Vorher | Nachher    |
| ----------------------------- | ------ | ---------- |
| XML-Lecks in der Antwort      | 10/10  | 0/10       |
| Verwendete URL-Abrufe         | 0      | 4/10 Läufe |
| Läufe mit korrekten Songnamen | 0/10   | 2/10       |
| Durchschn. Tool-Aufrufe       | 5.5    | 3.8        |
| Durchschn. Antwortzeit        | 12,3 s | 9,8 s      |

#### Neue Funktionen

* Hinzugefügt **benutzerdefinierte Ordner** sodass du beliebige GGUFs in jedem Ordner verwenden kannst - vorerst Zugriff in den erweiterten Einstellungen in Chat und Benutzerdefinierte Ordner
* **Update-Button** jetzt sichtbar
* Das Styling des Installationsskripts ist jetzt vollständig aktualisiert!
* Vorläufig **Automatische Multi-GPU-Unterstützung für Inferenz und Training** - nützlich für große Modelle, die nicht auf 1 GPU passen - Unsloth Auto weist GPU-Ressourcen automatisch zu
* Intel-Macs sollten sofort funktionieren

Viel flüssigeres und schnelleres Unsloth

* **Zeitüberschreitungen beim Herunterladen großer Modelle behoben** - keine Zeitüberschreitungen mehr festgestellt.
* **Hugging-Face-Ratenbegrenzung behoben - HF-API-Aufrufe um 90 % reduziert**
* bun unter Windows behoben und schnellere Installationen
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Neue wichtige Aktualisierungen**

Es sind erst 2 Tage seit unserer vorherigen Veröffentlichung vergangen, aber wir haben wichtigere Aktualisierungen:

* **Die Inferenz ist jetzt 20–30 % schneller.** Zuvor konnten Tool-Calling und Repeat-Penalty die Inferenz unter die normale Geschwindigkeit verlangsamen. Inferenz-Token/s sollten jetzt genauso abschneiden wie `llama-server` / `llama.cpp`.
* **Erkennt ältere oder bereits vorhandene Modelle jetzt automatisch** heruntergeladen von **LM Studio, Hugging Face,** und ähnlichen Quellen.
* **Die Inferenz-Token/s-Geschwindigkeit wird jetzt korrekt berechnet.** Zuvor enthielt tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer wirkte, als sie tatsächlich war. Sie sollte jetzt die „wahre“ Inferenzgeschwindigkeit widerspiegeln.
* **Die CPU-Auslastung steigt nicht mehr sprunghaft an.** Zuvor änderte sich die Inline-Querier-Identität bei jedem Rendern, wodurch `useLiveQuery` sich ständig neu angemeldet wurde.
* **Unsloth Studio hat jetzt einen Schließen-X-Button und beendet sich ordnungsgemäß.** Zuvor wurde es nach dem Öffnen über das Desktop-Symbol beim Schließen nicht ordnungsgemäß beendet. Wenn Sie es jetzt über die Verknüpfung starten, öffnet sich auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Falls Sie es noch aus einer früheren Sitzung geöffnet haben, können Sie Ihren Computer neu starten oder ausführen `lsof -i :8888` dann `kill -9 <PID>`.
* **Noch besseres Tool-Calling und Websuche** mit weniger Fehlern.
* Aktualisierte Dokumentation mit vielen neuen Informationen zu [dem Löschen von Modellen, der Deinstallation](/docs/de/neu/studio/install.md#uninstall) usw.
* **Saubereres, intelligenteres Installations- und Setup-Logging unter Windows und Linux.** Die Ausgabe ist jetzt mit konsistenter Formatierung leichter lesbar, standardmäßig zurückhaltender für ein flüssigeres Erlebnis und unterstützt reichhaltigere `--verbose` Diagnosen, wenn Sie vollständige technische Details wünschen.
* Sie können jetzt Ihren Trainingsverlauf ansehen!
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Erste Veröffentlichung nach Unsloth Studio

Hey Leute, das ist unsere erste Veröffentlichung, seit wir Unsloth Studio gestartet haben. Viele neue Funktionen und Fehlerbehebungen:

* **Sie können Unsloth Studio jetzt aktualisieren!** Bitte aktualisieren Sie mit denselben Installationsbefehlen.
* **Windows** CPU oder GPU funktioniert jetzt nahtlos. Bitte neu installieren!
* **App-Verknüpfungen**. Nach der Installation können Sie jetzt unter Windows, MacOS und Linux über ein Verknüpfungssymbol im Startmenü / Launch und auf dem Desktop starten.
* **Vorgekompilierte `llama.cpp` Binärdateien** und `mamba_ssm` - 6x schnellere Installationen! Außerdem <300 MB groß für Binärdateien.
* **50 % kleinere Installationsgrößen** (-7 GB oder mehr Einsparungen), 2x schnellere Installationen und schnellere Auflösung. 50 % kleinere PyPI-Größen.
* **Tool-Calling verbessert.** Bessere llama.cpp-Analyse, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Tool-Ausgaben-Panel, Timer.
* MacOS und CPU haben jetzt [Datenrezepte](/docs/de/neu/studio/data-recipe.md) mit Mehrdatei-Upload aktiviert.
* **Vorläufige AMD-Unterstützung für Linux** nur Maschinen - automatische Erkennung.
* **Überarbeitung der Einstellungs-Seitenleiste.** Einstellungen sind jetzt gruppiert nach **Modell, Sampling, Tools und Präferenzen**
* **Kontextlänge** jetzt anpassbar. Beachten Sie, dass dies nicht nötig ist, da llama.cpp intelligent den genauen Kontext verwendet, den Sie benötigen, über `--fit on`
* **Mehrdatei-Upload.** Datenrezepte unterstützen jetzt mehrere Drag-and-Drop-Uploads für PDF, DOCX, TXT und MD, mit Extraktion im Backend, gespeicherten Uploads und verbesserten Vorschauen.
* **Colab** mit kostenlosen T4-GPUs mit Unsloth Studio jetzt behoben! [Probieren Sie es hier aus](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Dank vorgefertigter Binärdateien ist es außerdem 20x schneller!
* **Bessere Chat-Beobachtbarkeit.** Unsloth zeigt jetzt `llama-server` Zeitmessungen und Nutzung, eine Nutzungsleiste für das Kontextfenster und aussagekräftigere Quellen-Hoverkarten.
* **Insgesamt bessere UX** - anklickbare Links, bessere LaTeX-Analyse, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!
* **LiteLLM -** Unsloth Studio und Unsloth waren **NICHT** von dem jüngsten LiteLLM-Kompromiss betroffen. Nemo Data Designer verwendete LiteLLM nur bis `1.80` , nicht die betroffene `1.82.7` oder `1.82.8` , und hat es inzwischen vollständig entfernt.
* Wir haben jetzt einen neuen Ein-Zeilen-Installationsbefehl, führen Sie einfach aus:&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Fehlerbehebungen:**

* **Verbesserungen für Windows/Setup.** Behebung stiller Windows-Beendigungen, Anaconda-/conda-forge-Startabstürze, fehlerhafter Nicht-NVIDIA-Windows-Installationen und fehlender früher CUDA-/stale-venv-Setup-Prüfungen.
* **System-Prompts behoben.** Sie funktionieren wieder für Text- und Vision-Inferenz ohne GGUF.
* **Persistente System-Prompts und Presets.** Benutzerdefinierte System-Prompts und Chat-Presets bleiben jetzt über Neuladungen und Seitenwechsel hinweg erhalten.
* **GGUF-Export erweitert.** Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportiert werden. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der UI deaktiviert.
* **Fehlerbehebungen für Chat-Scrollen/Layout.** Probleme mit der Scrollposition während der Generierung, Layoutverschiebungen des Denkpaneels und Sprünge im Viewport beim Einklappen von Reasoning-Panels behoben.
* **Intelligente Erkennung von Portkonflikten.** Unsloth erkennt jetzt Loopback-Konflikte, kann nach Möglichkeit den blockierenden Prozess identifizieren und gibt klarere Meldungen zum Ausweichport.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Neues Tool-Calling + Windows-Stabilität

* Claude Artifacts funktioniert, sodass HTML wie ein Snake-Spiel direkt im Chat ausgeführt werden kann
* +30 % genauere Tool-Aufrufe, besonders für kleine Modelle + Timer für Tool-Aufrufe
* Tool- + Web-Suche-Ausgaben können gespeichert werden + Auto-Healing-Tool ein/aus schalten
* Viele Fehlerbehebungen - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
