> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/changelog.md).

# Unsloth-Updates

Um die neuesten Änderungen zu nutzen, [aktualisiere Unsloth](/docs/de/neu/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD-Unterstützung ist da!

Hallo zusammen! Diese Veröffentlichung bringt lokales LLM-Training und Inferenz zu [AMD-GPUs](/docs/de/grundlagen/amd.md) unter Windows, WSL und Linux.

<a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Schnellstart</a><a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Funktionen</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">Github</a>

Ab heute ermöglicht euch unsere AMD-Zusammenarbeit, benutzerdefinierte Triton-Kerne und mathematische Algorithmen, über 500 Modelle auf AMDs Radeon-, Instinct-, Vulkan-, Ryzen- und Rechenzentrums-GPUs zu trainieren und auszuführen, bis zu 2× schneller mit 70 % weniger VRAM und ohne Genauigkeitsverlust. Optimierte ROCm-Builds unterstützen außerdem GGUF- und Safetensors-Inferenz.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Update vom 23. Juli

1. Hinzugefügt **RDNA2-, Gorgon Halo- und Vulkan-Unterstützung** + behobenes AMD-Installationsproblem, bei dem GPUs auf Strix Halo / anderen AMD-GPUs nicht erkannt wurden
2. Besseres RDNA4 sowie automatische Fehlerbehebung und Erkennung von HIP-/ROCm-Fehlern
3. **2x schnellerer einheitlicher Speicher** AMD-Safetensors-Laden + deutlich schnelleres Gradient Checkpointing für Geräte mit einheitlichem Speicher
4. Hinzugefügt **Sprachdiktat / whisper.cpp** vorläufige Unterstützung für schnelles Text-zu-Sprache
5. Behobener Rollback-Umgebungen-Fehler bei Installationen, der 5 GB Speicherplatz verbrauchte – jetzt automatisch bereinigt

#### LLMs lokal auf AMD trainieren

* Modelle lokal auf AMD-GPUs trainieren, ausführen, mit RL arbeiten, chatten und bereitstellen.
* Zuverlässigere AMD-GPU-Erkennung und -Installation unter Windows, WSL und Linux.
* Verbesserte ROCm-Kompatibilität für AMD MI300X- und MI325X-GPUs.
* Greife remote auf Unsloth zu über `unsloth studio --secure` über kostenloses HTTPS via Cloudflare

#### Größere Modelle auf deiner Hardware ausführen

* Verwende automatische GPU-Zuordnung oder wähle genau aus, welche GPUs und Modellebenen verwendet werden sollen.
* Verschiebe MoE-Expertenebenen in den Systemspeicher, damit größere Modelle passen.
* Teile Modelle über mehrere GPUs auf oder verwende Tensor-Parallelismus.
* Speichere Hardwareeinstellungen separat für jedes Modell und Quant.

#### Schnellere Chat-Neustarts und zuverlässigere Downloads

* Lange Chats fortsetzen, ohne die gesamte Unterhaltung neu aufzubauen, nachdem ein untätiges Modell seinen VRAM freigibt.
* Hängengebliebene Hugging-Face-XET-Downloads werden automatisch über Standard-HTTP erneut versucht.
* Vorhandene GGUF-Dateien werden wiederverwendet, statt bei jedem Laden eines Modells erneut heruntergeladen zu werden.

#### Bessere Suche, Tools und Agenten

* Die Websuche kann jetzt PDF-Papiere, Handbücher und andere PDF-Ergebnisse lesen.
* Parallele Tool-Aufrufe, Reasoning-Ausgabe und Tool-Wiederholungen funktionieren zuverlässiger.
* Ein neuer optionaler MCP-Endpunkt ermöglicht kompatiblen KI-Clients, Modelle und Trainingshistorie zu prüfen, Training zu starten oder zu stoppen, Checkpoints zu laden, Rezepte zu validieren und GGUFs zu exportieren.
  * Aktiviere es mit `UNSLOTH_STUDIO_ENABLE_MCP=1` und setze das erforderliche Bearer-Token mit `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Trainings- und Exportkorrekturen

* Nur-Text-Training mit multimodalen Modellen kürzt lange Beispiele vor dem Packen nicht mehr.
* Feinabgestimmte Qwen3.5- und Qwen3.6-MTP-Modelle exportieren jetzt korrekt nach GGUF.
* Ein Windows-Berechtigungsfehler, der GGUF-Exporte beim letzten Schreibschritt stoppen konnte, wurde behoben.

#### Falls du es verpasst hast

Unsere vorherige Studio-Version brachte Dynamic-NVFP4-Modelle, tiefere Personalisierung, sieben neue Anzeigesprachen, sicherere Agenten und Vulkan-GPU-Beschleunigung.

**Dynamic NVFP4:**

Unsloth Dynamic NVFP4 lässt genauigkeitskritische Schichten in FP8 oder BF16, während der Rest in W4A4 läuft. Auf NVIDIA-Blackwell-GPUs ermöglicht das bis zu 2,5x schnellere Inferenz, während kalibrierte FP8-KV-Caches bis zu 2x längeren Kontext bieten.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) und erkunde unsere erweiterte [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4), einschließlich Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4.

**Personalisiere dein Studio:**

Wähle zwischen den Farbpaletten Standard, Classic und Minimal, jeweils mit hellen und dunklen Modi. Du kannst außerdem Farben anpassen, Schriftarten importieren und Schriftgröße, Kontrast, reduzierte Bewegung und mehr einstellen.

Unsloth enthält außerdem einen Reiter für Spracheinstellungen für Diktat, benutzerdefinierte Wörterbücher und Vorlesen.

**Neue Sprachen:**

Unsloth Studio ist jetzt auf Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch verfügbar, zusätzlich zu Chinesisch (vereinfacht), Japanisch und Portugiesisch (Brasilien). Die automatische Erkennung der Browsersprache ist jetzt der Standard.

**Sicherere Agenten:**

Ein Berechtigungsauswähler für Tool-Aufrufe mit vier Stufen-**Fragen**, **Für mich genehmigen**, **Aus** und **Voller Zugriff**- bietet feinere Kontrolle über Agenten. Die Isolierung des Agenten-Arbeitsbereichs und sicherere Installer-Prüfungen verringern außerdem das Risiko unbeabsichtigter Änderungen.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personalisierung, NVFP4, Sprachen

Hey Leute, wir haben viele neue Updates für Unsloth, besonders zur Anpassung. Unsloth ist jetzt ganz nach euren Wünschen personalisierbar: drei Farbpaletten plus benutzerdefinierte Farben und Schriftarten, sieben neue Anzeigesprachen und ein neuer Reiter für Spracheinstellungen für Diktat und Vorlesen. Agenten werden mit einem Berechtigungsauswähler für Tool-Aufrufe mit vier Stufen (Fragen, Für mich genehmigen, Aus, Voller Zugriff) und Arbeitsbereichsisolierung sicherer, und Intel-GPUs erhalten endlich GPU-beschleunigte Inferenz durch das neue Vulkan `llama.cpp` Unterstützung.

Wir haben außerdem native Unterstützung für [Inkling](https://unsloth.ai/docs/models/inkling)hinzugefügt, ein offenes Modell mit 975B Parametern, 41B aktiven Parametern und einem Kontextfenster von bis zu 1M Tokens. Unter Apache 2.0 lizenziert, akzeptiert es Text, Bilder und Audio und erzeugt Text.

#### Dynamic NVFP4

Wir haben unsere [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4) um quantisierte Versionen von Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4 erweitert.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) für Details.

Personalisiere dein Unsloth

Unsloth ist nicht mehr auf hellen und dunklen Modus beschränkt:

* Wähle aus **Standard**, **Classic**und **Minimal** Paletten, jeweils mit hellen und dunklen Varianten.
* Passe Akzent-, Hintergrund- und Vordergrundfarben an.
* Importiere deine eigenen Schriftarten für UI, Überschriften, Chat und Code.
* Passe Schriftgröße, Kontrast, Bewegung, Cursorverhalten und Schriftglättung an.
* Suche in den Einstellungen und synchronisiere Präferenzen geräteübergreifend.

Helle und dunkle Modi behalten ihre eigenen Anpassungswerte.

#### Sieben neue Sprachen

Unsloth unterstützt jetzt Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch sowie Chinesisch, Japanisch und Portugiesisch. Die automatische Erkennung der Browsersprache ist jetzt der Standard.

#### Spracheinstellungen

Ein neuer Reiter „Sprache“ bietet Steuerelemente für Diktat, Aussprache-Wörterbücher und Vorlesen. Unterstützung für Sprache-zu-Text und Text-zu-Sprache kommt bald; vollständige Sprachgespräche befinden sich noch in Entwicklung.

#### Sicherere Agenten und Tool-Aufrufe

Der alte Bypass-Schalter ist jetzt ein Berechtigungsauswähler mit vier Stufen:

* **Fragen:** jeden Tool-Aufruf genehmigen.
* **Für mich genehmigen:** Lesezugriffsaktionen automatisch ausführen und bei potenziell unsicheren Aktionen pausieren.
* **Aus:** Tool-Aufrufe deaktivieren.
* **Voller Zugriff:** alle Aufrufe zulassen und die Sandbox deaktivieren.

Diese Steuerelemente gelten für Terminal-, Python-, Websuche-, RAG- und MCP-Tools. Agenten erhalten außerdem isolierte Arbeitsbereiche, fortsetzbare Sitzungen mit `--persist`, sicherere Warnungen für Remote-Installer, Live-Streaming von Tool-Ausgaben und verbesserte Web-Extraktion.

#### Vulkan und `llama.cpp`

Das neue Vulkan `llama.cpp` Backend gibt Intel-GPUs GPU-beschleunigte Inferenz, statt auf die CPU zurückzufallen. Es unterstützt bestehendes VRAM-Management, automatische Kontextgröße, Multi-GPU-Auswahl und Layer-Offloading.

AMD-Nutzer können es aktivieren mit:

```bash
UNSLOTH_FORCE_VULKAN=1
```

Wir haben außerdem die Zuverlässigkeit von Updates, die Wiederherstellung des Modellzustands und das Unterbrechen hängen gebliebener Generierungen verbessert.

#### Modelle und Training

Diese Veröffentlichung enthält außerdem:

* Native Inkling-Unterstützung und Verbesserungen für Multi-GPU-B200.
* DeepSeek-V4 Eager Attention und trainierbare FP8-Gruppenexperten.
* Zuverlässiges Training nur für den Abschluss durch automatische Erkennung von Chat-Template-Markern.
* Korrekte Behandlung von deaktiviertem Gradient Checkpointing.
* Verbessertes RoPE-Scaling und Kontextverlängerung.
* Erzwungenes Stoppen für festhängende Trainingsläufe.
* Automatisches Routing für neue Modellarchitekturen und neuere Transformers-Versionen.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth kann jetzt nach dem Training NVFP4-, FP8- und imatrix-GGUFs exportieren; als llama-swap-API-System dienen; Unterstützung für Japanisch und brasilianisches Portugiesisch hinzufügen; und enthält MLX-, Safetensors-, Tool-Calling-, Healing-Unterstützung und mehr. Unsloth Core macht GRPO 1,3x schneller, fügt einen HTTP-Fallback für hängen gebliebene Downloads hinzu, verbessert den Offline-Modus, beschleunigt MoE-Training um das 3- bis 5-Fache und behebt viele Fehler. Diese Veröffentlichungsreihe verwendet `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/de/modelle/deepseek-v4.md) wird jetzt mit Thinking-Schaltern und unseren verbesserten Korrekturen für Chat-Templates unterstützt.

<div data-with-frame="true"><figure><img src="/files/d0fc7fb63bbb9a1d9e04b7d7ee876fcebd7515e6" alt="" width="375"><figcaption></figcaption></figure></div>

#### Intelligenteres API-Serving kompatibel mit OpenAI

Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agenten-Tools.

* API-Anfragen können den automatischen Wechsel zwischen heruntergeladenen lokalen GGUFs aktivieren, während unbekannte Modellnamen sicher weiterhin das aktuelle Modell verwenden.
* `/v1/models` gibt jetzt saubere Modell-IDs und den lokalen GGUF-Katalog zurück statt lokaler `.gguf` Pfade.
* Der automatische Entladevorgang im Leerlauf kann nach Inaktivität VRAM freigeben, und die Reparatur von Tool-Aufrufen kann jetzt pro Anfrage gesteuert werden.

#### Verbesserungen beim Export

Exporte sind flexibler und vermeiden unnötige Downloads.

* Wähle mehrere Exportformate auf einmal aus, darunter portables FP8/INT8, GGUF-LoRA, quellkodematchte Exporte, imatrix-GGUF und komprimiertes FP8/FP4.
* Exporte mit mehreren Checkpoints vermeiden weitere wiederholte Downloads des Basismodells.
* FP8-, INT8- und GGUF-LoRA-Exporte berücksichtigen jetzt `trust_remote_code`und der GGUF-Export behandelt fehlende Quantisierungseinstellungen zuverlässiger.

#### RAG und Datei-Chat

Datei-Chat ist mit echten Dokumenten nützlicher.

* RAG-Anhänge können jetzt den gesamten Dokumentenkontext verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.
* Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich Text von rechts nach links, indischen Text und DOCX-Tabellen.
* Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.

#### Unsloth-Feinschliff und Zuverlässigkeit

Die tägliche Nutzung sollte sich flüssiger und stabiler anfühlen.

* Lange Trainings- und Chat-Läufe frieren seltener still ein.
* Der Vergleichsmodus, der Modellwechsel, das Modellabbrechen, das Hub-Browsing und Hub Discover sind zuverlässiger.
* Projekt-Exporte, Chat-Exporte, Einstellungen, geführte Touren, Dateidialoge, Update-Bildschirme und die Reasoning-Oberfläche sind sauberer und einheitlicher.

#### Installer-, Hardware- und Plattformkorrekturen

Unsloth installiert und läuft plattformübergreifend zuverlässiger.

* macOS-Installationen benötigen kein CMake oder Homebrew mehr, wenn ein vorgefertigtes `llama.cpp` verfügbar ist, und die Apple-Silicon-Unterstützung behandelt Pfade mit Leerzeichen und die Größe des einheitlichen Speichers besser.
* Der Windows-Start, die UTF-8-Behandlung, ROCm-RAG-Embeddings und die ROCm-unter-WSL-GPU-Unterstützung wurden verbessert.
* Die Auswahl vorgefertigter Blackwell-GPUs, GGUF-Passungstests, Tensor-Parallelismus für Vision-/mmproj-GGUFs und lokale `llama.cpp` Wiederverwendung sind jetzt zuverlässiger.

#### Training, Modelle und Kerne

Training und das Laden von Modellen sind über mehr Setups hinweg zuverlässiger.

* GRPO unterstützt jetzt standardmäßig Sequenz-Packing, vermeidet wiederholte gemeinsame Prompts und behandelt DDP-Logit-Skalierung korrekt.
* Full Fine-Tuning, RL-Genauigkeitseinstellungen, Gradient Checkpointing, DDP-RoPE-Puffer und MoE-LoRA-Erkennung wurden behoben.
* FP8-Quantisierung/-Dequantisierung, Llama-3-RoPE-Scaling mit Transformers v5, PEFT-0.19-LoRA-Neuladungen und `fast_generate` Fehlermeldungen wurden verbessert.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3x längere Kontexte

[GLM-5.2](/docs/de/modelle/glm-5.2.md) wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. **3x längere Kontextlängen** sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP möglich, was längere Chats erlaubt. Bypass-Berechtigungsmodus, verzweigte Chats, warteschlangenfähige Chats, ein neues Hub zur Modellentdeckung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende `unsloth studio --secure` für sicheren HTTPS-Globalzugriff!

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Besserer Algorithmus für Kontextlänge

Laut [PR 1](https://github.com/unslothai/unsloth/pull/6312) und [PR 2](https://github.com/unslothai/unsloth/pull/6447)haben wir die Bestimmung von Speicherverbrauch und Kontextlänge in Unsloth Studio erheblich verbessert und insgesamt 3x längere Kontexte erreicht:

| Szenario                         | KV       | vorher  | nachher |
| -------------------------------- | -------- | ------- | ------- |
| 1x 32-GB-Pipeline (\~31 GB frei) | f16      | 23,040  | 64,000  |
|                                  | q8\_0    | 43,520  | 114,944 |
|                                  | q4\_0    | 82,432  | 199,680 |
| 2x 32-GB-Pipeline                | beliebig | 262,144 | 262,144 |
| 2x 24-GB-Tensor (\~23 GB frei)   | f16      | 134,049 | 262,144 |
|                                  | q8\_0    | 252,329 | 262,144 |

#### Chat-Canvas, Verzweigung & Warteschlangen

* Bearbeite Assistentennachrichten direkt und führe ab jedem Punkt im Thread erneut aus.
* Verzweige einen Thread, um ein Gespräch abzutrennen, ohne das Original zu verlieren.
* Temporäre (Inkognito-)Chats, die nichts hinterlassen.
* Neue Prompts in die Warteschlange stellen, während noch eine Generierung läuft, statt zu warten.
* Chat-„Artefakte“ sind jetzt **Canvas**mit eingebetteten **HTML-Canvas-Karten** die automatisch gerendert werden, einer Code-Ansicht, und DiffusionGemma hält seinen Rohcode weiterhin direkt sichtbar statt ihn einzuklappen.
* Die Chat-Suche durchsucht jetzt jede Nachricht und zeigt deine eigenen Nachrichten zuerst an.

#### Hub (neu gestaltet)

* Hub über die gesamte Seite mit Trend-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.
* README-Vorschau in einer geteilten Feed-Ansicht, damit du vor dem Download lesen kannst.
* Downloads nutzen standardmäßig das schnellere **Xet** Transportverfahren, mit automatischem HTTP-Fallback, wenn ein Transfer hängen bleibt.
* Neuer Schalter „Beim Auswählen laden“, um Ladeoptionen festzulegen, bevor ein Modell geladen wird.
* Google-Logo für DiffusionGemma und zukünftige Gemma-Derivate angezeigt.

#### Modelle & Inferenz

* DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.
* Schnelle Inferenz in der neuesten vLLM-Version (0.22+) behoben, sodass Beschleunigungen wieder funktionieren.
* Tensor-Parallelismus ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, stellt er sich jetzt selbst wieder her, statt abzustürzen.
* DiffusionGemma zeigt jetzt live die entstehende Bildentwicklung beim Entrauschen, mit genauen Geschwindigkeitsstatistiken.

#### Sicherheit & verschlüsselte Cloudflare-Studios

* Neu `--secure` Nur-Cloudflare-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter `--secure`aktiviert bleiben. Verwende `unsloth studio --secure`!
* Bypass-Berechtigungsmodus, um Bestätigungen zu überspringen und die Tool-Sandbox zu deaktivieren, wenn du es möchtest.
* Automatische Erkennung von Hugging-Face-Virenscan + gefährlichen Dateien in Repos.

#### Protokollierung und API

* Neu **API-Server-Monitor** in Unsloth.
* Schnellere API-Aufrufe und geringere Latenz
* Deutlich bessere, gestraffte Protokolle – jetzt mit Durchsatz und Latenz und viel aufgeblähtes Protokoll entfernt.

#### Hardware & Backend

* Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs
* Stilles Downgrading auf CPU statt GPU beheben
* Die torchao-Version wird jetzt aus dem installierten torch ausgewählt.
* Der Installer repariert jetzt automatisch eine beschädigte oder nur-CPU-basierte PyTorch-Installation und warnt vor stillem CPU-Fallback, unter NVIDIA + AMD auf Win/Linux/Mac/WSL.
* Gibt den VRAM des Chat-Modells frei, wenn das Training beginnt, aber nur wenn die GPU tatsächlich knapp ist (sonst keine unnötigen Neuladungen).
* Wenn llama-server beim Start hart abstürzt, durchläuft Unsloth jetzt eine Wiederherstellungskette statt einfach zu scheitern.

#### Training & allgemeine Korrekturen & parallele Module

* MLX-Trainingsupdates.
* Verbesserte Zuverlässigkeit des GRPO-Trainings mit vLLM.
* Der Trainingsstart wurde zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.
* Unsloth bereinigt jetzt nach Abstürzen, Neustarts oder unterbrochenem Herunterfahren übrig gebliebene Backend-Prozesse zuverlässiger.
* Export, Chat, Training und Rezepte sind jetzt alle individuell / abgeschottet! Das bedeutet, ihr könnt jetzt alle 4 parallel ausführen! Ihr könnt chatten / Inferenz machen, während ihr auf einen Trainingslauf oder einen Export wartet!

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Stelle sicher, dass du das neueste installierst [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) und [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) werden jetzt alle unterstützt.

* Ausführen und trainieren [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) über [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) ist da! Ausführen [Gemma 4](https://unsloth.ai/docs/models/gemma-4) mit MTP \~2x schneller.
* Audio-Chat wird jetzt für Gemma 4 unterstützt (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Preserve Think zu Gemma 4 hinzugefügt.

<figure><img src="/files/37d41a9986d4b1f503942b2654532cfdd5149728" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Download-Manager (experimentell)

* Eine neue **Hub** Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging-Face-Modellen und -Datensätzen hinzugefügt.
* Unsloth kann jetzt Modelle und Datensätze erkennen, die bereits auf deinem Rechner vorhanden sind, und sie neben heruntergeladenen Assets anzeigen.
* Heruntergeladene [GGUF-Modelle](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) haben jetzt direkte **Ausführen / Neuer Chat** Aktionen.

#### RAG / Chat mit Dateien (experimentell)

* Hinzugefügt [**Chat mit Dateien**](https://unsloth.ai/docs/new/studio/chat) in Unsloth, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.
* Unterstützt hybriden Suchmodus, Zitate, PDF-Vorschauen, threadspezifische Dokumente und ein integriertes `search_knowledge_base` Werkzeug.

#### Neuer Aktualisieren-Button + Hardware-Unterstützung

* Unsloth verwendet jetzt stets aktuelle und frische [llama.cpp-Vorab-Builds](https://unsloth.ai/docs/new/changelog) für CUDA, ROCm, Windows, Linux und macOS.
* Ein in der App vorhandener **llama.cpp aktualisieren** Button wurde hinzugefügt, damit Nutzer das lokale Backend aktualisieren können, ohne Unsloth neu zu installieren.
* Verbesserte AMD-Unterstützung unter Windows / WSL, [ROCm-Unterstützung für Strix Halo](https://unsloth.ai/docs/get-started/install/amd), [Blackwell-CUDA-Auswahl](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)und klarere Installationsmeldungen.

#### Lokaler Chat, Tools & API-Kompatibilität

* Lokales [Tool-Calling](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) ist zuverlässiger, mit besserer Anordnung von Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.
* Verbesserte [OpenAI-kompatible API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) und Anthropic-kompatibles API-Verhalten für lokale Unsloth-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und [Claude Code-Kompatibilität](https://unsloth.ai/docs/basics/claude-code).

#### Training & Fehlerbehebungen

* Verbesserte [MLX-Unterstützung](https://unsloth.ai/docs/new/studio/install) mit besseren Modellbezeichnungen, Statistiken zur Generierungsgeschwindigkeit und Behebungen für [VLM-Training](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Mehrere [Trainings-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) und [Datensatz-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) Grenzfälle behoben, einschließlich nicht beschreibbarer Hugging-Face-Caches und benutzerdefinierter Datensatz-Zuordnungen.
* Zahlreiche UI-Feinschliffe über Chat, Menüs, Modellauswahl, Dark Mode, Import/Export und Einstellungen hinweg hinzugefügt.

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, neue UI, MCP, Projekte

Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

<div data-with-frame="true"><figure><img src="/files/03c0fa542e2dd3a0afc9fcd0c9c021346fd41c97" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google veröffentlicht [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4)ein neues Modell, das lokal auf 8 GB RAM läuft. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Anleitung](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führen Sie das Modell über Unsloth Studio aus und trainieren Sie es.

#### MCP

* Entfernte `MCP` Server-Unterstützung, einschließlich benutzerdefinierter Header und OAuth
* Lokale befehlsbasierte `MCP` Server-Unterstützung
* `MCP` kann jetzt vom Chat-Composer aus aktiviert werden
* Integrierte Presets für gängige `MCP` Server

#### Neue Chat-UI

* Projekte, Canvas, `MCP`, RAG- und Compare-Steuerelemente befinden sich jetzt im Plus-Menü
* Suche- und Code-Steuerelemente sind vom Composer aus leichter zugänglich
* Menüs, Overlays, Symbole und anklickbare Steuerelemente sind in Unsloth konsistenter

#### Projekte

* Verwandte Chats in eigenen Projekt-Arbeitsbereichen organisieren
* Vorhandene Chats in Projekte verschieben
* Projekte direkt über die Seitenleiste erstellen und verwalten

#### Experimentelles Canvas / Artefakte

* Öffnet generiertes HTML in einem eigenen Canvas-Bereich innerhalb von Unsloth Studio
* Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und über CDN geladener Pakete
* Ermöglicht den Wechsel zwischen gerenderter Vorschau und Quellcode

#### Installation, Laufzeit und Hardware

* Vorab-Build-Installationen für Windows erfordern den frühen `CUDA Toolkit` Check
* Linux- `llama.cpp` Vorab-Builds stimmen jetzt mit der erkannten Laufzeit überein `cudart` großen
* `ROCm-` Die gfx-Erkennung wird in die Auswahl der Vorab-Builds übernommen
* `Blackwell`, `B300` und `ARM64` Updates zur Linux-Unterstützung

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Packaging nicht die neuesten Updates erhält!**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du verwenden:**

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Packaging nicht die neuesten Updates erhält!**
{% endhint %}

#### Mac-Updates

* Wieder aktiviert `llama.cpp` Vorab-Build-Binaries für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Apple Silicon Mac OS 13 (Ventura) ist ein Source-Build
* Intel (x86\_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet `llama.cpp` Vorab-Build-Binaries
* Intel für Max 13.0 - 13.2 ist ein Source-Build

#### Windows-Updates

* CUDA 13.3 `llama.cpp` Vorab-Build-Binaries funktionieren jetzt für Windows
* Für CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte den CUDA-12.4-Fallback - wir arbeiten bald an CUDA-13.1-Binaries.

#### CUDA-13.3-Update

* CUDA-13.3-Binaries für Nicht-Linux-Systeme funktionieren. Vorerst verwenden wir weiterhin CUDA 13.1
* CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 - siehe <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell-GPU-Update

* Vorerst wird Blackwell verzögerte Veröffentlichungen von `llama.cpp` Vorab-Build-Binaries haben, da CUDA 12.4 nicht funktioniert - wir arbeiten daran, dies bald zu beheben.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Ein Update vor dem Revamp.

Hey Leute, wir machen noch ein weiteres kleines Update vor einem größeren Revamp, der wahrscheinlich diese oder nächste Woche kommt. Unser Revamp wird vieles verändern, insbesondere mit neuen großen Funktionen und vielen Designänderungen.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NEU: [**Unterstützung für API-Aufrufe**](https://unsloth.ai/docs/integrations/connections) jetzt mit Bildgenerierung + Bearbeitung, richtiger Websuche, Codeausführung und automatischem Prompt-Caching. Verbinden [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) und mehr.
* Richtige Unterstützung für **nicht-englische Sprachen** z. B. Japanisch, Chinesisch, Indisch usw.

Viele von euch haben möglicherweise unsere vorherige Veröffentlichung verpasst, die nur einen Tag lang verfügbar war. Wir haben eingeführt:

* Mit externen Inferenz-Backends verbinden: [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Sicherheitsverbesserungen**
* **Automatisches MTP-Spekulative-Decoding** für MTP-GGUFs; erhalten Sie die besten Einstellungen, angepasst an Ihre Hardware.

#### API-Provider-Aufrufe & externe Verbindungen

* Sie können Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* Bildgenerierung + Bearbeitung
* API-Schlüssel für lokale Anbieter jetzt optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### Weitere Unsloth-Studio-Updates

* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* Härtung des IME-Composers, RTL `dir="auto"`, Behebung der Abschneidung langer Log-Zeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständig Offline-Unterstützung: gecachte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training

#### Sicherheitsverbesserungen in Unsloth Studio

* Authentifizierungs-Ratenbegrenzung, proxy-bewusst, damit Reverse-Proxys sie nicht umgehen
* Isolierter Worker mit verschärfter Blockliste (bash, `hf-Upload`, `NOFILE`)
* Pfad-Eingrenzung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
* Strikte Schema-Validierung über die gesamte Unsloth-API
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt den `torch.load` Fallback für `training_args.bin` damit nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Die Abbruchbereinigung ist jetzt streng auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals Benutzerdaten löschen kann
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP- + Unsloth-Fehlerbehebungen

Viele Fehlerbehebungen sowie UI-/UX-Fixes für Unsloth! Um die neuesten Updates zu erhalten, führen Sie aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Fehlerbehebungen

1. Beheben `Unsloth-Studio-Update` funktioniert nicht gut
2. Behebung eines Hängers auf `reset-password` Seite
3. Mehr Unterstützung für den Offline-Modus
4. Verbessern, dass MTP auf Macs, CPUs und GPUs nicht schneller ist - jetzt ist es viel besser!
5. Behebung: Desktop-Verknüpfung funktioniert nach dem Update nicht
6. Sehr, sehr viele UI-/UX-Fehlerbehebungen
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API-Verbindungen

Wir haben viele neue Updates für Unsloth `v0.1.41-beta`:

* **etwa 2x schnellere GGUF-Inferenz** mit automatisch aktiviertem [MTP](/docs/de/modelle/qwen3.6.md#mtp-guide)
* [**Unterstützung für API-Aufrufe**](/docs/de/integrationen/connections.md) für [OpenAI](/docs/de/integrationen/connections/openai.md), [Anthropic](/docs/de/integrationen/connections/anthropic-claude.md) usw. mit automatischem Prompt-Caching, Websuche, Codeausführung
* Mit externen Inferenz-Backends verbinden: [vLLM](/docs/de/integrationen/connections/vllm.md), [Ollama](/docs/de/integrationen/connections/ollama.md), [llama-server](/docs/de/integrationen/connections/llama.cpp-mit-unsloth-verbinden-ggufs-mit-llama-server-ausfuhren.md)
* Experimentelle **MLX-Inferenz**
* Richtige Unterstützung für **nicht-englische Sprachen**
* **Sicherheits-** verbesserungen

<a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#qwen3.6-inference-tutorials" class="button primary">Qwen3.6-Tutorials ausführen</a><a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#mtp-guide" class="button primary">MTP-Anleitung</a>

<div data-with-frame="true"><figure><img src="/files/7b482fd313c9534e8f7f4639059ce9449817c948" alt="" width="375"><figcaption></figcaption></figure></div>

#### MTP-Unterstützung für spekulatives Decoding: 1,4 bis 2x schnellere Inferenz!

* **Automatisches MTP-Spekulative-Decoding** für MTP-GGUFs; warnen, wenn der mitgelieferte llama.cpp-Vorab-Build veraltet oder zu alt für MTP ist
* Neue vorgefertigte llama.cpp-Binaries für MTP-Unterstützung!

#### API-Provider-Aufrufe & externe Verbindungen

* Sie können Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* API-Schlüssel für lokale Anbieter jetzt optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### MLX-Inferenz (experimentell)

* MLX-Quants und -Modelle können jetzt lokal auf Ihren Mac-Rechnern ausgeführt werden!
* Wir werden bald Thinking, Tools und Websuche hinzufügen!

#### Weitere Unsloth-Studio-Updates

* Das Senden/Prompting nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Härtung des IME-Composers, RTL `dir="auto"`, Behebung der Abschneidung langer Log-Zeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständig Offline-Unterstützung: gecachte GGUF-Erkennung und automatische Offline-DNS-Erkennung für Inferenz und Training
* Zahlreiche UI/UX-Feinschliffe: Refactoring des Dark Themes, Neugestaltung der rechten Seitenleiste, Sloth-Maskottchen je nach Tageszeit, wegklickbare kopierbare Toaster, größerer Chat-Composer, Feinschliff der Codeausführungs-Konfiguration, Styling der Composer-Aktions-Pille, schmalerer Discord-Button

#### Trainings-Updates

* Korrekturen am Gemma-Attention-Mask
* Multi-Image GRPO
* Experimente zur Rückgabe des GRPO-Hidden-State
* Neue Methode des Continued Pretraining (CPT) als erstklassige Option
* Gemma-4-MoE-LoRA-Extractor registriert, um `grouped_mm` Contraction-Absturz
* Optionale gefusete `lm_head` + Cross-Entropy-Forward, mit Single-Matmul-Pfad unter `UNSLOTH_RETURN_LOGITS=1`
* Batch-Größe für Eval übergeben
* Eval-/Trainingspfade beachten jetzt `HF_DATASETS_OFFLINE` zusammen mit `HF_HUB_OFFLINE`

#### Sicherheitsverbesserungen in Unsloth Studio

* Authentifizierungs-Ratenbegrenzung, proxy-bewusst, damit Reverse-Proxys sie nicht umgehen
* Isolierter Worker mit verschärfter Blockliste (bash, `hf-Upload`, `NOFILE`)
* Pfad-Eingrenzung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
* Strikte Schema-Validierung über die gesamte Unsloth-API
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt den `torch.load` Fallback für `training_args.bin` damit nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Die Abbruchbereinigung ist jetzt streng auf laufende tmp-Verzeichnisse beschränkt, sodass sie niemals Benutzerdaten löschen kann
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth-API-Endpunkt

#### ***Fehlerbehebung in v0.1.39-beta*** **5. Mai 2026**

Behebt, dass der Chatverlauf nicht angezeigt wird (bestehender Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler betraf nur die Darstellung - verwenden Sie `2026.5.2` oder rufen Sie direkt `curl -fsSL https://unsloth.ai/install.sh | sh`  auf, um zu aktualisieren

Sie können lokale LLMs mit Tools wie [Claude Code](https://unsloth.ai/docs/basics/claude-code) und [Codex](https://unsloth.ai/docs/basics/codex) verwenden, indem Sie sie mit dem API-Endpunkt von Unsloth verbinden. So können Sie Modelle wie [Qwen](https://unsloth.ai/docs/models/qwen3.6) und [Gemma](https://unsloth.ai/docs/models/gemma-4) lokal ausführen, mit zusätzlichen Funktionen wie selbstheilenden Tool-Aufrufen, Codeausführung und Websuche.

Unsloth als API-Inferenz-Endpunkt zu verwenden, ist nicht nur deshalb vorteilhaft, weil es einfach einzurichten und schnell ist, sondern auch, weil Unsloth Folgendes bietet:

* [Selbstheilende Tool-Aufrufe](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), was dazu beiträgt, fehlerhafte oder unvollständige Tool-Aufrufe um 50 % zu reduzieren
* [Codeausführung](https://unsloth.ai/docs/new/studio/chat#code-execution) Unterstützung, die Bash- und Python-Ausführung für genauere Code-Ausgaben ermöglicht.
* Erweitert [Websuche](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) die Webseiten besucht und tatsächlich liest, um detaillierte Informationen zu sammeln.
* [Automatische Inferenz-Einstellungen](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) für GGUF-Modelle (temp, top-k usw.)

<div data-with-frame="true"><figure><img src="/files/4d7f67e24fb64209883a9782fb1c8e4d7782a66f" alt="" width="375"><figcaption></figcaption></figure></div>

#### Neue Modelle

Wir haben außerdem eine Reihe neuer Modelle zum Ausführen, darunter NVIDIA [Nemotron 3 Nano Omni](/docs/de/modelle/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/de/modelle/ibm-granite-4.1.md) und [Mistral 3.5](/docs/de/modelle/mistral-3.5.md) Medium. Wir haben Mistral geholfen, einige Probleme bei der Implementierung in Transformers und GGUFs zu lösen.

#### Unsloth-Updates

* Gestoppte Unsloth-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.
* Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.
* Hänger beim DPO-Training in Multi-Prozess-Setups wurden behoben.
* VLM-GRPO-Unterstützung mit MROPE-Updates verbessert.
* Der Stopp-Button von Unsloth stoppt die Generierung jetzt korrekt.
* Behebung: Chat-Vorlage verschwindet nach dem Browser-Refresh.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Brandneue UI-Neugestaltung

Hey Leute, wir haben die gesamte Unsloth-Studio-UI- und UX-Erfahrung überarbeitet, um einen Schwerpunkt auf Chat und Training zu legen:

* Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

<div data-with-frame="true"><figure><img src="/files/185679ec5ea5e6010281442e142bd0d961fb8f08" alt="" width="375"><figcaption></figcaption></figure></div>

* Sie können jetzt Chats löschen und frühere Gespräche durchsuchen

<div><figure><img src="/files/e57d933175dd866c23fb6d9276cdfb38ea19b22d" alt=""><figcaption></figcaption></figure> <figure><img src="/files/458049913eb8246383936137e5b124396134423d" alt=""><figcaption></figcaption></figure></div>

* Neuer Umschalter „Thinking beibehalten“ für Modelle, die es unterstützen, wie Qwen3.6
* Saubereres, konsistenteres Design mit einfacherer Navigation
* Erweiterte Einstellungsseite mit Optionen zum Ändern Ihres Profilbilds, Namens und mehr

<div data-with-frame="true"><figure><img src="/files/e1b3c839b73e0fd270b11a2912b3fa53fd6ac640" alt="" width="375"><figcaption></figcaption></figure></div>

* Kein doppeltes Eingeben Ihres Hugging-Face-Tokens mehr
* gpt-oss hat jetzt Umschalter für niedriges, mittleres und hohes Thinking.
* Verwendet jetzt das neueste llama.cpp-Vorab-Build, sogar unter Linux CUDA
* Viele Fehler-, Konsistenz- und Stabilitätskorrekturen
* Kimi-K2.6 kann jetzt ausgeführt werden!
* Wir haben auch experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. kommen nächste Woche.

Qwen3.6 wurde in Unsloth Studio auch zuvor schon für Ausführung und Training unterstützt. Sie können Qwen3.6-27B jetzt sofort trainieren und ausführen!
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/de/modelle/qwen3.6.md) kann jetzt ausgeführt werden (18 GB RAM) und in Unsloth Studio feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).

Unsloth Studio hat viele neue Updates erhalten, also bitte aktualisieren. Details und ein ausführlicher Beitrag kommen in den nächsten Tagen.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/de/modelle/qwen3.6.md) kann jetzt ausgeführt und in Unsloth Studio feinabgestimmt werden. Das Modell läuft mit 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma-4-Update + MiniMax-M2.7**

[Gemma-4-GGUFs](https://huggingface.co/collections/unsloth/gemma-4) wurden jetzt mit Googles offiziellen Korrekturen an der Chat-Vorlage aktualisiert (wodurch Tool-Calling behoben/verbessert wurde), zusammen mit den neuesten llama.cpp-Korrekturen. Aktualisieren Sie auf das neueste llama.cpp, laden Sie die Quants erneut herunter, und Sie sollten kein `nicht verwendetes Token` Probleme mehr sehen.\
\
[MiniMax-M2.7](/docs/de/modelle/tutorials/minimax-m27.md) ist jetzt verfügbar! Sie können das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma-4-Fehlerbehebungen**

Wir haben Gemma 4 aktualisiert [mit vielen Fehlerbehebungen](/docs/de/modelle/gemma-4/train.md). Diese Fehler sind universell und betrafen alle Trainingspakete und Implementierungen und **stammten nicht von Unsloth**. Wir haben die Fehler identifiziert, behoben, und Gemma-4-Training funktioniert jetzt in Unsloth korrekt.

Sie brauchen nur **8 GB VRAM** zum Trainieren **Gemma-4-E2B** lokal. Unsloth trainiert Gemma 4 **etwa 1,5x schneller und verwendet dabei etwa 60 % weniger VRAM** als FA2-Setups. Für die vollständige Anleitung und Notebooks zum Gemma-4-Training, [sehen Sie sich unseren Blog an](/docs/de/modelle/gemma-4/train.md).

#### Gemma-4-Trainingskorrekturen

1. **Gradient Accumulation** führt nicht mehr zu Verlust-Explosionen. Früher konnten die Verluste ansteigen auf **300–400**; der erwartete Verlust liegt bei etwa **10–15**.
2. Behoben wurde der **IndexError** der **26B** und **31B** Inferenz in `Transformers`.
3. Behoben: Kauderwelsch-Ausgaben für **E2B/E4B** wenn `use_cache=False`. Siehe [Problem #45242](https://github.com/huggingface/transformers/issues/45242).
4. Behoben **float16-Audio-** Überlauf von `-1e9` Werten.

Wenn Sie Verluste über **13–15** sehen, zum Beispiel **100** oder **300** - wird Gradient Accumulation wahrscheinlich falsch gehandhabt. Dies ist in beiden behoben **Unsloth** und **Unsloth Studio**.

#### Gemma-4-Quant-Reuploads

Wir haben auch unsere Gemma-4-GGUFs aktualisiert, daher müssen Sie sie erneut herunterladen. Auch hier stehen diese Quantisierungsprobleme in keinem Zusammenhang mit Unsloth und wurden nicht durch Unsloth verursacht **oder durch Unsloth verursacht**:

1. CUDA: vor dem Fusionieren auf Pufferüberlappung prüfen - kritischer Fix für `<unused24>` Tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`: Unterstützung für Attention-Rotation bei heterogenem iSWA - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `Vokabular`: Byte-Token-Behandlung zum BPE-Detokenizer für Gemma 4 hinzufügen - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `konvertieren`: setzen `"add bos" == True` für Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `allgemein`: spezialisierten Gemma-4-Parser hinzufügen - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lesen `final_logit_softcapping` für Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: benutzerdefinierten Zeilenumbruch-Split für Gemma 4 hinzufügen - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth-Studio-Updates

* Hinzufügen **spekulative Dekodierung** Unterstützung (ngram-mod, standardmäßig aktiviert)
* Llama.cpp wurde auf die neueste Version mit allen Gemma-4-Fixes aktualisiert
* Qwen3.5- und Gemma-4-Trainingsprobleme beheben
* Export und Speicherung von Gemma-4-Modellen aktivieren
* Sandbox-Sicherheit für Terminal- und Python-Tools stärken
* Rezepte das in Chat geladene Modell verwenden lassen
* Leere Chat-Threads bei der Navigation (und beim Wechseln von Tabs) beheben und den neuen Chat-Ablauf stabilisieren
* Ausführung von Nicht-LLM-Rezepten erlauben und den Daten-Tab bei Ausführungen an erste Stelle verschieben
* Zwischengespeicherte Repo-Groß-/Kleinschreibung von HF wiederverwenden, um doppelte Downloads zu verhindern
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Du kannst jetzt die [Gemma 4](/docs/de/modelle/gemma-4.md) Modelle in Unsloth ausführen und trainieren.
* Intel-Mac funktioniert jetzt
* Vorkompilierte Binärdateien für llama.cpp für 2 Gemma-4-Fixes:
  * vocab: Gemma-4-Tokenizer beheben ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * fix: Gemma-4-Template ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Tool-Aufrufe für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten
* Vorkompilierte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU
* Spekulative Dekodierung für Nicht-Vision-Modelle hinzugefügt (Gemma-4 ist leider Vision und Qwen3.5)
* Die Kontextlänge wird jetzt korrekt angewendet.
* Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* 90 % weniger HF-API-Aufrufe - weniger Rate-Limits
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % Genauigkeit bei Tool-Aufrufen + mehr Unterstützung**

* Tool-Aufrufe für alle Modelle sind jetzt **um 30 % bis 80 % genauer.**
* Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* Die Anzahl erlaubter Tool-Aufrufe wurde von 10 auf 25 erhöht
* Tool-Aufrufe beenden sich jetzt deutlich besser, sodass Schleifen/Wiederholungen reduziert werden
* Mehr **Heilung von Tool-Aufrufen** und Deduplizierungslogik, damit Tool-Aufrufe ebenfalls kein XML mehr ausgeben
* Getestet mit `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), Websuche + Codeausführung + Denken aktiviert.

| Metrik                             | Vorher | Nachher         |
| ---------------------------------- | ------ | --------------- |
| XML-Lecks in der Antwort           | 10/10  | 0/10            |
| Verwendete URL-Abrufe              | 0      | 4/10 Durchläufe |
| Durchläufe mit korrekten Songnamen | 0/10   | 2/10            |
| Durchschnittliche Tool-Aufrufe     | 5.5    | 3.8             |
| Durchschnittliche Antwortzeit      | 12.3s  | 9.8s            |

#### Neue Funktionen

* Hinzugefügt **benutzerdefinierte Ordner** sodass du beliebige GGUFs in jedem Ordner verwenden kannst - derzeit Zugriff in den erweiterten Einstellungen in Chat und Benutzerdefinierte Ordner
* **Update-Button** jetzt sichtbar
* Das Styling des Installationsskripts wurde komplett aktualisiert!
* Vorläufig **Automatische Multi-GPU-Unterstützung für Inferenz und Training** - nützlich für große Modelle, die nicht auf 1 GPU passen - Unsloth Auto weist GPU-Ressourcen automatisch zu
* Intel-Macs sollten sofort funktionieren

Viel flüssigeres und schnelleres Unsloth

* **Timeouts beim Herunterladen großer Modelle behoben** - keine Timeouts mehr.
* **Rate-Limiting von Hugging Face behoben - HF-API-Aufrufe um 90 % reduziert**
* Bun unter Windows behoben und schnellere Installationen
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Neue wichtige Updates**

Es sind erst 2 Tage seit unserer vorherigen Veröffentlichung vergangen, aber wir haben wichtigere Updates:

* **Die Inferenz ist jetzt 20–30 % schneller.** Früher konnten Tool-Calling und Wiederholungsstrafe die Inferenz unter die normalen Geschwindigkeiten verlangsamen. Inferenz-Tokens/s sollte jetzt genauso funktionieren wie `llama-server` / `llama.cpp`.
* **Ältere oder bereits vorhandene Modelle werden jetzt automatisch erkannt** heruntergeladen von **LM Studio, Hugging Face,** und ähnlichen Quellen.
* **Die Inferenz-Token/s-Geschwindigkeit wird jetzt korrekt berechnet.** Früher enthielten tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer wirkte, als sie tatsächlich war. Sie sollte jetzt die 'echte' Inferenzgeschwindigkeit widerspiegeln.
* **Die CPU-Auslastung steigt nicht mehr sprunghaft an.** Früher änderte sich die Identität des Inline-Queryers bei jedem Rendern, was `useLiveQuery` zu einer kontinuierlichen erneuten Anmeldung führte.
* **Unsloth Studio hat jetzt eine X-Schaltfläche zum Beenden und fährt ordnungsgemäß herunter.** Früher wurde es nach dem Öffnen über das Desktop-Symbol beim Schließen nicht richtig beendet. Jetzt öffnet das Starten über die Verknüpfung auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Wenn es noch aus einer vorherigen Sitzung geöffnet ist, kannst du deinen Computer neu starten oder `lsof -i :8888` dann `kill -9 <PID>`.
* **Noch besseres Tool-Calling und Websuche** mit weniger Fehlern.
* Aktualisierte Dokumentation mit vielen neuen Informationen zu [dem Löschen von Modellen, der Deinstallation](/docs/de/neu/studio/install.md#uninstall) usw.
* **Sauberere, intelligentere Installations- und Setup-Protokollierung unter Windows und Linux.** Die Ausgabe ist jetzt dank einheitlicher Formatierung leichter zu lesen, standardmäßig ruhiger für eine flüssigere Erfahrung und unterstützt umfangreichere `--verbose` Diagnosen, wenn du volle technische Details möchtest.
* Du kannst jetzt deinen Trainingsverlauf ansehen!
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Erste Veröffentlichung nach Unsloth Studio

Hey Leute, das ist unsere erste Veröffentlichung seit dem Start von Unsloth Studio. Viele neue Funktionen und Fehlerbehebungen:

* **Du kannst Unsloth Studio jetzt aktualisieren!** Bitte aktualisiere es mit denselben Installationsbefehlen.
* **Windows** CPU oder GPU funktionieren jetzt nahtlos. Bitte neu installieren!
* **App-Verknüpfungen**. Nach der Installation kannst du jetzt unter Windows, MacOS und Linux über ein Verknüpfungssymbol im Start-/Launch-Menü und auf dem Desktop starten.
* **Vorkompilierte `llama.cpp` Binärdateien** und `mamba_ssm` - 6x schnellere Installationen! Außerdem weniger als 300 MB groß für Binärdateien.
* **50 % kleinere Installationsgrößen** (-7 GB oder mehr Einsparungen), 2x schnellere Installationen und schnellere Auflösung. 50 % kleinere PyPI-Größen.
* **Tool-Calling verbessert.** Bessere llama.cpp-Analyse, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Tool-Ausgabe-Panel, Timer.
* MacOS und CPU haben jetzt [Daten-Rezepte](/docs/de/neu/studio/data-recipe.md) mit Upload mehrerer Dateien aktiviert.
* **Vorläufige AMD-Unterstützung für Linux** nur auf Maschinen - automatische Erkennung.
* **Neugestaltung der Einstellungen-Seitenleiste.** Einstellungen sind jetzt gruppiert in **Modell, Sampling, Tools und Einstellungen**
* **Kontextlänge** jetzt anpassbar. Beachte, dass dies nicht nötig ist, da llama.cpp den exakt benötigten Kontext intelligent verwendet über `--fit on`
* **Upload mehrerer Dateien.** Daten-Rezepte unterstützen jetzt mehrere Drag-and-drop-Uploads für PDF, DOCX, TXT und MD, mit Backend-Extraktion, gespeicherten Uploads und verbesserten Vorschauen.
* **Colab** mit kostenlosen T4-GPUs mit Unsloth Studio jetzt behoben! [Hier ausprobieren](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Dank vorkompilierter Binärdateien ist es außerdem 20x schneller!
* **Bessere Chat-Beobachtbarkeit.** Unsloth zeigt jetzt `llama-server` Zeitmessungen und Nutzung, eine Nutzungsleiste des Kontextfensters und ausführlichere Quell-Hovercards.
* **Insgesamt bessere UX** - anklickbare Links, bessere LaTeX-Analyse, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!
* **LiteLLM -** Unsloth Studio und Unsloth waren **NICHT** vom jüngsten LiteLLM-Kompromiss betroffen. Nemo Data Designer nutzte LiteLLM nur bis `1.80`, nicht die betroffene `1.82.7` oder `1.82.8`, und hat es seitdem vollständig entfernt.
* Wir haben jetzt einen neuen Einzeilen-Installationsbefehl, einfach ausführen:&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Fehlerbehebungen:**

* **Verbesserungen für Windows/Setup.** Stille Windows-Beendigungen, Anaconda-/conda-forge-Startabstürze, fehlerhafte nicht-NVIDIA-Windows-Installationen und fehlende frühe CUDA-/stale-venv-Setup-Prüfungen behoben.
* **System-Prompts behoben.** Sie funktionieren wieder für Nicht-GGUF-Text- und Vision-Inferenz.
* **Persistente System-Prompts und Voreinstellungen.** Benutzerdefinierte System-Prompts und Chat-Voreinstellungen bleiben jetzt über Neuladungen und Seitenwechsel hinweg erhalten.
* **GGUF-Export erweitert.** Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportiert werden. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der UI deaktiviert.
* **Fehlerbehebungen für Chat-Scrollen/Layout.** Probleme mit der Scrollposition während der Generierung, Layout-Verschiebungen des Denk-Panels und Viewport-Sprünge beim Einklappen von Reasoning-Panels behoben.
* **Intelligentere Erkennung von Portkonflikten.** Unsloth erkennt jetzt Loopback-Konflikte, kann den blockierenden Prozess wenn möglich identifizieren und gibt klarere Nachrichten zum Ausweichport.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Neues Tool-Calling + Windows-Stabilität

* Claude Artifacts funktioniert, sodass HTML wie ein Snake-Spiel im Chat ausgeführt werden kann
* +30 % genauere Tool-Aufrufe, insbesondere für kleine Modelle + Timer für Tool-Aufrufe
* Tool- + Websuche-Ausgaben können gespeichert werden + automatisches Tool-Healing ein-/ausschalten
* Viele Fehlerbehebungen - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
