> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/changelog.md).

# Unsloth-Updates

Um die neuesten Änderungen zu nutzen, [Unsloth aktualisieren](/docs/de/neu/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-08-20" tags="new-releases" %}

## Automatische Kompaktierung + LAN-Zugriff

Danke für die Unterstützung für Qwen3.8-27B und Unsloth Desktop letzte Woche! Für unsere [neue `v0.1.801-beta` Veröffentlichung](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta), haben wir über 200 PRs zusammengeführt, um viele neue Funktionen und Fehlerbehebungen einzuführen, darunter:

* **Automatische Kompaktierung (experimentell)** für längere Chats über Kontextgrenzen hinaus
* **Remote- und LAN-Zugriff (Vorschau)** für einfachen Netzwerkzugriff ohne Cloudflare-Links
* **Schnellerer Chat** - Verbesserte Streaming-Leistung, weniger UI-Lags und flüssigere lange Gespräche.
* Unterstützung für **benutzerdefinierte llama.cpp-Builds**. Umschalter für Cache RAM, Mmap, Mlock, Checkpoints, Spe Decoding KV Cache, Vision An / Aus
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) ist veröffentlicht. Die neuen Qwen3.8-27B Dynamic v3.0 GGUFs liefern >10 % höhere Top-1-Genauigkeit als alle anderen. Funktioniert mit Unsloth.

#### Automatische Kompaktierung (experimentell)

Lange Chats können nun Kontextgrenzen überschreiten, indem ältere Gesprächsrunden in ein durchsuchbares Archiv verschoben werden.

* Ältere Gesprächsrunden werden nur bei Bedarf entfernt und bleiben durchsuchbar.
* Frische Kontext-Epochen verbessern die Erinnerung, ohne Chats dauerhaft zu kürzen.
* Verwendet Abruf statt Zusammenfassung für bessere Genauigkeit.

#### Remote- und LAN-Zugriff (Vorschau)

Greife von anderen Geräten in deinem Netzwerk auf Unsloth zu.

* Neue Einstellungen für den Fernzugriff.
* LAN-Steuerung, QR-Codes und Autostart-Optionen.
* Aus Sicherheitsgründen standardmäßig deaktiviert.

#### Verbesserungen am Chat

* Schnellere lange Chats und verbessertes Threading.
* Projekte organisieren Chats, Dateien und Arbeitsbereiche.
* Prompt-Warteschlange, Shortcuts, `edit_file`, und bessere Tool-Unterstützung.

#### Hardware, Inferenz, API

* Unterstützung für benutzerdefinierte llama.cpp-Builds und Intel XPU.
* Mehr Inferenz-Steuerungen (Cache, mmap, mlock, Checkpoints, spekulatives Decoding, Vision).
* Verbesserte GPU-Validierung, VRAM-Verarbeitung und Kompatibilität.
* Strukturierte Ausgaben in der Responses-API.
* Bessere Wiederherstellung von llama-server.

Um Qwen3.8 auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B und Qwen3.8-2.4T können jetzt lokal in Unsloth ausgeführt werden!

Mit Unsloth Dynamic GGUFs auf 17 GB RAM ausführen. Du kannst Qwen3.8-27B in Unsloth auch feinabstimmen. Qwen3.8-27B ist mit Abstand das stärkste Modell seiner Größe. Wir haben auch NVFP4-Quants hochgeladen.

<a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616" class="button primary">Qwen3.8-Anleitung ausführen</a><a href="/pages/9e82a50e6e0d5d7acdb8b1e0b3d769fa91e350bf" class="button secondary">Muse Glimmer feinabstimmen</a>

<figure><img src="/files/890a793f7df395610304b6fca7b69cde807076b5" alt="" width="375"><figcaption></figcaption></figure>

Weitere Unsloth-Updates umfassen:

* Qwen3.8-27B + zusätzliche llama-server-Argumente erlaubt + Schalter für benutzerdefinierten VRAM
* Externer Anbieter hat Tool-Aufrufe + Tool-Unterstützung + Anmeldung mit Codex
* Schnelle FP8, 10x schnellere MiniMax-H3-Inferenz (3 Minuten statt 30)
* 10 % schnellere Inferenz für GGUFs + Umgehung der Berechtigungen behoben
* Verbunden [API-Anbieter](/docs/de/integrationen/connections.md) können entweder ihre eigene Suche oder die integrierte Suche und Tools von Unsloth Desktop verwenden. Tool-Ergebnisse werden an das Modell zurückgegeben, damit es mehrstufige Aufgaben fortsetzen kann.
* Mit einem Codex-Abonnement anmelden und Codex-Tools in Chat verwenden.

Um Qwen3.8 auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## Einführung von Unsloth Desktop

Wir stellen Unsloth Desktop vor 🦥 – die erste Desktop-App, um Modelle lokal auszuführen und zu trainieren.\
Open Source. Läuft auf Mac, Windows und Linux

<figure><img src="/files/0b36d843a92fb658bca1072a17cd8147bcf465a3" alt=""><figcaption></figcaption></figure>

• Unterstützt MLX, Diffusion für Bilder/Videos, Audio, GGUF\
• Verbinde Claude Code und Codex mit lokalen LLMs\
• 50 % genauere, sich selbst reparierende Tool-Aufrufe + Sandbox-Codeausführung\
• Funktioniert für CPU- + Multi-GPU-Setups – NVIDIA, AMD, Intel, Mac\
• Trainiere Modelle 2× schneller mit 70 % weniger VRAM\
• Private Websuche, Deep Research, RAG, MCP + Exporte (NVFP4, GGUF)\
• Verwende Unsloths OpenAI-kompatible API und Cloud-Modelle\
• Sichere Bereitstellung von LLMs aus der Ferne und Zugriff von überall

Du kannst Unsloth Desktop jetzt herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer ist da!

Meta hat Muse Glimmer veröffentlicht, das erste offene Modell von Meta Superintelligence Labs. Muse Glimmer ist ein dichtes Modell mit 30B Parametern von Meta, entwickelt für lokale agentische und Coding-Workflows. Unter Apache-2.0-Lizenz veröffentlicht, kannst du Muse Glimmer 30B über Unsloth und Unsloth Dynamic Quants für die beste Leistung ausführen.

<a href="/pages/905dffb7435b8aae6f540021fb352ca634402d1c" class="button primary">Muse Glimmer ausführen</a><a href="/pages/9e82a50e6e0d5d7acdb8b1e0b3d769fa91e350bf" class="button secondary">Muse Glimmer feinabstimmen</a>

Muse Glimmer 30B kann lokal laufen auf **20 GB RAM/VRAM** Setups, einschließlich Mac und GPUs. Du kannst Muse Glimmer 30B auch mit Unsloth auf\
20 GB VRAM trainieren und feinabstimmen **20 GB VRAM**.

Du kannst Muse Glimmer über die Unsloth-Desktop-App ausführen und feinabstimmen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + Deep Research + Parallel-Chat

Hallo zusammen! [Kimi K3](/docs/de/modelle/kimi-k3.md) kann jetzt lokal mit Unsloth Dynamic GGUFs ausgeführt werden, Unsloth kann mehrere Chats parallel generieren lassen, und der neue Deep-Research-Modus plant, liest und zitiert Quellen mit deinem lokalen Modell.

Dieses Release bringt außerdem bessere [AMD](/docs/de/grundlagen/amd.md) und Intel-GPU-Unterstützung, DoRA-Training sowie viele Fehlerbehebungen bei Installer, MLX, Export und Inferenz.

#### Kimi K3

Moonshot AIs **Kimi K3** ist ein 2,8T-Parameter-MoE-Modell mit 104B aktiven Parametern, nativer Vision-Unterstützung und einem Kontextfenster von 1 Mio. Kimi K3 ist nur fürs Denken und Unsloth unterstützt niedrigen, hohen und maximalen Reasoning-Aufwand.

Du kannst unsere [Kimi K3 Dynamic GGUFs](https://huggingface.co/unsloth/Kimi-K3-GGUF) über Unsloth ausführen. Unsloth erkennt Multi-GPU-Setups automatisch und kann Modellschichten in den Systemspeicher auslagern.

Kimi K3 ist ein sehr großes Modell, plane deine Hardware entsprechend:

* `UD-IQ1_S` belegt 595 GB Speicherplatz.
* `UD-Q4_K_XL` belegt 1,51 TB Speicherplatz.
* Für verlustfreie Inferenz verwende `UD-Q8_K_XL`, das 1,56 TB Speicherplatz belegt.

Lies unsere vollständige [Kimi-K3-Anleitung](https://unsloth.ai/docs/models/kimi-k3) und erfahre mehr über [Unsloth Dynamic 2.0 GGUFs](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### Parallel-Chat

Unsloth kann jetzt mehrere Unterhaltungen gleichzeitig ausführen. Beim Start eines **Neuen Chats** wird die vorherige Antwort weiter generiert, und jede aktive Unterhaltung erhält ihre eigene Fortschrittsanzeige und Stop-Steuerung.

* Standardmäßig 4 llama-server-Slots, in der Web-UI anpassbar.
* Tools, Uploads, Self-Healing und Agents bleiben zwischen Chats isoliert.
* Stoppe einen Chat, ohne andere zu unterbrechen oder den Server neu zu starten.
* Unsloth reduziert die Slot-Anzahl, wenn der Speicher knapp ist.
* Das erneute Laden des Modells stoppt aktive Chats nach Bestätigung weiterhin.

#### Deep Research

Deep Research verwandelt ein lokales Modell in einen vollständigen Recherche-Workflow. Gib ihm eine Frage und es erstellt einen Plan, sucht im Web, ordnet die Belege und erzeugt einen zitierten Bericht.

* Überprüfe und bearbeite den Plan, bevor die Recherche beginnt.
* Verfolge den Fortschritt und die gesammelten Quellen, während es arbeitet.
* Fortsetzen oder abbrechen, ohne die abgeschlossene Recherche zu verlieren.
* Websites erlauben oder blockieren, um die Quellenauswahl zu steuern.
* Quellen und Zitate bleiben bei jedem Lauf gespeichert.
* Vor dem Schreiben prüft Unsloth auf nicht unterstützte Behauptungen, Widersprüche und ungelöste Lücken. Empfehlungen ohne direkte Belege werden als überprüfbare Schlussfolgerungen markiert.

Pro Chat kann ein Lauf aktiv sein. Deep Research funktioniert derzeit mit lokalen Modellen. Optionales Full-Page-Grounding kann die Top-Suchergebnisse vor der Synthese in temporäres RAG einlesen; aktiviere es mit `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`. Es bleibt standardmäßig aus, da es zusätzliche Scraping-Zeit hinzufügt und weiteren Kontext benötigt.

#### Verbesserte AMD-Unterstützung

Dieses Update baut auf unserem ersten [AMD-Release und Einrichtungsleitfaden](https://unsloth.ai/docs/basics/amd) mit Unterstützung für mehr GPUs und zuverlässigerer ROCm-Inferenz und -Trainings.

* Verbesserte Erkennung für RDNA2, Radeon, Ryzen, Strix Halo und Workstation-GPUs.
* MI50 und Radeon VII unterstützen 16-Bit-LoRA und vollständiges Fine-Tuning unter Linux.
* Behoben wurden 4-Bit-NaNs, Bibliothekskonflikte und lange RDNA-Startverzögerungen.
* Nicht unterstützte Windows-HIP-GPUs können auf Vulkan zurückgreifen.
* Vulkan-Geräte zeigen ihre echten Namen und können einzeln ausgewählt werden.
* Saubere Windows-Installationen benötigen Winget oder Entwicklertools nicht mehr.

#### Training, Modelle und Plattform-Updates

* Intel XPU ermöglicht lokalen Chat und Training auf Intel Arc- und Data-Center-GPUs.
* DoRA ist neben LoRA und vollständigem Fine-Tuning verfügbar.
* Große Exporte können alle sichtbaren GPUs verwenden, um Speicherlimits von GPU 0 zu vermeiden.
* MLX fügt streamende Datensätze, fortgesetztes Vortraining, Callbacks sowie bessere VLM- und LoRA-Unterstützung hinzu.
* Falsch `flash_attention_2` Modellausgabe.
* Unsloth und Speicherhilfen funktionieren jetzt ohne bitsandbytes.
* Behoben `.json` Datensätze und Qwen3.5/3.6 MoE- und GRPO-Notebook-Einrichtung.
* Hub-Download-Ordner sind leichter zu finden und zu öffnen.
* Versionshinweise sind im Unsloth-Update-Popup verfügbar.
* `unsloth start --as-subagent` ermöglicht es Codex, Claude Code und Pi, Aufgaben an ein lokales Unsloth-Modell zu delegieren.
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD-Unterstützung ist da!

Hallo zusammen! Dieses Release bringt lokales LLM-Training und Inferenz auf [AMD-GPUs](/docs/de/grundlagen/amd.md) unter Windows, WSL und Linux.

<a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Schnellstart</a><a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Funktionen</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

Ab heute ermöglichen unsere AMD-Zusammenarbeit, benutzerdefinierte Triton-Kerne und mathematischen Algorithmen, dass du über 500 Modelle auf AMDs Radeon-, Instinct-, Vulkan-, Ryzen- und Rechenzentrums-GPUs trainieren und ausführen kannst, bis zu 2× schneller mit 70 % weniger VRAM und ohne Genauigkeitsverlust. Optimierte ROCm-Builds unterstützen außerdem GGUF- und Safetensors-Inferenz.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Update vom 23. Juli

1. Hinzugefügt **RDNA2, Gorgon Halo, Vulkan-Unterstützung** + behoben, dass die AMD-Installation GPUs auf Strix Halo / anderen AMD-GPUs nicht erkannte
2. Bessere RDNA4-, HIP-/ROCm-Fehlerautomatik und -erkennung
3. **2x schnellerer einheitlicher Speicher** AMD-Safetensors-Laden + deutlich schnelleres Gradient-Checkpointing für Geräte mit einheitlichem Speicher
4. Hinzugefügt **Sprachdiktat / whisper.cpp** vorläufige Unterstützung für schnelle Text-zu-Sprache
5. Behoben, dass Rollback-Umgebungen während Installationen 5 GB Speicherplatz verbrauchten - werden jetzt automatisch bereinigt

#### LLMs lokal auf AMD trainieren

* Modelle lokal auf AMD-GPUs trainieren, ausführen, mit RL nutzen und bereitstellen.
* Zuverlässigere AMD-GPU-Erkennung und -Installation unter Windows, WSL und Linux.
* Verbesserte ROCm-Kompatibilität für AMD MI300X- und MI325X-GPUs.
* Unsloth aus der Ferne zugreifen über `unsloth studio --secure` über kostenloses HTTPS via Cloudflare

#### Größere Modelle auf deiner Hardware ausführen

* Verwende automatische GPU-Platzierung oder wähle exakt aus, welche GPUs und Modellschichten verwendet werden.
* Verschiebe MoE-Experten-Schichten in den Systemspeicher, damit größere Modelle hineinpassen.
* Teile Modelle über mehrere GPUs auf oder verwende Tensor Parallelism.
* Speichere Hardwareeinstellungen separat für jedes Modell und jeden Quant.

#### Schnellere Chat-Neustarts und zuverlässigere Downloads

* Setze lange Chats fort, ohne die vollständige Unterhaltung neu aufzubauen, nachdem ein untätiges Modell seinen VRAM freigegeben hat.
* Stagnierte Hugging-Face-XET-Downloads werden automatisch über Standard-HTTP erneut versucht.
* Vorhandene GGUF-Dateien werden wiederverwendet, statt bei jedem Laden eines Modells erneut heruntergeladen zu werden.

#### Bessere Suche, Tools und Agents

* Die Websuche kann jetzt PDF-Papers, Handbücher und andere PDF-Ergebnisse lesen.
* Parallele Tool-Aufrufe, Reasoning-Ausgaben und Tool-Wiederholungen funktionieren zuverlässiger.
* Ein neuer optionaler MCP-Endpunkt ermöglicht kompatiblen KI-Clients, Modelle und Trainingshistorie zu prüfen, das Training zu starten oder zu stoppen, Checkpoints zu laden, Rezepte zu validieren und GGUFs zu exportieren.
  * Aktiviere es mit `UNSLOTH_STUDIO_ENABLE_MCP=1` und setze das erforderliche Bearer-Token mit `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Trainings- und Export-Fixes

* Textbasiertes Training mit multimodalen Modellen kürzt lange Beispiele vor dem Packen nicht mehr.
* Feinabgestimmte Qwen3.5- und Qwen3.6-MTP-Modelle exportieren jetzt korrekt nach GGUF.
* Ein Windows-Berechtigungsfehler, der GGUF-Exporte beim letzten Schreibschritt stoppen konnte, wurde behoben.

#### Falls du es verpasst hast

Unser vorheriges Studio-Release fügte Dynamic-NVFP4-Modelle, tiefere Personalisierung, sieben neue Anzeigesprachen, sicherere Agents und Vulkan-GPU-Beschleunigung hinzu.

**Dynamic NVFP4:**

Unsloth Dynamic NVFP4 behält empfindliche, genauigkeitskritische Schichten in FP8 oder BF16, während der Rest in W4A4 läuft. Auf NVIDIA-Blackwell-GPUs ermöglicht das bis zu 2,5x schnellere Inferenz, während kalibrierte FP8-KV-Caches bis zu 2x längeren Kontext bieten.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) und entdecke unsere erweiterte [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4), einschließlich Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4.

**Passe dein Studio an:**

Wähle zwischen den Farbpaletten Standard, Classic und Minimal, jeweils mit hellen und dunklen Modi. Du kannst außerdem Farben anpassen, Schriftarten importieren und Schriftgröße, Kontrast, reduzierte Bewegung und mehr einstellen.

Unsloth enthält außerdem einen Voice-Einstellungs-Tab für Diktat, benutzerdefinierte Wörterbuch-Einstellungen und Vorlesen.

**Neue Sprachen:**

Unsloth Studio ist jetzt auf Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch verfügbar, zusätzlich zu Chinesisch (vereinfacht), Japanisch und Portugiesisch (Brasilien). Die automatische Erkennung der Browsersprache ist jetzt standardmäßig aktiviert.

**Sicherere Agents:**

Ein vierstufiger Tool-Call-Berechtigungswähler-**Fragen**, **Für mich genehmigen**, **Aus** und **Vollzugriff**- bietet feinere Kontrolle über Agents. Die Isolation von Agent-Arbeitsbereichen und sicherere Installationsprüfungen verringern außerdem das Risiko unbeabsichtigter Änderungen.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personalisierung, NVFP4, Sprachen

Hey Leute, wir haben viele neue Updates für Unsloth, besonders bei der Anpassung. Unsloth gehört jetzt dir zur Personalisierung: drei Farbpaletten plus benutzerdefinierte Farben und Schriftarten, sieben neue Anzeigesprachen und ein neuer Voice-Einstellungs-Tab für Diktat und Vorlesen. Agents werden sicherer mit einem vierstufigen Tool-Call-Berechtigungswähler (Fragen, Für mich genehmigen, Aus, Vollzugriff) und Arbeitsbereichsisolierung, und Intel-GPUs erhalten endlich GPU-beschleunigte Inferenz durch das neue Vulkan `llama.cpp` Unterstützung.

Wir haben außerdem native Unterstützung für [Inkling](https://unsloth.ai/docs/models/inkling), ein offenes Modell mit 975B Parametern, 41B aktiven Parametern und einem Kontextfenster von bis zu 1 Mio. Tokens. Unter Apache-2.0-Lizenz akzeptiert es Text, Bilder und Audio und erzeugt Text.

#### Dynamic NVFP4

Wir haben unsere [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4) um quantisierte Versionen von Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4 erweitert.

Lies den [Dynamic-NVFP4-Leitfaden](https://unsloth.ai/docs/basics/nvfp4) für Details.

Unsloth personalisieren

Unsloth ist nicht länger auf Hell- und Dunkelmodus beschränkt:

* Wähle aus **Standard**, **Classic**, und **Minimal** Paletten, jeweils mit heller und dunkler Variante.
* Passe Akzent-, Hintergrund- und Vordergrundfarben an.
* Importiere deine eigenen UI-, Überschriften-, Chat- und Code-Schriftarten.
* Passe Schriftgröße, Kontrast, Bewegung, Cursorverhalten und Schriftglättung an.
* Such-Einstellungen und Synchronisierungsvorlieben über Geräte hinweg.

Helle und dunkle Modi behalten ihre eigenen Anpassungswerte.

#### Sieben neue Sprachen

Unsloth unterstützt jetzt Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch, zusätzlich zu Chinesisch, Japanisch und Portugiesisch. Die automatische Erkennung der Browsersprache ist jetzt standardmäßig aktiviert.

#### Voice-Einstellungen

Ein neuer Voice-Tab bietet Steuerelemente für Diktat, Aussprachwörterbücher und Vorlesen. Unterstützung für Spracherkennung und Text-zu-Sprache kommt bald; vollständige Sprachunterhaltungen sind noch in Entwicklung.

#### Sicherere Agents und Tool-Aufrufe

Der alte Bypass-Schalter ist jetzt ein vierstufiger Berechtigungswähler:

* **Fragen:** jeden Tool-Aufruf genehmigen.
* **Für mich genehmigen:** Lesezugriffe automatisch ausführen und bei potenziell unsicheren Aktionen pausieren.
* **Aus:** Tool-Aufrufe deaktivieren.
* **Vollzugriff:** alle Aufrufe erlauben und die Sandbox deaktivieren.

Diese Steuerelemente gelten für Terminal-, Python-, Websuche-, RAG- und MCP-Tools. Agents erhalten außerdem isolierte Arbeitsbereiche, fortsetzbare Sitzungen mit `--persist`, sicherere Warnungen für Remote-Installer, Live-Streaming von Tool-Ausgaben und verbesserte Web-Extraktion.

#### Vulkan und `llama.cpp`

Das neue Vulkan `llama.cpp` Backend gibt Intel-GPUs GPU-beschleunigte Inferenz, statt auf die CPU zurückzufallen. Es unterstützt die bestehende VRAM-Verwaltung, automatische Kontextgröße, Multi-GPU-Auswahl und Layer-Auslagerung.

AMD-Nutzer können sich mit folgendem Opt-in anmelden:

```bash
UNSLOTH_FORCE_VULKAN=1
```

Wir haben außerdem die Zuverlässigkeit von Updates, die Wiederherstellung des Modellzustands und das Unterbrechen hängender Generierungen verbessert.

#### Modelle und Training

Dieses Release umfasst außerdem:

* Native Inkling-Unterstützung und Verbesserungen für Multi-GPU-B200.
* DeepSeek-V4-Eager-Attention und trainierbare FP8-Gruppenspezialisten.
* Zuverlässiges Completion-only-Training durch automatische Erkennung von Chat-Template-Markern.
* Korrekte Behandlung deaktivierten Gradient Checkpointings.
* Verbesserte RoPE-Skalierung und Kontextverlängerung.
* Erzwingendes Stoppen für festhängende Trainingsläufe.
* Automatisches Routing für neue Modellarchitekturen und neuere Transformers-Releases.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth kann jetzt nach dem Training NVFP4-, FP8- und imatrix-GGUFs exportieren; als llama-swap-API-System fungieren; Unterstützung für Japanisch und brasilianisches Portugiesisch hinzufügen; und enthält MLX, safetensors, Tool-Aufrufe, Healing-Unterstützung und mehr. Der Unsloth-Kern macht GRPO 1,3x schneller, fügt einen HTTP-Fallback für hängende Downloads hinzu, verbessert den Offline-Modus, beschleunigt das MoE-Training um 3–5x und behebt viele Fehler. Diese Release-Serie verwendet `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/de/modelle/deepseek-v4.md) wird jetzt mit Thinking-Umschaltern und unseren verbesserten Chat-Template-Fixes unterstützt.

<div data-with-frame="true"><figure><img src="/files/d0fc7fb63bbb9a1d9e04b7d7ee876fcebd7515e6" alt="" width="375"><figcaption></figcaption></figure></div>

#### Intelligentere OpenAI-kompatible API-Bereitstellung

Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agent-Tools.

* API-Anfragen können das automatische Umschalten zwischen heruntergeladenen lokalen GGUFs aktivieren, während unbekannte Modellnamen sicher weiterhin das aktuelle Modell verwenden.
* `/v1/models` liefert jetzt saubere Modell-IDs und den lokalen GGUF-Katalog statt lokaler `.gguf` Pfade.
* Idle-Auto-Unload kann VRAM nach Inaktivität freigeben, und die Heilung von Tool-Aufrufen kann jetzt pro Anfrage gesteuert werden.

#### Exportverbesserungen

Exporte sind flexibler und vermeiden unnötige Downloads.

* Wähle mehrere Exportformate gleichzeitig aus, darunter portables FP8/INT8, GGUF-LoRA, quelltextabgeglichene Exporte, imatrix GGUF und komprimiertes FP8/FP4.
* Multi-Checkpoint-Exporte vermeiden weitere wiederholte Base-Model-Downloads.
* FP8-, INT8- und GGUF-LoRA-Exporte respektieren jetzt `trust_remote_code`, und der GGUF-Export behandelt fehlende Quantisierungseinstellungen zuverlässiger.

#### RAG und Datei-Chat

Datei-Chat ist bei echten Dokumenten nützlicher.

* RAG-Anhänge können jetzt den gesamten Dokumentkontext verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.
* Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich rechts-nach-links-Text, indischer Texte und DOCX-Tabellen.
* Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.

#### Unsloth-Feinschliff und Zuverlässigkeit

Die tägliche Nutzung sollte sich flüssiger und stabiler anfühlen.

* Lange Trainings- und Chat-Läufe frieren weniger wahrscheinlich stillschweigend ein.
* Vergleichsmodus, Modellwechsel, Modellabbruch, Hub-Browsing und Hub Discover sind zuverlässiger.
* Projekt-Exporte, Chat-Exporte, Einstellungen, geführte Touren, Dateidialoge, Update-Bildschirme und die Reasoning-UI sind sauberer und konsistenter.

#### Installer-, Hardware- und Plattform-Fixes

Unsloth installiert und läuft plattformübergreifend zuverlässiger.

* macOS-Installationen benötigen CMake oder Homebrew nicht mehr, wenn ein vorgefertigtes `llama.cpp` verfügbar ist, und die Apple-Silicon-Unterstützung kommt besser mit Pfaden mit Leerzeichen und der Größe des einheitlichen Speichers zurecht.
* Der Windows-Start, der UTF-8-Umgang, das ROCm-RAG-Embedding und die ROCm-on-WSL-GPU-Unterstützung wurden verbessert.
* Die Auswahl vorgefertigter Blackwell-GPUs, GGUF-Passprüfungen, Tensorparallelismus für Vision-/mmproj-GGUFs und lokale `llama.cpp` Wiederverwendung ist jetzt zuverlässiger.

#### Training, Modelle und Kernel

Training und das Laden von Modellen sind in mehr Setups zuverlässiger.

* GRPO unterstützt jetzt standardmäßig Sequenz-Packing, vermeidet wiederholte gemeinsame Prompts und behandelt die DDP-Logit-Skalierung korrekt.
* Full Fine-Tuning, RL-Präzisionseinstellungen, Gradient Checkpointing, DDP-RoPE-Puffer und die MoE-LoRA-Erkennung wurden behoben.
* FP8-Quantisierung/Dekodierung, Llama-3-RoPE-Skalierung mit Transformers v5, LoRA-Neuladevorgänge mit PEFT 0.19 und `fast_generate` Fehlermeldungen wurden verbessert.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3x längere Kontexte

[GLM-5.2](/docs/de/modelle/glm-5.2.md) wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. **3x längere Kontextlängen** sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP erreichbar und ermöglichen längere Chats. Modus zum Umgehen von Berechtigungen, verzweigende Chats, warteschlangenfähige Chats, ein neuer Hub zur Modellerkennung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende `unsloth studio --secure` für sicheren globalen HTTPS-Zugriff!

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Besserer Algorithmus für die Kontextlänge

Gemäß [PR 1](https://github.com/unslothai/unsloth/pull/6312) und [PR 2](https://github.com/unslothai/unsloth/pull/6447), haben wir Unsloths Bestimmung von Speicherverbrauch und Kontextlänge deutlich verbessert und insgesamt 3x längere Kontexte erreicht:

| Szenario                        | KV       | vorher  | nachher |
| ------------------------------- | -------- | ------- | ------- |
| 1x 32GB-Pipeline (\~31 GB frei) | f16      | 23,040  | 64,000  |
|                                 | q8\_0    | 43,520  | 114,944 |
|                                 | q4\_0    | 82,432  | 199,680 |
| 2x 32GB-Pipeline                | beliebig | 262,144 | 262,144 |
| 2x 24GB-Tensor (\~23 GB frei)   | f16      | 134,049 | 262,144 |
|                                 | q8\_0    | 252,329 | 262,144 |

#### Chat-Canvas, Forking & Warteschlangen

* Bearbeite Assistenten-Nachrichten direkt an Ort und Stelle und führe sie von jedem Punkt im Thread aus erneut aus.
* Forke einen Thread, um eine Unterhaltung abzuzweigen, ohne das Original zu verlieren.
* Temporäre (Inkognito-)Chats, die nichts zurücklassen.
* Stelle neue Prompts in die Warteschlange, während noch eine Generierung läuft, statt zu warten.
* Chat-„Artefakte“ sind jetzt **Canvas**, mit inline **HTML-Canvas-Karten** die sich automatisch rendern, einer Code-Ansicht, und DiffusionGemma hält seinen Rohcode inline sichtbar, statt ihn zusammenzuklappen.
* Die Chatsuche durchsucht jetzt jede Nachricht und zeigt zuerst deine eigenen Nachrichten an.

#### Hub (neu gestaltet)

* Vollseitiger Hub mit einem Trend-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.
* README-Vorschau in einer geteilten Ansicht, damit du vor dem Download lesen kannst.
* Downloads verwenden standardmäßig das schnellere **Xet** Übertragungsprotokoll, mit automatischem HTTP-Fallback, falls eine Übertragung hängen bleibt.
* Neuer Schalter „Beim Auswählen laden“, um Ladeoptionen festzulegen, bevor ein Modell geladen wird.
* Das Google-Logo wird für DiffusionGemma und künftige Gemma-Derivate angezeigt.

#### Modelle & Inferenz

* DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.
* Schnelle Inferenz mit dem neuesten vLLM (0.22+) behoben, sodass Beschleunigungen wieder funktionieren.
* Tensorparallelismus ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, erholt er sich jetzt selbstständig, statt abzustürzen.
* DiffusionGemma zeigt jetzt live, wie das Bild beim Entrauschen entsteht, mit genauen Geschwindigkeitsstatistiken.

#### Sicherheit & Cloudflare-verschlüsselte Studios

* Neu `--secure` Nur-Cloudflare-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter `--secure`. Verwende `unsloth studio --secure`!
* den Modus „Berechtigungen umgehen“, um Bestätigungen zu überspringen und die Tool-Sandbox zu deaktivieren, wenn du das möchtest.
* Automatische Erkennung von Hugging-Face-Virenscans und gefährlichen Dateien in Repositories.

#### Protokollierung und API

* Neu **API-Server-Monitor** in Unsloth.
* Schnellere API-Aufrufe und geringere Latenz
* Viel besser aufgeräumte Logs – jetzt mit Durchsatz und Latenz, und viele aufgeblähte Logs entfernt.

#### Hardware & Backend

* Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs
* Stilles Zurückfallen auf die CPU statt die GPU behoben
* Die torchao-Version wird jetzt anhand des installierten torch ausgewählt.
* Das Installationsprogramm repariert jetzt automatisch eine beschädigte oder nur-CPU-PyTorch-Installation und warnt vor stillem CPU-Fallback, über NVIDIA + AMD auf Win/Linux/Mac/WSL hinweg.
* Gibt den VRAM des Chat-Modells frei, wenn das Training beginnt, aber nur wenn der GPU-Speicher tatsächlich knapp ist (sonst keine unnötigen Neuladungen).
* Wenn llama-server beim Start hart abstürzt, durchläuft Unsloth jetzt eine Wiederherstellungsabfolge, statt einfach zu scheitern.

#### Training & allgemeine Fehlerbehebungen & parallele Module

* MLX-Training-Updates.
* Die Zuverlässigkeit des GRPO-Trainings mit vLLM wurde verbessert.
* Der Trainingsstart wurde zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.
* Unsloth räumt verbliebene Backend-Prozesse nach Abstürzen, Neustarts oder unterbrochenen Beendigungen jetzt zuverlässiger auf.
* Export, Chat, Training und Recipes sind jetzt alle individualisiert / compartmentalisiert! Das bedeutet, dass du jetzt alle 4 parallel erledigen kannst! Du kannst chatten / Inferenz machen, während du auf einen Trainingslauf oder einen Export wartest!

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Stelle sicher, dass du die neueste Version installierst [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) und [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) werden jetzt alle unterstützt.

* Ausführen und trainieren [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) über [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) ist da! Führe [Gemma 4](https://unsloth.ai/docs/models/gemma-4) \~2x schneller mit MTP.
* Audio-Chat wird jetzt für Gemma 4 unterstützt (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Preserve Think wurde zu Gemma 4 hinzugefügt.

<figure><img src="/files/37d41a9986d4b1f503942b2654532cfdd5149728" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Download-Manager (experimentell)

* Ein neuer **Hub** Hub-Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging-Face-Modellen und -Datensätzen.
* Unsloth kann jetzt Modelle und Datensätze erkennen, die bereits auf deinem Rechner vorhanden sind, und sie neben heruntergeladenen Assets anzeigen.
* Heruntergeladen [GGUF-Modelle](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) haben jetzt direkte **Ausführen / Neuer Chat** Aktionen.

#### RAG / Chat mit Dateien (experimentell)

* Hinzugefügt [**Mit Dateien chatten**](https://unsloth.ai/docs/new/studio/chat) in Unsloth, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.
* Unterstützt Hybrid-Suche, Zitate, PDF-Vorschauen, thread-spezifische Dokumente und ein integriertes `search_knowledge_base` Tool.

#### Neue Update-Schaltfläche + Hardware-Unterstützung

* Unsloth verwendet jetzt ständig frische, aktuelle [llama.cpp-Vorab-Builds](https://unsloth.ai/docs/new/changelog) für CUDA, ROCm, Windows, Linux und macOS.
* Eine integrierte **llama.cpp aktualisieren** Schaltfläche hinzugefügt, damit Nutzer das lokale Backend aktualisieren können, ohne Unsloth neu zu installieren.
* Verbesserte AMD-Unterstützung für Windows / WSL, [ROCm-Unterstützung für Strix Halo](https://unsloth.ai/docs/get-started/install/amd), [Blackwell-CUDA-Auswahl](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)und klarere Installationsmeldungen.

#### Lokaler Chat, Tools & API-Kompatibilität

* Lokal [Tool-Aufruf](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) ist zuverlässiger, mit besserer Reihenfolge der Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.
* Verbessertes [OpenAI-kompatible API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) und Anthropic-kompatibles API-Verhalten für lokale Unsloth-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und [Claude-Code-Kompatibilität](https://unsloth.ai/docs/basics/claude-code).

#### Training & Fehlerbehebungen

* Verbessertes [MLX-Unterstützung](https://unsloth.ai/docs/new/studio/install) mit besseren Modellbezeichnungen, Statistiken zur Generierungsgeschwindigkeit und Fehlerbehebungen für [VLM-Training](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Mehrere [Trainings-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) und [Datensatz-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) Sonderfälle behoben, darunter nicht beschreibbare Hugging-Face-Caches und benutzerdefinierte Datensatzzuordnungen.
* Viele UI-Feinschliff-Verbesserungen in Chat, Menüs, Modellauswahl, Dark Mode, Import/Export und Einstellungen hinzugefügt.

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, neue UI, MCP, Projekte

Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

<div data-with-frame="true"><figure><img src="/files/03c0fa542e2dd3a0afc9fcd0c9c021346fd41c97" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google veröffentlicht [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4), ein neues Modell, das lokal auf 8 GB RAM läuft. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Leitfaden](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führe das Modell über Unsloth Studio aus und trainiere es.

#### MCP

* Remote `MCP` Server-Unterstützung, einschließlich benutzerdefinierter Header und OAuth
* Lokal befehlsbasiert `MCP` Server-Unterstützung
* `MCP` kann jetzt im Chat-Composer aktiviert werden
* Integrierte Voreinstellungen für gängige `MCP` Server

#### Neue Chat-UI

* Projekte, Canvas, `MCP`, RAG- und Vergleichssteuerungen befinden sich jetzt im Plus-Menü
* Auf Such- und Code-Steuerungen kann im Composer jetzt einfacher zugegriffen werden
* Menüs, Overlays, Icons und anklickbare Steuerelemente sind in Unsloth jetzt einheitlicher

#### Projekte

* Organisiere zusammenhängende Chats in dedizierten Projekt-Workspaces
* Verschiebe bestehende Chats in Projekte
* Erstelle und verwalte Projekte direkt über die Seitenleiste

#### Experimenteller Canvas / Artefakte

* Öffnet generiertes HTML in einem dedizierten Canvas-Bereich in Unsloth Studio
* Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und von CDNs geladener Pakete
* Ermöglicht dir den Wechsel zwischen gerenderter Vorschau und Quellcode

#### Installation, Laufzeit und Hardware

* Windows-Vorabinstallationen erfordern nicht mehr die frühe `CUDA Toolkit` Prüfung
* Linux `llama.cpp` Vorab-Builds stimmen jetzt mit der erkannten Laufzeit überein `cudart` Haupt-
* `ROCm` gfx-Erkennung wird in die Auswahl der Vorab-Builds weitergeleitet
* `Blackwell`, `B300` und `ARM64` Updates zur Linux-Unterstützung

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Paket nicht die neuesten Updates erhält!**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:**

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `Unsloth-Studio-Update` nicht mehr, da das Paket nicht die neuesten Updates erhält!**
{% endhint %}

#### Mac-Updates

* Wieder aktiviert `llama.cpp` vorgefertigte Binaries für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Apple Silicon Mac OS 13 (Ventura) ist ein Quell-Build
* Intel (x86\_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet `llama.cpp` vorgefertigte Binaries
* Intel für Mac OS 13.0 - 13.2 ist ein Quell-Build

#### Windows-Updates

* CUDA 13.3 `llama.cpp` vorgefertigte Binaries funktionieren jetzt unter Windows
* Für CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte den CUDA-12.4-Fallback – wir arbeiten bald an CUDA-13.1-Binaries.

#### CUDA 13.3-Update

* CUDA-13.3-Binaries für Nicht-Linux funktionieren. Vorerst verwenden wir weiterhin CUDA 13.1
* CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 – siehe <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell-GPUs-Update

* Vorerst wird es für Blackwell verzögerte Veröffentlichungen von `llama.cpp` vorgefertigten Binaries geben, da CUDA 12.4 nicht funktioniert – wir arbeiten daran, dies bald zu beheben.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Ein Update vor dem Revamp.

Hey Leute, wir machen noch ungefähr ein weiteres Update vor einem größeren Revamp, der wahrscheinlich diese oder nächste Woche kommt. Unser Revamp wird vieles ändern, insbesondere mit neuen Hauptfunktionen und vielen Designänderungen.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NEU: [**Unterstützung für API-Aufrufe**](https://unsloth.ai/docs/integrations/connections) jetzt mit Bilderzeugung + -bearbeitung, echter Websuche, Codeausführung und automatischem Prompt-Caching. Verbinde [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) und mehr.
* Ordentliche Unterstützung für **nicht-englische Sprachen** z. B. Japanisch, Chinesisch, Indisch usw.

Viele von euch haben vielleicht unsere vorherige Veröffentlichung verpasst, die nur einen Tag lang verfügbar war. Wir haben Folgendes eingeführt:

* Verbinde dich mit externen Inferenz-Backends: [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Sicherheitsverbesserungen**
* **Automatisches MTP-spekulatives Decoding** für MTP-GGUFs; erhalte die besten, an deine Hardware angepassten Einstellungen.

#### API-Provider-Aufrufe & externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Dialogrunden hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* Bilderzeugung + -bearbeitung
* API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### Weitere Unsloth-Studio-Updates

* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Das Senden/Prompten nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* Härtung des IME-Composers, RTL `dir="auto"`, Behebung der Kürzung langer Log-Zeilen
* Darstellung von Tool-Reasoning-Traces in der UI
* Vollständige Offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung sowohl für Inferenz als auch Training

#### Sicherheitsverbesserungen in Unsloth Studio

* Rate-Limiting für Authentifizierung, proxy-bewusst, damit Reverse Proxies es nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfad-Eingrenzung, damit Worker ihre temporären In-Flight-Verzeichnisse nicht verlassen können
* Strikte Schema-Validierung über die gesamte Unsloth-API hinweg
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback bei `training_args.bin` damit nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Ablauf
* Frontend-Authentifizierung: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Das Aufräumen nach Abbruch ist jetzt streng auf temporäre In-Flight-Verzeichnisse beschränkt, sodass niemals Benutzerdaten gelöscht werden können
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP + Unsloth-Fehlerbehebungen

Viele Fehlerbehebungen sowie UI- und UX-Fixes für Unsloth! Um die neuesten Updates zu erhalten, führe Folgendes aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Fehlerbehebungen

1. Beheben `Unsloth-Studio-Update` funktioniert nicht gut
2. Beheben des Hängenbleibens auf `Passwort zurücksetzen` Seite
3. Mehr Unterstützung für den Offline-Modus
4. Verbesserung von MTP, das auf Macs, CPUs und GPUs nicht schneller war – jetzt ist es viel besser!
5. Beheben, dass die Desktop-Verknüpfung nach dem Update nicht funktioniert
6. Viele, viele UI-/UX-Fehlerbehebungen
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API-Verbindungen

Wir haben viele neue Updates für Unsloth `v0.1.41-beta`:

* **\~2x schnellere GGUF-Inferenz** mit automatisch aktiviertem [MTP](/docs/de/modelle/qwen3.6.md#mtp-guide)
* [**Unterstützung für API-Aufrufe**](/docs/de/integrationen/connections.md) für [OpenAI](/docs/de/integrationen/connections/openai.md), [Anthropic](/docs/de/integrationen/connections/anthropic-claude.md) usw. mit automatischem Prompt-Caching, Websuche und Codeausführung
* Verbinde dich mit externen Inferenz-Backends: [vLLM](/docs/de/integrationen/connections/vllm.md), [Ollama](/docs/de/integrationen/connections/ollama.md), [llama-server](/docs/de/integrationen/connections/verbinde-llama.cpp-mit-unsloth-fuhre-ggufs-mit-llama-server-aus.md)
* Experimentell **MLX-Inferenz**
* Ordentliche Unterstützung für **nicht-englische Sprachen**
* **Sicherheit** Verbesserungen

<a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#qwen3.6-inference-tutorials" class="button primary">Qwen3.6-Tutorials ausführen</a><a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#mtp-guide" class="button primary">MTP-Leitfaden</a>

<div data-with-frame="true"><figure><img src="/files/7b482fd313c9534e8f7f4639059ce9449817c948" alt="" width="375"><figcaption></figcaption></figure></div>

#### MTP-Support für spekulatives Decoding: 1,4 bis 2x schnellere Inferenz!

* **Automatisches MTP-spekulatives Decoding** für MTP-GGUFs; warne, wenn der mitgelieferte llama.cpp-Vorab-Build veraltet oder zu alt für MTP ist
* Neue vorgefertigte llama.cpp-Binaries für MTP-Unterstützung!

#### API-Provider-Aufrufe & externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Dialogrunden hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* API-Schlüssel ist jetzt für lokale Anbieter optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### MLX-Inferenz (experimentell)

* MLX-Quantisierungen und -Modelle können jetzt lokal auf deinen Mac-Rechnern laufen!
* Wir werden bald Denken, Werkzeuge und Websuche hinzufügen!

#### Weitere Unsloth-Studio-Updates

* Das Senden/Prompten nicht-englischer Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt korrekt
* OpenDocument-Chat-Anhänge
* o3-Reasoning-Zusammenfassungs-Payload
* Härtung des IME-Composers, RTL `dir="auto"`, Behebung der Kürzung langer Log-Zeilen
* Darstellung von Tool-Reasoning-Traces in der UI
* Vollständige Offline-Unterstützung: zwischengespeicherte GGUF-Erkennung und automatische Offline-DNS-Erkennung sowohl für Inferenz als auch Training
* Viel UI/UX-Feinschliff: Refactoring des Dark Themes, Neuaufbau der rechten Seitenleiste, Faultier-Maskottchen je nach Tageszeit, wegklickbare kopierbare Toasts, größerer Chat-Composer, Feinschliff an der Code-Ausführungs-Konfiguration, Styling der Aktions-Pills im Composer, schmalerer Discord-Button

#### Trainings-Updates

* Gemma-Attention-Mask-Fixes
* Multi-Image-GRPO
* Experimente zur Rückgabe von GRPO-Hidden-States
* Neue Continued Pretraining (CPT)-Trainingsmethode als erstklassige Option
* Gemma-4-MoE-LoRA-Extraktor registriert, um zu beheben `grouped_mm` Absturz bei Kontraktion
* Opt-in-Fusion `lm_head` + Cross-Entropy-Forward, mit Single-Matmul-Pfad unter `UNSLOTH_RETURN_LOGITS=1`
* Batchgröße für Eval übergeben
* Eval-/Trainingspfade berücksichtigen jetzt `HF_DATASETS_OFFLINE` zusammen mit `HF_HUB_OFFLINE`

#### Sicherheitsverbesserungen in Unsloth Studio

* Rate-Limiting für Authentifizierung, proxy-bewusst, damit Reverse Proxies es nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfad-Eingrenzung, damit Worker ihre temporären In-Flight-Verzeichnisse nicht verlassen können
* Strikte Schema-Validierung über die gesamte Unsloth-API hinweg
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback bei `training_args.bin` damit nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Ablauf
* Frontend-Authentifizierung: Singleflight-Token-Refresh, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Das Aufräumen nach Abbruch ist jetzt streng auf temporäre In-Flight-Verzeichnisse beschränkt, sodass niemals Benutzerdaten gelöscht werden können
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth-API-Endpunkt

#### ***Fehlerbehebung in v0.1.39-beta*** **5. Mai 2026**

Behebt, dass der Chatverlauf nicht angezeigt wird (der vorhandene Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler betraf nur das Rendering – verwende `2026.5.2` oder rufe direkt `curl -fsSL https://unsloth.ai/install.sh | sh`  auf, um zu aktualisieren

Du kannst lokale LLMs mit Tools wie [Claude Code](https://unsloth.ai/docs/basics/claude-code) und [Codex](https://unsloth.ai/docs/basics/codex) verwenden, indem du sie mit Unsloths API-Endpunkt verbindest. Damit kannst du Modelle wie [Qwen](https://unsloth.ai/docs/models/qwen3.6) und [Gemma](https://unsloth.ai/docs/models/gemma-4) lokal ausführen, mit zusätzlichen Funktionen wie selbstheilender Tool-Aufruf, Codeausführung und Websuche.

Unsloth als API-Inferenz-Endpunkt zu verwenden ist nicht nur deshalb vorteilhaft, weil es einfach einzurichten und schnell ist, sondern auch, weil Unsloth Folgendes bietet:

* [Selbstheilender Tool-Aufruf](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), was hilft, kaputte oder fehlerhafte Tool-Aufrufe um 50 % zu reduzieren
* [Codeausführung](https://unsloth.ai/docs/new/studio/chat#code-execution) Unterstützung, die Bash- und Python-Ausführung für genauere Code-Ausgaben ermöglicht.
* Erweitert [Websuche](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) die Webseiten besucht und tatsächlich liest, um tiefgehende Informationen zu sammeln.
* [Automatische Inferenz-Einstellungen](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) für GGUF-Modelle (temp, top-k usw.)

<div data-with-frame="true"><figure><img src="/files/4d7f67e24fb64209883a9782fb1c8e4d7782a66f" alt="" width="375"><figcaption></figcaption></figure></div>

#### Neue Modelle

Wir haben außerdem eine Handvoll neuer Modelle zum Ausführen, darunter NVIDIA [Nemotron 3 Nano Omni](/docs/de/modelle/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/de/modelle/ibm-granite-4.1.md) und [Mistral 3.5](/docs/de/modelle/mistral-3.5.md) Mittel. Wir haben Mistral geholfen, einige Probleme bei der Implementierung in transformers und GGUFs zu lösen.

#### Unsloth-Updates

* Gestoppte Unsloth-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.
* Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.
* Hänger bei DPO-Training in Multi-Prozess-Setups wurden behoben.
* VLM-GRPO-Unterstützung mit MROPE-Updates verbessert.
* Unsloths Stop-Button stoppt die Generierung jetzt korrekt.
* Behebt, dass die Chat-Vorlage nach einem Browser-Refresh verschwindet.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Brandneues UI-Redesign

Hey Leute, wir haben die gesamte UI- und UX-Erfahrung von Unsloth Studio überarbeitet, um den Fokus auf Chat und Training zu legen:

* Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

<div data-with-frame="true"><figure><img src="/files/185679ec5ea5e6010281442e142bd0d961fb8f08" alt="" width="375"><figcaption></figcaption></figure></div>

* Du kannst jetzt Chats löschen und vergangene Gespräche durchsuchen

<div><figure><img src="/files/e57d933175dd866c23fb6d9276cdfb38ea19b22d" alt=""><figcaption></figcaption></figure> <figure><img src="/files/458049913eb8246383936137e5b124396134423d" alt=""><figcaption></figcaption></figure></div>

* Neuer Schalter „Preserve Thinking“ für Modelle, die dies unterstützen, wie Qwen3.6
* Klareres, konsistenteres Design mit einfacher Navigation
* Erweiterte Einstellungsseite mit Optionen zum Ändern deines Profilbilds, Namens und mehr

<div data-with-frame="true"><figure><img src="/files/e1b3c839b73e0fd270b11a2912b3fa53fd6ac640" alt="" width="375"><figcaption></figcaption></figure></div>

* Kein doppeltes Eingeben deines Hugging-Face-Tokens mehr
* gpt-oss hat jetzt Schalter für niedriges, mittleres und hohes Thinking.
* Verwendet jetzt das neueste vorcompilierte llama.cpp, sogar unter Linux CUDA
* Viele Fehler-, Konsistenz- und Stabilitätskorrekturen
* Kimi-K2.6 kann jetzt ausgeführt werden!
* Wir haben außerdem experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. kommen nächste Woche.

Qwen3.6 wurde in Unsloth Studio zum Ausführen und Trainieren bereits zuvor unterstützt. Du kannst Qwen3.6-27B jetzt sofort trainieren und ausführen!
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/de/modelle/qwen3.6.md) kann jetzt in Unsloth Studio (18 GB RAM) ausgeführt und feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).

Unsloth Studio hat viele neue Updates erhalten, also bitte aktualisieren. Details und ein ausführlicher Beitrag folgen in den nächsten Tagen.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/de/modelle/qwen3.6.md) kann jetzt in Unsloth Studio ausgeführt und feinabgestimmt werden. Das Modell läuft mit 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma-4-Update + MiniMax-M2.7**

[Gemma-4-GGUFs](https://huggingface.co/collections/unsloth/gemma-4) wurden jetzt mit Googles offiziellen Korrekturen für die Chat-Vorlage aktualisiert (was das Tool-Calling behoben/verbessert hat), zusammen mit den neuesten llama.cpp-Fixes. Aktualisiere auf die neueste llama.cpp-Version, lade die Quantisierungen neu herunter, und du solltest keine `ungenutzten Token` Probleme mehr sehen.\
\
[MiniMax-M2.7](/docs/de/modelle/tutorials/minimax-m27.md) ist jetzt da! Du kannst das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma-4-Fixes**

Wir haben Gemma 4 [mit vielen Korrekturen aktualisiert](/docs/de/modelle/gemma-4/train.md). Diese Fehler sind universell und betrafen alle Trainingspakete und Implementierungen und **stammten nicht von Unsloth**. Wir haben die Fehler identifiziert, behoben, und das Gemma-4-Training funktioniert jetzt korrekt in Unsloth.

Du brauchst nur **8 GB VRAM** zum Trainieren **Gemma-4-E2B** lokal. Unsloth trainiert Gemma 4 **etwa 1,5x schneller und verwendet dabei etwa 60 % weniger VRAM** als FA2-Setups. Den vollständigen Leitfaden und die Notebooks zum Gemma-4-Training [findest du in unserem Blog](/docs/de/modelle/gemma-4/train.md).

#### Gemma-4-Trainingsfixes

1. **Gradient Accumulation** verursacht keine Loss-Explosionen mehr. Zuvor konnten die Loss-Werte auf **300–400**ansteigen; der erwartete Loss liegt bei etwa **10–15**.
2. Behoben wurde der **IndexError** der **26B** und **31B** Inference in `transformers`.
3. Behobene wirre Ausgaben für **E2B/E4B** wenn `use_cache=False`. Siehe [Issue #45242](https://github.com/huggingface/transformers/issues/45242).
4. Behoben **Float16-Audio** Überlauf von `-1e9` Werten.

Wenn du Loss-Werte über **13–15** siehst, zum Beispiel **100** oder **300** - dann wird die Gradient Accumulation wahrscheinlich falsch gehandhabt. Das ist in beiden **Unsloth** und **Unsloth Studio**.

#### Gemma-4-Quant-Re-Uploads

Wir haben auch unsere Gemma-4-GGUFs aktualisiert, daher musst du sie neu herunterladen. Auch diese Quantisierungsprobleme sind **nicht mit Unsloth verbunden und nicht durch Unsloth verursacht**:

1. CUDA: Vor dem Verschmelzen auf Puffer-Überlappung prüfen - kritischer Fix für `<unused24>` Token - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `KV-Cache`: Unterstützung für Attention-Rotation bei heterogenem iSWA - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `Vokabular`: Byte-Token-Handhabung für den BPE-Detokenizer für Gemma 4 hinzufügen - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `konvertieren`: setze `"add bos" == True` für Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `common`: speziellen Parser für Gemma 4 hinzufügen - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lesen `final_logit_softcapping` für Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: benutzerdefinierte Zeilentrennung für Gemma 4 hinzufügen - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio-Updates

* Unterstützung für **spekulatives Decoding** hinzufügen (ngram-mod, standardmäßig aktiviert)
* Llama.cpp wurde auf die neueste Version mit allen Gemma-4-Fixes aktualisiert
* Trainingsprobleme mit Qwen3.5 und Gemma 4 beheben
* Export und Speichern von Gemma-4-Modellen ermöglichen
* Sandbox-Sicherheit für Terminal- und Python-Tools härten
* Rezepten erlauben, das in Chat geladene Modell zu verwenden
* Leere Chat-Threads bei der Navigation (und beim Wechseln von Tabs) beheben und den neuen Chat-Flow stabilisieren
* Nicht-LLM-Rezepten die Ausführung erlauben und den Daten-Tab bei Ausführungen an erste Stelle setzen
* Groß-/Kleinschreibung des HF-Caches wiederverwenden, um doppelte Downloads zu verhindern
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Du kannst jetzt die [Gemma 4](/docs/de/modelle/gemma-4.md) Modelle in Unsloth ausführen und trainieren.
* Intel Mac funktioniert jetzt
* Vorcompilierte Binärdateien für llama.cpp für 2 Gemma-4-Fixes:
  * Vokabular: Gemma-4-Tokenizer beheben ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * fix: Gemma-4-Vorlage ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Tool-Aufrufe für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten
* Vorcompilierte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU
* Spekulatives Decoding für Nicht-Vision-Modelle hinzugefügt (Gemma 4 ist leider ein Vision-Modell und Qwen3.5)
* Die Kontextlänge wird jetzt korrekt angewendet.
* Die Websuche erhält jetzt tatsächlich Web-Inhalte und nicht nur Zusammenfassungen
* 90 % weniger HF-API-Aufrufe - weniger Rate-Limits
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % genauere Tool-Aufrufe + mehr Unterstützung**

* Tool-Aufrufe für alle Modelle sind jetzt **um +30 % bis +80 % genauer.**
* Die Websuche erhält jetzt tatsächlich Web-Inhalte und nicht nur Zusammenfassungen
* Die Anzahl erlaubter Tool-Aufrufe wurde von 10 auf 25 erhöht
* Tool-Aufrufe beenden sich jetzt viel besser, sodass Schleifen/Wiederholungen reduziert werden
* Mehr **Tool-Call-Healing** und Deduplizierungslogik, um zu verhindern, dass Tool-Aufrufe auch XML durchsickern lassen
* Getestet mit `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), Websuche + Codeausführung + Thinking aktiviert.

| Metrik                        | Vorher | Nachher    |
| ----------------------------- | ------ | ---------- |
| XML-Leaks in der Antwort      | 10/10  | 0/10       |
| Verwendete URL-Abrufe         | 0      | 4/10 Läufe |
| Läufe mit korrekten Songnamen | 0/10   | 2/10       |
| Ø Tool-Aufrufe                | 5.5    | 3.8        |
| Ø Antwortzeit                 | 12,3 s | 9,8 s      |

#### Neue Funktionen

* Hinzugefügt **benutzerdefinierte Ordner** damit du beliebige GGUFs in beliebigen Ordnern verwenden kannst - vorerst Zugriff in den erweiterten Einstellungen in Chat und Benutzerdefinierte Ordner
* **Update-Button** jetzt sichtbar
* Das Styling des Installationsskripts wurde komplett aktualisiert!
* Vorläufige **Automatische Multi-GPU-Unterstützung für Inferenz und Training** - nützlich für große Modelle, die nicht auf 1 GPU passen - Unsloth auto weist GPU-Ressourcen zu
* Intel Macs sollten sofort funktionieren

Deutlich flüssigeres und schnelleres Unsloth

* **Zeitüberschreitungen bei Downloads großer Modelle behoben** - keine Timeouts mehr gesehen.
* **Rate-Limiting von Hugging Face behoben - HF-API-Aufrufe um 90 % reduziert**
* bun unter Windows behoben und schnellere Installationen
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Neue wichtige Updates**

Es sind erst 2 Tage seit unserer vorherigen Veröffentlichung vergangen, aber wir haben wichtigere Updates:

* **Inference ist jetzt 20–30 % schneller.** Zuvor konnten Tool-Calling und Repeat Penalty die Inferenz unter normale Geschwindigkeiten verlangsamen. Inferenz-Token/s sollten jetzt genauso performant sein wie `llama-server` / `llama.cpp`.
* **Erkennt jetzt automatisch ältere oder bereits vorhandene Modelle** heruntergeladen von **LM Studio, Hugging Face,** und ähnlichen Quellen.
* **Die Geschwindigkeit für Inferenz-Token/s wird jetzt korrekt berechnet.** Zuvor enthielten tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer wirkte, als sie tatsächlich war. Sie sollte jetzt die „wahre“ Inferenzgeschwindigkeit widerspiegeln.
* **CPU-Auslastung spiked nicht mehr.** Zuvor änderte sich die Identität des Inline-Queriers bei jedem Rendern, was `useLiveQuery` dazu veranlasste, sich ständig neu anzumelden.
* **Unsloth Studio hat jetzt einen Shutdown-x-Button und fährt korrekt herunter.** Zuvor wurde es nach dem Öffnen über das Desktop-Symbol nicht korrekt geschlossen. Wenn du es jetzt über die Verknüpfung startest, öffnet sich auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Falls du es noch aus einer vorherigen Sitzung offen hast, kannst du deinen Computer neu starten oder `lsof -i :8888` ausführen, dann `kill -9 <PID>`.
* **Noch besseres Tool-Calling und Websuche** mit weniger Fehlern.
* Aktualisierte Dokumentation mit vielen neuen Infos zu [Modellen löschen, deinstallieren](/docs/de/neu/studio/install.md#uninstall) usw.
* **Sauberere, intelligentere Installations- und Setup-Logs unter Windows und Linux.** Die Ausgabe ist jetzt mit konsistenter Formatierung leichter zu lesen, standardmäßig leiser für ein flüssigeres Erlebnis, und unterstützt reichhaltigere `--verbose` Diagnosen, wenn du volle technische Details willst.
* Du kannst jetzt deinen Trainingsverlauf ansehen!
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Erste Veröffentlichung nach Unsloth Studio

Hey Leute, das ist unsere erste Veröffentlichung seit dem Start von Unsloth Studio. Viele neue Funktionen und Fehlerbehebungen:

* **Du kannst Unsloth Studio jetzt aktualisieren!** Bitte aktualisiere mit denselben Installationsbefehlen.
* **Windows** CPU oder GPU funktioniert jetzt nahtlos. Bitte neu installieren!
* **App-Verknüpfungen**. Nach der Installation kannst du jetzt in Windows, MacOS und Linux über ein Verknüpfungssymbol im Start-/Launch-Menü und auf dem Desktop starten.
* **Vorcompilierte `llama.cpp` Binärdateien** und `mamba_ssm` - 6x schnellere Installationen! Außerdem <300 MB groß für Binärdateien.
* **50 % kleinere Installationsgrößen** (-7 GB oder mehr Einsparung), 2x schnellere Installationen und schnelleres Auflösen. 50 % kleinere PyPI-Größen.
* **Tool-Calling verbessert.** Besseres llama.cpp-Parsing, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Tool-Outputs-Panel, Timer.
* MacOS und CPU haben jetzt [Daten-Rezepte](/docs/de/neu/studio/data-recipe.md) mit Multi-Datei-Upload aktiviert.
* **Vorläufige AMD-Unterstützung für Linux** nur Maschinen - automatische Erkennung.
* **Neugestaltung der Einstellungen-Seitenleiste.** Einstellungen sind jetzt gruppiert in **Modell, Sampling, Tools und Präferenzen**
* **Kontextlänge** jetzt anpassbar. Denk daran, dass dies nicht nötig ist, da llama.cpp den genau benötigten Kontext intelligent über `--fit on`
* **Multi-Datei-Upload.** Daten-Rezepte unterstützen jetzt mehrere Drag-and-Drop-Uploads für PDF, DOCX, TXT und MD, mit Backend-Extraktion, gespeicherten Uploads und verbesserten Vorschauen.
* **Colab** mit kostenlosen T4-GPUs funktioniert jetzt mit Unsloth Studio! [Probiere es hier aus](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Durch vorcompilierte Binärdateien ist es außerdem 20x schneller!
* **Bessere Chat-Beobachtbarkeit.** Unsloth zeigt jetzt `llama-server` Zeiten und Nutzung, eine Balkenanzeige für die Kontextfenster-Nutzung und reichhaltigere Karten bei Quellen-Hover an.
* **Insgesamt bessere UX** - klickbare Links, besseres LaTeX-Parsing, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!
* **LiteLLM -** Unsloth Studio und Unsloth waren **NICHT** vom jüngsten LiteLLM-Kompromittierungsfall betroffen. Nemo Data Designer nutzte LiteLLM nur bis `1.80`, nicht die betroffene `1.82.7` oder `1.82.8`, und hat es seitdem vollständig entfernt.
* Wir haben jetzt einen neuen Einzeilen-Installationsbefehl, einfach ausführen:&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Fixes:**

* **Verbesserungen für Windows/Setup.** Stille Windows-Beendigungen, Startabstürze von Anaconda/conda-forge, kaputte Nicht-NVIDIA-Windows-Installationen und fehlende frühe CUDA-/stale-venv-Setup-Prüfungen behoben.
* **System-Prompts behoben.** Sie funktionieren wieder für Nicht-GGUF-Text- und Vision-Inferenz.
* **Persistente System-Prompts und Presets.** Benutzerdefinierte System-Prompts und Chat-Presets bleiben jetzt über Reloads und Seitenwechsel hinweg erhalten.
* **GGUF-Export erweitert.** Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportieren. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der UI deaktiviert.
* **Korrekturen für Chat-Scrollen/Layout.** Behobene Scroll-Positionsprobleme während der Generierung, Verschiebungen im Thinking-Panel-Layout und Sprünge im Viewport beim Einklappen von Reasoning-Panels.
* **Intelligentere Erkennung von Portkonflikten.** Unsloth erkennt jetzt Loopback-Konflikte, kann nach Möglichkeit den blockierenden Prozess identifizieren und gibt klarere Meldungen zum Ausweich-Port aus.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Neues Tool-Calling + Windows-Stabilität

* Claude Artifacts funktioniert, sodass HTML wie ein Snake-Spiel direkt im Chat ausgeführt werden kann
* +30 % genauere Tool-Aufrufe, insbesondere für kleine Modelle + Timer für Tool-Aufrufe
* Ausgaben von Tool + Websuche können gespeichert werden + Auto-Healing-Tool ein-/ausschalten
* Viele Fehlerbehebungen - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
