> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/changelog.md).

# Unsloth-Updates

Um die neuesten Änderungen zu verwenden, [aktualisiere Unsloth](/docs/de/neu/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B und Qwen3.8-2.4T können jetzt lokal in Unsloth ausgeführt werden!

Ausführung auf 17 GB RAM über Unsloth Dynamic GGUFs. Du kannst Qwen3.8-27B auch in Unsloth feinabstimmen. Qwen3.8-27B ist mit Abstand das stärkste Modell seiner Größe. Wir haben auch NVFP4-Quants hochgeladen.

<a href="/pages/5695d6b6dec2df015f4427f80047e860ea228616" class="button primary">Qwen3.8-Anleitung ausführen</a><a href="/pages/9e82a50e6e0d5d7acdb8b1e0b3d769fa91e350bf" class="button secondary">Muse Glimmer feinabstimmen</a>

<figure><img src="/files/890a793f7df395610304b6fca7b69cde807076b5" alt="" width="375"><figcaption></figcaption></figure>

Weitere Unsloth-Updates umfassen:

* Qwen3.8-27B + zusätzliche llama-server-Argumente erlaubt + benutzerdefinierter VRAM-Schalter
* Externer Anbieter hat Tool-Aufrufe + Tool-Unterstützung + Anmeldung mit Codex
* Schnelle FP8-10x schnellere MiniMax-H3-Inferenz (3 Minuten statt 30)
* 10 % schnellere Inferenz für GGUFs + Umgehung von Berechtigungen behoben
* Verbunden [API-Anbieter](/docs/de/integrationen/connections.md) können ihre eigene Suche oder die integrierte Suche und die Tools von Unsloth Desktop verwenden. Die Tool-Ergebnisse werden an das Modell zurückgegeben, damit es mehrstufige Aufgaben fortsetzen kann.
* Melde dich mit einem Codex-Abonnement an und verwende Codex-Tools im Chat.

Um Qwen3.8 auszuführen oder zu trainieren, kannst du Unsloth Desktop herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## Wir stellen Unsloth Desktop vor

Wir stellen Unsloth Desktop vor 🦥 - die erste Desktop-App, um Modelle lokal auszuführen und zu trainieren.\
Open Source. Läuft auf Mac, Windows und Linux

<figure><img src="/files/0b36d843a92fb658bca1072a17cd8147bcf465a3" alt=""><figcaption></figcaption></figure>

• Unterstützt MLX, Diffusionsbild/-video, Audio, GGUF\
• Verbinde Claude Code und Codex mit lokalen LLMs\
• 50 % genauere, selbstheilende Tool-Aufrufe + Sandbox-Codeausführung\
• Funktioniert für CPU- + MultiGPU-Setups - NVIDIA, AMD, Intel, Mac\
• Modelle 2× schneller mit 70 % weniger VRAM trainieren\
• Private Websuche, Deep Research, RAG, MCP + Exporte (NVFP4, GGUF)\
• Verwende die OpenAI-kompatible API und Cloud-Modelle von Unsloth\
• LLMs sicher aus der Ferne bereitstellen und von überall darauf zugreifen

Du kannst Unsloth Desktop jetzt herunterladen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer ist da!

Meta hat Muse Glimmer veröffentlicht, das erste offene Modell von Meta Superintelligence Labs. Muse Glimmer ist ein dichtes Modell mit 30B Parametern von Meta, entwickelt für lokale agentische und Coding-Workflows. Veröffentlicht unter der Apache-2.0-Lizenz kannst du Muse Glimmer 30B über Unsloth und Unsloth Dynamic Quants für die beste Leistung ausführen.

<a href="/pages/905dffb7435b8aae6f540021fb352ca634402d1c" class="button primary">Muse Glimmer ausführen</a><a href="/pages/9e82a50e6e0d5d7acdb8b1e0b3d769fa91e350bf" class="button secondary">Muse Glimmer feinabstimmen</a>

Muse Glimmer 30B kann lokal laufen auf **20 GB RAM/VRAM** Setups, einschließlich Mac und GPUs. Du kannst Muse Glimmer 30B auch mit Unsloth auf **20 GB VRAM**.

Du kannst Muse Glimmer über die Unsloth-Desktop-App ausführen und feinabstimmen:

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth Desktop herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + Deep Research + Parallel Chat

Hallo zusammen! [Kimi K3](/docs/de/modelle/kimi-k3.md) kann jetzt lokal mit Unsloth Dynamic GGUFs ausgeführt werden, Unsloth kann mehrere Chats parallel generieren lassen, und der neue Deep-Research-Modus plant, liest und zitiert Quellen mithilfe deines lokalen Modells.

Dieses Release bringt außerdem bessere [AMD](/docs/de/grundlagen/amd.md) und Intel-GPU-Unterstützung, DoRA-Training sowie viele Installer-, MLX-, Export- und Inferenz-Fixes.

#### Kimi K3

Moonshot AIs **Kimi K3** ist ein MoE-Modell mit 2,8T Parametern und 104B aktiven Parametern, nativer Vision-Unterstützung und einem Kontextfenster von 1M. Kimi K3 ist nur für Thinking gedacht und Unsloth unterstützt niedrige, hohe und maximale Reasoning-Aufwände.

Du kannst unsere [Kimi K3 Dynamic GGUFs](https://huggingface.co/unsloth/Kimi-K3-GGUF) über Unsloth ausführen. Unsloth erkennt Multi-GPU-Setups automatisch und kann Modellschichten in den Systemspeicher auslagern.

Kimi K3 ist ein sehr großes Modell, also plane deine Hardware entsprechend:

* `UD-IQ1_S` belegt 595 GB Speicherplatz.
* `UD-Q4_K_XL` belegt 1,51 TB Speicherplatz.
* Für verlustfreie Inferenz verwende `UD-Q8_K_XL`, das 1,56 TB Speicherplatz belegt.

Lies unsere vollständige [Kimi K3-Anleitung](https://unsloth.ai/docs/models/kimi-k3) und erfahre mehr über [Unsloth Dynamic 2.0 GGUFs](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### Parallel Chat

Unsloth kann jetzt mehrere Unterhaltungen gleichzeitig ausführen. Wenn du einen **Neuen Chat** startest, läuft die vorherige Antwort weiter, und jede aktive Unterhaltung erhält ihren eigenen Fortschrittsindikator und Stopp-Button.

* Standardmäßig 4 llama-server-Slots, im Web-UI anpassbar.
* Tools, Uploads, Selbstheilung und Agenten bleiben zwischen Chats isoliert.
* Stoppe einen Chat, ohne andere zu unterbrechen oder den Server neu zu starten.
* Unsloth reduziert die Slot-Anzahl, wenn der Speicher knapp ist.
* Das Neuladen des Modells stoppt aktive Chats nach Bestätigung weiterhin.

#### Tiefgehende Recherche

Deep Research verwandelt ein lokales Modell in einen vollständigen Recherche-Workflow. Gib ihm eine Frage und es erstellt einen Plan, durchsucht das Web, ordnet die Belege und erstellt einen zitierten Bericht.

* Überprüfe und bearbeite den Plan, bevor die Recherche beginnt.
* Verfolge den Fortschritt und die gesammelten Quellen, während es arbeitet.
* Fortsetzen oder abbrechen, ohne die abgeschlossene Recherche zu verlieren.
* Websites zulassen oder blockieren, um die Quellenauswahl zu steuern.
* Quellen und Zitate bleiben bei jedem Durchlauf gespeichert.
* Vor dem Schreiben prüft Unsloth auf nicht unterstützte Behauptungen, Widersprüche und ungelöste Lücken. Empfehlungen ohne direkte Belege werden als überprüfbare Schlussfolgerungen markiert.

Pro Chat kann ein Lauf aktiv sein. Deep Research funktioniert derzeit mit lokalen Modellen. Optionales Grounding über die gesamte Seite kann die obersten Suchergebnisse vor der Synthese in temporäres RAG einlesen; aktiviere es mit `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`. Es bleibt standardmäßig deaktiviert, weil es zusätzliche Scraping-Zeit hinzufügt und weiteren Kontext benötigt.

#### Verbesserte AMD-Unterstützung

Dieses Update baut auf unserem ursprünglichen [AMD-Release und Einrichtungsleitfaden](https://unsloth.ai/docs/basics/amd) mit Unterstützung für mehr GPUs und zuverlässigere ROCm-Inferenz und -Trainings auf.

* Verbesserte Erkennung für RDNA2-, Radeon-, Ryzen-, Strix-Halo- und Workstation-GPUs.
* MI50 und Radeon VII unterstützen 16-Bit-LoRA und vollständiges Fine-Tuning unter Linux.
* 4-Bit-NaNs, Bibliothekskonflikte und lange RDNA-Startverzögerungen behoben.
* Nicht unterstützte Windows-HIP-GPUs können auf Vulkan zurückgreifen.
* Vulkan-Geräte zeigen ihre echten Namen und können einzeln ausgewählt werden.
* Saubere Windows-Installationen benötigen Winget oder Entwicklertools nicht mehr.

#### Trainings-, Modell- und Plattform-Updates

* Intel XPU ermöglicht lokalen Chat und Training auf Intel-Arc- und Data-Center-GPUs.
* DoRA ist neben LoRA und vollständigem Fine-Tuning verfügbar.
* Große Exporte können alle sichtbaren GPUs verwenden, um Speichergrenzen von GPU 0 zu vermeiden.
* MLX ergänzt Streaming-Datensätze, fortgesetztes Pretraining, Callbacks und bessere VLM- und LoRA-Unterstützung.
* Falsches `flash_attention_2` Modell-Output behoben.
* Unsloth und Speicherhilfsprogramme funktionieren jetzt ohne bitsandbytes.
* Behoben `.json` Datensätze sowie das Notebook-Setup für Qwen3.5/3.6 MoE und GRPO.
* Hub-Download-Ordner sind leichter zu finden und zu öffnen.
* Versionshinweise sind im Unsloth-Update-Popup verfügbar.
* `unsloth start --as-subagent` ermöglicht es Codex, Claude Code und Pi, Aufgaben an ein lokales Unsloth-Modell zu delegieren.
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD-Unterstützung ist da!

Hallo zusammen! Dieses Release bringt lokales LLM-Training und lokale Inferenz auf [AMD-GPUs](/docs/de/grundlagen/amd.md) unter Windows, WSL und Linux.

<a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Schnellstart</a><a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Funktionen</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">Github</a>

Ab heute ermöglichen unsere AMD-Zusammenarbeit, benutzerdefinierte Triton-Kernels und mathematische Algorithmen das Trainieren und Ausführen von über 500 Modellen auf AMDs Radeon-, Instinct-, Vulkan-, Ryzen- und Data-Center-GPUs, bis zu 2× schneller mit 70 % weniger VRAM und ohne Genauigkeitsverlust. Optimierte ROCm-Builds unterstützen auch GGUF- und Safetensors-Inferenz.

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### Update vom 23. Juli

1. Hinzugefügt **RDNA2-, Gorgon-Halo-, Vulkan-Unterstützung** + behoben, dass AMD-Installationen GPUs auf Strix Halo / anderen AMD-GPUs nicht erkennen
2. Bessere RDNA4-, HIP-/ROCm-Fehler-automatische Behebung und Erfassung
3. **2x schnellerer Unified Memory** AMD-safetensors-Laden + deutlich schnelleres Gradient Checkpointing für Geräte mit Unified Memory
4. Hinzugefügt **Sprachdiktat / whisper.cpp** vorläufige Unterstützung für schnelles Text-zu-Sprache
5. Behoben, dass Rollback-Umgebungen während der Installation 5 GB Speicherplatz verbrauchten - werden jetzt automatisch bereinigt

#### LLMs lokal auf AMD trainieren

* Modelle lokal auf AMD-GPUs trainieren, ausführen, mit RL nutzen und bereitstellen.
* Zuverlässigere AMD-GPU-Erkennung und -Installation unter Windows, WSL und Linux.
* Verbesserte ROCm-Kompatibilität für AMD-MI300X- und MI325X-GPUs.
* Unsloth aus der Ferne zugreifen über `unsloth studio --secure` über kostenloses HTTPS via Cloudflare

#### Größere Modelle auf deiner Hardware ausführen

* Verwende automatische GPU-Platzierung oder wähle genau aus, welche GPUs und Modellschichten verwendet werden sollen.
* Verschiebe MoE-Expertenschichten in den Systemspeicher, damit größere Modelle passen.
* Teile Modelle über mehrere GPUs auf oder verwende Tensor Parallelism.
* Hardwareeinstellungen separat für jedes Modell und jeden Quant speichern.

#### Schnellere Chat-Neustarts und zuverlässigere Downloads

* Lange Chats fortsetzen, ohne die gesamte Unterhaltung neu aufzubauen, nachdem ein untätiges Modell seinen VRAM freigegeben hat.
* Hängengebliebene Hugging-Face-XET-Downloads werden automatisch über standardmäßiges HTTP erneut versucht.
* Vorhandene GGUF-Dateien werden wiederverwendet, statt bei jedem Laden eines Modells erneut heruntergeladen zu werden.

#### Bessere Suche, Tools und Agenten

* Die Websuche kann jetzt PDF-Papiere, Handbücher und andere PDF-Ergebnisse lesen.
* Parallele Tool-Aufrufe, Reasoning-Ausgabe und Tool-Wiederholungen funktionieren zuverlässiger.
* Ein neuer optionaler MCP-Endpunkt ermöglicht kompatiblen KI-Clients, Modelle und Trainingshistorie zu inspizieren, Training zu starten oder zu stoppen, Checkpoints zu laden, Rezepte zu validieren und GGUFs zu exportieren.
  * Aktiviere es mit `UNSLOTH_STUDIO_ENABLE_MCP=1` und setze das erforderliche Bearer-Token mit `UNSLOTH_STUDIO_MCP_TOKEN`.

#### Trainings- und Export-Fixes

* Nur-Text-Training mit multimodalen Modellen kürzt lange Beispiele vor dem Packen nicht mehr.
* Feinabgestimmte Qwen3.5- und Qwen3.6-MTP-Modelle exportieren jetzt korrekt nach GGUF.
* Ein Windows-Berechtigungsfehler, der GGUF-Exporte beim letzten Schreibschritt stoppen konnte, wurde behoben.

#### Falls du es verpasst hast

Unser vorheriges Studio-Release brachte Dynamic-NVFP4-Modelle, tiefere Personalisierung, sieben neue Anzeigesprachen, sicherere Agenten und Vulkan-GPU-Beschleunigung.

**Dynamic NVFP4:**

Unsloth Dynamic NVFP4 belässt genauigkeitskritische Schichten in FP8 oder BF16, während der Rest in W4A4 läuft. Auf NVIDIA-Blackwell-GPUs ermöglicht das bis zu 2,5x schnellere Inferenz, während kalibrierte FP8-KV-Caches bis zu 2x längeren Kontext bieten.

Lies die [Dynamic-NVFP4-Anleitung](https://unsloth.ai/docs/basics/nvfp4) und entdecke unsere erweiterte [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4), einschließlich Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4.

**Passe dein Studio an:**

Wähle zwischen den Farbschemata Standard, Classic und Minimal, jeweils mit hellen und dunklen Modi. Du kannst außerdem Farben anpassen, Schriftarten importieren sowie Schriftgröße, Kontrast, reduzierte Bewegung und mehr anpassen.

Unsloth enthält außerdem einen Reiter für Stimmeinstellungen für Diktat, benutzerdefinierte Wörterbuch-Einstellungen und Vorlesen.

**Neue Sprachen:**

Unsloth Studio ist jetzt auf Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch verfügbar, zusätzlich zu Chinesisch (vereinfacht), Japanisch und Portugiesisch (Brasilien). Die automatische Erkennung der Browsersprache ist jetzt der Standard.

**Sicherere Agenten:**

Ein vierstufiger Berechtigungsauswähler für Tool-Aufrufe-**Fragen**, **Für mich genehmigen**, **Aus** und **Voller Zugriff**-bietet feinere Kontrolle über Agenten. Die Isolierung des Agenten-Arbeitsbereichs und sicherere Installer-Prüfungen verringern ebenfalls das Risiko unbeabsichtigter Änderungen.
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## Personalisierung, NVFP4, Sprachen

Hey Leute, wir haben viele neue Updates für Unsloth, besonders bei der Anpassung. Unsloth ist jetzt ganz auf dich anpassbar: drei Farbschemata plus benutzerdefinierte Farben und Schriftarten, sieben neue Anzeigesprachen und ein neuer Reiter für Stimmeinstellungen für Diktat und Vorlesen. Agenten werden sicherer mit einem vierstufigen Berechtigungsauswähler für Tool-Aufrufe (Fragen, Für mich genehmigen, Aus, Voller Zugriff) und Workspace-Isolation, und Intel-GPUs erhalten endlich GPU-beschleunigte Inferenz durch neues Vulkan `llama.cpp` Unterstützung.

Wir haben außerdem native Unterstützung für [Inkling](https://unsloth.ai/docs/models/inkling)hinzugefügt, ein offenes Modell mit 975B Parametern, 41B aktiven Parametern und einem Kontextfenster von bis zu 1M Tokens. Unter Apache 2.0 lizenziert, verarbeitet es Text, Bilder und Audio und generiert Text.

#### Dynamic NVFP4

Wir haben unsere [NVFP4-Sammlung](https://huggingface.co/collections/unsloth/nvfp4) um quantisierte Versionen von Qwen3.6, Qwen3.5, Inkling, GLM-4.7 Flash und Gemma 4 erweitert.

Lies die [Dynamic-NVFP4-Anleitung](https://unsloth.ai/docs/basics/nvfp4) für Details.

Dein Unsloth personalisieren

Unsloth ist nicht mehr auf hellen und dunklen Modus beschränkt:

* Wähle aus **Standard**, **Classic**, und **Minimal** Farbschemata, jeweils mit hellen und dunklen Varianten.
* Passe Akzent-, Hintergrund- und Vordergrundfarben an.
* Importiere deine eigenen UI-, Überschriften-, Chat- und Code-Schriftarten.
* Passe Schriftgröße, Kontrast, Bewegung, Cursorverhalten und Schriftglättung an.
* Sucheinstellungen und Sync-Einstellungen geräteübergreifend synchronisieren.

Heller und dunkler Modus behalten ihre eigenen Anpassungswerte.

#### Sieben neue Sprachen

Unsloth unterstützt jetzt Französisch, Deutsch, Spanisch, Hindi, Arabisch, Russisch und Koreanisch zusätzlich zu Chinesisch, Japanisch und Portugiesisch. Die automatische Erkennung der Browsersprache ist jetzt der Standard.

#### Stimmeinstellungen

Ein neuer Reiter „Stimme“ bietet Steuerelemente für Diktat, Aussprachewörterbücher und Vorlesen. Unterstützung für Spracherkennung und Text-zu-Sprache kommt bald; vollständige Sprachunterhaltungen befinden sich noch in Entwicklung.

#### Sicherere Agenten und Tool-Aufrufe

Der alte Umgehungsschalter ist jetzt ein vierstufiger Berechtigungsauswähler:

* **Fragen:** jeden Tool-Aufruf genehmigen.
* **Für mich genehmigen:** schreibgeschützte Aktionen automatisch ausführen und bei potenziell unsicheren Aktionen pausieren.
* **Aus:** Tool-Aufrufe deaktivieren.
* **Voller Zugriff:** alle Aufrufe zulassen und die Sandbox deaktivieren.

Diese Steuerelemente gelten für Terminal-, Python-, Websuche-, RAG- und MCP-Tools. Agenten erhalten außerdem isolierte Arbeitsbereiche, fortsetzbare Sitzungen mit `--persist`, sicherere Warnungen für Remote-Installer, Live-Streaming von Tool-Ausgaben und verbesserte Web-Extraktion.

#### Vulkan und `llama.cpp`

Der neue Vulkan `llama.cpp` Backend gibt Intel-GPUs GPU-beschleunigte Inferenz, statt auf die CPU zurückzufallen. Es unterstützt vorhandenes VRAM-Management, automatische Kontextgröße, Multi-GPU-Auswahl und Layer-Auslagerung.

AMD-Nutzer können es aktivieren mit:

```bash
UNSLOTH_FORCE_VULKAN=1
```

Wir haben außerdem die Aktualisierungszuverlässigkeit, die Wiederherstellung des Modellstatus und das Unterbrechen festhängender Generierungen verbessert.

#### Modelle und Training

Dieses Release enthält außerdem:

* Native Inkling-Unterstützung und Multi-GPU-B200-Verbesserungen.
* DeepSeek-V4-Eager-Attention und trainierbare FP8-Group Experts.
* Zuverlässiges Nur-Fertigstellen-Training durch automatische Erkennung von Chat-Template-Markern.
* Korrekte Behandlung deaktivierten Gradient Checkpointings.
* Verbessertes RoPE-Scaling und Kontextverlängerung.
* Erzwingen des Stopps für festhängende Trainingsläufe.
* Automatisches Routing für neue Modellarchitekturen und neuere Transformers-Versionen.
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth kann jetzt NVFP4-, FP8- und imatrix-GGUFs nach dem Training exportieren; als llama-swap-API-System agieren; japanische und brasilianisch-portugiesische Unterstützung hinzufügen; und enthält MLX, safetensors, Tool-Aufrufe, Heilungsunterstützung und mehr. Der Unsloth-Core macht GRPO 1,3x schneller, fügt HTTP-Fallback für hängen gebliebene Downloads hinzu, verbessert den Offline-Modus, beschleunigt MoE-Training um das 3-5-Fache und behebt viele Fehler. Diese Release-Reihe verwendet `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/de/modelle/deepseek-v4.md) wird jetzt mit Thinking-Schaltern und unseren verbesserten Chat-Template-Fixes unterstützt.

<div data-with-frame="true"><figure><img src="/files/d0fc7fb63bbb9a1d9e04b7d7ee876fcebd7515e6" alt="" width="375"><figcaption></figcaption></figure></div>

#### Intelligenteres OpenAI-kompatibles API-Serving

Betreibe einen lokalen API-Endpunkt mit sichererem Modellwechsel und besserer Wiederherstellung von Agenten-Tools.

* API-Anfragen können optional zwischen heruntergeladenen lokalen GGUFs automatisch wechseln, während unbekannte Modellnamen sicher weiterhin das aktuelle Modell verwenden.
* `/v1/models` gibt jetzt saubere Modell-IDs und den lokalen GGUF-Katalog zurück statt lokaler `.gguf` Pfade.
* Das automatische Entladen bei Inaktivität kann nach einer Phase der Inaktivität VRAM freigeben, und die Heilung von Tool-Aufrufen kann jetzt pro Anfrage gesteuert werden.

#### Export-Verbesserungen

Exporte sind flexibler und vermeiden unnötige Downloads.

* Wähle mehrere Exportformate auf einmal aus, einschließlich portabler FP8/INT8, GGUF-LoRA, quellenabgeglichenen Exporten, imatrix-GGUF und komprimiertem FP8/FP4.
* Multi-Checkpoint-Exporte vermeiden weitere wiederholte Basis-Modell-Downloads.
* FP8-, INT8- und GGUF-LoRA-Exporte respektieren jetzt `trust_remote_code`, und der GGUF-Export behandelt fehlende Quantisierungseinstellungen zuverlässiger.

#### RAG und Datei-Chat

Datei-Chat ist bei echten Dokumenten nützlicher.

* RAG-Anhänge können jetzt den Kontext des gesamten Dokuments verwenden, mit anpassbaren Embedding-Modellen und Hugging-Face-Suche.
* Datei-Chat liest mehr PDFs und Word-Dokumente korrekt, einschließlich von rechts nach links geschriebenem Text, indischem Text und DOCX-Tabellen.
* Lokale RAG-Prüfungen sind hinter Proxy-Setups zuverlässiger.

#### Unsloth-Feinschliff und Zuverlässigkeit

Die tägliche Nutzung sollte sich flüssiger und stabiler anfühlen.

* Lange Trainings- und Chat-Läufe frieren seltener still ein.
* Vergleichsmodus, Modellwechsel, Modellabbruch, Hub-Browsing und Hub Discover sind zuverlässiger.
* Projektexporte, Chat-Exporte, Einstellungen, geführte Touren, Dateidialoge, Update-Bildschirme und die Reasoning-Oberfläche sind sauberer und konsistenter.

#### Installer-, Hardware- und Plattform-Fixes

Unsloth lässt sich plattformübergreifend zuverlässiger installieren und ausführen.

* macOS-Installationen benötigen kein CMake oder Homebrew mehr, wenn ein vorgebautes `llama.cpp` verfügbar ist, und die Apple-Silicon-Unterstützung behandelt Pfade mit Leerzeichen und die Größenanpassung des Unified Memory besser.
* Windows-Start, UTF-8-Behandlung, ROCm-RAG-Embedding und ROCm-on-WSL-GPU-Unterstützung wurden verbessert.
* Blackwell-GPU-Vorabwahl, GGUF-Passformprüfungen, Tensor Parallelism für Vision/mmproj-GGUFs und lokales `llama.cpp` Wiederverwenden sind jetzt zuverlässiger.

#### Training, Modelle und Kernel

Training und Modellladen sind in mehr Setups zuverlässiger.

* GRPO unterstützt jetzt standardmäßig Sequence Packing, vermeidet wiederholte gemeinsame Prompts und behandelt DDP-Logit-Skalierung korrekt.
* Vollständiges Fine-Tuning, RL-Präzisionseinstellungen, Gradient Checkpointing, DDP-RoPE-Puffer und MoE-LoRA-Erkennung wurden behoben.
* FP8-Quantisierung/Dekquantisierung, Llama-3-RoPE-Scaling mit Transformers v5, PEFT-0.19-LoRA-Neuladen und `fast_generate` Fehlermeldungen wurden verbessert.
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3x längere Kontexte

[GLM-5.2](/docs/de/modelle/glm-5.2.md) wird jetzt in Unsloth Studio unterstützt! Alle Reasoning-Stufen werden unterstützt. **3x längere Kontextlängen** sind jetzt mit unserem neuen Auto-Fit-Algorithmus mit MTP erreichbar, wodurch längere Chats möglich werden. Umgehungsmodus für Berechtigungen, verzweigbare Chats, warteschlangenfähige Chats, ein neuer Hub für Modellentdeckung, parallele Module + HTTPS-Cloudflare-Unterstützung und mehr! Verwende `unsloth studio --secure` für sicheren globalen HTTPS-Zugriff!

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### Besserer Algorithmus für Kontextlänge

Laut [PR 1](https://github.com/unslothai/unsloth/pull/6312) und [PR 2](https://github.com/unslothai/unsloth/pull/6447), haben wir die Bestimmung von Speicherverbrauch und Kontextlänge in Unsloth Studio stark verbessert und insgesamt 3x längere Kontexte erreicht:

| Szenario                        | KV       | vor     | nach    |
| ------------------------------- | -------- | ------- | ------- |
| 1x 32GB-Pipeline (\~31 GB frei) | f16      | 23,040  | 64,000  |
|                                 | q8\_0    | 43,520  | 114,944 |
|                                 | q4\_0    | 82,432  | 199,680 |
| 2x 32GB-Pipeline                | beliebig | 262,144 | 262,144 |
| 2x 24GB Tensor (\~23 GB frei)   | f16      | 134,049 | 262,144 |
|                                 | q8\_0    | 252,329 | 262,144 |

#### Chat-Canvas, Verzweigungen & Warteschlange

* Bearbeite Assistentennachrichten direkt und starte von jedem Punkt im Thread neu.
* Verzweige einen Thread, um eine Unterhaltung abzuzweigen, ohne das Original zu verlieren.
* Temporäre (Inkognito-)Chats, die nichts zurücklassen.
* Neue Prompts in eine Warteschlange stellen, während noch eine Generierung läuft, statt zu warten.
* Chat-„Artefakte“ sind jetzt **Canvas**, mit Inline- **HTML-Canvas-Karten** die automatisch gerendert werden, einer Code-Ansicht, und DiffusionGemma zeigt seinen rohen Code weiterhin inline statt eingeklappt an.
* Die Chat-Suche umfasst jetzt jede Nachricht und zeigt zuerst deine eigenen Nachrichten an.

#### Hub (neu gestaltet)

* Vollseiten-Hub mit Trending-Feed, Suche und Unterstützung für benutzerdefinierte Modellpfade.
* README-Vorschau in einem Split-View-Feed, damit du vor dem Herunterladen lesen kannst.
* Downloads verwenden standardmäßig das schnellere **Xet** Transportprotokoll, mit automatischem HTTP-Fallback, falls eine Übertragung hängen bleibt.
* Neuer Schalter „Bei Auswahl laden“, um Ladeoptionen festzulegen, bevor ein Modell geladen wird.
* Google-Logo für DiffusionGemma und zukünftige Gemma-Derivate angezeigt.

#### Modelle & Inferenz

* DeepSeek-OCR und weitere Vision-Modelle laden und laufen jetzt ohne Fehler.
* Schnelle Inferenz in der neuesten vLLM (0.22+) behoben, sodass Beschleunigungen wieder funktionieren.
* Tensor Parallelism ist zuverlässiger: Wenn der schnellere MTP-Pfad fehlschlägt, erholt er sich jetzt selbstständig statt abzustürzen.
* DiffusionGemma zeigt jetzt live, wie das Bild beim Entrauschen entsteht, mit genauen Geschwindigkeitsstatistiken.

#### Sicherheit & Cloudflare-verschlüsselte Studios

* Neu `--secure` Nur-Cloudflare-Modus für Ende-zu-Ende-verschlüsselte Studios, wobei serverseitige Tools unter `--secure` verwendet werden. Nutze `unsloth studio --secure`!
* Den Modus „Berechtigungen umgehen“, um Bestätigungen zu überspringen und die Tool-Sandbox zu deaktivieren, wenn du das möchtest.
* Automatische Erkennung von Hugging Face-Virenscans + gefährlichen Dateien in Repositories.

#### Protokollierung und API

* Neu **API-Server-Monitor** in Unsloth.
* Schnellere API-Aufrufe und geringere Latenz
* Deutlich besser strukturierte Protokolle – jetzt mit Durchsatz und Latenz und viele aufgeblähte Protokolle entfernt.

#### Hardware & Backend

* Bessere Unterstützung für Blackwell RTX 50X- und 60X-GPUs
* Stilles Downgrading auf CPU statt GPU beheben
* Die torchao-Version wird jetzt anhand des installierten torch ausgewählt.
* Das Installationsprogramm repariert jetzt automatisch eine beschädigte oder nur-CPU-PyTorch-Installation und warnt vor stillem CPU-Fallback auf NVIDIA + AMD unter Win/Linux/Mac/WSL.
* Gibt den VRAM des Chat-Modells frei, wenn das Training startet, aber nur wenn die GPU tatsächlich knapp ist (sonst keine unnötigen Neuladungen).
* Wenn llama-server beim Start hart abstürzt, durchläuft Unsloth jetzt eine Wiederherstellungskette statt einfach zu scheitern.

#### Training & allgemeine Fehlerbehebungen & parallele Module

* MLX-Trainings-Updates.
* Verbesserte Zuverlässigkeit des GRPO-Trainings mit vLLM.
* Der Trainingsstart wurde zuverlässiger gemacht, mit klareren Fehlern für ungültige VLM-Batches.
* Unsloth bereinigt jetzt übrig gebliebene Backend-Prozesse nach Abstürzen, Neustarts oder unterbrochenen Herunterfahren zuverlässiger.
* Export, Chat, Training und Rezepte sind jetzt alle individuell / voneinander abgeschottet! Das bedeutet, dass du jetzt alle 4 parallel ausführen kannst! Du kannst chatten / Inferenz durchführen, während du auf einen Trainingslauf oder einen Export wartest!

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

Stelle sicher, dass du das neueste installierst [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) und [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) werden jetzt alle unterstützt.

* Ausführen und trainieren [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) über [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) ist da! Ausführen [Gemma 4](https://unsloth.ai/docs/models/gemma-4) \~2x schneller mit MTP.
* Audiokonversation wird jetzt für Gemma 4 unterstützt (`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Preserve Think wurde zu Gemma 4 hinzugefügt.

<figure><img src="/files/37d41a9986d4b1f503942b2654532cfdd5149728" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + Download-Manager (experimentell)

* Eine neue **Hub** Seite zum Durchsuchen, Herunterladen und Verwalten von Hugging Face-Modellen und -Datensätzen hinzugefügt.
* Unsloth kann jetzt bereits auf deinem Rechner vorhandene Modelle und Datensätze erkennen und sie zusammen mit heruntergeladenen Assets anzeigen.
* Heruntergeladen [GGUF-Modelle](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) haben jetzt direkte **Ausführen / Neuer Chat** Aktionen.

#### RAG / Mit Dateien chatten (experimentell)

* Hinzugefügt [**Mit Dateien chatten**](https://unsloth.ai/docs/new/studio/chat) in Unsloth, sodass du Fragen zu deinen eigenen Dokumenten und Wissensdatenbanken stellen kannst.
* Unterstützt hybride Suche, Zitate, PDF-Vorschauen, Dokumente pro Thread und ein integriertes `search_knowledge_base` Tool.

#### Neue Update-Schaltfläche + Hardware-Unterstützung

* Unsloth verwendet jetzt stets frische, aktuelle [llama.cpp-Prebuilds](https://unsloth.ai/docs/new/changelog) für CUDA, ROCm, Windows, Linux und macOS.
* Eine integrierte **llama.cpp aktualisieren** Schaltfläche wurde hinzugefügt, damit Nutzer das lokale Backend aktualisieren können, ohne Unsloth neu zu installieren.
* Verbesserte Windows-/WSL-AMD-Unterstützung, [Strix-Halo-ROCm-Unterstützung](https://unsloth.ai/docs/get-started/install/amd), [Blackwell-CUDA-Auswahl](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)und klarere Installationsmeldungen.

#### Lokaler Chat, Tools & API-Kompatibilität

* Lokale [Tool-Aufrufe](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) ist zuverlässiger, mit besserer Reihenfolge der Tool-Karten, weniger doppelten Tool-Schleifen und Unterstützung für die Tool-Nutzung mit GGUF-Vision-Modellen.
* Verbesserte [OpenAI-kompatible API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) und Anthropic-kompatibles API-Verhalten für lokale Unsloth-Server, einschließlich besserer Fehler, Token-Nutzung, Stoppgründe und [Claude-Code-Kompatibilität](https://unsloth.ai/docs/basics/claude-code).

#### Training & Fehlerbehebungen

* Verbesserte [MLX-Unterstützung](https://unsloth.ai/docs/new/studio/install) mit besseren Modellbezeichnungen, Generierungsgeschwindigkeits-Statistiken und Fehlerbehebungen für [VLM-Training](https://unsloth.ai/docs/basics/vision-fine-tuning).
* Mehrere [Trainings-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) und [Datensatz-](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) Grenzfälle behoben, einschließlich nicht beschreibbarer Hugging Face-Caches und benutzerdefinierter Datensatzzuordnungen.
* Viele UI-Feinschliffe über Chat, Menüs, Modellauswahl, Dark Mode, Import/Export und Einstellungen hinweg hinzugefügt.

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B, neue UI, MCP, Projekte

Dieses Update konzentriert sich hauptsächlich auf Gemma 4 12B, MCP, Projekte, Canvas, CUDA 13.3 und die neue Chat-UI. Nächste Woche gibt es ein noch größeres Update.

<div data-with-frame="true"><figure><img src="/files/03c0fa542e2dd3a0afc9fcd0c9c021346fd41c97" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google veröffentlicht [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4), ein neues Modell, das lokal auf 8 GB RAM läuft. [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [Anleitung](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified unterstützt Bild, Audio und 256K Kontext. Führe das Modell über Unsloth Studio aus und trainiere es.

#### MCP

* Entfernte `MCP` Serverunterstützung, einschließlich benutzerdefinierter Header und OAuth
* Lokale befehlsbasierte `MCP` Serverunterstützung
* `MCP` kann jetzt im Chat-Composer aktiviert werden
* Integrierte Voreinstellungen für gängige `MCP` Server

#### Neue Chat-UI

* Projekte, Canvas, `MCP`sowie RAG- und Vergleichssteuerungen sind jetzt im Plus-Menü zu finden
* Suche und Code-Steuerungen sind leichter über den Composer zugänglich
* Menüs, Overlays, Symbole und anklickbare Steuerelemente sind in Unsloth konsistenter

#### Projekte

* Ordne zusammengehörige Chats in dedizierten Projektarbeitsbereichen
* Vorhandene Chats in Projekte verschieben
* Projekte direkt über die Seitenleiste erstellen und verwalten

#### Experimentelles Canvas / Artefakte

* Öffnet generiertes HTML in einem dedizierten Canvas-Panel innerhalb von Unsloth Studio
* Unterstützt interaktive Ausgaben, einschließlich browserbasierter Visualisierungen und über CDN geladener Pakete
* Ermöglicht dir, zwischen gerendeter Vorschau und Quellcode zu wechseln

#### Installation, Laufzeit und Hardware

* Windows-Prebuild-Installationen benötigen nicht mehr die frühe `CUDA Toolkit` Prüfung
* Linux `llama.cpp` Prebuilds entsprechen jetzt der erkannten Laufzeit `cudart` Haupt-
* `ROCm` gfx-Erkennung wird in die Auswahl der Prebuilds weitergegeben
* `Blackwell`, `B300` und `ARM64` Linux-Unterstützungs-Updates

Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `unsloth studio update` nicht mehr, da das Packaging nicht die neuesten Updates erhält!**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3, Windows, Mac

**Um Unsloth zu aktualisieren oder ein neues Unsloth Studio zu installieren, musst du Folgendes verwenden:**

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**NICHT VERWENDEN `unsloth studio update` nicht mehr, da das Packaging nicht die neuesten Updates erhält!**
{% endhint %}

#### Mac-Updates

* Wieder aktiviert `llama.cpp` Prebuilt-Binaries für Apple Silicon (M1-M4) - Mac OS 14 / 15 / 26 (Tahoe)
* Apple Silicon Mac OS 13 (Ventura) ist ein Source-Build
* Intel (x86\_64) für Mac OS 13.3 / 14 / 15 / 26 (Tahoe) verwendet `llama.cpp` Prebuilt-Binaries
* Intel für Max 13.0 - 13.2 ist ein Source-Build

#### Windows-Updates

* CUDA 13.3 `llama.cpp` Prebuilt-Binaries funktionieren jetzt für Windows
* Für CUDA 13.2, CUDA 13.1 und darunter verwenden Windows-Geräte CUDA-12.4-Fallback - wir werden bald an CUDA-13.1-Binaries arbeiten.

#### CUDA-13.3-Update

* CUDA 13.3-Binaries außerhalb von Linux funktionieren. Wir werden vorerst weiterhin CUDA 13.1 verwenden
* CUDA 13.3 löst das Kauderwelsch-Problem von CUDA 13.2 - siehe <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell-GPUs-Update

* Vorerst wird es für Blackwell verzögerte Veröffentlichungen von `llama.cpp` Prebuilt-Binaries geben, da CUDA 12.4 nicht funktioniert - wir arbeiten daran, dies bald zu beheben.
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## Ein Update vor dem Revamp.

Hey Leute, wir machen noch ein letztes größeres Update vor einem großen Revamp, der wahrscheinlich diese Woche oder nächste Woche kommt. Unser Revamp wird vieles verändern, besonders mit neuen großen Funktionen und vielen Designänderungen.

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* NEU: [**API-Aufruf-Unterstützung**](https://unsloth.ai/docs/integrations/connections) jetzt mit Bildgenerierung + Bearbeitung, richtiger Websuche, Codeausführung, automatischem Prompt-Caching. Verbinden [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) und mehr.
* Ordentliche Unterstützung für **nicht-englische Sprachen** z. B. Japanisch, Chinesisch, Indisch usw.

Viele von euch haben vielleicht unser vorheriges Release verpasst, das nur einen Tag lang verfügbar war. Wir haben eingeführt:

* Mit externen Inferenz-Backends verbinden: [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **Sicherheitsverbesserungen**
* **Automatisches MTP-Spekulatives Dekodieren** für MTP-GGUFs; erhalte die besten Einstellungen, angepasst an deine Hardware.

#### API-Provider-Aufruf & externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* Bildgenerierung + Bearbeitung
* API-Schlüssel für lokale Anbieter jetzt optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### Weitere Unsloth Studio-Updates

* OpenDocument-Chat-Anhänge
* o3 Reasoning-Zusammenfassungs-Payload
* Das Senden/Prompten in nicht-englischen Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt richtig
* Härtung des IME-Compilers, RTL `dir="auto"`Behebung der Kürzung langer Protokollzeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständige Offline-Unterstützung: gecachte GGUF-Erkennung und Offline-DNS-Autoerkennung für Inferenz und Training

#### Sicherheitsverbesserungen von Unsloth Studio

* Authentifizierungs-Ratenbegrenzung, proxy-bewusst, damit Reverse Proxies sie nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
* Strikte Schema-Validierung über die gesamte Unsloth API hinweg
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback auf `training_args.bin` sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Aktualisierung, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Das Abbrechen der Bereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass niemals Benutzerzustand gelöscht werden kann
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP + Unsloth-Fehlerbehebungen

Viele Fehlerbehebungen sowie UI- und UX-Verbesserungen für Unsloth! Um die neuesten Updates zu erhalten, gehe wie folgt vor:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows:**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### Fehlerbehebungen

1. Beheben `unsloth studio update` funktioniert nicht gut
2. Beheben, dass es hängen bleibt bei `Passwort zurücksetzen` Seite
3. Mehr Unterstützung für den Offline-Modus
4. Verbessern, dass MTP auf Macs, CPUs und GPUs nicht schneller ist - jetzt ist es viel besser!
5. Beheben, dass die Desktop-Verknüpfung nach dem Update nicht funktioniert
6. Viele, viele UI-/UX-Fehlerbehebungen
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API-Verbindungen

Wir haben viele neue Updates für Unsloth `v0.1.41-beta`:

* **\~2x schnellere GGUF-Inferenz** mit automatisch aktiviertem [MTP](/docs/de/modelle/qwen3.6.md#mtp-guide)
* [**API-Aufruf-Unterstützung**](/docs/de/integrationen/connections.md) für [OpenAI](/docs/de/integrationen/connections/openai.md), [Anthropic](/docs/de/integrationen/connections/anthropic-claude.md) usw. mit automatischem Prompt-Caching, Websuche, Codeausführung
* Mit externen Inferenz-Backends verbinden: [vLLM](/docs/de/integrationen/connections/vllm.md), [Ollama](/docs/de/integrationen/connections/ollama.md), [llama-server](/docs/de/integrationen/connections/llama.cpp-mit-unsloth-verbinden-ggufs-mit-llama-server-ausfuhren.md)
* Experimentelle **MLX-Inferenz**
* Ordentliche Unterstützung für **nicht-englische Sprachen**
* **Sicherheit** Verbesserungen

<a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#qwen3.6-inference-tutorials" class="button primary">Qwen3.6-Tutorials ausführen</a><a href="/pages/efc00d6b1d286a029d0eec8a5a6a24d50b063840#mtp-guide" class="button primary">MTP-Anleitung</a>

<div data-with-frame="true"><figure><img src="/files/7b482fd313c9534e8f7f4639059ce9449817c948" alt="" width="375"><figcaption></figcaption></figure></div>

#### Unterstützung für MTP-spekulatives Dekodieren: 1,4- bis 2-fach schnellere Inferenz!

* **Automatisches MTP-Spekulatives Dekodieren** für MTP-GGUFs; warnt, wenn der mitgelieferte llama.cpp-Prebuild veraltet oder zu alt für MTP ist
* Neue vorgefertigte llama.cpp-Binaries für MTP-Unterstützung!

#### API-Provider-Aufruf & externe Verbindungen

* Du kannst Unsloth jetzt mit jedem API-Cloud-Anbieter verbinden (OpenAI, Anthropic, OpenRouter usw.)
* **Integrierte Websuche** für OpenAI, Anthropic, OpenRouter und Kimi
* **Integrierte Codeausführung** für OpenAI und Anthropic (Anthropic-Container bleiben bestehen und werden über Turns hinweg wiederverwendet)
* Prompt-Caching ist für OpenAI- und Anthropic-Modelle aktiviert und spart 50 bis 90 % der Kosten.
* API-Schlüssel für lokale Anbieter jetzt optional (llama.cpp / vLLM / Ollama)
* Modelle beim Hinzufügen eines Cloud-Anbieters automatisch laden

#### MLX-Inferenz (experimentell)

* MLX-Quants und -Modelle können jetzt lokal auf deinen Mac-Rechnern ausgeführt werden!
* Wir werden bald Thinking, Tools und Websuche hinzufügen!

#### Weitere Unsloth Studio-Updates

* Das Senden/Prompten in nicht-englischen Sprachen (z. B. Japanisch, Chinesisch) funktioniert jetzt richtig
* OpenDocument-Chat-Anhänge
* o3 Reasoning-Zusammenfassungs-Payload
* Härtung des IME-Compilers, RTL `dir="auto"`Behebung der Kürzung langer Protokollzeilen
* Rendering der Tool-Reasoning-Trace in der UI
* Vollständige Offline-Unterstützung: gecachte GGUF-Erkennung und Offline-DNS-Autoerkennung für Inferenz und Training
* Viele UI-/UX-Feinschliffe: Überarbeitung des Dark Themes, Neugestaltung der rechten Seitenleiste, Sloth-Maskottchen zur Tageszeit, wegklickbare und kopierbare Toasts, größerer Chat-Composer, Feinschliff der Codeausführungs-Konfiguration, Stil des Composer-Aktions-Pills, schmalere Discord-Schaltfläche

#### Trainings-Updates

* Fehlerbehebungen für Gemma-Aufmerksamkeitsmasken
* Multi-Image-GRPO
* Experimente zur Rückgabe von GRPO-Hidden-State
* Neue Methode für Continued Pretraining (CPT) als erstklassige Option
* Gemma-4-MoE-LoRA-Extractor registriert, um `grouped_mm` Absturz durch Kontraktion
* Optionales fusioniertes `lm_head` + Cross-Entropy-Forward, mit Single-Matmul-Pfad unter `UNSLOTH_RETURN_LOGITS=1`
* Batchgröße für Eval übergeben
* Eval-/Trainingspfade berücksichtigen jetzt `HF_DATASETS_OFFLINE` zusammen mit `HF_HUB_OFFLINE`

#### Sicherheitsverbesserungen von Unsloth Studio

* Authentifizierungs-Ratenbegrenzung, proxy-bewusst, damit Reverse Proxies sie nicht umgehen
* Sandboxed Worker mit einer verschärften Blockliste (bash, `hf upload`, `NOFILE`)
* Pfad-Einschränkung, damit Worker nicht aus ihren laufenden tmp-Verzeichnissen entkommen können
* Strikte Schema-Validierung über die gesamte Unsloth API hinweg
* Verschärfte CSP-/Sicherheits-Header (nur legitime Favicon-Hosts erlaubt)
* Entfernt wurde der `torch.load` Fallback auf `training_args.bin` sodass nicht vertrauenswürdige Pickles beim Laden des Modells niemals ausgeführt werden können
* Abgesicherter Tauri-Desktop-Release-Flow
* Frontend-Authentifizierung: Singleflight-Token-Aktualisierung, Eingabe des aktuellen Passworts bei Änderungen, funktionierendes Logout, gemeinsamer 422-Helfer
* Das Abbrechen der Bereinigung ist jetzt strikt auf laufende tmp-Verzeichnisse beschränkt, sodass niemals Benutzerzustand gelöscht werden kann
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth-API-Endpunkt

#### ***v0.1.39-beta Fehlerbehebung*** **5. Mai 2026**

Behebt, dass der Chatverlauf nicht angezeigt wird (der vorhandene Chatverlauf geht nicht verloren) und Anhänge nicht korrekt angehängt werden. Der Fehler betraf nur die Darstellung - verwende `2026.5.2` oder rufe direkt auf `curl -fsSL https://unsloth.ai/install.sh | sh`  zum Aktualisieren

Du kannst lokale LLMs mit Tools wie [Claude Code](https://unsloth.ai/docs/basics/claude-code) und [Codex](https://unsloth.ai/docs/basics/codex) verwenden, indem du sie mit dem API-Endpunkt von Unsloth verbindest. Dadurch kannst du Modelle wie [Qwen](https://unsloth.ai/docs/models/qwen3.6) und [Gemma](https://unsloth.ai/docs/models/gemma-4) lokal ausführen, mit zusätzlichen Funktionen wie selbstheilenden Tool-Aufrufen, Codeausführung und Websuche.

Unsloth als API-Inferenz-Endpunkt zu verwenden ist nicht nur deshalb vorteilhaft, weil es einfach einzurichten und schnell ist, sondern auch, weil Unsloth Folgendes bietet:

* [Selbstheilende Tool-Aufrufe](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling), die dabei hilft, fehlerhafte oder missgebildete Tool-Aufrufe um 50 % zu reduzieren
* [Codeausführung](https://unsloth.ai/docs/new/studio/chat#code-execution) Unterstützung, die Bash- und Python-Ausführung für genauere Codeausgaben ermöglicht.
* Erweitert [Websuche](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) die Webseiten aufruft und tatsächlich liest, um detaillierte Informationen zu sammeln.
* [Automatische Inferenz-Einstellungen](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) für GGUF-Modelle (Temp, Top-K usw.)

<div data-with-frame="true"><figure><img src="/files/4d7f67e24fb64209883a9782fb1c8e4d7782a66f" alt="" width="375"><figcaption></figcaption></figure></div>

#### Neue Modelle

Wir haben außerdem einige neue Modelle zum Ausführen, darunter NVIDIA [Nemotron 3 Nano Omni](/docs/de/modelle/nemotron-3-nano-omni.md), IBM [Granite 4.1](/docs/de/modelle/ibm-granite-4.1.md) und [Mistral 3.5](/docs/de/modelle/mistral-3.5.md) Medium. Wir haben Mistral dabei geholfen, einige Probleme bei der Implementierung in Transformers und GGUFs zu lösen.

#### Unsloth-Updates

* Gestoppte Unsloth-Trainingsläufe können jetzt von Checkpoints fortgesetzt werden.
* Chat-Threads speichern jetzt automatisch und bleiben zuverlässiger erhalten.
* Hänger bei DPO-Training in Multi-Prozess-Setups wurden behoben.
* VLM-GRPO-Unterstützung mit MROPE-Updates verbessert.
* Die Stopp-Schaltfläche von Unsloth stoppt die Generierung jetzt korrekt.
* Behebt, dass die Chat-Vorlage nach Browser-Refresh verschwindet.
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## Brandneues UI-Redesign

Hey Leute, wir haben die gesamte UI- und UX-Erfahrung von Unsloth Studio überarbeitet, um den Fokus auf Chat und Training zu legen:

* Eine einklappbare Seitenleiste basierend auf Community-Feedback hinzugefügt

<div data-with-frame="true"><figure><img src="/files/185679ec5ea5e6010281442e142bd0d961fb8f08" alt="" width="375"><figcaption></figcaption></figure></div>

* Du kannst jetzt Chats löschen und frühere Unterhaltungen durchsuchen

<div><figure><img src="/files/e57d933175dd866c23fb6d9276cdfb38ea19b22d" alt=""><figcaption></figcaption></figure> <figure><img src="/files/458049913eb8246383936137e5b124396134423d" alt=""><figcaption></figcaption></figure></div>

* Neuer Schalter „Denken beibehalten“ für Modelle, die das unterstützen, wie Qwen3.6
* Klareres, konsistenteres Design mit leichterer Navigation
* Erweiterte Einstellungsseite mit Optionen zum Ändern deines Profilbilds, Namens und mehr

<div data-with-frame="true"><figure><img src="/files/e1b3c839b73e0fd270b11a2912b3fa53fd6ac640" alt="" width="375"><figcaption></figcaption></figure></div>

* Kein doppeltes Eingeben deines Hugging Face-Tokens mehr
* gpt-oss hat jetzt Schalter für niedriges, mittleres und hohes Denken.
* Verwendet jetzt das neueste llama.cpp-Prebuild, sogar unter Linux CUDA
* Viele Fehler-, Konsistenz- und Stabilitätsbehebungen
* Kimi-K2.6 kann jetzt ausgeführt werden!
* Wir haben außerdem experimentelle API-Unterstützung hinzugefügt. Anleitungen, Ankündigungen usw. folgen nächste Woche.

Qwen3.6 wurde auch zuvor bereits in Unsloth Studio für Ausführung und Training unterstützt. Du kannst Qwen3.6-27B jetzt sofort trainieren und ausführen!
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/de/modelle/qwen3.6.md) kann jetzt ausgeführt werden (18 GB RAM) und in Unsloth Studio feinabgestimmt werden. Kimi K2.6 kann auch in Unsloth ausgeführt werden (350 GB RAM).

Unsloth Studio hat viele neue Updates erhalten, bitte aktualisieren. Details und ein ausführlicher Bericht kommen in den nächsten Tagen.
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/de/modelle/qwen3.6.md) kann jetzt ausgeführt und in Unsloth Studio feinabgestimmt werden. Das Modell läuft auf 23 GB RAM und ist das stärkste mittelgroße LLM in nahezu allen Benchmarks.
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma 4 Update + MiniMax-M2.7**

[Gemma 4 GGUFs](https://huggingface.co/collections/unsloth/gemma-4) sind jetzt mit den offiziellen Chat-Template-Fixes von Google aktualisiert (die das Tool-Calling behoben/verbessert haben), zusammen mit den neuesten llama.cpp-Fixes. Aktualisiere auf die neueste llama.cpp-Version, lade die Quantisierungen erneut herunter und du solltest keine `ungenutztes Token` Probleme mehr sehen.\
\
[MiniMax-M2.7](/docs/de/modelle/tutorials/minimax-m27.md) ist jetzt draußen! Du kannst das Modell lokal mit unseren GGUFs in 4-Bit-Quantisierung auf 128 GB RAM / Unified Memory ausführen. [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma 4-Fixes**

Wir haben Gemma 4 [mit vielen Fixes](/docs/de/modelle/gemma-4/train.md). Diese Bugs sind universell und betrafen alle Trainingspakete und Implementierungen und **stammten nicht von Unsloth**. Wir haben die Bugs identifiziert, behoben, und das Training von Gemma 4 funktioniert jetzt in Unsloth ordnungsgemäß.

Du brauchst nur **8 GB VRAM** zum Trainieren **Gemma-4-E2B** lokal. Unsloth trainiert Gemma 4 **\~1,5x schneller und verbraucht dabei \~60 % weniger VRAM** als FA2-Setups. Für die vollständige Anleitung und Notebooks zum Training von Gemma 4, [siehe unseren Blog](/docs/de/modelle/gemma-4/train.md).

#### Gemma 4 Training-Fixes

1. **Gradientenakkumulation** verursacht keine Loss-Ausbrüche mehr. Zuvor konnten die Loss-Werte auf **300–400**; der erwartete Loss liegt bei etwa **10–15**.
2. Behoben wurde der **IndexError** der **26B** und **31B** Inference in `transformers`.
3. Behoben wurden Kauderwelsch-Ausgaben für **E2B/E4B** wenn `use_cache=False`. Siehe [issue #45242](https://github.com/huggingface/transformers/issues/45242).
4. Behoben **float16-Audio** Überlauf durch `-1e9` Werte.

Wenn du Loss-Werte über **13–15 siehst,** zum Beispiel **100** oder **300** - wird die Gradientenakkumulation wahrscheinlich falsch behandelt. Dies ist in beiden behoben **Unsloth** und **Unsloth Studio**.

#### Gemma 4 Quant-Reuploads

Wir haben auch unsere Gemma 4 GGUFs aktualisiert, daher musst du sie erneut herunterladen. Auch diese Quantisierungsprobleme stehen **in keiner Beziehung zu Unsloth und werden nicht von Unsloth verursacht**:

1. CUDA: auf Pufferüberlappung vor dem Zusammenführen prüfen - kritischer Fix für `<unused24>` Tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`: Unterstützung für Attention-Rotation für heterogenes iSWA - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `Vokabular`: Byte-Token-Behandlung zum BPE-Detokenizer für Gemma 4 hinzufügen - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `konvertieren`: setze `"add bos" == True` für Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `allgemein`: Spezialparser für Gemma 4 hinzufügen - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: lies `final_logit_softcapping` für Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: benutzerdefinierten Zeilenumbruch-Split für Gemma 4 hinzufügen - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio-Updates

* Hinzufügen **spekulative Dekodierung** Unterstützung (ngram-mod, standardmäßig aktiviert)
* Llama.cpp wurde auf die neueste Version mit allen Gemma-4-Fixes aktualisiert
* Qwen3.5- und Gemma-4-Trainingsprobleme beheben
* Export und Speichern von Gemma-4-Modellen ermöglichen
* Sandbox-Sicherheit für Terminal- und Python-Tools verschärfen
* Rezepte das in Chat geladene Modell verwenden lassen
* Leere Chat-Threads bei der Navigation beheben (und immer beim Wechseln zwischen Tabs) und den neuen Chat-Flow stabilisieren
* Nicht-LLM-Rezepte laufen lassen und den Daten-Tab bei Ausführungen an erste Stelle setzen
* HF-Cached-Repo-Schreibweise wiederverwenden, um doppelte Downloads zu verhindern
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* Du kannst jetzt die [Gemma 4](/docs/de/modelle/gemma-4.md) Modelle in Unsloth ausführen und trainieren.
* Intel-Mac funktioniert jetzt
* Vorkompilierte Binärdateien für llama.cpp für 2 Gemma-4-Fixes:
  * Vokabular: Gemma4-Tokenizer beheben ([#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * Fix: Gemma-4-Template ([#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* Tool-Aufrufe für kleinere Modelle sind jetzt stabiler und werden nicht mehr abgeschnitten
* Vorkompilierte Binärdateien für Windows-, Linux-, Mac- und WSL-Geräte - CPU und GPU
* Spekulative Dekodierung für Nicht-Vision-Modelle hinzugefügt (Gemma-4 ist leider Vision und Qwen3.5)
* Die Kontextlänge wird jetzt korrekt angewendet.
* Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* 90 % weniger HF-API-Aufrufe - weniger Rate-Limits
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50 % Genauigkeit bei Tool-Aufrufen + mehr Unterstützung**

* Tool-Aufrufe für alle Modelle sind jetzt **+30 % bis +80 % genauer.**
* Die Websuche erhält jetzt tatsächlich Webinhalte und nicht nur Zusammenfassungen
* Die Anzahl erlaubter Tool-Aufrufe wird von 10 auf 25 erhöht
* Tool-Aufrufe enden jetzt deutlich besser, sodass Schleifen/Wiederholungen reduziert werden
* Mehr **Heilung von Tool-Aufrufen** und Deduplizierungslogik, damit Tool-Aufrufe auch kein XML mehr durchlecken
* Getestet mit `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`), Websuche + Codeausführung + Denken aktiviert.

| Metrik                             | Vorher | Nachher         |
| ---------------------------------- | ------ | --------------- |
| XML-Leaks in der Antwort           | 10/10  | 0/10            |
| Verwendete URL-Abrufe              | 0      | 4/10 Durchläufe |
| Durchläufe mit korrekten Songnamen | 0/10   | 2/10            |
| Durchschn. Tool-Aufrufe            | 5.5    | 3.8             |
| Durchschn. Antwortzeit             | 12,3 s | 9,8 s           |

#### Neue Funktionen

* Hinzugefügt **benutzerdefinierte Ordner** sodass du beliebige GGUFs in beliebigen Ordnern verwenden kannst - derzeit Zugriff in den erweiterten Einstellungen in Chat und Benutzerdefinierten Ordnern
* **Aktualisieren-Schaltfläche** jetzt sichtbar
* Installationsskript-Design vollständig aktualisiert!
* Vorläufige **Automatische Multi-GPU-Unterstützung für Inferenz und Training** - nützlich für große Modelle, die nicht auf 1 GPU passen - Unsloth Auto weist GPU-Ressourcen zu
* Intel-Macs sollten sofort funktionieren

Deutlich flüssigeres und schnelleres Unsloth

* **Zeitüberschreitungen beim Download großer Modelle behoben** - keine Zeitüberschreitungen mehr sichtbar.
* **Hugging-Face-Rate-Limiting behoben - HF-API-Aufrufe um 90 % reduziert**
* bun unter Windows behoben und schnellere Installationen
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **Neue wichtige Updates**

Es sind erst 2 Tage seit unserer vorherigen Veröffentlichung vergangen, aber wir haben wichtigere Updates:

* **Die Inferenz ist jetzt 20–30 % schneller.** Zuvor konnten Tool-Calling und Repeat Penalty die Inferenz unter normale Geschwindigkeiten verlangsamen. Die Inferenz-Tokens/s sollten jetzt genauso ausfallen wie `llama-server` / `llama.cpp`.
* **Erkennt ältere oder bereits vorhandene Modelle jetzt automatisch** heruntergeladen von **LM Studio, Hugging Face,** und ähnlichen Quellen.
* **Die Geschwindigkeit der Inferenz-Tokens/s wird jetzt korrekt berechnet.** Zuvor enthielten tokens/s die Startzeit, wodurch die angezeigte Geschwindigkeit langsamer aussah, als sie tatsächlich war. Sie sollte jetzt die 'echte' Inferenzgeschwindigkeit widerspiegeln.
* **Die CPU-Auslastung steigt nicht mehr sprunghaft an.** Zuvor änderte sich die Identität des Inline-Query-Handlers bei jedem Rendern, was `useLiveQuery` dazu veranlasste, sich kontinuierlich erneut zu abonnieren.
* **Unsloth Studio hat jetzt eine Schließen-x-Schaltfläche und wird ordnungsgemäß beendet.** Zuvor wurde es nach dem Öffnen über das Desktop-Symbol nicht korrekt geschlossen. Jetzt öffnet der Start über die Verknüpfung auch das Terminal, und das Schließen dieses Terminals beendet Unsloth Studio vollständig. Wenn du es noch aus einer früheren Sitzung geöffnet hast, kannst du deinen Computer neu starten oder `lsof -i :8888` dann `kill -9 <PID>`.
* **Noch besseres Tool-Calling und Websuche** mit weniger Fehlern.
* Dokumentation mit vielen neuen Infos zu [Löschen von Modellen, Deinstallation](/docs/de/neu/studio/install.md#uninstall) usw. aktualisiert.
* **Sauberere, intelligentere Installations- und Setup-Logs für Windows und Linux.** Die Ausgabe ist jetzt dank einheitlicher Formatierung leichter lesbar, standardmäßig leiser für ein flüssigeres Erlebnis und unterstützt reichhaltigere `--verbose` Diagnosen, wenn du vollständige technische Details möchtest.
* Du kannst jetzt deinen Trainingsverlauf ansehen!
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Erster Release-Post nach Unsloth Studio

Hey Leute, das ist unser erster Release seit dem Start von Unsloth Studio. Viele neue Funktionen und Fixes:

* **Du kannst Unsloth Studio jetzt aktualisieren!** Bitte über dieselben Installationsbefehle aktualisieren.
* **Windows** CPU oder GPU funktioniert jetzt nahtlos. Bitte neu installieren!
* **App-Verknüpfungen**. Nach der Installation kannst du jetzt unter Windows, MacOS und Linux über ein Verknüpfungssymbol in Start / Launch und auf dem Desktop starten.
* **Vorkompilierte `llama.cpp` Binärdateien** und `mamba_ssm` - 6x schnellere Installationen! Außerdem <300 MB Größe für Binärdateien.
* **50 % reduzierte Installationsgrößen** (-7 GB oder mehr Einsparung), 2x schnellere Installationen und schnelleres Auflösen. 50 % kleinere PyPI-Größen.
* **Tool-Calling verbessert.** Besseres llama.cpp-Parsing, kein rohes Tool-Markup im Chat, schnellere Inferenz, ein neues Panel für Tool-Ausgaben, Timer.
* MacOS und CPU haben jetzt [Daten-Rezepte](/docs/de/neu/studio/data-recipe.md) mit Mehrfachdatei-Upload aktiviert.
* **AMD-Unterstützung vorläufig für Linux** nur Maschinen - automatische Erkennung.
* **Neugestaltung der Seitenleiste für Einstellungen.** Die Einstellungen sind jetzt gruppiert in **Modell, Sampling, Tools und Präferenzen**
* **Kontextlänge** jetzt anpassbar. Beachte, dass dies nicht nötig ist, da llama.cpp den genau benötigten Kontext intelligent über `--fit on`
* **Mehrfachdatei-Upload.** Data-Rezepte unterstützen jetzt mehrere Drag-and-drop-Uploads für PDF, DOCX, TXT und MD, mit Backend-Extraktion, gespeicherten Uploads und verbesserten Vorschauen.
* **Colab** mit kostenlosen T4-GPUs mit Unsloth Studio jetzt behoben! [Hier ausprobieren](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb). Dank vorkompilierter Binärdateien ist es außerdem 20x schneller!
* **Bessere Chat-Observability.** Unsloth zeigt jetzt `llama-server` Zeitmessungen und Nutzung, eine Kontextfenster-Nutzungsleiste und umfangreichere Hover-Karten für Quellen an.
* **Bessere UX insgesamt** - anklickbare Links, bessere LaTeX-Analyse, Tool-/Code-/Web-Tooltips für Standardkarten und vieles mehr!
* **LiteLLM -** Unsloth Studio und Unsloth waren **NICHT** von dem jüngsten LiteLLM-Kompromittierung betroffen. Nemo Data Designer nutzte LiteLLM nur bis `1.80`, nicht die betroffene `1.82.7` oder `1.82.8`, und hat es inzwischen vollständig entfernt.
* Wir haben jetzt einen neuen Installationsbefehl in einer Zeile, einfach ausführen:&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **Fixes:**

* **Windows-/Setup-Verbesserungen.** Stille Windows-Beendigungen, Startabstürze von Anaconda/conda-forge, fehlerhafte Windows-Installationen ohne NVIDIA und fehlende frühe CUDA-/Stale-Venv-Setup-Prüfungen behoben.
* **System-Prompts behoben.** Sie funktionieren wieder für Text- und Vision-Inferenz ohne GGUF.
* **Persistente System-Prompts und Presets.** Benutzerdefinierte System-Prompts und Chat-Presets bleiben jetzt nach dem Neuladen und Seitenwechseln erhalten.
* **GGUF-Export erweitert.** Vollständige Fine-Tunes, nicht nur LoRA/PEFT, können jetzt nach GGUF exportieren. Die Auflösung des Basismodells ist zuverlässiger, und nicht unterstützte Exportoptionen sind in der UI deaktiviert.
* **Korrekturen für Chat-Scrollen/Layout.** Probleme mit der Scrollposition während der Generierung, Layoutverschiebung im Thinking-Panel und Viewport-Sprüngen beim Einklappen von Reasoning-Panels behoben.
* **Intelligentere Erkennung von Portkonflikten.** Unsloth erkennt jetzt Loopback-Konflikte, kann wenn möglich den blockierenden Prozess identifizieren und gibt klarere Fallback-Port-Meldungen aus.
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## Neues Tool-Calling + Windows-Stabilität

* Claude Artifacts funktioniert, sodass HTML wie ein Snake-Spiel im Chat ausgeführt werden kann
* +30 % genauere Tool-Aufrufe, besonders für kleine Modelle + Timer für Tool-Aufrufe
* Tool- + Websuche-Ausgaben können gespeichert werden + automatisches Tool-Healing ein-/ausschalten
* Viele Bugfixes - Windows-CPU funktioniert, Mac nahtloser, schnellere und kleinere Installationen
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
