> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/studio/chat.md).

# Wie man Modelle mit Unsloth Studio ausführt

[Unsloth Studio](/docs/de/neu/studio.md) ermöglicht es dir, KI-Modelle 100 % offline auf deinem Computer auszuführen. Führe Modellformate wie GGUF und safetensors von Hugging Face oder aus deinen lokalen Dateien aus.

* **Funktioniert auf allen macOS-, CPU-, Windows-, Linux- und WSL-Setups! Keine GPU erforderlich**
* [**Selbstheilende Tool-Aufrufe**](#auto-healing-tool-calling)**,** erweitert [**Websuche**](#advanced-web-search), [**Codeausführung**](#code-execution)
* Verwende Unsloth als eine OpenAI-kompatible Inferenz- [**API-Endpunkt**](/docs/de/grundlagen/api.md) oder verbinde einen [Anbieter](/docs/de/integrationen/connections.md)
* Suche + Herunterladen + Ausführen + [Vergleichen](#model-arena) jedes Modell wie GGUFs, LoRA-Adapter, safetensors usw.
* [**Automatische Inferenzparameter**](#auto-parameter-tuning) Tuning (temp, top-p usw.) und bearbeite Chat-Vorlagen
* Lade Bilder, Audio, PDFs, Code, DOCX und mehr Dateitypen hoch, um damit zu chatten.

<figure><img src="/files/487af505f1af13e0e0f30a25c1a5287836f987f4" alt="" width="563"><figcaption></figcaption></figure>

### Verwendung von Unsloth Studio Chat

{% hint style="success" %}
Unsloth Studio Chat funktioniert automatisch auf **Multi-GPU-Setups** für die Inferenz.
{% endhint %}

{% columns %}
{% column %}

#### Codeausführung

Unsloth Studio ermöglicht es LLMs, Bash und Python auszuführen, nicht nur JavaScript. Außerdem werden Programme wie Claude Artifacts in einer Sandbox isoliert, sodass Modelle Code testen, Dateien generieren und Antworten mit echter Berechnung verifizieren können.

Dadurch werden Antworten von Modellen zuverlässiger und genauer.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/5363ebe10ce81d1a17df83ba37b3806349759fb5" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Automatische Selbstheilung bei Tool-Aufrufen

Unsloth Studio ermöglicht nicht nur [Tool-Aufrufe](#id-50-tool-calling-accuracy), sondern behebt auch fehlerhafte oder defekte Tool-Aufrufe automatisch um 50 %.

Das bedeutet, dass du immer Inferenz-Ausgaben erhältst **ohne** defekte Tool-Aufrufe.&#x20;

Z. B. suchte Qwen3.5-4B auf über 20 Websites und zitierte Quellen, wobei die Websuche innerhalb seines Denkvorgangs stattfand.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/72e444ba2ee0f824709d0f03d5c3ca108bd5936f" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Erweiterte Websuche

Unsloths unbegrenzte und sichere Websuche besucht tatsächlich Seiten direkt, um relevante Informationen und Daten zu sammeln, und scannt nicht nur Website-Zusammenfassungen. Dadurch entstehen viel genauere / detailliertere Informationen und mehr Kontext in den Ausgaben. Die Suche verwendet die private und sichere API von DuckDuckGo.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/487af505f1af13e0e0f30a25c1a5287836f987f4" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Verwende Unsloth als API-Endpunkt

Du kannst lokale LLMs jetzt über Tools wie [Claude Code](/docs/de/grundlagen/claude-code.md) und [Codex](/docs/de/grundlagen/codex.md) verwenden, indem du sie mit Unsloths [API-Endpunkt](#use-unsloth-as-an-api-endpoint). Das bedeutet, dass du Qwen- und Gemma-Modelle direkt in diesen Tools mit Unsloths Inferenz ausführen kannst, einschließlich Funktionen wie selbstheilenden Tool-Aufrufen, Websuche usw.
{% endcolumn %}

{% column %}

<figure><img src="/files/4d7f67e24fb64209883a9782fb1c8e4d7782a66f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Automatische Inferenz-Einstellungen

Inferenzparameter wie **Temperatur**, **top-p**, **top-k**, [**MTP**](/docs/de/modelle/qwen3.6.md#mtp-guide) werden für neue Modelle wie Qwen3.5 automatisch voreingestellt, damit du die besten Ergebnisse erhältst, ohne dir um Einstellungen Gedanken machen zu müssen. Du kannst Parameter auch manuell anpassen und den System-Prompt bearbeiten.

Eine Anpassung der Kontextlänge ist mit dem intelligenten Auto-Kontext von llama.cpp nicht mehr nötig, da nur der benötigte Kontext verwendet wird, ohne etwas Zusätzliches zu laden.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/8f6e95acb5edfc9f0107b5d6b5f134645bfe6b9e" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Provider verbinden

[Unsloth verbindet](/docs/de/integrationen/connections.md) mit OpenAI, Anthropic, Ollama, llama.cpp, vLLM und anderen.

Füge API-Schlüssel oder Modellserver-URLs hinzu und verwende dann externe Modelle in derselben Chat-Oberfläche wie lokale + Cloud-Modelle. Ausführen mit [Prompt-Caching](/docs/de/integrationen/connections.md#prompt-caching)sowie Tool-Aufrufen, Thinking und anbietereigenen Funktionen wie OpenAIs [Websuche](#web-search-and-thinking) und [Codeausführung](#code-execution).
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/8f6e95acb5edfc9f0107b5d6b5f134645bfe6b9e" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Modelle suchen und ausführen

Du kannst jedes Modell über Hugging Face suchen und herunterladen oder lokale Dateien verwenden.

Unsloth unterstützt eine breite Palette von Modelltypen, darunter **GGUF**, Vision-Language- und Text-zu-Sprache-Modelle. Führe die neuesten Modelle wie [Qwen3.5](/docs/de/modelle/qwen3.5.md) oder NVIDIA [Nemotron 3](/docs/de/modelle/nemotron-3.md).

Lade Bilder, Audio, PDFs, Code, DOCX und mehr Dateitypen hoch, um damit zu chatten.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/969f06e1a29ca4b61df474403b61dd220364a9ff" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### Chat-Arbeitsbereich

Gib Prompts ein, füge beliebige Dokumente, Bilder (webp, png), Code-Dateien, txt oder Audio als zusätzlichen Kontext an und sieh die Antworten des Modells in Echtzeit.

Thinking + Websuche ein- oder ausschalten.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/8ac16e79b6962b31826fa6e0299158207997923b" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

### **+50 % Genauigkeit bei Tool-Aufrufen**

Unsloth bietet mehrere einzigartige Funktionen zur Verbesserung von Tool-Aufrufen, darunter:

* Tool-Aufrufe über alle Modelle in Unsloth sind **30 % bis 80 % genauer**.
* Die Websuche ruft tatsächliche Webinhalte statt nur Zusammenfassungen ab.
* Die maximale Anzahl erlaubter Tool-Aufrufe beträgt **mehr als 25.**
* Tool-Aufrufe werden zuverlässiger beendet, wodurch Schleifen und wiederholte Aufrufe reduziert werden.
* Verbesserte Logik zur Reparatur und Deduplizierung von Tool-Aufrufen hilft, zu verhindern, dass XML in Ausgaben gelangt.

Sieh dir Testergebnisse mit `unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL)` mit aktiviertem Websuche, Codeausführung und Thinking an:

| Metrik                                    | Normale Tool-Aufrufe | Unsloth-Tool-Aufrufe |
| ----------------------------------------- | -------------------- | -------------------- |
| XML-Leaks in der Antwort                  | 10/10                | 0/10                 |
| Verwendete URL-Abrufe                     | 0                    | 4/10 Durchläufe      |
| Durchläufe mit korrekten Songnamen        | 0/10                 | 2/10                 |
| Durchschnittliche Anzahl an Tool-Aufrufen | 5.5                  | 3.8                  |
| Durchschnittliche Antwortzeit             | 12,3 s               | 9,8 s                |

### Modell-Arena

Mit Unsloth Chat kannst du zwei beliebige Modelle mit demselben Prompt nebeneinander vergleichen. Z. B. das Basismodell und den LoRA-Adapter. Zuerst wird die Inferenz für ein Modell geladen, dann für das zweite (parallele Inferenz wird gerade entwickelt).

<div data-with-frame="true"><figure><img src="/files/e4fb56f14a51ce7663839b4f83309d2c63e84b05" alt="" width="563"><figcaption></figcaption></figure></div>

{% columns %}
{% column %}
Nach dem Training kannst du das Basis- und das feinabgestimmte Modell nebeneinander mit demselben Prompt vergleichen, um zu sehen, was sich geändert hat und ob sich die Ergebnisse verbessert haben.

Dieser Workflow macht es einfach zu sehen, wie dein Fine-Tuning die Antworten des Modells verändert hat und ob es die Ergebnisse für deinen Anwendungsfall verbessert hat.
{% endcolumn %}

{% column %}

<div align="center" data-with-frame="true"><figure><img src="/files/57327435a296ac04b674537dd10bf9ddc85a6464" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
Unsloth Studio Chat funktioniert automatisch auf **Multi-GPU-Setups** für die Inferenz.
{% endhint %}

### Verwendung alter / vorhandener GGUF-Modelle

{% columns %}
{% column %}
**Update vom 1. April:** Du kannst jetzt einen vorhandenen Ordner auswählen, den Unsloth erkennen soll.

**Update vom 27. März:** Unsloth Studio erkennt jetzt **ältere / bereits vorhandene Modelle automatisch** heruntergeladen von Hugging Face, LM Studio usw.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/6d118e4bf4a5fc18305137e0f3c5f956d8aba5a0" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

**Manuelle Anweisungen:** Unsloth Studio erkennt Modelle, die in deinem Hugging-Face-Hub-Cache heruntergeladen wurden `(C:\Users{your_username}.cache\huggingface\hub)`. Wenn du GGUF-Modelle über LM Studio heruntergeladen hast, beachte, dass diese in `C:\Users\{your_username}.cache\lm-studio\models` ***ODER*** `C:\Users{your_username}\lm-studio\models` gespeichert werden und standardmäßig für llama.cpp nicht sichtbar sind - du musst diese .gguf-Dateien in dein Hugging-Face-Hub-Cache-Verzeichnis (oder einen anderen für llama.cpp zugänglichen Pfad) verschieben oder kopieren, damit Unsloth Studio sie laden kann.

Nachdem du ein Modell oder einen Adapter in Unsloth feinabgestimmt hast, kannst du ihn nach GGUF exportieren und die lokale Inferenz direkt in Unsloth Chat mit **llama.cpp** ausführen. Unsloth Studio wird von llama.cpp und Hugging Face unterstützt.

### Dateien als Kontext hinzufügen

Unsloth Chat unterstützt multimodale Eingaben direkt im Gespräch. Du kannst Dokumente, Bilder oder Audio als zusätzlichen Kontext für einen Prompt anhängen.

<div data-with-frame="true"><figure><img src="/files/1484e2a651ae5a68bc7d37af9c0d7bc2b62f6d7a" alt="" width="563"><figcaption></figcaption></figure></div>

Dadurch lässt sich leicht testen, wie ein Modell mit realen Eingaben wie PDFs, Screenshots oder Referenzmaterial umgeht. Dateien werden lokal verarbeitet und als Kontext für das Modell einbezogen.

### **Modelldateien löschen**

Du kannst alte Modelldateien entweder über das Papierkorb-Symbol in der Modellsuche löschen oder den entsprechenden zwischengespeicherten Modellordner aus dem Standardverzeichnis des Hugging-Face-Caches entfernen. Standardmäßig verwendet Hugging Face `~/.cache/huggingface/hub/` auf macOS/Linux/WSL und `C:\Users\<username>\.cache\huggingface\hub\` unter Windows.

* **macOS, Linux, WSL:** `~/.cache/huggingface/hub/`
* **Windows:** `%USERPROFILE%\.cache\huggingface\hub\`

Wenn `HF_HUB_CACHE` oder `HF_HOME` gesetzt ist, verwende stattdessen diesen Speicherort. Unter Linux und WSL, `XDG_CACHE_HOME` kann auch das Standard-Cache-Root ändern.

### **Unsloth erkennt oder verwendet meine GPU nicht**

Wenn das Modell speziell für Docker nicht deine GPU verwendet, versuche Folgendes:

Das neueste Image manuell ziehen:

```bash
 docker pull unsloth/unsloth:latest
```

* Den Container mit GPU-Zugriff starten:
  * `docker run`: `--gpus all`
  * Docker Compose: `capabilities: [gpu]`
* Unter Linux stelle sicher, dass das NVIDIA Container Toolkit installiert ist.
* Unter Windows:
  * Prüfe, dass `nvcc --version` mit der CUDA-Version übereinstimmt, die in `nvidia-smi`
  * angezeigt wird [Folge: https://docs.docker.com/desktop/features/gpu/](https://docs.docker.com/desktop/features/gpu/)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/studio/chat.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
