> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/grundlagen/api.md).

# Wie man Unsloth als API-Endpunkt verwendet

Du kannst ausführen **lokale LLMs** mit Tools wie [Claude Code](/docs/de/grundlagen/claude-code.md) und [Codex](/docs/de/grundlagen/codex.md) indem du diese Tools mit Unsloths **OpenAI-kompatiblem API-Endpunkt**. Dadurch kannst du Modelle wie [Qwen](/docs/de/modelle/qwen3.6.md) und [Gemma](/docs/de/modelle/gemma-4.md) lokal für agentisches Programmieren ausführen. Unsloth bietet außerdem nützliche Funktionen wie selbstheilende **Tool-Aufrufe**, **Code-Ausführung**, und **Websuche**.

Unsloth macht es einfach, einen schnellen API-Inferenz-Endpunkt bereitzustellen, der Folgendes bietet:

* [**Selbstheilende Tool-Aufrufe**](/docs/de/neu/studio/chat.md#auto-healing-tool-calling), wodurch fehlerhafte oder fehlerhaft formatierte Tool-Aufrufe um 50 % reduziert werden
* [**Code-Ausführung**](/docs/de/neu/studio/chat.md#code-execution) Unterstützung, die Bash- und Python-Ausführung für genauere Code-Ausgaben ermöglicht.
* **Erweitert** [**Websuche**](/docs/de/neu/studio/chat.md#advanced-web-search) die Webseiten besucht und tatsächlich liest, um ausführliche Informationen zu sammeln.
* [**Automatische Inferenz-Einstellungen** Einstellungen](/docs/de/neu/studio/chat.md#auto-parameter-tuning) für GGUF-Modelle (temp, top-k usw.)

{% columns %}
{% column %}
In Unsloth geladene Modelle (einschließlich GGUFs) werden als ein **authentifizierte API** über `llama-server`. Aus Sicherheitsgründen wird ein langer API-Schlüssel generiert, so wie OpenAI einen bereitstellt.

Deine **lokalen Modelle** können dann direkt in deinem bevorzugten KI-Agenten, SDK oder Chat-Client verwendet werden. Unsloth spricht zwei Dialekte auf demselben Port. Beide unterstützen Streaming, Tool-Aufrufe (OpenAI `Tools` / Anthropic `Tools`), sowie Vision-Eingaben:
{% endcolumn %}

{% column %}

<figure><img src="/files/1ff12c8bf253d6a957722968ef137783f8bb8b55" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Egal, ob dein Modell über Unsloths Inferenz oder deinen eigenen entfernten OpenAI-kompatiblen Endpunkt läuft, du kannst ihm Zugriff auf Unsloths vollständige Tool-Suite geben, einschließlich Websuche, Code-Ausführung, Deep Research und mehr.

* **Anthropic-kompatibel `/v1/messages`**  für Claude Code, OpenClaw, das Anthropic SDK und jeden Client, der die Messages API erwartet.
* **OpenAI-kompatibel `/v1/chat/completions`** und **`/v1/responses`** für das OpenAI SDK, OpenCode, Cursor, Continue, Cline, Open WebUI, SillyTavern und jedes OpenAI-kompatible Tool.

### ⚡ Schnellstart

{% stepper %}
{% step %}

#### Unsloth herunterladen

Der einfachste Einstieg ist die Installation der [Unsloth Desktop](/docs/de/desktop.md) -App. Sie unterstützt [macOS](/docs/de/erste-schritte/install/mac.md), Linux, [Windows](/docs/de/erste-schritte/install/windows-installation.md), [NVIDIA](/docs/de/erste-schritte/install/pip-install.md), [AMD](/docs/de/erste-schritte/install/amd.md), Intel- und CPU-Setups.

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du die manuelle Installation bevorzugst:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Installieren

1. Öffne den Unsloth-Installer (`.dmg`, `.exe` Dateien)
2. Ziehe Unsloth auf dem Mac in den Ordner „Applications“ oder schließe das Setup unter Windows ab.
3. Starte die App und warte, bis die Installation abgeschlossen ist
   {% endstep %}

{% step %}

#### Wähle ein Modell

Öffne oben das Dropdown „Select model“ oder den Tab „Model hub“, wähle ein Modell und eine Quantisierung, die zu deinem Gerät passt, und lade es dann herunter. Sobald es fertig ist, kannst du mit dem Chatten beginnen – keine Einrichtung erforderlich.

<figure><img src="/files/c2bbae8035ca6e09125d7a93cb309bb6599d7402" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Unsloth ist jetzt bereit

Um mit dem Chatten zu beginnen, tippe eine Nachricht ein und drücke Enter.

* **Erstelle einen API-Schlüssel.** Klicke auf dein **Unsloth** Avatar unten links → **Einstellungen** → **API** → gib einen Schlüsselnamen ein → **Erstellen**. Kopiere den `sk-unsloth-…` angezeigten Wert. Unsloth zeigt ihn nur einmal an.
* **Richte deinen Client auf Unsloth aus.** Verwende `http://localhost:PORT` als Basis-URL und deinen `sk-unsloth-…` Schlüssel für die Authentifizierung. Springe unten zum Rezept für dein Tool.

<figure><img src="/files/7dd332eeb14ab9597f3e5b90e819b2fc153fd3ca" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### 🔑 Erstellen eines API-Schlüssels

1. Öffne die Seitenleiste und klicke auf deinen **Unsloth** Avatar unten links.
2. Gehe zu **Einstellungen** → **API** (Globus :globe\_with\_meridians: Symbol).
3. Gib einen aussagekräftigen Namen ein (z. B. `claude-code-macbook`). Lege ein Ablaufdatum fest (optional)
4. Klicke auf **Erstellen**.
5. **Kopiere den Schlüssel.** Unsloth speichert nur einen Hash und du kannst ihn nicht erneut anzeigen.

<div data-with-frame="true"><figure><img src="/files/c9b0bdb6f3a36aaafd6d21f90153bfa367054e9a" alt="" width="563"><figcaption></figcaption></figure></div>

Alle Schlüssel beginnen mit dem `sk-unsloth-` Präfix. Du kannst einen Schlüssel jederzeit auf derselben Seite widerrufen. Anfragen mit einem widerrufenen Schlüssel schlagen mit `401 Unauthorized`.

{% hint style="warning" %}
Behandle deinen API-Schlüssel wie ein Passwort. Jeder, der den Schlüssel und Netzwerkzugriff auf deine Unsloth-Instanz hat, kann Anfragen an dein geladenes Modell senden.
{% endhint %}

### ⏳ Modell wird geladen

{% stepper %}
{% step %}

#### Modell auswählen

Lade vor der Verwendung der API ein Modell aus dem **Select model** Dropdown oben links auf der Chat-Seite.

<figure><img src="/files/35a6966ece42497bdc299b98050269c7636c7c98" alt=""><figcaption></figcaption></figure>

In diesem Leitfaden verwenden wir:

`unsloth/gemma-4-26B-A4B-it-GGUF` mit der empfohlenen `UD-Q4_K_XL` Quantisierung.
{% endstep %}

{% step %}

#### Modell testen

Sende vor der Verwendung des Clients eine kurze Nachricht:

<div data-with-frame="true"><figure><img src="/files/245fe14776c68639a801acfab0d58e75d6cf1ce4" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
Das bestätigt, dass das Modell korrekt geladen wurde und bereit zum Antworten ist.
{% endhint %}
{% endstep %}

{% step %}

#### **Unsloth-API-Schlüssel**

Öffne in Unsloth **Einstellungen → API** um deinen API-Schlüssel anzuzeigen oder zu erstellen.

<figure><img src="/files/96dbb4b6e52ce8bc33d050cacf1e90d03b66c1ae" alt=""><figcaption></figcaption></figure>

Behandle deinen API-Schlüssel wie ein Passwort und vermeide es, ihn in Screenshots oder Repositories offenzulegen.
{% endstep %}
{% endstepper %}

### <i class="fa-terminal">:terminal:</i> Unsloth-Run-Befehl

1. **Installiere oder aktualisiere Unsloth Studio.** Frühere Versionen stellen die externe API nicht bereit. Siehe Installation.
2. **Lade ein GGUF-Modell.** Lade ein GGUF-Modell mit dem Run-Befehl. Dadurch wird die UI auch auf dem Standard-Port geladen. Die Endpunkt-URL und der API-Schlüssel werden in der Konsole ausgegeben und können dann sofort mit deinem bevorzugten Client verwendet werden.

   ```bash
   unsloth run --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
       --temp 1.0 \
       --top-p 0.95 \
       --top-k 20 \
       --min-p 0.0 \
       --chat-template-kwargs '{"reasoning_effort":"medium"}'
   ```

Passe die Einstellungen bei Bedarf an.

#### Ein Modell von der CLI laden

Du kannst ein Modell laden und automatisch einen API-Schlüssel für dich erstellen lassen mit dem `unsloth` CLI-Tool. Wenn das Modell fertig geladen ist, werden die Endpunkt-URL und der API-Schlüssel in deiner Konsole ausgegeben. Kopiere sie in deinen bevorzugten Client und los geht's.

#### Bevor du beginnst

Stelle sicher, dass du eine aktuelle Version von Unsloth Studio verwendest, da frühere Versionen die externe API nicht bereitstellen. Siehe [Installation](/docs/de/neu/studio/install.md).

#### Der schnelle Weg

Öffne ein Terminal und lade ein GGUF-Modell:

```bash
unsloth run --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL
```

Dies startet den Server auf dem Standard-Port, lädt die UI und gibt deine Endpunkt-URL sowie deinen API-Schlüssel aus.

#### Wie der Modellname funktioniert

Du kannst auf ein Modell auf verschiedene Arten verweisen. Wähle die Methode, die dir am einfachsten erscheint:

```bash
# Kombiniert: Repo und Quantisierungsvariante in einem String (empfohlen — am kürzesten)
unsloth run --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL

# Getrennt: Repo und Variante als zwei Flags (der ältere Stil, funktioniert weiterhin)
unsloth run --model unsloth/gemma-4-26B-A4B-it-GGUF --gguf-variant UD-Q4_K_XL

# Verwendung von -hf / --hf-repo (entspricht der Schreibweise von llama.cpp, praktisch, wenn du von dort kommst)
unsloth run -hf unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL
```

### Den Run anpassen (optional)

Für einen einfachen Ladevorgang brauchst du nichts davon, aber `unsloth run` unterstützt viele Laufzeit-Flags von llama-server zur Anpassung von Leistung, Speichernutzung, Kontextlänge, Generierungsverhalten, Netzwerk und Tool-Zugriff.

Zusätzliche Flags werden direkt an den zugrunde liegenden Inferenzserver weitergeleitet, und deine Werte überschreiben die Standardwerte von Unsloth.

#### Generierungsverhalten anpassen

Sampling-Einstellungen steuern, wie kreativ, fokussiert oder deterministisch sich das Modell bei der Generierung verhält.

```bash
# Weniger Zufälligkeit und bessere Reproduzierbarkeit
unsloth run \
  --model unsloth/Qwen3-1.7B-GGUF \
  --temp 0.6 \
  --seed 42
```

Niedrigere Temperaturwerte führen normalerweise zu stabileren Ausgaben, während top-p-, top-k-, min-p- und Repeat-Penalty-Einstellungen die Token-Auswahl und Wiederholung weiter steuern.

```bash
# Token-Auswahl und Wiederholungsverhalten anpassen
unsloth run \
  --model unsloth/Qwen3-1.7B-GGUF \
  --top-p 0.95 \
  --top-k 20 \
  --min-p 0.05 \
  --repeat-penalty 1.1
```

#### Kontextlänge und CPU-Threads erhöhen

Nützlich, wenn du mit großen Projekten, langen Chats oder Agent-Workflows arbeitest, die mehr Speicher benötigen.

```bash
# Verwende ein größeres Kontextfenster und mehr CPU-Threads
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  -c 131072 \
  --threads 32
```

#### API in deinem lokalen Netzwerk bereitstellen

Standardmäßig läuft Unsloth nur lokal auf deinem Rechner. Du kannst die API anderen Geräten in deinem Netzwerk zugänglich machen, indem du bindest an `0.0.0.0`.

```bash
# LAN-Geräten die Verbindung erlauben
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  -H 0.0.0.0 \
  -p 8888
```

#### Reasoning-Verhalten steuern

Einige reasoning-fähige Modelle unterstützen zusätzliche Flags zur Steuerung von Denken und Reasoning-Verhalten.

```bash
# Reasoning-/Denkausgabe deaktivieren
unsloth run \
  --model unsloth/Qwen3-1.7B-GGUF \
  --reasoning off
```

```bash
# Reasoning-Modus aktivieren
unsloth run \
  --model unsloth/Qwen3-1.7B-GGUF \
  --reasoning on
```

Die Unterstützung für Reasoning hängt vom Modell und den Fähigkeiten des Backends ab.

#### Serverseitige Tools aktivieren oder deaktivieren

Steuere, ob Tools wie Websuche und Code-Ausführung vom Inferenzserver bereitgestellt werden.

```bash
# Tools explizit aktivieren
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  --enable-tools
```

```bash
# Tools explizit deaktivieren
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  --disable-tools
```

Unsloth unterstützt die meisten Laufzeit-Flags von llama-server, einschließlich Kontextgröße, GPU-Layern, Threading, Sampling, Networking und Tool-Konfiguration.

Siehe die [llama-server](https://github.com/ggml-org/llama.cpp/tree/master/tools/server) Dokumentation für die vollständige Liste unterstützter Laufzeit-Flags.

#### **Richtlinie für serverseitige Tools**

`unsloth run` legt fest, ob serverseitige Tools (Websuche, Code-Ausführung usw.) vom Inferenzserver bereitgestellt werden. Die Standardwerte basieren auf der Bind-Adresse:

* **`127.0.0.1` (localhost)** — Tools **ein** standardmäßig. Nur dein Rechner kann den Server erreichen.
* **`0.0.0.0` oder jede andere Nicht-Loopback-Adresse** — Tools **aus** standardmäßig. Ein geleakter API-Schlüssel auf einem netzwerkexponierten Server bedeutet beliebige Codeausführung auf dem Host.

**Flags:**

* `--enable-tools` / `--disable-tools` — erzwingt Ein oder Aus. Bei Ein `0.0.0.0`, `--enable-tools` wird eine Sicherheitsabfrage y/N angezeigt.
* `--yes` / `-y` — überspringt die Abfrage (für Automatisierung).

Die festgelegte Richtlinie ist eine harte Überschreibung auf Prozessebene — einzelne Anfragen können sie nicht umgehen über `enable_tools=true` im Request-Body.

<div data-with-frame="true"><figure><img src="/files/64c4a3226214c0d7de03f170ef9efa901a01176b" alt=""><figcaption></figcaption></figure></div>

### 🌐 **Endpunkte**

Unsloth stellt diese Endpunkte auf dem Port bereit, auf dem es gestartet wurde (typischerweise `http://localhost:8000` oder `http://localhost:8888`):

| Endpunkt                    | Kompatibel mit              | Verwende es von                                                      |
| --------------------------- | --------------------------- | -------------------------------------------------------------------- |
| `POST /v1/messages`         | Anthropic Messages API      | Claude Code, Anthropic SDK, OpenClaw, alles, was Anthropic spricht   |
| `POST /v1/chat/completions` | OpenAI Chat Completions API | OpenAI SDK, opencode, Cursor, Continue, Cline, Open WebUI, curl usw. |
| `GET /v1/models`            | OpenAI-Modellliste          | Liste die derzeit in Unsloth geladenen Modelle                       |

Authentifiziere dich mit einem `Authorization: Bearer sk-unsloth-…` Header in jeder Anfrage.

{% hint style="info" %}
Du musst für die beiden Formate keine unterschiedlichen Server ausführen. Unsloth verarbeitet beide auf demselben Port.
{% endhint %}

### 🖇️ Deinen Client verbinden

Unsloth ermöglicht dir, lokale LLMs über die meisten Frameworks zu nutzen, einschließlich [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [OpenClaw](/docs/de/integrationen/openclaw.md), [OpenCode](/docs/de/integrationen/opencode.md) und mehr. Klicke unten auf die jeweiligen Tools für eine Anleitung:

{% columns %}
{% column width="50%" %}
{% content-ref url="/pages/d12c953ceacbd6c3e44f3aa911056928e0488f5b" %}
[Claude Code](/docs/de/grundlagen/claude-code.md)
{% endcontent-ref %}

{% content-ref url="/pages/1813c928d883d651dff92062bc0da6e96d06e50a" %}
[OpenAI Codex](/docs/de/grundlagen/codex.md)
{% endcontent-ref %}

{% content-ref url="/pages/cede767fc3b9f7535c2c3cc36963872488a3bd1d" %}
[Curl & HTTP](/docs/de/integrationen/verbinde-curl-and-http-mit-unsloth.md)
{% endcontent-ref %}
{% endcolumn %}

{% column width="50%" %}
{% content-ref url="/pages/4ad33e7ce59bb7203a1fddd7e6e0102f70c191db" %}
[OpenClaw](/docs/de/integrationen/openclaw.md)
{% endcontent-ref %}

{% content-ref url="/pages/69edb30cadb1e5ecada5bd2a700b63f49e94955f" %}
[OpenCode](/docs/de/integrationen/opencode.md)
{% endcontent-ref %}

{% content-ref url="/pages/67298920320a528a941c4123bc768cc0a79e7332" %}
[Python SDK](/docs/de/integrationen/verbinde-python-sdk-mit-unsloth.md)
{% endcontent-ref %}
{% endcolumn %}
{% endcolumns %}

Um diesen Endpunkt von einem anderen Rechner aus zu erreichen, starte mit `unsloth studio --secure`. Unsloth bleibt an localhost gebunden und veröffentlicht sich unter einer kostenlosen Cloudflare-HTTPS-URL; verwende diese URL anstelle von `http://127.0.0.1:8888` als Basis-URL deines Clients. Beachte, dass Server-Sent Events einen Cloudflare-Quick-Tunnel nicht überstehen, daher setze `stream: false` beim Aufruf darüber.

### 🧰 Tool-Aufrufe

Beide Endpunkte unterstützen Funktions-/Tool-Aufrufe in ihrem nativen Format sowie eine Unsloth-spezifische Kurzform für die integrierten Tools von Unsloth.

**Tools im OpenAI-Stil:** sende `Tools` und `tool_choice` an `/v1/chat/completions` genau wie bei OpenAI. Claude Code (über `/v1/messages`), opencode, Cursor, Continue und Cline funktionieren sofort.

**Tools im Anthropic-Stil:** sende `Tools` (mit `input_schema`) und `tool_choice` an `/v1/messages` genau wie bei Claude.

Unsloth-Server-seitige Tools: Unsloth kann Python, Websuche und Bash ausführen *serverseitig* und die Ergebnisse als `tool_result` Events zurückstreamen. Aktiviere dies, indem du diese zusätzlichen Felder zu einem der beiden Endpunkte hinzufügst:

```json
{
  "messages": [{"role": "user", "content": "Was ist 123 * 456? Verwende Python."}],
  "stream": true,
  "enable_tools": true,
  "enabled_tools": ["python", "web_search","terminal"],
  "session_id": "my-session"
}
```

Das Modell sieht die Ausgabe jedes Tools in seinem nächsten Durchlauf. Für eine tiefere Abdeckung (Schemas, Streaming-Events, Verkettung) siehe .

{% hint style="info" %}
Wenn du den Anthropic- `/v1/messages` Endpunkt verwendest, `tool_choice` passt sauber zusammen: Anthropic `auto` → OpenAI `auto`, Anthropic `beliebig` → OpenAI `erforderlich`, Anthropic `{type: "tool", name: "x"}` → OpenAI `{type: "function", function: {name: "x"}}`, Anthropic `keins` → OpenAI `keins`.
{% endhint %}

### 📈 API-Überwachung

Jeder Aufruf über diesen Endpunkt wird live in Studio an zwei Stellen aufgelistet:

Die Seitenleiste der API-Überwachung öffnet sich automatisch in der Ecke, sobald API-Schlüssel-Traffic eingeht. Sie fasst das aktive Modell, laufende Anfragen, Fehler und die durchschnittliche Latenz zusammen.

<div data-with-frame="true"><figure><img src="/files/bfa36fe183a75c8139cb304236cee86ad2a37b39" alt=""><figcaption></figcaption></figure></div>

Drücke „Expand to full monitor“ oder gehe zu Einstellungen>API Monitor, um zur vollständigen **API** Seite zu gelangen, auf der Modellladen, Prompts, Antworten, Token-Zahlen, Time-to-first-Token, Durchsatz und Fehlermeldungen im Monitor angezeigt werden.

<div data-with-frame="true"><figure><img src="/files/3aadaa4e5a5f28af53f9b8824cf4d8e8979cab37" alt="" width="563"><figcaption></figcaption></figure></div>

### ❔ Fehlerbehebung

**`401 Unauthorized`** : entweder der `Authorization` Header fehlt oder der Schlüssel ist falsch. Schlüssel müssen als `Authorization: Bearer sk-unsloth-…`. Wenn du den Schlüssel verloren hast, erstelle einen neuen über **Einstellungen → API.** Unsloth zeigt alte Schlüssel nach der Erstellung nicht an.

**`Verbindung zum Modellserver verloren`** : Unsloth konnte den zugrunde liegenden llama.cpp-Server nicht erreichen. Normalerweise wurde das Modell fertig geladen, ist dann aber abgestürzt, oder der Modell-Tab wurde in Unsloth geschlossen. Laden Sie das Modell erneut von **Neuer Chat** und versuchen Sie es erneut.

**Claude Code zeigt das Standard-Anthropic-Modell an, nicht mein lokales** :  überprüfen Sie, ob alle drei Umgebungsvariablen in der **gleichen** Shell exportiert sind, in der Sie `claude`:

```bash
echo $ANTHROPIC_BASE_URL
echo $ANTHROPIC_AUTH_TOKEN
echo $ANTHROPIC_MODEL
```

Dann führen Sie `/model` in Claude Code aus, um dies zu bestätigen. Unter Windows PowerShell verwenden Sie `$env:ANTHROPIC_BASE_URL` usw.

**`stream: true` gibt ein einzelnes JSON-Objekt statt SSE zurück** :  stellen Sie sicher, dass Sie den richtigen Pfad treffen (`/v1/messages` oder `/v1/chat/completions`) und dass Ihr HTTP-Client die Antwort tatsächlich als Stream verarbeitet und nicht puffert.

**Ich kann den Namen des Modells nicht finden, das ich zu opencode (oder OpenClaw / einem anderen Client) hinzufügen soll** : fragen Sie direkt bei Unsloth nach. `GET /v1/models` liefert die exakte Modell-ID, die Sie in das Feld "Model ID" des Clients eintragen müssen:

```bash
curl http://localhost:8888/v1/models \\
  -H "Authorization: Bearer sk-unsloth-xxxxxxxxxxxx"
```

Sie erhalten eine JSON-Nutzlast in der Form `{"data": [{"id": "gemma-4-26B-A4B-it-GGUF", ...}]}`. Kopiere den `id` Wert, das ist die Zeichenkette, die opencodes **Modell-ID** Feld (linke Spalte) und OpenClaws `models[].id` erwarten. Der Anzeigename rechts ist alles, was die Nutzer sehen sollen.

**Tool-Aufrufe werden nicht ausgeführt** :  Das Modell muss Tool-Calling für clientseitige Tools unterstützen (`Tools` / `tool_choice`). Für die integrierten Tools von Unsloth denken Sie daran, zu setzen `enable_tools: true` **und** listen Sie die gewünschten in `enabled_tools` (z. B. `["python", "web_search"]`).

* **Mein Client meldet einen Verbindungsfehler.** Öffnen Sie den API-Monitor. Wenn es für den Aufruf keine Zeile gibt, hat er Unsloth nie erreicht; vergleichen Sie die Base-URL Ihres Clients mit der **Base-URL** oben auf dieser Seite angezeigt wird.
* **Die Antwort wird abgeschnitten.** Prüfen Sie **Verwendeter Kontext** für die Anfrage im API-Monitor. Nahe 100 % oder ein Stop-Grund von `length`, bedeutet, dass das Kontextfenster voll war, statt dass das Modell fehlgeschlagen ist.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/grundlagen/api.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
