For the complete documentation index, see llms.txt. This page is also available as Markdown.

Wie man Unsloth als API-Endpunkt verwendet

Du kannst lokale LLMs mit Tools wie Claude Code und Codex indem du diese Tools mit Unsloths OpenAI-kompatiblen API-Endpunkt. So kannst du Modelle wie Qwen und Gemma lokal für agentisches Coding ausführen. Unsloth hat außerdem nützliche Funktionen wie selbstheilendes Tool-Calling, Code-Ausführungund Websuche.

Unsloth macht es einfach, einen schnellen API-Inferenz-Endpunkt bereitzustellen, der Folgendes bietet:

In Unsloth geladene Modelle (einschließlich GGUFs) werden als authentifizierte API über llama-server. Aus Sicherheitsgründen wird ein langer API-Schlüssel generiert, so wie OpenAI einen bereitstellt.

Deine lokalen Modelle können dann direkt in deinem bevorzugten KI-Agenten, SDK oder Chat-Client verwendet werden. Unsloth spricht zwei Dialekte auf demselben Port. Beide unterstützen Streaming, Tool-Calling (OpenAI Tools / Anthropic Tools), sowie Vision-Eingaben:

Egal, ob dein Modell über Unsloths Inferenz oder deinen eigenen entfernten OpenAI-kompatiblen Endpunkt läuft, du kannst ihm Zugriff auf Unsloths vollständige Werkzeug-Suite geben, einschließlich Websuche, Code-Ausführung, Deep Research und mehr.

  • Anthropic-kompatibel /v1/messages für Claude Code, OpenClaw, das Anthropic SDK und jeden Client, der die Messages API erwartet.

  • OpenAI-kompatibel /v1/chat/completions und /v1/responses für das OpenAI SDK, OpenCode, Cursor, Continue, Cline, Open WebUI, SillyTavern und jedes OpenAI-kompatible Tool.

⚡ Schnellstart

1

Unsloth herunterladen

Der einfachste Einstieg ist die Installation der Unsloth Desktop App. Sie unterstützt macOS, Linux, Windows, NVIDIA, AMD, Intel- und CPU-Konfigurationen.

Unsloth herunterladen

Oder, wenn du die manuelle Installation bevorzugst:

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell:

irm https://unsloth.ai/install.ps1 | iex
2

Installieren

  1. Öffne den Unsloth-Installer (.dmg, .exe Dateien)

  2. Ziehe Unsloth auf Anwendungen auf dem Mac oder schließe das Setup für Windows ab.

  3. Starte die App und warte, bis die Installation abgeschlossen ist

3

Wähle ein Modell

Öffne oben das Dropdown-Menü 'Modell auswählen' oder den Tab 'Model hub', wähle ein Modell und eine Quantisierung, die zu deinem Gerät passt, und lade es dann herunter. Sobald der Download abgeschlossen ist, kannst du mit dem Chatten beginnen – keine Einrichtung erforderlich.

4

Unsloth ist jetzt bereit

Um mit dem Chatten zu beginnen, gib eine Nachricht ein und drücke Enter.

  • Erstelle einen API-Schlüssel. Klicke auf dein Unsloth Avatar unten links → EinstellungenAPI → gib einen Schlüsselnamen ein → Erstellen. Kopiere den sk-unsloth-… angezeigten Wert. Unsloth zeigt ihn nur einmal an.

  • Richte deinen Client auf Unsloth aus. Verwende http://localhost:PORT als Basis-URL und deinen sk-unsloth-… Schlüssel zur Authentifizierung. Springe unten zum Rezept für dein Tool.

🔑 Einen API-Schlüssel erstellen

  1. Öffne die Seitenleiste und klicke auf deinen Unsloth Avatar unten links.

  2. Gehe zu EinstellungenAPI (Globus 🌐 -Symbol).

  3. Gib einen aussagekräftigen Namen ein (z. B. claude-code-macbook). Lege ein Ablaufdatum fest (optional)

  4. Klicke auf Erstellen.

  5. Kopiere den Schlüssel. Unsloth speichert nur einen Hash, und du kannst ihn nicht erneut anzeigen.

Alle Schlüssel beginnen mit dem sk-unsloth- Präfix. Du kannst einen Schlüssel jederzeit auf derselben Seite widerrufen. Anfragen mit einem widerrufenen Schlüssel schlagen mit 401 Unauthorized.

⏳ Modell wird geladen

1

Modell auswählen

Bevor du die API verwendest, lade ein Modell über das Modell auswählen Dropdown-Menü in der oberen linken Ecke der Chat-Seite.

In diesem Leitfaden verwenden wir:

unsloth/gemma-4-26B-A4B-it-GGUF mit der empfohlenen UD-Q4_K_XL Quantisierung.

2

Modell testen

Bevor du den Client verwendest, sende eine kurze Nachricht:

Dies bestätigt, dass das Modell korrekt geladen wurde und bereit zum Antworten ist.

3

Unsloth-API-Schlüssel

Öffne in Unsloth Settings → API um deinen API-Schlüssel anzuzeigen oder zu erstellen.

Behandle deinen API-Schlüssel wie ein Passwort und vermeide es, ihn in Screenshots oder Repositories offenzulegen.

Unsloth-Ausführungsbefehl

  1. Installiere oder aktualisiere Unsloth Studio. Frühere Versionen stellen die externe API nicht bereit. Siehe Installation.

  2. Lade ein GGUF-Modell. Lade ein GGUF-Modell mit dem Run-Befehl. Dadurch wird auch die Benutzeroberfläche auf dem Standardport geladen. Die Endpunkt-URL und der API-Schlüssel werden in der Konsole ausgegeben und können direkt mit deinem bevorzugten Client verwendet werden.

Passe die Einstellungen nach Bedarf an.

Ein Modell über die CLI laden

Du kannst ein Modell laden und dir automatisch einen API-Schlüssel erstellen lassen, indem du das unsloth CLI-Tool verwendest. Wenn das Modell fertig geladen ist, werden die Endpunkt-URL und der API-Schlüssel in deiner Konsole ausgegeben. Kopiere sie in deinen bevorzugten Client, und schon kann es losgehen.

Bevor du beginnst

Stelle sicher, dass du eine aktuelle Version von Unsloth Studio verwendest, da frühere Versionen die externe API nicht bereitstellen. Siehe Installation.

Der schnelle Weg

Öffne ein Terminal und lade ein GGUF-Modell:

Dadurch startet der Server auf dem Standardport, die Benutzeroberfläche wird geladen und deine Endpunkt-URL sowie dein API-Schlüssel werden ausgegeben.

Wie der Modellname funktioniert

Du kannst auf ein Modell auf verschiedene Arten verweisen. Wähle die, die dir am einfachsten erscheint:

Den Lauf anpassen (optional)

Für einen einfachen Ladevorgang brauchst du nichts davon, aber unsloth run unterstützt viele llama-server-Laufzeitflags zur Anpassung von Leistung, Speichernutzung, Kontextlänge, Generierungsverhalten, Netzwerk und Tool-Zugriff.

Zusätzliche Flags werden direkt an den zugrunde liegenden Inferenzserver weitergeleitet, und deine Werte überschreiben die Standardwerte von Unsloth. Wenn keine Einstellungs-/Sampling-Flags gesetzt sind, wählt Unsloth automatisch die besten/empfohlenen Einstellungen für das Modell, einschließlich Kontextlänge, Temperatur usw.

Steuere das Reasoning-Verhalten

Einige Modelle mit Reasoning-Fähigkeit unterstützen zusätzliche Flags zur Steuerung des Denk- und Reasoning-Verhaltens.

Reasoning-Aufwand und Flags hängen davon ab, was das Modell unterstützt.

Generierungsverhalten anpassen

Sampling-Einstellungen steuern, wie kreativ, fokussiert oder deterministisch sich das Modell bei der Generierung verhält.

Niedrigere Temperaturwerte erzeugen normalerweise stabilere Ausgaben, während top-p-, top-k-, min-p- und Repeat-Penalty-Einstellungen die Tokenauswahl und Wiederholung weiter steuern.

Kontextlänge und CPU-Threads erhöhen

Nützlich, wenn du mit großen Projekten, langen Chats oder Agent-Workflows arbeitest, die mehr Speicher benötigen.

Die API im lokalen Netzwerk freigeben

Standardmäßig läuft Unsloth nur lokal auf deinem Rechner. Du kannst die API anderen Geräten in deinem Netzwerk zugänglich machen, indem du an 0.0.0.0.

Serverseitige Tools aktivieren oder deaktivieren

Steuere, ob Tools wie Websuche und Code-Ausführung vom Inferenzserver bereitgestellt werden.

Unsloth unterstützt die meisten llama-server-Laufzeitflags, einschließlich Kontextgröße, GPU-Layer, Threading, Sampling, Netzwerk und Tool-Konfiguration.

Siehe die llama-server Dokumentation für die vollständige Liste der unterstützten Laufzeitflags.

Richtlinie für serverseitige Tools

unsloth run steuert, ob serverseitige Tools (Websuche, Code-Ausführung usw.) vom Inferenzserver bereitgestellt werden. Die Standardwerte basieren auf der Bind-Adresse:

  • 127.0.0.1 (localhost) — Tools ein standardmäßig. Nur dein Rechner kann den Server erreichen.

  • 0.0.0.0 oder jede Nicht-Loopback-Adresse — Tools aus standardmäßig. Ein geleakter API-Schlüssel auf einem im Netzwerk exponierten Server bedeutet beliebige Code-Ausführung auf dem Host.

Flags:

  • --enable-tools / --disable-tools — erzwingt ein oder aus. Ein 0.0.0.0, --enable-tools zeigt eine Sicherheitsabfrage mit y/N an.

  • --yes / -y — überspringt die Abfrage (für Automatisierung).

Die festgelegte Richtlinie ist ein harter Override auf Prozessebene — einzelne Anfragen können sie nicht umgehen über enable_tools=true im Request-Body.

🌐 Endpunkte

Unsloth stellt diese Endpunkte auf dem Port bereit, auf dem es gestartet wurde (typischerweise http://localhost:8000 oder http://localhost:8888):

Endpunkt
Kompatibel mit
Verwende es mit

POST /v1/messages

Anthropic Messages API

Claude Code, Anthropic SDK, OpenClaw, alles, was Anthropic spricht

POST /v1/chat/completions

OpenAI Chat Completions API

OpenAI SDK, opencode, Cursor, Continue, Cline, Open WebUI, curl usw.

GET /v1/models

OpenAI-Modellliste

Listet die aktuell in Unsloth geladenen Modelle auf

Authentifiziere dich mit einem Authorization: Bearer sk-unsloth-… Header bei jeder Anfrage.

Du musst für die beiden Formate keine unterschiedlichen Server betreiben. Unsloth behandelt beide auf demselben Port.

🖇️ Deinen Client verbinden

Unsloth ermöglicht es dir, lokale LLMs über die meisten Frameworks auszuführen, einschließlich Claude Code, Codex, OpenClaw, OpenCode und mehr. Klicke unten auf die jeweiligen Tools für eine Anleitung:

Um diesen Endpunkt von einem anderen Rechner aus zu erreichen, starte mit unsloth studio --secure. Unsloth bleibt an localhost gebunden und stellt sich unter einer kostenlosen Cloudflare-HTTPS-URL bereit; verwende diese URL anstelle von http://127.0.0.1:8888 als Basis-URL deines Clients. Beachte, dass servergesendete Ereignisse einen Cloudflare Quick Tunnel nicht überstehen; setze daher stream: false wenn du über einen solchen verbindest.

🧰 Tool-Calling

Beide Endpunkte unterstützen Function-/Tool-Calling in ihrem nativen Format sowie eine Unsloth-spezifische Kurzform für die eingebauten Tools von Unsloth.

Tools im OpenAI-Stil: sende Tools und tool_choice an /v1/chat/completions genau so, wie du es mit OpenAI tun würdest. Claude Code (über /v1/messages)

Tools im Anthropic-Stil: sende Tools (mit input_schema) und tool_choice an /v1/messages genau so, wie du es mit Claude tun würdest.

Unsloth-Tools auf Serverseite: Unsloth kann Python, Websuche und Bash ausführen serverseitig und die Ergebnisse als tool_result Ereignisse zurückstreamen. Aktiviere dies, indem du diese zusätzlichen Felder zu einem der beiden Endpunkte hinzufügst:

Das Modell sieht die Ausgabe jedes Tools in seinem nächsten Durchlauf. Für eine ausführlichere Abdeckung (Schemas, Streaming-Ereignisse, Verkettung) siehe .

Wenn du den Anthropic /v1/messages Endpunkt, tool_choice lässt sich sauber zuordnen: Anthropic auto → OpenAI auto, Anthropic beliebig → OpenAI erforderlich, Anthropic {type: "tool", name: "x"} → OpenAI {type: "function", function: {name: "x"}}, Anthropic keins → OpenAI keins.

📈 API-Monitor

Jeder Aufruf über diesen Endpunkt wird in Studio live an zwei Stellen angezeigt:

Das Seitenpanel des API-Monitors öffnet sich automatisch in der Ecke, sobald API-Schlüssel-Traffic eingeht. Es fasst das aktive Modell, Live-Anfragen, Fehler und die durchschnittliche Latenz zusammen.

Klicke auf "Zum vollständigen Monitor erweitern" oder gehe zu Einstellungen > API-Monitor, um zur vollständigen API Seite zu gelangen, auf der Modellladen, Prompts, Antworten, Token-Zahlen, Time-to-First-Token, Durchsatz und Fehlermeldungen im Monitor angezeigt werden.

❔ Fehlerbehebung

401 Unauthorized : entweder ist der Authorization Header fehlt oder der Schlüssel ist falsch. Schlüssel müssen als Authorization: Bearer sk-unsloth-…. Wenn du den Schlüssel verloren hast, erstelle einen neuen unter Einstellungen → API. Unsloth zeigt alte Schlüssel nach der Erstellung nicht an.

Verbindung zum Modellserver verloren : Unsloth konnte den zugrunde liegenden llama.cpp-Server nicht erreichen. In der Regel wurde das Modell zwar fertig geladen, ist dann aber abgestürzt, oder der Modell-Tab wurde in Unsloth geschlossen. Lade das Modell erneut von Neuer Chat und versuche es erneut.

Claude Code zeigt das standardmäßige Anthropic-Modell an, nicht mein lokales : überprüfe, ob alle drei Umgebungsvariablen in der derselben Shell exportiert sind, in der du claude:

Dann führe /model in Claude Code aus, um es zu bestätigen. Unter Windows PowerShell verwende $env:ANTHROPIC_BASE_URL usw.

stream: true liefert einen einzelnen JSON-Block statt SSE : stelle sicher, dass du den richtigen Pfad triffst (/v1/messages oder /v1/chat/completions) und dass dein HTTP-Client die Antwort tatsächlich als Stream verarbeitet und nicht puffert.

Ich kann den Namen des Modells nicht finden, um es opencode (oder OpenClaw / einem anderen Client) hinzuzufügen : frage direkt bei Unsloth nach. GET /v1/models liefert die genaue Modell-ID, die du in das Feld „Model ID“ des Clients eintragen musst:

Du erhältst ein JSON-Payload in der Form {"data": [{"id": "gemma-4-26B-A4B-it-GGUF", ...}]}. Kopiere den ID Wert, das ist die Zeichenfolge, die opencode erwartet Modell-ID Feld (linke Spalte) und OpenClaws models[].id erwarten. Der Anzeigename rechts ist alles, was die Benutzer sehen sollen.

Tool-Aufrufe werden nicht ausgeführt : Das Modell muss Tool-Calling für clientseitige Tools unterstützen (Tools / tool_choice). Denk bei Unsloths integrierten Tools daran, enable_tools: true und die gewünschten in enabled_tools (z. B. ["python", "web_search"]).

  • Mein Client meldet einen Verbindungsfehler. Öffne den API-Monitor. Keine Zeile für den Aufruf bedeutet, dass er Unsloth nie erreicht hat; vergleiche die Base-URL deines Clients mit der Base-URL oben auf dieser Seite angezeigt wird.

  • Die Antwort wird abgeschnitten. Prüfe Verwendeter Kontext für die Anfrage im API-Monitor. Nahe 100 % oder ein Stoppgrund von length, bedeutet, dass das Kontextfenster vollgelaufen ist, statt dass das Modell fehlgeschlagen ist.

Zuletzt aktualisiert

War das hilfreich?