Wie man Unsloth als API-Endpunkt verwendet
Du kannst lokale LLMs mit Tools wie Claude Code und Codex indem du diese Tools mit Unsloths OpenAI-kompatiblen API-Endpunkt. So kannst du Modelle wie Qwen und Gemma lokal für agentisches Coding ausführen. Unsloth hat außerdem nützliche Funktionen wie selbstheilendes Tool-Calling, Code-Ausführungund Websuche.
Unsloth macht es einfach, einen schnellen API-Inferenz-Endpunkt bereitzustellen, der Folgendes bietet:
Selbstheilendes Tool-Calling, was dazu beiträgt, fehlerhafte oder ungültige Tool-Aufrufe um 50 % zu reduzieren
Code-Ausführung Unterstützung, die die Ausführung von Bash und Python für genauere Code-Ausgaben ermöglicht.
Erweiterte Websuche die Webseiten besucht und tatsächlich liest, um detaillierte Informationen zu sammeln.
Automatische Inferenz Einstellungen für GGUF-Modelle (temp, top-k usw.)
In Unsloth geladene Modelle (einschließlich GGUFs) werden als authentifizierte API über llama-server. Aus Sicherheitsgründen wird ein langer API-Schlüssel generiert, so wie OpenAI einen bereitstellt.
Deine lokalen Modelle können dann direkt in deinem bevorzugten KI-Agenten, SDK oder Chat-Client verwendet werden. Unsloth spricht zwei Dialekte auf demselben Port. Beide unterstützen Streaming, Tool-Calling (OpenAI Tools / Anthropic Tools), sowie Vision-Eingaben:

Egal, ob dein Modell über Unsloths Inferenz oder deinen eigenen entfernten OpenAI-kompatiblen Endpunkt läuft, du kannst ihm Zugriff auf Unsloths vollständige Werkzeug-Suite geben, einschließlich Websuche, Code-Ausführung, Deep Research und mehr.
Anthropic-kompatibel
/v1/messagesfür Claude Code, OpenClaw, das Anthropic SDK und jeden Client, der die Messages API erwartet.OpenAI-kompatibel
/v1/chat/completionsund/v1/responsesfür das OpenAI SDK, OpenCode, Cursor, Continue, Cline, Open WebUI, SillyTavern und jedes OpenAI-kompatible Tool.
⚡ Schnellstart
Unsloth herunterladen
Der einfachste Einstieg ist die Installation der Unsloth Desktop App. Sie unterstützt macOS, Linux, Windows, NVIDIA, AMD, Intel- und CPU-Konfigurationen.
Oder, wenn du die manuelle Installation bevorzugst:
macOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows PowerShell:
irm https://unsloth.ai/install.ps1 | iexUnsloth ist jetzt bereit
Um mit dem Chatten zu beginnen, gib eine Nachricht ein und drücke Enter.
Erstelle einen API-Schlüssel. Klicke auf dein Unsloth Avatar unten links → Einstellungen → API → gib einen Schlüsselnamen ein → Erstellen. Kopiere den
sk-unsloth-…angezeigten Wert. Unsloth zeigt ihn nur einmal an.Richte deinen Client auf Unsloth aus. Verwende
http://localhost:PORTals Basis-URL und deinensk-unsloth-…Schlüssel zur Authentifizierung. Springe unten zum Rezept für dein Tool.

🔑 Einen API-Schlüssel erstellen
Öffne die Seitenleiste und klicke auf deinen Unsloth Avatar unten links.
Gehe zu Einstellungen → API (Globus 🌐 -Symbol).
Gib einen aussagekräftigen Namen ein (z. B.
claude-code-macbook). Lege ein Ablaufdatum fest (optional)Klicke auf Erstellen.
Kopiere den Schlüssel. Unsloth speichert nur einen Hash, und du kannst ihn nicht erneut anzeigen.

Alle Schlüssel beginnen mit dem sk-unsloth- Präfix. Du kannst einen Schlüssel jederzeit auf derselben Seite widerrufen. Anfragen mit einem widerrufenen Schlüssel schlagen mit 401 Unauthorized.
Behandle deinen API-Schlüssel wie ein Passwort. Jeder mit dem Schlüssel und Netzwerkzugriff auf deine Unsloth-Instanz kann Anfragen an dein geladenes Modell senden.
⏳ Modell wird geladen
Unsloth-Ausführungsbefehl
Installiere oder aktualisiere Unsloth Studio. Frühere Versionen stellen die externe API nicht bereit. Siehe Installation.
Lade ein GGUF-Modell. Lade ein GGUF-Modell mit dem Run-Befehl. Dadurch wird auch die Benutzeroberfläche auf dem Standardport geladen. Die Endpunkt-URL und der API-Schlüssel werden in der Konsole ausgegeben und können direkt mit deinem bevorzugten Client verwendet werden.
Passe die Einstellungen nach Bedarf an.
Ein Modell über die CLI laden
Du kannst ein Modell laden und dir automatisch einen API-Schlüssel erstellen lassen, indem du das unsloth CLI-Tool verwendest. Wenn das Modell fertig geladen ist, werden die Endpunkt-URL und der API-Schlüssel in deiner Konsole ausgegeben. Kopiere sie in deinen bevorzugten Client, und schon kann es losgehen.
Bevor du beginnst
Stelle sicher, dass du eine aktuelle Version von Unsloth Studio verwendest, da frühere Versionen die externe API nicht bereitstellen. Siehe Installation.
Der schnelle Weg
Öffne ein Terminal und lade ein GGUF-Modell:
Dadurch startet der Server auf dem Standardport, die Benutzeroberfläche wird geladen und deine Endpunkt-URL sowie dein API-Schlüssel werden ausgegeben.
Wie der Modellname funktioniert
Du kannst auf ein Modell auf verschiedene Arten verweisen. Wähle die, die dir am einfachsten erscheint:
Den Lauf anpassen (optional)
Für einen einfachen Ladevorgang brauchst du nichts davon, aber unsloth run unterstützt viele llama-server-Laufzeitflags zur Anpassung von Leistung, Speichernutzung, Kontextlänge, Generierungsverhalten, Netzwerk und Tool-Zugriff.
Zusätzliche Flags werden direkt an den zugrunde liegenden Inferenzserver weitergeleitet, und deine Werte überschreiben die Standardwerte von Unsloth. Wenn keine Einstellungs-/Sampling-Flags gesetzt sind, wählt Unsloth automatisch die besten/empfohlenen Einstellungen für das Modell, einschließlich Kontextlänge, Temperatur usw.
Steuere das Reasoning-Verhalten
Einige Modelle mit Reasoning-Fähigkeit unterstützen zusätzliche Flags zur Steuerung des Denk- und Reasoning-Verhaltens.
Reasoning-Aufwand und Flags hängen davon ab, was das Modell unterstützt.
Generierungsverhalten anpassen
Sampling-Einstellungen steuern, wie kreativ, fokussiert oder deterministisch sich das Modell bei der Generierung verhält.
Niedrigere Temperaturwerte erzeugen normalerweise stabilere Ausgaben, während top-p-, top-k-, min-p- und Repeat-Penalty-Einstellungen die Tokenauswahl und Wiederholung weiter steuern.
Kontextlänge und CPU-Threads erhöhen
Nützlich, wenn du mit großen Projekten, langen Chats oder Agent-Workflows arbeitest, die mehr Speicher benötigen.
Die API im lokalen Netzwerk freigeben
Standardmäßig läuft Unsloth nur lokal auf deinem Rechner. Du kannst die API anderen Geräten in deinem Netzwerk zugänglich machen, indem du an 0.0.0.0.
Serverseitige Tools aktivieren oder deaktivieren
Steuere, ob Tools wie Websuche und Code-Ausführung vom Inferenzserver bereitgestellt werden.
Unsloth unterstützt die meisten llama-server-Laufzeitflags, einschließlich Kontextgröße, GPU-Layer, Threading, Sampling, Netzwerk und Tool-Konfiguration.
Siehe die llama-server Dokumentation für die vollständige Liste der unterstützten Laufzeitflags.
Richtlinie für serverseitige Tools
unsloth run steuert, ob serverseitige Tools (Websuche, Code-Ausführung usw.) vom Inferenzserver bereitgestellt werden. Die Standardwerte basieren auf der Bind-Adresse:
127.0.0.1(localhost) — Tools ein standardmäßig. Nur dein Rechner kann den Server erreichen.0.0.0.0oder jede Nicht-Loopback-Adresse — Tools aus standardmäßig. Ein geleakter API-Schlüssel auf einem im Netzwerk exponierten Server bedeutet beliebige Code-Ausführung auf dem Host.
Flags:
--enable-tools/--disable-tools— erzwingt ein oder aus. Ein0.0.0.0,--enable-toolszeigt eine Sicherheitsabfrage mit y/N an.--yes/-y— überspringt die Abfrage (für Automatisierung).
Die festgelegte Richtlinie ist ein harter Override auf Prozessebene — einzelne Anfragen können sie nicht umgehen über enable_tools=true im Request-Body.

🌐 Endpunkte
Unsloth stellt diese Endpunkte auf dem Port bereit, auf dem es gestartet wurde (typischerweise http://localhost:8000 oder http://localhost:8888):
POST /v1/messages
Anthropic Messages API
Claude Code, Anthropic SDK, OpenClaw, alles, was Anthropic spricht
POST /v1/chat/completions
OpenAI Chat Completions API
OpenAI SDK, opencode, Cursor, Continue, Cline, Open WebUI, curl usw.
GET /v1/models
OpenAI-Modellliste
Listet die aktuell in Unsloth geladenen Modelle auf
Authentifiziere dich mit einem Authorization: Bearer sk-unsloth-… Header bei jeder Anfrage.
🖇️ Deinen Client verbinden
Unsloth ermöglicht es dir, lokale LLMs über die meisten Frameworks auszuführen, einschließlich Claude Code, Codex, OpenClaw, OpenCode und mehr. Klicke unten auf die jeweiligen Tools für eine Anleitung:
Um diesen Endpunkt von einem anderen Rechner aus zu erreichen, starte mit unsloth studio --secure. Unsloth bleibt an localhost gebunden und stellt sich unter einer kostenlosen Cloudflare-HTTPS-URL bereit; verwende diese URL anstelle von http://127.0.0.1:8888 als Basis-URL deines Clients. Beachte, dass servergesendete Ereignisse einen Cloudflare Quick Tunnel nicht überstehen; setze daher stream: false wenn du über einen solchen verbindest.
🧰 Tool-Calling
Beide Endpunkte unterstützen Function-/Tool-Calling in ihrem nativen Format sowie eine Unsloth-spezifische Kurzform für die eingebauten Tools von Unsloth.
Tools im OpenAI-Stil: sende Tools und tool_choice an /v1/chat/completions genau so, wie du es mit OpenAI tun würdest. Claude Code (über /v1/messages)
Tools im Anthropic-Stil: sende Tools (mit input_schema) und tool_choice an /v1/messages genau so, wie du es mit Claude tun würdest.
Unsloth-Tools auf Serverseite: Unsloth kann Python, Websuche und Bash ausführen serverseitig und die Ergebnisse als tool_result Ereignisse zurückstreamen. Aktiviere dies, indem du diese zusätzlichen Felder zu einem der beiden Endpunkte hinzufügst:
Das Modell sieht die Ausgabe jedes Tools in seinem nächsten Durchlauf. Für eine ausführlichere Abdeckung (Schemas, Streaming-Ereignisse, Verkettung) siehe .
📈 API-Monitor
Jeder Aufruf über diesen Endpunkt wird in Studio live an zwei Stellen angezeigt:
Das Seitenpanel des API-Monitors öffnet sich automatisch in der Ecke, sobald API-Schlüssel-Traffic eingeht. Es fasst das aktive Modell, Live-Anfragen, Fehler und die durchschnittliche Latenz zusammen.

Klicke auf "Zum vollständigen Monitor erweitern" oder gehe zu Einstellungen > API-Monitor, um zur vollständigen API Seite zu gelangen, auf der Modellladen, Prompts, Antworten, Token-Zahlen, Time-to-First-Token, Durchsatz und Fehlermeldungen im Monitor angezeigt werden.

❔ Fehlerbehebung
401 Unauthorized : entweder ist der Authorization Header fehlt oder der Schlüssel ist falsch. Schlüssel müssen als Authorization: Bearer sk-unsloth-…. Wenn du den Schlüssel verloren hast, erstelle einen neuen unter Einstellungen → API. Unsloth zeigt alte Schlüssel nach der Erstellung nicht an.
Verbindung zum Modellserver verloren : Unsloth konnte den zugrunde liegenden llama.cpp-Server nicht erreichen. In der Regel wurde das Modell zwar fertig geladen, ist dann aber abgestürzt, oder der Modell-Tab wurde in Unsloth geschlossen. Lade das Modell erneut von Neuer Chat und versuche es erneut.
Claude Code zeigt das standardmäßige Anthropic-Modell an, nicht mein lokales : überprüfe, ob alle drei Umgebungsvariablen in der derselben Shell exportiert sind, in der du claude:
Dann führe /model in Claude Code aus, um es zu bestätigen. Unter Windows PowerShell verwende $env:ANTHROPIC_BASE_URL usw.
stream: true liefert einen einzelnen JSON-Block statt SSE : stelle sicher, dass du den richtigen Pfad triffst (/v1/messages oder /v1/chat/completions) und dass dein HTTP-Client die Antwort tatsächlich als Stream verarbeitet und nicht puffert.
Ich kann den Namen des Modells nicht finden, um es opencode (oder OpenClaw / einem anderen Client) hinzuzufügen : frage direkt bei Unsloth nach. GET /v1/models liefert die genaue Modell-ID, die du in das Feld „Model ID“ des Clients eintragen musst:
Du erhältst ein JSON-Payload in der Form {"data": [{"id": "gemma-4-26B-A4B-it-GGUF", ...}]}. Kopiere den ID Wert, das ist die Zeichenfolge, die opencode erwartet Modell-ID Feld (linke Spalte) und OpenClaws models[].id erwarten. Der Anzeigename rechts ist alles, was die Benutzer sehen sollen.
Tool-Aufrufe werden nicht ausgeführt : Das Modell muss Tool-Calling für clientseitige Tools unterstützen (Tools / tool_choice). Denk bei Unsloths integrierten Tools daran, enable_tools: true und die gewünschten in enabled_tools (z. B. ["python", "web_search"]).
Mein Client meldet einen Verbindungsfehler. Öffne den API-Monitor. Keine Zeile für den Aufruf bedeutet, dass er Unsloth nie erreicht hat; vergleiche die Base-URL deines Clients mit der Base-URL oben auf dieser Seite angezeigt wird.
Die Antwort wird abgeschnitten. Prüfe Verwendeter Kontext für die Anfrage im API-Monitor. Nahe 100 % oder ein Stoppgrund von
length, bedeutet, dass das Kontextfenster vollgelaufen ist, statt dass das Modell fehlgeschlagen ist.
Zuletzt aktualisiert
War das hilfreich?





