For the complete documentation index, see llms.txt. This page is also available as Markdown.

API-Anbieter und Modellserver mit Unsloth verbinden

Leitfaden zum Verbinden von OpenAI, Anthropic, Ollama, llama.cpp, vLLM und anderen Anbietern mit Unsloth. Füge API-Schlüssel oder URLs von Modellservern hinzu, lade Modelle und verwende externe Modelle im Chat.

Erfahren Sie, wie Sie Modelle von OpenAI, Anthropic, Ollama, llama.cpp, vLLM und anderen Anbietern über eine einzige lokale UI-Oberfläche mit Unsloth, ein Open-Source-Repository zum Ausführen und Trainieren von LLMs.

Sobald verbunden, können Sie Modelle mit Codeausführung, Tool-Calling, Bildgenerierung und anderen Funktionen in derselben Unsloth-Chat-Oberfläche ausführen, die sowohl für lokale als auch für Cloud-Modelle verwendet wird.

Unsloth unterstützt einzigartig Prompt-Caching (um Ihnen viele Tokens ohne Genauigkeitsverlust zu sparen) und behält gleichzeitig den Zugriff auf anbietereigene Funktionen wie OpenAIs integrierte Websuche und Codeausführung.

Verbindungen

Verbindungen fallen in zwei Gruppen: gehostete API-Anbieter, die Modelle für Sie ausführen, und Modellserver, die Sie selbst betreiben oder kontrollieren.

Cloud-Anbieter - Gehostete APIs, die einen Konto-API-Schlüssel verwenden:

Verbindung
Funktionen
Einrichtungsanleitung

OpenAI

Bild, Suche, Code, Denken

Anthropic

Bild, Suche, Code, Denken

OpenRouter

Viele gehostete Modelle über einen einzigen API-Schlüssel.

Modellserver - Inferenzserver, die lokal, in Ihrem Netzwerk oder auf Ihrer entfernten Maschine laufen:

Server
Beschreibung
Anleitung

Llama.cpp

Effizientes Bereitstellen von GGUF-Modellen

vLLM

Bereitstellung mit hohem Durchsatz

Ollama

Einfacher lokaler Modellserver

Schnellstart

Um ein Modell eines externen Anbieters auszuführen, fügen Sie einen API-Schlüssel hinzu und wählen Sie aus, welche Modelle Unsloth anzeigen soll. In diesem Beispiel verwenden wir OpenAI. Dieselbe Einrichtung funktioniert auch für Anthropic und andere Anbieter.

1

API erstellen

Erstellen Sie einen neuen API-Schlüssel im Dashboard des Anbieters und kopieren Sie ihn.

2

Unsloth Studio einrichten

Nun müssen wir Unslothinstallieren und einrichten, damit Sie die Cloud-Modelle in einer UI-Oberfläche ausführen können. Hier ansehen für genauere Anweisungen.

Schritt 1: Unsloth einrichten

Starten Sie das Terminal auf dem Mac und installieren Sie dann Unsloth, indem Sie den folgenden Befehl eingeben.

curl -fsSL https://unsloth.ai/install.sh | sh

Die Umgebung und die erforderlichen Pakete werden nun installiert. Geben Sie Y ein und drücken Sie Enter, wenn Sie zur Fortsetzung aufgefordert werden. Nach Abschluss der Einrichtung ist der Server lokal auf Port 8888.

Wenn Sie das Starten der App während der Installation übersprungen haben, können Sie sie später mit unsloth studio -p 8888. Um Verbindungen von anderen Geräten in Ihrem Netzwerk zu erlauben, verwenden Sie stattdessen. Schritt 2: Unsloth starten

Öffnen Sie Ihren bevorzugten Browser und geben Sie

http://127.0.0.1:8888 in die URL-Leiste ein. Wenn Sie Unsloth zum ersten Mal installieren, werden Sie zur Passwortseite weitergeleitet, wo Sie ein neues Passwort erstellen müssen. Danach sollten Sie die Chat-Seite wie unten gezeigt sehen. Windows

3

Verbindungen konfigurieren

Verbinden Sie als Nächstes Ihren Anbieter mit Unsloth.

  1. in Ihrem Browser. Beim ersten Start erstellen Sie ein neues Passwort, um zur Chat-Seite fortzufahren. EinstellungenVerbindungen, dann klicken Sie auf Verbindung hinzufügen.

  2. Wählen Sie den Anbieter aus, den Sie hinzufügen möchten, und fügen Sie dann den zuvor kopierten API-Schlüssel ein.

  3. Klicken Sie auf Modelle neu laden um die Liste mit den für Ihr Konto verfügbaren Modellen zu aktualisieren.

  4. Wählen Sie die Modelle aus, die Sie aktivieren möchten, und klicken Sie dann auf Speichern.

4

Bereit zum Chatten

Die von Ihnen aktivierten Modelle erscheinen nun unter Verbunden im Modell auswählen Dropdown-Menü.

Unsloth stellt dynamisch kompatible Denkstufen und Generierungssteuerungen für verschiedene Modelle bereit.

Verbinden Sie einen Modellserver

Verwenden Sie diesen Ablauf für llama.cpp, vLLM, und Ollama. Starten oder suchen Sie den Server, den Sie verbinden möchten.

Starten llama-server mit dem Modell, das Sie bereitstellen möchten:

Dadurch wird ein API-Endpunkt bereitgestellt unter: http://localhost:8080/v1

Um einen API-Schlüssel zu verlangen, fügen Sie hinzu:

Jetzt können wir den Modellserver verbinden. Öffnen Sie Einstellungen → Verbindungen, dann klicken Sie auf Anbieter hinzufügen.

Wählen Sie llama.cpp, vLLM oder Ollama aus und fügen Sie dann die Server- Basis-URL.

  • llama.cpp-Beispiel: http://localhost:8080/v1

  • Ollama-Beispiel: http://localhost:11434/v1

Klicken Sie auf Modelle laden um verfügbare Modell-IDs abzurufen, oder geben Sie Modell-IDs manuell ein, wenn Ihr Server /models.

Dann, nachdem Sie auf Anbieter hinzufügen, Die von Ihnen aktivierten Modelle erscheinen nun unter Extern im Modell auswählen Dropdown-Menü.

Codeausführung

Wenn diese Option aktiviert ist, können unterstützte OpenAI- und Anthropic-Modelle Code in einer Sandbox des Anbieters ausführen, um Probleme zu lösen, Daten zu analysieren und mit Dateien zu arbeiten. Anthropic-Modelle verwenden Claudes anbieterseitiges Codeausführungstool. OpenAI verwendet wiederverwendbare Container, die Sie erstellen, löschen und auswählen können Codeausführung in den Einstellungen. Wählen Sie in einem neuen Thread denselben Container aus, um mit seinen Dateien und seinem Zustand fortzufahren.

Prompt-Caching

Prompt-Caching reduziert Latenz und Kosten, wenn Anfragen denselben langen Präfix wiederverwenden. Es wird von kompatiblen Anbietern und Servern unterstützt, darunter OpenAI, Anthropic und llama.cpp. Verwenden Sie die Prompt-Caching Einstellung in der Seitenleiste, um das Caching-Verhalten für unterstützte Verbindungen zu steuern.

Bei llama.cpp ist Prompt-Caching standardmäßig aktiviert und kann beim Starten deaktiviert werden llama-server mit:

Websuche & Denken

Anbieterseitige Websuche ist für unterstützte Modelle von OpenAI, Anthropic, OpenRouter, Mistral, Gemini und Kimi verfügbar. Die Think-Steuerung passt sich dem ausgewählten Modell an: Einige Modelle verwenden einen Ein/Aus-Schalter, während Modelle mit Reasoning-Aufwand modellspezifische Denkstufen verwenden.

Bildgenerierung

Genau wie GPT und Gemini unterstützt Unsloth auch die Bildgenerierung. Sie können ein Bild direkt bearbeiten, indem Sie auf die Schaltfläche „Bild bearbeiten“ klicken und einen neuen Prompt eingeben, um es zu verfeinern oder neu zu generieren. Bilder werden automatisch generiert, wenn dies angefordert wird, aber Sie können dieses Verhalten deaktivieren. Außerdem gibt es eine Download-Schaltfläche, mit der Sie das Bild in seiner ursprünglichen vollständigen Auflösung speichern können.

Fehlerbehebung

Wenn die Verbindung zu einem Anbieter fehlschlägt, prüfen Sie, ob der API-Schlüssel zum ausgewählten Anbieter gehört und Zugriff auf das von Ihnen gewählte Modell hat.

Wenn ein Modell nach dem Klicken auf Modelle neu ladennicht angezeigt wird, ist es möglicherweise für Ihr Konto nicht verfügbar. Sie können dennoch Unsloths Standard-Modellliste verwenden oder ein anderes Modell wählen.

Zuletzt aktualisiert

War das hilfreich?