For the complete documentation index, see llms.txt. This page is also available as Markdown.

llama.cpp mit Unsloth verbinden: GGUFs mit llama-server ausführen

Llama.cpp ist eine Open-Source-Inferenz-Engine zum effizienten Ausführen von GGUF-Modellen auf lokaler Hardware, und Unsloth macht es einfach, diese Modelle direkt in eine Open-Source-UI-Chat-Oberfläche auszuführen. Durch das Starten eines lokalen llama-server, können Sie ein GGUF-Modell von Ihrem Rechner oder von Hugging Face bereitstellen, es mit Unsloth verbinden und es wie jedes andere externe Chat-Modell verwenden.

Diese Anleitung führt durch die Installation von llama.cpp, das Starten von llama-server, die Verbindung mit Unsloth, das Aktivieren Ihres Modells und das Konfigurieren von Prompt-Caching, Kontextlänge, API-Schlüsseln, FA und Chat-Vorlagen.

Einrichtung

1

llama.cpp installieren

Installieren Sie zuerst llama.cpp, damit Sie den llama-server Befehl ausführen können.

Verwenden Sie eine der offiziellen Installationsoptionen:

Nach der Installation prüfen Sie, ob llama-server in Ihrem Terminal funktioniert:

llama-server --help

2

Wählen Sie ein GGUF-Modell

llama-server kann eine lokale .gguf-Datei laden oder ein GGUF-Modell von Hugging Face herunterladen.

Um direkt ein Hugging-Face-GGUF-Repository bereitzustellen, verwenden Sie den Repo- und Quant-Namen:

llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL

Wenn Sie ein lokales Modell laden möchten, können Sie auch die folgenden Schritte befolgen.

Starten llama-server Sie mit dem Modell, das Sie bereitstellen möchten:

Dies stellt einen API-Endpunkt bereit unter: http://localhost:8080/v1

Um einen API-Schlüssel zu verlangen, fügen Sie hinzu:

3

Llama.cpp mit Unsloth verbinden

Öffnen Sie Einstellungen → Verbindungen, dann klicken Sie auf Verbindung hinzufügen. Wählen Sie llama.cpp, und geben Sie dann Ihre Serverdetails ein:

wenn Sie llama-server nicht mit --api-keygestartet haben, lassen Sie das Feld für den API-Schlüssel leer. Geben Sie die Basis-URL Ihres Servers ein, z. B. http://localhost:8080/v1 Klicken Sie auf Modelle laden um verfügbare Modell-IDs abzurufen, oder geben Sie die Modell-IDs manuell ein, wenn Ihr Server /models.

nicht bereitstellt. Dann, nachdem Sie auf Verbindung hinzufügen geklickt haben, werden die von Ihnen aktivierten Modelle nun unter Verbunden in der Modell auswählen Dropdown-Liste angezeigt.

4

Bereit zum Chatten

Nachdem Sie die Verbindung gespeichert haben, erscheint Ihr llama.cpp-Modell unter Verbindung in der Modell-Dropdown-Liste. Wählen Sie es aus, um mit Ihnen zu chatten llama-server.

Prompt-Caching

Prompt-Caching reduziert Latenz und Kosten, wenn Anfragen denselben langen Präfix wiederverwenden. Verwenden Sie die Prompt-Caching Einstellung in der Seitenleiste von Unsloth, um das Caching-Verhalten für unterstützte Verbindungen zu steuern.

Bei llama.cpp ist Prompt-Caching standardmäßig aktiviert und kann beim Starten deaktiviert werden llama-server mit:

Häufige llama-server-Argumente

Das obige Beispiel verwendet nur die erforderlichen Verbindungseinstellungen. Sie können je nach Ihrem Modell und Ihrer Hardware weitere llama-server-Argumente hinzufügen.

Zu den häufigen Optionen gehören:

Für die vollständige Liste der Server-Argumente siehe die offizielle README des llama.cpp-Servers.

Zuletzt aktualisiert

War das hilfreich?