llama.cpp mit Unsloth verbinden: GGUFs mit llama-server ausführen
Llama.cpp ist eine Open-Source-Inferenz-Engine zum effizienten Ausführen von GGUF-Modellen auf lokaler Hardware, und Unsloth macht es einfach, diese Modelle direkt in eine Open-Source-UI-Chat-Oberfläche auszuführen. Durch das Starten eines lokalen llama-server, können Sie ein GGUF-Modell von Ihrem Rechner oder von Hugging Face bereitstellen, es mit Unsloth verbinden und es wie jedes andere externe Chat-Modell verwenden.
Diese Anleitung führt durch die Installation von llama.cpp, das Starten von llama-server, die Verbindung mit Unsloth, das Aktivieren Ihres Modells und das Konfigurieren von Prompt-Caching, Kontextlänge, API-Schlüsseln, FA und Chat-Vorlagen.

Einrichtung
llama.cpp installieren
Installieren Sie zuerst llama.cpp, damit Sie den llama-server Befehl ausführen können.
Verwenden Sie eine der offiziellen Installationsoptionen:
Laden Sie ein vorgefertigtes llama.cpp-Binary
llama.cpp aus dem Quellcode
Nach der Installation prüfen Sie, ob llama-server in Ihrem Terminal funktioniert:
llama-server --help
Wählen Sie ein GGUF-Modell
llama-server kann eine lokale .gguf-Datei laden oder ein GGUF-Modell von Hugging Face herunterladen.
Um direkt ein Hugging-Face-GGUF-Repository bereitzustellen, verwenden Sie den Repo- und Quant-Namen:
llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL
Wenn Sie ein lokales Modell laden möchten, können Sie auch die folgenden Schritte befolgen.
Starten llama-server Sie mit dem Modell, das Sie bereitstellen möchten:
Dies stellt einen API-Endpunkt bereit unter: http://localhost:8080/v1
Um einen API-Schlüssel zu verlangen, fügen Sie hinzu:
Llama.cpp mit Unsloth verbinden
Öffnen Sie Einstellungen → Verbindungen, dann klicken Sie auf Verbindung hinzufügen. Wählen Sie llama.cpp, und geben Sie dann Ihre Serverdetails ein:

wenn Sie llama-server nicht mit --api-keygestartet haben, lassen Sie das Feld für den API-Schlüssel leer. Geben Sie die Basis-URL Ihres Servers ein, z. B. http://localhost:8080/v1
Klicken Sie auf Modelle laden um verfügbare Modell-IDs abzurufen, oder geben Sie die Modell-IDs manuell ein, wenn Ihr Server /models.

nicht bereitstellt. Dann, nachdem Sie auf Verbindung hinzufügen geklickt haben, werden die von Ihnen aktivierten Modelle nun unter Verbunden in der Modell auswählen Dropdown-Liste angezeigt.
Prompt-Caching
Prompt-Caching reduziert Latenz und Kosten, wenn Anfragen denselben langen Präfix wiederverwenden. Verwenden Sie die Prompt-Caching Einstellung in der Seitenleiste von Unsloth, um das Caching-Verhalten für unterstützte Verbindungen zu steuern.

Bei llama.cpp ist Prompt-Caching standardmäßig aktiviert und kann beim Starten deaktiviert werden
llama-server mit:
Häufige llama-server-Argumente
Das obige Beispiel verwendet nur die erforderlichen Verbindungseinstellungen. Sie können je nach Ihrem Modell und Ihrer Hardware weitere llama-server-Argumente hinzufügen.
Zu den häufigen Optionen gehören:
Für die vollständige Liste der Server-Argumente siehe die offizielle README des llama.cpp-Servers.
Zuletzt aktualisiert
War das hilfreich?

