> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/integrationen/connections/llama.cpp-mit-unsloth-verbinden-ggufs-mit-llama-server-ausfuhren.md).

# llama.cpp mit Unsloth verbinden: GGUFs mit llama-server ausführen

Llama.cpp ist eine Open-Source-Inferenz-Engine zum effizienten Ausführen von GGUF-Modellen auf lokaler Hardware, und [Unsloth](https://github.com/unslothai/unsloth) macht es einfach, diese Modelle direkt in eine Open-Source-UI-Chat-Oberfläche auszuführen. Durch das Starten eines lokalen `llama-server`, können Sie ein GGUF-Modell von Ihrem Rechner oder von Hugging Face bereitstellen, es mit Unsloth verbinden und es wie jedes andere externe Chat-Modell verwenden.

Diese Anleitung führt durch die Installation von llama.cpp, das Starten von `llama-server`, die Verbindung mit Unsloth, das Aktivieren Ihres Modells und das Konfigurieren von Prompt-Caching, Kontextlänge, API-Schlüsseln, FA und Chat-Vorlagen.

<figure><img src="/files/dc547939ff73b3550d30d942faddaf623078f330" alt=""><figcaption></figcaption></figure>

## Einrichtung

{% stepper %}
{% step %}

### llama.cpp installieren

Installieren Sie zuerst llama.cpp, damit Sie den `llama-server` Befehl ausführen können.

Verwenden Sie eine der offiziellen Installationsoptionen:

* Laden Sie ein vorgefertigtes [llama.cpp-Binary](https://github.com/ggml-org/llama.cpp/releases)
* llama.cpp aus dem [Quellcode](https://github.com/ggml-org/llama.cpp/blob/master/docs/build.md)

Nach der Installation prüfen Sie, ob llama-server in Ihrem Terminal funktioniert:

`llama-server --help`
{% endstep %}

{% step %}

### Wählen Sie ein GGUF-Modell

llama-server kann eine lokale .gguf-Datei laden oder ein GGUF-Modell von Hugging Face herunterladen.

Um direkt ein Hugging-Face-GGUF-Repository bereitzustellen, verwenden Sie den Repo- und Quant-Namen:

`llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL`

Wenn Sie ein lokales Modell laden möchten, können Sie auch die folgenden Schritte befolgen.&#x20;

Starten `llama-server` Sie mit dem Modell, das Sie bereitstellen möchten:

```bash
llama-server \
  --model /path/to/model.gguf \
  --host 0.0.0.0 \
  --port 8080
```

Dies stellt einen API-Endpunkt bereit unter: `http://localhost:8080/v1`

Um einen API-Schlüssel zu verlangen, fügen Sie hinzu:

```bash
--api-key 1234-myapi-key
```

{% endstep %}

{% step %}

### Llama.cpp mit Unsloth verbinden

Öffnen Sie **Einstellungen → Verbindungen**, dann klicken Sie auf **Verbindung hinzufügen**. Wählen Sie **llama.cpp**, und geben Sie dann Ihre Serverdetails ein:

<figure><img src="/files/0de0e044cf6af85d4b1ad6e6ff76a0e0e0e7f4e2" alt="" width="563"><figcaption></figcaption></figure>

wenn Sie llama-server nicht mit `--api-key`gestartet haben, lassen Sie das Feld für den API-Schlüssel leer. Geben Sie die Basis-URL Ihres Servers ein, z. B. `http://localhost:8080/v1`\
Klicken Sie auf **Modelle laden** um verfügbare Modell-IDs abzurufen, oder geben Sie die Modell-IDs manuell ein, wenn Ihr Server `/models`.

<figure><img src="/files/aa9e97e8b7054f0e28c1952c20a2d22fc3b0ed59" alt="" width="563"><figcaption></figcaption></figure>

nicht bereitstellt. Dann, nachdem Sie auf **Verbindung hinzufügen** geklickt haben, werden die von Ihnen aktivierten Modelle nun unter **Verbunden** in der **Modell auswählen** Dropdown-Liste angezeigt.
{% endstep %}

{% step %}

### Bereit zum Chatten&#x20;

Nachdem Sie die Verbindung gespeichert haben, erscheint Ihr llama.cpp-Modell unter **Verbindung** in der Modell-Dropdown-Liste. Wählen Sie es aus, um mit Ihnen zu chatten **llama-server**.

<figure><img src="/files/dc547939ff73b3550d30d942faddaf623078f330" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Prompt-Caching

Prompt-Caching reduziert Latenz und Kosten, wenn Anfragen denselben langen Präfix wiederverwenden. Verwenden Sie die **Prompt-Caching** Einstellung in der Seitenleiste von Unsloth, um das Caching-Verhalten für unterstützte Verbindungen zu steuern.

<figure><img src="/files/d2dfbf9f4bda25e515dd1f2d2075a57818fa9fef" alt="" width="375"><figcaption></figcaption></figure>

Bei llama.cpp ist Prompt-Caching standardmäßig aktiviert und kann beim Starten deaktiviert werden\
`llama-server` mit:

```bash
--no-cache-prompt
```

### **Häufige llama-server-Argumente**

Das obige Beispiel verwendet nur die erforderlichen Verbindungseinstellungen. Sie können je nach Ihrem Modell und Ihrer Hardware weitere llama-server-Argumente hinzufügen.

Zu den häufigen Optionen gehören:

```bash
  --ctx-size 8192 \        # Die Kontextlänge festlegen
  --parallel 2 \           # Die Anzahl der parallelen Slots festlegen
  --flash-attn on \        # Flash Attention aktivieren, wenn unterstützt
  --jinja \                # Die Chat-Vorlage des Modells verwenden
  --api-key 1234-key \     # Einen API-Schlüssel verlangen
  --no-cache-prompt        # Prompt-Caching deaktivieren
```

Für die vollständige Liste der Server-Argumente siehe die offizielle [README des llama.cpp-Servers](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md).


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/integrationen/connections/llama.cpp-mit-unsloth-verbinden-ggufs-mit-llama-server-ausfuhren.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
