> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/integrations/connections/connecter-llama.cpp-a-unsloth-executer-des-gguf-avec-llama-server.md).

# Connecter llama.cpp à Unsloth : exécuter des GGUF avec llama-server

Llama.cpp est un moteur d’inférence open source pour exécuter efficacement des modèles GGUF sur du matériel local, et [Unsloth](https://github.com/unslothai/unsloth) facilite l’exécution de ces modèles directement dans une interface de chat UI open source. En démarrant un `llama-server`, vous pouvez diffuser un modèle GGUF depuis votre machine ou Hugging Face, le connecter à Unsloth et l’utiliser comme n’importe quel autre modèle de chat externe.

Ce guide explique comment installer llama.cpp, lancer `llama-server`, le connecter à Unsloth, activer votre modèle et configurer la mise en cache des prompts, la longueur du contexte, les clés API, FA et les modèles de chat.

<figure><img src="/files/0369b53163180f57095d882f58881cc37a969064" alt=""><figcaption></figcaption></figure>

## Configuration

{% stepper %}
{% step %}

### Installer llama.cpp

Installez d’abord llama.cpp afin de pouvoir exécuter la commande `llama-server` .

Utilisez l’une des options d’installation officielles :

* Télécharger un [binaire llama.cpp](https://github.com/ggml-org/llama.cpp/releases)
* Compiler llama.cpp à partir du [code source](https://github.com/ggml-org/llama.cpp/blob/master/docs/build.md)

Après l’installation, vérifiez que llama-server fonctionne dans votre terminal :

`llama-server --help`
{% endstep %}

{% step %}

### Choisir un modèle GGUF

llama-server peut charger un fichier .gguf local ou télécharger un modèle GGUF depuis Hugging Face.

Pour diffuser directement un dépôt GGUF Hugging Face, utilisez le dépôt et le nom de quantification :

`llama-server -hf unsloth/Qwen3.6-27B-GGUF:UD-Q4_K_XL`

Si vous souhaitez charger un modèle local, vous pouvez aussi suivre les étapes ci-dessous.&#x20;

Commencez `llama-server` avec le modèle que vous souhaitez diffuser :

```bash
llama-server \\
  --model /path/to/model.gguf \\
  --host 0.0.0.0 \\
  --port 8080
```

Cela expose un point de terminaison API à : `http://localhost:8080/v1`

Pour exiger une clé API, ajoutez :

```bash
--api-key 1234-myapi-key
```

{% endstep %}

{% step %}

### Connecter Llama.cpp à Unsloth

Ouvrez **Paramètres → Connexions**, puis cliquez sur **Ajouter une connexion**. Sélectionnez **llama.cpp**, puis saisissez les détails de votre serveur :

<figure><img src="/files/b3c76040e1d6bd18576ca8a4279d45d98e8bb7a0" alt="" width="563"><figcaption></figcaption></figure>

si vous n’avez pas démarré llama-server avec `--api-key`, laissez le champ de clé API vide. Saisissez l’URL de base de votre serveur, par exemple `http://localhost:8080/v1`\
Cliquez sur **Charger les modèles** pour récupérer les identifiants de modèles disponibles, ou saisissez les identifiants de modèles manuellement si votre serveur n’expose pas `/models`.

<figure><img src="/files/e398eaf463e42910c06475a80118ce8252a463b7" alt="" width="563"><figcaption></figcaption></figure>

Ensuite, après avoir cliqué sur **Ajouter une connexion,** Les modèles que vous avez activés apparaîtront désormais sous **Connecté** dans la liste déroulante **Sélectionner le modèle** .
{% endstep %}

{% step %}

### Prêt à discuter&#x20;

Après avoir enregistré la connexion, votre modèle llama.cpp apparaîtra sous **Connexion** dans la liste déroulante des modèles. Sélectionnez-le pour commencer à discuter via votr **llama-server**.

<figure><img src="/files/0369b53163180f57095d882f58881cc37a969064" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Mise en cache des prompts

La mise en cache des prompts réduit la latence et le coût lorsque les requêtes réutilisent le même long préfixe. Utilisez le paramètre **Mise en cache des prompts** dans le panneau latéral d’Unsloth pour contrôler le comportement de mise en cache pour les connexions prises en charge.

<figure><img src="/files/ba383fce34ff4f8414f62d082fe7d4a954f62a23" alt="" width="375"><figcaption></figcaption></figure>

Avec llama.cpp, la mise en cache des prompts est activée par défaut et peut être désactivée au démarrage\
`llama-server` avec :

```bash
--no-cache-prompt
```

### **Arguments courants de llama-server**

L’exemple ci-dessus n’utilise que les paramètres de connexion requis. Vous pouvez ajouter d’autres arguments llama-server en fonction de votre modèle et de votre matériel.

Les options courantes incluent :

```bash
  --ctx-size 8192 \        # Définir la longueur du contexte
  --parallel 2 \           # Définir le nombre de slots parallèles
  --flash-attn on \        # Activer Flash Attention lorsqu’elle est prise en charge
  --jinja \                # Utiliser le modèle de chat du modèle
  --api-key 1234-key \     # Exiger une clé API
  --no-cache-prompt        # Désactiver la mise en cache des prompts
```

Pour la liste complète des arguments du serveur, consultez le [README du serveur llama.cpp officiel](https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md).


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/integrations/connections/connecter-llama.cpp-a-unsloth-executer-des-gguf-avec-llama-server.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
