> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/bases/inference-and-deployment/vllm-guide/vllm-engine-arguments.md).

# Arguments du moteur vLLM

Arguments du moteur vLLM, drapeaux et options pour servir des modèles sur vLLM.

<table><thead><tr><th width="212.9000244140625">Argument</th><th>Exemple et cas d’utilisation</th></tr></thead><tbody><tr><td><strong><code>--gpu-memory-utilization</code></strong></td><td>Par défaut 0.9. Quantité de VRAM que vLLM peut utiliser. Réduisez si vous manquez de mémoire. Essayez de définir cette valeur à 0.95 ou 0.97.</td></tr><tr><td><strong><code>--max-model-len</code></strong></td><td>Définissez la longueur maximale de séquence. Réduisez-la si vous manquez de mémoire ! Par exemple, définissez <strong><code>--max-model-len 32768</code></strong> pour n’utiliser que des longueurs de séquence de 32K.</td></tr><tr><td><strong><code>--quantization</code></strong></td><td>Utilisez fp8 pour la quantification dynamique en float8. Utilisez cela conjointement avec <strong><code>--kv-cache-dtype</code></strong> fp8 pour activer également le cache KV en float8.</td></tr><tr><td><strong><code>--kv-cache-dtype</code></strong></td><td>Utilisez <code>fp8</code> pour le cache KV en float8 afin de réduire l’utilisation de mémoire de 50 %.</td></tr><tr><td><strong><code>--port</code></strong></td><td>La valeur par défaut est 8000. Comment accéder au localhost de vLLM, c’est-à-dire http://localhost:8000</td></tr><tr><td><strong><code>--api-key</code></strong></td><td>Optionnel - Définissez le mot de passe (ou aucun mot de passe) pour accéder au modèle.</td></tr><tr><td><strong><code>--tensor-parallel-size</code></strong></td><td>La valeur par défaut est 1. Divise le modèle entre les tenseurs. Définissez cette valeur en fonction du nombre de GPU que vous utilisez - si vous en avez 4, définissez-la à 4. 8, alors 8. Vous devez avoir NCCL, sinon cela pourrait être lent.</td></tr><tr><td><strong><code>--pipeline-parallel-size</code></strong></td><td>La valeur par défaut est 1. Divise le modèle entre les couches. Utilisez cela avec <strong><code>--pipeline-parallel-size</code></strong> où TP est utilisé à l’intérieur de chaque nœud, et PP est utilisé pour les configurations multi-nœuds (définissez PP sur le nombre de nœuds)</td></tr><tr><td><strong><code>--enable-lora</code></strong></td><td>Active le service LoRA. Utile pour servir des LoRA affinés avec Unsloth.</td></tr><tr><td><strong><code>--max-loras</code></strong></td><td>Combien de LoRA vous souhaitez servir en même temps. Définissez cette valeur à 1 pour 1 LoRA, ou par exemple 16. Il s’agit d’une file d’attente, donc les LoRA peuvent être permutés à chaud.</td></tr><tr><td><strong><code>--max-lora-rank</code></strong></td><td>Rang maximal de tous les LoRA. Les choix possibles sont <code>8</code>, <code>16</code>, <code>32</code>, <code>64</code>, <code>128</code>, <code>256</code>, <code>320</code>, <code>512</code></td></tr><tr><td><strong><code>--dtype</code></strong></td><td>Permet <code>auto</code>, <code>bfloat16</code>, <code>float16</code> Le float8 et les autres quantifications utilisent un autre drapeau - voir <code>--quantization</code></td></tr><tr><td><strong><code>--tokenizer</code></strong></td><td>Spécifiez le chemin du tokenizer comme <code>unsloth/gpt-oss-20b</code> si le modèle servi a un tokenizer différent.</td></tr><tr><td><strong><code>--hf-token</code></strong></td><td>Ajoutez votre jeton HuggingFace si nécessaire pour les modèles à accès restreint</td></tr><tr><td><strong><code>--swap-space</code></strong></td><td>La valeur par défaut est 4 Go. Utilisation du déchargement sur CPU. Réduisez si vous avez de la VRAM, ou augmentez pour les GPU à faible mémoire.</td></tr><tr><td><strong><code>--seed</code></strong></td><td>La valeur par défaut est 0 pour vLLM</td></tr><tr><td><strong><code>--disable-log-stats</code></strong></td><td>Désactive la journalisation comme le débit, les requêtes serveur.</td></tr><tr><td><strong><code>--enforce-eager</code></strong></td><td>Désactive la compilation. Plus rapide à charger, mais plus lent pour l’inférence.</td></tr><tr><td><strong><code>--disable-cascade-attn</code></strong></td><td>Utile pour les exécutions d’apprentissage par renforcement pour vLLM &#x3C; 0.11.0, car Cascade Attention présentait un léger bug sur les GPU A100 (Unsloth corrige cela)</td></tr></tbody></table>

### :tada:Quantification Float8

Par exemple, pour héberger Llama 3.3 70B Instruct (prend en charge une longueur de contexte de 128K) avec le cache KV Float8 et la quantification, essayez :

```bash
vllm serve unsloth/Llama-3.3-70B-Instruct \\
    --quantization fp8 \
    --kv-cache-dtype fp8 \
    --gpu-memory-utilization 0.97 \\
    --max-model-len 65536
```

### :shaved\_ice:Permutation à chaud des LoRA / LoRA dynamiques

Pour permettre le service LoRA pour au plus 4 LoRA à la fois (celles-ci sont permutées à chaud / modifiées), commencez par définir le drapeau d’environnement pour autoriser la permutation à chaud :

Voir notre [Guide de permutation à chaud LoRA](/docs/fr/bases/inference-and-deployment/vllm-guide/lora-hot-swapping-guide.md) pour plus de détails.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/bases/inference-and-deployment/vllm-guide/vllm-engine-arguments.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
