For the complete documentation index, see llms.txt. This page is also available as Markdown.

Arguments du moteur vLLM

Arguments du moteur vLLM, drapeaux et options pour servir des modèles sur vLLM.

Argument
Exemple et cas d’utilisation

--gpu-memory-utilization

Par défaut 0.9. Quantité de VRAM que vLLM peut utiliser. Réduisez si vous manquez de mémoire. Essayez de définir cette valeur à 0.95 ou 0.97.

--max-model-len

Définissez la longueur maximale de séquence. Réduisez-la si vous manquez de mémoire ! Par exemple, définissez --max-model-len 32768 pour n’utiliser que des longueurs de séquence de 32K.

--quantization

Utilisez fp8 pour la quantification dynamique en float8. Utilisez cela conjointement avec --kv-cache-dtype fp8 pour activer également le cache KV en float8.

--kv-cache-dtype

Utilisez fp8 pour le cache KV en float8 afin de réduire l’utilisation de mémoire de 50 %.

--port

La valeur par défaut est 8000. Comment accéder au localhost de vLLM, c’est-à-dire http://localhost:8000

--api-key

Optionnel - Définissez le mot de passe (ou aucun mot de passe) pour accéder au modèle.

--tensor-parallel-size

La valeur par défaut est 1. Divise le modèle entre les tenseurs. Définissez cette valeur en fonction du nombre de GPU que vous utilisez - si vous en avez 4, définissez-la à 4. 8, alors 8. Vous devez avoir NCCL, sinon cela pourrait être lent.

--pipeline-parallel-size

La valeur par défaut est 1. Divise le modèle entre les couches. Utilisez cela avec --pipeline-parallel-size où TP est utilisé à l’intérieur de chaque nœud, et PP est utilisé pour les configurations multi-nœuds (définissez PP sur le nombre de nœuds)

--enable-lora

Active le service LoRA. Utile pour servir des LoRA affinés avec Unsloth.

--max-loras

Combien de LoRA vous souhaitez servir en même temps. Définissez cette valeur à 1 pour 1 LoRA, ou par exemple 16. Il s’agit d’une file d’attente, donc les LoRA peuvent être permutés à chaud.

--max-lora-rank

Rang maximal de tous les LoRA. Les choix possibles sont 8, 16, 32, 64, 128, 256, 320, 512

--dtype

Permet auto, bfloat16, float16 Le float8 et les autres quantifications utilisent un autre drapeau - voir --quantization

--tokenizer

Spécifiez le chemin du tokenizer comme unsloth/gpt-oss-20b si le modèle servi a un tokenizer différent.

--hf-token

Ajoutez votre jeton HuggingFace si nécessaire pour les modèles à accès restreint

--swap-space

La valeur par défaut est 4 Go. Utilisation du déchargement sur CPU. Réduisez si vous avez de la VRAM, ou augmentez pour les GPU à faible mémoire.

--seed

La valeur par défaut est 0 pour vLLM

--disable-log-stats

Désactive la journalisation comme le débit, les requêtes serveur.

--enforce-eager

Désactive la compilation. Plus rapide à charger, mais plus lent pour l’inférence.

--disable-cascade-attn

Utile pour les exécutions d’apprentissage par renforcement pour vLLM < 0.11.0, car Cascade Attention présentait un léger bug sur les GPU A100 (Unsloth corrige cela)

🎉Quantification Float8

Par exemple, pour héberger Llama 3.3 70B Instruct (prend en charge une longueur de contexte de 128K) avec le cache KV Float8 et la quantification, essayez :

🍧Permutation à chaud des LoRA / LoRA dynamiques

Pour permettre le service LoRA pour au plus 4 LoRA à la fois (celles-ci sont permutées à chaud / modifiées), commencez par définir le drapeau d’environnement pour autoriser la permutation à chaud :

Voir notre Guide de permutation à chaud LoRA pour plus de détails.

Mis à jour

Ce contenu vous a-t-il été utile ?