Arguments du moteur vLLM
Arguments du moteur vLLM, drapeaux et options pour servir des modèles sur vLLM.
--gpu-memory-utilization
Par défaut 0.9. Quantité de VRAM que vLLM peut utiliser. Réduisez si vous manquez de mémoire. Essayez de définir cette valeur à 0.95 ou 0.97.
--max-model-len
Définissez la longueur maximale de séquence. Réduisez-la si vous manquez de mémoire ! Par exemple, définissez --max-model-len 32768 pour n’utiliser que des longueurs de séquence de 32K.
--quantization
Utilisez fp8 pour la quantification dynamique en float8. Utilisez cela conjointement avec --kv-cache-dtype fp8 pour activer également le cache KV en float8.
--kv-cache-dtype
Utilisez fp8 pour le cache KV en float8 afin de réduire l’utilisation de mémoire de 50 %.
--port
La valeur par défaut est 8000. Comment accéder au localhost de vLLM, c’est-à-dire http://localhost:8000
--api-key
Optionnel - Définissez le mot de passe (ou aucun mot de passe) pour accéder au modèle.
--tensor-parallel-size
La valeur par défaut est 1. Divise le modèle entre les tenseurs. Définissez cette valeur en fonction du nombre de GPU que vous utilisez - si vous en avez 4, définissez-la à 4. 8, alors 8. Vous devez avoir NCCL, sinon cela pourrait être lent.
--pipeline-parallel-size
La valeur par défaut est 1. Divise le modèle entre les couches. Utilisez cela avec --pipeline-parallel-size où TP est utilisé à l’intérieur de chaque nœud, et PP est utilisé pour les configurations multi-nœuds (définissez PP sur le nombre de nœuds)
--enable-lora
Active le service LoRA. Utile pour servir des LoRA affinés avec Unsloth.
--max-loras
Combien de LoRA vous souhaitez servir en même temps. Définissez cette valeur à 1 pour 1 LoRA, ou par exemple 16. Il s’agit d’une file d’attente, donc les LoRA peuvent être permutés à chaud.
--max-lora-rank
Rang maximal de tous les LoRA. Les choix possibles sont 8, 16, 32, 64, 128, 256, 320, 512
--dtype
Permet auto, bfloat16, float16 Le float8 et les autres quantifications utilisent un autre drapeau - voir --quantization
--tokenizer
Spécifiez le chemin du tokenizer comme unsloth/gpt-oss-20b si le modèle servi a un tokenizer différent.
--hf-token
Ajoutez votre jeton HuggingFace si nécessaire pour les modèles à accès restreint
--swap-space
La valeur par défaut est 4 Go. Utilisation du déchargement sur CPU. Réduisez si vous avez de la VRAM, ou augmentez pour les GPU à faible mémoire.
--seed
La valeur par défaut est 0 pour vLLM
--disable-log-stats
Désactive la journalisation comme le débit, les requêtes serveur.
--enforce-eager
Désactive la compilation. Plus rapide à charger, mais plus lent pour l’inférence.
--disable-cascade-attn
Utile pour les exécutions d’apprentissage par renforcement pour vLLM < 0.11.0, car Cascade Attention présentait un léger bug sur les GPU A100 (Unsloth corrige cela)
🎉Quantification Float8
Par exemple, pour héberger Llama 3.3 70B Instruct (prend en charge une longueur de contexte de 128K) avec le cache KV Float8 et la quantification, essayez :
🍧Permutation à chaud des LoRA / LoRA dynamiques
Pour permettre le service LoRA pour au plus 4 LoRA à la fois (celles-ci sont permutées à chaud / modifiées), commencez par définir le drapeau d’environnement pour autoriser la permutation à chaud :
Voir notre Guide de permutation à chaud LoRA pour plus de détails.
Mis à jour
Ce contenu vous a-t-il été utile ?

