vLLM-Engine-Argumente
vLLM-Engine-Argumente, Flags und Optionen zum Bereitstellen von Modellen mit vLLM.
--gpu-memory-utilization
Standard 0,9. Wie viel VRAM-Nutzung vLLM verwenden kann. Reduzieren, wenn der Speicher knapp wird. Versuchen Sie, dies auf 0,95 oder 0,97 zu setzen.
--max-model-len
Maximale Sequenzlänge festlegen. Reduzieren Sie dies, wenn der Speicher knapp wird! Zum Beispiel setzen Sie --max-model-len 32768 um nur 32K-Sequenzlängen zu verwenden.
--quantization
Verwenden Sie fp8 für dynamische Float8-Quantisierung. Verwenden Sie dies zusammen mit --kv-cache-dtype fp8, um auch den Float8-KV-Cache zu aktivieren.
--kv-cache-dtype
Verwenden Sie fp8 für den Float8-KV-Cache, um den Speicherverbrauch um 50 % zu reduzieren.
--port
Standard ist 8000. So greifen Sie auf den lokalen Host von vLLM zu, z. B. http://localhost:8000
--api-key
Optional - Legen Sie das Passwort (oder kein Passwort) fest, um auf das Modell zuzugreifen.
--tensor-parallel-size
Standard ist 1. Teilt das Modell über Tensoren auf. Setzen Sie dies auf die Anzahl der GPUs, die Sie verwenden - wenn Sie 4 haben, setzen Sie dies auf 4. 8, dann 8. Sie sollten NCCL haben, andernfalls könnte dies langsam sein.
--pipeline-parallel-size
Standard ist 1. Teilt das Modell über Schichten auf. Verwenden Sie dies mit --pipeline-parallel-size wobei TP innerhalb jedes Knotens verwendet wird und PP über Multi-Node-Setups hinweg verwendet wird (setzen Sie PP auf die Anzahl der Knoten)
--enable-lora
Aktiviert die Bereitstellung von LoRA. Nützlich für die Bereitstellung von mit Unsloth feinabgestimmten LoRAs.
--max-loras
Wie viele LoRAs Sie gleichzeitig bereitstellen möchten. Setzen Sie dies auf 1 für 1 LoRA oder z. B. auf 16. Dies ist eine Warteschlange, sodass LoRAs per Hot-Swap ausgetauscht werden können.
--max-lora-rank
Maximaler Rang aller LoRAs. Mögliche Optionen sind 8, 16, 32, 64, 128, 256, 320, 512
--dtype
Ermöglicht wird sauber zugeordnet: Anthropic, bfloat16, float16 Float8 und andere Quantisierungen verwenden einen anderen Schalter - siehe --quantization
--tokenizer
Geben Sie den Tokenizer-Pfad an, z. B. unsloth/gpt-oss-20b wenn das bereitgestellte Modell einen anderen Tokenizer hat.
--hf-token
Fügen Sie bei Bedarf Ihr HuggingFace-Token für geschützte Modelle hinzu
--swap-space
Standard ist 4 GB. CPU-Offloading-Nutzung. Reduzieren, wenn Sie VRAM haben, oder erhöhen für GPUs mit wenig Speicher.
--seed
Standard ist 0 für vLLM
--disable-log-stats
Deaktiviert Protokollierung wie Durchsatz, Serveranfragen.
--enforce-eager
Deaktiviert die Kompilierung. Schneller zu laden, aber langsamer bei der Inferenz.
--disable-cascade-attn
Nützlich für Reinforcement-Learning-Läufe für vLLM < 0.11.0, da Cascade Attention auf A100-GPUs leicht fehlerhaft war (Unsloth behebt dies)
🎉Float8-Quantisierung
Um beispielsweise Llama 3.3 70B Instruct (unterstützt 128K Kontextlänge) mit Float8-KV-Cache und Quantisierung zu hosten, versuchen Sie:
🍧LoRA-Hot-Swapping / dynamische LoRAs
Um das Bereitstellen von LoRAs für höchstens 4 LoRAs gleichzeitig zu ermöglichen (diese werden „hot swapped“ / geändert), setzen Sie zuerst das Umgebungs-Flag, um Hot Swapping zu erlauben:
Siehe unser Leitfaden zum Hot-Swapping von LoRA für weitere Details.
Zuletzt aktualisiert
War das hilfreich?

