For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM-Engine-Argumente

vLLM-Engine-Argumente, Flags und Optionen zum Bereitstellen von Modellen mit vLLM.

Argument
Beispiel und Anwendungsfall

--gpu-memory-utilization

Standard 0,9. Wie viel VRAM-Nutzung vLLM verwenden kann. Reduzieren, wenn der Speicher knapp wird. Versuchen Sie, dies auf 0,95 oder 0,97 zu setzen.

--max-model-len

Maximale Sequenzlänge festlegen. Reduzieren Sie dies, wenn der Speicher knapp wird! Zum Beispiel setzen Sie --max-model-len 32768 um nur 32K-Sequenzlängen zu verwenden.

--quantization

Verwenden Sie fp8 für dynamische Float8-Quantisierung. Verwenden Sie dies zusammen mit --kv-cache-dtype fp8, um auch den Float8-KV-Cache zu aktivieren.

--kv-cache-dtype

Verwenden Sie fp8 für den Float8-KV-Cache, um den Speicherverbrauch um 50 % zu reduzieren.

--port

Standard ist 8000. So greifen Sie auf den lokalen Host von vLLM zu, z. B. http://localhost:8000

--api-key

Optional - Legen Sie das Passwort (oder kein Passwort) fest, um auf das Modell zuzugreifen.

--tensor-parallel-size

Standard ist 1. Teilt das Modell über Tensoren auf. Setzen Sie dies auf die Anzahl der GPUs, die Sie verwenden - wenn Sie 4 haben, setzen Sie dies auf 4. 8, dann 8. Sie sollten NCCL haben, andernfalls könnte dies langsam sein.

--pipeline-parallel-size

Standard ist 1. Teilt das Modell über Schichten auf. Verwenden Sie dies mit --pipeline-parallel-size wobei TP innerhalb jedes Knotens verwendet wird und PP über Multi-Node-Setups hinweg verwendet wird (setzen Sie PP auf die Anzahl der Knoten)

--enable-lora

Aktiviert die Bereitstellung von LoRA. Nützlich für die Bereitstellung von mit Unsloth feinabgestimmten LoRAs.

--max-loras

Wie viele LoRAs Sie gleichzeitig bereitstellen möchten. Setzen Sie dies auf 1 für 1 LoRA oder z. B. auf 16. Dies ist eine Warteschlange, sodass LoRAs per Hot-Swap ausgetauscht werden können.

--max-lora-rank

Maximaler Rang aller LoRAs. Mögliche Optionen sind 8, 16, 32, 64, 128, 256, 320, 512

--dtype

Ermöglicht wird sauber zugeordnet: Anthropic, bfloat16, float16 Float8 und andere Quantisierungen verwenden einen anderen Schalter - siehe --quantization

--tokenizer

Geben Sie den Tokenizer-Pfad an, z. B. unsloth/gpt-oss-20b wenn das bereitgestellte Modell einen anderen Tokenizer hat.

--hf-token

Fügen Sie bei Bedarf Ihr HuggingFace-Token für geschützte Modelle hinzu

--swap-space

Standard ist 4 GB. CPU-Offloading-Nutzung. Reduzieren, wenn Sie VRAM haben, oder erhöhen für GPUs mit wenig Speicher.

--seed

Standard ist 0 für vLLM

--disable-log-stats

Deaktiviert Protokollierung wie Durchsatz, Serveranfragen.

--enforce-eager

Deaktiviert die Kompilierung. Schneller zu laden, aber langsamer bei der Inferenz.

--disable-cascade-attn

Nützlich für Reinforcement-Learning-Läufe für vLLM < 0.11.0, da Cascade Attention auf A100-GPUs leicht fehlerhaft war (Unsloth behebt dies)

🎉Float8-Quantisierung

Um beispielsweise Llama 3.3 70B Instruct (unterstützt 128K Kontextlänge) mit Float8-KV-Cache und Quantisierung zu hosten, versuchen Sie:

🍧LoRA-Hot-Swapping / dynamische LoRAs

Um das Bereitstellen von LoRAs für höchstens 4 LoRAs gleichzeitig zu ermöglichen (diese werden „hot swapped“ / geändert), setzen Sie zuerst das Umgebungs-Flag, um Hot Swapping zu erlauben:

Siehe unser Leitfaden zum Hot-Swapping von LoRA für weitere Details.

Zuletzt aktualisiert

War das hilfreich?