For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM 引擎参数

vLLM 引擎参数、标志和选项,用于在 vLLM 上部署模型。

参数
示例与使用场景

--gpu-memory-utilization

默认 0.9。vLLM 可使用多少显存。若发生内存不足请降低。可尝试设置为 0.95 或 0.97。

--max-model-len

设置最大序列长度。如果内存不足请降低这个值!例如设置 --max-model-len 32768 即可仅使用 32K 序列长度。

--quantization

使用 fp8 进行动态 float8 量化。请与以下参数配合使用: --kv-cache-dtype fp8 以同样启用 float8 KV 缓存。

--kv-cache-dtype

使用 fp8 用于 float8 KV 缓存,以将内存占用减少 50%。

--port

默认是 8000。如何访问 vLLM 的本地主机,即 http://localhost:8000

--api-key

可选 - 设置访问模型的密码(或不设密码)。

--tensor-parallel-size

默认是 1。将模型按张量切分。将其设置为你正在使用的 GPU 数量——如果有 4 块,就设为 4;8 块就设为 8。你应该安装 NCCL,否则这可能会很慢。

--pipeline-parallel-size

默认是 1。将模型按层切分。将其与以下参数一起使用: --pipeline-parallel-size 其中 TP 在每个节点内使用,PP 在多节点设置中使用(将 PP 设为节点数)

--enable-lora

启用 LoRA 服务。适合部署 Unsloth 微调后的 LoRA。

--max-loras

你希望一次部署多少个 LoRA。若只有 1 个 LoRA,就设为 1;或者比如设为 16。这是一个队列,因此 LoRA 可以热切换。

--max-lora-rank

所有 LoRA 的最大 rank。可选值为 8, 16, 32, 64, 128, 256, 320, 512

--dtype

允许 auto, bfloat16, float16 Float8 和其他量化方式使用不同的标志——请参见 --quantization

--tokenizer

指定 tokenizer 路径,例如 unsloth/gpt-oss-20b 如果部署的模型使用了不同的 tokenizer。

--hf-token

如果是受限模型,按需添加你的 HuggingFace token

--swap-space

默认是 4GB。CPU 卸载所用空间。如果你有足够显存可降低;如果 GPU 内存较小则可增加。

--seed

vLLM 的默认值是 0

--disable-log-stats

禁用吞吐量、服务器请求等日志记录。

--enforce-eager

禁用编译。加载更快,但推理更慢。

--disable-cascade-attn

对于 vLLM < 0.11.0 的强化学习运行很有用,因为 Cascade Attention 在 A100 GPU 上有些小问题(Unsloth 已修复此问题)

🎉Float8 量化

例如,要使用 Float8 KV 缓存和量化来部署 Llama 3.3 70B Instruct(支持 128K 上下文长度),可以尝试:

🍧LoRA 热切换 / 动态 LoRA

要启用最多同时 4 个 LoRA 的 LoRA 服务(这些会被热切换/更换),首先将环境标志设为允许热切换:

请参阅我们的 LoRA 热插拔指南 了解更多细节。

最后更新于

这有帮助吗?