For the complete documentation index, see llms.txt. This page is also available as Markdown.

LoRA ホットスワッピングガイド

🍧 vLLM LoRA ホットスワッピング / 動的 LoRA

一度に最大 4 つの LoRA を LoRA サービングで有効にするには(これらはホットスワップ/変更されます)、まずホットスワッピングを許可する環境フラグを設定します:

export VLLM_ALLOW_RUNTIME_LORA_UPDATING=True

次に、LoRA サポート付きでサービスを起動します:

export VLLM_ALLOW_RUNTIME_LORA_UPDATING=True
vllm serve unsloth/Llama-3.1-8B-Instruct \
    --quantization fp8 \
    --kv-cache-dtype fp8 \
    --gpu-memory-utilization 0.8 \
    --max-model-len 65536 \
    --enable-lora \
    --max-loras 4 \
    --max-lora-rank 64

LoRA を動的に読み込むには(LoRA 名も設定します)、次のようにします:

curl -X POST http://localhost:8000/v1/load_lora_adapter \
    -H "Content-Type: application/json" \
    -d '{
        "lora_name": "LORA_NAME",
        "lora_path": "/path/to/LORA"
    }'

プールから削除するには:

たとえば、Unsloth でファインチューニングする場合:

その後、学習後に LoRA を保存します:

その後、LoRA を読み込めます:

最終更新

役に立ちましたか?