For the complete documentation index, see llms.txt. This page is also available as Markdown.

Leitfaden zum Hot-Swapping von LoRA

🍧 vLLM LoRA Hot Swapping / Dynamische LoRAs

Um das Bereitstellen von LoRAs für höchstens 4 LoRAs gleichzeitig zu ermöglichen (diese werden „hot swapped“ / geändert), setzen Sie zuerst das Umgebungs-Flag, um Hot Swapping zu erlauben:

export VLLM_ALLOW_RUNTIME_LORA_UPDATING=True

Dann stellen Sie es mit LoRA-Unterstützung bereit:

export VLLM_ALLOW_RUNTIME_LORA_UPDATING=True
vllm serve unsloth/Llama-3.1-8B-Instruct \
    --quantization fp8 \
    --kv-cache-dtype fp8 \
    --gpu-memory-utilization 0.8 \
    --max-model-len 65536 \
    --enable-lora \
    --max-loras 4 \
    --max-lora-rank 64

Um eine LoRA dynamisch zu laden (setzen Sie ebenfalls den LoRA-Namen), machen Sie Folgendes:

curl -X POST http://localhost:8000/v1/load_lora_adapter \
    -H "Content-Type: application/json" \
    -d '{
        "lora_name": "LORA_NAME",
        "lora_path": "/path/to/LORA"
    }'

Um sie aus dem Pool zu entfernen:

Zum Beispiel beim Finetuning mit Unsloth:

Nach dem Training speichern wir dann die LoRAs:

Dann können wir die LoRA laden:

Zuletzt aktualisiert

War das hilfreich?