For the complete documentation index, see llms.txt. This page is also available as Markdown.

ローカルチャット推論のためにvLLMをUnslothに接続

接続方法を学ぶ vLLM を Unsloth vLLM の OpenAI 互換 API を使って オープンソースの UI チャットインターフェース内で、モデルを提供し、ローカルでそれらとチャットできるようにします。このガイドでは、vLLM のインストール、ローカル vLLM サーバーの起動、API ベース URL の設定、利用可能なモデル ID の読み込み、ホストされた vLLM モデルの選択までを説明します。

最後まで進めると、vLLM で提供されるモデルがローカルモデルと並んで表示され、UI チャットインターフェースから外部 LLM 推論を高速かつ柔軟に実行できるようになります。

セットアップ

1

vLLM をインストールする

まず vLLM をインストールして、 vllm serve コマンドを実行できるようにします。公式の vLLM インストールガイド を、お使いのプラットフォームとハードウェアに合わせて参照してください。

インストール後、ターミナルで vLLM が動作することを確認します: vllm --help

2

モデルを選択する

vLLM は Hugging Face のモデルを提供します。

たとえば、Unsloth モデルで vLLM サーバーを起動します:

vllm serve unsloth/gemma-4-26B-A4B-it 
\ --dtype auto

これにより、次の API エンドポイントが公開されます:

http://localhost:8000/v1

API キーを必須にするには、次を追加します:

--api-key token-abc123
3

vLLM を Unsloth に接続する

開く 設定 → 接続、次にクリック 接続を追加.

選択 vLLMを選択し、サーバー情報を入力します。

vLLM サーバーの詳細を入力してください:

  • API キー: vLLM を --api-key 付きで起動していない限り空欄のままにします

  • ベース URL: 例: http://localhost:8000/v1

  • 推論モデル: 提供されるモデルが思考をサポートしている場合はこれを有効にします

  • モデル ID: クリック モデルを読み込む、またはカスタム ID を手動で入力します

をクリックすると 接続を追加、有効にしたモデルが次の下に表示されます 接続 の下にある OpenRouter モデルを選択します。

4

チャットの準備完了

接続を保存すると、vLLM モデルが次の下に表示されます 接続済み モデルのドロップダウンで。選択すると、vLLM サーバー経由でチャットを開始できます。

vLLM サーバーの応答が遅い場合(特にモデルの読み込み中)は、タイムアウトを調整できます:

AIOHTTP_CLIENT_TIMEOUT_MODEL_LIST=30

一般的な vLLM 引数

上の例では、基本的な提供設定を使用しています。モデルやハードウェアに応じて、さらに vllm serve 引数を追加できます。

一般的なオプションには次が含まれます:

vllm serve unsloth/gemma-4-26B-A4B-it \
  --dtype auto \
  --host 0.0.0.0 \
  --port 8000 \
  --api-key token-abc123 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.9

vLLM サーバー引数の完全な一覧については、公式の vLLM の OpenAI 互換サーバー ドキュメントを参照してください。

最終更新

役に立ちましたか?