ローカルチャット推論のためにvLLMをUnslothに接続
最終更新
役に立ちましたか?
接続方法を学ぶ vLLM を Unsloth vLLM の OpenAI 互換 API を使って オープンソースの UI チャットインターフェース内で、モデルを提供し、ローカルでそれらとチャットできるようにします。このガイドでは、vLLM のインストール、ローカル vLLM サーバーの起動、API ベース URL の設定、利用可能なモデル ID の読み込み、ホストされた vLLM モデルの選択までを説明します。
最後まで進めると、vLLM で提供されるモデルがローカルモデルと並んで表示され、UI チャットインターフェースから外部 LLM 推論を高速かつ柔軟に実行できるようになります。
まず vLLM をインストールして、 vllm serve コマンドを実行できるようにします。公式の vLLM インストールガイド を、お使いのプラットフォームとハードウェアに合わせて参照してください。
インストール後、ターミナルで vLLM が動作することを確認します: vllm --help
開く 設定 → 接続、次にクリック 接続を追加.
選択 vLLMを選択し、サーバー情報を入力します。

vLLM サーバーの詳細を入力してください:
API キー: vLLM を --api-key 付きで起動していない限り空欄のままにします
ベース URL: 例: http://localhost:8000/v1
推論モデル: 提供されるモデルが思考をサポートしている場合はこれを有効にします
モデル ID: クリック モデルを読み込む、またはカスタム ID を手動で入力します
をクリックすると 接続を追加、有効にしたモデルが次の下に表示されます 接続 の下にある OpenRouter モデルを選択します。
上の例では、基本的な提供設定を使用しています。モデルやハードウェアに応じて、さらに vllm serve 引数を追加できます。
一般的なオプションには次が含まれます:
vllm serve unsloth/gemma-4-26B-A4B-it \
--dtype auto \
--host 0.0.0.0 \
--port 8000 \
--api-key token-abc123 \
--max-model-len 8192 \
--gpu-memory-utilization 0.9vLLM サーバー引数の完全な一覧については、公式の vLLM の OpenAI 互換サーバー ドキュメントを参照してください。
最終更新
役に立ちましたか?
役に立ちましたか?

