For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM mit Unsloth für lokale Chat-Inferenz verbinden

Erfahre, wie du dich verbindest vLLM mit Unsloth unter Verwendung von vLLMs OpenAI-kompatible API damit du Modelle bereitstellen und lokal über eine Open-Source-UI-Chatoberfläche mit ihnen chatten kannst. Diese Anleitung führt dich durch die Installation von vLLM, das Starten eines lokalen vLLM-Servers, das Konfigurieren der API-Basis-URL, das Laden verfügbarer Modell-IDs und das Auswählen deines gehosteten vLLM-Modells.

Am Ende werden deine von vLLM bereitgestellten Modelle neben lokalen Modellen angezeigt, sodass du auf einfache und flexible Weise externe LLM-Inferenz über eine UI-Chatoberfläche ausführen kannst.

Einrichtung

1

vLLM installieren

Installiere vLLM zuerst, damit du den vllm serve Befehl ausführen kannst. Folge der offiziellen vLLM-Installationsanleitung für deine Plattform und Hardware.

Nachdem du es installiert hast, prüfe im Terminal, ob vLLM funktioniert: vllm --help

2

Wähle ein Modell aus

vLLM stellt Modelle von Hugging Face bereit.

Starte zum Beispiel einen vLLM-Server mit einem Unsloth-Modell:

vllm serve unsloth/gemma-4-26B-A4B-it 
\ --dtype auto

Dies stellt einen API-Endpunkt bereit unter:

http://localhost:8000/v1

Um einen API-Schlüssel zu verlangen, füge hinzu:

--api-key token-abc123
3

Verbinde vLLM mit Unsloth

Öffnen Sie Einstellungen → Verbindungen, klicken Sie dann auf Verbindung hinzufügen.

Wählen Sie vLLM, und gib dann deine Serverdetails ein.

Gib deine vLLM-Serverdetails ein:

  • API-Schlüssel: leer lassen, außer du hast vLLM mit --api-key gestartet

  • Basis-URL: zum Beispiel http://localhost:8000/v1

  • Reasoning-Modell: aktiviere dies, wenn das bereitgestellte Modell Thinking unterstützt

  • Modell-IDs: klicken Sie auf Modelle laden, oder gib benutzerdefinierte IDs manuell ein

Nachdem du auf Verbindung hinzufügengeklickt hast, werden die von dir aktivierten Modelle unter Verbindung im Modellauswahlmenü aus.

4

Bereit zum Chatten

Nachdem du die Verbindung gespeichert hast, wird dein vLLM-Modell unter Verbunden im Modell-Dropdown angezeigt. Wähle es aus, um das Chatten über deinen vLLM-Server zu starten.

Wenn dein vLLM-Server langsam reagiert (insbesondere während des Modellladens), kannst du das Timeout anpassen:

AIOHTTP_CLIENT_TIMEOUT_MODEL_LIST=30

Häufige vLLM-Argumente

Das obige Beispiel verwendet die grundlegenden Serving-Einstellungen. Du kannst je nach deinem Modell und deiner Hardware weitere vllm serve-Argumente hinzufügen.

Zu den häufigen Optionen gehören:

vllm serve unsloth/gemma-4-26B-A4B-it \
  --dtype auto \
  --host 0.0.0.0 \
  --port 8000 \
  --api-key token-abc123 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.9

Die vollständige Liste der vLLM-Serverargumente findest du in der offiziellen vLLM OpenAI-kompatiblen Server Dokumentation.

Zuletzt aktualisiert

War das hilfreich?