For the complete documentation index, see llms.txt. This page is also available as Markdown.

So verbindest du Ollama mit Unsloth

Ollama ermöglicht es dir, lokale LLMs auf deiner eigenen Hardware auszuführen, und Unsloth macht es einfach, diese Modelle direkt mit einer Open-Source-UI-Chat-Oberfläche zu verbinden und auszuführen. In diesem Leitfaden lernst du, wie du Ollama installierst, native Ollama-Modelle oder GGUF-Modelle von Hugging Face ausführst, Ollama mit Unsloth verbindest und mit lokalen KI-Modellen zu chatten beginnst.

Egal, ob du Modelle wie Qwenverwenden, eine GGUF-Datei importieren oder deinen lokalen Ollama-Server über einen OpenAI-kompatiblen Endpunkt bereitstellen möchtest – diese Anleitung deckt das gesamte Setup von der Installation bis zum ersten Chat ab.

Einrichtung

1

Ollama installieren oder vorbereiten

Installiere Ollama mit dem Installationsskript:

curl -fsSL https://ollama.com/install.sh | sh

Du kannst Ollama auch manuell herunterladen von ollama.com/download.

Ollama läuft normalerweise unter:

http://localhost:11434
2

Ein Modell ausführen

Du kannst ein Modell auf zwei gängige Arten auswählen:

  • Suche native Ollama-Modelle unter ollama.com/search, dann kopiere den Modellnamen.

  • Verwende ein GGUF-Modell von Hugging Face und kopiere dann den Ollama-Befehl von Dieses Modell verwenden.

Für ein Ollama-Modell: herunterladen und ausführen:

ollama pull qwen3.6:35b-a3b
ollama run qwen3.6:35b-a3b

Wenn die Ollama-App oder der Dienst noch nicht läuft, starte ihn zuerst:

ollama serve

Ein GGUF von Hugging Face auswählen

Wenn du ein GGUF-Modell von Hugging Face verwendest, ist der einfachste Weg, den Befehl zu erhalten, über die Modellseite.

Öffne das Modell, das du verwenden möchtest, klicke auf Dieses Modell verwendenund wähle dann Ollama aus der Liste der lokalen Apps. Wähle die gewünschte Quantisierung aus dem Dropdown-Menü und kopiere dann den generierten Befehl.

Zum Beispiel mit Ollama:

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_XL

So vermeidest du Fehler beim Repo-Namen oder beim Quantisierungs-Tag.

3

Ollama mit Unsloth verbinden

Öffne Einstellungen → Verbindungen, dann klicke auf Verbindung hinzufügen.

Wähle Ollamaaus und gib dann deine Verbindungsdetails ein:

Verwende die in der Unsloth-Formular angezeigte Ollama-URL. In den meisten lokalen Setups ist das:

http://localhost:11434

Wenn Unsloth eine OpenAI-kompatible Basis-URL verlangt, verwende:

http://localhost:11434/v1

Ollama benötigt normalerweise keinen API-Schlüssel. Lass das Feld für den API-Schlüssel leer, außer du verwendest einen Proxy, der einen erfordert.

Klicke auf Modelle laden um die in Ollama laufenden Modelle abzurufen, oder gib die Modell-ID selbst ein, zum Beispiel qwen3.6.

4

Bereit zum Chatten

Nachdem du auf Verbindung hinzufügengeklickt hast, werden die von dir aktivierten Modelle nun unter Verbunden im Modell auswählen Dropdown angezeigt.

Häufige Ollama-Befehle

Verwende diese beim Einrichten des Modells, das du für Unsloth freigeben möchtest:

Befehl
Was er bewirkt

ollama run qwen3.6:35b-a3b

Ein Modell ausführen und einen interaktiven Chat öffnen

ollama pull qwen3.6:35b-a3b

Ein Modell herunterladen, ohne den Chat zu starten

ollama ls

Heruntergeladene Modelle auflisten

ollama ps

Aktuell laufende Modelle auflisten

ollama stop qwen3.6:35b-a3b

Ein laufendes Modell stoppen

ollama rm qwen3.6:35b-a3b

Ein heruntergeladenes Modell entfernen

ollama serve

Den Ollama-Server starten

Wenn du ein lokales GGUF in Ollama importierst, erstelle ein Modelfile, dann führe aus:

ollama create -f Modelfile

Wenn Ollama nicht erkannt wird, stelle sicher, dass die Ollama-App oder der Dienst läuft. Klicke dann erneut auf Modelle laden in Unsloth.

Die vollständige Befehlsliste findest du in der Ollama-CLI-Referenz.

Zuletzt aktualisiert

War das hilfreich?