Wie man Modelle mit Unsloth Studio ausführt
Führe KI-Modelle, LLMs und GGUFs lokal mit Unsloth Studio aus.
Unsloth Studio ermöglicht es dir, KI-Modelle 100 % offline auf deinem Computer auszuführen. Führe Modellformate wie GGUF und safetensors von Hugging Face oder aus deinen lokalen Dateien aus.
Funktioniert auf allen macOS-, CPU-, Windows-, Linux- und WSL-Setups! Keine GPU erforderlich
Selbstheilende Tool-Aufrufe, erweitert Websuche, Codeausführung
Verwende Unsloth als eine OpenAI-kompatible Inferenz- API-Endpunkt oder verbinde einen Anbieter
Suche + Herunterladen + Ausführen + Vergleichen jedes Modell wie GGUFs, LoRA-Adapter, safetensors usw.
Automatische Inferenzparameter Tuning (temp, top-p usw.) und bearbeite Chat-Vorlagen
Lade Bilder, Audio, PDFs, Code, DOCX und mehr Dateitypen hoch, um damit zu chatten.

Verwendung von Unsloth Studio Chat
Unsloth Studio Chat funktioniert automatisch auf Multi-GPU-Setups für die Inferenz.
Codeausführung
Unsloth Studio ermöglicht es LLMs, Bash und Python auszuführen, nicht nur JavaScript. Außerdem werden Programme wie Claude Artifacts in einer Sandbox isoliert, sodass Modelle Code testen, Dateien generieren und Antworten mit echter Berechnung verifizieren können.
Dadurch werden Antworten von Modellen zuverlässiger und genauer.

Automatische Selbstheilung bei Tool-Aufrufen
Unsloth Studio ermöglicht nicht nur Tool-Aufrufe, sondern behebt auch fehlerhafte oder defekte Tool-Aufrufe automatisch um 50 %.
Das bedeutet, dass du immer Inferenz-Ausgaben erhältst ohne defekte Tool-Aufrufe.
Z. B. suchte Qwen3.5-4B auf über 20 Websites und zitierte Quellen, wobei die Websuche innerhalb seines Denkvorgangs stattfand.

Erweiterte Websuche
Unsloths unbegrenzte und sichere Websuche besucht tatsächlich Seiten direkt, um relevante Informationen und Daten zu sammeln, und scannt nicht nur Website-Zusammenfassungen. Dadurch entstehen viel genauere / detailliertere Informationen und mehr Kontext in den Ausgaben. Die Suche verwendet die private und sichere API von DuckDuckGo.

Verwende Unsloth als API-Endpunkt
Du kannst lokale LLMs jetzt über Tools wie Claude Code und Codex verwenden, indem du sie mit Unsloths API-Endpunkt. Das bedeutet, dass du Qwen- und Gemma-Modelle direkt in diesen Tools mit Unsloths Inferenz ausführen kannst, einschließlich Funktionen wie selbstheilenden Tool-Aufrufen, Websuche usw.

Automatische Inferenz-Einstellungen
Inferenzparameter wie Temperatur, top-p, top-k, MTP werden für neue Modelle wie Qwen3.5 automatisch voreingestellt, damit du die besten Ergebnisse erhältst, ohne dir um Einstellungen Gedanken machen zu müssen. Du kannst Parameter auch manuell anpassen und den System-Prompt bearbeiten.
Eine Anpassung der Kontextlänge ist mit dem intelligenten Auto-Kontext von llama.cpp nicht mehr nötig, da nur der benötigte Kontext verwendet wird, ohne etwas Zusätzliches zu laden.

Provider verbinden
Unsloth verbindet mit OpenAI, Anthropic, Ollama, llama.cpp, vLLM und anderen.
Füge API-Schlüssel oder Modellserver-URLs hinzu und verwende dann externe Modelle in derselben Chat-Oberfläche wie lokale + Cloud-Modelle. Ausführen mit Prompt-Cachingsowie Tool-Aufrufen, Thinking und anbietereigenen Funktionen wie OpenAIs Websuche und Codeausführung.

Modelle suchen und ausführen
Du kannst jedes Modell über Hugging Face suchen und herunterladen oder lokale Dateien verwenden.
Unsloth unterstützt eine breite Palette von Modelltypen, darunter GGUF, Vision-Language- und Text-zu-Sprache-Modelle. Führe die neuesten Modelle wie Qwen3.5 oder NVIDIA Nemotron 3.
Lade Bilder, Audio, PDFs, Code, DOCX und mehr Dateitypen hoch, um damit zu chatten.


+50 % Genauigkeit bei Tool-Aufrufen
Unsloth bietet mehrere einzigartige Funktionen zur Verbesserung von Tool-Aufrufen, darunter:
Tool-Aufrufe über alle Modelle in Unsloth sind 30 % bis 80 % genauer.
Die Websuche ruft tatsächliche Webinhalte statt nur Zusammenfassungen ab.
Die maximale Anzahl erlaubter Tool-Aufrufe beträgt mehr als 25.
Tool-Aufrufe werden zuverlässiger beendet, wodurch Schleifen und wiederholte Aufrufe reduziert werden.
Verbesserte Logik zur Reparatur und Deduplizierung von Tool-Aufrufen hilft, zu verhindern, dass XML in Ausgaben gelangt.
Sieh dir Testergebnisse mit unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) mit aktiviertem Websuche, Codeausführung und Thinking an:
XML-Leaks in der Antwort
10/10
0/10
Verwendete URL-Abrufe
0
4/10 Durchläufe
Durchläufe mit korrekten Songnamen
0/10
2/10
Durchschnittliche Anzahl an Tool-Aufrufen
5.5
3.8
Durchschnittliche Antwortzeit
12,3 s
9,8 s
Modell-Arena
Mit Unsloth Chat kannst du zwei beliebige Modelle mit demselben Prompt nebeneinander vergleichen. Z. B. das Basismodell und den LoRA-Adapter. Zuerst wird die Inferenz für ein Modell geladen, dann für das zweite (parallele Inferenz wird gerade entwickelt).

Nach dem Training kannst du das Basis- und das feinabgestimmte Modell nebeneinander mit demselben Prompt vergleichen, um zu sehen, was sich geändert hat und ob sich die Ergebnisse verbessert haben.
Dieser Workflow macht es einfach zu sehen, wie dein Fine-Tuning die Antworten des Modells verändert hat und ob es die Ergebnisse für deinen Anwendungsfall verbessert hat.

Unsloth Studio Chat funktioniert automatisch auf Multi-GPU-Setups für die Inferenz.
Verwendung alter / vorhandener GGUF-Modelle
Update vom 1. April: Du kannst jetzt einen vorhandenen Ordner auswählen, den Unsloth erkennen soll.
Update vom 27. März: Unsloth Studio erkennt jetzt ältere / bereits vorhandene Modelle automatisch heruntergeladen von Hugging Face, LM Studio usw.

Manuelle Anweisungen: Unsloth Studio erkennt Modelle, die in deinem Hugging-Face-Hub-Cache heruntergeladen wurden (C:\Users{your_username}.cache\huggingface\hub). Wenn du GGUF-Modelle über LM Studio heruntergeladen hast, beachte, dass diese in C:\Users\{your_username}.cache\lm-studio\models ODER C:\Users{your_username}\lm-studio\models gespeichert werden und standardmäßig für llama.cpp nicht sichtbar sind - du musst diese .gguf-Dateien in dein Hugging-Face-Hub-Cache-Verzeichnis (oder einen anderen für llama.cpp zugänglichen Pfad) verschieben oder kopieren, damit Unsloth Studio sie laden kann.
Nachdem du ein Modell oder einen Adapter in Unsloth feinabgestimmt hast, kannst du ihn nach GGUF exportieren und die lokale Inferenz direkt in Unsloth Chat mit llama.cpp ausführen. Unsloth Studio wird von llama.cpp und Hugging Face unterstützt.
Dateien als Kontext hinzufügen
Unsloth Chat unterstützt multimodale Eingaben direkt im Gespräch. Du kannst Dokumente, Bilder oder Audio als zusätzlichen Kontext für einen Prompt anhängen.

Dadurch lässt sich leicht testen, wie ein Modell mit realen Eingaben wie PDFs, Screenshots oder Referenzmaterial umgeht. Dateien werden lokal verarbeitet und als Kontext für das Modell einbezogen.
Modelldateien löschen
Du kannst alte Modelldateien entweder über das Papierkorb-Symbol in der Modellsuche löschen oder den entsprechenden zwischengespeicherten Modellordner aus dem Standardverzeichnis des Hugging-Face-Caches entfernen. Standardmäßig verwendet Hugging Face ~/.cache/huggingface/hub/ auf macOS/Linux/WSL und C:\Users\<username>\.cache\huggingface\hub\ unter Windows.
macOS, Linux, WSL:
~/.cache/huggingface/hub/Windows:
%USERPROFILE%\.cache\huggingface\hub\
Wenn HF_HUB_CACHE oder HF_HOME gesetzt ist, verwende stattdessen diesen Speicherort. Unter Linux und WSL, XDG_CACHE_HOME kann auch das Standard-Cache-Root ändern.
Unsloth erkennt oder verwendet meine GPU nicht
Wenn das Modell speziell für Docker nicht deine GPU verwendet, versuche Folgendes:
Das neueste Image manuell ziehen:
Den Container mit GPU-Zugriff starten:
docker run:--gpus allDocker Compose:
capabilities: [gpu]
Unter Linux stelle sicher, dass das NVIDIA Container Toolkit installiert ist.
Unter Windows:
Prüfe, dass
nvcc --versionmit der CUDA-Version übereinstimmt, die innvidia-smiangezeigt wird Folge: https://docs.docker.com/desktop/features/gpu/
Zuletzt aktualisiert
War das hilfreich?

