For the complete documentation index, see llms.txt. This page is also available as Markdown.

Modelle mit Unsloth auf AMD-GPUs trainieren & ausführen

Unsloth unterstützt jetzt offiziell AMD-Hardware und macht es einfach, Modelle lokal auf AMD-GPUs auszuführen, zu trainieren, feinabzustimmen, RL zu betreiben und bereitzustellen. Vollständig Open Source, Unsloth Studio funktioniert unter Windows, WSL und Linux und unterstützt AMDs Radeon RX 9000, 7000er-Serie, Instinct MI350- und MI300-Rechenzentrums-GPUs, Vulkan, Strix Halo-basierte Ryzen AI Max-Systeme und mehr.

Wir haben zusammengearbeitet mit AMD und unserer Community, um bis zu 2x schnelleres Training und 70 % weniger VRAM für alle Modelle ohne Genauigkeitsverlust zu ermöglichen. Wenn du keine GPU hast, unterstützt Unsloth weiterhin native AMD-Inferenz für Qwen3.6, Gemma 4, DeepSeek-V4, GLM 5.2, DiffusionGemma, Kimi K2.7 und andere Modelle.

SchnellstartFunktionenGitHub

Um Unsloth Studio auf AMD zu installieren, führe aus:

MacOS, Linux, WSL:

Windows PowerShell:

irm https://unsloth.ai/install.ps1 | iex 
Beispiel für eine 1-Bit-GLM-5.2-Ausführung mit Unsloth

⭐ Funktionen

Unsloth unterstützt auf AMD sowohl Inferenz als auch Training, sodass du, wenn du keine GPU und nur eine CPU hast, Modelle trotzdem mit Unsloth ausführen kannst. Bei der Verwendung von Unsloth erhältst du:

  • Tool-Call-Healing für Inferenz, um die Genauigkeit um 50 % zu erhöhen, unbegrenzte kostenlose Websuche, HTML-Canvas, sichere HTTPS-Bereitstellung über Cloudflare und Code-Ausführung alle Arbeit.

  • Trainiere Gemma-4-Modelle in 8 GB VRAM oder Qwen3.5 in 3 GB VRAM. Triton-Kernels, mathematische Algorithmen und Speichertricks ermöglichen auf AMD 70 % weniger VRAM-Verbrauch ohne Genauigkeitsverlust.

  • Bis zu 80 % weniger VRAM-Nutzung für Reinforcement Learning wie GRPO. Und Weight Sharing mit vLLM, um 50 % Speicherverbrauch zu sparen.

  • Optimierte Unterstützung für RDNA 3 und neuere GPUs sowie GPUs in Rechenzentrumsqualität. Strix Halo ist auch für Linux, WSL und Windows optimiert.

DiffusionGemma auf AMD-GPUs ausgeführt

⚡Schnellstart

Unsloth installiert automatisch die besten ROCm-Builds für PyTorch, llama.cpp-Prebuilds, bitsandbytes, ROCm-optimierte Kernel und Triton. Wir liefern außerdem unsere AMD-Optimierungen und -Fixes gemeinsam aus. Du kannst unseren ausführlicheren detaillierten Leitfaden hier für weitere Details lesen.

Wir haben die Installation von Unsloth für Windows- und WSL-Nutzer nahtlos gemacht - empfehlen aber generell Linux direkt, da es die breiteste Unterstützung bietet. Unsloth unterstützt MacOS, Linux, Windows, NVIDIA, Intel- und CPU-Setups. Siehe: Unsloth-Anforderungen. Das Aktualisieren erfolgt mit denselben Befehlen!

MacOS, Linux, WSL:

Windows PowerShell:

Unsloth installiert automatisch ROCm, PyTorch, benutzerdefinierte llama.cpp-Prebuilds und mehr!

Unsloth aus der Ferne aufrufen

Wir haben außerdem Cloudflare-HTTPS-Tunneling kostenlos aktiviert - so kannst du sicher per HTTPS aus der Ferne auf Unsloth zugreifen.

Unsloth auf AMD-Windows-Rechnern installieren

📥 Unsloth-Notebooks installieren & pip installieren

Wenn du nur einfache Unsloth-Notebooks möchtest, siehe den allgemeinen AMD Installationsleitfaden. Lies unbedingt denAMD Installationsleitfaden! Nachdem du ihn für die Installation von PyTorch und ROCm befolgt hast, führe dann aus:

⏯️Unsloth Start

Unsloth Start ermöglicht dir, Claude Code, Codex und andere Agents mit lokalen Modellen über den unsloth start Befehl zu verbinden.

Starte Unsloth, öffne deinen Projektordner und führe aus:

Ersetze claude durch einen der folgenden Agents:

Claude Code, lokal mit Qwen3.5 ausgeführt.
Agent
Befehl

Claude Code

unsloth start claude

OpenAI Codex

unsloth start codex

Hermes Agent

unsloth start hermes

OpenClaw

unsloth start openclaw

OpenCode

unsloth start opencode

Claude-Instanzen sind alle isoliert
Codex läuft mit dynamischem 4-Bit unsloth/gemma-4-E2B-it

📊 AMD-Analyse

Wir haben viele unserer für nicht-AMD-GPUs entwickelten Optimierungen übernommen, damit AMD-GPUs glänzen! AMD-Training unter Windows-Geräten zum Laufen zu bringen und die Kompatibilität mit nahezu jedem AMD-Gerät sicherzustellen, war viel Arbeit, aber wir sind mit dem aktuellen Stand zufrieden. Wir arbeiten weiterhin aktiv daran, AMD-GPUs noch besser zu machen! Unten sind einige Analysen/Benchmarks, die wir auf einer AMD MI300X durchgeführt haben.

Reinforcement Learning: genauere LoRA und QLoRA

Während RL auf AMD unterstützt Unsloth Weight Sharing mit vLLM, wie in Speichereffizientes RL. Wir halbieren den Speicherverbrauch durch direkten Zugriff auf vLLMs Modellallokation.

Während LoRA und QLoRA führen wir außerdem kein Mergen und Demergen der LoRA-Gewichte wie unten durch:

W=W+sABinference=XWW=WsABW = W + sAB \\ \text{inference} = XW \\ W = W - sAB

Das oben Genannte verursacht Probleme, da IEEE-Floats aufgrund von Rundung nicht assoziativ sind. Wenn W in BF16 vorliegt, verursacht dies subtile Unterschiede beim Subtrahieren, wie es in anderen RL-Engines geschieht. Das bedeutet im IEEE-Kontext:

W(W+sAB)(sAB)W \ne(W + sAB) - (sAB)

Und wenn W in bfloat16 mit wenigen Mantissenbits vorliegt, rundet es kleine Zahlen auf Null. Da A und B während LoRA float32 sind, kann W im Laufe der Zeit nach dem Mergen und Demergen driften. Unsloth nutzt direkt vLLMs LoRA-Pfad, daher vermeiden wir das. Die Basisgewichte werden nie bearbeitet und driften niemals.

Schnelleres Reinforcement Learning

Wir haben andere Setups mit FA2 und vLLM am selben Ort benchmarked. Beide nutzen vLLM für die Generierung, Unsloth verlagert mehr des Schritts in die Generierung und macht Training und ungefähr 2x schneller.

Alle drei Benchmarks sind reproduzierbar: gleiche Seeds, gleiche Token-Budgets, und die Verlustkurven stimmen zwischen den beiden Stacks überein.

Schnelleres und speichereffizienteres Training

Bei Llama-3.1-8B LoRA SFT (Batch 2 x Grad-Accum 4 x 2048 = 16.384 Tokens/Schritt, gepackt) trainiert Unsloth mit 2,07 s/Schritt gegenüber 2,87 s/Schritt für TRL + FA2 und erreicht einen Peak von 18,3 GB gegenüber 24,3 GB. Das ist 1,39x schneller und 1,33x weniger Speicherverbrauch, ohne Änderung der Genauigkeit. Wir planen, das noch weiter zu verbessern!

Die Speicherersparnis ist nicht nur ein niedrigerer Peak, sie hält während des gesamten Laufs an. Bei der Stichprobenmessung des zugewiesenen VRAMs alle 0,1 s bleibt Unsloth die ganze Zeit über flach und niedrig, während andere Setups + FA2 bei fast jedem Schritt in Richtung 22,8 GB spiken und länger zum Fertigwerden brauchen (75 s vs. 56 s für dieselben 25 Schritte).

Unterstützte AMD-Hardware

Unsloths AMD-Unterstützung konzentriert sich auf beliebte Consumer-, Workstation- und Datacenter-GPUs. Unterstützung für Training, Unsloth Studio und GGUF-/llama.cpp-Inferenz kann je nach Architektur variieren, daher trennt die folgende Tabelle optimierte Unterstützung von Kompatibilitätspfaden.

Architektur
Serie
gfx
Unterstützung
Plattform

RDNA 4

Radeon™ RX 9000-Serie

gfx1200, gfx1201

Vollständig

Windows + WSL + Linux

RDNA 3.5

Ryzen AI 300 / Ryzen AI MAX (Strix Halo)

gfx1150, gfx1151, gfx1152

Vollständig

Windows + WSL + Linux

RDNA 3

Radeon™ RX 7000-Serie

gfx1100, gfx1101, gfx1102

Vollständig

Windows + WSL + Linux

RDNA 2

Radeon™ RX 6000-Serie

nur gfx1030

Nahezu

Windows + WSL + Linux

CDNA 4

Instinct™ MI350-Serie GPUs

gfx950

Vollständig

nur Linux

CDNA 3

Instinct™ MI300-Serie GPUs

gfx940, gfx941, gfx942

Vollständig

nur Linux

CDNA 2

Instinct™ MI200-Serie GPUs

gfx90a

Vollständig

nur Linux

Wir arbeiten aktiv daran, mehr AMD-GPUs zu unterstützen, jedoch verfügen ältere leider nicht über die erforderliche Hardwareunterstützung, damit wir damit arbeiten können.

🖥️ Leitfaden zur Verwendung von Unsloth auf AMD

Nach der Installation kannst du Unsloth Studio in deinem Browser öffnen. Von dort aus kannst du lokale LLMs auf AMD-Hardware automatisch ausführen und feinabstimmen. Siehe unten die detaillierten Installationsanweisungen:

AMD-InstallationsleitfadenUnsloth Studio installieren

Wähle dein Modell, deinen Datensatz und deine Trainingseinstellungen aus, um zu beginnen. Zum Beispiel kannst du QLoRA-4-Bit-Fine-Tuning auf Gemma 4 12B mit einer Kontextlänge von ~16k, LoRA-Rang 16, Lernrate 0.0002 und 30 Maximalschritten ausführen.

Der Fine-Tuning-Bildschirm von Unsloth Studio ist vollständig anpassbar, sodass du dein Modell, deinen Datensatz und die Trainingsparameter konfigurieren kannst. Während des Trainings verfolgt Unsloth den Fortschritt in Echtzeit, einschließlich Verlust, RAM- und VRAM-Nutzung sowie Unterstützung für Multi-GPU. Sobald das Training beginnt, siehst du den Fortschritt in Echtzeit geplottet.

Nach dem Training kannst du deine Historie aufrufen, um vergangene und aktive Trainingssitzungen zu sehen. Wähle eines deiner feinabgestimmten Modelle aus, um vergangene Trainingsprotokolle anzuzeigen:

Wenn das Training abgeschlossen ist, exportiere dein Modell als GGUF, zusammengeführte Modell-Safetensors oder als LoRA-Adapter für die Bereitstellung mit Hugging Face, llama.cpp, vLLM oder Unsloth. Für GGUF-Exporte verwendet Unsloth AMD-bewusste llama.cpp-ROCm-Prebuilds, die deiner gfx-Architektur entsprechen, mit Quellkompilierung als Fallback, wenn kein Prebuild verfügbar ist. Sobald der Export abgeschlossen ist, siehst du Export erfolgreich abgeschlossen. Du kannst dein Modell auch direkt auf den Hugging Face Hub pushen.

Exportiere dein Modell in dein bevorzugtes Format und stelle es überall bereit. Nach dem Export lade dein feinabgestimmtes Modell aus dem Bereich „Fine-tuned“ der Modellauswahl in „New Chat“ oder „Recents“.

Wähle dein feinabgestimmtes Modell aus dem Dropdown aus und chatte direkt in Unsloth damit. Du kannst deine trainierten oder heruntergeladenen Modelle jetzt in New Chat, Recents oder Projects verwenden. Aktiviere die Schalter für Think, Code und Search für das beste Erlebnis und sieh dir die Unsloth Studio Chat Dokumentation für weitere Details an.

Und schließlich kannst du mit deinem neu feinabgestimmten Modell direkt in Unsloth chatten!

Du kannst auch den Durchsatz und die Generierungstokens / s direkt im Terminal überwachen, ähnlich wie bei vLLM-Logging. Du wirst sehen "gen_tok_s" das sind die Tokens / s und "prompt_tok_s" das ist die Prompt-Verarbeitung.

📱Unsloth auf Telefonen und remote HTTPS-Tunneling

Wir haben kostenlose Cloudflare-HTTPS-Tunnels für Unsloth hinzugefügt (ähnlich wie bei LM Link), sodass du Modelle mit Unsloth per Remote-Zugriff auf deinem Telefon (iPhone, Android – jedes Telefon!) über einen Link oder von jedem anderen Computer aus chatten / trainieren kannst! Das funktioniert auf Mac-, Linux-, WSL- und Windows-Geräten.

  • Trainiere & feinabstimme von deinem Telefon aus / aus der Ferne mit Live-Trainingsverlust-Protokollen - abbrechen oder neu trainieren!

  • Im Browser von überall aus chatten mit Tool-Calling und Live-Streaming.

  • Echtes interaktives HTML-Canvas Ausgaben direkt auf deinem Telefon - spiele von LLMs erstellte Spiele!

Remote chatten!
Live-Inferenz + Tool-Calling
Remote-Trainingsprotokolle!
Live-HTML auf dem Telefon ausführen

Um es einzurichten, tippe zuerst im Terminal nach der Installation von Unsloth unsloth studio --secure . Lege ein Passwort fest, damit keine unbefugte Person auf den HTTPS-Link zugreifen kann!

Dann in den Logs - verwende den grünen Cloudflare-Link und gib das auf unserem Telefon oder einem anderen Remote-Gerät ein!

Und schon bist du drin! Du kannst den live per HTTPS bereitgestellten Link jederzeit überwachen / abbrechen, indem du im Terminal, in dem Unsloth Studio gestartet wurde, STRG+C drückst!

Inferenz-Einstellungen bearbeiten
Temp, top_p, Kontextlänge bearbeiten
Canvas rendert HTML automatisch!

Wie AMD-Unterstützung für Unsloth aufgebaut wurde

Unsloths benutzerdefinierte Kernel wurden in enger Zusammenarbeit mit dem AMD-Team auf AMD portiert. Dies erforderte Änderungen am Installer, der Hardwareerkennung, dem Laufzeit-Routing, dem Monitoring und der Auswahl vorgefertigter Assets.

  • ROCm-Kernel: HIP-/Triton-Ports für RDNA und CDNA optimiert, mit architekturspezifischen Präzisions-, Leistungs- und Stabilitätsfixes. (#2520)

  • 4-Bit-Training: bitsandbytes-basierte QLoRA-Unterstützung für Radeon- und CDNA-GPUs. (#3748)

  • Automatische Einrichtung: robuste AMD-GPU-Erkennung und Installation des richtigen ROCm-PyTorch-Wheels, einschließlich Reparatur- und Plattform-Sicherungen. (#4770)

  • Windows und Strix Halo: native ROCm-Installation unter Windows, Laufzeit-Kompatibilitätspatches, Berichte über Unified Memory und WSL-Unterstützung. (#5301, #6227)

  • ROCm-Inferenz: architekturspezifische llama.cpp-Prebuilds, Fallback auf Quellbuild, AMD-VRAM-Erkennung und Monitoring. (#5172)

🕐 Zukünftige Arbeiten

Vielen Dank an das AMD-Team für die Zusammenarbeit mit uns, damit AMD gut funktioniert! Zu den nächsten Prioritäten gehören:

  • Fortgesetzte Entwicklung und Zusammenarbeit mit dem AMD-Team.

  • Erweiterte Hardware-Backend-CI/CD mit AMD Strix Halo und Radeon-Lab-Hardware.

  • Unterstützung für neue AMD-GPU-Karten und Architekturen, sobald sie erscheinen.

  • Klarere Multi-GPU-Anleitung: AMD-Distributed-Training ist derzeit nur unter Linux verfügbar. Unter Linux verwendet ROCm RCCL, daher funktioniert verteiltes Training. Unter Windows stellt AMD ROCm noch kein GPU-Collective-Backend bereit, mit GLOO/CPU-only-Unterstützung ab TheRock #5694, verwende Linux, wenn du AMD-Multi-GPU-Training durchführen möchtest.

  • Weitere Geschwindigkeitsoptimierungen in Bezug auf den ROCm-Stack.

💌 Danke an AMD für die Zusammenarbeit!

Vielen Dank an das AMD-Team und unsere großartige Unsloth-Community für die Zusammenarbeit mit uns an diesem Release. Wir danken Strahinja Stamenkovic, Filip Jankovic, Iswarya Alex, Yue Yuan Bill He, Eda Zhou, Mahdi Ghodsi, Guruprasad und dem gesamten AMD-Team für die Zusammenarbeit, damit AMD-Unterstützung mit Unsloth großartig funktioniert! Ein großes Dankeschön auch an Community-Mitglieder: Nate, UBER6, AiwendilOfMirk..., Gene, Jimster480, VELICAN, Vintheboy, archmaker, BichonFriseMax, Calandracas, Chigoma333, Edd, electroglyph, jslowbell, mk 27B UD-, Satyam, snapcast3r, TotoMC fürs Testen und Debuggen mit uns.

Eine einfache Möglichkeit, Unsloth auf AMD zu verwenden, ist über AMD Developer Cloud, mit Ein-Klick-Notebooks, unterstützt von MI300X-GPUs mit 192 GB VRAM. AMD bietet außerdem kostenlose Credits über das AMD AI Developer Program. Um ein Unsloth-Notebook auszuführen, verwende ein beliebiges AMD-Notebook von unslothai/notebooks und ersetze die GitHub-Domain durch die URL der AMD Developer Cloud, da die Notebook-Pfade gleich sind.

Brauchst du Hilfe oder möchtest du Feedback teilen? Du kannst unserem Discordbeitreten, die AMD-Dokumentationlesen, ein Issue oder einen PR auf GitHuböffnen oder in unserem Reddit r/unsloth posten.

Zuletzt aktualisiert

War das hilfreich?