> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/grundlagen/amd.md).

# Modelle auf AMD-GPUs mit Unsloth trainieren und ausführen

Unsloth unterstützt jetzt offiziell AMD-Hardware und macht es einfach, Modelle lokal auf AMD-GPUs auszuführen, zu trainieren, feinabzustimmen, RL zu betreiben und bereitzustellen. Vollständig Open Source, [Unsloth Studio](/docs/de/neu/studio.md) funktioniert unter Windows, WSL und Linux und unterstützt AMDs Radeon RX 9000, 7000er-Serie, Instinct MI350- und MI300-Rechenzentrums-GPUs, Vulkan, Strix Halo-basierte Ryzen AI Max-Systeme und mehr.

Wir haben zusammengearbeitet mit [AMD](https://www.amd.com/en/developer/resources/technical-articles/2026/train-and-run-models-on-amd-gpus-with-unsloth.html) und unserer Community, um bis zu 2x schnelleres Training und 70 % weniger VRAM für alle Modelle ohne Genauigkeitsverlust zu ermöglichen. Wenn du keine GPU hast, unterstützt Unsloth weiterhin native AMD-Inferenz für [Qwen3.6](/docs/de/modelle/qwen3.6.md), [Gemma 4](/docs/de/modelle/gemma-4.md), DeepSeek-V4, GLM 5.2, DiffusionGemma, Kimi K2.7 und andere Modelle.

<a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#installing-unsloth-on-amd" class="button primary" data-icon="bolt">Schnellstart</a><a href="/pages/b21f0a5b7b44aca704f0d30d93e42b6124f974ff#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">Funktionen</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

{% hint style="success" %}
**Update vom 23. Juli:** Hinzugefügt **RDNA2, Gorgon Halo, Vulkan-Unterstützung** + behoben, dass GPUs auf AMD-GPUs nicht erkannt wurden.\
Bessere RDNA4-, HIP-/ROCm-Fehler-Autokorrektur und -Erfassung.
{% endhint %}

{% columns %}
{% column width="58.333333333333336%" %}
Um Unsloth Studio auf AMD zu installieren, führe aus:

**MacOS, Linux, WSL:**

{% code overflow="wrap" expandable="true" %}

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

{% endcode %}

**Windows PowerShell:**

<pre class="language-powershell" data-overflow="wrap"><code class="lang-powershell"><strong>irm https://unsloth.ai/install.ps1 | iex 
</strong></code></pre>

{% endcolumn %}

{% column width="41.666666666666664%" %}

<figure><img src="/files/09bc2ab6a892e6f635e2ed7a996d77e9ace81cdc" alt=""><figcaption><p>Beispiel für eine 1-Bit-GLM-5.2-Ausführung mit Unsloth</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

### ⭐ Funktionen

Unsloth unterstützt auf AMD sowohl Inferenz als auch Training, sodass du, wenn du keine GPU und nur eine CPU hast, Modelle trotzdem mit Unsloth ausführen kannst. Bei der Verwendung von Unsloth erhältst du:

* [**Tool-Call-Healing**](/docs/de/neu/studio/chat.md#auto-healing-tool-calling) **für Inferenz, um die Genauigkeit um 50 % zu erhöhen**, unbegrenzte kostenlose [Websuche](/docs/de/neu/studio/chat.md#advanced-web-search), HTML-Canvas, [**sichere HTTPS-Bereitstellung**](#unsloth-on-phones-and-remote-https-tunneling) über Cloudflare und [Code-Ausführung](/docs/de/neu/studio.md#execute-code--heal-tool-calling) alle Arbeit.
* **Trainiere Gemma-4-Modelle in 8 GB VRAM** oder Qwen3.5 in 3 GB VRAM. Triton-Kernels, mathematische Algorithmen und Speichertricks ermöglichen auf AMD 70 % weniger VRAM-Verbrauch ohne Genauigkeitsverlust.
* Bis zu **80 % weniger VRAM-Nutzung für** [**Reinforcement Learning**](/docs/de/erste-schritte/reinforcement-learning-rl-guide/grpo-long-context.md) wie GRPO. Und Weight Sharing mit vLLM, um 50 % Speicherverbrauch zu sparen.
* Optimierte Unterstützung für **RDNA 3** und neuere GPUs sowie GPUs in Rechenzentrumsqualität. Strix Halo ist auch für Linux, WSL und Windows optimiert.

{% columns %}
{% column %}

* [**Verbinde**](/docs/de/integrationen/unsloth-start.md) **deine lokalen Modelle mit jedem Agenten-Framework**: [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md), [Hermes](/docs/de/integrationen/hermes-agent.md), [OpenClaw](/docs/de/integrationen/openclaw.md) und mehr.
* Unterstützung für Inferenz und Training für nahezu **alle Modelle**, einschließlich der neuesten [DeepSeek-V4](/docs/de/modelle/deepseek-v4.md), [GLM-5.2](/docs/de/modelle/glm-5.2.md), [Kimi-K2.7](/docs/de/modelle/kimi-k2.7-code.md), [MiniMax M3](/docs/de/modelle/minimax-m3.md), [DiffusionGemma](/docs/de/modelle/diffusiongemma.md), [Inkling](/docs/de/modelle/inkling.md) und mehr!
* AMD-Multi-GPU-Unterstützung + VRAM-/RAM-Tracking. `llama.cpp` ROCm-Prebuilds werden täglich bereitgestellt, damit du immer die neuesten Modell-Updates erhältst!
  {% endcolumn %}

{% column %}

<figure><img src="/files/37d41a9986d4b1f503942b2654532cfdd5149728" alt="" width="375"><figcaption><p>DiffusionGemma auf AMD-GPUs ausgeführt</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

### ⚡Schnellstart

Unsloth installiert automatisch die besten ROCm-Builds für PyTorch, llama.cpp-Prebuilds, bitsandbytes, ROCm-optimierte Kernel und Triton. Wir liefern außerdem unsere AMD-Optimierungen und -Fixes gemeinsam aus. Du kannst unseren ausführlicheren [detaillierten Leitfaden hier](#guide-to-using-unsloth-on-amd) für weitere Details lesen.

Wir haben die Installation von Unsloth für Windows- und WSL-Nutzer nahtlos gemacht - empfehlen aber generell Linux direkt, da es die breiteste Unterstützung bietet. Unsloth unterstützt MacOS, Linux, [Windows](/docs/de/erste-schritte/install/windows-installation.md), [NVIDIA](/docs/de/erste-schritte/install/pip-install.md), Intel- und CPU-Setups. Siehe: [Unsloth-Anforderungen](/docs/de/erste-schritte/fine-tuning-for-beginners/unsloth-requirements.md). Das Aktualisieren erfolgt mit denselben Befehlen!

**MacOS, Linux, WSL:**

{% code overflow="wrap" %}

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

{% endcode %}

**Windows PowerShell:**

{% code overflow="wrap" %}

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endcode %}

{% columns %}
{% column %}
Unsloth installiert automatisch ROCm, PyTorch, benutzerdefinierte llama.cpp-Prebuilds und mehr!

#### Unsloth aus der Ferne aufrufen

Wir haben außerdem [Cloudflare-HTTPS-Tunneling](#unsloth-on-phones-and-remote-https-tunneling) kostenlos aktiviert - so kannst du sicher per HTTPS aus der Ferne auf Unsloth zugreifen.
{% endcolumn %}

{% column %}

<figure><img src="/files/dad9bf06cefee36b5ee9c8446e6b3feb1886373b" alt=""><figcaption><p>Unsloth auf AMD-Windows-Rechnern installieren</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### :inbox\_tray: Unsloth-Notebooks installieren & pip installieren

Wenn du nur einfache Unsloth-Notebooks möchtest, siehe den allgemeinen [AMD](/docs/de/erste-schritte/install/amd.md) Installationsleitfaden. Lies unbedingt den[AMD](/docs/de/erste-schritte/install/amd.md) Installationsleitfaden! Nachdem du ihn für die Installation von PyTorch und ROCm befolgt hast, führe dann aus:

{% code overflow="wrap" %}

```bash
uv pip install unsloth[amd]
```

{% endcode %}

#### :play\_pause:Unsloth Start

{% columns %}
{% column width="58.333333333333336%" %}
[Unsloth Start](/docs/de/integrationen/unsloth-start.md) ermöglicht dir, [Claude Code](/docs/de/grundlagen/claude-code.md), [Codex](/docs/de/grundlagen/codex.md) und andere Agents mit lokalen Modellen über den `unsloth start` Befehl zu verbinden.&#x20;

Starte Unsloth, öffne deinen Projektordner und führe aus:

{% code overflow="wrap" %}

```bash
unsloth start claude --model \\
    unsloth/gemma-4-E2B-it-GGUF:UD-Q4_K_XL
```

{% endcode %}

Ersetze `claude` durch einen der folgenden Agents:
{% endcolumn %}

{% column width="41.666666666666664%" %}

<figure><img src="/files/71dc8d04c5322ed18a0af5f03d72f1ec3f286b24" alt="" width="563"><figcaption><p>Claude Code, lokal mit Qwen3.5 ausgeführt.</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

| Agent                                                              | Befehl                   |
| ------------------------------------------------------------------ | ------------------------ |
| <i class="fa-claude">:claude:</i> Claude Code                      | `unsloth start claude`   |
| <i class="fa-openai">:openai:</i> OpenAI Codex                     | `unsloth start codex`    |
| <i class="fa-caduceus">:caduceus:</i> Hermes Agent                 | `unsloth start hermes`   |
| <i class="fa-lobster">:lobster:</i> OpenClaw                       | `unsloth start openclaw` |
| <i class="fa-rectangle-vertical">:rectangle-vertical:</i> OpenCode | `unsloth start opencode` |

<div><figure><img src="/files/c376567ea2d210cc9dc0ab90c93c7e417f1e9052" alt=""><figcaption><p>Claude-Instanzen sind alle isoliert</p></figcaption></figure> <figure><img src="/files/7de6e2d98c7d19b4b382bf1d8bb7ed0cce167561" alt=""><figcaption><p>Codex läuft mit dynamischem 4-Bit unsloth/gemma-4-E2B-it</p></figcaption></figure></div>

### :bar\_chart: AMD-Analyse

Wir haben viele unserer für nicht-AMD-GPUs entwickelten Optimierungen übernommen, damit AMD-GPUs glänzen! AMD-Training unter Windows-Geräten zum Laufen zu bringen und die Kompatibilität mit nahezu jedem AMD-Gerät sicherzustellen, war viel Arbeit, aber wir sind mit dem aktuellen Stand zufrieden. Wir arbeiten weiterhin aktiv daran, AMD-GPUs noch besser zu machen! Unten sind einige Analysen/Benchmarks, die wir auf einer AMD MI300X durchgeführt haben.

#### Reinforcement Learning: genauere LoRA und QLoRA

Während RL auf AMD unterstützt Unsloth **Weight Sharing** mit vLLM, wie in [Speichereffizientes RL](/docs/de/erste-schritte/reinforcement-learning-rl-guide/memory-efficient-rl.md). Wir **halbieren den Speicherverbrauch** durch direkten Zugriff auf vLLMs Modellallokation.

Während LoRA und QLoRA führen wir außerdem kein Mergen und Demergen der LoRA-Gewichte wie unten durch:

$$
W = W + sAB \\
\text{inference} = XW \\
W = W - sAB
$$

Das oben Genannte verursacht Probleme, da **IEEE-Floats aufgrund von Rundung nicht assoziativ sind**. Wenn W in BF16 vorliegt, verursacht dies subtile Unterschiede beim Subtrahieren, wie es in anderen RL-Engines geschieht. Das bedeutet im IEEE-Kontext:

$$
W \ne(W + sAB) - (sAB)
$$

Und wenn W in bfloat16 mit wenigen Mantissenbits vorliegt, **rundet es kleine Zahlen auf Null**. Da A und B während LoRA float32 sind, kann W im Laufe der Zeit nach dem Mergen und Demergen driften. Unsloth nutzt direkt vLLMs LoRA-Pfad, daher vermeiden wir das. Die Basisgewichte werden nie bearbeitet und driften niemals.

#### Schnelleres Reinforcement Learning

{% columns %}
{% column %}
Wir haben andere Setups mit FA2 und vLLM am selben Ort benchmarked. Beide nutzen vLLM für die Generierung, Unsloth verlagert mehr des Schritts in die Generierung und macht Training und ungefähr 2x schneller.

Alle drei Benchmarks sind reproduzierbar: gleiche Seeds, gleiche Token-Budgets, und die&#x20;Verlustkurven stimmen zwischen den beiden Stacks überein.
{% endcolumn %}

{% column %}

<figure><img src="/files/ea68db3b3cd7d5bf46759ef8f640e916e7a73b80" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### Schnelleres und speichereffizienteres Training

Bei Llama-3.1-8B LoRA SFT (Batch 2 x Grad-Accum 4 x 2048 = 16.384 Tokens/Schritt, gepackt) trainiert Unsloth mit 2,07 s/Schritt gegenüber 2,87 s/Schritt für TRL + FA2 und erreicht einen Peak von 18,3 GB gegenüber 24,3 GB. Das ist 1,39x schneller und 1,33x weniger Speicherverbrauch, ohne Änderung der Genauigkeit. Wir planen, das noch weiter zu verbessern!

<div><figure><img src="/files/6781ab1461436e3be121af580cc0c56a415b7a73" alt=""><figcaption></figcaption></figure> <figure><img src="/files/aaf254723c98e456c9c4ed1da13cb5bb47f40232" alt=""><figcaption></figcaption></figure></div>

Die Speicherersparnis ist nicht nur ein niedrigerer Peak, sie hält während des gesamten Laufs an.&#x20;Bei der Stichprobenmessung des zugewiesenen VRAMs alle 0,1 s bleibt Unsloth die ganze Zeit über flach und niedrig,&#x20;während andere Setups + FA2 bei fast jedem Schritt in Richtung 22,8 GB spiken und länger zum&#x20;Fertigwerden brauchen (75 s vs. 56 s für dieselben 25 Schritte).

### :sparkles:Unterstützte AMD-Hardware

Unsloths AMD-Unterstützung konzentriert sich auf beliebte Consumer-, Workstation- und Datacenter-GPUs. Unterstützung für Training, Unsloth Studio und GGUF-/llama.cpp-Inferenz kann je nach Architektur variieren, daher trennt die folgende Tabelle optimierte Unterstützung von Kompatibilitätspfaden.

| Architektur | Serie                                    | gfx                       | Unterstützung | Plattform             |
| ----------- | ---------------------------------------- | ------------------------- | ------------- | --------------------- |
| RDNA 4      | Radeon™ RX 9000-Serie                    | gfx1200, gfx1201          | Vollständig   | Windows + WSL + Linux |
| RDNA 3.5    | Ryzen AI 300 / Ryzen AI MAX (Strix Halo) | gfx1150, gfx1151, gfx1152 | Vollständig   | Windows + WSL + Linux |
| RDNA 3      | Radeon™ RX 7000-Serie                    | gfx1100, gfx1101, gfx1102 | Vollständig   | Windows + WSL + Linux |
| RDNA 2      | Radeon™ RX 6000-Serie                    | nur gfx1030               | Nahezu        | Windows + WSL + Linux |
| CDNA 4      | Instinct™ MI350-Serie GPUs               | gfx950                    | Vollständig   | nur Linux             |
| CDNA 3      | Instinct™ MI300-Serie GPUs               | gfx940, gfx941, gfx942    | Vollständig   | nur Linux             |
| CDNA 2      | Instinct™ MI200-Serie GPUs               | gfx90a                    | Vollständig   | nur Linux             |

Wir arbeiten aktiv daran, mehr AMD-GPUs zu unterstützen, jedoch verfügen ältere leider nicht über die erforderliche Hardwareunterstützung, damit wir damit arbeiten können.

### :desktop: Leitfaden zur Verwendung von Unsloth auf AMD

Nach der Installation kannst du Unsloth Studio in deinem Browser öffnen. Von dort aus kannst du lokale LLMs auf AMD-Hardware automatisch ausführen und feinabstimmen. Siehe unten die detaillierten Installationsanweisungen:

{% columns %}
{% column width="50%" %} <a href="/pages/6cfc4e7277de7763f13423fb2a9191134f5aba98" class="button primary">AMD-Installationsleitfaden</a><a href="/pages/fd472c5a40e73b8e54cee17244010f121bf38286" class="button primary">Unsloth Studio installieren</a>

Wähle dein Modell, deinen Datensatz und deine Trainingseinstellungen aus, um zu beginnen. Zum Beispiel kannst du QLoRA-4-Bit-Fine-Tuning auf Gemma 4 12B mit einer Kontextlänge von \~16k, LoRA-Rang 16, Lernrate 0.0002 und 30 Maximalschritten ausführen.
{% endcolumn %}

{% column width="50%" %}

<figure><img src="/files/098b71380bd3f0bcac04f7b2613cd17e6df40b3f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}
Der Fine-Tuning-Bildschirm von Unsloth Studio ist vollständig anpassbar, sodass du dein Modell, deinen Datensatz und die Trainingsparameter konfigurieren kannst. Während des Trainings verfolgt Unsloth den Fortschritt in Echtzeit, einschließlich Verlust, RAM- und VRAM-Nutzung sowie Unterstützung für Multi-GPU. Sobald das Training beginnt, siehst du den Fortschritt in Echtzeit geplottet.

Nach dem Training kannst du deine Historie aufrufen, um vergangene und aktive Trainingssitzungen zu sehen. Wähle eines deiner feinabgestimmten Modelle aus, um vergangene Trainingsprotokolle anzuzeigen:
{% endcolumn %}

{% column %}

<figure><img src="/files/20efeaa3a43d05aa4db99ccff7b0d0c7b7e18ec8" alt="" width="563"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

<div align="left"><figure><img src="/files/52e649309329d95b37e8351acfe84aec72365695" alt="" width="563"><figcaption></figcaption></figure></div>

{% columns %}
{% column %}
Wenn das Training abgeschlossen ist, exportiere dein Modell als GGUF, zusammengeführte Modell-Safetensors oder als LoRA-Adapter für die Bereitstellung mit Hugging Face, llama.cpp, vLLM oder Unsloth. Für GGUF-Exporte verwendet Unsloth AMD-bewusste llama.cpp-ROCm-Prebuilds, die deiner gfx-Architektur entsprechen, mit Quellkompilierung als Fallback, wenn kein Prebuild verfügbar ist. Sobald der Export abgeschlossen ist, siehst du Export erfolgreich abgeschlossen. Du kannst dein Modell auch direkt auf den Hugging Face Hub pushen.
{% endcolumn %}

{% column %}

<figure><img src="/files/6588158ccaf3e18c2cc3e70a0892425da02b2f8e" alt="" width="563"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}
Exportiere dein Modell in dein bevorzugtes Format und stelle es überall bereit. Nach dem Export lade dein feinabgestimmtes Modell aus dem Bereich „Fine-tuned“ der Modellauswahl in „New Chat“ oder „Recents“.

Wähle dein feinabgestimmtes Modell aus dem Dropdown aus und chatte direkt in Unsloth damit. Du kannst deine trainierten oder heruntergeladenen Modelle jetzt in New Chat, Recents oder Projects verwenden. Aktiviere die Schalter für Think, Code und Search für das beste Erlebnis und sieh dir die [Unsloth Studio Chat](https://unsloth.ai/docs/new/studio/chat) Dokumentation für weitere Details an.
{% endcolumn %}

{% column %}

<figure><img src="/files/1cfc0be634f8ab316ab26d4ab96a4479dc67ba3e" alt="" width="407"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Und schließlich kannst du mit deinem neu feinabgestimmten Modell direkt in Unsloth chatten!

<figure><img src="/files/ddfe1df5a430a4a6d5d650459d39c598ee69ab33" alt=""><figcaption></figcaption></figure>

Du kannst auch den Durchsatz und die Generierungstokens / s direkt im Terminal überwachen, ähnlich wie bei vLLM-Logging. Du wirst sehen `"gen_tok_s"` das sind die Tokens / s und `"prompt_tok_s"` das ist die Prompt-Verarbeitung.

<figure><img src="/files/808459ba63b4062a0dee3822e4807819341833b4" alt=""><figcaption></figcaption></figure>

### :mobile\_phone:Unsloth auf Telefonen und remote HTTPS-Tunneling

Wir haben **kostenlose** Cloudflare-HTTPS-Tunnels für Unsloth hinzugefügt (ähnlich wie bei LM Link), sodass du Modelle mit Unsloth per Remote-Zugriff auf deinem Telefon (iPhone, Android – jedes Telefon!) über einen Link oder von jedem anderen Computer aus chatten / trainieren kannst! Das funktioniert auf Mac-, Linux-, WSL- und Windows-Geräten.

* Trainiere & feinabstimme von deinem Telefon aus / **aus der Ferne mit Live-Trainingsverlust-Protokollen** - abbrechen oder neu trainieren!
* Im Browser von überall aus chatten mit Tool-Calling und Live-Streaming.
* Echtes **interaktives HTML-Canvas** Ausgaben direkt auf deinem Telefon - spiele von LLMs erstellte Spiele!

<div><figure><img src="/files/276460cdc805a28a319fb065d41bea79ba0db4eb" alt="" width="188"><figcaption><p>Remote chatten!</p></figcaption></figure> <figure><img src="/files/19fbc2efc602549ead08a71b3c6d7d14cdfb10a2" alt="" width="188"><figcaption><p>Live-Inferenz + Tool-Calling</p></figcaption></figure> <figure><img src="/files/cc4a35d36e3ef493d9855dd3d608b863cb4285ce" alt="" width="188"><figcaption><p>Remote-Trainingsprotokolle!</p></figcaption></figure> <figure><img src="/files/2240c2ffc9989f079a11f663f711f787f90f9e2c" alt="" width="188"><figcaption><p>Live-HTML auf dem Telefon ausführen</p></figcaption></figure></div>

Um es einzurichten, tippe zuerst im Terminal nach der Installation von Unsloth `unsloth studio --secure` . Lege ein Passwort fest, damit keine unbefugte Person auf den HTTPS-Link zugreifen kann!

<figure><img src="/files/dbc67dc6d36751a4b8ca88bb32079a03ad690020" alt=""><figcaption></figcaption></figure>

Dann in den Logs - verwende den <mark style="color:$success;">**grünen Cloudflare-Link**</mark> und gib das auf unserem Telefon oder einem anderen Remote-Gerät ein!

<figure><img src="/files/f1c4b9b646beb2802c5300887831d41acf959830" alt=""><figcaption></figcaption></figure>

Und schon bist du drin! Du kannst den live per HTTPS bereitgestellten Link jederzeit überwachen / abbrechen, indem du im Terminal, in dem Unsloth Studio gestartet wurde, STRG+C drückst!

<div><figure><img src="/files/4c4f9fd5647ef07fd5235e1cb1c5496d3d598e6f" alt="" width="188"><figcaption><p>Inferenz-Einstellungen bearbeiten</p></figcaption></figure> <figure><img src="/files/3096ada217654f3e95c1a275fda94f9a50803999" alt="" width="188"><figcaption><p>Temp, top_p, Kontextlänge bearbeiten</p></figcaption></figure> <figure><img src="/files/f980f0b4cbf7d6bdd1d9662cfd19614c8083cd76" alt="" width="188"><figcaption><p>Canvas rendert HTML automatisch!</p></figcaption></figure></div>

### :question:Wie AMD-Unterstützung für Unsloth aufgebaut wurde

Unsloths benutzerdefinierte Kernel wurden in enger Zusammenarbeit mit dem AMD-Team auf AMD portiert. Dies erforderte Änderungen am Installer, der Hardwareerkennung, dem Laufzeit-Routing, dem Monitoring und der Auswahl vorgefertigter Assets.

* **ROCm-Kernel:** HIP-/Triton-Ports für RDNA und CDNA optimiert, mit architekturspezifischen Präzisions-, Leistungs- und Stabilitätsfixes. ([#2520](https://github.com/unslothai/unsloth/pull/2520))
* **4-Bit-Training:** bitsandbytes-basierte QLoRA-Unterstützung für Radeon- und CDNA-GPUs. ([#3748](https://github.com/unslothai/unsloth/pull/3748))
* **Automatische Einrichtung:** robuste AMD-GPU-Erkennung und Installation des richtigen ROCm-PyTorch-Wheels, einschließlich Reparatur- und Plattform-Sicherungen. ([#4770](https://github.com/unslothai/unsloth/pull/4770))
* **Windows und Strix Halo:** native ROCm-Installation unter Windows, Laufzeit-Kompatibilitätspatches, Berichte über Unified Memory und WSL-Unterstützung. ([#5301](https://github.com/unslothai/unsloth/pull/5301), [#6227](https://github.com/unslothai/unsloth/pull/6227))
* **ROCm-Inferenz:** architekturspezifische llama.cpp-Prebuilds, Fallback auf Quellbuild, AMD-VRAM-Erkennung und Monitoring. ([#5172](https://github.com/unslothai/unsloth/pull/5172))

### :clock1: Zukünftige Arbeiten

Vielen Dank an das AMD-Team für die Zusammenarbeit mit uns, damit AMD gut funktioniert! Zu den nächsten Prioritäten gehören:

* Fortgesetzte Entwicklung und Zusammenarbeit mit dem AMD-Team.
* Erweiterte Hardware-Backend-CI/CD mit AMD Strix Halo und Radeon-Lab-Hardware.
* Unterstützung für neue AMD-GPU-Karten und Architekturen, sobald sie erscheinen.
* Klarere Multi-GPU-Anleitung: AMD-Distributed-Training ist derzeit nur unter Linux verfügbar. Unter Linux verwendet ROCm RCCL, daher funktioniert verteiltes Training. Unter Windows stellt AMD ROCm noch kein GPU-Collective-Backend bereit, mit GLOO/CPU-only-Unterstützung ab [TheRock #5694](https://github.com/ROCm/TheRock/pull/5694), verwende Linux, wenn du AMD-Multi-GPU-Training durchführen möchtest.
* Weitere Geschwindigkeitsoptimierungen in Bezug auf den ROCm-Stack.

### :love\_letter: Danke an AMD für die Zusammenarbeit!

Vielen Dank an das AMD-Team und unsere großartige Unsloth-Community für die Zusammenarbeit mit uns an diesem Release. Wir danken Strahinja Stamenkovic, Filip Jankovic, Iswarya Alex, Yue Yuan Bill He, Eda Zhou, Mahdi Ghodsi, Guruprasad und dem gesamten AMD-Team für die Zusammenarbeit, damit AMD-Unterstützung mit Unsloth großartig funktioniert! Ein großes Dankeschön auch an Community-Mitglieder: Nate, UBER6, AiwendilOfMirk..., Gene, Jimster480, VELICAN, Vintheboy, archmaker, BichonFriseMax, Calandracas, Chigoma333, Edd, electroglyph, jslowbell, mk 27B UD-, Satyam, snapcast3r, TotoMC fürs Testen und Debuggen mit uns.

Eine einfache Möglichkeit, Unsloth auf AMD zu verwenden, ist über [AMD Developer Cloud](https://www.amd.com/en/developer/resources/cloud-access/amd-developer-cloud.html), mit Ein-Klick-Notebooks, unterstützt von MI300X-GPUs mit 192 GB VRAM. AMD bietet außerdem kostenlose Credits über das [AMD AI Developer Program](https://www.amd.com/en/developer/ai-dev-program.html). Um ein Unsloth-Notebook auszuführen, verwende ein beliebiges AMD-Notebook von [unslothai/notebooks](https://github.com/unslothai/notebooks) und ersetze die GitHub-Domain durch die URL der AMD Developer Cloud, da die Notebook-Pfade gleich sind.

Brauchst du Hilfe oder möchtest du Feedback teilen? Du kannst unserem [Discord](https://discord.com/invite/unsloth)beitreten, die [AMD-Dokumentation](https://unsloth.ai/docs/get-started/install/amd)lesen, ein Issue oder einen PR auf [GitHub](https://github.com/unslothai/unsloth/issues)öffnen oder in unserem [Reddit r/unsloth posten](https://www.reddit.com/r/unsloth/).


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/grundlagen/amd.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
