使用 Unsloth 在 AMD GPU 上训练和运行模型
Unsloth 现已正式支持 AMD 硬件,让你可以轻松在 AMD GPU 上本地运行、训练、微调、做 RL 以及部署模型。完全开源, Unsloth Studio 可在 Windows、WSL 和 Linux 上运行,并支持 AMD 的 Radeon RX 9000、7000 系列、Instinct MI350 和 MI300 数据中心 GPU、Vulkan、搭载 Strix Halo 的 Ryzen AI Max 系统等。
我们与 AMD 以及我们的社区合作,实现了所有模型最高 2 倍的训练速度提升,并将 VRAM 用量减少 70%,且不损失准确率。如果你没有 GPU,Unsloth 仍支持 AMD 原生推理,适用于 Qwen3.6, Gemma 4、DeepSeek-V4、GLM 5.2、DiffusionGemma、Kimi K2.7 以及其他模型。
7月23日更新: 新增 RDNA2、Gorgon Halo、Vulkan 支持 + 修复了在 AMD GPU 上无法检测 GPU 的问题。 改进了 RDNA4、HIP / ROCm 失败的自动修复与捕获。
要在 AMD 上安装 Unsloth Studio,请运行:
MacOS、Linux、WSL:
Windows Powershell:
irm https://unsloth.ai/install.ps1 | iex 
⭐ 功能
Unsloth 同时支持 AMD 的推理和训练,所以即使你没有 GPU、只有 CPU,也仍然可以使用 Unsloth 运行模型。使用 Unsloth 时,你会获得:
工具调用修复 用于推理,准确率提升 50%,无限免费 网页搜索、HTML 画布、 通过 Cloudflare 进行安全 HTTPS 部署 以及 代码执行 全部工作。
在 8GB VRAM 中训练 Gemma 4 模型 或在 3GB VRAM 中训练 Qwen3.5。Triton 内核、数学算法和内存技巧让 AMD 在不损失准确率的情况下将 VRAM 用量降低 70%。
最高 可减少 80% 的 VRAM 用量,适用于 强化学习 例如 GRPO。并通过与 vLLM 共享权重来节省 50% 的内存用量。
针对 RDNA 3 及更新的 GPU 和数据中心级 GPU 的优化支持。Strix Halo 也已针对 Linux、WSL 和 Windows 进行了优化。
将 你的本地模型连接到任何 agent harness: Claude Code, Codex, Hermes, OpenClaw 以及更多。
支持几乎所有模型的推理和训练, 包括最新的DeepSeek-V4 GLM-5.2, Kimi-K2.7, MiniMax M3, DiffusionGemma, Inkling, 以及更多! 以及更多!
AMD 多 GPU 支持 + VRAM/RAM 追踪。
llama.cppROCm 预编译包每日提供,所以你总能获得最新的模型更新!

⚡快速开始
Unsloth 会自动安装最适合的 ROCm 构建版 PyTorch、llama.cpp 预编译包、bitsandbytes、ROCm 优化内核和 Triton。我们还会将 AMD 优化和修复一并提供。你可以阅读我们更 详细指南这里 了解更多细节。
我们已让 Windows 和 WSL 用户能够无缝安装 Unsloth——但通常建议直接使用 Linux,因为它支持范围最广。Unsloth 支持 MacOS、Linux、 Windows, NVIDIA、Intel 以及 CPU 配置。参见: Unsloth 需求。更新也使用相同的命令!
MacOS、Linux、WSL:
Windows PowerShell:
Unsloth 会自动安装 ROCm、PyTorch、自定义 llama.cpp 预编译包等更多内容!
远程访问 Unsloth
我们还启用了 Cloudflare HTTPS 隧道 ,免费使用——因此你可以通过 HTTPS 远程安全访问 Unsloth。

📥 安装 Unsloth Notebooks 和 pip install
如果你只想要普通的 Unsloth notebooks,请查看通用 AMD 安装指南。务必阅读AMD 安装指南!在你按照指南安装 PyTorch 和 ROCm 之后,再执行:
⏯️Unsloth Start
Unsloth Start 让你可以通过 Claude Code, Codex 以及其他 agent 连接到本地模型,使用 unsloth start 命令。
启动 Unsloth,打开你的项目文件夹,然后运行:
将 claude 替换为下面任意一个 agent:

Claude Code
unsloth start claude
OpenAI Codex
unsloth start codex
Hermes Agent
unsloth start hermes
OpenClaw
unsloth start openclaw
OpenCode
unsloth start opencode


📊 AMD 分析
我们把为非 AMD GPU 制作的许多优化也移植过来,让 AMD GPU 也能大放异彩!让 AMD 训练在 Windows 设备上运行,并确保几乎所有 AMD 设备的兼容性是相当大的工作量,但我们对当前状态感到满意。我们仍在积极努力让 AMD GPU 变得更好!下面是我们在 AMD MI300X 上进行的一些分析/基准测试。
强化学习:更准确的 LoRA 和 QLoRA
在 AMD 上进行 RL 时,Unsloth 支持 权重共享 ,与 vLLM 一起,如 内存高效的 RL中所介绍。我们 将内存用量减半 ,通过直接访问 vLLM 对模型的分配。
在 LoRA 和 QLoRA 过程中,我们也不会像下面这样对 LoRA 权重进行合并和拆分:
上述做法会引发问题,因为 IEEE 浮点数由于舍入不是可结合的。当 W 处于 BF16 时,这会在做减法时产生细微差异,而其他 RL 引擎也是这样做的。这意味着在 IEEE 的世界里:
而当 W 处于只有少量尾数位的 bfloat16 时,它会 将小数舍入为零。由于在 LoRA 期间 A 和 B 是 float32,这意味着在合并与拆分后,W 会随着时间漂移。Unsloth 直接使用 vLLM 的 LoRA 路径,因此我们避免了这一点。基础权重从不被编辑,也永远不会漂移。
更快的强化学习
我们基准测试了其他将 FA2 与 vLLM 同机部署的方案。两者都使用 vLLM 生成,而 Unsloth 将更多步骤转移到生成上,同时让训练大约快 2 倍。
这三个基准测试都可复现:相同的随机种子、相同的 token 预算,并且两套栈之间的损失曲线一致。

更快且更省内存的训练
在 Llama-3.1-8B LoRA SFT(batch 2 x grad-accum 4 x 2048 = 16,384 tokens/step,已打包)上,Unsloth 的训练速度为 2.07 s/step,而 TRL + FA2 为 2.87 s/step,峰值内存为 18.3 GB,而后者为 24.3 GB。这意味着速度快 1.39 倍,内存用量少 1.33 倍,且准确率没有变化。我们计划把它做得更好!


节省的内存不只是峰值更低,而是在整个运行过程中都能保持。 每 0.1 秒采样一次已分配 VRAM,Unsloth 在全程都保持平稳且较低, 而其他方案 + FA2 几乎每一步都会飙升到 22.8 GB,并且完成时间更长(同样 25 步,75 秒对 56 秒)。
✨支持的 AMD 硬件
Unsloth 的 AMD 支持主要面向流行的消费级、工作站和数据中心 GPU。训练、Unsloth Studio 以及 GGUF/llama.cpp 推理支持会因架构而异,因此下表将优化支持与兼容路径分开列出。
RDNA 4
Radeon™ RX 9000 系列
gfx1200, gfx1201
完整
Windows + WSL + Linux
RDNA 3.5
Ryzen AI 300 / Ryzen AI MAX(Strix Halo)
gfx1150, gfx1151, gfx1152
完整
Windows + WSL + Linux
RDNA 3
Radeon™ RX 7000 系列
gfx1100, gfx1101, gfx1102
完整
Windows + WSL + Linux
RDNA 2
Radeon™ RX 6000 系列
仅 gfx1030
几乎
Windows + WSL + Linux
CDNA 4
Instinct™ MI350 系列 GPU
gfx950
完整
仅 Linux
CDNA 3
Instinct™ MI300 系列 GPU
gfx940, gfx941, gfx942
完整
仅 Linux
CDNA 2
Instinct™ MI200 系列 GPU
gfx90a
完整
仅 Linux
我们正在积极支持更多 AMD GPU,但遗憾的是较老的型号不具备我们所需的硬件支持,无法继续适配。
🖥️ 在 AMD 上使用 Unsloth 的指南
安装后,你可以在浏览器中打开 Unsloth Studio。之后,你可以在 AMD 硬件上自动运行并微调本地 LLM。下面是详细安装说明:
选择你的模型、数据集和训练设置即可开始。例如,你可以在 Gemma 4 12B 上运行 QLoRA 4-bit 微调,使用约 16k 的上下文长度、LoRA rank 16、学习率 0.0002,以及最多 30 步。

Unsloth Studio 的微调界面完全可自定义,让你配置模型、数据集和训练参数。训练期间,Unsloth 会实时跟踪进度,包括 loss、RAM 和 VRAM 使用情况,以及多 GPU 支持。一旦训练开始,你会看到进度实时绘图。
训练完成后,你可以查看历史记录,了解过去和正在进行的训练会话。从你任何已微调的模型中选择,即可查看过去的训练日志:


训练完成后,你可以将模型导出为 GGUF、合并后的 safetensors 模型,或 LoRA Adapter,以便与 Hugging Face、llama.cpp、vLLM 或 Unsloth 部署。对于 GGUF 导出,Unsloth 会使用与 AMD 兼容的 llama.cpp ROCm 预编译包,并与你的 gfx 架构匹配;如果没有预编译包,则回退为源码编译。导出完成后,你会看到“导出成功完成”。你也可以直接将模型推送到 Hugging Face Hub。

将你的模型导出为你偏好的格式,并部署到任何地方。导出后,可在 New Chat 或 Recents 的模型下拉列表中的 Fine-tuned 部分加载你的微调模型。
从下拉列表中选择你微调后的模型,并直接在 Unsloth 中与它聊天。你现在可以在 New Chat、Recents 或 Projects 中使用你训练或下载的模型。开启 think、code 和 search 开关以获得最佳体验,并查看 Unsloth Studio Chat 文档了解更多细节。

最后,你还可以直接在 Unsloth 中与新微调好的模型聊天!

你也可以像 vLLM 日志一样,在终端中监控吞吐量以及 generation tokens / s。你会看到 "gen_tok_s" 它表示 tokens / s,以及 "prompt_tok_s" 它表示提示词处理速度。

📱手机上的 Unsloth 和远程 HTTPS 隧道
我们添加了 免费的 Cloudflare HTTPS 隧道用于 Unsloth(类似 LM Link),因此你可以通过链接或其他任何电脑,在手机上(iPhone、Android——任何手机!)远程使用 Unsloth 聊天 / 训练模型!这适用于 Mac、Linux、WSL 和 Windows 设备。
从你的手机训练和微调 / 可远程查看实时训练 loss 日志 - 可取消或重新训练!
可在任何地方通过浏览器聊天,支持工具调用和实时流式输出。
真正的 可交互 HTML 画布 直接在你的手机上输出——玩由 LLM 制作的游戏!




要设置它,首先在安装 Unsloth 后打开终端,输入 unsloth studio --secure 。设置密码,这样未经授权的人就无法访问 HTTPS 链接!

然后在日志里——使用 绿色的 Cloudflare 链接 并在我们的手机或任何远程设备上输入这个!

然后你就进来了!你始终可以通过在启动 Unsloth Studio 的终端中按 CTRL+C 来监控 / 取消正在运行的 HTTPS 服务链接!



❓AMD 支持是如何为 Unsloth 构建的
Unsloth 的自定义内核是在与 AMD 团队的紧密合作下移植到 AMD 上的。这需要在安装器、硬件检测、运行时路由、监控以及预编译资源选择等方面进行改动。
ROCm 内核: 针对 RDNA 和 CDNA 调优的 HIP/Triton 移植,包含架构特定的精度、性能和稳定性修复。(#2520)
4-bit 训练: 基于 bitsandbytes 的 Radeon 和 CDNA GPU 的 QLoRA 支持。(#3748)
自动设置: 稳健的 AMD GPU 检测,以及正确的 ROCm PyTorch wheel 安装,包括修复和平台保护措施。(#4770)
ROCm 推理: 针对架构特定的 llama.cpp 预编译包、源码构建回退、AMD VRAM 检测和监控。(#5172)
🕐 未来工作
非常感谢 AMD 团队与我们合作,让 AMD 运行得如此顺畅!接下来的优先事项包括:
持续与 AMD 团队开发和协作。
使用 AMD Strix Halo 和 Radeon Lab 硬件扩展硬件后端 CI/CD。
在新的 AMD GPU 卡和架构发布时提供支持。
更清晰的多 GPU 指南:AMD 分布式训练目前仅支持 Linux。在 Linux 上,ROCm 使用 RCCL,因此分布式训练可用。在 Windows 上,AMD ROCm 目前还未提供 GPU collective 后端,截至 TheRock #5694,如果你计划进行 AMD 多 GPU 训练,请使用 Linux。
进一步针对 ROCm 栈进行速度优化。
💌 感谢 AMD 的协作!
非常感谢 AMD 团队和我们出色的 Unsloth 社区与我们合作完成此次发布。我们感谢 Strahinja Stamenkovic、Filip Jankovic、Iswarya Alex、Yue Yuan Bill He、Eda Zhou、Mahdi Ghodsi、Guruprasad 以及整个 AMD 团队,为让 AMD 支持在 Unsloth 中表现出色而共同合作!也非常感谢社区成员:Nate、UBER6、AiwendilOfMirk...、Gene、Jimster480、VELICAN、Vintheboy、archmaker、BichonFriseMax、Calandracas、Chigoma333、Edd、electroglyph、jslowbell、mk 27B UD-、Satyam、snapcast3r、TotoMC 与我们一起测试和调试。
在 AMD 上使用 Unsloth 的一个简单方法是通过 AMD Developer Cloud,它提供由 MI300X GPU 驱动、拥有 192GB VRAM 的一键式 notebooks。AMD 还通过 AMD AI Developer Program提供免费额度。要运行 Unsloth notebook,请使用来自 unslothai/notebooks 的任意 AMD notebook,并将 GitHub 域名替换为 AMD Developer Cloud URL,因为 notebook 路径是相同的。
需要帮助或想分享反馈?你可以加入我们的 Discord,阅读 AMD 文档,在 GitHub上提交 issue 或 PR,或者在我们的 Reddit r/unsloth.
最后更新于
这有帮助吗?

