For the complete documentation index, see llms.txt. This page is also available as Markdown.

Unsloth 更新

Unsloth 最新版本、改进和修复的更新日志。

要使用最新更改, 请更新 Unsloth.

Qwen3.8

Qwen3.8-27B 和 Qwen3.8-2.4T 现在可以在 Unsloth 中本地运行了!

可通过 Unsloth Dynamic GGUF 在 17GB RAM 上运行。您也可以在 Unsloth 中微调 Qwen3.8-27B。就尺寸而言,Qwen3.8-27B 迄今为止是最强的模型。我们还上传了 NVFP4 量化版本。

运行 Qwen3.8 指南微调 Muse Glimmer

Unsloth 的其他更新包括:

  • Qwen3.8-27B + 允许额外的 llama-server 参数 + 自定义 VRAM 切换

  • 外部提供方支持工具调用 + 工具支持 + 使用 Codex 登录

  • 快速 FP8 使 MiniMax-H3 推理快 10 倍(3 分钟对比 30 分钟)

  • GGUF 推理快 10% + 修复了绕过权限

  • 已连接 API 提供商 可以使用它们自己的搜索,或使用 Unsloth Desktop 内置的搜索和工具。工具结果会返回给模型,以便继续执行多步任务。

  • 使用 Codex 订阅登录,并在 Chat 中使用 Codex 工具。

要运行或训练 Qwen3.8,您可以下载 Unsloth Desktop:

下载 Unsloth Desktop

介绍 Unsloth Desktop

推出 Unsloth Desktop 🦥 —— 首个可在本地运行和训练模型的桌面应用。\n开源。可在 Mac、Windows 和 Linux 上运行

• 支持 MLX、扩散图像/视频、音频、GGUF\n• 将 Claude Code 和 Codex 连接到本地 LLM\n• 准确率提高 50%,具备自我修复的工具调用 + 沙箱化代码执行\n• 适用于 CPU + 多 GPU 配置——NVIDIA、AMD、Intel、Mac\n• 以 70% 更少的 VRAM 将模型训练速度提高 2 倍\n• 私密网页搜索、深度研究、RAG、MCP + 导出(NVFP4、GGUF)\n• 使用 Unsloth 的 OpenAI 兼容 API 和云模型\n• 安全地远程部署 LLM 并随时访问

您现在可以下载 Unsloth Desktop:

下载 Unsloth Desktop

Meta Muse Glimmer 来了!

Meta 发布了 Muse Glimmer,这是 Meta Superintelligence Labs 推出的首个开放模型。Muse Glimmer 是 Meta 的一个稠密 300 亿参数模型,专为本地智能体和编码工作流打造。它采用 Apache 2.0 许可证,您可以通过 Unsloth 和 Unsloth Dynamic 量化运行 Muse Glimmer 30B,以获得最佳性能。

运行 Muse Glimmer微调 Muse Glimmer

Muse Glimmer 30B 可在本地运行于 20GB RAM/VRAM 配置上,包括 Mac 和 GPU。您也可以在 20GB VRAM.

您可以通过 Unsloth Desktop 应用运行并微调 Muse Glimmer:

下载 Unsloth Desktop

Kimi K3 + 深度研究 + 并行聊天

大家好! Kimi K3 现在可以通过 Unsloth Dynamic GGUF 在本地运行,Unsloth 可让多个聊天并行生成,而新的深度研究模式会使用您的本地模型来规划、阅读并引用来源。

此次发布还带来了更好的 AMD 以及 Intel GPU 支持、DoRA 训练,还有许多安装器、MLX、导出和推理修复。

Kimi K3

Moonshot AI 的 Kimi K3 是一个拥有 2.8T 参数的 MoE 模型,具备 104B 活跃参数、原生视觉支持和 100 万上下文窗口。Kimi K3 仅支持思考模式,Unsloth 支持低、高和最高推理力度。

您可以运行我们的 Kimi K3 Dynamic GGUF 通过 Unsloth。Unsloth 会自动检测多 GPU 配置,并可将模型层卸载到系统内存。

Kimi K3 是一个非常大的模型,因此请相应规划您的硬件:

  • UD-IQ1_S 占用 595GB 磁盘空间。

  • UD-Q4_K_XL 占用 1.51TB 磁盘空间。

  • 若要无损推理,请使用 UD-Q8_K_XL,它占用 1.56TB 磁盘空间。

阅读我们的完整 Kimi K3 指南 并了解更多关于 Unsloth Dynamic 2.0 GGUF.

并行聊天

Unsloth 现在可以同时运行多个对话。开始一个 新建聊天 会让上一个答案继续生成,并且每个活动对话都有自己的进度指示器和停止控制。

  • 默认有 4 个 llama-server 槽位,可在网页 UI 中调整。

  • 工具、上传、自修复和智能体在不同聊天之间保持隔离。

  • 可停止单个聊天,而不会打断其他聊天或重启服务器。

  • 当内存有限时,Unsloth 会减少槽位数量。

  • 重新加载模型在确认后仍会停止活动聊天。

深度研究

深度研究会把本地模型变成完整的研究工作流。给它一个问题,它就会创建计划、搜索网页、整理证据并生成带引用的报告。

  • 在研究开始前审阅并编辑计划。

  • 在其工作时跟踪进度和收集到的来源。

  • 可在不丢失已完成研究的情况下继续或取消。

  • 允许或屏蔽网站,以控制来源选择。

  • 每次运行的来源和引用都会被保存。

  • 在撰写之前,Unsloth 会检查不受支持的主张、矛盾和未解决的空缺。没有直接证据的建议会被标记为可检验推断。

每个聊天只能有一次运行处于活动状态。深度研究目前适用于本地模型。可选的全页 grounding 可在合成前将顶部搜索结果读取到临时 RAG 中;使用以下方式启用: UNSLOTH_RESEARCH_AUTO_SCRAPE=1。它默认保持关闭,因为这会增加抓取时间并需要额外上下文。

改进的 AMD 支持

此次更新建立在我们最初的 AMD 发布与安装指南 基础上,支持更多 GPU,并提供更可靠的 ROCm 推理和训练。

  • 改进了对 RDNA2、Radeon、Ryzen、Strix Halo 和工作站 GPU 的检测。

  • MI50 和 Radeon VII 在 Linux 上支持 16 位 LoRA 和全量微调。

  • 修复了 4 位 NaN、库冲突以及较长的 RDNA 启动卡顿。

  • 不受支持的 Windows HIP GPU 可回退到 Vulkan。

  • Vulkan 设备会显示其真实名称,并可单独选择。

  • 全新 Windows 安装不再需要 Winget 或开发者工具。

训练、模型和平台更新

  • Intel XPU 可在 Intel Arc 和数据中心 GPU 上实现本地聊天和训练。

  • DoRA 现在与 LoRA 和全量微调并存。

  • 大型导出可使用所有可见 GPU,以避免 GPU 0 的内存限制。

  • MLX 增加了流式数据集、继续预训练、回调,以及更好的 VLM 和 LoRA 支持。

  • 修复了错误的 flash_attention_2 模型输出。

  • Unsloth 和保存工具现在无需 bitsandbytes 也能工作。

  • 修复了 .json 数据集以及 Qwen3.5/3.6 MoE 和 GRPO 笔记本设置。

  • Hub 下载文件夹更容易找到和打开。

  • 更新说明可在 Unsloth 更新弹窗中查看。

  • unsloth start --as-subagent 可让 Codex、Claude Code 和 Pi 将任务委派给本地 Unsloth 模型。

AMD 支持来了!

大家好!此版本将本地 LLM 训练和推理带到 AMD GPU ,覆盖 Windows、WSL 和 Linux。

快速入门功能GitHub

从今天开始,我们与 AMD 的合作、自定义 Triton 内核以及数学算法让您能够在 AMD 的 Radeon、Instinct、Vulkan、Ryzen 和数据中心 GPU 上训练并运行 500+ 个模型,速度最高提升 2 倍,VRAM 占用减少 70%,且不损失精度。优化后的 ROCm 构建还支持 GGUF 和 Safetensors 推理。

7 月 23 日更新

  1. 新增 RDNA2、Gorgon Halo、Vulkan 支持 + 修复了 AMD 安装在 Strix Halo / 其他 AMD GPU 上无法检测 GPU 的问题

  2. 更好的 RDNA4、HIP / ROCm 故障自动修复和捕获

  3. 统一内存快 2 倍 AMD safetensors 加载 + 面向统一内存设备的梯度检查点速度大幅提升

  4. 新增 语音听写 / whisper.cpp 快速文本转语音的初步支持

  5. 修复了安装期间回滚环境占用 5GB 磁盘空间的问题——现在会自动清理

在 AMD 上本地训练 LLM

  • 在 AMD GPU 上本地训练、运行 RL、聊天并部署模型。

  • 在 Windows、WSL 和 Linux 上更可靠的 AMD GPU 检测和安装。

  • 改进了 AMD MI300X 和 MI325X GPU 的 ROCm 兼容性。

  • 通过以下方式远程访问 Unsloth: unsloth studio --secure 通过 Cloudflare 提供的免费 HTTPS

在您的硬件上运行更大的模型

  • 使用自动 GPU 放置,或精确选择要使用的 GPU 和模型层。

  • 将 MoE 专家层移动到系统内存中,以帮助更大的模型适配。

  • 将模型拆分到多个 GPU 上,或使用张量并行。

  • 为每个模型和量化版本分别保存硬件设置。

更快的聊天重启和更可靠的下载

  • 当空闲模型释放其 VRAM 后,可继续长聊天,而无需重建完整对话。

  • 卡住的 Hugging Face XET 下载会自动通过标准 HTTP 重试。

  • 每次模型加载时都会复用已有的 GGUF 文件,而不是再次下载。

更好的搜索、工具和智能体

  • 网页搜索现在可以读取 PDF 论文、手册和其他 PDF 结果。

  • 并行工具调用、推理输出和工具重试工作更可靠。

  • 一个新的可选 MCP 端点允许兼容的 AI 客户端检查模型和训练历史、开始或停止训练、加载检查点、验证配方并导出 GGUF。

    • 通过以下方式启用: UNSLOTH_STUDIO_ENABLE_MCP=1 并通过以下方式设置所需的 bearer token: UNSLOTH_STUDIO_MCP_TOKEN.

训练和导出修复

  • 使用多模态模型进行纯文本训练时,不再会在打包前截断长样本。

  • 微调后的 Qwen3.5 和 Qwen3.6 MTP 模型现在可正确导出为 GGUF。

  • 修复了一个 Windows 权限错误,该错误可能会在最终写入步骤中停止 GGUF 导出。

如果您错过了

我们之前的 Studio 版本加入了 Dynamic NVFP4 模型、更深入的个性化、7 种新的显示语言、更安全的智能体以及 Vulkan GPU 加速。

Dynamic NVFP4:

Unsloth Dynamic NVFP4 会将对精度敏感的层保留为 FP8 或 BF16,而其余部分以 W4A4 运行。在 NVIDIA Blackwell GPU 上,这可实现最高 2.5 倍更快的推理,而经过校准的 FP8 KV 缓存可提供最高 2 倍更长的上下文。

阅读 Dynamic NVFP4 指南 并探索我们扩展的 NVFP4 集合,其中包括 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。

个性化您的 Studio:

在 Standard、Classic 和 Minimal 配色方案之间选择,每种都有浅色和深色模式。您还可以自定义颜色、导入字体,并调整字体大小、对比度、减少动态效果等。

Unsloth 还包含一个语音设置选项卡,用于听写、自定义词典设置和朗读。

新语言:

Unsloth Studio 现已支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语,以及简体中文、日语和葡萄牙语(巴西)。浏览器语言自动检测现在为默认设置。

更安全的智能体:

一个四级工具调用权限选择器——询问, 为我批准, 关闭完全访问——可对智能体进行更精细的控制。智能体工作区隔离和更安全的安装器检查也降低了意外更改的风险。

个性化、NVFP4、语言

大家好,我们为 Unsloth 带来了很多新更新,尤其是自定义方面。现在您可以个性化您的 Unsloth:三种配色方案加上自定义颜色和字体、七种新的显示语言,以及用于听写和朗读的新语音设置选项卡。智能体通过四级工具调用权限选择器(询问、为我批准、关闭、完全访问)和工作区隔离变得更安全,Intel GPU 也终于可通过新的 Vulkan\n llama.cpp 支持。

我们还新增了对以下内容的原生支持: Inkling,这是一个拥有 9750 亿参数的开放模型,具备 410 亿活跃参数和最高 100 万 token 的上下文窗口。它采用 Apache 2.0 许可,接受文本、图像和音频并生成文本。

Dynamic NVFP4

我们扩展了我们的 NVFP4 集合 ,加入了 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4 的量化版本。

阅读 Dynamic NVFP4 指南 以了解详情。

个性化您的 Unsloth

Unsloth 不再局限于浅色和深色模式:

  • 从以下选项中选择 标准, 经典,以及 极简 配色方案,每种都有浅色和深色变体。

  • 自定义强调色、背景色和前景色。

  • 导入您自己的 UI、标题、聊天和代码字体。

  • 调整字体大小、对比度、动态效果、光标行为和字体平滑。

  • 搜索设置并在设备间同步偏好设置。

浅色和深色模式各自保留自己的自定义值。

七种新语言

Unsloth 现在支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语,以及中文、日语和葡萄牙语。浏览器语言自动检测现在为默认设置。

语音设置

新的语音选项卡增加了用于听写、发音词典和朗读的控件。语音转文字和文字转语音支持即将推出;完整语音对话仍在开发中。

更安全的智能体和工具调用

旧的绕过开关现在变成了四级权限选择器:

  • 询问: 批准每一次工具调用。

  • 为我批准: 自动运行只读操作,并在可能不安全的操作前暂停。

  • 关闭: 禁用工具调用。

  • 完全访问: 允许所有调用并禁用沙箱。

这些控件涵盖终端、Python、网页搜索、RAG 和 MCP 工具。智能体还获得隔离工作区,以及可恢复的会话,使用 --persist,更安全的远程安装器警告、实时工具输出流式传输,以及改进的网页提取。

Vulkan 和 llama.cpp

新的 Vulkan llama.cpp 后端让 Intel GPU 获得 GPU 加速推理,而不是退回到 CPU。它支持现有的 VRAM 管理、自动上下文大小设置、多 GPU 选择和层卸载。

AMD 用户可以通过以下方式启用:

UNSLOTH_FORCE_VULKAN=1

我们还提高了更新可靠性、模型状态恢复以及卡住生成的中断能力。

模型与训练

此次发布还包括:

  • 原生 Inkling 支持以及多 GPU B200 改进。

  • DeepSeek-V4 eager attention 和可训练的 FP8 分组专家。

  • 通过自动聊天模板标记检测实现可靠的仅完成训练。

  • 正确处理已禁用的梯度检查点。

  • 改进了 RoPE 缩放和上下文扩展。

  • 对卡住的训练运行进行强制停止。

  • 为新模型架构和较新的 Transformers 版本提供自动路由。

DeepSeek-V4 + NVFP4

Unsloth 现在可以在训练后导出 NVFP4、FP8 和 imatrix GGUF;充当 llama-swap API 系统;添加日语和巴西葡萄牙语支持;并包含 MLX、safetensors、工具调用、自修复支持等更多功能。Unsloth core 让 GRPO 快 1.3 倍,增加了对卡住下载的 HTTP 回退,改进了离线模式,将 MoE 训练加速 3-5 倍,并修复了许多错误。此发布系列使用 unsloth>=2026.7.1.

DeepSeek-V4-Flash 现在支持思考切换以及我们改进的聊天模板修复。

更智能的兼容 OpenAI 的 API 服务

运行一个本地 API 端点,具备更安全的模型切换和更好的智能体工具恢复。

  • API 请求可选择在已下载的本地 GGUF 之间自动切换,而未知模型名称会安全地继续使用当前模型。

  • /v1/models 现在返回干净的模型 ID 和本地 GGUF 目录,而不是本地 .gguf 路径。

  • 空闲自动卸载可在不活动后释放 VRAM,且工具调用修复现在可按请求控制。

导出改进

导出更灵活,并避免不必要的下载。

  • 可一次选择多种导出格式,包括便携式 FP8/INT8、GGUF LoRA、与源码匹配的导出、imatrix GGUF 和压缩 FP8/FP4。

  • 多检查点导出可进一步避免重复下载基础模型。

  • FP8、INT8 和 GGUF-LoRA 导出现在会遵循 trust_remote_code,而且 GGUF 导出对缺失的量化设置处理得更可靠。

RAG 和文件聊天

文件聊天在真实文档上更有用。

  • RAG 附件现在可使用整篇文档上下文,并支持可自定义的嵌入模型和 Hugging Face 搜索。

  • 文件聊天现在能更正确地读取更多 PDF 和 Word 文档,包括从右到左文本、印度语文本和 DOCX 表格。

  • 在代理环境下,本地 RAG 检查更可靠。

Unsloth 优化与可靠性

日常使用应感觉更流畅、更稳定。

  • 长时间训练和聊天运行更不容易无声卡死。

  • 对比模式、模型切换、模型取消、Hub 浏览和 Hub Discover 更可靠。

  • 项目导出、聊天导出、设置、引导式教程、文件对话框、更新界面和推理 UI 更整洁且更一致。

安装器、硬件和平台修复

Unsloth 在各个平台上的安装和运行更加可靠。

  • 当有预构建版本可用时,macOS 安装不再需要 CMake 或 Homebrew llama.cpp ,且 Apple Silicon 支持对包含空格的路径和统一内存大小处理得更好。

  • Windows 启动、UTF-8 处理、ROCm RAG 嵌入以及 WSL 上的 ROCm GPU 支持得到了改进。

  • Blackwell GPU 预构建版本选择、GGUF 适配检查、用于 vision/mmproj GGUF 的张量并行,以及本地 llama.cpp 复用现在更可靠。

训练、模型和内核

在更多配置下,训练和模型加载更加可靠。

  • GRPO 现在默认支持序列打包,避免重复共享提示,并正确处理 DDP logit 缩放。

  • 修复了全量微调、RL 精度设置、梯度检查点、DDP RoPE 缓冲区和 MoE LoRA 检测。

  • FP8 量化/反量化、Transformers v5 下的 Llama 3 RoPE 缩放、PEFT 0.19 LoRA 重新加载,以及 fast_generate 错误消息得到了改进。

GLM 5.2 + Hub + 长 3 倍的上下文

GLM-5.2 现在已在 Unsloth Studio 中支持!支持所有推理级别。 3 倍更长的上下文长度 现在可通过我们带有 MTP 的新自动适配算法实现,从而支持更长的聊天。绕过权限模式、可分叉聊天、可排队聊天、用于模型发现的新 Hub、并行模块 + HTTPS Cloudflare 支持等!使用 unsloth studio --secure 以获得安全的 HTTPS 全球访问!

更好的上下文长度算法

根据 PR 1PR 2,我们大幅改进了 Unsloth Studio 对内存使用和上下文长度的判断,使整体上下文长度提升 3 倍:

场景
KV
之前
之后

1x 32GB 管道(约剩余 31 GB)

f16

23,040

64,000

q8_0

43,520

114,944

q4_0

82,432

199,680

2x 32GB 管道

any

262,144

262,144

2x 24GB 张量(约剩余 23 GB)

f16

134,049

262,144

q8_0

252,329

262,144

聊天画布、分叉与队列

  • 可直接编辑助手消息,并从线程中的任意位置重新运行。

  • 分叉线程,在不丢失原始对话的情况下创建分支。

  • 临时(隐身)聊天,不留下任何痕迹。

  • 在生成仍在运行时排队新提示,而不是等待。

  • 聊天“工件”现在是 画布,带有内联 HTML 画布卡片 可自动渲染,提供代码视图,而且 DiffusionGemma 会将其原始代码以内联方式保持可见,而不是折叠。

  • 聊天搜索现在涵盖每条消息,并优先显示您自己的消息。

Hub(重新设计)

  • 全页 Hub,带有趋势动态、搜索和自定义模型路径支持。

  • README 在分屏动态中预览,因此您可以先阅读再下载。

  • 下载默认使用更快的 Xet 传输方式,如果传输卡住则自动回退到 HTTP。

  • 新增“选择时加载”开关,可在模型加载前设置加载选项。

  • DiffusionGemma 和未来的 Gemma 衍生模型将显示 Google 标志。

模型与推理

  • DeepSeek-OCR 和更多视觉模型现在可以无错误地加载和运行。

  • 修复了最新 vLLM(0.22+)上的快速推理,因此加速效果恢复正常。

  • 张量并行更可靠:如果更快的 MTP 路径失败,它现在会自行恢复,而不是崩溃。

  • DiffusionGemma 现在会在去噪时实时显示图像形成过程,并提供准确的速度统计。

安全与 Cloudflare 加密 Studio

  • --secure 适用于端到端加密工作室的仅 Cloudflare 模式,同时在下保持服务端工具启用 --secure。使用 unsloth studio --secure!

  • 绕过权限模式以跳过确认,并在你需要时禁用工具沙箱。

  • 自动检测 Hugging Face 病毒扫描 + 仓库中的危险文件。

日志与 API

  • API 服务器监视器 在 Unsloth 中。

  • 更快的 API 调用和更低的延迟

  • 日志大幅精简得多——现在包含吞吐量和延迟,并移除了许多臃肿日志。

硬件与后端

  • 更好支持 Blackwell RTX 50X 和 60X GPU

  • 修复静默降级为 CPU 而不是 GPU 的问题

  • torchao 版本现在从已安装的 torch 中选择。

  • 安装程序现在会自动修复损坏或仅 CPU 的 PyTorch 安装,并在静默回退到 CPU 时发出警告,覆盖 NVIDIA + AMD,在 Win/Linux/Mac/WSL 上均适用。

  • 在训练开始时释放聊天模型的 VRAM,但仅在 GPU 确实吃紧时才这样做(否则不会进行不必要的重新加载)。

  • 如果 llama-server 在启动时硬崩溃,Unsloth 现在会逐级尝试恢复,而不是直接失败。

训练与通用修复与并行模块

  • MLX 训练更新。

  • 使用 vLLM 改进了 GRPO 训练可靠性。

  • 训练启动更加可靠,并为无效的 VLM 批次提供了更清晰的错误信息。

  • Unsloth 现在在崩溃、重启或中断关闭后,更可靠地清理残留的后端进程。

  • 导出、聊天、训练、配方现在都彼此独立/隔离!这意味着你现在可以同时进行这 4 项操作!你可以在等待训练运行或导出时聊天/做推理!

要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

DiffusionGemma + Gemma 4 MTP

确保你安装最新的 v0.1.464-beta2026.6.7. DiffusionGemma, Gemma 4 MTPMiniMax-M3 现在都已支持。

Hub + 下载管理器(实验性)

  • 新增了一个 Hub 页面,用于浏览、下载和管理 Hugging Face 模型与数据集。

  • Unsloth 现在可以检测你机器上已存在的模型和数据集,并将它们与已下载资源一起显示。

  • 已下载 GGUF 模型 现在具有直接的 运行 / 新聊天 操作。

RAG / 使用文件聊天(实验性)

  • 新增 使用文件聊天 在 Unsloth 中,让你可以针对自己的文档和知识库提问。

  • 支持混合搜索、引用、PDF 预览、按线程文档,以及内置的 search_knowledge_base 工具。

新更新按钮 + 硬件支持

  • Unsloth 现在使用始终保持最新的 llama.cpp 预构建版本 ,覆盖 CUDA、ROCm、Windows、Linux 和 macOS。

  • 新增了应用内的 更新 llama.cpp 按钮,因此用户可以在不重新安装 Unsloth 的情况下更新本地后端。

  • 改进了 Windows / WSL AMD 支持, Strix Halo ROCm 支持, Blackwell CUDA 选择,以及更清晰的安装程序信息。

本地聊天、工具与 API 兼容性

  • 本地 工具调用 更加可靠,工具卡片排序更好,重复工具循环更少,并支持在 GGUF 视觉模型上使用工具。

  • 改进了 OpenAI 兼容 API 以及 Anthropic 兼容 API 在本地 Unsloth 服务器上的行为,包括更好的错误信息、token 使用量、停止原因,以及 Claude Code 兼容性.

训练与修复

  • 改进了 MLX 支持 ,并改进了模型标签、生成速度统计,以及修复了 VLM 训练.

  • 修复了若干 训练数据集 边缘情况,包括不可写的 Hugging Face 缓存和自定义数据集映射。

  • 在聊天、菜单、模型选择器、深色模式、导入/导出和设置中增加了许多 UI 精修修复。

要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Gemma 4 12B、新 UI、MCP、项目

本次更新主要聚焦于 Gemma 4 12B、MCP、项目、Canvas、CUDA 13.3 和新的聊天 UI。下周我们会有更大的更新。

Gemma 4 12B

Google 发布了 Gemma 4 12B,这是一个可在 8GB RAM 上本地运行的新模型。 GGUF / 指南

Gemma 4 12B Unified 支持图像、音频和 256K 上下文。可通过 Unsloth Studio 运行并训练该模型。

MCP

  • 远程 MCP 服务器支持,包括自定义标头和 OAuth

  • 本地基于命令的 MCP 服务器支持

  • MCP 现在可以从聊天编辑器中开启

  • 常见 MCP 服务器的内置预设

全新聊天 UI

  • 项目、Canvas、 MCP、RAG 和 Compare 控件现在都位于加号菜单中

  • 从编辑器更容易访问搜索和代码控件

  • 菜单、覆盖层、图标和可点击控件在 Unsloth 中更加一致

项目

  • 将相关聊天整理到专用项目工作区中

  • 将现有聊天移动到项目中

  • 直接从侧边栏创建和管理项目

实验性 Canvas / 工件

  • 在 Unsloth Studio 内的专用画布面板中打开生成的 HTML

  • 支持交互式输出,包括基于浏览器的可视化和通过 CDN 加载的包

  • 可在渲染预览和源代码之间切换

安装、运行时与硬件

  • Windows 预构建安装现在不再需要早期的 CUDA Toolkit 检查

  • Linux llama.cpp 预构建版本现在与检测到的运行时匹配 cudart 主版本

  • ROCm gfx 检测已转发到预构建版本选择中

  • Blackwell, B300ARM64 Linux 支持更新

要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

CUDA 13.3、Windows、Mac

要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Mac 更新

  • 重新启用 llama.cpp Apple Silicon(M1-M4)预构建二进制文件 - Mac OS 14 / 15 / 26(Tahoe)

  • Apple Silicon Mac OS 13(Ventura)为源码构建

  • Mac OS 13.3 / 14 / 15 / 26(Tahoe)上的 Intel(x86_64)使用 llama.cpp 预构建二进制文件

  • Mac OS 13.0 - 13.2 的 Intel 为源码构建

Windows 更新

  • CUDA 13.3 llama.cpp 预构建二进制文件现在可在 Windows 上使用

  • 对于 CUDA 13.2、CUDA 13.1 及更低版本,Windows 设备将使用 CUDA 12.4 回退——我们很快会着手处理 CUDA 13.1 二进制文件。

CUDA 13.3 更新

  • CUDA 13.3 的非 Linux 二进制文件可用。我们目前仍将使用 CUDA 13.1

  • CUDA 13.3 解决了 CUDA 13.2 的乱码问题 - 见 https://github.com/unslothai/unsloth/issues/4849

Blackwell GPU 更新

  • 目前 Blackwell 将会延迟发布 llama.cpp 预构建二进制文件,因为 CUDA 12.4 不可用——我们正在努力尽快解决此问题。

重构前的一次更新。

大家好,在即将到来的一次重大重构之前,我们还会再做一次差不多的更新,这次重构很可能会在本周或下周到来。我们的重构将改变很多东西,尤其是新增重大功能以及大量设计变更。

  • 新: API 调用支持 现在支持图像生成 + 编辑、正确的网页搜索、代码执行、自动提示缓存。连接 OpenAI, Anthropic 以及更多。

  • 对以下内容的完整支持 非英语语言 例如日语、中文、印地语等。

你们中的许多人可能错过了我们之前只持续了一天的发布。我们引入了:

  • 连接到外部推理后端: vLLM, Ollama, llama-server

  • 安全性改进

  • 自动 MTP 推测解码 适用于 MTP GGUF;根据你的硬件获取最佳定制设置。

API 提供商调用与外部连接

  • 你现在可以将 Unsloth 连接到任何 API 云提供商(OpenAI、Anthropic、OpenRouter 等)

  • 内置网页搜索 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi

  • 内置代码执行 适用于 OpenAI 和 Anthropic(Anthropic 容器会持续存在并在不同轮次间复用)

  • OpenAI 和 Anthropic 模型已启用提示缓存,可节省 50% 到 90% 的成本。

  • 图像生成 + 编辑

  • 本地提供商(llama.cpp / vLLM / Ollama)的 API 密钥现在可选

  • 添加云提供商时自动加载模型

其他 Unsloth Studio 更新

  • OpenDocument 聊天附件

  • o3 推理摘要负载

  • 发送/提示非英语语言(例如日语、中文)现在可以正常工作

  • IME 编辑器加固,RTL dir="auto",修复长日志行截断问题

  • UI 中的工具推理轨迹渲染

  • 完全离线支持:缓存的 GGUF 发现以及针对推理和训练的离线 DNS 自动检测

Unsloth Studio 安全性改进

  • 认证速率限制,支持代理感知,因此反向代理不会绕过它

  • 带有更严格黑名单的沙箱工作进程(bash, hf 上传, NOFILE)

  • 路径包含,因此工作进程无法逃离其进行中的 tmp 目录

  • 跨 Unsloth API 的严格 schema 验证

  • 收紧的 CSP / 安全标头(仅允许合法的 favicon 主机)

  • 移除了 torch.loadtraining_args.bin 上的回退,因此不可信的 pickle 在模型加载时永远无法执行

  • 加固的 Tauri 桌面发布流程

  • 前端认证:单飞式令牌刷新、更改时输入当前密码、可用的登出、共享的 422 助手

  • 取消清理现在严格限定在进行中的 tmp 目录中,因此它永远不会删除用户状态

MTP + Unsloth 修复

Unsloth 有大量 bug 修复、UI 和 UX 修复!要获取最新更新,请执行:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

修复

  1. 修复 unsloth studio 更新 运行不佳

  2. 修复卡在 重置密码 页面

  3. 更多离线模式支持

  4. 改进 MTP 在 Mac、CPU 和 GPU 上不够快的问题——现在好多了!

  5. 修复桌面快捷方式在更新后无法工作的问题

  6. 大量 UI/UX 错误修复

Qwen3.6 MTP + API 连接

我们为 Unsloth 带来了许多新更新 v0.1.41-beta:

  • GGUF 推理快约 2 倍 并自动启用 MTP

  • API 调用支持 用于 OpenAI, Anthropic 等,配有自动提示缓存、网页搜索、代码执行

  • 连接到外部推理后端: vLLM, Ollama, llama-server

  • 实验性 MLX 推理

  • 对以下内容的完整支持 非英语语言

  • 安全 改进

运行 Qwen3.6 教程MTP 指南

MTP 推测解码支持,推理速度提升 1.4 到 2 倍!

  • 自动 MTP 推测解码 适用于 MTP GGUF;当捆绑的 llama.cpp 预构建版本过旧或对 MTP 来说太老时发出警告

  • 用于 MTP 支持的新预构建 llama.cpp 二进制文件!

API 提供商调用与外部连接

  • 你现在可以将 Unsloth 连接到任何 API 云提供商(OpenAI、Anthropic、OpenRouter 等)

  • 内置网页搜索 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi

  • 内置代码执行 适用于 OpenAI 和 Anthropic(Anthropic 容器会持续存在并在不同轮次间复用)

  • OpenAI 和 Anthropic 模型已启用提示缓存,可节省 50% 到 90% 的成本。

  • 本地提供商(llama.cpp / vLLM / Ollama)的 API 密钥现在可选

  • 添加云提供商时自动加载模型

MLX 推理(实验性)

  • MLX 量化和模型现在可以在你的 Mac 机器上本地运行了!

  • 我们很快会添加思考、工具和网页搜索!

其他 Unsloth Studio 更新

  • 发送/提示非英语语言(例如日语、中文)现在可以正常工作

  • OpenDocument 聊天附件

  • o3 推理摘要负载

  • IME 编辑器加固,RTL dir="auto",修复长日志行截断问题

  • UI 中的工具推理轨迹渲染

  • 完全离线支持:缓存的 GGUF 发现以及针对推理和训练的离线 DNS 自动检测

  • 大量 UI/UX 精修:深色主题重构、右侧边栏重新设计、按一天中的时间变化的树懒吉祥物、可关闭且可复制的提示通知、更大的聊天编辑器、代码执行配置精修、编辑器操作胶囊样式、较窄的 Discord 按钮

训练更新

  • Gemma 注意力掩码修复

  • 多图像 GRPO

  • GRPO 隐状态返回实验

  • 新的持续预训练(CPT)训练方法作为一等选项

  • 注册了 Gemma-4 MoE LoRA 提取器以修复 grouped_mm 收缩崩溃

  • 可选的融合 lm_head + 交叉熵前向,在下具有单 matmul 路径 UNSLOTH_RETURN_LOGITS=1

  • 传递评估批大小

  • 评估/训练路径现在遵循 HF_DATASETS_OFFLINE 以及 HF_HUB_OFFLINE

Unsloth Studio 安全性改进

  • 认证速率限制,支持代理感知,因此反向代理不会绕过它

  • 带有更严格黑名单的沙箱工作进程(bash, hf 上传, NOFILE)

  • 路径包含,因此工作进程无法逃离其进行中的 tmp 目录

  • 跨 Unsloth API 的严格 schema 验证

  • 收紧的 CSP / 安全标头(仅允许合法的 favicon 主机)

  • 移除了 torch.loadtraining_args.bin 上的回退,因此不可信的 pickle 在模型加载时永远无法执行

  • 加固的 Tauri 桌面发布流程

  • 前端认证:单飞式令牌刷新、更改时输入当前密码、可用的登出、共享的 422 助手

  • 取消清理现在严格限定在进行中的 tmp 目录中,因此它永远不会删除用户状态

Unsloth API 端点

v0.1.39-beta 错误修复 2026 年 5 月 5 日

修复聊天历史不显示(现有聊天历史不会丢失)以及附件无法正确附加的问题。该 bug 仅影响渲染——使用 2026.5.2 或直接调用 curl -fsSL https://unsloth.ai/install.sh | sh 以更新

你可以通过将本地 LLM 连接到 Unsloth 的 API 端点来与诸如 Claude CodeCodex 之类的工具一起使用本地 LLM,这样可以运行像 QwenGemma 这样的模型,具备自我修复工具调用、代码执行和网页搜索等附加功能。

将 Unsloth 用作 API 推理端点之所以有益,不仅因为它易于设置且速度快,还因为 Unsloth 提供:

新模型

我们还带来了一些新的可运行模型,包括 NVIDIA Nemotron 3 Nano Omni、IBM Granite 4.1Mistral 3.5 Medium。我们帮助 Mistral 解决了 transformers 和 GGUF 实现中的一些问题。

Unsloth 更新

  • 已停止的 Unsloth 训练现在可以从检查点继续。

  • 聊天线程现在可更可靠地自动保存并持久保留。

  • 已修复多进程设置中的 DPO 训练挂起问题。

  • 通过 MROPE 更新改进了 VLM GRPO 支持。

  • Unsloth 的停止按钮现在可以正确停止生成。

  • 修复浏览器刷新后聊天模板消失的问题。

全新 UI 重设计

大家好,我们重新设计了整个 Unsloth Studio UI 和 UX 体验,重点放在聊天和训练上:

  • 根据社区反馈添加了可折叠侧边栏

  • 你现在可以删除聊天并搜索过去的对话

  • 为支持它的模型新增 Preserve Thinking 开关,例如 Qwen3.6

  • 更简洁、更一致的设计,导航更轻松

  • 扩展的设置页面,包含更改头像、名称等选项

  • 不再需要两次输入你的 Hugging Face 令牌

  • gpt-oss 现在有低、中、高思考开关。

  • 现在使用最新的 llama.cpp 预构建版本,即使在 Linux CUDA 上也是如此

  • 大量 bug、一致性和稳定性修复

  • Kimi-K2.6 现在可以运行了!

  • 我们还添加了实验性 API 支持。指南、公告等将于下周发布。

Qwen3.6 之前也已经在 Unsloth Studio 中支持运行和训练。你现在就可以训练并运行 Qwen3.6-27B!

Qwen3.6-27B + Kimi K2.6

Qwen3.6-27B 现在可以运行(18GB RAM)并在 Unsloth Studio 中微调。Kimi K2.6 也可以在 Unsloth 中运行(350GB RAM)。

Unsloth Studio 收到了许多新更新,所以请更新。详情和说明将在接下来的几天内发布。

Qwen3.6

Qwen3.6 现在可以在 Unsloth Studio 中运行并微调。该模型可在 23GB RAM 上运行,并且几乎在所有基准中都是最强的中型 LLM。

Gemma 4 更新 + MiniMax-M2.7

Gemma 4 GGUF 现在已更新为 Google 官方聊天模板修复(修复/改进了工具调用),以及最新的 llama.cpp 修复。更新到最新的 llama.cpp,重新下载量化版本后,你应该不会再看到 未使用的 token 问题了。 MiniMax-M2.7 现已发布!你可以使用我们的 GGUF 在 128GB RAM / 统一内存上以 4-bit 量化本地运行该模型。 MiniMax-M2.7 GGUF

Gemma 4 修复

我们已更新 Gemma 4 并包含许多修复。这些 bug 是通用的,影响了所有训练包和实现,并且 并非源自 Unsloth。我们已经识别出这些 bug,修复了它们,现在 Gemma 4 训练在 Unsloth 中可以正常工作。

你只需要 8GB 显存 来训练 Gemma-4-E2B 在本地。Unsloth 训练 Gemma 4 速度约快 1.5 倍,同时使用约少 60% 的显存 相比 FA2 配置。关于 Gemma 4 训练的完整指南和笔记本, 请参阅我们的博客.

Gemma 4 训练修复

  1. 梯度累积 不再会导致 loss 爆炸。此前,loss 可能会飙升到 300–400;预期的 loss 大约在 10–15.

  2. 已修复 IndexError 影响 26B31Btransformers.

  3. 已修复 E2B/E4Buse_cache=False时输出乱码的问题。请参见 问题 #45242.

  4. 修复了 float16 音频-1e9 值溢出。

如果你看到 loss 高于 13–15, 例如 100300 - 梯度累积很可能被错误处理了。这个问题已在 UnslothUnsloth Studio.

Gemma 4 量化重新上传版

中修复。我们也更新了 Gemma 4 GGUF,因此你需要重新下载。再次说明,这些量化问题 与 Unsloth 无关,也不是由 Unsloth 引起的:

  1. CUDA:在融合前检查缓冲区重叠 - 这是针对以下内容的关键修复 <unused24> tokens - PR #21566

  2. kv-cache:为异构 iSWA 支持注意力旋转 - PR #21513

  3. 词汇表:为 Gemma 4 的 BPE 反分词器添加字节 token 处理 - PR #21488

  4. 转换:设置 "add bos" == True 用于 Gemma 4 - PR #21500

  5. common:添加 Gemma 4 专用解析器 - PR #21418

  6. llama-model:读取 final_logit_softcapping 用于 Gemma 4 - PR #21390

  7. llama:为 Gemma 4 添加自定义换行拆分 - PR #21406

Unsloth Studio 更新

  • 添加 推测解码 支持(ngram-mod,默认开启)

  • Llama.cpp 已更新为使用包含所有 Gemma 4 修复的最新版本

  • 修复 Qwen3.5 和 Gemma 4 训练问题

  • 启用 Gemma 4 模型的导出和保存

  • 加强终端和 Python 工具的沙箱安全性

  • 让 recipes 使用在 Chat 中加载的模型

  • 修复导航时(以及切换标签页时)空聊天线程的问题,并稳定新建聊天流程

  • 允许非 LLM recipes 运行,并将 Data 标签页在执行中移到第一位

  • 复用 HF 缓存仓库的大小写以防止重复下载

Google - Gemma 4

  • 你现在可以运行和训练 Gemma 4 Unsloth 中的这些模型。

  • Intel Mac 现在可正常工作

  • 为 llama.cpp 提供了两个 Gemma-4 修复的预编译二进制文件:

    • vocab:修复 Gemma4 分词器(#21343)

    • 修复:gemma 4 模板(#21326)

  • 较小模型的工具调用现在更稳定,不再会被截断

  • 适用于 Windows、Linux、Mac、WSL 设备的预编译二进制文件 - CPU 和 GPU

  • 推测解码已为非视觉模型添加(遗憾的是 Gemma-4 是视觉模型,而 Qwen3.5 也是)

  • 上下文长度现在已正确应用。

  • 网页搜索现在确实会获取网页内容,而不只是摘要

  • HF API 调用减少 90% - 限流更少

工具调用准确率提升 50% + 更多支持

  • 所有模型的工具调用现在都 准确度提升了 30% 到 80%。

  • 网页搜索现在确实会获取网页内容,而不只是摘要

  • 允许的工具调用次数从 10 次增加到 25 次

  • 工具调用现在终止得更好,因此循环/重复会减少

  • 更多 工具调用修复 以及去重逻辑,以防止工具调用泄露 XML

  • 已测试: unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL),已启用网页搜索 + 代码执行 + 思考。

指标
之前
之后

响应中的 XML 泄露

10/10

0/10

使用了 URL 抓取

0

4/10 次运行

歌曲名称正确的运行次数

0/10

2/10

平均工具调用次数

5.5

3.8

平均响应时间

12.3 秒

9.8 秒

新功能

  • 新增 自定义文件夹 这样你就可以在任何文件夹中使用任何 GGUF——目前可在 Chat 的高级设置和自定义文件夹中访问

  • 更新按钮 现在可见

  • 安装脚本样式全部更新!

  • 初步 用于推理和训练的自动多 GPU 支持 - 适用于单块 GPU 放不下的大模型 - Unsloth auto 将自动分配 GPU 资源

  • Intel Mac 应该开箱即用

更流畅、更快速的 Unsloth

  • 修复大型模型下载超时问题 - 不再会看到超时。

  • 修复 Hugging Face 限流 - HF API 调用减少 90%

  • 修复 Windows 上的 bun,并加快安装速度

新的重要更新

距离我们上一个版本才过去 2 天,但我们带来了更重要的更新:

  • 推理现在快了 20–30%。 此前,工具调用和重复惩罚可能会让推理速度慢于正常水平。现在推理 tokens/s 应该与……表现相同 llama-server / llama.cpp.

  • 现在会自动检测较旧或已存在的模型 下载自 LM Studio、Hugging Face、 以及类似来源。

  • 推理 token/s 速度现在计算正确。 此前,tokens/s 包含启动时间,这使显示速度看起来比实际更慢。现在它应该能反映“真实”的推理速度。

  • CPU 占用不再飙升。 此前,内联查询器身份在每次渲染时都会变化,导致 useLiveQuery 持续重新订阅。

  • Unsloth Studio 现在有了关闭的 x 按钮,并且可以正确关闭。 此前,从桌面图标打开后再关闭并不会正确退出。现在,通过快捷方式启动也会打开终端,关闭该终端会彻底退出 Unsloth Studio。如果你仍然在之前的会话中保持它打开,可以重启电脑或运行 lsof -i :8888 然后 kill -9 <PID>.

  • 更好的工具调用和网页搜索 并减少错误。

  • 更新了文档,增加了许多关于以下内容的新信息: 删除模型、卸载 等等。

  • 在 Windows 和 Linux 上更简洁、更智能的安装与设置日志。 输出现在更易读,格式一致,默认更安静以获得更流畅的体验,并支持更丰富的 --verbose 诊断信息,以便在你需要完整技术细节时使用。

  • 你现在可以查看你的训练历史!

Unsloth Studio 发布后的首次发布

大家好,这是我们发布 Unsloth Studio 以来的首次版本更新。新增了很多功能和修复:

  • 你现在可以更新 Unsloth Studio 了! 请使用相同的安装命令进行更新。

  • Windows CPU 或 GPU 现在都能无缝工作。请重新安装!

  • 应用快捷方式。安装后,你现在可以通过开始/启动菜单和桌面上的快捷方式图标在 Windows、MacOS 和 Linux 上启动。

  • 预编译 llama.cpp 二进制文件mamba_ssm - 安装速度快 6 倍!二进制文件大小也小于 300MB。

  • 安装体积减少 50% (节省 7GB 或更多)、安装速度提升 2 倍,解析更快。pypi 体积缩小 50%。

  • 工具调用已改进。 更好的 llama.cpp 解析,聊天中不再显示原始工具标记,更快的推理,一个新的工具输出面板,计时器。

  • MacOS 和 CPU 现在都有 数据 recipes 并启用了多文件上传。

  • Linux 上 AMD 支持初步 仅限机器 - 自动检测。

  • 设置侧边栏重新设计。 设置现在已分组为 模型、采样、工具和偏好

  • 上下文长度 现在可调整。请注意,这并非必需,因为 llama.cpp 会通过 --fit on

  • 多文件上传。 数据 recipes 现在支持对 PDF、DOCX、TXT 和 MD 进行多个拖放上传,带有后端提取、已保存上传和改进的预览。

  • Colab 与免费 T4 GPU 一起使用的 Unsloth Studio 现在已修复! 在此试用。由于使用了预编译二进制文件,它的速度也快了 20 倍!

  • 更好的聊天可观测性。 Unsloth 现在会显示 llama-server 时间与使用情况、上下文窗口使用条,以及更丰富的来源悬停卡片。

  • 整体 UX 更好 - 可点击链接、更好的 LaTeX 解析、默认卡片的工具/代码/网页提示信息等等!

  • LiteLLM - Unsloth Studio 和 Unsloth 没有 受到最近 LiteLLM 安全事件的影响。Nemo Data Designer 仅在 1.80之前使用 LiteLLM, 1.82.71.82.8而不是受影响的版本,并且之后已将其完全移除。

  • 我们现在有了新的单行安装命令,只需运行:

修复:

  • Windows/安装改进。 修复了 Windows 静默退出、Anaconda/conda-forge 启动崩溃、非 NVIDIA Windows 安装损坏,以及缺失的早期 CUDA/旧 venv 设置检查。

  • 系统提示词已修复。 它们现在再次适用于非 GGUF 文本和视觉推理。

  • 持久化系统提示词和预设。 自定义系统提示词和聊天预设现在会在重新加载和页面切换后保持。

  • GGUF 导出扩展。 完整微调,而不仅仅是 LoRA/PEFT,现在可以导出为 GGUF。基座模型解析更可靠,且不支持的导出选项在 UI 中已被禁用。

  • 聊天滚动/布局修复。 修复了生成期间的滚动位置问题、思考面板布局偏移,以及折叠推理面板时的视口跳动。

  • 更智能的端口冲突检测。 Unsloth 现在可以检测回环冲突,尽可能识别阻塞进程,并提供更清晰的备用端口消息。

新的工具调用 + Windows 稳定性

  • Claude Artifacts 可用,因此 HTML 可以像蛇游戏一样在聊天中执行

  • 工具调用准确率提升 30%,尤其针对小模型 + 工具调用计时器

  • 工具 + 网页搜索输出可保存 + 可切换自动修复工具开/关

  • 许多 bug 修复 - Windows CPU 可用,Mac 更无缝、更快且更小的安装

最后更新于

这有帮助吗?