Unsloth 更新
Unsloth 最新版本、改进和修复的更新日志。
要使用最新更改, 请更新 Unsloth.
Qwen3.8
Qwen3.8-27B 和 Qwen3.8-2.4T 现在可以在 Unsloth 中本地运行了!
可通过 Unsloth Dynamic GGUF 在 17GB RAM 上运行。您也可以在 Unsloth 中微调 Qwen3.8-27B。就尺寸而言,Qwen3.8-27B 迄今为止是最强的模型。我们还上传了 NVFP4 量化版本。

Unsloth 的其他更新包括:
Qwen3.8-27B + 允许额外的 llama-server 参数 + 自定义 VRAM 切换
外部提供方支持工具调用 + 工具支持 + 使用 Codex 登录
快速 FP8 使 MiniMax-H3 推理快 10 倍(3 分钟对比 30 分钟)
GGUF 推理快 10% + 修复了绕过权限
已连接 API 提供商 可以使用它们自己的搜索,或使用 Unsloth Desktop 内置的搜索和工具。工具结果会返回给模型,以便继续执行多步任务。
使用 Codex 订阅登录,并在 Chat 中使用 Codex 工具。
要运行或训练 Qwen3.8,您可以下载 Unsloth Desktop:
介绍 Unsloth Desktop
推出 Unsloth Desktop 🦥 —— 首个可在本地运行和训练模型的桌面应用。\n开源。可在 Mac、Windows 和 Linux 上运行
• 支持 MLX、扩散图像/视频、音频、GGUF\n• 将 Claude Code 和 Codex 连接到本地 LLM\n• 准确率提高 50%,具备自我修复的工具调用 + 沙箱化代码执行\n• 适用于 CPU + 多 GPU 配置——NVIDIA、AMD、Intel、Mac\n• 以 70% 更少的 VRAM 将模型训练速度提高 2 倍\n• 私密网页搜索、深度研究、RAG、MCP + 导出(NVFP4、GGUF)\n• 使用 Unsloth 的 OpenAI 兼容 API 和云模型\n• 安全地远程部署 LLM 并随时访问
您现在可以下载 Unsloth Desktop:
Meta Muse Glimmer 来了!
Meta 发布了 Muse Glimmer,这是 Meta Superintelligence Labs 推出的首个开放模型。Muse Glimmer 是 Meta 的一个稠密 300 亿参数模型,专为本地智能体和编码工作流打造。它采用 Apache 2.0 许可证,您可以通过 Unsloth 和 Unsloth Dynamic 量化运行 Muse Glimmer 30B,以获得最佳性能。
运行 Muse Glimmer微调 Muse Glimmer
Muse Glimmer 30B 可在本地运行于 20GB RAM/VRAM 配置上,包括 Mac 和 GPU。您也可以在 20GB VRAM.
您可以通过 Unsloth Desktop 应用运行并微调 Muse Glimmer:
Kimi K3 + 深度研究 + 并行聊天
大家好! Kimi K3 现在可以通过 Unsloth Dynamic GGUF 在本地运行,Unsloth 可让多个聊天并行生成,而新的深度研究模式会使用您的本地模型来规划、阅读并引用来源。
此次发布还带来了更好的 AMD 以及 Intel GPU 支持、DoRA 训练,还有许多安装器、MLX、导出和推理修复。
Kimi K3
Moonshot AI 的 Kimi K3 是一个拥有 2.8T 参数的 MoE 模型,具备 104B 活跃参数、原生视觉支持和 100 万上下文窗口。Kimi K3 仅支持思考模式,Unsloth 支持低、高和最高推理力度。
您可以运行我们的 Kimi K3 Dynamic GGUF 通过 Unsloth。Unsloth 会自动检测多 GPU 配置,并可将模型层卸载到系统内存。
Kimi K3 是一个非常大的模型,因此请相应规划您的硬件:
UD-IQ1_S占用 595GB 磁盘空间。UD-Q4_K_XL占用 1.51TB 磁盘空间。若要无损推理,请使用
UD-Q8_K_XL,它占用 1.56TB 磁盘空间。
阅读我们的完整 Kimi K3 指南 并了解更多关于 Unsloth Dynamic 2.0 GGUF.
并行聊天
Unsloth 现在可以同时运行多个对话。开始一个 新建聊天 会让上一个答案继续生成,并且每个活动对话都有自己的进度指示器和停止控制。
默认有 4 个 llama-server 槽位,可在网页 UI 中调整。
工具、上传、自修复和智能体在不同聊天之间保持隔离。
可停止单个聊天,而不会打断其他聊天或重启服务器。
当内存有限时,Unsloth 会减少槽位数量。
重新加载模型在确认后仍会停止活动聊天。
深度研究
深度研究会把本地模型变成完整的研究工作流。给它一个问题,它就会创建计划、搜索网页、整理证据并生成带引用的报告。
在研究开始前审阅并编辑计划。
在其工作时跟踪进度和收集到的来源。
可在不丢失已完成研究的情况下继续或取消。
允许或屏蔽网站,以控制来源选择。
每次运行的来源和引用都会被保存。
在撰写之前,Unsloth 会检查不受支持的主张、矛盾和未解决的空缺。没有直接证据的建议会被标记为可检验推断。
每个聊天只能有一次运行处于活动状态。深度研究目前适用于本地模型。可选的全页 grounding 可在合成前将顶部搜索结果读取到临时 RAG 中;使用以下方式启用: UNSLOTH_RESEARCH_AUTO_SCRAPE=1。它默认保持关闭,因为这会增加抓取时间并需要额外上下文。
改进的 AMD 支持
此次更新建立在我们最初的 AMD 发布与安装指南 基础上,支持更多 GPU,并提供更可靠的 ROCm 推理和训练。
改进了对 RDNA2、Radeon、Ryzen、Strix Halo 和工作站 GPU 的检测。
MI50 和 Radeon VII 在 Linux 上支持 16 位 LoRA 和全量微调。
修复了 4 位 NaN、库冲突以及较长的 RDNA 启动卡顿。
不受支持的 Windows HIP GPU 可回退到 Vulkan。
Vulkan 设备会显示其真实名称,并可单独选择。
全新 Windows 安装不再需要 Winget 或开发者工具。
训练、模型和平台更新
Intel XPU 可在 Intel Arc 和数据中心 GPU 上实现本地聊天和训练。
DoRA 现在与 LoRA 和全量微调并存。
大型导出可使用所有可见 GPU,以避免 GPU 0 的内存限制。
MLX 增加了流式数据集、继续预训练、回调,以及更好的 VLM 和 LoRA 支持。
修复了错误的
flash_attention_2模型输出。Unsloth 和保存工具现在无需 bitsandbytes 也能工作。
修复了
.json数据集以及 Qwen3.5/3.6 MoE 和 GRPO 笔记本设置。Hub 下载文件夹更容易找到和打开。
更新说明可在 Unsloth 更新弹窗中查看。
unsloth start --as-subagent可让 Codex、Claude Code 和 Pi 将任务委派给本地 Unsloth 模型。
AMD 支持来了!
大家好!此版本将本地 LLM 训练和推理带到 AMD GPU ,覆盖 Windows、WSL 和 Linux。
从今天开始,我们与 AMD 的合作、自定义 Triton 内核以及数学算法让您能够在 AMD 的 Radeon、Instinct、Vulkan、Ryzen 和数据中心 GPU 上训练并运行 500+ 个模型,速度最高提升 2 倍,VRAM 占用减少 70%,且不损失精度。优化后的 ROCm 构建还支持 GGUF 和 Safetensors 推理。
7 月 23 日更新
新增 RDNA2、Gorgon Halo、Vulkan 支持 + 修复了 AMD 安装在 Strix Halo / 其他 AMD GPU 上无法检测 GPU 的问题
更好的 RDNA4、HIP / ROCm 故障自动修复和捕获
统一内存快 2 倍 AMD safetensors 加载 + 面向统一内存设备的梯度检查点速度大幅提升
新增 语音听写 / whisper.cpp 快速文本转语音的初步支持
修复了安装期间回滚环境占用 5GB 磁盘空间的问题——现在会自动清理
在 AMD 上本地训练 LLM
在 AMD GPU 上本地训练、运行 RL、聊天并部署模型。
在 Windows、WSL 和 Linux 上更可靠的 AMD GPU 检测和安装。
改进了 AMD MI300X 和 MI325X GPU 的 ROCm 兼容性。
通过以下方式远程访问 Unsloth:
unsloth studio --secure通过 Cloudflare 提供的免费 HTTPS
在您的硬件上运行更大的模型
使用自动 GPU 放置,或精确选择要使用的 GPU 和模型层。
将 MoE 专家层移动到系统内存中,以帮助更大的模型适配。
将模型拆分到多个 GPU 上,或使用张量并行。
为每个模型和量化版本分别保存硬件设置。
更快的聊天重启和更可靠的下载
当空闲模型释放其 VRAM 后,可继续长聊天,而无需重建完整对话。
卡住的 Hugging Face XET 下载会自动通过标准 HTTP 重试。
每次模型加载时都会复用已有的 GGUF 文件,而不是再次下载。
更好的搜索、工具和智能体
网页搜索现在可以读取 PDF 论文、手册和其他 PDF 结果。
并行工具调用、推理输出和工具重试工作更可靠。
一个新的可选 MCP 端点允许兼容的 AI 客户端检查模型和训练历史、开始或停止训练、加载检查点、验证配方并导出 GGUF。
通过以下方式启用:
UNSLOTH_STUDIO_ENABLE_MCP=1并通过以下方式设置所需的 bearer token:UNSLOTH_STUDIO_MCP_TOKEN.
训练和导出修复
使用多模态模型进行纯文本训练时,不再会在打包前截断长样本。
微调后的 Qwen3.5 和 Qwen3.6 MTP 模型现在可正确导出为 GGUF。
修复了一个 Windows 权限错误,该错误可能会在最终写入步骤中停止 GGUF 导出。
如果您错过了
我们之前的 Studio 版本加入了 Dynamic NVFP4 模型、更深入的个性化、7 种新的显示语言、更安全的智能体以及 Vulkan GPU 加速。
Dynamic NVFP4:
Unsloth Dynamic NVFP4 会将对精度敏感的层保留为 FP8 或 BF16,而其余部分以 W4A4 运行。在 NVIDIA Blackwell GPU 上,这可实现最高 2.5 倍更快的推理,而经过校准的 FP8 KV 缓存可提供最高 2 倍更长的上下文。
阅读 Dynamic NVFP4 指南 并探索我们扩展的 NVFP4 集合,其中包括 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。
个性化您的 Studio:
在 Standard、Classic 和 Minimal 配色方案之间选择,每种都有浅色和深色模式。您还可以自定义颜色、导入字体,并调整字体大小、对比度、减少动态效果等。
Unsloth 还包含一个语音设置选项卡,用于听写、自定义词典设置和朗读。
新语言:
Unsloth Studio 现已支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语,以及简体中文、日语和葡萄牙语(巴西)。浏览器语言自动检测现在为默认设置。
更安全的智能体:
一个四级工具调用权限选择器——询问, 为我批准, 关闭 和 完全访问——可对智能体进行更精细的控制。智能体工作区隔离和更安全的安装器检查也降低了意外更改的风险。
个性化、NVFP4、语言
大家好,我们为 Unsloth 带来了很多新更新,尤其是自定义方面。现在您可以个性化您的 Unsloth:三种配色方案加上自定义颜色和字体、七种新的显示语言,以及用于听写和朗读的新语音设置选项卡。智能体通过四级工具调用权限选择器(询问、为我批准、关闭、完全访问)和工作区隔离变得更安全,Intel GPU 也终于可通过新的 Vulkan\n llama.cpp 支持。
我们还新增了对以下内容的原生支持: Inkling,这是一个拥有 9750 亿参数的开放模型,具备 410 亿活跃参数和最高 100 万 token 的上下文窗口。它采用 Apache 2.0 许可,接受文本、图像和音频并生成文本。
Dynamic NVFP4
我们扩展了我们的 NVFP4 集合 ,加入了 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4 的量化版本。
阅读 Dynamic NVFP4 指南 以了解详情。
个性化您的 Unsloth
Unsloth 不再局限于浅色和深色模式:
从以下选项中选择 标准, 经典,以及 极简 配色方案,每种都有浅色和深色变体。
自定义强调色、背景色和前景色。
导入您自己的 UI、标题、聊天和代码字体。
调整字体大小、对比度、动态效果、光标行为和字体平滑。
搜索设置并在设备间同步偏好设置。
浅色和深色模式各自保留自己的自定义值。
七种新语言
Unsloth 现在支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语,以及中文、日语和葡萄牙语。浏览器语言自动检测现在为默认设置。
语音设置
新的语音选项卡增加了用于听写、发音词典和朗读的控件。语音转文字和文字转语音支持即将推出;完整语音对话仍在开发中。
更安全的智能体和工具调用
旧的绕过开关现在变成了四级权限选择器:
询问: 批准每一次工具调用。
为我批准: 自动运行只读操作,并在可能不安全的操作前暂停。
关闭: 禁用工具调用。
完全访问: 允许所有调用并禁用沙箱。
这些控件涵盖终端、Python、网页搜索、RAG 和 MCP 工具。智能体还获得隔离工作区,以及可恢复的会话,使用 --persist,更安全的远程安装器警告、实时工具输出流式传输,以及改进的网页提取。
Vulkan 和 llama.cpp
新的 Vulkan llama.cpp 后端让 Intel GPU 获得 GPU 加速推理,而不是退回到 CPU。它支持现有的 VRAM 管理、自动上下文大小设置、多 GPU 选择和层卸载。
AMD 用户可以通过以下方式启用:
UNSLOTH_FORCE_VULKAN=1我们还提高了更新可靠性、模型状态恢复以及卡住生成的中断能力。
模型与训练
此次发布还包括:
原生 Inkling 支持以及多 GPU B200 改进。
DeepSeek-V4 eager attention 和可训练的 FP8 分组专家。
通过自动聊天模板标记检测实现可靠的仅完成训练。
正确处理已禁用的梯度检查点。
改进了 RoPE 缩放和上下文扩展。
对卡住的训练运行进行强制停止。
为新模型架构和较新的 Transformers 版本提供自动路由。
DeepSeek-V4 + NVFP4
Unsloth 现在可以在训练后导出 NVFP4、FP8 和 imatrix GGUF;充当 llama-swap API 系统;添加日语和巴西葡萄牙语支持;并包含 MLX、safetensors、工具调用、自修复支持等更多功能。Unsloth core 让 GRPO 快 1.3 倍,增加了对卡住下载的 HTTP 回退,改进了离线模式,将 MoE 训练加速 3-5 倍,并修复了许多错误。此发布系列使用 unsloth>=2026.7.1.
DeepSeek-V4-Flash 现在支持思考切换以及我们改进的聊天模板修复。

更智能的兼容 OpenAI 的 API 服务
运行一个本地 API 端点,具备更安全的模型切换和更好的智能体工具恢复。
API 请求可选择在已下载的本地 GGUF 之间自动切换,而未知模型名称会安全地继续使用当前模型。
/v1/models现在返回干净的模型 ID 和本地 GGUF 目录,而不是本地.gguf路径。空闲自动卸载可在不活动后释放 VRAM,且工具调用修复现在可按请求控制。
导出改进
导出更灵活,并避免不必要的下载。
可一次选择多种导出格式,包括便携式 FP8/INT8、GGUF LoRA、与源码匹配的导出、imatrix GGUF 和压缩 FP8/FP4。
多检查点导出可进一步避免重复下载基础模型。
FP8、INT8 和 GGUF-LoRA 导出现在会遵循
trust_remote_code,而且 GGUF 导出对缺失的量化设置处理得更可靠。
RAG 和文件聊天
文件聊天在真实文档上更有用。
RAG 附件现在可使用整篇文档上下文,并支持可自定义的嵌入模型和 Hugging Face 搜索。
文件聊天现在能更正确地读取更多 PDF 和 Word 文档,包括从右到左文本、印度语文本和 DOCX 表格。
在代理环境下,本地 RAG 检查更可靠。
Unsloth 优化与可靠性
日常使用应感觉更流畅、更稳定。
长时间训练和聊天运行更不容易无声卡死。
对比模式、模型切换、模型取消、Hub 浏览和 Hub Discover 更可靠。
项目导出、聊天导出、设置、引导式教程、文件对话框、更新界面和推理 UI 更整洁且更一致。
安装器、硬件和平台修复
Unsloth 在各个平台上的安装和运行更加可靠。
当有预构建版本可用时,macOS 安装不再需要 CMake 或 Homebrew
llama.cpp,且 Apple Silicon 支持对包含空格的路径和统一内存大小处理得更好。Windows 启动、UTF-8 处理、ROCm RAG 嵌入以及 WSL 上的 ROCm GPU 支持得到了改进。
Blackwell GPU 预构建版本选择、GGUF 适配检查、用于 vision/mmproj GGUF 的张量并行,以及本地
llama.cpp复用现在更可靠。
训练、模型和内核
在更多配置下,训练和模型加载更加可靠。
GRPO 现在默认支持序列打包,避免重复共享提示,并正确处理 DDP logit 缩放。
修复了全量微调、RL 精度设置、梯度检查点、DDP RoPE 缓冲区和 MoE LoRA 检测。
FP8 量化/反量化、Transformers v5 下的 Llama 3 RoPE 缩放、PEFT 0.19 LoRA 重新加载,以及
fast_generate错误消息得到了改进。
GLM 5.2 + Hub + 长 3 倍的上下文
GLM-5.2 现在已在 Unsloth Studio 中支持!支持所有推理级别。 3 倍更长的上下文长度 现在可通过我们带有 MTP 的新自动适配算法实现,从而支持更长的聊天。绕过权限模式、可分叉聊天、可排队聊天、用于模型发现的新 Hub、并行模块 + HTTPS Cloudflare 支持等!使用 unsloth studio --secure 以获得安全的 HTTPS 全球访问!
更好的上下文长度算法
根据 PR 1 和 PR 2,我们大幅改进了 Unsloth Studio 对内存使用和上下文长度的判断,使整体上下文长度提升 3 倍:
1x 32GB 管道(约剩余 31 GB)
f16
23,040
64,000
q8_0
43,520
114,944
q4_0
82,432
199,680
2x 32GB 管道
any
262,144
262,144
2x 24GB 张量(约剩余 23 GB)
f16
134,049
262,144
q8_0
252,329
262,144
聊天画布、分叉与队列
可直接编辑助手消息,并从线程中的任意位置重新运行。
分叉线程,在不丢失原始对话的情况下创建分支。
临时(隐身)聊天,不留下任何痕迹。
在生成仍在运行时排队新提示,而不是等待。
聊天“工件”现在是 画布,带有内联 HTML 画布卡片 可自动渲染,提供代码视图,而且 DiffusionGemma 会将其原始代码以内联方式保持可见,而不是折叠。
聊天搜索现在涵盖每条消息,并优先显示您自己的消息。
Hub(重新设计)
全页 Hub,带有趋势动态、搜索和自定义模型路径支持。
README 在分屏动态中预览,因此您可以先阅读再下载。
下载默认使用更快的 Xet 传输方式,如果传输卡住则自动回退到 HTTP。
新增“选择时加载”开关,可在模型加载前设置加载选项。
DiffusionGemma 和未来的 Gemma 衍生模型将显示 Google 标志。
模型与推理
DeepSeek-OCR 和更多视觉模型现在可以无错误地加载和运行。
修复了最新 vLLM(0.22+)上的快速推理,因此加速效果恢复正常。
张量并行更可靠:如果更快的 MTP 路径失败,它现在会自行恢复,而不是崩溃。
DiffusionGemma 现在会在去噪时实时显示图像形成过程,并提供准确的速度统计。
安全与 Cloudflare 加密 Studio
新
--secure适用于端到端加密工作室的仅 Cloudflare 模式,同时在下保持服务端工具启用--secure。使用unsloth studio --secure!绕过权限模式以跳过确认,并在你需要时禁用工具沙箱。
自动检测 Hugging Face 病毒扫描 + 仓库中的危险文件。
日志与 API
新 API 服务器监视器 在 Unsloth 中。
更快的 API 调用和更低的延迟
日志大幅精简得多——现在包含吞吐量和延迟,并移除了许多臃肿日志。
硬件与后端
更好支持 Blackwell RTX 50X 和 60X GPU
修复静默降级为 CPU 而不是 GPU 的问题
torchao 版本现在从已安装的 torch 中选择。
安装程序现在会自动修复损坏或仅 CPU 的 PyTorch 安装,并在静默回退到 CPU 时发出警告,覆盖 NVIDIA + AMD,在 Win/Linux/Mac/WSL 上均适用。
在训练开始时释放聊天模型的 VRAM,但仅在 GPU 确实吃紧时才这样做(否则不会进行不必要的重新加载)。
如果 llama-server 在启动时硬崩溃,Unsloth 现在会逐级尝试恢复,而不是直接失败。
训练与通用修复与并行模块
MLX 训练更新。
使用 vLLM 改进了 GRPO 训练可靠性。
训练启动更加可靠,并为无效的 VLM 批次提供了更清晰的错误信息。
Unsloth 现在在崩溃、重启或中断关闭后,更可靠地清理残留的后端进程。
导出、聊天、训练、配方现在都彼此独立/隔离!这意味着你现在可以同时进行这 4 项操作!你可以在等待训练运行或导出时聊天/做推理!
要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexDiffusionGemma + Gemma 4 MTP
确保你安装最新的 v0.1.464-beta 或 2026.6.7. DiffusionGemma, Gemma 4 MTP 和 MiniMax-M3 现在都已支持。
运行与训练 DiffusionGemma 通过 Unsloth Studio.
Gemma 4 MTP 已上线!运行 Gemma 4 使用 MTP 可快约 2 倍。
Gemma 4 现已支持音频聊天(
wav,mp3,m4a,flac,webm).Gemma 4 新增了 Preserve Think。

Hub + 下载管理器(实验性)
新增了一个 Hub 页面,用于浏览、下载和管理 Hugging Face 模型与数据集。
Unsloth 现在可以检测你机器上已存在的模型和数据集,并将它们与已下载资源一起显示。
已下载 GGUF 模型 现在具有直接的 运行 / 新聊天 操作。
RAG / 使用文件聊天(实验性)
新增 使用文件聊天 在 Unsloth 中,让你可以针对自己的文档和知识库提问。
支持混合搜索、引用、PDF 预览、按线程文档,以及内置的
search_knowledge_base工具。
新更新按钮 + 硬件支持
Unsloth 现在使用始终保持最新的 llama.cpp 预构建版本 ,覆盖 CUDA、ROCm、Windows、Linux 和 macOS。
新增了应用内的 更新 llama.cpp 按钮,因此用户可以在不重新安装 Unsloth 的情况下更新本地后端。
改进了 Windows / WSL AMD 支持, Strix Halo ROCm 支持, Blackwell CUDA 选择,以及更清晰的安装程序信息。
本地聊天、工具与 API 兼容性
本地 工具调用 更加可靠,工具卡片排序更好,重复工具循环更少,并支持在 GGUF 视觉模型上使用工具。
改进了 OpenAI 兼容 API 以及 Anthropic 兼容 API 在本地 Unsloth 服务器上的行为,包括更好的错误信息、token 使用量、停止原因,以及 Claude Code 兼容性.
训练与修复
在聊天、菜单、模型选择器、深色模式、导入/导出和设置中增加了许多 UI 精修修复。
要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexGemma 4 12B、新 UI、MCP、项目
本次更新主要聚焦于 Gemma 4 12B、MCP、项目、Canvas、CUDA 13.3 和新的聊天 UI。下周我们会有更大的更新。

Gemma 4 12B
Google 发布了 Gemma 4 12B,这是一个可在 8GB RAM 上本地运行的新模型。 GGUF / 指南
Gemma 4 12B Unified 支持图像、音频和 256K 上下文。可通过 Unsloth Studio 运行并训练该模型。
MCP
远程
MCP服务器支持,包括自定义标头和 OAuth本地基于命令的
MCP服务器支持MCP现在可以从聊天编辑器中开启常见
MCP服务器的内置预设
全新聊天 UI
项目、Canvas、
MCP、RAG 和 Compare 控件现在都位于加号菜单中从编辑器更容易访问搜索和代码控件
菜单、覆盖层、图标和可点击控件在 Unsloth 中更加一致
项目
将相关聊天整理到专用项目工作区中
将现有聊天移动到项目中
直接从侧边栏创建和管理项目
实验性 Canvas / 工件
在 Unsloth Studio 内的专用画布面板中打开生成的 HTML
支持交互式输出,包括基于浏览器的可视化和通过 CDN 加载的包
可在渲染预览和源代码之间切换
安装、运行时与硬件
Windows 预构建安装现在不再需要早期的
CUDA Toolkit检查Linux
llama.cpp预构建版本现在与检测到的运行时匹配cudart主版本ROCmgfx 检测已转发到预构建版本选择中Blackwell,B300和ARM64Linux 支持更新
要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iex请勿使用 unsloth studio 更新 了,因为打包版本不会获得最新更新!
CUDA 13.3、Windows、Mac
要更新 Unsloth 或安装新的 Unsloth Studio,你必须使用:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iex请勿使用 unsloth studio 更新 了,因为打包版本不会获得最新更新!
Mac 更新
重新启用
llama.cppApple Silicon(M1-M4)预构建二进制文件 - Mac OS 14 / 15 / 26(Tahoe)Apple Silicon Mac OS 13(Ventura)为源码构建
Mac OS 13.3 / 14 / 15 / 26(Tahoe)上的 Intel(x86_64)使用
llama.cpp预构建二进制文件Mac OS 13.0 - 13.2 的 Intel 为源码构建
Windows 更新
CUDA 13.3
llama.cpp预构建二进制文件现在可在 Windows 上使用对于 CUDA 13.2、CUDA 13.1 及更低版本,Windows 设备将使用 CUDA 12.4 回退——我们很快会着手处理 CUDA 13.1 二进制文件。
CUDA 13.3 更新
CUDA 13.3 的非 Linux 二进制文件可用。我们目前仍将使用 CUDA 13.1
CUDA 13.3 解决了 CUDA 13.2 的乱码问题 - 见 https://github.com/unslothai/unsloth/issues/4849
Blackwell GPU 更新
目前 Blackwell 将会延迟发布
llama.cpp预构建二进制文件,因为 CUDA 12.4 不可用——我们正在努力尽快解决此问题。
重构前的一次更新。
大家好,在即将到来的一次重大重构之前,我们还会再做一次差不多的更新,这次重构很可能会在本周或下周到来。我们的重构将改变很多东西,尤其是新增重大功能以及大量设计变更。
对以下内容的完整支持 非英语语言 例如日语、中文、印地语等。
你们中的许多人可能错过了我们之前只持续了一天的发布。我们引入了:
连接到外部推理后端: vLLM, Ollama, llama-server
安全性改进
自动 MTP 推测解码 适用于 MTP GGUF;根据你的硬件获取最佳定制设置。
API 提供商调用与外部连接
你现在可以将 Unsloth 连接到任何 API 云提供商(OpenAI、Anthropic、OpenRouter 等)
内置网页搜索 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
内置代码执行 适用于 OpenAI 和 Anthropic(Anthropic 容器会持续存在并在不同轮次间复用)
OpenAI 和 Anthropic 模型已启用提示缓存,可节省 50% 到 90% 的成本。
图像生成 + 编辑
本地提供商(llama.cpp / vLLM / Ollama)的 API 密钥现在可选
添加云提供商时自动加载模型
其他 Unsloth Studio 更新
OpenDocument 聊天附件
o3 推理摘要负载
发送/提示非英语语言(例如日语、中文)现在可以正常工作
IME 编辑器加固,RTL
dir="auto",修复长日志行截断问题UI 中的工具推理轨迹渲染
完全离线支持:缓存的 GGUF 发现以及针对推理和训练的离线 DNS 自动检测
Unsloth Studio 安全性改进
认证速率限制,支持代理感知,因此反向代理不会绕过它
带有更严格黑名单的沙箱工作进程(bash,
hf 上传,NOFILE)路径包含,因此工作进程无法逃离其进行中的 tmp 目录
跨 Unsloth API 的严格 schema 验证
收紧的 CSP / 安全标头(仅允许合法的 favicon 主机)
移除了
torch.load在training_args.bin上的回退,因此不可信的 pickle 在模型加载时永远无法执行加固的 Tauri 桌面发布流程
前端认证:单飞式令牌刷新、更改时输入当前密码、可用的登出、共享的 422 助手
取消清理现在严格限定在进行中的 tmp 目录中,因此它永远不会删除用户状态
Qwen3.6 MTP + API 连接
我们为 Unsloth 带来了许多新更新 v0.1.41-beta:
GGUF 推理快约 2 倍 并自动启用 MTP
连接到外部推理后端: vLLM, Ollama, llama-server
实验性 MLX 推理
对以下内容的完整支持 非英语语言
安全 改进

MTP 推测解码支持,推理速度提升 1.4 到 2 倍!
自动 MTP 推测解码 适用于 MTP GGUF;当捆绑的 llama.cpp 预构建版本过旧或对 MTP 来说太老时发出警告
用于 MTP 支持的新预构建 llama.cpp 二进制文件!
API 提供商调用与外部连接
你现在可以将 Unsloth 连接到任何 API 云提供商(OpenAI、Anthropic、OpenRouter 等)
内置网页搜索 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
内置代码执行 适用于 OpenAI 和 Anthropic(Anthropic 容器会持续存在并在不同轮次间复用)
OpenAI 和 Anthropic 模型已启用提示缓存,可节省 50% 到 90% 的成本。
本地提供商(llama.cpp / vLLM / Ollama)的 API 密钥现在可选
添加云提供商时自动加载模型
MLX 推理(实验性)
MLX 量化和模型现在可以在你的 Mac 机器上本地运行了!
我们很快会添加思考、工具和网页搜索!
其他 Unsloth Studio 更新
发送/提示非英语语言(例如日语、中文)现在可以正常工作
OpenDocument 聊天附件
o3 推理摘要负载
IME 编辑器加固,RTL
dir="auto",修复长日志行截断问题UI 中的工具推理轨迹渲染
完全离线支持:缓存的 GGUF 发现以及针对推理和训练的离线 DNS 自动检测
大量 UI/UX 精修:深色主题重构、右侧边栏重新设计、按一天中的时间变化的树懒吉祥物、可关闭且可复制的提示通知、更大的聊天编辑器、代码执行配置精修、编辑器操作胶囊样式、较窄的 Discord 按钮
训练更新
Gemma 注意力掩码修复
多图像 GRPO
GRPO 隐状态返回实验
新的持续预训练(CPT)训练方法作为一等选项
注册了 Gemma-4 MoE LoRA 提取器以修复
grouped_mm收缩崩溃可选的融合
lm_head+ 交叉熵前向,在下具有单 matmul 路径UNSLOTH_RETURN_LOGITS=1传递评估批大小
评估/训练路径现在遵循
HF_DATASETS_OFFLINE以及HF_HUB_OFFLINE
Unsloth Studio 安全性改进
认证速率限制,支持代理感知,因此反向代理不会绕过它
带有更严格黑名单的沙箱工作进程(bash,
hf 上传,NOFILE)路径包含,因此工作进程无法逃离其进行中的 tmp 目录
跨 Unsloth API 的严格 schema 验证
收紧的 CSP / 安全标头(仅允许合法的 favicon 主机)
移除了
torch.load在training_args.bin上的回退,因此不可信的 pickle 在模型加载时永远无法执行加固的 Tauri 桌面发布流程
前端认证:单飞式令牌刷新、更改时输入当前密码、可用的登出、共享的 422 助手
取消清理现在严格限定在进行中的 tmp 目录中,因此它永远不会删除用户状态
Unsloth API 端点
v0.1.39-beta 错误修复 2026 年 5 月 5 日
修复聊天历史不显示(现有聊天历史不会丢失)以及附件无法正确附加的问题。该 bug 仅影响渲染——使用 2026.5.2 或直接调用 curl -fsSL https://unsloth.ai/install.sh | sh 以更新
你可以通过将本地 LLM 连接到 Unsloth 的 API 端点来与诸如 Claude Code 和 Codex 之类的工具一起使用本地 LLM,这样可以运行像 Qwen 和 Gemma 这样的模型,具备自我修复工具调用、代码执行和网页搜索等附加功能。
将 Unsloth 用作 API 推理端点之所以有益,不仅因为它易于设置且速度快,还因为 Unsloth 提供:
自我修复工具调用,可帮助将损坏或格式错误的工具调用减少 50%
代码执行 支持,可进行 Bash 和 Python 执行,从而获得更准确的代码输出。
高级 网页搜索 ,会访问并实际读取网页以收集深入信息。
自动推理设置 适用于 GGUF 模型(temp、top-k 等)

新模型
我们还带来了一些新的可运行模型,包括 NVIDIA Nemotron 3 Nano Omni、IBM Granite 4.1 和 Mistral 3.5 Medium。我们帮助 Mistral 解决了 transformers 和 GGUF 实现中的一些问题。
Unsloth 更新
已停止的 Unsloth 训练现在可以从检查点继续。
聊天线程现在可更可靠地自动保存并持久保留。
已修复多进程设置中的 DPO 训练挂起问题。
通过 MROPE 更新改进了 VLM GRPO 支持。
Unsloth 的停止按钮现在可以正确停止生成。
修复浏览器刷新后聊天模板消失的问题。
全新 UI 重设计
大家好,我们重新设计了整个 Unsloth Studio UI 和 UX 体验,重点放在聊天和训练上:
根据社区反馈添加了可折叠侧边栏

你现在可以删除聊天并搜索过去的对话


为支持它的模型新增 Preserve Thinking 开关,例如 Qwen3.6
更简洁、更一致的设计,导航更轻松
扩展的设置页面,包含更改头像、名称等选项

不再需要两次输入你的 Hugging Face 令牌
gpt-oss 现在有低、中、高思考开关。
现在使用最新的 llama.cpp 预构建版本,即使在 Linux CUDA 上也是如此
大量 bug、一致性和稳定性修复
Kimi-K2.6 现在可以运行了!
我们还添加了实验性 API 支持。指南、公告等将于下周发布。
Qwen3.6 之前也已经在 Unsloth Studio 中支持运行和训练。你现在就可以训练并运行 Qwen3.6-27B!
Qwen3.6-27B + Kimi K2.6
Qwen3.6-27B 现在可以运行(18GB RAM)并在 Unsloth Studio 中微调。Kimi K2.6 也可以在 Unsloth 中运行(350GB RAM)。
Unsloth Studio 收到了许多新更新,所以请更新。详情和说明将在接下来的几天内发布。
Qwen3.6
Qwen3.6 现在可以在 Unsloth Studio 中运行并微调。该模型可在 23GB RAM 上运行,并且几乎在所有基准中都是最强的中型 LLM。
Gemma 4 更新 + MiniMax-M2.7
Gemma 4 GGUF 现在已更新为 Google 官方聊天模板修复(修复/改进了工具调用),以及最新的 llama.cpp 修复。更新到最新的 llama.cpp,重新下载量化版本后,你应该不会再看到 未使用的 token 问题了。
MiniMax-M2.7 现已发布!你可以使用我们的 GGUF 在 128GB RAM / 统一内存上以 4-bit 量化本地运行该模型。 MiniMax-M2.7 GGUF
Gemma 4 修复
我们已更新 Gemma 4 并包含许多修复。这些 bug 是通用的,影响了所有训练包和实现,并且 并非源自 Unsloth。我们已经识别出这些 bug,修复了它们,现在 Gemma 4 训练在 Unsloth 中可以正常工作。
你只需要 8GB 显存 来训练 Gemma-4-E2B 在本地。Unsloth 训练 Gemma 4 速度约快 1.5 倍,同时使用约少 60% 的显存 相比 FA2 配置。关于 Gemma 4 训练的完整指南和笔记本, 请参阅我们的博客.
Gemma 4 训练修复
梯度累积 不再会导致 loss 爆炸。此前,loss 可能会飙升到 300–400;预期的 loss 大约在 10–15.
已修复 IndexError 影响 26B 和 31B 在
transformers.已修复 E2B/E4B 在
use_cache=False时输出乱码的问题。请参见 问题 #45242.修复了 float16 音频 从
-1e9值溢出。
如果你看到 loss 高于 13–15, 例如 100 或 300 - 梯度累积很可能被错误处理了。这个问题已在 Unsloth 和 Unsloth Studio.
Gemma 4 量化重新上传版
中修复。我们也更新了 Gemma 4 GGUF,因此你需要重新下载。再次说明,这些量化问题 与 Unsloth 无关,也不是由 Unsloth 引起的:
CUDA:在融合前检查缓冲区重叠 - 这是针对以下内容的关键修复
<unused24>tokens - PR #21566kv-cache:为异构 iSWA 支持注意力旋转 - PR #21513词汇表:为 Gemma 4 的 BPE 反分词器添加字节 token 处理 - PR #21488转换:设置"add bos" == True用于 Gemma 4 - PR #21500common:添加 Gemma 4 专用解析器 - PR #21418llama-model:读取final_logit_softcapping用于 Gemma 4 - PR #21390llama:为 Gemma 4 添加自定义换行拆分 - PR #21406
Unsloth Studio 更新
添加 推测解码 支持(ngram-mod,默认开启)
Llama.cpp 已更新为使用包含所有 Gemma 4 修复的最新版本
修复 Qwen3.5 和 Gemma 4 训练问题
启用 Gemma 4 模型的导出和保存
加强终端和 Python 工具的沙箱安全性
让 recipes 使用在 Chat 中加载的模型
修复导航时(以及切换标签页时)空聊天线程的问题,并稳定新建聊天流程
允许非 LLM recipes 运行,并将 Data 标签页在执行中移到第一位
复用 HF 缓存仓库的大小写以防止重复下载
Google - Gemma 4
你现在可以运行和训练 Gemma 4 Unsloth 中的这些模型。
Intel Mac 现在可正常工作
较小模型的工具调用现在更稳定,不再会被截断
适用于 Windows、Linux、Mac、WSL 设备的预编译二进制文件 - CPU 和 GPU
推测解码已为非视觉模型添加(遗憾的是 Gemma-4 是视觉模型,而 Qwen3.5 也是)
上下文长度现在已正确应用。
网页搜索现在确实会获取网页内容,而不只是摘要
HF API 调用减少 90% - 限流更少
工具调用准确率提升 50% + 更多支持
所有模型的工具调用现在都 准确度提升了 30% 到 80%。
网页搜索现在确实会获取网页内容,而不只是摘要
允许的工具调用次数从 10 次增加到 25 次
工具调用现在终止得更好,因此循环/重复会减少
更多 工具调用修复 以及去重逻辑,以防止工具调用泄露 XML
已测试:
unsloth/Qwen3.5-4B-GGUF(UD-Q4_K_XL),已启用网页搜索 + 代码执行 + 思考。
响应中的 XML 泄露
10/10
0/10
使用了 URL 抓取
0
4/10 次运行
歌曲名称正确的运行次数
0/10
2/10
平均工具调用次数
5.5
3.8
平均响应时间
12.3 秒
9.8 秒
新功能
新增 自定义文件夹 这样你就可以在任何文件夹中使用任何 GGUF——目前可在 Chat 的高级设置和自定义文件夹中访问
更新按钮 现在可见
安装脚本样式全部更新!
初步 用于推理和训练的自动多 GPU 支持 - 适用于单块 GPU 放不下的大模型 - Unsloth auto 将自动分配 GPU 资源
Intel Mac 应该开箱即用
更流畅、更快速的 Unsloth
修复大型模型下载超时问题 - 不再会看到超时。
修复 Hugging Face 限流 - HF API 调用减少 90%
修复 Windows 上的 bun,并加快安装速度
新的重要更新
距离我们上一个版本才过去 2 天,但我们带来了更重要的更新:
推理现在快了 20–30%。 此前,工具调用和重复惩罚可能会让推理速度慢于正常水平。现在推理 tokens/s 应该与……表现相同
llama-server/llama.cpp.现在会自动检测较旧或已存在的模型 下载自 LM Studio、Hugging Face、 以及类似来源。
推理 token/s 速度现在计算正确。 此前,tokens/s 包含启动时间,这使显示速度看起来比实际更慢。现在它应该能反映“真实”的推理速度。
CPU 占用不再飙升。 此前,内联查询器身份在每次渲染时都会变化,导致
useLiveQuery持续重新订阅。Unsloth Studio 现在有了关闭的 x 按钮,并且可以正确关闭。 此前,从桌面图标打开后再关闭并不会正确退出。现在,通过快捷方式启动也会打开终端,关闭该终端会彻底退出 Unsloth Studio。如果你仍然在之前的会话中保持它打开,可以重启电脑或运行
lsof -i :8888然后kill -9 <PID>.更好的工具调用和网页搜索 并减少错误。
更新了文档,增加了许多关于以下内容的新信息: 删除模型、卸载 等等。
在 Windows 和 Linux 上更简洁、更智能的安装与设置日志。 输出现在更易读,格式一致,默认更安静以获得更流畅的体验,并支持更丰富的
--verbose诊断信息,以便在你需要完整技术细节时使用。你现在可以查看你的训练历史!
Unsloth Studio 发布后的首次发布
大家好,这是我们发布 Unsloth Studio 以来的首次版本更新。新增了很多功能和修复:
你现在可以更新 Unsloth Studio 了! 请使用相同的安装命令进行更新。
Windows CPU 或 GPU 现在都能无缝工作。请重新安装!
应用快捷方式。安装后,你现在可以通过开始/启动菜单和桌面上的快捷方式图标在 Windows、MacOS 和 Linux 上启动。
预编译
llama.cpp二进制文件 和mamba_ssm- 安装速度快 6 倍!二进制文件大小也小于 300MB。安装体积减少 50% (节省 7GB 或更多)、安装速度提升 2 倍,解析更快。pypi 体积缩小 50%。
工具调用已改进。 更好的 llama.cpp 解析,聊天中不再显示原始工具标记,更快的推理,一个新的工具输出面板,计时器。
MacOS 和 CPU 现在都有 数据 recipes 并启用了多文件上传。
Linux 上 AMD 支持初步 仅限机器 - 自动检测。
设置侧边栏重新设计。 设置现在已分组为 模型、采样、工具和偏好
上下文长度 现在可调整。请注意,这并非必需,因为 llama.cpp 会通过
--fit on多文件上传。 数据 recipes 现在支持对 PDF、DOCX、TXT 和 MD 进行多个拖放上传,带有后端提取、已保存上传和改进的预览。
Colab 与免费 T4 GPU 一起使用的 Unsloth Studio 现在已修复! 在此试用。由于使用了预编译二进制文件,它的速度也快了 20 倍!
更好的聊天可观测性。 Unsloth 现在会显示
llama-server时间与使用情况、上下文窗口使用条,以及更丰富的来源悬停卡片。整体 UX 更好 - 可点击链接、更好的 LaTeX 解析、默认卡片的工具/代码/网页提示信息等等!
LiteLLM - Unsloth Studio 和 Unsloth 没有 受到最近 LiteLLM 安全事件的影响。Nemo Data Designer 仅在
1.80之前使用 LiteLLM,1.82.7或1.82.8而不是受影响的版本,并且之后已将其完全移除。我们现在有了新的单行安装命令,只需运行:
修复:
Windows/安装改进。 修复了 Windows 静默退出、Anaconda/conda-forge 启动崩溃、非 NVIDIA Windows 安装损坏,以及缺失的早期 CUDA/旧 venv 设置检查。
系统提示词已修复。 它们现在再次适用于非 GGUF 文本和视觉推理。
持久化系统提示词和预设。 自定义系统提示词和聊天预设现在会在重新加载和页面切换后保持。
GGUF 导出扩展。 完整微调,而不仅仅是 LoRA/PEFT,现在可以导出为 GGUF。基座模型解析更可靠,且不支持的导出选项在 UI 中已被禁用。
聊天滚动/布局修复。 修复了生成期间的滚动位置问题、思考面板布局偏移,以及折叠推理面板时的视口跳动。
更智能的端口冲突检测。 Unsloth 现在可以检测回环冲突,尽可能识别阻塞进程,并提供更清晰的备用端口消息。
最后更新于
这有帮助吗?

