> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/zh/xin/changelog.md).

# Unsloth 更新

要使用最新更改， [请更新 Unsloth](/docs/zh/xin/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-08-20" tags="new-releases" %}

## 自动压缩 + 局域网访问

感谢大家上周对 Qwen3.8-27B 和 Unsloth Desktop 的支持！对于我们的 [新 `v0.1.801-beta` 版本](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta)，我们合并了 200 多个 PR，带来了许多新功能和修复，包括：

* **自动压缩（实验性）** 适用于超出上下文限制的更长对话
* [**远程与局域网访问（预览）**](/docs/zh/ji-chu-zhi-shi/lan.md) 可轻松通过网络访问，无需 Cloudflare 链接
* **更快的聊天** - 改进了流式传输性能，减少了界面卡顿，使长对话更流畅。
* 支持 **自定义 llama.cpp 构建**。可切换 Cache RAM、Mmap、Mlock、Checkpoints、Spe Decoding KV Cache、Vision 开/关
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) 已发布。新的 Qwen3.8-27B Dynamic v3.0 GGUF 相比其他方案，Top-1 准确率高出 10% 以上。可与 Unsloth 配合使用。

#### 自动压缩（实验性）

现在长聊天可以通过将旧轮次移入可搜索的归档，从而突破上下文限制。

* 只有在需要时才移除较早轮次，并且它们仍然可搜索。
* 新的上下文周期可提升回忆能力，而不会永久截断聊天记录。
* 使用检索而不是摘要以获得更高准确度。

#### 远程与局域网访问（预览）

可从网络中的其他设备访问 Unsloth。

* 新的远程访问设置。
* 局域网控制、二维码和自动启动选项。
* 默认禁用以确保安全。

#### 聊天改进

* 更快的长聊天和改进的线程处理。
* 项目可组织聊天、文件和工作区。
* 新增提示队列、快捷键， `edit_file`，以及更好的工具支持。

#### 硬件、推理、API

* 支持自定义 llama.cpp 构建和 Intel XPU。
* 更多推理控制项（缓存、mmap、mlock、检查点、投机解码、视觉）。
* 改进了 GPU 验证、VRAM 处理和兼容性。
* Responses API 中的结构化输出。
* 更好的 llama-server 恢复能力。

要运行或训练 Qwen3.8，你可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B 和 Qwen3.8-2.4T 现在可以在 Unsloth 中本地运行！

可通过 Unsloth Dynamic GGUF 在 17GB RAM 上运行。你也可以在 Unsloth 中微调 Qwen3.8-27B。Qwen3.8-27B 迄今为止是同规模中最强的模型。我们还上传了 NVFP4 量化版本。

<a href="/pages/d03b47babbad2abc249a0979b2d44af1f02bbd20" class="button primary">运行 Qwen3.8 指南</a><a href="/pages/93f0f3bc09ef59174b9c859b9f427e958a5c7b21" class="button secondary">微调 Muse Glimmer</a>

<figure><img src="/files/a784ba37c1a67db035da56d244db09245361d940" alt="" width="375"><figcaption></figcaption></figure>

其他 Unsloth 更新包括：

* Qwen3.8-27B + 允许额外 llama-server 参数 + 自定义 VRAM 切换
* 外部提供方支持工具调用 + 工具支持 + 使用 Codex 登录
* 快速 FP8：MiniMax-H3 推理快 10 倍（3 分钟对比 30 分钟）
* GGUF 推理快 10%，并修复了绕过权限问题
* 已连接 [API 提供商](/docs/zh/ji-cheng/connections.md) 可以使用自己的搜索，或使用 Unsloth Desktop 内置的搜索和工具。工具结果会回传给模型，以便继续执行多步任务。
* 使用 Codex 订阅登录，并在聊天中使用 Codex 工具。

要运行或训练 Qwen3.8，你可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## 介绍 Unsloth Desktop

介绍 Unsloth Desktop 🦥——首个可在本地运行和训练模型的桌面应用。\
开源。可在 Mac、Windows 和 Linux 上运行

<figure><img src="/files/2f6d683fff2b297edbdcc5c1043bc7a986309170" alt=""><figcaption></figcaption></figure>

• 支持 MLX、扩散图像/视频、音频、GGUF\
• 将 Claude Code 和 Codex 连接到本地 LLM\
• 准确率提高 50%，自我修复工具调用 + 沙箱化代码执行\
• 适用于 CPU + 多 GPU 配置——NVIDIA、AMD、Intel、Mac\
• 用少 70% 的 VRAM 将模型训练速度提高 2 倍\
• 私密网页搜索、深度研究、RAG、MCP + 导出（NVFP4、GGUF）\
• 使用 Unsloth 的 OpenAI 兼容 API 和云模型\
• 安全地远程部署 LLM 并随处访问

你现在可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer 来了！

Meta 发布了 Muse Glimmer，这是 Meta Superintelligence Labs 的首个开放模型。Muse Glimmer 是 Meta 推出的稠密型 300 亿参数模型，专为本地智能体和代码工作流打造。它采用 Apache 2.0 许可证发布，你可以通过 Unsloth 和 Unsloth Dynamic 量化版本运行 Muse Glimmer 30B 以获得最佳性能。

<a href="/pages/109c22d0c1d136d31076df8bc2667ebda88e2601" class="button primary">运行 Muse Glimmer</a><a href="/pages/93f0f3bc09ef59174b9c859b9f427e958a5c7b21" class="button secondary">微调 Muse Glimmer</a>

Muse Glimmer 30B 可在本地运行于 **20GB RAM/VRAM** 配置上，包括 Mac 和 GPU。你也可以使用 Unsloth 在 **20GB VRAM**.

你可以通过 Unsloth Desktop 应用运行和微调 Muse Glimmer：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + 深度研究 + 并行聊天

大家好！ [Kimi K3](/docs/zh/mo-xing/kimi-k3.md) 现在可以使用 Unsloth Dynamic GGUF 在本地运行，Unsloth 还能让多个聊天并行生成，新的深度研究模式会使用你的本地模型来规划、阅读并引用来源。

这个版本还带来了更好的 [AMD](/docs/zh/ji-chu-zhi-shi/amd.md) 和 Intel GPU 支持、DoRA 训练，以及许多安装、MLX、导出和推理修复。

#### Kimi K3

Moonshot AI 的 **Kimi K3** 是一个 2.8T 参数的 MoE 模型，拥有 1040 亿活跃参数、原生视觉支持和 100 万上下文窗口。Kimi K3 仅支持思考模式，Unsloth 支持低、高和最大推理力度。

你可以通过 Unsloth 运行我们的 [Kimi K3 Dynamic GGUF](https://huggingface.co/unsloth/Kimi-K3-GGUF) 。Unsloth 会自动检测多 GPU 配置，并可将模型层卸载到系统内存。

Kimi K3 是一个非常大的模型，因此请相应规划你的硬件：

* `UD-IQ1_S` 需要 595GB 磁盘空间。
* `UD-Q4_K_XL` 需要 1.51TB 磁盘空间。
* 如需无损推理，请使用 `UD-Q8_K_XL`，它需要 1.56TB 磁盘空间。

阅读我们的完整 [Kimi K3 指南](https://unsloth.ai/docs/models/kimi-k3) 并进一步了解 [Unsloth Dynamic 2.0 GGUF](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### 并行聊天

Unsloth 现在可以同时运行多个对话。启动一个 **新聊天** 会让上一个回答继续生成，每个活动对话都会有自己的进度指示器和停止控制。

* 默认有 4 个 llama-server 槽位，可在网页界面中调整。
* 工具、上传、自我修复和智能体在不同聊天之间保持隔离。
* 停止一个聊天不会中断其他聊天，也不会重启服务器。
* 当内存有限时，Unsloth 会减少槽位数量。
* 重新加载模型后，经过确认仍会停止活动聊天。

#### 深度研究

深度研究会将本地模型变成完整的研究工作流。给它一个问题，它就会创建计划、搜索网页、组织证据并生成带引用的报告。

* 在研究开始前审阅并编辑计划。
* 在其工作时跟踪进度和收集到的来源。
* 可继续或取消，而不会丢失已完成的研究。
* 允许或阻止网站以控制来源选择。
* 来源和引用会随每次运行一起保存。
* 在写作前，Unsloth 会检查不受支持的说法、矛盾和未解决的缺口。没有直接证据的建议会被标记为可测试推断。

每个聊天一次只能有一个运行处于活动状态。深度研究目前适用于本地模型。可选的全页 grounding 会在综合前将顶部搜索结果读取到临时 RAG 中；通过以下方式启用： `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`。默认保持关闭，因为它会增加抓取时间，并需要额外上下文。

#### 改进的 AMD 支持

此次更新建立在我们最初的 [AMD 发布与设置指南](https://unsloth.ai/docs/basics/amd) 之上，增加了对更多 GPU 的支持，以及更可靠的 ROCm 推理和训练。

* 改进了对 RDNA2、Radeon、Ryzen、Strix Halo 和工作站 GPU 的检测。
* MI50 和 Radeon VII 在 Linux 上支持 16 位 LoRA 和完整微调。
* 修复了 4 位 NaN、库冲突和长时间 RDNA 启动卡顿。
* 不受支持的 Windows HIP GPU 可回退到 Vulkan。
* Vulkan 设备会显示真实名称，并且可以单独选择。
* 全新 Windows 安装不再需要 Winget 或开发者工具。

#### 训练、模型和平台更新

* Intel XPU 支持在 Intel Arc 和数据中心 GPU 上进行本地聊天和训练。
* DoRA 可与 LoRA 和完整微调一起使用。
* 大型导出可使用所有可见 GPU，以避免 GPU 0 的内存限制。
* MLX 增加了流式数据集、继续预训练、回调以及更好的 VLM 和 LoRA 支持。
* 修复了错误的 `flash_attention_2` 模型输出。
* Unsloth 和保存工具现在无需 bitsandbytes 即可运行。
* 修复了 `.json` 数据集以及 Qwen3.5/3.6 MoE 和 GRPO 笔记本设置。
* Hub 下载文件夹更容易找到和打开了。
* 版本说明可在 Unsloth 更新弹窗中查看。
* `unsloth start --as-subagent` 可让 Codex、Claude Code 和 Pi 将任务委派给本地 Unsloth 模型。
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD 支持来了！

大家好！这个版本将本地 LLM 训练和推理带到了 [AMD GPU](/docs/zh/ji-chu-zhi-shi/amd.md) ，支持 Windows、WSL 和 Linux。

<a href="/pages/6eeaac81e7a7e3da5e7f0f844d5686500ef20959#installing-unsloth-on-amd" class="button primary" data-icon="bolt">快速开始</a><a href="/pages/6eeaac81e7a7e3da5e7f0f844d5686500ef20959#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">功能</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">Github</a>

从今天起，我们与 AMD 的合作、自定义 Triton 内核和数学算法，让你可以在 AMD 的 Radeon、Instinct、Vulkan、Ryzen 和数据中心 GPU 上训练和运行 500 多个模型，速度最高提升 2 倍，VRAM 使用减少 70%，且不会损失准确度。优化后的 ROCm 构建也支持 GGUF 和 Safetensors 推理。

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### 7 月 23 日更新

1. 新增 **RDNA2、Gorgon Halo、Vulkan 支持** + 修复了 AMD 安装程序在 Strix Halo / 其他 AMD GPU 上无法检测到 GPU 的问题
2. 更好的 RDNA4、HIP / ROCm 失败自动修复和捕获
3. **统一内存快 2 倍** AMD safetensors 加载 + 统一内存设备上的梯度检查点快得多
4. 新增 **语音听写 / whisper.cpp** 快速文本转语音的初步支持
5. 修复了安装时回滚环境占用 5GB 磁盘空间的问题——现在会自动清理

#### 在 AMD 上本地训练 LLM

* 在 AMD GPU 上本地训练、运行 RL、聊天并部署模型。
* 在 Windows、WSL 和 Linux 上实现了更可靠的 AMD GPU 检测和安装。
* 改进了 AMD MI300X 和 MI325X GPU 的 ROCm 兼容性。
* 通过以下方式远程访问 Unsloth： `unsloth studio --secure` 通过 Cloudflare 的免费 HTTPS

#### 在你的硬件上运行更大的模型

* 使用自动 GPU 放置，或精确选择要使用的 GPU 和模型层。
* 将 MoE 专家层移入系统内存，以帮助更大的模型适配。
* 将模型拆分到多个 GPU 上，或使用张量并行。
* 为每个模型和量化单独保存硬件设置。

#### 更快的聊天重启和更可靠的下载

* 在空闲模型释放 VRAM 后，无需重建完整对话即可恢复长聊天。
* 卡住的 Hugging Face XET 下载会自动重试为标准 HTTP。
* 现有的 GGUF 文件会被复用，而不是在每次加载模型时重新下载。

#### 更好的搜索、工具和智能体

* 网页搜索现在可以读取 PDF 论文、手册和其他 PDF 结果。
* 并行工具调用、推理输出和工具重试的可靠性更高了。
* 新的可选 MCP 端点允许兼容的 AI 客户端检查模型和训练历史、开始或停止训练、加载检查点、验证配方并导出 GGUF。
  * 通过以下方式启用： `UNSLOTH_STUDIO_ENABLE_MCP=1` 并使用以下项设置所需的 bearer token： `UNSLOTH_STUDIO_MCP_TOKEN`.

#### 训练和导出修复

* 使用多模态模型进行纯文本训练时，在打包前不再会截断长样本。
* 微调后的 Qwen3.5 和 Qwen3.6 MTP 模型现在可正确导出为 GGUF。
* 修复了一个 Windows 权限错误，该错误可能在最终写入步骤中阻止 GGUF 导出。

#### 如果你错过了

我们之前的 Studio 版本加入了 Dynamic NVFP4 模型、更深度的个性化、七种新的显示语言、更安全的智能体和 Vulkan GPU 加速。

**Dynamic NVFP4：**

Unsloth Dynamic NVFP4 会将对准确度敏感的层保持为 FP8 或 BF16，而其余部分以 W4A4 运行。在 NVIDIA Blackwell GPU 上，这可实现最高 2.5 倍的推理速度提升，而经过校准的 FP8 KV 缓存可提供最高 2 倍更长的上下文。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 并探索我们扩展的 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4)，其中包括 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。

**个性化你的 Studio：**

在 Standard、Classic 和 Minimal 配色方案之间选择，每种都提供浅色和深色模式。你还可以自定义颜色、导入字体，并调整字号、对比度、减少动态效果等。

Unsloth 还包含一个语音设置选项卡，用于听写、自定义词典设置和朗读。

**新语言：**

除了中文（简体）、日语和葡萄牙语（巴西）之外，Unsloth Studio 现在还支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语。浏览器语言自动检测现已成为默认设置。

**更安全的智能体：**

四级工具调用权限选择器-**询问**, **为我批准**, **关闭** 和 **完全访问**- 为智能体提供更细致的控制。智能体工作区隔离和更安全的安装程序检查也降低了意外更改的风险。
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## 个性化、NVFP4、语言

大家好，我们为 Unsloth 带来了很多新更新，尤其是自定义功能。现在你可以个性化你的 Unsloth：三种配色方案加自定义颜色和字体、七种新的显示语言，以及用于听写和朗读的新语音设置选项卡。智能体通过四级工具调用权限选择器（询问、为我批准、关闭、完全访问）和工作区隔离变得更安全，而且 Intel GPU 终于通过新的 Vulkan `llama.cpp` 支持。

我们还增加了对以下内容的原生支持： [Inkling](https://unsloth.ai/docs/models/inkling)，这是一个 9750 亿参数的开放模型，拥有 410 亿活跃参数，并支持高达 100 万 token 的上下文窗口。它采用 Apache 2.0 许可，接受文本、图像和音频，并生成文本。

#### Dynamic NVFP4

我们扩展了我们的 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4) ，加入了 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4 的量化版本。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 了解详情。

个性化你的 Unsloth

Unsloth 不再局限于浅色和深色模式：

* 可从以下方案中选择 **标准**, **经典**，以及 **极简** 配色方案，每种都有浅色和深色变体。
* 自定义强调色、背景色和前景色。
* 导入你自己的 UI、标题、聊天和代码字体。
* 调整字号、对比度、动效、光标行为和字体平滑。
* 搜索设置并在设备间同步偏好。

浅色和深色模式会分别保留各自的自定义值。

#### 七种新语言

Unsloth 现在支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语，此外还有中文、日语和葡萄牙语。浏览器语言自动检测现已成为默认设置。

#### 语音设置

新的语音选项卡增加了用于听写、发音词典和朗读的控制。语音转文字和文字转语音支持即将推出；完整语音对话仍在开发中。

#### 更安全的智能体和工具调用

旧的绕过切换现在变成了四级权限选择器：

* **询问：** 批准每一次工具调用。
* **为我批准：** 自动运行只读操作，并在可能不安全的操作前暂停。
* **关闭：** 禁用工具调用。
* **完全访问：** 允许所有调用并禁用沙箱。

这些控制项涵盖终端、Python、网页搜索、RAG 和 MCP 工具。智能体还获得了隔离工作区、可恢复会话以及 `--persist`、更安全的远程安装程序警告、实时工具输出流式传输和改进的网页提取。

#### Vulkan 和 `llama.cpp`

新的 Vulkan `llama.cpp` 后端让 Intel GPU 能够进行 GPU 加速推理，而不是退回到 CPU。它支持现有的 VRAM 管理、自动上下文大小调整、多 GPU 选择和层卸载。

AMD 用户可以通过以下方式启用：

```bash
UNSLOTH_FORCE_VULKAN=1
```

我们还提高了更新可靠性、模型状态恢复能力，以及对卡住生成的中断处理。

#### 模型与训练

此版本还包括：

* 原生 Inkling 支持和多 GPU B200 改进。
* DeepSeek-V4 eager attention 和可训练的 FP8 分组专家。
* 通过自动检测聊天模板标记实现可靠的仅完成训练。
* 正确处理禁用的梯度检查点。
* 改进了 RoPE 缩放和上下文扩展。
* 对卡住的训练运行进行强制停止。
* 为新的模型架构和较新的 Transformers 版本自动路由。
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth 现在可以在训练后导出 NVFP4、FP8 和 imatrix GGUF；充当 llama-swap API 系统；添加日语和巴西葡萄牙语支持；并包含 MLX、safetensors、工具调用、自我修复支持等。Unsloth core 让 GRPO 快 1.3 倍，为卡住的下载增加 HTTP 回退，改进离线模式，将 MoE 训练速度提高 3-5 倍，并修复了许多 bug。本系列版本使用 `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/zh/mo-xing/deepseek-v4.md) 现在已受支持，并带有 Thinking 切换和我们改进的聊天模板修复。

<div data-with-frame="true"><figure><img src="/files/24011740e066568a4f1ece7d3742c125303ef850" alt="" width="375"><figcaption></figcaption></figure></div>

#### 更智能的 OpenAI 兼容 API 服务

运行一个本地 API 端点，具备更安全的模型切换和更好的智能体-工具恢复。

* API 请求可以选择在已下载的本地 GGUF 之间自动切换，而未知模型名称会安全地继续使用当前模型。
* `/v1/models` 现在返回干净的模型 ID 和本地 GGUF 目录，而不是本地 `.gguf` 路径。
* 空闲自动卸载可在不活动后释放 VRAM，而且工具调用修复现在可以按请求控制。

#### 导出改进

导出更灵活，并避免不必要的下载。

* 可一次选择多种导出格式，包括便携式 FP8/INT8、GGUF LoRA、与源匹配的导出、imatrix GGUF 以及压缩 FP8/FP4。
* 多检查点导出可避免更多重复的基础模型下载。
* FP8、INT8 和 GGUF-LoRA 导出现在会尊重 `trust_remote_code`，并且 GGUF 导出对缺失的量化设置处理得更可靠。

#### RAG 和文件聊天

文件聊天在真实文档上的实用性更强了。

* RAG 附件现在可以使用整篇文档上下文，并支持可自定义的嵌入模型和 Hugging Face 搜索。
* 文件聊天可更正确地读取更多 PDF 和 Word 文档，包括从右到左文本、印度语文本和 DOCX 表格。
* 在代理环境下，本地 RAG 检查更可靠了。

#### Unsloth 优化与可靠性

日常使用应该感觉更顺畅、更稳定。

* 长时间训练和聊天运行静默冻结的可能性更低了。
* 对比模式、模型切换、模型取消、Hub 浏览和 Hub Discover 更可靠。
* 项目导出、聊天导出、设置、引导式导览、文件对话框、更新界面和推理 UI 更简洁一致。

#### 安装程序、硬件和平台修复

Unsloth 在各个平台上的安装和运行更可靠了。

* 在有预编译版本可用时，macOS 安装不再需要 CMake 或 Homebrew `llama.cpp` ，并且 Apple Silicon 支持更好地处理带空格的路径和统一内存大小设置。
* 改进了 Windows 启动、UTF-8 处理、ROCm RAG 嵌入以及 ROCm-on-WSL GPU 支持。
* Blackwell GPU 预编译选择、GGUF 适配检查、用于 vision/mmproj GGUF 的张量并行，以及本地 `llama.cpp` 复用现在更加可靠。

#### 训练、模型与内核

训练和模型加载在更多配置下更加可靠。

* GRPO 现在默认支持序列打包，避免重复共享提示词，并能正确处理 DDP logits 缩放。
* 修复了全量微调、RL 精度设置、梯度检查点、DDP RoPE 缓冲区以及 MoE LoRA 检测。
* FP8 量化/反量化、在 Transformers v5 下的 Llama 3 RoPE 缩放、PEFT 0.19 LoRA 重载，以及 `fast_generate` 错误信息已改进。
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3 倍更长上下文

[GLM-5.2](/docs/zh/mo-xing/glm-5.2.md) 现已在 Unsloth Studio 中支持！支持所有推理级别。 **3 倍更长的上下文长度** 现在借助我们带 MTP 的新自动适配算法可以实现，从而支持更长的聊天。绕过权限模式、可分叉聊天、可排队聊天、用于模型发现的新 Hub、并行模块 + HTTPS Cloudflare 支持等等！使用 `unsloth studio --secure` 即可获得安全的 HTTPS 全局访问！

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### 更好的上下文长度算法

根据 [PR 1](https://github.com/unslothai/unsloth/pull/6312) 和 [PR 2](https://github.com/unslothai/unsloth/pull/6447)，我们大幅改进了 Unsloth Studio 对内存占用和上下文长度的判断，使整体上下文长度提升了 3 倍：

| 场景                     | KV    | 之前      | 之后      |
| ---------------------- | ----- | ------- | ------- |
| 1x 32GB 管线（约 31 GB 空闲） | f16   | 23,040  | 64,000  |
|                        | q8\_0 | 43,520  | 114,944 |
|                        | q4\_0 | 82,432  | 199,680 |
| 2x 32GB 管线             | 任意    | 262,144 | 262,144 |
| 2x 24GB 张量（约 23 GB 空闲） | f16   | 134,049 | 262,144 |
|                        | q8\_0 | 252,329 | 262,144 |

#### 聊天画布、分叉与排队

* 可直接编辑助手消息，并从会话中的任意位置重新运行。
* 分叉一个会话，在不丢失原始会话的情况下分支出一段对话。
* 临时（隐身）聊天，不会留下任何痕迹。
* 在生成仍在运行时就可排队新的提示词，而不是等待。
* 聊天“工件”现在是 **画布**，并带有内联 **HTML 画布卡片** ，可自动渲染，带代码视图，而且 DiffusionGemma 会保持其原始代码以内联方式可见，而不会折叠。
* 聊天搜索现在覆盖每条消息，并优先显示你自己的消息。

#### Hub（重新设计）

* 全页 Hub，带有趋势信息流、搜索以及自定义模型路径支持。
* 在分栏信息流中预览 README，这样你可以在下载前先阅读。
* 下载默认使用更快的 **Xet** 传输方式，如果传输卡住则自动回退到 HTTP。
* 新增“在选择时加载”开关，可在模型加载前设置加载选项。
* DiffusionGemma 和未来的 Gemma 衍生模型会显示 Google 标志。

#### 模型与推理

* DeepSeek-OCR 和更多视觉模型现在可以无错误地加载和运行。
* 修复了最新 vLLM（0.22+）上的快速推理，使加速功能重新可用。
* 张量并行更加可靠：如果更快的 MTP 路径失败，现在会自行恢复，而不是崩溃。
* DiffusionGemma 现在会在去噪时实时显示图像生成过程，并提供准确的速度统计。

#### 安全与 Cloudflare 加密 Studio

* 新 `--secure` 仅限 Cloudflare 模式，用于端到端加密的 studio，而服务器端工具会在 `--secure`下保持启用。使用 `unsloth studio --secure`!
* 绕过权限模式可跳过确认，并在需要时禁用工具沙箱。
* 自动检测 Hugging Face 病毒扫描 + 仓库中的危险文件。

#### 日志与 API

* 新 **API 服务器监视器** 位于 Unsloth 中。
* 更快的 API 调用和更低的延迟
* 日志大幅精简——现在包含吞吐量和延迟，并移除了大量冗余日志。

#### 硬件与后端

* 更好地支持 Blackwell RTX 50X 和 60X GPU
* 修复静默降级为 CPU 而不是 GPU 的问题
* torchao 版本现在从已安装的 torch 中选择。
* 安装器现在会自动修复损坏的或仅 CPU 的 PyTorch 安装，并在静默回退到 CPU 时发出警告，覆盖 Win/Linux/Mac/WSL 上的 NVIDIA + AMD。
* 在训练开始时释放聊天模型的 VRAM，但仅在 GPU 真的紧张时才这样做（否则不会进行不必要的重载）。
* 如果 llama-server 在启动时严重崩溃，Unsloth 现在会沿着恢复阶梯逐步处理，而不是直接失败。

#### 训练与常规修复及并行模块

* MLX 训练更新。
* 提升了结合 vLLM 的 GRPO 训练可靠性。
* 训练启动更加可靠，并为无效的 VLM 批次提供更清晰的错误信息。
* Unsloth 现在在崩溃、重启或中断关闭后，会更可靠地清理残留的后端进程。
* 导出、聊天、训练、配方现在都已独立/分区！这意味着你现在可以同时做这 4 件事！在等待训练运行或导出时，你可以聊天/做推理！

要更新 Unsloth 或安装新的 Unsloth Studio，请使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

请确保安装最新的 [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) 或 `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 和 [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) 现已全部支持。

* 运行与训练 [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) 通过 [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 来了！运行 [Gemma 4](https://unsloth.ai/docs/models/gemma-4) 使用 MTP 速度约快 2 倍。
* 现在 Gemma 4 支持音频聊天（`wav`, `mp3`, `m4a`, `flac`, `webm`).
* Gemma 4 新增 Preserve Think。

<figure><img src="/files/1bbdb052f36c70a05af0a94756a76e8ee3fc3288" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + 下载管理器（实验性）

* 新增了一个 **Hub** 页面，用于浏览、下载和管理 Hugging Face 模型与数据集。
* Unsloth 现在可以检测你机器上已存在的模型和数据集，并将它们与已下载资源一起显示。
* 已下载的 [GGUF 模型](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) 现在可以直接 **运行 / 新聊天** 操作。

#### RAG / 与文件聊天（实验性）

* 新增 [**与文件聊天**](https://unsloth.ai/docs/new/studio/chat) 功能现已加入 Unsloth，让你可以针对自己的文档和知识库提问。
* 支持混合搜索、引用、PDF 预览、按会话文档，以及内置的 `search_knowledge_base` 工具。

#### 新的更新按钮 + 硬件支持

* Unsloth 现在使用持续更新的最新 [llama.cpp 预编译版本](https://unsloth.ai/docs/new/changelog) ，覆盖 CUDA、ROCm、Windows、Linux 和 macOS。
* 新增了应用内 **更新 llama.cpp** 按钮，用户无需重新安装 Unsloth 即可更新本地后端。
* 改进了 Windows / WSL AMD 支持， [Strix Halo ROCm 支持](https://unsloth.ai/docs/get-started/install/amd), [Blackwell CUDA 选择](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)，以及更清晰的安装器消息。

#### 本地聊天、工具与 API 兼容性

* 本地 [工具调用](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) 更加可靠，工具卡片排序更好，重复工具循环更少，并支持与 GGUF 视觉模型一起使用工具。
* 改进了 [OpenAI 兼容 API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) 以及 Anthropic 兼容 API 在本地 Unsloth 服务器上的行为，包括更好的错误、token 使用、停止原因，以及 [Claude Code 兼容性](https://unsloth.ai/docs/basics/claude-code).

#### 训练与修复

* 改进了 [MLX 支持](https://unsloth.ai/docs/new/studio/install) ，带来更好的模型标签、生成速度统计，以及对 [VLM 训练](https://unsloth.ai/docs/basics/vision-fine-tuning).
* 修复了若干 [训练](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) 和 [数据集](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) 边缘情况，包括不可写的 Hugging Face 缓存和自定义数据集映射。
* 在聊天、菜单、模型选择器、深色模式、导入/导出和设置中加入了许多 UI 润色修复。

要更新 Unsloth 或安装新的 Unsloth Studio，请使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B、新 UI、MCP、项目

本次更新主要聚焦 Gemma 4 12B、MCP、项目、画布、CUDA 13.3 和新的聊天 UI。下周我们会有一个更大的更新。

<div data-with-frame="true"><figure><img src="/files/ab4797a53a7e650b5bd6e31277a097bd31086b51" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google 发布 [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4)，这是一个可在 8GB RAM 上本地运行的新模型。 [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [指南](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified 支持图像、音频和 256K 上下文。通过 Unsloth Studio 运行并训练该模型。

#### MCP

* 远程 `MCP` 服务器支持，包括自定义请求头和 OAuth
* 本地基于命令的 `MCP` 服务器支持
* `MCP` 现在可以从聊天编辑器中开启
* 常见 `MCP` 服务器

#### 新的聊天 UI

* 项目、画布、 `MCP`、RAG 和 Compare 控件现在位于加号菜单中
* 搜索和代码控件可更轻松地从编辑器访问
* Unsloth 中的菜单、浮层、图标和可点击控件更加一致

#### 项目

* 将相关聊天整理到专用项目工作区中
* 将现有聊天移动到项目中
* 直接从侧边栏创建和管理项目

#### 实验性画布 / 工件

* 在 Unsloth Studio 内的专用画布面板中打开生成的 HTML
* 支持交互式输出，包括基于浏览器的可视化和通过 CDN 加载的包
* 可在渲染预览和源代码之间切换

#### 安装、运行时与硬件

* Windows 预编译安装不再需要早期的 `CUDA Toolkit` 检查
* Linux `llama.cpp` 预编译版本现在会与检测到的运行时 `cudart` 主
* `ROCm` gfx 检测会传递到预编译选择中
* `Blackwell`, `B300` 和 `ARM64` Linux 支持更新

要更新 Unsloth 或安装新的 Unsloth Studio，请使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**请勿使用 `unsloth studio update` 了，因为打包不会获得最新更新！**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3、Windows、Mac

**要更新 Unsloth 或安装新的 Unsloth Studio，请使用：**

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**请勿使用 `unsloth studio update` 了，因为打包不会获得最新更新！**
{% endhint %}

#### Mac 更新

* 重新启用 `llama.cpp` Apple Silicon（M1-M4）的预编译二进制文件 - Mac OS 14 / 15 / 26（Tahoe）
* Apple Silicon Mac OS 13（Ventura）采用源码构建
* Mac OS 13.3 / 14 / 15 / 26（Tahoe）上的 Intel（x86\_64）使用 `llama.cpp` 预编译二进制文件
* Mac OS 13.0 - 13.2 上的 Intel 采用源码构建

#### Windows 更新

* CUDA 13.3 `llama.cpp` 预编译二进制文件现在可在 Windows 上运行
* 对于 CUDA 13.2、CUDA 13.1 及更低版本，Windows 设备使用 CUDA 12.4 回退——我们很快会着手 CUDA 13.1 的二进制文件。

#### CUDA 13.3 更新

* CUDA 13.3 的非 Linux 二进制文件可用。我们暂时仍会使用 CUDA 13.1
* CUDA 13.3 解决了 CUDA 13.2 的乱码问题 - 见 <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell GPU 更新

* 目前 Blackwell 的 `llama.cpp` 预编译二进制文件发布会延后，因为 CUDA 12.4 无法工作——我们正尽快解决此问题。
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## 重构前的更新。

大家好，在即将到来的一次重大重构之前，我们还会再做一次左右的小更新，这次重构很可能在本周或下周到来。我们的重构会改变很多东西，尤其是新的重大功能和大量设计变更。

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* 新： [**API 调用支持**](https://unsloth.ai/docs/integrations/connections) 现在支持图像生成 + 编辑、正确的网页搜索、代码执行、自动提示词缓存。连接 [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) 等。
* 对 **非英语语言** 的正确支持，例如日语、中文、印度语等。

你们中的许多人可能错过了我们之前只持续一天的发布。我们引入了：

* 连接到外部推理后端： [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **安全性改进**
* **自动 MTP 预测解码** 适用于 MTP GGUF；根据你的硬件获取最佳设置。

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）。
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存并在轮次间复用）
* OpenAI 和 Anthropic 模型已启用提示词缓存，可节省 50% 到 90% 的成本。
* 图像生成 + 编辑
* 对于本地提供商（llama.cpp / vLLM / Ollama），API 密钥现在可选
* 添加云提供商时自动加载模型

#### 其他 Unsloth Studio 更新

* OpenDocument 聊天附件
* o3 推理摘要负载
* 发送/输入非英语语言（例如日语、中文）现在可以正常工作了
* IME 编辑器加固、RTL `dir="auto"`、长日志行截断修复
* 在 UI 中渲染工具推理轨迹
* 完全离线支持：缓存的 GGUF 发现以及适用于推理和训练的离线 DNS 自动检测

#### Unsloth Studio 安全性改进

* 身份验证限流，考虑到代理，这样反向代理不会绕过它
* 受沙箱保护的工作进程，带有收紧的阻止列表（bash、 `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程不能跳出其正在处理的 tmp 目录
* Unsloth API 全面的严格 schema 验证
* 收紧 CSP / 安全头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 对 `training_args.bin` 的回退，因此不受信任的 pickle 在模型加载时绝不会执行
* 加固了 Tauri 桌面版发布流程
* 前端认证：单飞令牌刷新、变更时输入当前密码、可用的注销、共享 422 辅助函数
* 取消清理现在严格限定在正在处理的 tmp 目录中，因此绝不会删除用户状态
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP + Unsloth 修复

Unsloth 有很多 bug 修复、UI、UX 修复！要获取最新更新，请执行：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### 修复

1. 修复 `unsloth studio update` 运行不佳
2. 修复卡在 `重置密码` 页面
3. 更多离线模式支持
4. 改进 MTP 在 Mac、CPU 和 GPU 上没有更快的问题——现在好多了！
5. 修复更新后桌面快捷方式不起作用的问题
6. 大量 UI/UX bug 修复
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API 连接

我们为 Unsloth 带来了许多新更新 `v0.1.41-beta`:

* **GGUF 推理约快 2 倍** 并自动启用 [MTP](/docs/zh/mo-xing/qwen3.6.md#mtp-guide)
* [**API 调用支持**](/docs/zh/ji-cheng/connections.md) 用于 [OpenAI](/docs/zh/ji-cheng/connections/openai.md), [Anthropic](/docs/zh/ji-cheng/connections/anthropic-claude.md) 等，并带有自动提示词缓存、网页搜索、代码执行
* 连接到外部推理后端： [vLLM](/docs/zh/ji-cheng/connections/vllm.md), [Ollama](/docs/zh/ji-cheng/connections/ollama.md), [llama-server](/docs/zh/ji-cheng/connections/jiang-llama.cpp-lian-jie-dao-unsloth-shi-yong-llamaserver-yun-xing-gguf.md)
* 实验性 **MLX 推理**
* 对 **非英语语言**
* **安全** 改进

<a href="/pages/213bd08e4302b621f4392f7ee38decb275ffab02#qwen3.6-inference-tutorials" class="button primary">运行 Qwen3.6 教程</a><a href="/pages/213bd08e4302b621f4392f7ee38decb275ffab02#mtp-guide" class="button primary">MTP 指南</a>

<div data-with-frame="true"><figure><img src="/files/31ab8e22459d009a889ab0da5455340326388734" alt="" width="375"><figcaption></figcaption></figure></div>

#### 支持 MTP 预测解码，推理速度提升 1.4 到 2 倍！

* **自动 MTP 预测解码** 适用于 MTP GGUF；当捆绑的 llama.cpp 预编译版本过旧或对 MTP 来说太旧时发出警告
* 支持 MTP 的新预编译 llama.cpp 二进制文件！

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）。
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存并在轮次间复用）
* OpenAI 和 Anthropic 模型已启用提示词缓存，可节省 50% 到 90% 的成本。
* 对于本地提供商（llama.cpp / vLLM / Ollama），API 密钥现在可选
* 添加云提供商时自动加载模型

#### MLX 推理（实验性）

* 现在 MLX 量化和模型可以在你的 Mac 机器上本地运行了！
* 我们很快就会加入思考、工具和网页搜索！

#### 其他 Unsloth Studio 更新

* 发送/输入非英语语言（例如日语、中文）现在可以正常工作了
* OpenDocument 聊天附件
* o3 推理摘要负载
* IME 编辑器加固、RTL `dir="auto"`、长日志行截断修复
* 在 UI 中渲染工具推理轨迹
* 完全离线支持：缓存的 GGUF 发现以及适用于推理和训练的离线 DNS 自动检测
* 大量 UI/UX 润色：深色主题重构、右侧边栏重新设计、按一天中的时段切换的树懒吉祥物、可关闭且可复制的通知、更大的聊天输入框、代码执行配置润色、输入框操作胶囊样式、宽度更窄的 Discord 按钮

#### 训练更新

* Gemma 注意力掩码修复
* 多图像 GRPO
* GRPO 隐状态返回实验
* 新的继续预训练（CPT）训练方法，作为一等选项
* 已注册用于修复的 Gemma-4 MoE LoRA 提取器 `grouped_mm` 收缩崩溃
* 可选启用的融合 `lm_head` + 交叉熵前向传播，且在 UNSLOTH\_RETURN\_LOGITS=1 下使用单次矩阵乘法路径 `UNSLOTH_RETURN_LOGITS=1`
* 传递用于评估的批大小
* 评估/训练路径现在会遵循 `HF_DATASETS_OFFLINE` 以及 `HF_HUB_OFFLINE`

#### Unsloth Studio 安全性改进

* 身份验证限流，考虑到代理，这样反向代理不会绕过它
* 受沙箱保护的工作进程，带有收紧的阻止列表（bash、 `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程不能跳出其正在处理的 tmp 目录
* Unsloth API 全面的严格 schema 验证
* 收紧 CSP / 安全头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 对 `training_args.bin` 的回退，因此不受信任的 pickle 在模型加载时绝不会执行
* 加固了 Tauri 桌面版发布流程
* 前端认证：单飞令牌刷新、变更时输入当前密码、可用的注销、共享 422 辅助函数
* 取消清理现在严格限定在正在处理的 tmp 目录中，因此绝不会删除用户状态
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth API 端点

#### ***v0.1.39-beta 错误修复*** **2026年5月5日**

修复了聊天历史不显示的问题（现有聊天历史不会丢失）以及附件无法正确附加的问题。该 bug 仅影响渲染——请使用 `2026.5.2` 或者直接调用 `curl -fsSL https://unsloth.ai/install.sh | sh`  以更新

你可以把本地 LLM 与以下工具一起使用： [Claude Code](https://unsloth.ai/docs/basics/claude-code) 和 [Codex](https://unsloth.ai/docs/basics/codex) ，只需将它们连接到 Unsloth 的 API 端点即可。这让你可以运行如下模型： [Qwen](https://unsloth.ai/docs/models/qwen3.6) 和 [Gemma](https://unsloth.ai/docs/models/gemma-4) 本地运行，并附带自我修复工具调用、代码执行和网页搜索等额外功能。

将 Unsloth 作为 API 推理端点的好处不仅在于它易于设置且速度快，还在于 Unsloth 提供：

* [自我修复工具调用](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling)，这有助于将损坏或格式错误的工具调用减少 50%
* [代码执行](https://unsloth.ai/docs/new/studio/chat#code-execution) 支持，可执行 Bash 和 Python，以获得更准确的代码输出。
* 高级 [网页搜索](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) ，会访问并真正读取网页以收集深入信息。
* [自动推理设置](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) 用于 GGUF 模型（temp、top-k 等）

<div data-with-frame="true"><figure><img src="/files/c633f6e5a61522d2d7fa76b1c6c3376b956d223d" alt="" width="375"><figcaption></figcaption></figure></div>

#### 新模型

我们还新增了多款可运行的新模型，包括 NVIDIA [Nemotron 3 Nano Omni](/docs/zh/mo-xing/nemotron-3-nano-omni.md)、IBM [Granite 4.1](/docs/zh/mo-xing/ibm-granite-4.1.md) 和 [Mistral 3.5](/docs/zh/mo-xing/mistral-3.5.md) Medium。我们帮助 Mistral 解决了 transformers 和 GGUF 实现中的一些问题。

#### Unsloth 更新

* 已停止的 Unsloth 训练运行现在可以从检查点恢复。
* 聊天线程现在可以更可靠地自动保存并持久保留。
* 多进程设置中的 DPO 训练卡住问题已修复。
* 通过 MROPE 更新，VLM GRPO 支持得到改进。
* Unsloth 的停止按钮现在可以正确停止生成。
* 修复浏览器刷新后聊天模板消失的问题。
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## 全新 UI 重新设计

大家好，我们彻底重做了整个 Unsloth Studio 的 UI 和 UX 体验，重点放在聊天和训练上：

* 根据社区反馈添加了可折叠侧边栏

<div data-with-frame="true"><figure><img src="/files/16cd5c624d215906fa9d68a69a32e3e5c28d1730" alt="" width="375"><figcaption></figcaption></figure></div>

* 你现在可以删除聊天并搜索过去的对话

<div><figure><img src="/files/7edd3f0c4d396a97d88f556990e9f773733f217f" alt=""><figcaption></figcaption></figure> <figure><img src="/files/9396bda0dcb1e0b931b2323c8c6b05f16867a68d" alt=""><figcaption></figcaption></figure></div>

* 为支持该功能的模型新增了“保留思考”切换项，例如 Qwen3.6
* 更简洁、更一致的设计，导航更轻松
* 扩展了设置页面，可更改头像、名称等

<div data-with-frame="true"><figure><img src="/files/bd51c25b8a1cd8fdf88fb54d9e00ae0f551e3ee1" alt="" width="375"><figcaption></figcaption></figure></div>

* 不再需要输入两次 Hugging Face 令牌
* gpt-oss 现在有低、中、高三档思考切换项。
* 现在使用最新的 llama.cpp 预编译版本，即使在 Linux CUDA 上也是如此
* 大量错误、一致性和稳定性修复
* Kimi-K2.6 现在可以运行了！
* 我们还添加了实验性的 API 支持。指南、公告等将在下周发布。

Unsloth Studio 之前也已经支持在运行和训练中使用 Qwen3.6。你现在就可以训练并运行 Qwen3.6-27B！
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行（18GB RAM）并进行微调。Kimi K2.6 也可以在 Unsloth 中运行（350GB RAM）。

Unsloth Studio 收到了许多新更新，请尽快更新。详情和文章将在接下来的几天发布。
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行并进行微调。该模型仅需 23GB RAM，且在几乎所有基准上都是最强的中型 LLM。
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma 4 更新 + MiniMax-M2.7**

[Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4) 现已更新，包含 Google 官方聊天模板修复（修复/改进了工具调用），以及最新的 llama.cpp 修复。请更新到最新的 llama.cpp，重新下载量化文件，你就不应该再看到 `未使用的 token` 问题了。\
\
[MiniMax-M2.7](/docs/zh/mo-xing/tutorials/minimax-m27.md) 已经发布！你可以使用我们的 GGUF 在本地以 4 位量化在 128GB RAM / 统一内存上运行该模型。 [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma 4 修复**

我们已经更新了 Gemma 4 [并修复了许多问题](/docs/zh/mo-xing/gemma-4/train.md)。这些 bug 是通用的，影响了所有训练包和实现，并且 **并非源自 Unsloth**。我们找到了这些 bug，修复了它们，现在 Gemma 4 训练在 Unsloth 中可以正常工作了。

你只需要 **8GB VRAM** 即可训练 **Gemma-4-E2B** 本地运行。Unsloth 训练 Gemma 4 **约快 1.5 倍，同时使用约 60% 更少的 VRAM** 比 FA2 配置更快。有关 Gemma 4 训练的完整指南和笔记本， [请参阅我们的博客](/docs/zh/mo-xing/gemma-4/train.md).

#### Gemma 4 训练修复

1. **梯度累积** 不再会导致 loss 爆炸。此前，loss 可能飙升到 **300–400**；预期 loss 大约在 **10–15**.
2. 修复了 **IndexError** 影响 **26B** 和 **31B** 在 `transformers`.
3. 修复了 **E2B/E4B** 在 `use_cache=False`时的乱码输出。见 [问题 #45242](https://github.com/huggingface/transformers/issues/45242).
4. 修复了 **float16 音频** 溢出，来自 `-1e9` 数值。

如果你看到 loss 高于 **13–15，** 例如 **100** 或 **300** - 梯度累积很可能被错误处理了。这已在以下两处修复： **Unsloth** 和 **Unsloth Studio**.

#### Gemma 4 量化重新上传

我们也更新了 Gemma 4 GGUF，因此你需要重新下载。再次强调，这些量化问题 **与 Unsloth 无关，也不是由 Unsloth 引起的**:

1. CUDA：在融合前检查缓冲区重叠——以下内容的关键修复： `<unused24>` tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`：为异构 iSWA 支持注意力旋转 - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `词汇表`：为 Gemma 4 的 BPE 反分词器添加字节 token 处理 - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `转换`：设置 `“add bos”为 True` 用于 Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `通用`：添加 Gemma 4 专用解析器 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`：读取 `final_logit_softcapping` 用于 Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`：为 Gemma 4 添加自定义换行拆分 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio 更新

* 添加 **推测解码** 支持（ngram-mod，默认开启）
* Llama.cpp 已更新为使用包含所有 Gemma 4 修复的最新版本
* 修复 Qwen3.5 和 Gemma 4 的训练问题
* 启用 Gemma 4 模型的导出和保存
* 加强终端和 Python 工具的沙盒安全性
* 允许 recipe 使用聊天中加载的模型
* 修复导航时（以及切换标签页时）空聊天线程的问题，并稳定新建聊天流程
* 允许非 LLM recipe 运行，并在执行中将 Data 标签页移到最前
* 重用 HF 缓存仓库的大小写以防止重复下载
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* 你现在可以运行和训练 [Gemma 4](/docs/zh/mo-xing/gemma-4.md) Unsloth 中的这些模型。
* Intel Mac 现在可用
* 用于解决 2 个 Gemma-4 修复的 llama.cpp 预编译二进制文件：
  * vocab：修复 Gemma4 分词器（[#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * 修复：gemma 4 模板（[#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* 较小模型的工具调用现在更稳定，不再会被截断
* 适用于 Windows、Linux、Mac、WSL 设备的预编译二进制文件——CPU 和 GPU
* 为非视觉模型添加了推测解码（遗憾的是 Gemma-4 和 Qwen3.5 是视觉模型）
* 上下文长度现在已正确应用。
* 网页搜索现在真的会获取网页内容，而不只是摘要
* HF API 调用减少 90%——更少的速率限制
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **+50% 工具调用准确率 + 更多支持**

* 所有模型的工具调用现在都 **提升了 30% 到 80% 的准确率。**
* 网页搜索现在真的会获取网页内容，而不只是摘要
* 允许的工具调用数量从 10 增加到 25
* 工具调用现在终止得更好，因此循环/重复会减少
* 更多 **工具调用修复** 和去重逻辑，以防工具调用也泄漏 XML
* 已测试，使用 `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`），已启用网页搜索 + 代码执行 + 思考。

| 指标           | 之前     | 之后       |
| ------------ | ------ | -------- |
| 响应中的 XML 泄漏  | 10/10  | 0/10     |
| 使用的 URL 获取次数 | 0      | 4/10 次运行 |
| 歌曲名称正确的运行次数  | 0/10   | 2/10     |
| 平均工具调用次数     | 5.5    | 3.8      |
| 平均响应时间       | 12.3 秒 | 9.8 秒    |

#### 新功能

* 新增 **自定义文件夹** 这样你就可以在任何文件夹中使用任何 GGUF——目前可在聊天和自定义文件夹的高级设置中访问
* **更新按钮** 现在可见
* 安装脚本样式已全面更新！
* 初步 **用于推理和训练的自动多 GPU 支持** ——适用于无法放入 1 张 GPU 的大模型——Unsloth 自动分配 GPU 资源
* Intel Mac 应该开箱即用

更加流畅、更快的 Unsloth

* **修复了大模型下载超时问题** ——不再看到超时。
* **修复了 Hugging Face 速率限制——HF API 调用减少 90%**
* 修复了 Windows 上的 bun，并加快安装
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **新的重要更新**

距离上次发布才 2 天，但我们有更重要的更新：

* **推理现在快了 20–30%。** 此前，工具调用和重复惩罚可能会将推理速度拖到低于正常水平。推理 tokens/s 现在应与 `llama-server` / `llama.cpp`.
* **现在可自动检测旧模型或预先存在的模型** 下载自 **LM Studio、Hugging Face、** 以及类似来源。
* **推理 token/s 速度现在计算正确。** 此前，tokens/s 包含启动时间，这让显示速度看起来比实际更慢。现在它应该反映“真实”的推理速度。
* **CPU 使用率不再飙升。** 此前，内联查询器标识 `useLiveQuery` 不断重新订阅。
* **Unsloth Studio 现在有关闭 x 按钮，并且可以正确关闭。** 此前，从桌面图标打开后关闭它不会正确退出。现在，从快捷方式启动也会打开终端，关闭该终端即可完全退出 Unsloth Studio。如果你仍然在之前的会话中将其打开，可以重启电脑或运行 `lsof -i :8888` 然后 `kill -9 <PID>`.
* **更好的工具调用和网页搜索** ，错误更少。
* 已更新文档，新增了关于 [删除模型、卸载](/docs/zh/xin/studio/install.md#uninstall) 等的许多信息。
* **在 Windows 和 Linux 上，安装与设置日志更干净、更智能。** 输出现在更易读，格式一致，默认更安静，体验更流畅，并在你需要完整技术细节时支持更丰富的 `--verbose` 诊断信息。
* 你现在可以查看你的训练历史了！
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Unsloth Studio 之后的首个发布

大家好，这是我们推出 Unsloth Studio 之后的首次发布。新增了许多功能和修复：

* **你现在可以更新 Unsloth Studio 了！** 请使用相同的安装命令进行更新。
* **Windows** CPU 或 GPU 现在都能无缝工作。请重新安装！
* **应用快捷方式**。安装后，你现在可以在 Windows、MacOS 和 Linux 上通过开始菜单/启动器和桌面上的快捷方式图标启动。
* **预编译 `llama.cpp` 二进制文件** 和 `mamba_ssm` ——安装速度快 6 倍！二进制文件体积也小于 300MB。
* **安装体积减少 50%** （节省 7GB 或更多）、安装速度快 2 倍、解析更快。pypi 体积缩小 50%。
* **工具调用已改进。** 更好的 llama.cpp 解析、聊天中不再出现原始工具标记、更快的推理、全新的工具输出面板、计时器。
* MacOS 和 CPU 现在有 [数据配方](/docs/zh/xin/studio/data-recipe.md) 并支持多文件上传。
* **Linux 上 AMD 支持初步** 仅机器——自动检测。
* **设置侧边栏重新设计。** 设置现在分组为 **模型、采样、工具和偏好设置**
* **上下文长度** 现在可调整。请注意，这并非必需，因为 llama.cpp 会通过 `--fit 开启`
* **多文件上传。** 数据配方现在支持对 PDF、DOCX、TXT 和 MD 的多文件拖放上传，并带有后端提取、保存上传和改进的预览。
* **Colab** 中使用免费 T4 GPU 的 Unsloth Studio 现在已修复！ [在这里试试](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb)。由于预编译二进制文件，它也快了 20 倍！
* **更好的聊天可观测性。** Unsloth 现在显示 `llama-server` 计时和使用情况、上下文窗口使用条，以及更丰富的来源悬停卡片。
* **整体 UX 更好** ——可点击链接、更好的 LaTeX 解析、默认卡片的工具/代码/网页工具提示等更多功能！
* **LiteLLM -** Unsloth Studio 和 Unsloth **并未** 受到近期 LiteLLM 供应链入侵的影响。Nemo Data Designer 仅在 `1.80`之前使用 LiteLLM， `1.82.7` 或 `1.82.8`，并已将其完全移除。
* 我们现在有了新的单行安装命令，只需运行：&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **修复：**

* **Windows/设置改进。** 修复了 Windows 静默退出、Anaconda/conda-forge 启动崩溃、非 NVIDIA Windows 安装损坏，以及缺少早期 CUDA/旧 venv 设置检查的问题。
* **系统提示已修复。** 它们现在可用于非 GGUF 文本和视觉推理。
* **持久系统提示和预设。** 自定义系统提示和聊天预设现在会在重新加载和页面切换之间保留。
* **GGUF 导出扩展。** 现在不仅 LoRA/PEFT，完整微调也可以导出为 GGUF。基础模型解析更可靠，UI 中不支持的导出选项已被禁用。
* **聊天滚动/布局修复** 修复了生成过程中的滚动位置问题、思考面板布局偏移，以及折叠推理面板时的视口跳动。
* **更智能的端口冲突检测。** Unsloth 现在可以检测回环冲突，在可能的情况下识别阻塞进程，并提供更清晰的备用端口提示。
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## 新的工具调用 + Windows 稳定性

* Claude Artifacts 现已可用，因此 HTML 可以像聊天中的贪吃蛇游戏一样直接执行
* 工具调用准确率提升 30%，尤其适用于小模型 + 工具调用计时器
* 工具 + 网页搜索输出可保存 + 可切换自动修复工具的开/关
* 大量错误修复——Windows CPU 可用，Mac 更加流畅，安装更快且体积更小
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/zh/xin/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
