> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/zh/xin/changelog.md).

# Unsloth 更新

Unsloth 最新版本、改进和修复的更新日志。

要使用最新更改， [请更新 Unsloth](/docs/zh/xin/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-09-17" tags="new-releases" %}

## Docker + 多用户 + AMD 支持

我们正在发布全新更新的 Docker 镜像，以及多用户账户、RDNA1+2、FP8/INT8 扩散支持、ARM64 CUDA Windows 支持和许多训练、GRPO 与推理改进

#### 亮点：

* 更新后的 Docker，支持 NVIDIA 和 AMD： [指南](https://unsloth.ai/docs/get-started/install/docker)
* 带隔离的多用户账户： **设置 > 账户**
* INT8/FP8 图像扩散推理：快 2 倍
* 用于训练和推理的 ARM64 Windows CUDA 支持
* GRPO：支持 Qwen3.5 和最新的 TRL/vLLM
* 支持 AMD RDNA1 和 RDNA2
* 更好的 Windows NVIDIA GPU 检测与恢复

#### 更新的 Docker 镜像

* 更新了 CUDA 镜像和 Studio 设置，移除了捆绑缓存，并在 GPU 主机上恢复了 Unsloth 的训练补丁。
* Studio 数据会保存在卷中，而不会固定应用代码。改进了更新、生成密码、可配置端口和包保留。
* 为受支持的 Linux 主机新增了 AMD ROCm 镜像。

#### 多用户账户

* 在以下位置创建账户 **设置 > 账户** 使用一次性设置代码和各自的密码。
* 当设置一致时，账户在共享已加载模型的同时保持工作隔离。单账户行为不变。

#### 聊天 + 推理

* 即使在本地模型加载时，也可以编辑、重新排序并引导排队中的提示。
* 新增 GGUF 推理预算、可调节聊天宽度、桌面缩放和紧凑编辑器。
* 改进了长推理响应速度、聊天历史保留，以及工具生成的文件和图像处理。

#### 硬件 + 推理

* MLX 新增视频输入、可选 MoE 和解码优化，以及更可靠的多模态聊天。
* 改进了 GGUF 内存估算、DGX Spark 处理、NVIDIA 检测、NVLink 检查以及用户选择的 GPU 排序。
* 新增原生 Windows ARM64 桌面打包、Qwen3.5 `fast_inference`以及 Ascend NPU 检测。

#### 研究 + API

* Deep Research 更好地保留未完成报告、处理 JSON 输出，并标记缺少证据的运行。扫描版 PDF 上传获得本地 OCR 回退。
* 改进了提供方推理控制、MCP 兼容性、工具调用和流式错误报告。
* 新增 `/v1/chat/completions` 视频输入，以及对已安装 Ollama 模型的 API 访问。

#### 训练 + 安装

* 新增 Data Recipes 数据集下载，并修复了 16 位微调导出、LoRA 保存和 Push to Hub。
* 改进了数据集处理、训练内存估算，以及容器关闭时的检查点保存。核心修复涵盖归一化、RoPE、Q-GaLore 和分布式设备选择。
* 改进了 Windows 安装、GPU 包修复、依赖缓存和已验证的离线安装。

#### 安全 + 工具执行

* 加强了凭据保护和工具调用验证，并对沙箱外的文件访问请求进行审批。
* 在受支持的 Linux 和 macOS 主机上新增了预览版 OS 级工具沙箱。网络访问仍不受限制；在 OS 隔离不可用时，自动模式会保留现有保护措施。

<a href="/docs/zh/kai-shi-shi-yong/install/docker.md" class="button primary">Docker 指南</a>
{% endupdate %}

{% update date="2026-09-02" tags="new-releases" %}

## Qwen3.8-Flash + GLM-5.3 快 2 倍

运行 [**Qwen3.8-Flash-Next**](/docs/zh/mo-xing/qwen3.8-next.md) 和 [**GLM-5.3-Flash**](/docs/zh/mo-xing/glm-5.3-flash.md) 最高 **快 2 倍** 采用更快的解码和额外的 MTP，现已默认启用。本次发布还包括 **170 多项改进** 涵盖训练、聊天、硬件支持、API 和性能。

* 借助 MTP，Qwen 和 GLM 的生成更快，同时工具使用和推荐的 Qwen 设置也有所改进。
* 所有聊天的 UI/UX 卡顿都大幅减少，尤其是在长对话中
* 新增对 **MiniMax-Music3、Higgs 和 MOSS** 音频模型的支持，包括进度跟踪和剪辑管理。
* 本地服务器和已连接提供方的模型加载更可靠。
* 更安全的聊天编辑，可保留工具调用、回复、媒体和对话分支。
* 改进了多 GPU 训练、内存适配、模型放置和 GGUF 导出。
* 更强的 AMD/ROCm 安装、检测和 GPU 兼容性。
* MCP、Deep Research、OAuth、并行工具调用和智能体工作流更加可靠。
* 新增面向以下内容的 OpenAI 兼容 API： **视频、音频和由 MLX 提供服务的模型**.
* 改进了桌面更新、LAN 端口控制、下载和 GPU 内存清理。

<a href="/docs/zh/mo-xing/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/zh/mo-xing/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/zh/mo-xing/glm-5.3.md" class="button primary">GLM-5.3</a>
{% endupdate %}

{% update date="2026-08-27" tags="new-releases" %}

## Qwen3.8-Flash-Next + GLM-5.3

[Qwen3.8-Flash-Next](/docs/zh/mo-xing/qwen3.8-next.md), [GLM-5.3-Flash](/docs/zh/mo-xing/glm-5.3-flash.md) + [GLM-5.3](/docs/zh/mo-xing/glm-5.3.md) 现在可以在 Unsloth 中本地运行！

* Qwen3.8-Flash 可在 75GB RAM 上运行
* GLM-5.3-Flash 可在 102GB RAM + VRAM 上运行
* RAM 卸载速度最高提升 5 倍
* 重复自动压缩现在可稳定工作
* 100 多项聊天、可靠性和性能改进

<a href="/docs/zh/mo-xing/qwen3.8-next.md" class="button primary">Qwen3.8-Flash-Next</a><a href="/docs/zh/mo-xing/glm-5.3-flash.md" class="button primary">GLM-5.3-Flash</a><a href="/docs/zh/mo-xing/glm-5.3.md" class="button primary">GLM-5.3</a>

<div align="left"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1YneA51oWzaIiwep9H5I%2F1000024423.gif?alt=media&amp;token=40a169cc-12f1-403a-898c-b310f81ff52a" alt="" width="375"><figcaption></figcaption></figure></div>

#### Qwen3.8-Flash-Next

125B 多模态推理模型，以及 Qwen4 架构的早期预览。

* 1 比特 Dynamic GGUF 可在 75GB RAM 或统一内存上运行
* 文本和图像最高可达 262K 上下文
* 无、低、中和超高推理模式
* 保留思考可提升长聊天中的一致性

#### GLM-5.3-Flash

320B 多模态模型，激活参数为 18B。

* 1 比特模型可在 102GB 组合 RAM + VRAM 上运行
* 文本、图像和文档最高可达 1M 上下文
* 低、高和最大推理模式
* 改进了编码、智能体和视觉性能

#### Unsloth 改进

* 大型 GGUF 会自动分配到 GPU 和系统 RAM 上
* 在加载前查看内存估算
* 断开后聊天可恢复
* 更好的多图像视觉和 MCP 图像支持
* 将聊天导出为 JSONL
* 改进了自动压缩控制
* 修复了 Linux、NVIDIA Wayland、AMD 和 Windows 问题

要运行或训练新模型，你可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-20" tags="new-releases" %}

## 自动压缩 + LAN 访问

感谢大家上周对 Qwen3.8-27B 和 Unsloth Desktop 的支持！对于我们的 [新 `v0.1.801-beta` 版本](https://github.com/unslothai/unsloth/releases/tag/v0.1.801-beta)，我们合并了 200 多个 PR，引入了许多新功能和修复，包括：

* **自动压缩（实验性）** 用于超出上下文限制的更长聊天
* [**远程与 LAN 访问（预览）**](/docs/zh/ji-chu/lan.md) 无需 Cloudflare 链接即可轻松进行网络访问
* **更快的聊天** - 改进了流式性能，减少了 UI 卡顿，并使长对话更流畅。
* 支持 **自定义 llama.cpp 构建**。可切换缓存 RAM、Mmap、Mlock、检查点、Spe 解码 KV Cache、视觉开/关
* [Unsloth Dynamic v3.0](https://unsloth.ai/docs/basics/dynamic-3.0-ggufs) 已发布。新的 Qwen3.8-27B Dynamic v3.0 GGUF 与其他方案相比，top-1 准确率提升超过 10%。可与 Unsloth 配合使用。

#### 自动压缩（实验性）

现在长聊天可以通过将旧轮次移入可搜索档案来超出上下文限制。

* 仅在需要时才移除旧轮次，并且仍可搜索。
* 新的上下文周期可提高召回率，同时不会永久裁剪聊天。
* 使用检索而不是摘要，以获得更高准确性。

#### 远程与 LAN 访问（预览）

可从网络中的其他设备访问 Unsloth。

* 新的远程访问设置。
* LAN 控制、二维码和自动启动选项。
* 出于安全考虑，默认关闭。

#### 聊天改进

* 更快的长聊天和改进的线程处理。
* 项目可组织聊天、文件和工作区。
* 新增提示队列、快捷键、 `edit_file`以及更好的工具支持。

#### 硬件、推理、API

* 支持自定义 llama.cpp 构建和 Intel XPU。
* 更多推理控制项（缓存、mmap、mlock、检查点、推测解码、视觉）。
* 改进了 GPU 验证、VRAM 处理和兼容性。
* Responses API 中的结构化输出。
* 更好的 llama-server 恢复。

要运行或训练 Qwen3.8，你可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-14" tags="new-releases" %}

## Qwen3.8

Qwen3.8-27B 和 Qwen3.8-2.4T 现在可以在 Unsloth 中本地运行！

可通过 Unsloth Dynamic GGUF 在 17GB RAM 上运行。你也可以在 Unsloth 中微调 Qwen3.8-27B。Qwen3.8-27B 迄今为止是该尺寸中最强的模型。我们还上传了 NVFP4 量化版本。

<a href="/docs/zh/mo-xing/qwen3.8.md" class="button primary">运行 Qwen3.8 指南</a><a href="/docs/zh/mo-xing/muse-glimmer/train.md" class="button secondary">微调 Muse Glimmer</a>

<figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FSqxs6NjShWrLfRKhDy1m%2Fvolcano%202.gif?alt=media&amp;token=395274a0-b437-403a-8a01-8e8502f9d225" alt="" width="375"><figcaption></figcaption></figure>

其他 Unsloth 更新包括：

* Qwen3.8-27B + 允许额外 llama-server 参数 + 自定义 VRAM 开关
* 外部提供方具有工具调用 + 工具支持 + 使用 Codex 登录
* 快速 FP8：MiniMax-H3 推理快 10 倍（3 分钟 vs 30 分钟）
* GGUF 推理快 10%，且已修复绕过权限问题
* 已连接的 [API 提供方](/docs/zh/ji-cheng/connections.md) 可以使用自己的搜索，或者使用 Unsloth Desktop 内置的搜索和工具。工具结果会传回模型，以便它继续执行多步任务。
* 使用 Codex 订阅登录，并在 Chat 中使用 Codex 工具。

要运行或训练 Qwen3.8，你可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-11" tags="new-releases" %}

## 介绍 Unsloth Desktop

介绍 Unsloth Desktop 🦥——首个可在本地运行和训练模型的桌面应用。\
开源。可在 Mac、Windows 和 Linux 上运行

<figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FyUdniXManojk20Q3M5Lf%2Fintroducing%20unsloth%20desktop%20thumb.png?alt=media&amp;token=5ecd2f25-b996-4749-8242-ffd21b080ae7" alt=""><figcaption></figcaption></figure>

• 支持 MLX、扩散图像/视频、音频、GGUF\
• 将 Claude Code 和 Codex 连接到本地 LLM\
• 准确率提升 50%，具备自我修复工具调用 + 沙箱代码执行\
• 适用于 CPU + 多 GPU 方案 - NVIDIA、AMD、Intel、Mac\
• 训练模型速度提升 2 倍，VRAM 占用减少 70%\
• 私有网页搜索、深度研究、RAG、MCP + 导出（NVFP4、GGUF）\
• 使用 Unsloth 的 OpenAI 兼容 API 和云模型\
• 安全地远程部署 LLM 并随处访问

你现在可以下载 Unsloth Desktop：

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-08-10" tags="new-releases" %}

## Meta Muse Glimmer 来了！

Meta 已发布 Muse Glimmer，这是来自 Meta Superintelligence Labs 的首个开放模型。Muse Glimmer 是 Meta 开发的稠密型 300 亿参数模型，面向本地智能体和编码工作流。它采用 Apache 2.0 许可证发布，你可以通过 Unsloth 和 Unsloth Dynamic 量化版本运行 Muse Glimmer 30B，以获得最佳性能。

<a href="/docs/zh/mo-xing/muse-glimmer.md" class="button primary">运行 Muse Glimmer</a><a href="/docs/zh/mo-xing/muse-glimmer/train.md" class="button secondary">微调 Muse Glimmer</a>

Muse Glimmer 30B 现在可以在本地运行于 **20GB RAM/VRAM** 配置上，包括 Mac 和 GPU。你也可以在 **20GB VRAM**.

上使用 Unsloth 训练和微调 Muse Glimmer 30B。

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth Desktop</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版](https://unsloth.ai/download/linux)
  {% endupdate %}

{% update date="2026-07-29" tags="new-releases,v0.1.51-beta" %}

## Kimi K3 + 深度研究 + 并行聊天

大家好！ [Kimi K3](/docs/zh/mo-xing/kimi-k3.md) 现在可以通过 Unsloth Dynamic GGUF 在本地运行，Unsloth 可以让多个聊天同时并行生成，而新的 Deep Research 模式会使用你的本地模型进行规划、阅读和引用来源。

本次发布还带来了更好的 [AMD](/docs/zh/ji-chu/amd.md) 和 Intel GPU 支持、DoRA 训练，以及许多安装程序、MLX、导出和推理修复。

#### Kimi K3

Moonshot AI 的 **Kimi K3** 是一个 2.8T 参数的 MoE 模型，具有 104B 活跃参数、原生视觉支持和 1M 上下文窗口。Kimi K3 仅支持思考，Unsloth 支持低、高和最大推理强度。

你可以通过 Unsloth 运行我们的 [Kimi K3 Dynamic GGUF](https://huggingface.co/unsloth/Kimi-K3-GGUF) 。Unsloth 会自动检测多 GPU 设置，并可将模型层卸载到系统内存。

Kimi K3 是一个非常大的模型，所以请相应规划你的硬件：

* `UD-IQ1_S` 占用 595GB 磁盘空间。
* `UD-Q4_K_XL` 占用 1.51TB 磁盘空间。
* 对于无损推理，请使用 `UD-Q8_K_XL`，占用 1.56TB 磁盘空间。

阅读我们的完整 [Kimi K3 指南](https://unsloth.ai/docs/models/kimi-k3) 并了解更多关于 [Unsloth Dynamic 2.0 GGUF](https://unsloth.ai/docs/basics/unsloth-dynamic-2.0-ggufs).

#### 并行聊天

Unsloth 现在可以同时运行多个对话。启动 **新聊天** 会保留上一个答案继续生成，而每个活动对话都有自己的进度指示器和停止控制。

* 默认有 4 个 llama-server 插槽，可在网页界面中调整。
* 工具、上传、自我修复和智能体在不同聊天之间保持隔离。
* 可停止一个聊天而不影响其他聊天或重启服务器。
* 当内存不足时，Unsloth 会减少插槽数量。
* 重新加载模型时，在确认后仍会停止活动聊天。

#### Deep Research

Deep Research 会将本地模型变成完整的研究工作流。给它一个问题，它就会创建计划、搜索网页、组织证据并生成带引用的报告。

* 在研究开始前审查并编辑计划。
* 在运行时跟踪其进度和收集到的来源。
* 可恢复或取消，而不会丢失已完成的研究。
* 允许或阻止网站以控制来源选择。
* 来源和引用会随每次运行一起保存。
* 在写作前，Unsloth 会检查未支持的主张、矛盾和未解决的缺口。没有直接证据的建议会被标记为可测试推断。

每个聊天一次只能有一个运行。Deep Research 目前适用于本地模型。可选的整页 grounding 可以在综合前将排名靠前的搜索结果读取到临时 RAG 中；使用以下方式启用： `UNSLOTH_RESEARCH_AUTO_SCRAPE=1`。默认保持关闭，因为它会增加抓取时间并需要额外上下文。

#### 改进的 AMD 支持

此更新基于我们最初的 [AMD 发布与设置指南](https://unsloth.ai/docs/basics/amd) ，增加了对更多 GPU 的支持，以及更可靠的 ROCm 推理和训练。

* 改进了对 RDNA2、Radeon、Ryzen、Strix Halo 和工作站 GPU 的检测。
* MI50 和 Radeon VII 在 Linux 上支持 16 位 LoRA 和全量微调。
* 修复了 4 位 NaN、库冲突和长时间 RDNA 启动卡顿。
* 不受支持的 Windows HIP GPU 可以回退到 Vulkan。
* Vulkan 设备会显示真实名称，并可单独选择。
* 全新 Windows 安装不再需要 Winget 或开发者工具。

#### 训练、模型和平台更新

* Intel XPU 可在 Intel Arc 和数据中心 GPU 上实现本地聊天和训练。
* DoRA 可与 LoRA 和全量微调一起使用。
* 大型导出可使用所有可见 GPU，以避免 GPU 0 的内存限制。
* MLX 增加了流式数据集、继续预训练、回调，以及更好的 VLM 和 LoRA 支持。
* 修复了错误的 `flash_attention_2` 模型输出。
* Unsloth 和保存工具现在无需 bitsandbytes 也可工作。
* 修复了 `.json` 数据集以及 Qwen3.5/3.6 MoE 和 GRPO 笔记本设置。
* Hub 下载文件夹更容易找到和打开。
* 发布说明可在 Unsloth 更新弹窗中查看。
* `unsloth start --as-subagent` 可让 Codex、Claude Code 和 Pi 将任务委派给本地 Unsloth 模型。
  {% endupdate %}

{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD 支持来了！

大家好！本次发布将本地 LLM 训练和推理带到 [AMD GPU](/docs/zh/ji-chu/amd.md) ，覆盖 Windows、WSL 和 Linux。

<a href="/docs/zh/ji-chu/amd.md#installing-unsloth-on-amd" class="button primary" data-icon="bolt">快速开始</a><a href="/docs/zh/ji-chu/amd.md#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">功能</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">GitHub</a>

从今天起，我们与 AMD 的合作、自定义 Triton 内核以及数学算法，让你能够在 AMD 的 Radeon、Instinct、Vulkan、Ryzen 和数据中心 GPU 上训练和运行 500 多个模型，速度最高提升 2 倍，VRAM 占用减少 70%，且不损失准确率。优化后的 ROCm 构建也支持 GGUF 和 Safetensors 推理。

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### 7 月 23 日更新

1. 新增 **RDNA2、Gorgon Halo、Vulkan 支持** + 修复了 AMD 安装在 Strix Halo / 其他 AMD GPU 上未检测到 GPU 的问题
2. 更好的 RDNA4、HIP / ROCm 失败自动修复和捕获
3. **统一内存快 2 倍** AMD safetensors 加载 + 面向统一内存设备的梯度检查点快得多
4. 新增 **语音听写 / whisper.cpp** 快速文本转语音的初步支持
5. 修复了安装期间回滚环境占用 5GB 磁盘空间的问题——现在会自动清理

#### 在 AMD 上本地训练 LLM

* 在 AMD GPU 上本地训练、运行 RL、聊天并部署模型。
* 在 Windows、WSL 和 Linux 上实现更可靠的 AMD GPU 检测与安装。
* 改进了 AMD MI300X 和 MI325X GPU 的 ROCm 兼容性。
* 通过以下方式远程访问 Unsloth `unsloth studio --secure` 通过 Cloudflare 提供的免费 HTTPS

#### 在你的硬件上运行更大的模型

* 使用自动 GPU 放置，或精确选择要使用的 GPU 和模型层。
* 将 MoE 专家层移入系统内存，以帮助更大的模型装得下。
* 将模型拆分到多个 GPU 上，或使用张量并行。
* 为每个模型和量化分别保存硬件设置。

#### 更快的聊天重启和更可靠的下载

* 在空闲模型释放其 VRAM 后，无需重建整个对话即可恢复长聊天。
* 卡住的 Hugging Face XET 下载会自动重试标准 HTTP。
* 现有 GGUF 文件在模型加载时会被复用，而不是每次重新下载。

#### 更好的搜索、工具和智能体

* 网页搜索现在可以读取 PDF 论文、手册和其他 PDF 结果。
* 并行工具调用、推理输出和工具重试现在更可靠。
* 新增一个可选的 MCP 端点，允许兼容的 AI 客户端检查模型和训练历史、开始或停止训练、加载检查点、验证配方以及导出 GGUF。
  * 使用以下方式启用： `UNSLOTH_STUDIO_ENABLE_MCP=1` 并使用以下方式设置所需的 bearer token： `UNSLOTH_STUDIO_MCP_TOKEN`.

#### 训练与导出修复

* 使用多模态模型进行纯文本训练时，不再会在打包前截断长示例。
* 微调后的 Qwen3.5 和 Qwen3.6 MTP 模型现在可正确导出为 GGUF。
* 修复了一个 Windows 权限错误，该错误可能在最终写入步骤中阻止 GGUF 导出。

#### 如果你错过了

我们之前的 Studio 版本新增了 Dynamic NVFP4 模型、更深层个性化、7 种新显示语言、更安全的智能体和 Vulkan GPU 加速。

**Dynamic NVFP4：**

Unsloth Dynamic NVFP4 会将对精度敏感的层保留在 FP8 或 BF16，而其余部分使用 W4A4 运行。在 NVIDIA Blackwell GPU 上，这可实现最高 2.5 倍更快的推理，而经过校准的 FP8 KV 缓存可提供最长 2 倍的上下文。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 并探索我们扩展的 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4)，包括 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。

**个性化你的 Studio：**

可在 Standard、Classic 和 Minimal 配色方案之间选择，每种都有浅色和深色模式。你还可以自定义颜色、导入字体，并调整字号、对比度、减少动态效果等。

Unsloth 还包含一个语音设置选项卡，用于听写、自定义词典设置和朗读。

**新语言：**

Unsloth Studio 现已提供法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语版本，同时还有中文（简体）、日语和葡萄牙语（巴西）。浏览器语言自动检测现已成为默认设置。

**更安全的智能体：**

四级工具调用权限选择器-**询问**, **替我批准**, **关闭** 和 **完全访问**-为智能体提供更精细的控制。智能体工作区隔离和更安全的安装程序检查也降低了意外更改的风险。
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## 个性化、NVFP4、语言

嘿，大家好！我们为 Unsloth 带来了很多新更新，尤其是自定义功能。现在 Unsloth 完全由你来个性化：三套配色方案外加自定义颜色和字体，七种新的显示语言，以及一个用于听写和朗读的新语音设置标签页。智能体通过四级工具调用权限选择器（询问、替我批准、关闭、完全访问）和工作区隔离变得更安全，而 Intel GPU 终于通过新的 Vulkan 获得了 GPU 加速推理 `llama.cpp` 支持。

我们还新增了对 [Inkling](https://unsloth.ai/docs/models/inkling)的原生支持，这是一个拥有 9750 亿参数的开源模型，激活参数为 410 亿，最长可支持 100 万 token 的上下文窗口。它采用 Apache 2.0 许可，支持文本、图像和音频输入，并生成文本。

#### 动态 NVFP4

我们扩展了我们的 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4) ，加入了 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4 的量化版本。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 了解详情。

个性化你的 Unsloth

Unsloth 不再局限于浅色和深色模式：

* 可从以下方案中选择 **标准**, **经典**，以及 **极简** 配色方案，每种都有浅色和深色变体。
* 自定义强调色、背景色和前景色。
* 导入你自己的界面、标题、聊天和代码字体。
* 调整字体大小、对比度、动效、光标行为和字体平滑。
* 搜索设置，并在设备之间同步偏好。

浅色和深色模式分别保留各自的自定义值。

#### 七种新语言

Unsloth 现在支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语，同时还支持中文、日语和葡萄牙语。浏览器语言自动检测现已成为默认设置。

#### 语音设置

新增的语音标签页提供听写、发音词典和朗读控制。语音转文本和文本转语音支持即将推出；完整的语音对话仍在开发中。

#### 更安全的智能体和工具调用

旧的绕过开关现在变成了四级权限选择器：

* **询问：** 批准每一次工具调用。
* **替我批准：** 自动运行只读操作，并在潜在不安全操作时暂停。
* **关闭：** 禁用工具调用。
* **完全访问：** 允许所有调用并禁用沙箱。

这些控制覆盖终端、Python、网页搜索、RAG 和 MCP 工具。智能体还获得了隔离工作区、可恢复会话，配合 `--persist`、更安全的远程安装程序警告、实时工具输出流以及改进的网页提取。

#### Vulkan 和 `llama.cpp`

新的 Vulkan `llama.cpp` 后端让 Intel GPU 实现 GPU 加速推理，而不是回退到 CPU。它支持现有的 VRAM 管理、自动上下文大小设置、多 GPU 选择以及层卸载。

AMD 用户可以通过以下方式启用：

```bash
UNSLOTH_FORCE_VULKAN=1
```

我们还改进了更新可靠性、模型状态恢复以及对卡住生成的中断。

#### 模型与训练

此版本还包括：

* Inkling 原生支持和多 GPU B200 改进。
* DeepSeek-V4 的 eager attention 和可训练 FP8 分组专家。
* 通过自动检测聊天模板标记，实现可靠的仅完成训练。
* 正确处理已禁用的梯度检查点。
* 改进的 RoPE 缩放和上下文扩展。
* 对卡住的训练任务强制停止。
* 为新的模型架构和较新的 Transformers 版本自动路由。
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth 现在可在训练后导出 NVFP4、FP8 和 imatrix GGUF；可作为 llama-swap API 系统运行；新增日语和巴西葡萄牙语支持；并包含 MLX、safetensors、工具调用、healing 支持等更多功能。Unsloth core 让 GRPO 快 1.3 倍，为卡住的下载增加 HTTP 回退，改进离线模式，将 MoE 训练速度提升 3-5 倍，并修复了许多 bug。本版本系列使用 `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/zh/mo-xing/deepseek-v4.md) 现已支持，并带有思考切换和我们改进后的聊天模板修复。

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FChQx2DGoDLyhf7mp8G2d%2Fdeepseek%20v4%20flashhh.png?alt=media&amp;token=a84f2fbc-8ab0-44cf-a3a8-0bdaaf80a2a7" alt="" width="375"><figcaption></figcaption></figure></div>

#### 更智能的 OpenAI 兼容 API 服务

运行一个本地 API 端点，具备更安全的模型切换和更好的智能体-工具恢复能力。

* API 请求可以选择在已下载的本地 GGUF 之间自动切换，而未知的模型名称会安全地继续使用当前模型。
* `/v1/models` 现在返回干净的模型 ID 和本地 GGUF 目录，而不是本地 `.gguf` 路径。
* 空闲自动卸载可以在无活动后释放 VRAM，而工具调用修复现在可以按请求进行控制。

#### 导出改进

导出更灵活，并避免不必要的下载。

* 可一次选择多种导出格式，包括便携式 FP8/INT8、GGUF LoRA、源匹配导出、imatrix GGUF，以及压缩 FP8/FP4。
* 多检查点导出可避免更多重复的基础模型下载。
* FP8、INT8 和 GGUF-LoRA 导出现在会遵守 `trust_remote_code`，并且 GGUF 导出对缺失的量化设置处理更可靠。

#### RAG 和文件聊天

文件聊天在真实文档上的实用性更强了。

* RAG 附件现在可以使用整个文档上下文，并支持可自定义的嵌入模型和 Hugging Face 搜索。
* 文件聊天可以更正确地读取更多 PDF 和 Word 文档，包括从右到左文本、印度语系文本和 DOCX 表格。
* 在代理配置后面的本地 RAG 检查更可靠了。

#### Unsloth 美化与可靠性

日常使用应该会更流畅、更稳定。

* 长时间训练和聊天运行更不容易悄悄卡住。
* 对比模式、模型切换、模型取消、Hub 浏览和 Hub Discover 更可靠。
* 项目导出、聊天导出、设置、引导教程、文件对话框、更新界面和推理 UI 更简洁、更一致。

#### 安装程序、硬件和平台修复

Unsloth 在各个平台上的安装和运行更可靠了。

* 当存在预构建 `llama.cpp` 时，macOS 安装不再需要 CMake 或 Homebrew，并且 Apple Silicon 支持对带空格的路径和统一内存大小处理得更好。
* 改进了 Windows 启动、UTF-8 处理、ROCm RAG 嵌入，以及 WSL 上的 ROCm GPU 支持。
* Blackwell GPU 预构建选择、GGUF 适配检查、视觉/mmproj GGUF 的张量并行，以及本地 `llama.cpp` 复用现在更可靠了。

#### 训练、模型和内核

训练和模型加载在更多配置下更可靠了。

* GRPO 现在默认支持序列打包，避免重复共享提示，并正确处理 DDP logits 缩放。
* 修复了全量微调、RL 精度设置、梯度检查点、DDP RoPE 缓冲区和 MoE LoRA 检测。
* 改进了 FP8 量化/反量化、带 Transformers v5 的 Llama 3 RoPE 缩放、PEFT 0.19 LoRA 重新加载，以及 `fast_generate` 错误消息。
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3 倍更长上下文

[GLM-5.2](/docs/zh/mo-xing/glm-5.2.md) 现已在 Unsloth Studio 中支持！所有推理级别都支持。 **3 倍更长的上下文长度** 现在借助我们带有 MTP 的新自动适配算法可以实现，从而支持更长的聊天。绕过权限模式、可分叉聊天、可排队聊天、用于模型发现的新 Hub、并行模块 + HTTPS Cloudflare 支持等更多功能！使用 `unsloth studio --secure` 即可安全地通过 HTTPS 全局访问！

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### 更好的上下文长度算法

根据 [PR 1](https://github.com/unslothai/unsloth/pull/6312) 和 [PR 2](https://github.com/unslothai/unsloth/pull/6447)，我们大幅改进了 Unsloth Studio 对内存占用和上下文长度的判定，使整体上下文长度达到 3 倍提升：

| 场景                     | KV    | 之前      | 之后      |
| ---------------------- | ----- | ------- | ------- |
| 1x 32GB 管线（约 31 GB 可用） | f16   | 23,040  | 64,000  |
|                        | q8\_0 | 43,520  | 114,944 |
|                        | q4\_0 | 82,432  | 199,680 |
| 2x 32GB 管线             | 任意    | 262,144 | 262,144 |
| 2x 24GB 张量（约 23 GB 可用） | f16   | 134,049 | 262,144 |
|                        | q8\_0 | 252,329 | 262,144 |

#### 聊天画布、分叉与排队

* 就地编辑助手消息，并从线程中的任意位置重新运行。
* 分叉线程，在不丢失原始对话的情况下创建一个分支。
* 临时（隐身）聊天，不留下任何痕迹。
* 当生成仍在运行时排队新的提示，而不是等待。
* 聊天“工件”现在是 **画布**，带有内联 **HTML 画布卡片** ，可自动渲染，包含代码视图，而 DiffusionGemma 会将其原始代码以内联形式保持可见，而不是折叠。
* 聊天搜索现在会覆盖每条消息，并优先显示你自己的消息。

#### Hub（重新设计）

* 带有热门动态流、搜索和自定义模型路径支持的全页 Hub。
* 在分栏动态流中预览 README，这样你可以在下载前先阅读。
* 下载默认使用更快的 **Xet** 传输，如果传输卡住则自动回退到 HTTP。
* 新增“在选择时加载”开关，可在模型加载前设置加载选项。
* DiffusionGemma 和未来 Gemma 衍生模型将显示 Google 标志。

#### 模型与推理

* DeepSeek-OCR 和更多视觉模型现在可以无错误地加载和运行。
* 修复了最新 vLLM（0.22+）上的快速推理，使加速再次可用。
* 张量并行更可靠了：如果更快的 MTP 路径失败，现在会自行恢复，而不是崩溃。
* DiffusionGemma 现在会在去噪时实时显示图像形成过程，并提供准确的速度统计。

#### 安全性与 Cloudflare 加密工作室

* 新的 `--secure` 仅限 Cloudflare 模式，适用于端到端加密工作室，而服务器端工具在 `--secure`下保持启用。使用 `unsloth studio --secure`!
* 绕过权限模式可在你需要时跳过确认并禁用工具沙箱。
* 自动检测 Hugging Face 病毒扫描 + 仓库中的危险文件。

#### 日志和 API

* 新的 **API 服务器监控** 在 Unsloth 中。
* 更快的 API 调用和更低的延迟
* 日志大幅精简——现在包含吞吐量和延迟，并移除了大量臃肿日志。

#### 硬件与后端

* 更好地支持 Blackwell RTX 50X 和 60X GPU
* 修复静默降级到 CPU 而不是 GPU 的问题
* torchao 版本现在从已安装的 torch 中选择。
* 安装程序现在会自动修复损坏或仅 CPU 的 PyTorch 安装，并在 Windows/Linux/Mac/WSL 上针对 NVIDIA + AMD 警告静默回退到 CPU。
* 训练开始时释放聊天模型的 VRAM，但仅在 GPU 实际吃紧时才会这样做（否则不会进行不必要的重新加载）。
* 如果 llama-server 在启动时硬崩溃，Unsloth 现在会沿着恢复梯度逐步尝试，而不是直接失败。

#### 训练与通用修复以及并行模块

* MLX 训练更新。
* 改进了与 vLLM 一起使用时的 GRPO 训练可靠性。
* 训练启动更可靠了，并为无效的 VLM 批次提供更清晰的错误信息。
* Unsloth 现在在崩溃、重启或中断关闭后，更可靠地清理残留的后端进程。
* 导出、聊天、训练、食谱现在都已个体化/分区化！这意味着你现在可以同时进行这 4 项！在等待训练任务或导出时，你可以聊天/进行推理！

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

请确保安装最新的 [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) 或 `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 和 [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) 现在都已支持。

* 通过 [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) 在 [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 中运行和训练现已到来！运行 [Gemma 4](https://unsloth.ai/docs/models/gemma-4) 使用 MTP 约快 2 倍。
* Gemma 4 现在支持音频聊天（`wav`, `mp3`, `m4a`, `flac`, `webm`).
* 已为 Gemma 4 添加 Preserve Think。

<figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fszoidwwj70dLm5vBjpmL%2Fdiffusiongemma.gif?alt=media&amp;token=8ce359fd-f92c-4cf8-a491-06b04c505cb7" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + 下载管理器（实验性）

* 新增了一个 **Hub** 页面，用于浏览、下载和管理 Hugging Face 模型与数据集。
* Unsloth 现在可以检测你机器上已经存在的模型和数据集，并将它们与已下载资源一起显示。
* 已下载的 [GGUF 模型](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) 现在拥有直接的 **运行 / 新聊天** 操作。

#### RAG / 使用文件聊天（实验性）

* 新增 [**使用文件聊天**](https://unsloth.ai/docs/new/studio/chat) 在 Unsloth 中，让你可以针对自己的文档和知识库提问。
* 支持混合搜索、引用、PDF 预览、按线程文档，以及内置的 `search_knowledge_base` 工具。

#### 新更新按钮 + 硬件支持

* Unsloth 现在始终使用最新的 [llama.cpp 预构建版本](https://unsloth.ai/docs/new/changelog) ，覆盖 CUDA、ROCm、Windows、Linux 和 macOS。
* 新增了应用内 **更新 llama.cpp** 按钮，用户无需重新安装 Unsloth 就能更新本地后端。
* 改进了 Windows / WSL 的 AMD 支持， [Strix Halo ROCm 支持](https://unsloth.ai/docs/get-started/install/amd), [Blackwell CUDA 选择](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)，以及更清晰的安装程序消息。

#### 本地聊天、工具与 API 兼容性

* 本地 [工具调用](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) 更可靠了，工具卡片排序更好，重复的工具循环更少，并支持在 GGUF 视觉模型中使用工具。
* 改进了 [OpenAI 兼容 API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) 以及 Anthropic 兼容 API 在本地 Unsloth 服务器上的行为，包括更好的错误、token 使用、停止原因，以及 [Claude Code 兼容性](https://unsloth.ai/docs/basics/claude-code).

#### 训练与修复

* 改进了 [MLX 支持](https://unsloth.ai/docs/new/studio/install) 拥有更好的模型标签、生成速度统计，以及对 [VLM 训练](https://unsloth.ai/docs/basics/vision-fine-tuning).
* 修复了若干 [训练](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) 和 [数据集](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) 边缘情况，包括不可写的 Hugging Face 缓存和自定义数据集映射。
* 在聊天、菜单、模型选择器、深色模式、导入/导出和设置中添加了许多 UI 美化修复。

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B、新 UI、MCP、项目

本次更新主要聚焦于 Gemma 4 12B、MCP、项目、画布、CUDA 13.3 和新的聊天 UI。下周我们会带来更大的更新。

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FoRn2YEPb9lJ81kP3GQQh%2Fwhats%20on%20ur%20mind.png?alt=media&amp;token=f388e42a-bb05-4a09-9cbf-ec699a6baf6b" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google 发布 [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4)，这是一个可在 8GB 内存上本地运行的新模型。 [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [指南](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified 支持图像、音频和 256K 上下文。可通过 Unsloth Studio 运行并训练该模型。

#### MCP

* 远程 `MCP` 服务器支持，包括自定义标头和 OAuth
* 本地基于命令的 `MCP` 服务器支持
* `MCP` 现在可以从聊天输入框中开启
* 常见 `MCP` 服务器的内置预设

#### 新的聊天 UI

* 项目、画布、 `MCP`、RAG 和对比控制现在都位于加号菜单中
* 从输入框更容易访问搜索和代码控制
* 菜单、覆盖层、图标和可点击控件在 Unsloth 中更加一致

#### 项目

* 将相关聊天组织到专用项目工作区中
* 将现有聊天移动到项目中
* 直接从侧边栏创建和管理项目

#### 实验性画布 / 工件

* 在 Unsloth Studio 内的专用画布面板中打开生成的 HTML
* 支持交互式输出，包括基于浏览器的可视化和通过 CDN 加载的包
* 让你可以在渲染预览和源代码之间切换

#### 安装、运行时和硬件

* Windows 预构建安装不再需要早期的 `CUDA Toolkit` 检查
* Linux `llama.cpp` 预构建现在会匹配检测到的运行时 `cudart` 主版本
* `ROCm` gfx 检测已传递到预构建选择中
* `Blackwell`, `B300` 和 `ARM64` Linux 支持更新

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**不要使用 `unsloth studio update` 了，因为打包版本不会获得最新更新！**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3、Windows、Mac

**要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：**

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**不要使用 `unsloth studio update` 了，因为打包版本不会获得最新更新！**
{% endhint %}

#### Mac 更新

* 重新启用 `llama.cpp` Apple Silicon（M1-M4）的预构建二进制文件 - Mac OS 14 / 15 / 26（Tahoe）
* Apple Silicon Mac OS 13（Ventura）为源代码构建
* Mac OS 13.3 / 14 / 15 / 26（Tahoe）上的 Intel（x86\_64）使用 `llama.cpp` 预构建二进制文件
* Mac OS 13.0 - 13.2 上的 Intel 为源代码构建

#### Windows 更新

* CUDA 13.3 `llama.cpp` 预构建二进制文件现在可在 Windows 上使用
* 对于 CUDA 13.2、CUDA 13.1 及以下版本，Windows 设备将使用 CUDA 12.4 回退——我们很快会处理 CUDA 13.1 的二进制文件。

#### CUDA 13.3 更新

* CUDA 13.3 的非 Linux 二进制文件可用。我们目前仍会使用 CUDA 13.1
* CUDA 13.3 解决了 CUDA 13.2 的乱码问题 - 见 <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell GPU 更新

* 目前 Blackwell 的发布将会延迟 `llama.cpp` 预编译二进制文件，因为 CUDA 12.4 不可用——我们正在努力尽快解决。
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## 重构前的更新。

大家好，我们在重大重构前还会再做一次差不多的更新，预计会在本周或下周到来。我们的重构将改变很多东西，尤其会带来新的重大功能和大量设计变更。

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* 新： [**API 调用支持**](https://unsloth.ai/docs/integrations/connections) 现在支持图像生成 + 编辑、真正的网页搜索、代码执行、自动提示词缓存。连接 [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) 等等。
* 对以下内容的完整支持 **非英语语言** 例如日语、中文、印地语等。

你们很多人可能错过了我们之前只持续一天的发布。我们引入了：

* 连接外部推理后端： [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **安全性改进**
* **自动 MTP 推测解码** 适用于 MTP GGUF；为你的硬件获取最佳的定制设置。

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）。
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存并在多轮对话中复用）
* OpenAI 和 Anthropic 模型已启用提示词缓存，可节省 50% 到 90% 的成本。
* 图像生成 + 编辑
* 本地提供商现在可选 API 密钥（llama.cpp / vLLM / Ollama）
* 在添加云提供商时自动加载模型

#### 其他 Unsloth Studio 更新

* OpenDocument 聊天附件
* o3 推理摘要载荷
* 发送/提示非英语语言（例如日语、中文）现在可以正常工作了
* IME 组合器加固，RTL `dir="auto"`，长日志行截断修复
* 在 UI 中渲染工具推理轨迹
* 完全离线支持：缓存的 GGUF 发现和离线 DNS 自动检测，适用于推理和训练

#### Unsloth Studio 安全性改进

* 身份验证限流，支持代理感知，因此反向代理不会绕过它
* 带有更严格黑名单的沙盒工作进程（bash， `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程无法逃离其进行中的 tmp 目录
* Unsloth API 全面的严格模式验证
* 更严格的 CSP / 安全头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 在 `training_args.bin` 上的回退，因此不受信任的 pickle 在模型加载时绝不会执行
* 强化的 Tauri 桌面版发布流程
* 前端认证：单次并发令牌刷新，修改时输入当前密码，可正常登出，共享 422 辅助函数
* 取消清理现在严格限定在进行中的 tmp 目录内，因此永远不会删除用户状态
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP + Unsloth 修复

大量针对 Unsloth 的错误修复、UI、UX 修复！要获取最新更新，请执行：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### 修复

1. 修复 `unsloth studio update` 表现不佳
2. 修复卡在 `重置密码` 页面
3. 更多离线模式支持
4. 改进 MTP 在 Mac、CPU 和 GPU 上不够快的问题 - 现在好多了！
5. 修复更新后桌面快捷方式无法工作的问题
6. 大量 UI UX 错误修复
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API 连接

我们为 Unsloth 带来了很多新更新 `v0.1.41-beta`:

* **GGUF 推理速度约快 2 倍** 并自动启用 [MTP](/docs/zh/mo-xing/qwen3.6.md#mtp-guide)
* [**API 调用支持**](/docs/zh/ji-cheng/connections.md) 用于 [OpenAI](/docs/zh/ji-cheng/connections/openai.md), [Anthropic](/docs/zh/ji-cheng/connections/anthropic-claude.md) 等，并支持自动提示词缓存、网页搜索、代码执行
* 连接外部推理后端： [vLLM](/docs/zh/ji-cheng/connections/vllm.md), [Ollama](/docs/zh/ji-cheng/connections/ollama.md), [llama-server](/docs/zh/ji-cheng/connections/jiang-llama.cpp-lian-jie-dao-unsloth-shi-yong-llamaserver-yun-xing-gguf.md)
* 实验性 **MLX 推理**
* 对以下内容的完整支持 **非英语语言**
* **安全** 改进

<a href="/pages/213bd08e4302b621f4392f7ee38decb275ffab02#qwen3.6-inference-tutorials" class="button primary">运行 Qwen3.6 教程</a><a href="/docs/zh/mo-xing/qwen3.6.md#mtp-guide" class="button primary">MTP 指南</a>

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F0abq31rgj0gOSH9vnpQ6%2Fmtp.gif?alt=media&amp;token=c66ec3f5-91f0-4617-824c-c537a2dde8b0" alt="" width="375"><figcaption></figcaption></figure></div>

#### MTP 推测解码支持，推理速度提升 1.4 到 2 倍！

* **自动 MTP 推测解码** 适用于 MTP GGUF；当捆绑的 llama.cpp 预编译版本过旧或不适用于 MTP 时发出警告
* 支持 MTP 的全新预编译 llama.cpp 二进制文件！

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）。
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存并在多轮对话中复用）
* OpenAI 和 Anthropic 模型已启用提示词缓存，可节省 50% 到 90% 的成本。
* 本地提供商现在可选 API 密钥（llama.cpp / vLLM / Ollama）
* 在添加云提供商时自动加载模型

#### MLX 推理（实验性）

* MLX 量化模型和模型现在可以在你的 Mac 机器上本地运行！
* 我们很快会加入思考、工具和网页搜索！

#### 其他 Unsloth Studio 更新

* 发送/提示非英语语言（例如日语、中文）现在可以正常工作了
* OpenDocument 聊天附件
* o3 推理摘要载荷
* IME 组合器加固，RTL `dir="auto"`，长日志行截断修复
* 在 UI 中渲染工具推理轨迹
* 完全离线支持：缓存的 GGUF 发现和离线 DNS 自动检测，适用于推理和训练
* 大量 UI/UX 润色：深色主题重构、右侧边栏重新设计、按一天中的时间变化的树懒吉祥物、可关闭且可复制的提示、加大的聊天输入区、代码执行配置润色、输入器操作胶囊样式、更窄的 Discord 按钮

#### 训练更新

* Gemma attention mask 修复
* 多图像 GRPO
* GRPO 隐藏状态返回实验
* 全新的持续预训练（CPT）训练方法，作为一级选项
* 注册了 Gemma-4 MoE LoRA 提取器以修复 `grouped_mm` 收缩崩溃
* 可选启用融合的 `lm_head`  + 交叉熵前向传播，在以下条件下使用单矩阵乘法路径 `UNSLOTH_RETURN_LOGITS=1`
* 为评估传递批大小
* 评估/训练路径现在会遵循 `HF_DATASETS_OFFLINE` 以及 `HF_HUB_OFFLINE`

#### Unsloth Studio 安全性改进

* 身份验证限流，支持代理感知，因此反向代理不会绕过它
* 带有更严格黑名单的沙盒工作进程（bash， `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程无法逃离其进行中的 tmp 目录
* Unsloth API 全面的严格模式验证
* 更严格的 CSP / 安全头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 在 `training_args.bin` 上的回退，因此不受信任的 pickle 在模型加载时绝不会执行
* 强化的 Tauri 桌面版发布流程
* 前端认证：单次并发令牌刷新，修改时输入当前密码，可正常登出，共享 422 辅助函数
* 取消清理现在严格限定在进行中的 tmp 目录内，因此永远不会删除用户状态
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth API 端点

#### ***v0.1.39-beta 错误修复*** **2026 年 5 月 5 日**

修复聊天历史不显示（现有聊天历史不会丢失）以及附件无法正确附加的问题。这个 bug 只是渲染层面的 - 使用 `2026.5.2` 或者直接调用 `curl -fsSL https://unsloth.ai/install.sh | sh`  来更新

你可以将本地 LLM 与以下工具一起使用： [Claude Code](https://unsloth.ai/docs/basics/claude-code) 和 [Codex](https://unsloth.ai/docs/basics/codex) 只需将它们连接到 Unsloth 的 API 端点。这让你能够本地运行如下模型： [Qwen](https://unsloth.ai/docs/models/qwen3.6) 和 [Gemma](https://unsloth.ai/docs/models/gemma-4) 本地运行，并具备自愈式工具调用、代码执行和网页搜索等附加功能。

将 Unsloth 作为 API 推理端点不仅因为它易于设置且速度快而有优势，还因为 Unsloth 提供：

* [自愈式工具调用](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling)，这有助于将损坏或格式错误的工具调用减少 50%
* [代码执行](https://unsloth.ai/docs/new/studio/chat#code-execution) 支持，允许执行 Bash 和 Python，以获得更准确的代码输出。
* 高级 [网页搜索](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) 会访问并实际读取网页，以收集深入信息。
* [自动推理设置](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) 适用于 GGUF 模型（temp、top-k 等）

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1s98Id9xclzwMfxjXw2O%2Funsloth%20api%20cropped.png?alt=media&amp;token=64fac263-ca5b-4447-a740-41f58ec94904" alt="" width="375"><figcaption></figcaption></figure></div>

#### 新模型

我们还可以运行一些新模型，包括 NVIDIA [Nemotron 3 Nano Omni](/docs/zh/mo-xing/nemotron-3-nano-omni.md)、IBM [Granite 4.1](/docs/zh/mo-xing/ibm-granite-4.1.md) 和 [Mistral 3.5](/docs/zh/mo-xing/mistral-3.5.md) Medium。我们帮助 Mistral 解决了 transformers 和 GGUF 实现中的一些问题。

#### Unsloth 更新

* 已停止的 Unsloth 训练运行现在可以从检查点继续。
* 聊天线程现在会更可靠地自动保存并持久保留。
* 多进程设置中的 DPO 训练挂起问题已修复。
* 通过 MROPE 更新改进了 VLM GRPO 支持。
* Unsloth 的停止按钮现在可以正确停止生成。
* 修复浏览器刷新后聊天模板消失的问题。
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## 全新 UI 重设计

大家好，我们彻底重做了整个 Unsloth Studio 的 UI 和 UX 体验，重点放在聊天和训练上：

* 根据社区反馈添加了可折叠侧边栏

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FKoonE97b0H3RioMwVohd%2Fstudio%20new%20ui.gif?alt=media&amp;token=e37f2839-914e-48b8-8c81-2dac3ade9408" alt="" width="375"><figcaption></figcaption></figure></div>

* 你现在可以删除聊天并搜索过去的对话

<div><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fm6se3dOmBZH9d9Wlif4W%2FScreenshot%202026-04-23%20at%206.15.38%E2%80%AFAM.png?alt=media&amp;token=e83fe246-1f88-4bf7-aa15-baf7d3356676" alt=""><figcaption></figcaption></figure> <figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fa4EGTdaWQ6EA81PeC3JZ%2FScreenshot%202026-04-23%20at%206.01.36%E2%80%AFAM.png?alt=media&amp;token=1a1cc50d-e0e0-47cd-9c1a-80583a887794" alt=""><figcaption></figcaption></figure></div>

* 为支持它的模型（如 Qwen3.6）新增了“保留思考”切换
* 更简洁、更一致的设计，导航也更容易
* 扩展了设置页面，可修改头像、名称等更多内容

<div data-with-frame="true"><figure><img src="https://2657992854-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FvMtRDH8cVXCu08OZ4TRf%2FScreenshot%202026-04-23%20at%206.18.35%E2%80%AFAM.png?alt=media&amp;token=d989c4b5-6293-402c-981c-3209b7e7d750" alt="" width="375"><figcaption></figcaption></figure></div>

* 不再需要输入两次 Hugging Face 令牌
* gpt-oss 现在有低、中、高三档思考切换。
* 现在使用最新的 llama.cpp 预编译版本，即使在 Linux CUDA 上也是如此
* 大量错误、一致性和稳定性修复
* Kimi-K2.6 现在可以运行了！
* 我们还添加了实验性 API 支持。指南、公告等内容会在下周发布。

Qwen3.6 之前也已经在 Unsloth Studio 中支持运行和训练。你现在就可以训练和运行 Qwen3.6-27B！
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行（18GB 内存）并进行微调。Kimi K2.6 也可以在 Unsloth 中运行（350GB 内存）。

Unsloth Studio 收到了许多新更新，请及时更新。详细内容和说明将在接下来的几天发布。
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行并进行微调。该模型在 23GB 内存上运行，并且几乎在所有基准测试中都是最强的中型 LLM。
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma 4 更新 + MiniMax-M2.7**

[Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4) 现在已更新为 Google 官方聊天模板修复（修复/改进了工具调用），并包含最新的 llama.cpp 修复。更新到最新的 llama.cpp，重新下载量化文件，你应该不会再看到 `未使用的 token` 问题了。\
\
[MiniMax-M2.7](/docs/zh/mo-xing/tutorials/minimax-m27.md) 现已发布！你可以使用我们的 GGUF 在本地以 4 位量化、128GB 内存 / 统一内存运行该模型。 [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma 4 修复**

我们已经更新了 Gemma 4 [并修复了许多问题](/docs/zh/mo-xing/gemma-4/train.md)。这些 bug 是通用的，影响了所有训练包和实现，并且 **并非源自 Unsloth**。我们已经识别并修复了这些 bug，现在 Gemma 4 训练在 Unsloth 中可以正常工作了。

你只需要 **8GB 显存** 即可训练 **Gemma-4-E2B** 在本地运行。Unsloth 训练 Gemma 4 **速度约快 1.5 倍，同时显存占用约少 60%** 相比 FA2 配置。关于 Gemma 4 训练的完整指南和笔记本， [请参阅我们的博客](/docs/zh/mo-xing/gemma-4/train.md).

#### Gemma 4 训练修复

1. **梯度累积** 不再会导致 loss 爆炸。此前，loss 可能会飙升到 **300–400**；预期 loss 大约是 **10–15**.
2. 修复了 **IndexError** 影响 **26B** 和 **31B** 在 `transformers 中的推理`.
3. 修复了以下模型的乱码输出： **E2B/E4B** 当 `use_cache=False`。见 [问题 #45242](https://github.com/huggingface/transformers/issues/45242).
4. 修复了 **float16 音频** 来自以下项的溢出 `-1e9` 数值。

如果你看到 loss 高于 **13–15，** 例如 **100** 或 **300** - 那么梯度累积很可能处理不正确。这在 **Unsloth** 和 **Unsloth Studio**.

#### Gemma 4 量化重新上传

我们也更新了 Gemma 4 GGUF，因此你需要重新下载。再次说明，这些量化问题 **与 Unsloth 无关，也不是由 Unsloth 引起的**:

1. CUDA：在融合前检查缓冲区重叠 - 这是对 `<unused24>` tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`：支持异构 iSWA 的注意力旋转 - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `词表`：为 Gemma 4 在 BPE 反分词器中添加字节 token 处理 - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `转换`：设置 `“add bos” == True` 用于 Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `common`：添加 Gemma 4 专用解析器 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`：读取 `final_logit_softcapping` 用于 Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`：为 Gemma 4 添加自定义换行分割 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio 更新

* 添加 **推测解码** 支持（ngram-mod，默认开启）
* Llama.cpp 已更新为使用包含所有 Gemma 4 修复的最新版本
* 修复 Qwen3.5 和 Gemma 4 的训练问题
* 启用 Gemma 4 模型的导出和保存
* 加固终端和 Python 工具的沙盒安全
* 让 recipes 使用在聊天中加载的模型
* 修复导航时空聊天线程的问题（以及切换标签页时），并稳定新的聊天流程
* 允许非 LLM recipes 运行，并在执行中将 Data 选项卡移到最前
* 复用 HF 缓存仓库的大小写，防止重复下载
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* 你现在可以运行和训练 [Gemma 4](/docs/zh/mo-xing/gemma-4.md) Unsloth 中的这些模型。
* Intel Mac 现在可正常工作
* 用于 llama.cpp 的预编译二进制文件，包含 2 个 Gemma-4 修复：
  * vocab：修复 Gemma4 分词器（[#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * 修复：gemma 4 模板（[#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* 较小模型的工具调用现在更稳定，不会再被截断
* 适用于 Windows、Linux、Mac、WSL 设备的预编译二进制文件 - CPU 和 GPU
* 已为非视觉模型添加推测解码（Gemma-4 很遗憾是视觉模型，Qwen3.5 也是）
* 上下文长度现在已正确应用。
* 网页搜索现在真正获取网页内容，而不只是摘要
* HF API 调用减少 90% - 更少的速率限制
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **工具调用准确率提升 50% + 更多支持**

* 所有模型的工具调用现在都 **准确率提升了 30% 到 80%。**
* 网页搜索现在真正获取网页内容，而不只是摘要
* 允许的工具调用数量从 10 增加到 25
* 工具调用现在终止得更好了，因此循环 / 重复会减少
* 更多 **工具调用修复** 和去重逻辑，以防工具调用也泄漏 XML
* 经过测试，使用 `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`），启用了网页搜索 + 代码执行 + 思考。

| 指标          | 之前     | 之后       |
| ----------- | ------ | -------- |
| 响应中的 XML 泄漏 | 10/10  | 0/10     |
| 使用的 URL 抓取  | 0      | 4/10 次运行 |
| 名称正确的歌曲运行次数 | 0/10   | 2/10     |
| 平均工具调用数     | 5.5    | 3.8      |
| 平均响应时间      | 12.3 秒 | 9.8 秒    |

#### 新功能

* 新增 **自定义文件夹** 因此你可以在任何文件夹中使用任何 GGUF——目前可在聊天和自定义文件夹的高级设置中访问
* **更新按钮** 现已可见
* 安装脚本样式已全部更新！
* 初步的 **用于推理和训练的自动多 GPU 支持** - 适用于无法装进 1 张 GPU 的大型模型 - Unsloth 会自动分配 GPU 资源
* Intel Mac 开箱即用

更加流畅、更快的 Unsloth

* **修复了大型模型下载超时问题** - 不再看到超时问题。
* **修复了 Hugging Face 速率限制 - HF API 调用减少了 90%**
* 修复了 Windows 上的 bun，并加快了安装速度
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **新的重要更新**

距离我们上一个版本只过了 2 天，但我们带来了更重要的更新：

* **推理现在快了 20–30%。** 之前，工具调用和重复惩罚可能会让推理速度低于正常水平。现在，推理 tokens/s 应该与 `llama-server` / `llama.cpp`.
* **现在可自动检测旧模型或已存在的模型** 从 **LM Studio、Hugging Face、** 以及类似来源下载的。
* **推理 token/s 速度现在计算正确了。** 之前，tokens/s 会包含启动时间，这会让显示的速度看起来比实际更慢。现在它应该能反映“真实”的推理速度了。
* **CPU 占用不再突然飙升。** 之前，内联查询器身份在每次渲染时都会变化，导致 `useLiveQuery` 持续重新订阅。
* **Unsloth Studio 现在有了关闭按钮 x，并且能正确关闭。** 之前，从桌面图标打开后再关闭时，无法正确退出。现在，从快捷方式启动也会打开终端，关闭该终端即可完全退出 Unsloth Studio。如果你之前的会话里它仍然保持打开，你可以重启电脑，或者运行 `lsof -i :8888` 然后 `kill -9 <PID>`.
* **更好的工具调用和网页搜索** 并减少了错误。
* 更新了文档，加入了大量关于 [删除模型、卸载](/docs/zh/xin/studio/install.md#uninstall) 等内容的新信息。
* **Windows 和 Linux 上的安装与设置日志更简洁、更智能。** 输出现在更易阅读，格式更统一，默认更安静，带来更流畅的体验，并支持更丰富的 `--verbose` 诊断信息，供你查看完整技术细节。
* 你现在可以查看你的训练历史了！
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Unsloth Studio 发布后的首个版本公告

大家好，这是我们推出 Unsloth Studio 以来的第一个版本。包含大量新功能和修复：

* **你现在可以更新 Unsloth Studio 了！** 请使用相同的安装命令进行更新。
* **Windows** 现在 CPU 或 GPU 都能无缝工作。请重新安装！
* **应用快捷方式**。安装后，你现在可以在 Windows、MacOS 和 Linux 上通过开始菜单 / 启动器以及桌面上的快捷图标启动。
* **预编译的 `llama.cpp` 二进制文件** 和 `mamba_ssm` - 安装速度快 6 倍！二进制文件大小也小于 300MB。
* **安装体积减少 50%** （节省 7GB 或更多），安装快 2 倍，解析更快。pypi 体积缩小 50%。
* **工具调用已改进。** 更好的 llama.cpp 解析，聊天中不再出现原始工具标记，更快的推理，一个新的工具输出面板，计时器。
* MacOS 和 CPU 现在有 [数据配方](/docs/zh/xin/studio/data-recipe.md) ，并支持多文件上传。
* **Linux 上 AMD 支持为初步版本** 仅限机器 - 可自动检测。
* **设置侧边栏重新设计。** 设置现在分组为 **模型、采样、工具和偏好设置**
* **上下文长度** 现在可调整。请注意，这其实并不需要，因为 llama.cpp 会通过 `--fit on`
* **多文件上传。** 数据配方现在支持对 PDF、DOCX、TXT 和 MD 进行多文件拖放上传，支持后端提取、保存上传内容，并改进了预览。
* **Colab** 在 Unsloth Studio 中使用免费的 T4 GPU 现在已修复！ [在这里试试](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb)。由于采用了预编译二进制文件，它现在也快了 20 倍！
* **更好的聊天可观测性。** Unsloth 现在显示 `llama-server` 计时和使用情况、上下文窗口使用条，以及更丰富的来源悬停卡片。
* **整体 UX 更好** ——可点击链接、更好的 LaTeX 解析、默认卡片的工具 / 代码 / 网页提示等更多功能！
* **LiteLLM -** Unsloth Studio 和 Unsloth **没有** 受到近期 LiteLLM 安全事件影响。Nemo Data Designer 仅在 `1.80`之前使用 LiteLLM，而不是受影响的 `1.82.7` 或 `1.82.8`，并且之后已经将其完全移除。
* 我们现在有了新的单行安装命令，只需运行：&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **修复内容：**

* **Windows/设置改进。** 修复了 Windows 静默退出、Anaconda/conda-forge 启动崩溃、非 NVIDIA Windows 安装损坏，以及缺失的早期 CUDA/旧虚拟环境设置检查。
* **系统提示词已修复。** 它们现在可以再次用于非 GGUF 文本和视觉推理。
* **持久化系统提示词和预设。** 自定义系统提示词和聊天预设现在会在重新加载和页面切换后保持不变。
* **GGUF 导出扩展。** 现在完整微调，而不只是 LoRA/PEFT，也可以导出为 GGUF。基础模型解析更可靠，且不支持的导出选项会在 UI 中被禁用。
* **聊天滚动/布局修复。** 修复了生成过程中滚动位置问题、思考面板布局偏移，以及折叠推理面板时的视图跳动。
* **更智能的端口冲突检测。** Unsloth 现在可以检测回环冲突，在可能时识别阻塞进程，并提供更清晰的备用端口消息。
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## 新的工具调用 + Windows 稳定性

* Claude Artifacts 可用，因此 HTML 可以像聊天中的贪吃蛇游戏一样执行
* 工具调用准确率提升 30%，尤其适用于小模型 + 工具调用计时器
* 工具 + 网页搜索输出现在可以保存 + 可切换自动修复工具的开/关
* 大量 bug 修复 - Windows CPU 可用，Mac 更无缝，安装更快、更小
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/zh/xin/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
