> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/zh/xin/changelog.md).

# Unsloth 更新

要使用最新更改， [请更新 Unsloth](/docs/zh/xin/studio/install.md#update-unsloth-studio).

{% updates format="full" %}
{% update date="2026-07-20" tags="new-releases,v0.1.50-beta" %}

## AMD 支持来了！

大家好！这个版本将本地 LLM 训练和推理带到 [AMD GPU](/docs/zh/ji-chu/amd.md) ，适用于 Windows、WSL 和 Linux。

<a href="/pages/6eeaac81e7a7e3da5e7f0f844d5686500ef20959#installing-unsloth-on-amd" class="button primary" data-icon="bolt">快速开始</a><a href="/pages/6eeaac81e7a7e3da5e7f0f844d5686500ef20959#id-2x-faster-training-and-50-more-accurate-tool-calls" class="button secondary" data-icon="star">功能</a><a href="https://github.com/unslothai/unsloth" class="button secondary" data-icon="github">Github</a>

从今天起，我们与 AMD 的合作、自定义 Triton 内核以及数学算法，使你能够在 AMD 的 Radeon、Instinct、Vulkan、Ryzen 和数据中心 GPU 上训练并运行 500+ 个模型，速度最高提升 2×，VRAM 占用减少 70%，且不会损失精度。优化后的 ROCm 构建也支持 GGUF 和 Safetensors 推理。

<img src="https://github.com/user-attachments/assets/bb8bc525-9fb8-405d-98f5-6c9c07128085" alt="" width="375">

#### 7 月 23 日更新

1. 新增 **RDNA2、Gorgon Halo、Vulkan 支持** + 修复了 AMD 安装在 Strix Halo / 其他 AMD GPU 上无法检测到 GPU 的问题
2. 更好的 RDNA4、HIP / ROCm 失败自动修复与捕获
3. **统一内存速度提升 2 倍** AMD safetensors 加载 + 面向统一内存设备的梯度检查点速度大幅提升
4. 新增 **语音听写 / whisper.cpp** 快速文本转语音的初步支持
5. 修复了安装时回滚环境占用 5GB 磁盘空间的问题——现在会自动清理

#### 在 AMD 上本地训练 LLM

* 在 AMD GPU 上本地训练、运行 RL、聊天并部署模型。
* 在 Windows、WSL 和 Linux 上实现更可靠的 AMD GPU 检测与安装。
* 改进了 AMD MI300X 和 MI325X GPU 的 ROCm 兼容性。
* 通过以下方式远程访问 Unsloth： `unsloth studio --secure` 通过 Cloudflare 提供免费的 HTTPS

#### 在你的硬件上运行更大的模型

* 使用自动 GPU 放置，或精确选择要使用的 GPU 和模型层。
* 将 MoE 专家层移动到系统内存中，以帮助更大的模型装入。
* 将模型拆分到多个 GPU 上，或使用张量并行。
* 为每个模型和量化分别保存硬件设置。

#### 更快的聊天重启与更可靠的下载

* 当空闲模型释放其 VRAM 后，无需重建整段对话即可继续长聊天。
* 卡住的 Hugging Face XET 下载会自动重试标准 HTTP。
* 现有的 GGUF 文件会被复用，而不是在每次模型加载时重新下载。

#### 更好的搜索、工具和智能体

* 网页搜索现在可以读取 PDF 论文、手册和其他 PDF 结果。
* 并行工具调用、推理输出和工具重试的可靠性更高。
* 一个新的可选 MCP 端点让兼容的 AI 客户端可以检查模型和训练历史、开始或停止训练、加载检查点、验证配方并导出 GGUF。
  * 通过以下方式启用： `UNSLOTH_STUDIO_ENABLE_MCP=1` 并使用以下项设置所需的 bearer token： `UNSLOTH_STUDIO_MCP_TOKEN`.

#### 训练与导出修复

* 使用多模态模型进行纯文本训练时，在打包前不会再截断长示例。
* 微调后的 Qwen3.5 和 Qwen3.6 MTP 模型现在可以正确导出为 GGUF。
* 修复了可能在最终写入步骤中阻止 GGUF 导出的 Windows 权限错误。

#### 如果你错过了

我们之前的 Studio 版本加入了 Dynamic NVFP4 模型、更深层的个性化、7 种新显示语言、更安全的智能体以及 Vulkan GPU 加速。

**Dynamic NVFP4：**

Unsloth Dynamic NVFP4 会将对精度敏感的层保留为 FP8 或 BF16，而其余部分以 W4A4 运行。在 NVIDIA Blackwell GPU 上，这可实现最高 2.5 倍的推理速度提升，而经过校准的 FP8 KV 缓存可提供最高 2 倍的更长上下文。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 并探索我们扩展后的 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4)，其中包括 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。

**个性化你的 Studio：**

在标准、经典和极简三种配色方案之间选择，每种都有浅色和深色模式。你还可以自定义颜色、导入字体，并调整字号、对比度、减少动态效果等。

Unsloth 还包含一个语音设置选项卡，用于听写、自定义词典设置和朗读。

**新语言：**

Unsloth Studio 现在除中文（简体）、日语和葡萄牙语（巴西）外，还提供法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语。浏览器语言自动检测现在是默认设置。

**更安全的智能体：**

四级工具调用权限选择器-**询问**, **为我批准**, **关闭** 和 **完全访问**-为智能体提供更细致的控制。智能体工作区隔离和更安全的安装程序检查也降低了意外更改的风险。
{% endupdate %}

{% update date="2026-07-15" tags="new-releases,v0.1.49-beta" %}

## 个性化、NVFP4、语言

大家好，我们为 Unsloth 带来了大量新更新，尤其是自定义功能。现在 Unsloth 可以按你的喜好进行个性化：三种配色方案以及自定义颜色和字体、7 种新的显示语言，还有一个新的语音设置选项卡用于听写和朗读。智能体也因四级工具调用权限选择器（询问、为我批准、关闭、完全访问）和工作区隔离而更安全，Intel GPU 也终于可以通过新的 Vulkan 获得 GPU 加速推理 `llama.cpp` 支持。

我们还新增了对 [Inkling](https://unsloth.ai/docs/models/inkling)的原生支持，这是一个拥有 9750 亿参数的开放模型，41 亿参数处于激活状态，上下文窗口最高可达 100 万 token。它采用 Apache 2.0 许可，可接受文本、图像和音频并生成文本。

#### Dynamic NVFP4

我们扩展了 [NVFP4 集合](https://huggingface.co/collections/unsloth/nvfp4) ，加入了量化版本的 Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash 和 Gemma 4。

阅读 [Dynamic NVFP4 指南](https://unsloth.ai/docs/basics/nvfp4) 了解详情。

个性化你的 Unsloth

Unsloth 不再局限于浅色和深色模式：

* 从以下选项中选择 **标准**, **经典**，以及 **极简** 配色方案，每种都有浅色和深色变体。
* 自定义强调色、背景色和前景色。
* 导入你自己的 UI、标题、聊天和代码字体。
* 调整字号、对比度、动态效果、光标行为和字体平滑。
* 搜索设置并在设备间同步偏好。

浅色和深色模式会保留各自的自定义值。

#### 7 种新语言

Unsloth 现在支持法语、德语、西班牙语、印地语、阿拉伯语、俄语和韩语，并支持中文、日语和葡萄牙语。浏览器语言自动检测现在是默认设置。

#### 语音设置

新的语音选项卡增加了听写、发音词典和朗读控制。语音转文字和文字转语音支持即将推出；完整的语音对话仍在开发中。

#### 更安全的智能体和工具调用

旧的绕过开关现在变成了一个四级权限选择器：

* **询问：** 批准每一次工具调用。
* **为我批准：** 自动运行只读操作，并在可能不安全的操作前暂停。
* **关闭：** 禁用工具调用。
* **完全访问：** 允许所有调用并禁用沙箱。

这些控制覆盖终端、Python、网页搜索、RAG 和 MCP 工具。智能体还获得了隔离工作区、可通过 `--persist`恢复的会话、更安全的远程安装器警告、实时工具输出流式传输以及改进的网页提取。

#### Vulkan 和 `llama.cpp`

新的 Vulkan `llama.cpp` 后端让 Intel GPU 获得 GPU 加速推理，而不是回退到 CPU。它支持现有的 VRAM 管理、自动上下文大小设置、多 GPU 选择以及层卸载。

AMD 用户可以通过以下方式启用：

```bash
UNSLOTH_FORCE_VULKAN=1
```

我们还改进了更新可靠性、模型状态恢复以及对卡住生成的中断。

#### 模型与训练

此版本还包括：

* 原生 Inkling 支持以及多 GPU B200 改进。
* DeepSeek-V4 eager attention 和可训练的 FP8 grouped experts。
* 通过自动检测 chat-template 标记，实现可靠的仅完成训练。
* 正确处理已禁用的梯度检查点。
* 改进了 RoPE 缩放和上下文扩展。
* 对卡住的训练运行强制停止。
* 为新的模型架构和更新的 Transformers 版本自动路由。
  {% endupdate %}

{% update date="2026-07-07" tags="new-releases,v0.1.48-beta" %}

## DeepSeek-V4 + NVFP4

Unsloth 现在可以在训练后导出 NVFP4、FP8 和 imatrix GGUF；充当 llama-swap API 系统；新增日语和巴西葡萄牙语支持；并包含 MLX、safetensors、工具调用、修复支持等功能。Unsloth core 让 GRPO 速度提升 1.3 倍，为卡住的下载添加 HTTP 回退，改进离线模式，将 MoE 训练加速 3-5 倍，并修复了许多 bug。此版本系列使用 `unsloth>=2026.7.1`.

[DeepSeek-V4-Flash](/docs/zh/mo-xing/deepseek-v4.md) 现在也已支持，并提供 Thinking 切换以及我们改进后的 chat template 修复。

<div data-with-frame="true"><figure><img src="/files/24011740e066568a4f1ece7d3742c125303ef850" alt="" width="375"><figcaption></figcaption></figure></div>

#### 更智能的 OpenAI 兼容 API 提供

运行一个本地 API 端点，并带来更安全的模型切换和更好的智能体工具恢复。

* API 请求现在可以选择在已下载的本地 GGUF 之间自动切换，而未知的模型名称会安全地继续使用当前模型。
* `/v1/models` 现在返回干净的模型 ID 和本地 GGUF 目录，而不是本地 `.gguf` 路径。
* 空闲自动卸载可在不活跃后释放 VRAM，而工具调用修复现在可以按请求控制。

#### 导出改进

导出更加灵活，并避免不必要的下载。

* 可一次选择多种导出格式，包括便携 FP8/INT8、GGUF LoRA、源匹配导出、imatrix GGUF 以及压缩 FP8/FP4。
* 多检查点导出避免了更多重复的基础模型下载。
* FP8、INT8 和 GGUF-LoRA 导出现在会遵守 `trust_remote_code`，并且 GGUF 导出现在更可靠地处理缺失的量化设置。

#### RAG 和文件聊天

文件聊天在真实文档上的实用性更高了。

* RAG 附件现在可以使用整篇文档上下文，并支持可自定义的嵌入模型和 Hugging Face 搜索。
* 文件聊天可以更正确地读取更多 PDF 和 Word 文档，包括从右到左文本、印度语言文本和 DOCX 表格。
* 在代理设置后，本地 RAG 检查更加可靠。

#### Unsloth 的优化与可靠性

日常使用应该感觉更流畅、更稳定。

* 长时间的训练和聊天运行更不容易无声卡死。
* 比较模式、模型切换、模型取消、Hub 浏览和 Hub Discover 更加可靠。
* 项目导出、聊天导出、设置、引导教程、文件对话框、更新界面和推理 UI 更简洁、更一致。

#### 安装程序、硬件和平台修复

Unsloth 在各个平台上的安装和运行更加可靠。

* 如果有预构建版本可用，macOS 安装不再需要 CMake 或 Homebrew `llama.cpp` ，Apple Silicon 支持对带空格的路径和统一内存大小调整处理得更好。
* 改进了 Windows 启动、UTF-8 处理、ROCm RAG 嵌入以及 WSL 上的 ROCm GPU 支持。
* Blackwell GPU 预构建版本选择、GGUF 适配检查、用于视觉/mmproj GGUF 的张量并行，以及本地 `llama.cpp` 复用现在更加可靠。

#### 训练、模型和内核

训练和模型加载在更多环境下更加可靠。

* GRPO 现在默认支持序列打包，避免重复共享提示，并正确处理 DDP logit 缩放。
* 修复了全量微调、RL 精度设置、梯度检查点、DDP RoPE 缓冲区以及 MoE LoRA 检测。
* FP8 量化/反量化、与 Transformers v5 一起使用的 Llama 3 RoPE 缩放、PEFT 0.19 LoRA 重新加载，以及 `fast_generate` 错误信息也得到改进。
  {% endupdate %}

{% update date="2026-06-18" tags="new-releases,v0.1.47-beta" %}

## GLM 5.2 + Hub + 3 倍更长上下文

[GLM-5.2](/docs/zh/mo-xing/glm-5.2.md) 现在已在 Unsloth Studio 中支持！支持所有推理级别。 **3 倍更长的上下文长度** 现在可通过我们带有 MTP 的新自动适配算法实现，从而支持更长的聊天。绕过权限模式、可分叉聊天、可排队聊天、用于模型发现的新 Hub、并行模块 + HTTPS Cloudflare 支持等等！使用 `unsloth studio --secure` 以获得安全的 HTTPS 全球访问！

<div data-with-frame="true"><img src="https://github.com/user-attachments/assets/93c18616-415f-48ea-957d-9e0fa97a45dd" alt="" width="563"></div>

#### 更好的上下文长度算法

根据 [PR 1](https://github.com/unslothai/unsloth/pull/6312) 和 [PR 2](https://github.com/unslothai/unsloth/pull/6447)，我们大幅改进了 Unsloth Studio 对内存占用和上下文长度的判断，使整体上下文长度达到 3 倍：

| 场景                           | KV    | 之前      | 之后      |
| ---------------------------- | ----- | ------- | ------- |
| 1x 32GB pipeline（约 31 GB 可用） | f16   | 23,040  | 64,000  |
|                              | q8\_0 | 43,520  | 114,944 |
|                              | q4\_0 | 82,432  | 199,680 |
| 2x 32GB pipeline             | 任意    | 262,144 | 262,144 |
| 2x 24GB tensor（约 23 GB 可用）   | f16   | 134,049 | 262,144 |
|                              | q8\_0 | 252,329 | 262,144 |

#### 聊天画布、分叉与排队

* 可直接编辑助手消息，并从线程中的任意位置重新运行。
* 分叉线程，在不丢失原始内容的情况下分支对话。
* 临时（隐身）聊天，不留下任何痕迹。
* 在生成仍在运行时排队新提示，而不是等待。
* 聊天“工件”现在是 **画布**，内嵌 **HTML 画布卡片** 会自动渲染，还有代码视图，并且 DiffusionGemma 会保持其原始代码以内联方式可见，而不是折叠。
* 聊天搜索现在覆盖每条消息，并优先显示你自己的消息。

#### Hub（重新设计）

* 全页 Hub，带有热门动态流、搜索以及自定义模型路径支持。
* 在分栏流中预览 README，这样你在下载前就能阅读。
* 下载默认使用更快的 **Xet** 传输，如果传输卡住会自动回退到 HTTP。
* 新增“按选择加载”开关，可在模型加载前设置加载选项。
* DiffusionGemma 和未来 Gemma 衍生模型会显示 Google 标志。

#### 模型与推理

* DeepSeek-OCR 及更多视觉模型现在可无错误地加载和运行。
* 修复了最新 vLLM（0.22+）上的快速推理问题，因此加速效果重新生效。
* 张量并行更可靠了：如果更快的 MTP 路径失败，现在会自行恢复而不是崩溃。
* DiffusionGemma 现在会在去噪时实时显示图像形成过程，并带有准确的速度统计。

#### 安全与 Cloudflare 加密 Studio

* 新的 `--secure` 仅 Cloudflare 模式，用于端到端加密的 studio，服务器端工具在 `--secure`下仍保持启用。使用 `unsloth studio --secure`!
* 绕过权限模式可跳过确认，并在你需要时禁用工具沙箱。
* 自动检测 Hugging Face 病毒扫描 + 仓库中的危险文件。

#### 日志与 API

* 新的 **API 服务器监视器** 在 Unsloth 中。
* 更快的 API 调用和更低的延迟
* 日志大幅精简——现在包含吞吐量和延迟，并移除了大量臃肿日志。

#### 硬件与后端

* 更好地支持 Blackwell RTX 50X 和 60X GPU
* 修复了静默降级到 CPU 而不是 GPU 的问题
* torchao 版本现在根据已安装的 torch 进行选择。
* 安装程序现在会自动修复损坏或仅 CPU 的 PyTorch 安装，并在 NVIDIA + AMD 于 Win/Linux/Mac/WSL 上静默回退到 CPU 时发出警告。
* 在训练开始时释放聊天模型的 VRAM，但仅在 GPU 确实吃紧时才这样做（否则不会不必要地重新加载）。
* 如果 llama-server 在启动时硬崩溃，Unsloth 现在会逐步进入恢复流程，而不是直接失败。

#### 训练与通用修复以及并行模块

* MLX 训练更新。
* 提高了使用 vLLM 的 GRPO 训练可靠性。
* 使训练启动更加可靠，并为无效的 VLM 批次提供更清晰的错误信息。
* 在崩溃、重启或中断关闭后，Unsloth 现在能更可靠地清理遗留的后端进程。
* 导出、聊天、训练、配方现在都已经个体化 / 分区化了！这意味着你现在可以同时进行这 4 项操作！在等待训练运行或导出时，你可以聊天 / 做推理！

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-12" tags="new-releases,v0.1464-beta" %}

## DiffusionGemma + Gemma 4 MTP

请确保安装最新的 [`v0.1.464-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) 或 `2026.6.7`. [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma), [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 和 [**MiniMax-M3**](https://unsloth.ai/docs/models/minimax-m3) 现在都已支持。

* 运行和训练 [DiffusionGemma](https://unsloth.ai/docs/models/diffusiongemma) 通过 [Unsloth Studio](https://unsloth.ai/docs/new/studio).
* [Gemma 4 MTP](https://unsloth.ai/docs/models/mtp) 已经来了！运行 [Gemma 4](https://unsloth.ai/docs/models/gemma-4) 使用 MTP 速度提升约 2 倍。
* Gemma 4 现在支持音频聊天（`wav`, `mp3`, `m4a`, `flac`, `webm`).
* 已为 Gemma 4 添加 Preserve Think。

<figure><img src="/files/1bbdb052f36c70a05af0a94756a76e8ee3fc3288" alt="" width="375"><figcaption></figcaption></figure>

#### Hub + 下载管理器（实验性）

* 新增了一个新的 **Hub** 页面，用于浏览、下载和管理 Hugging Face 模型与数据集。
* Unsloth 现在可以检测你机器上已经存在的模型和数据集，并将它们与已下载资源一起显示。
* 已下载的 [GGUF 模型](https://unsloth.ai/docs/basics/inference-and-deployment/saving-to-gguf) 现在拥有直接的 **运行 / 新聊天** 操作。

#### RAG / 使用文件聊天（实验性）

* 新增 [**使用文件聊天**](https://unsloth.ai/docs/new/studio/chat) 在 Unsloth 中，让你可以围绕自己的文档和知识库提问。
* 支持混合搜索、引用、PDF 预览、按线程文档以及内置的 `search_knowledge_base` 工具。

#### 新的更新按钮 + 硬件支持

* Unsloth 现在始终使用最新的 [llama.cpp 预构建版本](https://unsloth.ai/docs/new/changelog) ，覆盖 CUDA、ROCm、Windows、Linux 和 macOS。
* 新增了一个应用内 **更新 llama.cpp** 按钮，因此用户无需重新安装 Unsloth 即可更新本地后端。
* 改进了 Windows / WSL AMD 支持， [Strix Halo ROCm 支持](https://unsloth.ai/docs/get-started/install/amd), [Blackwell CUDA 选择](https://unsloth.ai/docs/blog/fine-tuning-llms-with-blackwell-rtx-50-series-and-unsloth)，以及更清晰的安装程序消息。

#### 本地聊天、工具与 API 兼容性

* 本地 [工具调用](https://unsloth.ai/docs/basics/tool-calling-guide-for-local-llms) 更加可靠，工具卡片排序更好、重复工具循环更少，并支持与 GGUF 视觉模型一起使用工具。
* 改进的 [OpenAI 兼容 API](https://unsloth.ai/docs/basics/inference-and-deployment/llama-server-and-openai-endpoint) 以及兼容 Anthropic 的本地 Unsloth 服务器 API 行为，包括更好的错误、token 使用情况、停止原因，以及 [兼容 Claude Code](https://unsloth.ai/docs/basics/claude-code).

#### 训练与修复

* 改进的 [MLX 支持](https://unsloth.ai/docs/new/studio/install) 以及更好的模型标签、生成速度统计，以及对以下内容的修复： [VLM 训练](https://unsloth.ai/docs/basics/vision-fine-tuning).
* 修复了若干 [训练](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide) 和 [数据集](https://unsloth.ai/docs/get-started/fine-tuning-llms-guide/datasets-guide) 边缘情况，包括不可写的 Hugging Face 缓存和自定义数据集映射。
* 对聊天、菜单、模型选择器、深色模式、导入/导出和设置进行了大量 UI 优化修复。

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% endupdate %}

{% update date="2026-06-03" tags="new-releases,v0.1.44-beta" %}

## Gemma 4 12B、新 UI、MCP、项目

这次更新主要聚焦于 Gemma 4 12B、MCP、项目、Canvas、CUDA 13.3 以及新的聊天 UI。下周我们会有一个更大的更新。

<div data-with-frame="true"><figure><img src="/files/ab4797a53a7e650b5bd6e31277a097bd31086b51" alt="" width="375"><figcaption></figcaption></figure></div>

#### Gemma 4 12B

Google 发布 [Gemma 4 12B](https://unsloth.ai/docs/models/gemma-4)，一个可在 8GB RAM 上本地运行的新模型。 [GGUF](https://huggingface.co/unsloth/gemma-4-12b-it-GGUF) / [指南](https://unsloth.ai/docs/models/gemma-4)

Gemma 4 12B Unified 支持图像、音频和 256K 上下文。可通过 Unsloth Studio 运行并训练该模型。

#### MCP

* 远程 `MCP` 服务器支持，包括自定义标头和 OAuth
* 本地基于命令的 `MCP` 服务器支持
* `MCP` 现在可以直接从聊天编辑器中开启
* 常见的内置预设 `MCP` 服务器

#### 全新聊天 UI

* 项目、Canvas、 `MCP`、RAG 和 Compare 控件现在都在加号菜单中
* 搜索和代码控件现在更容易从编辑器中访问
* 菜单、浮层、图标和可点击控件在 Unsloth 中更加一致

#### 项目

* 将相关聊天整理到专用项目工作区中
* 将现有聊天移动到项目中
* 直接从侧边栏创建和管理项目

#### 实验性 Canvas / Artifacts

* 将生成的 HTML 打开到 Unsloth Studio 内专用的 Canvas 面板中
* 支持交互式输出，包括基于浏览器的可视化和通过 CDN 加载的包
* 可在渲染预览和源代码之间切换

#### 安装、运行时和硬件

* Windows 预编译安装现在不再需要早期的 `CUDA Toolkit` 检查
* Linux `llama.cpp` 预编译包现在与检测到的运行时匹配 `cudart` 主要
* `ROCm` gfx 检测已转发到预编译包选择中
* `Blackwell`, `B300` 和 `ARM64` Linux 支持更新

要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**请勿使用 `unsloth studio 更新` 了，因为打包版本不会获得最新更新！**
{% endhint %}
{% endupdate %}

{% update date="2026-05-31" tags="new-releases,v0.1.43-beta" %}

## CUDA 13.3、Windows、Mac

**要更新 Unsloth 或安装新的 Unsloth Studio，必须使用：**

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

{% hint style="warning" %}
**请勿使用 `unsloth studio 更新` 了，因为打包版本不会获得最新更新！**
{% endhint %}

#### Mac 更新

* 重新启用 `llama.cpp` Apple Silicon（M1-M4）的预编译二进制文件 - Mac OS 14 / 15 / 26 (Tahoe)
* Apple Silicon Mac OS 13 (Ventura) 使用源码构建
* Intel (x86\_64) 在 Mac OS 13.3 / 14 / 15 / 26 (Tahoe) 上使用 `llama.cpp` 预编译二进制文件
* Mac OS 13.0 - 13.2 的 Intel 版本为源码构建

#### Windows 更新

* CUDA 13.3 `llama.cpp` 预编译二进制文件现在可在 Windows 上运行
* 对于 CUDA 13.2、CUDA 13.1 及更低版本，Windows 设备将使用 CUDA 12.4 回退方案——我们很快会着手处理 CUDA 13.1 二进制文件。

#### CUDA 13.3 更新

* CUDA 13.3 的非 Linux 二进制文件可用。我们目前仍将使用 CUDA 13.1
* CUDA 13.3 解决了 CUDA 13.2 的乱码问题 - 参见 <https://github.com/unslothai/unsloth/issues/4849>

#### Blackwell GPU 更新

* 目前 Blackwell 的 `llama.cpp` 预编译二进制文件发布将延后，因为 CUDA 12.4 不可用——我们正在尽快解决这个问题。
  {% endupdate %}

{% update date="2026-05-26" tags="new-releases,v0.1.42-beta" %}

## 重构前的一个更新。

大家好，在即将到来的重大重构之前，我们再做一次比较小的更新；该重构可能会在本周或下周到来。我们的重构将改变很多东西，尤其是引入新的重大功能和大量设计变更。

{% embed url="<https://github.com/user-attachments/assets/70456395-e016-4273-8256-35adb206267e>" %}

* 新： [**API 调用支持**](https://unsloth.ai/docs/integrations/connections) 现在支持图像生成 + 编辑、正确的网页搜索、代码执行、自动提示缓存。连接 [OpenAI](https://unsloth.ai/docs/integrations/connections/openai), [Anthropic](https://unsloth.ai/docs/integrations/connections/anthropic-claude) 等。
* 对以下内容提供正确支持： **非英语语言** 例如日语、中文、印度语等。

你们中的很多人可能错过了我们之前那次只持续一天的发布。我们引入了：

* 连接到外部推理后端： [vLLM](https://unsloth.ai/docs/integrations/connections/vllm), [Ollama](https://unsloth.ai/docs/integrations/connections/ollama), [llama-server](https://unsloth.ai/docs/integrations/connections/connect-llama.cpp-to-unsloth-run-ggufs-with-llama-server)
* **安全性改进**
* **自动 MTP 投机解码** 适用于 MTP GGUF；可获得针对你硬件定制的最佳设置。

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存，并在多轮对话中复用）
* OpenAI 和 Anthropic 模型已启用提示缓存，可节省 50% 到 90% 的成本。
* 图像生成 + 编辑
* 本地提供商（llama.cpp / vLLM / Ollama）现在可选填 API 密钥
* 添加云提供商时自动加载模型

#### 其他 Unsloth Studio 更新

* OpenDocument 聊天附件
* o3 推理摘要载荷
* 现在发送/提示非英语语言（例如日语、中文）可以正常工作了
* IME 编辑器加固，RTL `dir="auto"`，长日志行截断修复
* UI 中的工具推理轨迹渲染
* 完全离线支持：缓存的 GGUF 发现，以及用于推理和训练的离线 DNS 自动检测

#### Unsloth Studio 安全性改进

* 认证限流，支持代理感知，因此反向代理不会绕过它
* 带有更严格黑名单的沙盒工作进程（bash， `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程无法逃出其进行中的 tmp 目录
* Unsloth API 全面的严格 schema 验证
* 收紧 CSP / 安全标头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 在 `training_args.bin` 上的回退，因此不受信任的 pickle 在模型加载时绝不可能执行
* 加固了 Tauri 桌面发布流程
* 前端认证：单飞 token 刷新，修改时输入当前密码，正常注销，共享的 422 辅助函数
* 取消清理现在严格限定在进行中的 tmp 目录中，因此绝不会删除用户状态
  {% endupdate %}

{% update date="2026-05-19" tags="new-releases,v0.1.41-beta" %}

## MTP + Unsloth 修复

Unsloth 有很多 bug 修复和 UI、UX 修复！要获取最新更新，请执行：

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows：**

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

#### 修复

1. 修复 `unsloth studio 更新` 运行不太正常
2. 修复卡在 `重置密码` 页面
3. 更多离线模式支持
4. 改进 MTP 在 Mac、CPU 和 GPU 上没有更快的问题——现在好多了！
5. 修复桌面快捷方式在更新后失效
6. 大量 UI/UX bug 修复
   {% endupdate %}

{% update date="2026-05-18" tags="new-releases,model-release,v0.1.405-beta" %}

## Qwen3.6 MTP + API 连接

我们为 Unsloth 带来了很多新更新 `v0.1.41-beta`:

* **GGUF 推理速度约提升 2 倍** 并自动启用 [MTP](/docs/zh/mo-xing/qwen3.6.md#mtp-guide)
* [**API 调用支持**](/docs/zh/ji-cheng/connections.md) 用于 [OpenAI](/docs/zh/ji-cheng/connections/openai.md), [Anthropic](/docs/zh/ji-cheng/connections/anthropic-claude.md) 等，并带有自动提示缓存、网页搜索、代码执行
* 连接到外部推理后端： [vLLM](/docs/zh/ji-cheng/connections/vllm.md), [Ollama](/docs/zh/ji-cheng/connections/ollama.md), [llama-server](/docs/zh/ji-cheng/connections/jiang-llama.cpp-lian-jie-dao-unsloth-shi-yong-llamaserver-yun-xing-gguf.md)
* 实验性 **MLX 推理**
* 对以下内容提供正确支持： **非英语语言**
* **安全** 改进

<a href="/pages/213bd08e4302b621f4392f7ee38decb275ffab02#qwen3.6-inference-tutorials" class="button primary">运行 Qwen3.6 教程</a><a href="/pages/213bd08e4302b621f4392f7ee38decb275ffab02#mtp-guide" class="button primary">MTP 指南</a>

<div data-with-frame="true"><figure><img src="/files/31ab8e22459d009a889ab0da5455340326388734" alt="" width="375"><figcaption></figcaption></figure></div>

#### MTP 投机解码支持，推理速度提升 1.4 到 2 倍！

* **自动 MTP 投机解码** 适用于 MTP GGUF；当内置的 llama.cpp 预编译版本过旧或太老而不支持 MTP 时发出警告
* 全新的 MTP 支持预构建 llama.cpp 二进制文件！

#### API 提供商调用与外部连接

* 现在你可以将 Unsloth 连接到任何 API 云提供商（OpenAI、Anthropic、OpenRouter 等）
* **内置网页搜索** 适用于 OpenAI、Anthropic、OpenRouter 和 Kimi
* **内置代码执行** 适用于 OpenAI 和 Anthropic（Anthropic 容器会持久保存，并在多轮对话中复用）
* OpenAI 和 Anthropic 模型已启用提示缓存，可节省 50% 到 90% 的成本。
* 本地提供商（llama.cpp / vLLM / Ollama）现在可选填 API 密钥
* 添加云提供商时自动加载模型

#### MLX 推理（实验性）

* 现在 MLX 量化模型和模型可以在你的 Mac 机器上本地运行！
* 我们很快会加入思考、工具和网页搜索！

#### 其他 Unsloth Studio 更新

* 现在发送/提示非英语语言（例如日语、中文）可以正常工作了
* OpenDocument 聊天附件
* o3 推理摘要载荷
* IME 编辑器加固，RTL `dir="auto"`，长日志行截断修复
* UI 中的工具推理轨迹渲染
* 完全离线支持：缓存的 GGUF 发现，以及用于推理和训练的离线 DNS 自动检测
* 大量 UI/UX 优化：深色主题重构、右侧边栏重新设计、昼夜 sloth 吉祥物、可关闭且可复制的提示、加大的聊天编辑器、代码执行配置优化、编辑器操作胶囊样式、较窄的 Discord 按钮

#### 训练更新

* Gemma attention mask 修复
* 多图像 GRPO
* GRPO 隐藏状态返回实验
* 新的持续预训练（CPT）训练方法，作为一等公民选项
* 已注册 Gemma-4 MoE LoRA 提取器以修复 `grouped_mm` 收缩崩溃
* 可选的融合 `lm_head`  + 交叉熵前向，在 `UNSLOTH_RETURN_LOGITS=1`
* 传递评估的批大小
* 评估/训练路径现在会遵守 `HF_DATASETS_OFFLINE` 以及 `HF_HUB_OFFLINE`

#### Unsloth Studio 安全性改进

* 认证限流，支持代理感知，因此反向代理不会绕过它
* 带有更严格黑名单的沙盒工作进程（bash， `hf 上传`, `NOFILE`)
* 路径隔离，确保工作进程无法逃出其进行中的 tmp 目录
* Unsloth API 全面的严格 schema 验证
* 收紧 CSP / 安全标头（仅允许合法的 favicon 主机）
* 移除了 `torch.load` 在 `training_args.bin` 上的回退，因此不受信任的 pickle 在模型加载时绝不可能执行
* 加固了 Tauri 桌面发布流程
* 前端认证：单飞 token 刷新，修改时输入当前密码，正常注销，共享的 422 辅助函数
* 取消清理现在严格限定在进行中的 tmp 目录中，因此绝不会删除用户状态
  {% endupdate %}

{% update date="2026-05-05" tags="new-releases,v0.1.39-beta,v0.1.38-beta" %}

## Unsloth API 端点

#### ***v0.1.39-beta bug 修复*** **2026 年 5 月 5 日**

修复聊天历史未显示（现有聊天历史不会丢失）以及附件未正确附加的问题。该 bug 只是渲染层面的——请使用 `2026.5.2` 或直接调用 `curl -fsSL https://unsloth.ai/install.sh | sh`  来更新

你可以通过将它们连接到 Unsloth 的 API 端点来在本地使用带工具的 LLM，例如 [Claude Code](https://unsloth.ai/docs/basics/claude-code) 和 [Codex](https://unsloth.ai/docs/basics/codex) 。这让你可以运行如下模型： [Qwen](https://unsloth.ai/docs/models/qwen3.6) 和 [Gemma](https://unsloth.ai/docs/models/gemma-4) 在本地运行，并附带自愈式工具调用、代码执行和网页搜索等额外功能。

将 Unsloth 用作 API 推理端点的好处不仅在于它易于设置且速度快，还在于 Unsloth 提供：

* [自愈式工具调用](https://unsloth.ai/docs/new/studio/chat#auto-healing-tool-calling)，这有助于将错误或格式异常的工具调用减少 50%
* [代码执行](https://unsloth.ai/docs/new/studio/chat#code-execution) 支持，允许执行 Bash 和 Python，以获得更准确的代码输出。
* 高级 [网页搜索](https://unsloth.ai/docs/new/studio/chat#advanced-web-search) 会访问并实际读取网页以收集深入信息。
* [自动推理设置](https://unsloth.ai/docs/new/studio/chat#auto-parameter-tuning) 适用于 GGUF 模型（temp、top-k 等）

<div data-with-frame="true"><figure><img src="/files/c633f6e5a61522d2d7fa76b1c6c3376b956d223d" alt="" width="375"><figcaption></figcaption></figure></div>

#### 新模型

我们还新增了一些可运行的新模型，包括 NVIDIA [Nemotron 3 Nano Omni](/docs/zh/mo-xing/nemotron-3-nano-omni.md)、IBM [Granite 4.1](/docs/zh/mo-xing/ibm-granite-4.1.md) 和 [Mistral 3.5](/docs/zh/mo-xing/mistral-3.5.md) Medium。我们帮助 Mistral 解决了 transformers 和 GGUF 实现中的一些问题。

#### Unsloth 更新

* 已停止的 Unsloth 训练任务现在可以从检查点恢复。
* 聊天线程现在自动保存，持久性更可靠。
* 多进程设置中的 DPO 训练挂起问题已修复。
* MROPE 更新改进了 VLM GRPO 支持。
* Unsloth 的停止按钮现在可以正确停止生成。
* 修复浏览器刷新后聊天模板消失的问题。
  {% endupdate %}

{% update date="2026-04-23" tags="new-releases,v0.1.37-beta" %}

## 全新 UI 重设计

大家好，我们重做了整个 Unsloth Studio 的 UI 和 UX 体验，重点放在聊天和训练上：

* 根据社区反馈添加了可折叠侧边栏

<div data-with-frame="true"><figure><img src="/files/16cd5c624d215906fa9d68a69a32e3e5c28d1730" alt="" width="375"><figcaption></figcaption></figure></div>

* 现在你可以删除聊天并搜索历史对话

<div><figure><img src="/files/7edd3f0c4d396a97d88f556990e9f773733f217f" alt=""><figcaption></figcaption></figure> <figure><img src="/files/9396bda0dcb1e0b931b2323c8c6b05f16867a68d" alt=""><figcaption></figcaption></figure></div>

* 为支持它的模型（如 Qwen3.6）新增保留思考切换
* 更简洁、更一致的设计，导航更轻松
* 扩展的设置页面，可更改头像、名称等

<div data-with-frame="true"><figure><img src="/files/bd51c25b8a1cd8fdf88fb54d9e00ae0f551e3ee1" alt="" width="375"><figcaption></figcaption></figure></div>

* 无需再输入两次 Hugging Face token
* gpt-oss 现在具有低、中、高思考切换。
* 现在使用最新的 llama.cpp 预编译版本，即使在 Linux CUDA 上也是如此
* 大量 bug、一致性和稳定性修复
* Kimi-K2.6 现在可以运行了！
* 我们还添加了实验性 API 支持。指南、公告等内容会在下周发布。

Qwen3.6 之前也已在 Unsloth Studio 中支持运行和训练。你现在就可以训练和运行 Qwen3.6-27B！
{% endupdate %}

{% update date="2026-04-22" tags="model-release,new-releases" %}

## **Qwen3.6-27B + Kimi K2.6**

[**Qwen3.6-27B**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行（18GB RAM）并进行微调。Kimi K2.6 也可以在 Unsloth 中运行（350GB RAM）。

Unsloth Studio 收到了许多新更新，请及时更新。详细信息和说明将在接下来的几天内发布。
{% endupdate %}

{% update date="2026-04-16" tags="model-release,new-releases" %}

## **Qwen3.6**

[**Qwen3.6**](/docs/zh/mo-xing/qwen3.6.md) 现在可以在 Unsloth Studio 中运行并进行微调。该模型可在 23GB RAM 上运行，并且在几乎所有基准测试中都是最强的中型 LLM。
{% endupdate %}

{% update date="2026-04-11" tags="model-release" %}

## **Gemma 4 更新 + MiniMax-M2.7**

[Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4) 现已更新 Google 官方聊天模板修复（修复/改进了工具调用），并包含最新的 llama.cpp 修复。更新到最新的 llama.cpp，重新下载量化文件，你就不会再看到 `未使用的 token` 问题了。\
\
[MiniMax-M2.7](/docs/zh/mo-xing/tutorials/minimax-m27.md) 现已发布！你可以使用我们的 GGUF 以 4 位量化在 128GB RAM / 统一内存上本地运行该模型。 [**MiniMax-M2.7 GGUF**](https://huggingface.co/unsloth/MiniMax-M2.7-GGUF)
{% endupdate %}

{% update date="2026-04-08" tags="new-releases,v0.1.36-beta" %}

## **Gemma 4 修复**

我们已更新 Gemma 4 [并进行了大量修复](/docs/zh/mo-xing/gemma-4/train.md)。这些 bug 是通用的，影响了所有训练包和实现，而且 **并非起源于 Unsloth**。我们识别了这些 bug，修复了它们，现在 Gemma 4 训练在 Unsloth 中可以正常工作。

你只需要 **8GB VRAM** 即可训练 **Gemma-4-E2B** 在本地。Unsloth 训练 Gemma 4 **速度约快 1.5 倍，同时使用约少 60% 的 VRAM** 相比 FA2 配置。关于 Gemma 4 训练的完整指南和笔记本， [请查看我们的博客](/docs/zh/mo-xing/gemma-4/train.md).

#### Gemma 4 训练修复

1. **梯度累积** 不再导致 loss 爆炸。此前，loss 可能会飙升到 **300–400**；预期 loss 大约为 **10–15**.
2. 修复了 **IndexError** 影响 **26B** 和 **31B** 在 `transformers`.
3. 修复了 **E2B/E4B** 在 `use_cache=False`时产生的乱码输出。参见 [问题 #45242](https://github.com/huggingface/transformers/issues/45242).
4. 修复了 **float16 音频** 溢出来自 `-1e9` 值。

如果你看到 loss 高于 **13–15，** 例如 **100** 或 **300** ——梯度累积很可能被错误处理了。这个问题在 **Unsloth** 和 **Unsloth Studio**.

#### Gemma 4 量化重新上传

我们也更新了 Gemma 4 GGUF，因此你需要重新下载。再次说明，这些量化问题 **与 Unsloth 无关，也不是由 Unsloth 导致的**:

1. CUDA：在融合前检查缓冲区重叠——对 `<unused24>` tokens - [PR #21566](https://github.com/ggml-org/llama.cpp/pull/21566)
2. `kv-cache`：支持异构 iSWA 的注意力旋转 - [PR #21513](https://github.com/ggml-org/llama.cpp/pull/21513)
3. `词表`：为 Gemma 4 的 BPE 反分词器添加字节 token 处理 - [PR #21488](https://github.com/ggml-org/llama.cpp/pull/21488)
4. `转换`: 设置 `"add bos" == True` 适用于 Gemma 4 - [PR #21500](https://github.com/ggml-org/llama.cpp/pull/21500)
5. `通用`: 添加 Gemma 4 专用解析器 - [PR #21418](https://github.com/ggml-org/llama.cpp/pull/21418)
6. `llama-model`: 读取 `final_logit_softcapping` 适用于 Gemma 4 - [PR #21390](https://github.com/ggml-org/llama.cpp/pull/21390)
7. `llama`: 为 Gemma 4 添加自定义换行分割 - [PR #21406](https://github.com/ggml-org/llama.cpp/pull/21406)

#### Unsloth Studio 更新

* 添加 **推测解码** 支持（ngram-mod，默认开启）
* Llama.cpp 已更新为使用包含所有 Gemma 4 修复的最新版本
* 修复 Qwen3.5 和 Gemma 4 的训练问题
* 启用 Gemma 4 模型的导出和保存
* 加强终端和 Python 工具的沙箱安全性
* 让配方使用 Chat 中加载的模型
* 修复导航时（以及切换标签页时）空聊天线程问题，并稳定新聊天流程
* 允许非 LLM 配方运行，并在执行中将 Data 选项卡移到最前
* 重用 HF 缓存的仓库大小写以防止重复下载
  {% endupdate %}

{% update date="2026-04-03" tags="new-releases,v0.1.36-beta" %}

## **Google - Gemma 4**

* 你现在可以运行和训练 [Gemma 4](/docs/zh/mo-xing/gemma-4.md) Unsloth 中的模型。
* Intel Mac 现在可用
* 针对 2 个 Gemma-4 修复的 llama.cpp 预编译二进制文件：
  * 词表：修复 Gemma4 分词器（[#21343](https://github.com/ggml-org/llama.cpp/pull/21343))
  * 修复：gemma 4 模板（[#21326](https://github.com/ggml-org/llama.cpp/pull/21326))
* 小型模型的工具调用现在更稳定，不再会被截断
* 适用于 Windows、Linux、Mac、WSL 设备的预编译二进制文件——CPU 和 GPU
* 为非视觉模型添加了推测解码（遗憾的是 Gemma-4 和 Qwen3.5 属于视觉模型）
* 上下文长度现在已正确应用。
* 网络搜索现在实际上获取的是网页内容，而不只是摘要
* HF API 调用减少 90%——更少的速率限制
  {% endupdate %}

{% update date="2026-03-31" tags="new-releases,improvements" %}

## **工具调用准确率提升 50% + 更多支持**

* 所有模型的工具调用现在已 **准确度提高了 30% 到 80%。**
* 网络搜索现在实际上获取的是网页内容，而不只是摘要
* 允许的工具调用次数从 10 次增加到 25 次
* 工具调用现在终止得更好，因此循环/重复会减少
* 更多 **工具调用修复** 以及去重逻辑，以防工具调用也泄漏 XML
* 测试使用： `unsloth/Qwen3.5-4B-GGUF` (`UD-Q4_K_XL`），已启用网络搜索 + 代码执行 + 思考。

| 指标           | 之前     | 之后       |
| ------------ | ------ | -------- |
| 响应中的 XML 泄漏  | 10/10  | 0/10     |
| 使用的 URL 抓取次数 | 0      | 4/10 次运行 |
| 歌曲名称正确的运行次数  | 0/10   | 2/10     |
| 平均工具调用次数     | 5.5    | 3.8      |
| 平均响应时间       | 12.3 秒 | 9.8 秒    |

#### 新功能

* 新增 **自定义文件夹** 因此你可以在任意文件夹中使用任何 GGUF——目前可在 Chat 的高级设置和自定义文件夹中访问
* **更新按钮** 现在可见
* 安装脚本样式全部已更新！
* 初步 **推理和训练的自动多 GPU 支持** - 适用于无法放入一张 GPU 的大型模型 - Unsloth auto 将分配 GPU 资源
* Intel Mac 应该可开箱即用

更流畅、更快速的 Unsloth

* **修复大型模型下载超时问题** - 不再出现超时。
* **修复 Hugging Face 速率限制问题 - HF API 调用减少 90%**
* 修复 Windows 上的 bun，并加快安装速度
  {% endupdate %}

{% update date="2026-03-27" tags="new-releases,fixes,improvements" %}

## **新的重要更新**

距离我们上一个版本才过了 2 天，但我们有更重要的更新：

* **推理现在快了 20–30%。** 之前，工具调用和重复惩罚可能会使推理速度低于正常水平。现在推理 tokens/s 应该与 `llama-server` / `llama.cpp`.
* **现在可自动检测较旧或已存在的模型** 下载自 **LM Studio、Hugging Face、** 以及类似来源。
* **推理 token/s 速度现在可正确计算。** 之前，tokens/s 包含启动时间，这使显示速度看起来比实际更慢。现在应能反映“真实”的推理速度。
* **CPU 使用不再激增。** 之前，内联查询器标识在每次渲染时都会变化，导致 `useLiveQuery` 持续重新订阅。
* **Unsloth Studio 现在有一个关闭 X 按钮，并且能正确关闭。** 之前，从桌面图标打开后再关闭它不会正确关闭。现在，从快捷方式启动也会打开终端，关闭该终端会完全退出 Unsloth Studio。如果你仍然保留了上一次会话中的它，可以重启电脑或运行 `lsof -i :8888` 然后 `kill -9 <PID>`.
* **更好的工具调用和网络搜索** 错误更少。
* 更新了文档，包含大量关于 [删除模型、卸载](/docs/zh/xin/studio/install.md#uninstall) 等的新信息。
* **Windows 和 Linux 上更简洁、更智能的安装和设置日志记录。** 输出现在更易读，格式统一，默认更安静以获得更流畅的体验，并支持更丰富的 `--verbose` 诊断信息，当你需要完整技术细节时。
* 你现在可以查看你的训练历史！
  {% endupdate %}

{% update date="2026-03-25" tags="new-releases,fixes,improvements" %}

## Unsloth Studio 之后的首次发布

嗨，大家好，这是我们自 Unsloth Studio 发布以来的第一个版本。新增了许多功能和修复：

* **你现在可以更新 Unsloth Studio 了！** 请使用相同的安装命令进行更新。
* **Windows** CPU 或 GPU 现在都能无缝工作。请重新安装！
* **应用快捷方式**。安装后，你现在可以通过开始/启动菜单和桌面上的快捷方式图标在 Windows、MacOS 和 Linux 上启动。
* **预编译 `llama.cpp` 二进制文件** 和 `mamba_ssm` - 安装速度快 6 倍！二进制文件大小也小于 300MB。
* **安装体积减少 50%** （节省 7GB 或更多），安装快 2 倍，依赖解析更快。PyPI 包大小减少 50%。
* **工具调用得到改进。** 更好的 llama.cpp 解析，聊天中不再显示原始工具标记，更快的推理，新的“工具输出”面板，计时器。
* MacOS 和 CPU 现在具有 [数据配方](/docs/zh/xin/studio/data-recipe.md) 并支持多文件上传。
* **Linux 上的 AMD 支持为初步支持** 仅限机器 - 自动检测。
* **设置侧边栏重新设计。** 设置现在分组为 **模型、采样、工具和偏好**
* **上下文长度** 现在可调整。请注意，这其实并非必需，因为 llama.cpp 会通过 `--fit on`
* **多文件上传。** 数据配方现在支持对 PDF、DOCX、TXT 和 MD 的多次拖放上传，并具备后端提取、已保存上传和改进的预览。
* **Colab** 使用免费 T4 GPU 的 Unsloth Studio 现在已修复！ [在这里试用](https://colab.research.google.com/github/unslothai/unsloth/blob/main/studio/Unsloth_Studio_Colab.ipynb)。由于使用了预编译二进制文件，它也快了 20 倍！
* **更好的聊天可观测性。** Unsloth 现在显示 `llama-server` 时间和用量、上下文窗口使用条，以及更丰富的来源悬停卡片。
* **整体更好的用户体验** - 可点击链接、更好的 LaTeX 解析、默认卡片的工具/代码/网页提示等更多功能！
* **LiteLLM -** Unsloth Studio 和 Unsloth **未** 受最近的 LiteLLM 泄露事件影响。Nemo Data Designer 仅在 `1.80`之前使用了 LiteLLM， `1.82.7` 或 `1.82.8`而不是受影响的
* 我们现在有新的单行安装命令，只需运行：&#x20;

  <pre class="language-bash" data-overflow="wrap" data-expandable="true"><code class="lang-bash">curl -fsSL https://unsloth.ai/install.sh | sh
  </code></pre>

#### **修复：**

* **Windows/安装改进。** 修复了 Windows 静默退出、Anaconda/conda-forge 启动崩溃、非 NVIDIA Windows 安装损坏，以及缺失的早期 CUDA/陈旧虚拟环境设置检查。
* **系统提示词已修复。** 它们现在可再次用于非 GGUF 文本和视觉推理。
* **持久化系统提示词和预设。** 自定义系统提示词和聊天预设现在会在重新加载和页面切换后保留。
* **GGUF 导出扩展。** 完整微调（不仅仅是 LoRA/PEFT）现在可以导出为 GGUF。基础模型解析更可靠，不支持的导出选项会在界面中禁用。
* **聊天滚动/布局修复。** 修复了生成期间的滚动位置问题、思考面板布局偏移，以及折叠推理面板时的视口跳动。
* **更智能的端口冲突检测。** Unsloth 现在可检测回环冲突，在可能时可识别阻塞进程，并提供更清晰的备用端口消息。
  {% endupdate %}

{% update date="2026-03-17" tags="fixes,improvements" %}

## 新的工具调用 + Windows 稳定性

* Claude Artifacts 现已可用，因此 HTML 可以像贪吃蛇游戏一样在聊天中执行
* 工具调用准确率提高 30%，尤其是对小模型 + 工具调用计时器
* 工具 + 网页搜索输出可保存 + 可切换自动修复工具的开/关
* 多项 bug 修复 - Windows CPU 可用，Mac 更无缝，安装更快且更小
  {% endupdate %}
  {% endupdates %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/zh/xin/changelog.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
