For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.5 微调指南

了解如何使用 Unsloth 微调 Qwen3.5 LLM。

你现在可以微调 Qwen3.5 模型家族(0.8B、2B、4B、9B、27B、35B‑A3B、122B‑A10B),使用 Unsloth。支持包括 视觉、文本和 RL 微调。 Qwen3.5‑35B‑A3B - bf16 LoRA 可在 74GB 显存

  • 上使用。Unsloth 让 Qwen3.5 训练速度 快 1.5× ,并且比 FA2 配置使用 少 50% 的显存

  • Qwen3.5 bf16 LoRA 显存占用: 0.8B:3GB • 2B:5GB • 4B:10GB • 9B:22GB • 27B:56GB

  • 微调 0.8B, 2B 4B 通过我们的 免费 Google Colab 笔记本进行 bf16 LoRA:

  • 如果你想 保留推理 能力,你可以将推理风格示例与直接回答混合使用(至少保留 75% 的推理)。否则你可以完全输出。

  • 全量微调(FFT) 也同样可行。注意这会使用 4 倍显存。

  • Qwen3.5 非常适合多语言微调,因为它支持 201 种语言。

  • 微调后,你可以导出为 GGUF (用于 llama.cpp/Ollama 等)或 vLLM

  • 强化学习 (RL)用于 Qwen3.5 VLM RL 也可以通过 Unsloth 推理使用。

  • 我们有 A100 Colab 笔记本用于 Qwen3.5‑27BQwen3.5‑35B‑A3B.

如果你使用的是旧版本(或在本地微调),请先更新:

Unsloth Studio:

Unsloth 代码版:

pip install --upgrade --force-reinstall --no-cache-dir unsloth unsloth_zoo

MoE 微调(35B、122B)

对于如下 MoE 模型 Qwen3.5‑35B‑A3B / 122B‑A10B / 397B‑A17B:

  • 你可以使用我们的 Qwen3.5‑35B‑A3B(A100) 微调笔记本

  • 支持我们最新的约 12 倍更快 MoE 训练更新 ,显存占用减少 >35%,上下文长度约提升 6 倍

  • 最好使用 bf16 配置(例如 LoRA 或全量微调) (由于 BitsandBytes 的限制,不推荐 MoE QLoRA 4-bit)。

  • Unsloth 的 MoE 内核默认启用,并且可以使用不同后端;你可以通过 UNSLOTH_MOE_BACKEND.

  • 进行切换。为稳定起见,路由层微调默认已禁用。

  • Qwen3.5‑122B‑A10B - bf16 LoRA 可在 256GB 显存上运行。如果你使用多 GPU,请添加 device_map = "balanced" 或者参考我们的 多 GPU 指南.

快速开始

🦥 Unsloth Studio 指南

Qwen3.5 可以在 Unsloth Studio中运行和微调,这是我们新的用于本地 AI 的开源 Web UI。借助 Unsloth Studio,你可以在本地运行模型,使用 MacOS、Windows、Linux 以及:

1

安装 Unsloth

在你的终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://localhost:8888 并在浏览器中访问。

3

训练 Qwen3.5

首次启动时,你需要创建一个密码来保护账户,并在之后重新登录。然后你会看到一个简短的引导向导,用于选择模型、数据集和基本设置。你可以随时跳过它。

在搜索栏中搜索 Qwen3.5,并选择你想要的模型和数据集。接下来,按需调整超参数和上下文长度。

4

监控训练进度

点击开始训练后,你将能够监控并观察模型的训练进度。训练损失应该会稳步下降。 完成后,模型将自动保存。

5

导出你的微调模型

完成后,Unsloth Studio 允许你将模型导出为 GGUF、safetensor 等格式。

Unsloth Core(代码版)指南:

下面是一个最小的 SFT 配方(适用于“仅文本”微调)。另见我们的 视觉微调 部分。

Qwen3.5 是“带视觉编码器的因果语言模型”(它是一个统一的 VLM),因此请确保已安装常见的视觉依赖(torchvision, pillow),如有需要,并保持 Transformers 为最新版本。请为 Qwen3.5 使用最新的 Transformers。

如果你想进行 GRPO,只要禁用快速 vLLM 推理并改用 Unsloth 推理,它就能在 Unsloth 中工作。请参考我们的 视觉 RL 笔记本示例。

如果出现 OOM:

  • 降低 per_device_train_batch_size 改为 1 和/或减少 max_seq_length.

  • 保持 use_gradient_checkpointing="unsloth" 开启(它旨在减少显存占用并延长上下文长度)。

MoE 加载示例(bf16 LoRA):

加载后,你会附加 LoRA 适配器,并以与上面的 SFT 示例类似的方式进行训练。

视觉微调

Unsloth 支持 视觉微调 用于多模态 Qwen3.5 模型。请使用下面的 Qwen3.5 笔记本,并将相应的模型名称改成你想要的 Qwen3.5 模型。

禁用视觉 / 仅文本微调:

为了微调视觉模型,我们现在允许你选择要微调模型的哪些部分。你可以只微调视觉层,或语言层,或注意力 / MLP 层!默认我们会全部开启!

为了使用多图像对 Qwen3.5 进行微调或训练, 查看我们的 多图像视觉指南.

强化学习(RL)

你现在可以使用 我们的免费笔记本:

来训练 Qwen3.5 的 RL、GSPO、GRPO 等,即使它不受 vLLM 支持,只要设置 fast_inference=False 在加载模型时:

保存 / 导出微调模型

你可以查看我们针对以下内容的特定推理 / 部署指南: Unsloth Studio, llama.cpp, vLLM, llama-server, Ollama.

保存为 GGUF

Unsloth 支持直接保存为 GGUF:

或者将 GGUF 推送到 Hugging Face:

如果导出的模型在其他运行时中表现更差,Unsloth 会指出最常见的原因: 推理时使用了错误的聊天模板 / EOS token (你必须使用训练时相同的聊天模板)。

保存为 vLLM

若要为 vLLM 保存为 16-bit,请使用:

若只保存 LoRA 适配器,可使用:

或者使用我们的内置函数:

更多详情请阅读我们的推理指南:

最后更新于

这有帮助吗?