Qwen3.5 微调指南
了解如何使用 Unsloth 微调 Qwen3.5 LLM。
你现在可以微调 Qwen3.5 模型家族(0.8B、2B、4B、9B、27B、35B‑A3B、122B‑A10B),使用 Unsloth。支持包括 视觉、文本和 RL 微调。 Qwen3.5‑35B‑A3B - bf16 LoRA 可在 74GB 显存
上使用。Unsloth 让 Qwen3.5 训练速度 快 1.5× ,并且比 FA2 配置使用 少 50% 的显存 。
Qwen3.5 bf16 LoRA 显存占用: 0.8B:3GB • 2B:5GB • 4B:10GB • 9B:22GB • 27B:56GB
微调 0.8B, 2B 和 4B 通过我们的 免费 Google Colab 笔记本进行 bf16 LoRA:
如果你想 保留推理 能力,你可以将推理风格示例与直接回答混合使用(至少保留 75% 的推理)。否则你可以完全输出。
全量微调(FFT) 也同样可行。注意这会使用 4 倍显存。
Qwen3.5 非常适合多语言微调,因为它支持 201 种语言。
我们有 A100 Colab 笔记本用于 Qwen3.5‑27B 和 Qwen3.5‑35B‑A3B.
如果你使用的是旧版本(或在本地微调),请先更新:
Unsloth Studio:
Unsloth 代码版:
pip install --upgrade --force-reinstall --no-cache-dir unsloth unsloth_zoo请使用 transformers v5 来运行 Qwen3.5。旧版本无法使用。Unsloth 现在会默认自动使用 transformers v5(Colab 环境除外)。
如果训练看起来 比平时更慢,那是因为 Qwen3.5 使用了自定义的 Mamba Triton 内核。编译这些内核可能比正常情况更久,尤其是在 T4 GPU 上。
不建议在 Qwen3.5 模型上进行 QLoRA(4-bit)训练,无论是 MoE 还是稠密模型,因为量化差异高于正常水平。
MoE 微调(35B、122B)
对于如下 MoE 模型 Qwen3.5‑35B‑A3B / 122B‑A10B / 397B‑A17B:
你可以使用我们的 Qwen3.5‑35B‑A3B(A100) 微调笔记本
支持我们最新的约 12 倍更快 MoE 训练更新 ,显存占用减少 >35%,上下文长度约提升 6 倍
最好使用 bf16 配置(例如 LoRA 或全量微调) (由于 BitsandBytes 的限制,不推荐 MoE QLoRA 4-bit)。
Unsloth 的 MoE 内核默认启用,并且可以使用不同后端;你可以通过
UNSLOTH_MOE_BACKEND.进行切换。为稳定起见,路由层微调默认已禁用。
Qwen3.5‑122B‑A10B - bf16 LoRA 可在 256GB 显存上运行。如果你使用多 GPU,请添加
device_map = "balanced"或者参考我们的 多 GPU 指南.
快速开始
🦥 Unsloth Studio 指南
Qwen3.5 可以在 Unsloth Studio中运行和微调,这是我们新的用于本地 AI 的开源 Web UI。借助 Unsloth Studio,你可以在本地运行模型,使用 MacOS、Windows、Linux 以及:

Unsloth Core(代码版)指南:
下面是一个最小的 SFT 配方(适用于“仅文本”微调)。另见我们的 视觉微调 部分。
如果出现 OOM:
降低
per_device_train_batch_size改为 1 和/或减少max_seq_length.保持
use_gradient_checkpointing="unsloth"开启(它旨在减少显存占用并延长上下文长度)。
MoE 加载示例(bf16 LoRA):
加载后,你会附加 LoRA 适配器,并以与上面的 SFT 示例类似的方式进行训练。
视觉微调
Unsloth 支持 视觉微调 用于多模态 Qwen3.5 模型。请使用下面的 Qwen3.5 笔记本,并将相应的模型名称改成你想要的 Qwen3.5 模型。
Qwen3-VL GRPO/GSPO RL 笔记本 (将模型名称改为 Qwen3.5-4B 等)
禁用视觉 / 仅文本微调:
为了微调视觉模型,我们现在允许你选择要微调模型的哪些部分。你可以只微调视觉层,或语言层,或注意力 / MLP 层!默认我们会全部开启!
为了使用多图像对 Qwen3.5 进行微调或训练, 查看我们的 多图像视觉指南.
强化学习(RL)
你现在可以使用 我们的免费笔记本:
来训练 Qwen3.5 的 RL、GSPO、GRPO 等,即使它不受 vLLM 支持,只要设置 fast_inference=False 在加载模型时:
保存 / 导出微调模型
你可以查看我们针对以下内容的特定推理 / 部署指南: Unsloth Studio, llama.cpp, vLLM, llama-server, Ollama.
保存为 GGUF
Unsloth 支持直接保存为 GGUF:
或者将 GGUF 推送到 Hugging Face:
如果导出的模型在其他运行时中表现更差,Unsloth 会指出最常见的原因: 推理时使用了错误的聊天模板 / EOS token (你必须使用训练时相同的聊天模板)。
保存为 vLLM
vLLM 版本 0.16.0 不支持 Qwen3.5。请等待 0.170 ,或者尝试 Nightly 版本。
若要为 vLLM 保存为 16-bit,请使用:
若只保存 LoRA 适配器,可使用:
或者使用我们的内置函数:
更多详情请阅读我们的推理指南:
最后更新于
这有帮助吗?




