For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌠Qwen3-VL:如何运行指南

了解如何使用 Unsloth 在本地微调和运行 Qwen3-VL。

Qwen3-VL 是 Qwen 的新视觉模型,具有 指令思考 版本。2B、4B、8B 和 32B 模型是稠密模型,而 30B 和 235B 是 MoE。235B 思考 LLM 提供 SOTA 视觉和编码性能,可与 GPT-5(high)和 Gemini 2.5 Pro 媲美。 Qwen3-VL 具备视觉、视频和 OCR 能力,以及 256K 上下文(可扩展至 1M)。 Unsloth 支持 Qwen3-VL 微调和 RL。使用我们的 notebooks.

运行 Qwen3-VL微调 Qwen3-VL

🖥️ 运行 Qwen3-VL

要在 llama.cpp、vLLM、Ollama 等中运行该模型,推荐设置如下:

⚙️ 推荐设置

Qwen 为两个模型都推荐这些设置(Instruct 与 Thinking 略有不同):

Instruct 设置:
Thinking 设置:

Temperature = 0.7

Temperature = 1.0

Top_P = 0.8

Top_P = 0.95

presence_penalty = 1.5

presence_penalty = 0.0

输出长度 = 32768(最多 256K)

输出长度 = 40960(最多 256K)

Top_K = 20

Top_K = 20

Qwen3-VL 还使用了下面这些设置来得到他们的基准测试结果,如所提到的 在 GitHub 上.

Instruct 设置:

export greedy='false'
export seed=3407
export top_p=0.8
export top_k=20
export temperature=0.7
export repetition_penalty=1.0
export presence_penalty=1.5
export out_seq_length=32768

Thinking 设置:

export greedy='false'
export seed=1234
export top_p=0.95
export top_k=20
export temperature=1.0
export repetition_penalty=1.0
export presence_penalty=0.0
export out_seq_length=40960

🐛聊天模板修复

在 Unsloth,我们最重视准确性,所以我们调查了为什么在运行 Thinking 模型的第二轮后,llama.cpp 会崩溃,如下所示:

错误代码:

terminate called after throwing an instance of 'std::runtime_error'
  what():  值不可调用:第 63 行,第 78 列处为 null:
            {%- if '</think>' in content %}
                {%- set reasoning_content = ((content.split('</think>')|first).rstrip('\n').split('<think>')|last).lstrip('\n') %}
                                                                             ^

我们已经成功修复了 VL 模型的 Thinking 聊天模板,因此我们重新上传了所有 Thinking 量化版本以及 Unsloth 的量化版本。现在它们都应该能在第二轮对话后正常工作 - 其他量化版本将在第二轮对话后加载失败。

Qwen3-VL Unsloth 上传:

自 2025 年 10 月 30 日起,llama.cpp 已支持 Qwen3-VL 的 GGUF,因此你现在可以在本地运行它们!

📖 Llama.cpp:运行 Qwen3-VL 教程

  1. 获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续 - Metal 支持默认已开启。

  1. 先获取一张图片! 你也可以上传图片。我们将使用 https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png,这只是我们的迷你标志,展示了 finetunes 是如何由 Unsloth 制作的:

  1. 让我们下载这张图片

  1. 然后,让我们使用 llama.cpp 的自动模型下载功能,8B Instruct 模型可以尝试这样:

  1. 进入后,你会看到下面的界面:

  1. 通过以下方式加载图片 /image PATH/image unsloth.png 然后按 ENTER

  1. 当你按下 ENTER 时,它会显示“unsloth.png image loaded”

  1. 现在让我们问一个问题,比如“这是什么图片?”:

  1. 现在通过以下方式加载图片 2 /image picture.png 然后按下 ENTER 并询问“这是什么图片?”

  1. 最后让我们问一下这两张图片之间有什么关系(它有效!)

  1. 你也可以通过(在安装后)下载模型 pip install huggingface_hub hf_transfer )HuggingFace 的 snapshot_download 这对于大型模型下载很有用, 因为 llama.cpp 的自动下载器可能会变慢。 你可以选择 Q4_K_M,或其他量化版本。

  1. 运行模型并尝试任意提示词。 对于 Instruct:

  1. 对于 Thinking:

🪄运行 Qwen3-VL-235B-A22B 和 Qwen3-VL-30B-A3B

对于 Qwen3-VL-235B-A22B,我们将使用 llama.cpp 进行优化推理,并提供大量选项。

  1. 我们沿用与上面类似的步骤,不过这次还需要执行额外步骤,因为模型非常大。

  2. 通过以下方式下载模型(在安装后) pip install huggingface_hub hf_transfer )。你可以选择 UD-Q2_K_XL,或其他量化版本。。

  3. 运行模型并尝试一个提示词。为 Thinking 与 Instruct 设置正确的参数。

Instruct:

Thinking:

  1. 编辑, --ctx-size 16384 用于上下文长度, --n-gpu-layers 99 用于将多少层卸载到 GPU。如果你的 GPU 显存不足,请尝试调整它。如果你只有 CPU 推理,也请移除它。

🐋 Docker:运行 Qwen3-VL

如果你已经安装了 Docker desktop,要从 Hugging Face 运行 Unsloth 的模型,只需运行下面的命令即可:

或者你也可以运行 Docker 上已上传的 Qwen3-VL 模型:

🦥 微调 Qwen3-VL

Unsloth 支持对 Qwen3-VL 进行微调和强化学习(RL),包括更大的 32B 和 235B 模型。这还包括对视频和目标检测微调的支持。和往常一样,Unsloth 使 Qwen3-VL 模型训练速度提高 1.7 倍,显存占用减少 60%,上下文长度扩大 8 倍且没有准确率下降。 我们制作了两个 Qwen3-VL(8B)训练笔记本,你可以在 Colab 上免费训练:

GRPO 笔记本的目标是让一个视觉语言模型在给定如下图所示的图像输入时,通过 RL 解决数学问题:

这项 Qwen3-VL 支持还集成了我们最新的更新,使 RL 更省内存、更快速,其中包括我们的 待机功能,与其他实现相比,它能独特地限制速度下降。你可以通过我们的 VLM GRPO 指南.

多图训练

为了使用多张图片对 Qwen3-VL 进行微调或训练,最直接的更改是将

改为:

使用 map 会触发数据集标准化和 arrow 处理规则,而这些规则可能更严格,也更复杂。

最后更新于

这有帮助吗?