> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/zh/mo-xing/muse-glimmer/train.md).

# Muse Glimmer 微调指南

您现在可以通过以下方式使用 Meta 的 Muse Glimmer 30B 参数智能体模型进行微调和强化学习（RL）： [Unsloth](https://github.com/unslothai/unsloth)。Muse Glimmer 支持视觉功能，并可通过 Unsloth 在本地 24GB VRAM 上训练，同时支持视觉、文本、音频和 RL 训练。

* Unsloth 训练 Muse Glimmer **快约 1.5 倍** ，仅需 **约少 50% 的 VRAM** 相比 FA2 配置（无精度损失）
* 微调 Muse Glimmer 通过我们的 **免费** **Kaggle 笔记本**:

| [**视觉 + 文本**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-Vision.ipynb\&accelerator=nvidiaTeslaT4) | [**RL GRPO**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-GRPO.ipynb\&accelerator=nvidiaTeslaT4) | [**对话式**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-Conversational.ipynb\&accelerator=nvidiaTeslaT4) |
| ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |

* 您还可以通过以下方式训练 Muse Glimmer： [强化学习](#reinforcement-learning-rl) （RL）免费或在 24GB VRAM 上进行。
* **30B QLoRA 可在 24GB 上运行** 而 LoRA 需要超过 40GB
* **导出**/将模型保存为 GGUF 等格式。 以及 完整微调 **（FFT）** 也可以正常工作。

我们还对 Muse Glimmer 进行了优化，使其能够适配，包括以下优化：

* `offload_embedding = True` 会将 `embed_tokens` 保留在 CPU RAM 中，只将查找到的行移到 GPU。Muse Glimmer 的输入嵌入为 202048 x 6656，16 位精度，因此在加载时可释放 2.5 GB——目前仅适用于单 GPU（多 GPU 配置仍在开发中）
* 动态 4 位 BnB 量化，可将模型从 56GB 压缩到 21GB，从而让 24GB 显卡也能微调！在一张 180 GiB 显卡上测得： `max_seq_length = 1024`，batch size 为 1，LoRA r=16：开启卸载后加载后的权重为 18.22 GiB（未开启时为 20.72 GiB），并且 **训练过程中峰值保留为 22.57 GiB** 。对于现实可行的最低配置，请预留 24 GiB 显卡。

### 快速开始

Muse Glimmer 是一种稠密因果 Transformer，带有专用感知编码器，专为需要规划、工具执行、多模态理解和长上下文推理的自主智能体而设计。

* 如果您希望保留推理能力，请将推理风格的示例与直接回答混合使用。避免只训练简短回答，因为这可能会降低多步推理性能。
* Muse Glimmer 支持长达 131K+ tokens 的长上下文，但请先从较短上下文开始微调。
* 微调后，您可以将模型导出为 NVFP4、FP8 或 GGUF 以用于本地推理格式。

### 免费微调笔记本

用于通过以下方式免费微调 Muse Glimmer： [Unsloth](https://github.com/unslothai/unsloth)，我们提供多个 Kaggle 笔记本，提供 **30 小时免费 GPU 使用时间，配备 2× Tesla T4 GPU**。Kaggle 是 Google 的产品，类似于 Google Colab，提供了一种无需自有 GPU 硬件即可运行微调工作流的便捷方式。

| [**视觉 + 文本**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-Vision.ipynb\&accelerator=nvidiaTeslaT4) | [**RL GRPO**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-GRPO.ipynb\&accelerator=nvidiaTeslaT4) | [**对话式**](https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_\(30B\)-Conversational.ipynb\&accelerator=nvidiaTeslaT4) |
| ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |

{% columns %}
{% column %}
Muse Glimmer **视觉** Kaggle

{% embed url="<https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_(30B)-Vision.ipynb&accelerator=nvidiaTeslaT4>" %}
{% endcolumn %}

{% column %}
Muse Glimmer **对话式** Kaggle

{% embed url="<https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_(30B)-Conversational.ipynb&accelerator=nvidiaTeslaT4>" %}
{% endcolumn %}
{% endcolumns %}

<figure><img src="/files/281e144ab6e4f886e8cc13791b7100ac053def93" alt=""><figcaption></figcaption></figure>

### 强化学习 RL

我们还成功让 Muse Glimmer 在免费的 Tesla T4 x2 Kaggle 环境中进行了 GRPO / RL——几乎刚好能放下，但确实可行！

在 2 张 16 GB T4 GPU 上 `num_generations = 2`, `max_seq_length = 1536` 以及对 log-softmax 的 128 行上限，需要 4.10 GiB 的 GPU VRAM。同样的运行在 3072 tokens 时需要 7.57 GiB，因此无法放下。

我们使用以下方式显式指定了设备映射： `unsloth_zoo.device_map_planner`，这也会在主 GPU 卡上预留 logits 空间。

{% embed url="<https://www.kaggle.com/notebooks/welcome?src=https://github.com/unslothai/notebooks/blob/main/nb/Kaggle-Muse_Glimmer_(30B)-GRPO.ipynb&accelerator=nvidiaTeslaT4>" %}
Muse Glimmer 强化学习 Kaggle 免费笔记本
{% endembed %}

{% code overflow="wrap" %}

```python
from unsloth_zoo.device_map_planner import plan_device_map_for_pretrained
_plan = plan_device_map_for_pretrained(
    MODEL_NAME,
    # 只看可用内存，不看总内存：CUDA 上下文已常驻
    max_memory = {i: torch.cuda.mem_get_info(i)[0] for i in range(_n)},
    rows_per_chunk = 128,                       # 与下面的 log-softmax 上限匹配
    retained_rows  = BATCH_SIZE * max_seq_length,
    softcapped = True, temperature_scaled = True,
)
```

{% endcode %}

### 🦥 Unsloth 指南

{% columns %}
{% column %}
Muse Glimmer 可在 [Unsloth](/docs/zh/xin-zeng/studio.md) Desktop，我们新的本地 AI 开源网页界面中运行和微调。

使用 Unsloth Studio，您可以在以下平台本地运行模型： **MacOS、Windows**、Linux，并训练 NVIDIA GPU。本月还将支持 Intel、MLX 和 AMD 训练。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/b2a3b63c5bcb7de0e73edfadea034e8836543429" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### 安装 Unsloth

最简单的入门方式是下载 [Unsloth Desktop 应用](/docs/zh/desktop.md)。可在以下系统上运行： [macOS](/docs/zh/kai-shi-shi-yong/install/mac.md), [Windows](/docs/zh/kai-shi-shi-yong/install/windows-installation.md)，以及 [Linux](/docs/zh/kai-shi-shi-yong/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">下载 Unsloth</a>

* <i class="fa-apple">:apple:</i> [下载 macOS 版本](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [下载 Windows 版本](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [下载 Linux 版本](https://unsloth.ai/download/linux)

或者，如果您更喜欢手动安装：

MacOS、Linux、WSL：

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell：

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### 训练 Muse Glimmer

首次启动时，您需要创建密码以保护账户安全，并在稍后重新登录。随后您会看到一个简短的上手向导，用于选择模型、数据集和基本设置。您可以随时跳过。

在搜索栏中搜索 Muse Glimmer，并选择您想要的模型和数据集。接下来，根据需要调整超参数和上下文长度。
{% endstep %}

{% step %}

#### 监控训练进度

点击开始训练后，您将能够监控并观察模型的训练进度。训练损失应持续下降。\
完成后，模型将自动保存。

<div data-with-frame="true"><figure><img src="/files/8307e19c6d02f6c28d84f5386706c3b37f958067" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### 导出您的微调模型

完成后，Unsloth Studio 允许您将模型导出为 GGUF、safetensor 等格式。

<div data-with-frame="true"><figure><img src="/files/d1130dc8880b70d1db60cadb771bd69c69088e90" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### 比较微调模型与原始模型

点击 `比较模式` 来比较 LoRA 适配器和原始模型。

<div data-with-frame="true"><figure><img src="/files/80d70deeeeff75ab5fc4b65e9206475c99471833" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

## Muse Glimmer-30B 概览

| 模型架构  | 带感知编码器的稠密因果 Transformer |
| ----- | ----------------------- |
| 参数    | 约 29.6B                 |
| 层数    | 52                      |
| 隐藏维度  | 6656                    |
| 注意力   | 局部、局部、局部、全局重复           |
| 滑动窗口  | 2048                    |
| 注意力头  | 32 Query / 2 KV         |
| FFN   | SwiGLU                  |
| 上下文长度 | 131,072+                |
| 视觉编码器 | ViT-G/14（约 1.8B 参数）     |
| 模态    | 文本 + 图像输入，文本输出          |
| 词表    | 202,048 个 token         |

Muse Glimmer 使用：

* 长上下文推理
* 工具使用规划
* 失败恢复
* 多模态理解
* 智能体脚手架兼容性
* 可控的推理强度

## 推荐的微调方法

### LoRA 微调

对于大多数用户，LoRA 是推荐方案。

优点：

* 更低的 VRAM 占用
* 更快的训练
* 更小的适配器文件
* 便于模型共享
* 保留基础模型能力

推荐的起始配置：

```python
r = 16
lora_alpha = 16
lora_dropout = 0
```

对于更困难的智能体任务：

```python
r = 32
lora_alpha = 32
```

先从较小值开始，只有在必要时再增加。

## QLoRA 微调

当 GPU 内存受限时，推荐使用 QLoRA。

Muse Glimmer 的设计目标是高效本地部署，包括量化推理。相同的原则也使 QLoRA 成为一种实用的微调方法。

在以下情况下使用 QLoRA：

* 在消费级 GPU 上训练
* 微调更大的数据集
* 保持低内存占用
* 训练多个适配器

示例：

```python
load_in_4bit = True
```

***

## 多模态微调

Muse Glimmer 包含一个专门用于图像理解的感知编码器。

对于视觉任务：

* 最初保持感知编码器冻结。
* 先微调语言层。
* 只有当数据集需要视觉适配时，才训练视觉组件。

良好的多模态数据集包括：

* 截图理解
* 文档推理
* 图表解读
* GUI 交互
* 基于图像的智能体工作流

示例格式：

```json
{
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "image",
          "image": "example.png"
        },
        {
          "type": "text",
          "text": "解释这张截图。"
        }
      ]
    },
    {
      "role": "assistant",
      "content": "这张截图显示……"
    }
  ]
}
```

## 智能体微调

Muse Glimmer 针对自主智能体工作流进行了优化。

对于智能体数据集，请包含：

* 工具说明
* 正确的函数调用
* 工具输出
* 从失败中恢复
* 多步规划示例
* 权限处理
* 面向最终用户的响应

示例：

```json
{
  "messages": [
    {
      "role": "user",
      "content": "找到我最新的报告并为我总结一下。"
    },
    {
      "role": "assistant",
      "content": "我将搜索您的文件。",
      "tool_calls": [
        {
          "name": "file_search",
          "arguments": {
            "query": "最新报告"
          }
        }
      ]
    }
  ]
}
```

## 数据集准备

Muse Glimmer 在高质量指令数据集上表现最佳。

推荐的数据集：

* 多轮对话
* 工具使用轨迹
* 编码任务
* 智能体轨迹
* 视觉-语言示例
* 推理示例

避免：

* 重复示例
* 低质量生成答案
* 错误的工具调用
* 格式不一致

对于保留推理能力：

* 保持推理示例多样化。
* 包含最终答案。
* 避免只训练链式思维输出。

## 训练设置

一个良好的起始配置：

```python
trainer = SFTTrainer(
    max_seq_length = 4096,
    packing = True,
)
```

推荐：

| 设置   | 值         |
| ---- | --------- |
| 批大小  | 1-8       |
| 梯度累积 | 4-16      |
| 学习率  | 2e-4 LoRA |
| 轮数   | 1-3       |
| 优化器  | AdamW     |
| 精度   | BF16      |

对于长上下文训练：

* 逐步增加序列长度。
* 监控 VRAM 使用情况。
* 使用梯度检查点。

## 推理微调

Muse Glimmer 支持可控的推理强度：

```
推理强度：低
推理强度：中
推理强度：高
推理强度：超高
```

对于复杂任务：

* 编码 → 高/超高
* 智能体工作流 → 高/超高
* 简单助手 → 中
* 快速响应 → 低

微调推理模型时：

* 包含困难示例。
* 包含失败和修正。
* 包含多步任务。
* 保留通用能力。

## 导出您的微调模型

训练完成后，导出您的适配器：

```python
model.save_pretrained("muse-glimmer-lora")
tokenizer.save_pretrained("muse-glimmer-lora")
```

您可以合并 LoRA 适配器：

```python
model.merge_and_unload()
```

导出格式可以包括：

* Hugging Face 格式
* Safetensors
* GGUF 兼容格式

## 推理设置

推荐的生成设置：

```python
temperature = 1.0
top_p = 0.95
top_k = 64
```

对于困难推理任务：

```
推理强度：高
```

对于快速对话：

```
推理强度：低
```

## 硬件要求

Muse Glimmer 针对本地部署进行了优化。

大致要求：

| 训练方式  | 硬件                  |
| ----- | ------------------- |
| LoRA  | 推荐高显存 GPU           |
| QLoRA | 消费级 GPU 也可以，取决于序列长度 |
| 完整微调  | 多 GPU 系统            |

该模型本身可以使用量化权重高效运行，已发布的 4 位版本面向 24GB 和 32GB 消费级硬件。

## 安全微调

在智能体系统中部署 Muse Glimmer 时：

* 添加工具权限检查。
* 验证外部操作。
* 对于不可逆操作，要求确认。
* 测试提示注入防护能力。
* 评估隐私风险。

推荐的安全数据集：

* 工具误用示例
* 权限边界
* 不安全指令处理
* 数据最小化示例

## 故障排除

### 内存不足

尝试：

* 降低序列长度
* 降低 LoRA 秩
* 启用 4 位加载
* 减小批大小
* 启用梯度检查点

### 模型质量下降

尝试：

* 降低学习率
* 训练更少的轮次
* 提高数据集质量
* 混合原始指令示例

### 工具调用变得不正确

添加：

* 更多工具调用示例
* 正确的 schema
* 故障恢复示例
* 多轮工作流


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/zh/mo-xing/muse-glimmer/train.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
