For the complete documentation index, see llms.txt. This page is also available as Markdown.

Muse Glimmerファインチューニングガイド

UnslothでMetaのMuse Glimmer 30Bモデルを学習します。

Meta の Muse Glimmer 30B パラメータのエージェントモデルを使って、ファインチューニングと強化学習(RL)を行えます。 Unsloth。Muse Glimmer は視覚をサポートし、Unsloth を通じて 24GB VRAM でローカル学習でき、視覚・テキスト・音声・RL の学習をサポートします。

  • Unsloth で Muse Glimmer を 約1.5倍高速に かつ VRAM を約50%削減 FA2 構成よりも少ない(精度低下なし)

  • Muse Glimmer をファインチューニング 私たちの 無料 Kaggle ノートブックで:

  • Muse Glimmer は次の方法でも学習できます。 強化学習 (RL)を無料で、または 24GB VRAM で。

  • 30B QLoRA は 24GB で動作し LoRA には 40GB 超が必要です

  • エクスポート/モデルの GGUF などへの保存 および フルファインチューニング (FFT) も動作します。

Muse Glimmer が収まるよう、次の最適化も含めて調整しました。

  • offload_embedding = Trueembed_tokens を CPU RAM に保持し、検索された行だけを GPU に移動します。Muse Glimmer の入力埋め込みは 16 ビットで 202048 x 6656 なので、読み込み時に 2.5 GB を回復できます。なお現時点では単一 GPU でのみ動作します(マルチ GPU 構成は WIP)。

  • 動的 4-bit BnB 量子化によりモデルを 56GB から 21GB に圧縮し、24GB カードでのファインチューニングを可能にします。180 GiB の 1 枚カードで測定したところ、 max_seq_length = 1024、batch size 1、LoRA r=16 で、offload 有効時は読み込み後の重みが 18.22 GiB(無効時は 20.72 GiB)で、 ピーク予約容量は 22.57 GiB でした。現実的な最小値としては 24 GiB カードを想定してください。

クイックスタート

Muse Glimmer は、計画、ツール実行、マルチモーダル理解、長文コンテキスト推論を必要とする自律エージェント向けに設計された、専用の認識エンコーダを備えた密な因果 Transformer です。

  • 推論能力を維持したい場合は、推論スタイルの例と直接回答を混ぜてください。短い回答だけで学習すると、マルチステップ推論性能が低下する可能性があります。

  • Muse Glimmer は 131K+ トークンまでの長いコンテキストをサポートしますが、まずは短いコンテキストからファインチューニングを始めてください。

  • ファインチューニング後は、ローカル推論用フォーマットとしてモデルを NVFP4、FP8、または GGUF にエクスポートできます。

無料ファインチューニング用ノートブック

以下を通じて Muse Glimmer を無料でファインチューニングするために Unsloth、私たちは複数の Kaggle ノートブックを用意しており、 2× Tesla T4 GPU で 30 時間の無料 GPU 使用が可能です。Kaggle は Google の製品で、Google Colab に似ており、自前の GPU ハードウェアがなくてもファインチューニングのワークフローを便利に実行できます。

Muse Glimmer ビジョン Kaggle

Muse Glimmer 対話型 Kaggle

強化学習 RL

無料の Tesla T4 x 2 Kaggle 環境で Muse Glimmer に GRPO / RL を実際に動かすことにも成功しました。かなりギリギリですが、動作します!

2 × 16GB T4 GPU では num_generations = 2, max_seq_length = 1536 かつ log-softmax に 128 行の上限を設けると、GPU VRAM は 4.10 GiB 必要です。同じ実行を 3072 トークンで行うと 7.57 GiB 必要になるため、収まりません。

次の明示的なデバイスマップを作成しました。 unsloth_zoo.device_map_planner。これにより、メイン GPU カード上の logit 用余裕も確保されます。

Muse Glimmer 用 強化学習 Kaggle 無料ノートブック

🦥 Unsloth ガイド

Muse Glimmer は、 Unsloth ローカル AI 向けの新しいオープンソース Web UI である Desktop で実行およびファインチューニングできます。

Unsloth Studio を使えば、次の環境でモデルをローカル実行できます。 MacOS、Windows、Linux、および NVIDIA GPU の学習。Intel、MLX、AMD の学習サポートは今月中に提供予定です。

1

Unsloth をインストール

最も簡単な始め方は、 Unsloth Desktop アプリをダウンロードすることです。 macOS, Windows、および Linux.

Unsloth をダウンロード

または、手動でインストールしたい場合は:

MacOS、Linux、WSL:

Windows PowerShell:

2

Muse glimmer を学習する

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。その後、モデル、データセット、基本設定を選ぶ簡単な初期設定ウィザードが表示されます。いつでもスキップできます。

検索バーで Muse Glimmer を検索し、希望するモデルとデータセットを選択します。次に、ハイパーパラメータやコンテキスト長を必要に応じて調整します。

3

学習の進捗を監視

学習開始をクリックすると、モデルの学習進捗を監視・確認できます。学習損失は着実に減少しているはずです。 完了すると、モデルは自動的に保存されます。

4

ファインチューニングしたモデルをエクスポート

完了後、Unsloth Studio ではモデルを GGUF、safetensor などの形式にエクスポートできます。

5

ファインチューニング済みモデルと元のモデルを比較

をクリック 比較モード して LoRA アダプタと元のモデルを比較します。

Muse Glimmer-30B の概要

モデルアーキテクチャ
認識エンコーダ付きの密な因果 Transformer

パラメータ

約29.6B

52

隠れ次元

6656

アテンション

Local, Local, Local, Global の繰り返し

スライディングウィンドウ

2048

アテンションヘッド

32 Query / 2 KV

FFN

SwiGLU

コンテキスト長

131,072+

Vision Encoder

ViT-G/14(約1.8B パラメータ)

モダリティ

テキスト + 画像入力、テキスト出力

語彙

202,048 トークン

Muse Glimmer は次を使用します:

  • 長文コンテキスト推論

  • ツール使用の計画

  • 障害回復

  • マルチモーダル理解

  • エージェント用スキャフォールドとの互換性

  • 制御可能な推論コスト

推奨ファインチューニング手法

LoRA ファインチューニング

ほとんどのユーザーには、LoRA が推奨される方法です。

利点:

  • VRAM 使用量が大幅に少ない

  • 学習が高速

  • より小さいアダプタファイル

  • モデル共有が容易

  • ベースモデルの能力を維持

推奨の開始構成:

より難しいエージェントタスクでは:

まず小さく始め、必要な場合のみ増やしてください。

QLoRA ファインチューニング

GPU メモリが限られている場合は QLoRA が推奨されます。

Muse Glimmer は、量子化推論を含む効率的なローカル展開向けに設計されています。同じ原則により、QLoRA も実用的なファインチューニング手法になります。

次の場合に QLoRA を使用します:

  • コンシューマ向け GPU での学習

  • より大きなデータセットのファインチューニング

  • メモリ使用量を低く保つ

  • 複数のアダプタを学習する

例:


マルチモーダルファインチューニング

Muse Glimmer には、画像理解のための専用認識エンコーダが含まれています。

ビジョンタスクでは:

  • 最初は認識エンコーダを凍結したままにします。

  • まず言語層をファインチューニングします。

  • データセットに視覚適応が必要な場合のみ、ビジョンコンポーネントを学習します。

良いマルチモーダルデータセットには次が含まれます:

  • スクリーンショット理解

  • 文書推論

  • グラフ解釈

  • GUI との対話

  • 画像に基づくエージェントワークフロー

形式の例:

エージェント向けファインチューニング

Muse Glimmer は自律エージェントのワークフロー向けに最適化されています。

エージェント用データセットには次を含めます:

  • ツールの説明

  • 正しい関数呼び出し

  • ツールの出力

  • 失敗からの復旧

  • 多段階計画の例

  • 権限の処理

  • 最終的なユーザー向け応答

例:

データセットの準備

Muse Glimmer は高品質な指示データセットで最もよく動作します。

推奨データセット:

  • 複数ターン会話

  • ツール使用のトレース

  • コーディング課題

  • エージェントの軌跡

  • 画像・言語の例

  • 推論の例

避けるもの:

  • 重複した例

  • 低品質な生成回答

  • 誤ったツール呼び出し

  • 一貫性のない書式

推論を維持するには:

  • 推論例を多様に保ってください。

  • 最終回答を含めてください。

  • chain-of-thought の出力だけで学習するのは避けてください。

学習設定

良い開始構成:

推奨:

設定

バッチサイズ

1-8

勾配蓄積

4-16

学習率

2e-4 LoRA

エポック数

1-3

オプティマイザ

AdamW

精度

BF16

長文コンテキスト学習では:

  • シーケンス長を段階的に増やします。

  • VRAM 使用量を監視します。

  • 勾配チェックポイントを使用します。

推論ファインチューニング

Muse Glimmer は制御可能な推論強度をサポートします:

複雑なタスクでは:

  • コーディング → 高 / xhigh

  • エージェントワークフロー → 高 / xhigh

  • シンプルなアシスタント → 中

  • 高速応答 → 低

推論モデルをファインチューニングする際は:

  • 難しい例を含めます。

  • 失敗例と修正例を含めます。

  • 多段階タスクを含めます。

  • 汎用能力を維持します。

ファインチューニング済みモデルのエクスポート

学習後、アダプタをエクスポートします:

LoRA アダプタを統合できます:

エクスポート形式には次が含まれます:

  • Hugging Face 形式

  • Safetensors

  • GGUF 互換形式

推論設定

推奨生成設定:

難しい推論タスクでは:

高速な会話では:

ハードウェア要件

Muse Glimmer はローカル展開向けに最適化されています。

おおよその要件:

学習方法
ハードウェア

LoRA

大容量メモリの GPU 推奨

QLoRA

シーケンス長によってはコンシューマ向け GPU でも可能

フルファインチューニング

マルチ GPU システム

モデル自体は量子化重みで効率的に動作でき、公開されている 4-bit 版は 24GB および 32GB のコンシューマ向けハードウェアを対象としています。

安全性ファインチューニング

Muse Glimmer をエージェントシステムに展開する際は:

  • ツール権限チェックを追加します。

  • 外部アクションを検証します。

  • 元に戻せない操作には確認を必須にします。

  • プロンプトインジェクション耐性をテストします。

  • プライバシーリスクを評価します。

推奨安全性データセット:

  • ツール悪用の例

  • 権限境界

  • 安全でない指示の処理

  • データ最小化の例

トラブルシューティング

メモリ不足

試すこと:

  • シーケンス長を短くする

  • LoRA ランクを下げる

  • 4-bit 読み込みを有効にする

  • バッチサイズを小さくする

  • 勾配チェックポイントを有効にする

モデル品質が低下する

試すこと:

  • 学習率を下げる

  • 学習エポック数を減らす

  • データセットの品質を向上させる

  • 元の指示例を混ぜる

ツール呼び出しが不正確になる

追加:

  • より多くのツール呼び出し例

  • 正しいスキーマ

  • 失敗からの復旧例

  • マルチターンのワークフロー

最終更新

役に立ちましたか?