Muse Glimmerファインチューニングガイド
UnslothでMetaのMuse Glimmer 30Bモデルを学習します。
Meta の Muse Glimmer 30B パラメータのエージェントモデルを使って、ファインチューニングと強化学習(RL)を行えます。 Unsloth。Muse Glimmer は視覚をサポートし、Unsloth を通じて 24GB VRAM でローカル学習でき、視覚・テキスト・音声・RL の学習をサポートします。
Unsloth で Muse Glimmer を 約1.5倍高速に かつ VRAM を約50%削減 FA2 構成よりも少ない(精度低下なし)
Muse Glimmer をファインチューニング 私たちの 無料 Kaggle ノートブックで:
Muse Glimmer は次の方法でも学習できます。 強化学習 (RL)を無料で、または 24GB VRAM で。
30B QLoRA は 24GB で動作し LoRA には 40GB 超が必要です
エクスポート/モデルの GGUF などへの保存 および フルファインチューニング (FFT) も動作します。
Muse Glimmer が収まるよう、次の最適化も含めて調整しました。
offload_embedding = Trueはembed_tokensを CPU RAM に保持し、検索された行だけを GPU に移動します。Muse Glimmer の入力埋め込みは 16 ビットで 202048 x 6656 なので、読み込み時に 2.5 GB を回復できます。なお現時点では単一 GPU でのみ動作します(マルチ GPU 構成は WIP)。動的 4-bit BnB 量子化によりモデルを 56GB から 21GB に圧縮し、24GB カードでのファインチューニングを可能にします。180 GiB の 1 枚カードで測定したところ、
max_seq_length = 1024、batch size 1、LoRA r=16 で、offload 有効時は読み込み後の重みが 18.22 GiB(無効時は 20.72 GiB)で、 ピーク予約容量は 22.57 GiB でした。現実的な最小値としては 24 GiB カードを想定してください。
クイックスタート
Muse Glimmer は、計画、ツール実行、マルチモーダル理解、長文コンテキスト推論を必要とする自律エージェント向けに設計された、専用の認識エンコーダを備えた密な因果 Transformer です。
推論能力を維持したい場合は、推論スタイルの例と直接回答を混ぜてください。短い回答だけで学習すると、マルチステップ推論性能が低下する可能性があります。
Muse Glimmer は 131K+ トークンまでの長いコンテキストをサポートしますが、まずは短いコンテキストからファインチューニングを始めてください。
ファインチューニング後は、ローカル推論用フォーマットとしてモデルを NVFP4、FP8、または GGUF にエクスポートできます。
無料ファインチューニング用ノートブック
以下を通じて Muse Glimmer を無料でファインチューニングするために Unsloth、私たちは複数の Kaggle ノートブックを用意しており、 2× Tesla T4 GPU で 30 時間の無料 GPU 使用が可能です。Kaggle は Google の製品で、Google Colab に似ており、自前の GPU ハードウェアがなくてもファインチューニングのワークフローを便利に実行できます。
Muse Glimmer ビジョン Kaggle
Muse Glimmer 対話型 Kaggle

強化学習 RL
無料の Tesla T4 x 2 Kaggle 環境で Muse Glimmer に GRPO / RL を実際に動かすことにも成功しました。かなりギリギリですが、動作します!
2 × 16GB T4 GPU では num_generations = 2, max_seq_length = 1536 かつ log-softmax に 128 行の上限を設けると、GPU VRAM は 4.10 GiB 必要です。同じ実行を 3072 トークンで行うと 7.57 GiB 必要になるため、収まりません。
次の明示的なデバイスマップを作成しました。 unsloth_zoo.device_map_planner。これにより、メイン GPU カード上の logit 用余裕も確保されます。
🦥 Unsloth ガイド
Muse Glimmer は、 Unsloth ローカル AI 向けの新しいオープンソース Web UI である Desktop で実行およびファインチューニングできます。
Unsloth Studio を使えば、次の環境でモデルをローカル実行できます。 MacOS、Windows、Linux、および NVIDIA GPU の学習。Intel、MLX、AMD の学習サポートは今月中に提供予定です。

Unsloth をインストール
最も簡単な始め方は、 Unsloth Desktop アプリをダウンロードすることです。 macOS, Windows、および Linux.
または、手動でインストールしたい場合は:
MacOS、Linux、WSL:
Windows PowerShell:
Muse Glimmer-30B の概要
パラメータ
約29.6B
層
52
隠れ次元
6656
アテンション
Local, Local, Local, Global の繰り返し
スライディングウィンドウ
2048
アテンションヘッド
32 Query / 2 KV
FFN
SwiGLU
コンテキスト長
131,072+
Vision Encoder
ViT-G/14(約1.8B パラメータ)
モダリティ
テキスト + 画像入力、テキスト出力
語彙
202,048 トークン
Muse Glimmer は次を使用します:
長文コンテキスト推論
ツール使用の計画
障害回復
マルチモーダル理解
エージェント用スキャフォールドとの互換性
制御可能な推論コスト
推奨ファインチューニング手法
LoRA ファインチューニング
ほとんどのユーザーには、LoRA が推奨される方法です。
利点:
VRAM 使用量が大幅に少ない
学習が高速
より小さいアダプタファイル
モデル共有が容易
ベースモデルの能力を維持
推奨の開始構成:
より難しいエージェントタスクでは:
まず小さく始め、必要な場合のみ増やしてください。
QLoRA ファインチューニング
GPU メモリが限られている場合は QLoRA が推奨されます。
Muse Glimmer は、量子化推論を含む効率的なローカル展開向けに設計されています。同じ原則により、QLoRA も実用的なファインチューニング手法になります。
次の場合に QLoRA を使用します:
コンシューマ向け GPU での学習
より大きなデータセットのファインチューニング
メモリ使用量を低く保つ
複数のアダプタを学習する
例:
マルチモーダルファインチューニング
Muse Glimmer には、画像理解のための専用認識エンコーダが含まれています。
ビジョンタスクでは:
最初は認識エンコーダを凍結したままにします。
まず言語層をファインチューニングします。
データセットに視覚適応が必要な場合のみ、ビジョンコンポーネントを学習します。
良いマルチモーダルデータセットには次が含まれます:
スクリーンショット理解
文書推論
グラフ解釈
GUI との対話
画像に基づくエージェントワークフロー
形式の例:
エージェント向けファインチューニング
Muse Glimmer は自律エージェントのワークフロー向けに最適化されています。
エージェント用データセットには次を含めます:
ツールの説明
正しい関数呼び出し
ツールの出力
失敗からの復旧
多段階計画の例
権限の処理
最終的なユーザー向け応答
例:
データセットの準備
Muse Glimmer は高品質な指示データセットで最もよく動作します。
推奨データセット:
複数ターン会話
ツール使用のトレース
コーディング課題
エージェントの軌跡
画像・言語の例
推論の例
避けるもの:
重複した例
低品質な生成回答
誤ったツール呼び出し
一貫性のない書式
推論を維持するには:
推論例を多様に保ってください。
最終回答を含めてください。
chain-of-thought の出力だけで学習するのは避けてください。
学習設定
良い開始構成:
推奨:
バッチサイズ
1-8
勾配蓄積
4-16
学習率
2e-4 LoRA
エポック数
1-3
オプティマイザ
AdamW
精度
BF16
長文コンテキスト学習では:
シーケンス長を段階的に増やします。
VRAM 使用量を監視します。
勾配チェックポイントを使用します。
推論ファインチューニング
Muse Glimmer は制御可能な推論強度をサポートします:
複雑なタスクでは:
コーディング → 高 / xhigh
エージェントワークフロー → 高 / xhigh
シンプルなアシスタント → 中
高速応答 → 低
推論モデルをファインチューニングする際は:
難しい例を含めます。
失敗例と修正例を含めます。
多段階タスクを含めます。
汎用能力を維持します。
ファインチューニング済みモデルのエクスポート
学習後、アダプタをエクスポートします:
LoRA アダプタを統合できます:
エクスポート形式には次が含まれます:
Hugging Face 形式
Safetensors
GGUF 互換形式
推論設定
推奨生成設定:
難しい推論タスクでは:
高速な会話では:
ハードウェア要件
Muse Glimmer はローカル展開向けに最適化されています。
おおよその要件:
LoRA
大容量メモリの GPU 推奨
QLoRA
シーケンス長によってはコンシューマ向け GPU でも可能
フルファインチューニング
マルチ GPU システム
モデル自体は量子化重みで効率的に動作でき、公開されている 4-bit 版は 24GB および 32GB のコンシューマ向けハードウェアを対象としています。
安全性ファインチューニング
Muse Glimmer をエージェントシステムに展開する際は:
ツール権限チェックを追加します。
外部アクションを検証します。
元に戻せない操作には確認を必須にします。
プロンプトインジェクション耐性をテストします。
プライバシーリスクを評価します。
推奨安全性データセット:
ツール悪用の例
権限境界
安全でない指示の処理
データ最小化の例
トラブルシューティング
メモリ不足
試すこと:
シーケンス長を短くする
LoRA ランクを下げる
4-bit 読み込みを有効にする
バッチサイズを小さくする
勾配チェックポイントを有効にする
モデル品質が低下する
試すこと:
学習率を下げる
学習エポック数を減らす
データセットの品質を向上させる
元の指示例を混ぜる
ツール呼び出しが不正確になる
追加:
より多くのツール呼び出し例
正しいスキーマ
失敗からの復旧例
マルチターンのワークフロー
最終更新
役に立ちましたか?




