Muse Glimmer - ローカルでの実行方法
Metaの新しいMuse Glimmer 30Bモデルを実行する方法を学びましょう。
Muse Glimmer は Meta の新しいオープンウェイト 30B パラメータ 密なビジョンモデルで、ローカルなエージェント的ワークフローやコーディングワークフロー向けに設計されています。これは Meta Superintelligence Labs からの最初のオープンモデルであり、 Apache 2.0 ライセンスで公開されています。このガイドでは、Muse Glimmer 30B を Unsloth Dynamic 量子化で最大性能を引き出して実行する方法を説明します。
Muse Glimmer 30B はローカルで 18GB の RAM/VRAM 構成で動作します。Mac や GPU/CPU システムも含みます。 実行 または Muse Glimmer を Unslothでファインチューニングできます。llama.cpp の推論実装では Meta および Hugging Face と協力しました。Unsloth に day-zero サポートを提供してくれた Meta に感謝します。

使用ガイド
Muse Glimmer は複数ステップのタスクを計画し、順次のツール呼び出しを実行し、失敗から復旧し、条件の変化に適応し、ランタイムメモリを使用し、状態が永続化されていれば長時間セッションをまたいで作業を再開できます。この永続化はモデルではなくエージェントハーネスによるものです。を使うと ビジョンサポートがあるため、Muse Glimmer はマルチモーダルなワークフローに最適です。
ハードウェア要件
Muse Glimmer 30B は約 BF16 のフル精度重みで 58 GB を使用します。 Unsloth Dynamic の量子化は、量子化によって可能な限り精度を回復し、Muse Glimmer 30B を RTX 5090 などのより小さなデバイスで動作させられるようにします。
表: Muse Glimmer 30B 推論 GGUF の推奨ハードウェア要件 (単位 = 総メモリ: RAM + VRAM、またはユニファイドメモリ)。
12~14 GB
14~15 GB
17 GB
20~22 GB
34 GB
詳細要件表:
2-bit(UD-Q2_K_XL)
12~14 GB以上
RTX 4080
3-bit(UD-Q3_K_XL)
14~15 GB以上
RTX 4090
4-bit(UD-Q4_K_XL, NVFP4)
17 GB以上
Mac 32GB
6-bit(UD-Q6_K_XL)
20~22 GB以上
RTX 5090, Mac 48GB
8-bit(UD-Q8_K_XL)
34 GB以上
Mac 128GB, DGX Spark
BF16(フル精度)
58 GB以上
Mac 128GB, DGX Spark
推奨設定
Meta の Muse Glimmer のデフォルトパラメータを使用することを推奨します:
temperature = 1.0top_p = 0.95top_k = 64
最大コンテキスト長: 131,072 (既定)最大 262,144
思考設定
Muse Glimmer は以下を含む制御可能な推論努力をサポートします:
低
中
高
超高
Muse Glimmer チュートリアルを実行
量子化された Muse Glimmer 30B は複数のサイズで提供されるため、モデルの推奨開始点は Dynamic 4-bit(UD です。Muse Glimmer 30B GGUF.
🦥 Unsloth ガイド
Muse Glimmer 30B は、ローカル AI 向けの新しいオープンソースデスクトップアプリ Unsloth Desktop で、実行およびファインチューニングできるようになりました。Unsloth を使うと、モデルをローカルで MacOS、Windows、Linux で以下を行えます:
検索、ダウンロード、 GGUF を実行 および safetensor モデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-p など)
llama.cpp による高速 CPU + GPU 推論
LLM を学習 VRAM を 70% 削減して 2 倍高速

Muse Glimmer を実行
Unsloth Desktop を使うと推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。GGUF ファイルと MLX ファイルを実行できます。
詳細については、 Unsloth 推論ガイド.

Unsloth API で Muse Glimmer を提供
を使用できます unsloth run コマンドを使い、 llama-server のランタイムフラグを使って、コンテキストサイズ、GPU レイヤー、スレッディング、サンプリング、ネットワーキング、ツール設定を含む形で API 経由で Muse Glimmer を提供できます。詳細は API ドキュメント または unsloth start.
🦙 Llama.cpp ガイド
このガイドでは、Muse Glimmer 30B に Dynamic 4-bit を使用します。以下を参照してください: Muse Glimmer 30B コレクション
最新の llama.cpp を GitHub でこちらから取得してください。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON を -DGGML_CUDA=OFF に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合です。 Apple Mac / Metal デバイスでは、 -DGGML_CUDA=OFF を設定し、その後は通常どおり続行してください。Metal サポートは既定で有効です。
もし llama.cpp を直接使ってモデルを読み込む場合は、各モデルに応じて以下のコマンドに従ってください。 UD-Q4_K_XL は量子化タイプです。Hugging Face からもダウンロードできます(手順 3)。これは ollama run に似ています。 export LLAMA_CACHE="folder" を使って llama.cpp を特定の場所に保存するよう強制できます。llama.cpp は必要な正確な量を自動的に使用するため、コンテキスト長を設定する必要はありません。
以下のコードでも手動でモデルをダウンロードできます( pip install huggingface_hubをインストールした後)。 UD-Q4_K_XL または、 Q8_0 のような他の量子化版を選べます。ダウンロードが止まる場合は、以下を参照してください: Hugging Face Hub、XET デバッグ
その後、会話モードでモデルを実行します(ビジョン mmproj-F16):
🔧 ファインチューニング
Meta の Muse Glimmer-30B を Unsloth を使って今すぐファインチューニングできます。 24GB カード! Muse Glimmer は、ローカル展開向けに最適化された 30B パラメータのマルチモーダル・エージェントモデルです。
Tesla T4 GPU 2 枚で 30 時間無料で使える Kaggle ノートブックを複数提供しています!
Muse Glimmer Vision Kaggle
Muse Glimmer Conversational Kaggle
ベンチマーク

一般エージェント的
MCP Atlas(公開)
75.5
54.2
62.5
DeepSearch QA
74.6
61.7
71.1
𝛕3-Banking
23.5
15.1
16.7
WildClawBench
47.6
37.6
43.2
GDPVal-AA v2
953
811
1141
Gaia2
43.3
36.4
40.0
SkillsBench(スキルあり)
44.3
32.4
46.6
OSWorld-Verified
65.9
58.5
75.6
エージェント的コーディング
SWE-Bench Pro
51.2
36.9
50.2
SWE-Bench Verified
76.0
66.6
77.2
TerminalBench 2.1(terminus2 付き)
51.7
43.4
60.7
SciCode
43.6
43.4
39.8
マルチモーダル
Charxiv 推論
78.8
77.7
78.4
ScreenSpot Pro
75.4
75.9
76.1
OmniDocBench v1.5
75.8
72.5
77.8
MMMU Pro
74
73
75
安全性
CI Memories
違反(↓):26.4 カバレッジ:64.8
違反(↓): 12.1 カバレッジ:53.0
違反(↓):53.4 カバレッジ: 66.9
Siren AgentDojo
攻撃成功率(↓):28.4 有用性: 94.2
攻撃成功率(↓): 25.6 有用性:90.8
攻撃成功率(↓):40.3 有用性:92.7
一般的な能力と推論
IFBench
77.0
76.0
70.8
AIME 2026
94.7
89.2
94.1
GPQA Diamond(AA)
83.5
85.7
84.2
HLE Text(AA)
22.0
23.6
23.1
AA-LCR
80.0
68.3
73.3
Beam128K
65.1
58.2
63.0
最終更新
役に立ちましたか?

