Muse Glimmer - Wie man lokal ausführt
Lerne, wie du das neue Muse-Glimmer-30B-Modell von Meta ausführst.
Muse Glimmer ist Metas neues Open-Weight 30B Parameter dichtes Vision-Modell, entwickelt für lokale agentische und Coding-Workflows. Es ist das erste offene Modell von Meta Superintelligence Labs und wird unter der Apache 2.0 -Lizenz veröffentlicht. Dieser Leitfaden behandelt das Ausführen von Muse Glimmer 30B mit Unsloth Dynamic Quants für maximale Leistung.
Muse Glimmer 30B läuft lokal auf 18 GB RAM/VRAM -Setups, einschließlich Mac- und GPU/CPU-Systemen. Sie können ausführen oder Muse Glimmer mit Unsloth. Wir haben mit Meta und Hugging Face an der llama.cpp-Inferenzimplementierung zusammengearbeitet. Vielen Dank an Meta für die Bereitstellung von Day-Zero-Support für Unsloth.

Verwendungsleitfaden
Muse Glimmer kann mehrstufige Aufgaben planen, sequentielle Tool-Aufrufe ausführen, sich von Fehlern erholen, sich an veränderte Bedingungen anpassen, Laufzeitgedächtnis verwenden und die Arbeit über lang laufende Sitzungen hinweg fortsetzen, wenn der Zustand gespeichert wird. Diese Persistenz stammt vom Agenten-Harness, nicht vom Modell. Mit Vision-Unterstützung, ist Muse Glimmer ideal für multimodale Workflows.
Hardwareanforderungen
Muse Glimmer 30B benötigt etwa 58 GB für Gewichte in voller Präzision BF16. Unsloth Dynamic quants versuchen, durch Quantisierung so viel Genauigkeit wie möglich wiederherzustellen, sodass Muse Glimmer 30B auf kleineren Geräten wie RTX 5090s und so weiter passt.
Tabelle: Empfohlene Hardwareanforderungen für die Muse Glimmer 30B Inferenz GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher).
12-14 GB
14-15 GB
17 GB
20-22 GB
34 GB
Detaillierte Anforderungstabelle:
2-Bit (UD-Q2_K_XL)
12-14+ GB
RTX 4080
3-Bit (UD-Q3_K_XL)
14-15 GB+
RTX 4090
4-Bit (UD-Q4_K_XL, NVFP4)
17 GB+
Mac 32GB
6-Bit (UD-Q6_K_XL)
20-22 GB+
RTX 5090, Mac 48GB
8-Bit (UD-Q8_K_XL)
34 GB+
Mac 128GB, DGX Spark
BF16 (volle Präzision)
58 GB+
Mac 128GB, DGX Spark
Empfohlene Einstellungen
Es wird empfohlen, Metas Standardparameter für Muse Glimmer zu verwenden:
temperature = 1.0top_p = 0.95top_k = 64
Maximale Kontextlänge: 131,072 (Standard) bis zu 262,144
Denk-Einstellungen
Muse Glimmer unterstützt steuerbaren Denkaufwand, einschließlich:
niedrig
mittel
hoch
xhoch
Muse Glimmer-Tutorials ausführen
Da quantisierte Muse Glimmer 30B in mehreren Größen erhältlich ist, ist der empfohlene Ausgangspunkt für die Modelle Dynamic 4-Bit (UD . Muse Glimmer 30B GGUFs.
🦥 Unsloth-Leitfaden
Muse Glimmer 30B kann jetzt in Unsloth Desktop, unserer neuen Open-Source-Desktop-App für lokale KI, ausgeführt und feinabgestimmt werden. Unsloth ermöglicht es Ihnen, Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilend Tool-Aufrufe + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-P usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Muse Glimmer ausführen
Inferenzparameter sollten bei Verwendung von Unsloth Desktop automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Sie können GGUFs und MLX-Dateien ausführen.
Weitere Informationen finden Sie in unserem Unsloth-Inferenzleitfaden.

Muse Glimmer mit der Unsloth-API bereitstellen
Sie können den Befehl unsloth run verwenden und Muse Glimmer über eine API bereitstellen mit llama-server Laufzeitflags, einschließlich Kontextgröße, GPU-Ebenen, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Informationen finden Sie in unseren API-Dokumenten oder unsloth start.
🦙 Llama.cpp-Leitfaden
Für diesen Leitfaden verwenden wir Dynamic 4-Bit für Muse Glimmer 30B. Siehe: Muse Glimmer 30B-Sammlung
Die neueste llama.cpp auf GitHub hier. Sie können auch die folgenden Build-Anweisungen befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie den folgenden Befehlen entsprechend jedem Modell folgen. UD-Q4_K_XL ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Schritt 3). Dies ähnelt ollama run . Verwenden Sie export LLAMA_CACHE="folder" um llama.cpp zu erzwingen, dass
Sie können das Modell auch manuell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Sie können UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 wählen. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Konversationsmodus aus (mit Vision mmproj-F16):
🔧 Feinabstimmen
Sie können Metas Muse Glimmer-30B jetzt mit Unsloth auf einer 24GB-Kartefeinabstimmen! Muse Glimmer ist ein multimodales agentisches Modell mit 30B Parametern, das für den lokalen Einsatz optimiert ist.
Wir stellen mehrere Kaggle-Notebooks bereit, die 30 Stunden kostenlos mit 2x Tesla T4-GPUs bieten!
Muse Glimmer Vision Kaggle
Muse Glimmer Konversations-Kaggle
Benchmarks

Allgemein agentisch
MCP Atlas (öffentlich)
75.5
54.2
62.5
DeepSearch QA
74.6
61.7
71.1
𝛕3-Banking
23.5
15.1
16.7
WildClawBench
47.6
37.6
43.2
GDPVal-AA v2
953
811
1141
Gaia2
43.3
36.4
40.0
SkillsBench (mit Skills)
44.3
32.4
46.6
OSWorld-verifiziert
65.9
58.5
75.6
Agentisches Coding
SWE-Bench Pro
51.2
36.9
50.2
SWE-Bench verifiziert
76.0
66.6
77.2
TerminalBench 2.1 (mit terminus2)
51.7
43.4
60.7
SciCode
43.6
43.4
39.8
Multimodal
Charxiv-Schlussfolgerung
78.8
77.7
78.4
ScreenSpot Pro
75.4
75.9
76.1
OmniDocBench v1.5
75.8
72.5
77.8
MMMU Pro
74
73
75
Sicherheit
CI-Erinnerungen
Verstoß (↓): 26.4 Abdeckung: 64.8
Verstoß (↓): 12.1 Abdeckung: 53.0
Verstoß (↓): 53.4 Abdeckung: 66.9
Siren AgentDojo
Angriffserfolgsrate (↓): 28.4 Nützlichkeit: 94.2
Angriffserfolgsrate (↓): 25.6 Nützlichkeit: 90.8
Angriffserfolgsrate (↓): 40.3 Nützlichkeit: 92.7
Allgemeine Fähigkeiten und Schlussfolgerung
IFBench
77.0
76.0
70.8
AIME 2026
94.7
89.2
94.1
GPQA Diamond (AA)
83.5
85.7
84.2
HLE Text (AA)
22.0
23.6
23.1
AA-LCR
80.0
68.3
73.3
Beam128K
65.1
58.2
63.0
Zuletzt aktualisiert
War das hilfreich?

