For the complete documentation index, see llms.txt. This page is also available as Markdown.

Muse Glimmer - Wie man lokal ausführt

Lerne, wie du das neue Muse-Glimmer-30B-Modell von Meta ausführst.

Muse Glimmer ist Metas neues Open-Weight 30B Parameter dichtes Vision-Modell, entwickelt für lokale agentische und Coding-Workflows. Es ist das erste offene Modell von Meta Superintelligence Labs und wird unter der Apache 2.0 -Lizenz veröffentlicht. Dieser Leitfaden behandelt das Ausführen von Muse Glimmer 30B mit Unsloth Dynamic Quants für maximale Leistung.

Muse Glimmer 30B läuft lokal auf 18 GB RAM/VRAM -Setups, einschließlich Mac- und GPU/CPU-Systemen. Sie können ausführen oder Muse Glimmer mit Unsloth. Wir haben mit Meta und Hugging Face an der llama.cpp-Inferenzimplementierung zusammengearbeitet. Vielen Dank an Meta für die Bereitstellung von Day-Zero-Support für Unsloth.

Muse Glimmer-Tutorials ausführenMuse Glimmer feinabstimmen

2-Bit Muse Glimmer, ausgeführt in Unsloth

Verwendungsleitfaden

Muse Glimmer kann mehrstufige Aufgaben planen, sequentielle Tool-Aufrufe ausführen, sich von Fehlern erholen, sich an veränderte Bedingungen anpassen, Laufzeitgedächtnis verwenden und die Arbeit über lang laufende Sitzungen hinweg fortsetzen, wenn der Zustand gespeichert wird. Diese Persistenz stammt vom Agenten-Harness, nicht vom Modell. Mit Vision-Unterstützung, ist Muse Glimmer ideal für multimodale Workflows.

Hardwareanforderungen

Muse Glimmer 30B benötigt etwa 58 GB für Gewichte in voller Präzision BF16. Unsloth Dynamic quants versuchen, durch Quantisierung so viel Genauigkeit wie möglich wiederherzustellen, sodass Muse Glimmer 30B auf kleineren Geräten wie RTX 5090s und so weiter passt.

Tabelle: Empfohlene Hardwareanforderungen für die Muse Glimmer 30B Inferenz GGUF (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher).

2-Bit
3-Bit
4-Bit
6-Bit
8-Bit

12-14 GB

14-15 GB

17 GB

20-22 GB

34 GB

Detaillierte Anforderungstabelle:

Quantisierung
Empfohlenes RAM/VRAM:
Hardwarebeispiele

2-Bit (UD-Q2_K_XL)

12-14+ GB

RTX 4080

3-Bit (UD-Q3_K_XL)

14-15 GB+

RTX 4090

4-Bit (UD-Q4_K_XL, NVFP4)

17 GB+

Mac 32GB

6-Bit (UD-Q6_K_XL)

20-22 GB+

RTX 5090, Mac 48GB

8-Bit (UD-Q8_K_XL)

34 GB+

Mac 128GB, DGX Spark

BF16 (volle Präzision)

58 GB+

Mac 128GB, DGX Spark

Als Faustregel sollte Ihr insgesamt verfügbarer Speicher die Größe des quantisierten Modells, das Sie herunterladen, mindestens übertreffen. Wenn dies nicht der Fall ist, kann llama.cpp weiterhin mit teilweisem RAM-/Festplatten-Offloading ausgeführt werden, die Generierung wird jedoch langsamer sein. Außerdem benötigen Sie je nach dem von Ihnen verwendeten Kontextfenster mehr Rechenleistung.

Empfohlene Einstellungen

Es wird empfohlen, Metas Standardparameter für Muse Glimmer zu verwenden:

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Maximale Kontextlänge: 131,072 (Standard) bis zu 262,144

Denk-Einstellungen

Muse Glimmer unterstützt steuerbaren Denkaufwand, einschließlich:

  • niedrig

  • mittel

  • hoch

  • xhoch

Muse Glimmer-Tutorials ausführen

Da quantisierte Muse Glimmer 30B in mehreren Größen erhältlich ist, ist der empfohlene Ausgangspunkt für die Modelle Dynamic 4-Bit (UD . Muse Glimmer 30B GGUFs.

🦥 Unsloth-Leitfaden🦙 Llama.cpp-Leitfaden

🦥 Unsloth-Leitfaden

Muse Glimmer 30B kann jetzt in Unsloth Desktop, unserer neuen Open-Source-Desktop-App für lokale KI, ausgeführt und feinabgestimmt werden. Unsloth ermöglicht es Ihnen, Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Unsloth läuft auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, für die manuelle Installation:

MacOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten und Muse Glimmer suchen und herunterladen

Beim ersten Start gehen Sie zur Registerkarte Model Hub und suchen Sie in der Suchleiste nach Muse Glimmer und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter.

3

Muse Glimmer ausführen

Inferenzparameter sollten bei Verwendung von Unsloth Desktop automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten. Sie können GGUFs und MLX-Dateien ausführen.

Weitere Informationen finden Sie in unserem Unsloth-Inferenzleitfaden.

4

Muse Glimmer mit der Unsloth-API bereitstellen

Sie können den Befehl unsloth run verwenden und Muse Glimmer über eine API bereitstellen mit llama-server Laufzeitflags, einschließlich Kontextgröße, GPU-Ebenen, Threading, Sampling, Netzwerken und Tool-Konfiguration. Weitere Informationen finden Sie in unseren API-Dokumenten oder unsloth start.

5

Unsloth ist jetzt bereit

Sie können mit Muse Glimmer über Unsloth Desktop auch viele andere Dinge tun, wie:

🦙 Llama.cpp-Leitfaden

Für diesen Leitfaden verwenden wir Dynamic 4-Bit für Muse Glimmer 30B. Siehe: Muse Glimmer 30B-Sammlung

1

Die neueste llama.cpp auf GitHub hier. Sie können auch die folgenden Build-Anweisungen befolgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple Mac / Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie den folgenden Befehlen entsprechend jedem Modell folgen. UD-Q4_K_XL ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Schritt 3). Dies ähnelt ollama run . Verwenden Sie export LLAMA_CACHE="folder" um llama.cpp zu erzwingen, dass

3

Sie können das Modell auch manuell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Sie können UD-Q4_K_XL oder andere quantisierte Versionen wie Q8_0 wählen. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Konversationsmodus aus (mit Vision mmproj-F16):

5

Llama-Server-Bereitstellung

Um Muse Glimmer 30B auf llama-server bereitzustellen, verwenden Sie:

🔧 Feinabstimmen

Sie können Metas Muse Glimmer-30B jetzt mit Unsloth auf einer 24GB-Kartefeinabstimmen! Muse Glimmer ist ein multimodales agentisches Modell mit 30B Parametern, das für den lokalen Einsatz optimiert ist.

Wir stellen mehrere Kaggle-Notebooks bereit, die 30 Stunden kostenlos mit 2x Tesla T4-GPUs bieten!

Muse Glimmer Konversations-Kaggle

Benchmarks

Kategorie
Benchmark
Muse Glimmer-30B Hohe Schlussfolgerungsleistung
Gemma4-31B Denkmodus
Qwen3.6-27B Denkmodus

Allgemein agentisch

MCP Atlas (öffentlich)

75.5

54.2

62.5

DeepSearch QA

74.6

61.7

71.1

𝛕3-Banking

23.5

15.1

16.7

WildClawBench

47.6

37.6

43.2

GDPVal-AA v2

953

811

1141

Gaia2

43.3

36.4

40.0

SkillsBench (mit Skills)

44.3

32.4

46.6

OSWorld-verifiziert

65.9

58.5

75.6

Agentisches Coding

SWE-Bench Pro

51.2

36.9

50.2

SWE-Bench verifiziert

76.0

66.6

77.2

TerminalBench 2.1 (mit terminus2)

51.7

43.4

60.7

SciCode

43.6

43.4

39.8

Multimodal

Charxiv-Schlussfolgerung

78.8

77.7

78.4

ScreenSpot Pro

75.4

75.9

76.1

OmniDocBench v1.5

75.8

72.5

77.8

MMMU Pro

74

73

75

Sicherheit

CI-Erinnerungen

Verstoß (↓): 26.4 Abdeckung: 64.8

Verstoß (↓): 12.1 Abdeckung: 53.0

Verstoß (↓): 53.4 Abdeckung: 66.9

Siren AgentDojo

Angriffserfolgsrate (↓): 28.4 Nützlichkeit: 94.2

Angriffserfolgsrate (↓): 25.6 Nützlichkeit: 90.8

Angriffserfolgsrate (↓): 40.3 Nützlichkeit: 92.7

Allgemeine Fähigkeiten und Schlussfolgerung

IFBench

77.0

76.0

70.8

AIME 2026

94.7

89.2

94.1

GPQA Diamond (AA)

83.5

85.7

84.2

HLE Text (AA)

22.0

23.6

23.1

AA-LCR

80.0

68.3

73.3

Beam128K

65.1

58.2

63.0

Zuletzt aktualisiert

War das hilfreich?