Muse Glimmer : comment l'exécuter localement
Apprenez à exécuter le nouveau modèle Muse Glimmer 30B de Meta.
Muse Glimmer est le nouveau modèle à poids ouverts de Meta 30B paramètre modèle de vision dense, conçu pour des flux de travail agentiques et de codage locaux. C'est le premier modèle ouvert de Meta Superintelligence Labs, et il est publié sous la Apache 2.0 licence. Ce guide explique comment exécuter Muse Glimmer 30B avec Unsloth Dynamic des quantifications pour des performances maximales.
Muse Glimmer 30B s'exécute localement sur 18 Go de RAM/VRAM configurations, y compris les systèmes Mac et GPU/CPU. Vous pouvez exécuter ou affiner Muse Glimmer avec Unsloth. Nous avons collaboré avec Meta et Hugging Face sur l'implémentation de l'inférence llama.cpp. Merci à Meta d'avoir fourni à Unsloth une prise en charge dès le premier jour.

Guide d'utilisation
Muse Glimmer peut planifier des tâches en plusieurs étapes, exécuter des appels d'outils séquentiels, se remettre des échecs, s'adapter aux changements de conditions, utiliser la mémoire d'exécution et reprendre le travail entre des sessions de longue durée lorsque l'état est persisté. Cette persistance provient du cadre d'agent, pas du modèle. Avec prise en charge de la vision, Muse Glimmer est idéal pour les flux de travail multimodaux.
Configuration matérielle requise
Muse Glimmer 30B utilise environ 58 Go pour des poids BF16 en pleine précision. Les quantifications dynamiques d'Unsloth tentent de récupérer autant de précision que possible grâce à la quantification, permettant à Muse Glimmer 30B de fonctionner sur de plus petits appareils comme les RTX 5090, etc.
Tableau : exigences matérielles recommandées pour l'inférence GGUF de Muse Glimmer 30B (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée).
12-14 Go
14-15 Go
17 Go
20-22 Go
34 Go
Tableau détaillé des exigences :
2 bits (UD-Q2_K_XL)
12-14+ Go
RTX 4080
3 bits (UD-Q3_K_XL)
14-15 Go+
RTX 4090
4 bits (UD-Q4_K_XL, NVFP4)
17 Go+
Mac 32 Go
6 bits (UD-Q6_K_XL)
20-22 Go+
RTX 5090, Mac 48 Go
8 bits (UD-Q8_K_XL)
34 Go+
Mac 128 Go, DGX Spark
BF16 (pleine précision)
58 Go+
Mac 128 Go, DGX Spark
Paramètres recommandés
Il est recommandé d'utiliser les paramètres Muse Glimmer par défaut de Meta :
temperature = 1.0top_p = 0.95top_k = 64
Longueur maximale du contexte : 131,072 (par défaut) jusqu'à 262,144
Paramètres de raisonnement
Muse Glimmer prend en charge des niveaux d'effort de raisonnement contrôlables, notamment :
faible
moyen
élevé
très élevé
Tutoriels pour exécuter Muse Glimmer
Comme Muse Glimmer 30B quantifié existe en plusieurs tailles, le point de départ recommandé pour les modèles est Dynamique 4 bits (UD . Muse Glimmer 30B GGUF.
🦥 Guide Unsloth
Muse Glimmer 30B peut désormais être exécuté et affiné dans Unsloth Desktop, notre nouvelle application de bureau open source pour l'IA locale. Unsloth vous permet d'exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide CPU + GPU via llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Exécuter Muse Glimmer
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Desktop, cependant vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur du contexte, le template de chat et d'autres paramètres. Vous pouvez exécuter des fichiers GGUF et MLX.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

Servir Muse Glimmer avec l'API Unsloth
Vous pouvez utiliser unsloth run la commande et servir Muse Glimmer via une API en utilisant llama-server des options d'exécution, notamment la taille du contexte, les couches GPU, le multithreading, l'échantillonnage, la mise en réseau et la configuration des outils. Pour plus d'infos, consultez notre documentation de l'API ou unsloth start.
Unsloth est maintenant prêt
Vous pouvez également faire de nombreuses autres choses avec Muse Glimmer via Unsloth Desktop, comme :
Connecter des outils : Claude Code, Codex, recherche web, MCP et plus encore
Entraîner des modèles : Affiner du texte, de la diffusion, embeddings, et plus encore
Générer des médias : Créer et entraîner images, vidéo, synthèse vocale localement
🦙 Guide Llama.cpp
Pour ce guide, nous utiliserons Dynamic 4 bits pour Muse Glimmer 30B. Voir : Collection Muse Glimmer 30B
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge Metal est activée par défaut.
Si vous souhaitez utiliser llama.cpp directement pour charger des modèles, vous pouvez suivre les commandes ci-dessous, selon chaque modèle. UD-Q4_K_XL est le type de quantification. Vous pouvez également télécharger via Hugging Face (étape 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Il n'est pas nécessaire de définir la longueur du contexte, car llama.cpp utilise automatiquement la quantité exacte requise.
Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub et XET
Puis exécutez le modèle en mode conversation (avec vision mmproj-F16):
🔧 Affiner
Vous pouvez désormais affiner Muse Glimmer-30B de Meta avec Unsloth sur une carte de 24 Go! Muse Glimmer est un modèle agentique multimodal de 30 milliards de paramètres optimisé pour un déploiement local.
Nous fournissons plusieurs notebooks Kaggle qui offrent 30 heures gratuites avec 2 GPU Tesla T4 !
Kaggle Muse Glimmer Vision
Kaggle conversationnel Muse Glimmer
Benchmarks

Agentique général
MCP Atlas (public)
75.5
54.2
62.5
Q&R DeepSearch
74.6
61.7
71.1
𝛕3-Banking
23.5
15.1
16.7
WildClawBench
47.6
37.6
43.2
GDPVal-AA v2
953
811
1141
Gaia2
43.3
36.4
40.0
SkillsBench (avec compétences)
44.3
32.4
46.6
OSWorld-Verified
65.9
58.5
75.6
Codage agentique
SWE-Bench Pro
51.2
36.9
50.2
SWE-Bench Verified
76.0
66.6
77.2
TerminalBench 2.1 (avec terminus2)
51.7
43.4
60.7
SciCode
43.6
43.4
39.8
Multimodal
Raisonnement Charxiv
78.8
77.7
78.4
ScreenSpot Pro
75.4
75.9
76.1
OmniDocBench v1.5
75.8
72.5
77.8
MMMU Pro
74
73
75
Sécurité
Mémoires CI
Violation (↓) : 26.4 Couverture : 64.8
Violation (↓) : 12.1 Couverture : 53.0
Violation (↓) : 53.4 Couverture : 66.9
Siren AgentDojo
Taux de réussite de l'attaque (↓) : 28.4 Utilité : 94.2
Taux de réussite de l'attaque (↓) : 25.6 Utilité : 90.8
Taux de réussite de l'attaque (↓) : 40.3 Utilité : 92.7
Capacités générales et raisonnement
IFBench
77.0
76.0
70.8
AIME 2026
94.7
89.2
94.1
GPQA Diamond (AA)
83.5
85.7
84.2
HLE Text (AA)
22.0
23.6
23.1
AA-LCR
80.0
68.3
73.3
Beam128K
65.1
58.2
63.0
Mis à jour
Ce contenu vous a-t-il été utile ?

