For the complete documentation index, see llms.txt. This page is also available as Markdown.

Muse Glimmer : comment l'exécuter localement

Apprenez à exécuter le nouveau modèle Muse Glimmer 30B de Meta.

Muse Glimmer est le nouveau modèle à poids ouverts de Meta 30B paramètre modèle de vision dense, conçu pour des flux de travail agentiques et de codage locaux. C'est le premier modèle ouvert de Meta Superintelligence Labs, et il est publié sous la Apache 2.0 licence. Ce guide explique comment exécuter Muse Glimmer 30B avec Unsloth Dynamic des quantifications pour des performances maximales.

Muse Glimmer 30B s'exécute localement sur 18 Go de RAM/VRAM configurations, y compris les systèmes Mac et GPU/CPU. Vous pouvez exécuter ou affiner Muse Glimmer avec Unsloth. Nous avons collaboré avec Meta et Hugging Face sur l'implémentation de l'inférence llama.cpp. Merci à Meta d'avoir fourni à Unsloth une prise en charge dès le premier jour.

Tutoriels pour exécuter Muse GlimmerAffiner Muse Glimmer

Muse Glimmer 2 bits exécuté dans Unsloth

Guide d'utilisation

Muse Glimmer peut planifier des tâches en plusieurs étapes, exécuter des appels d'outils séquentiels, se remettre des échecs, s'adapter aux changements de conditions, utiliser la mémoire d'exécution et reprendre le travail entre des sessions de longue durée lorsque l'état est persisté. Cette persistance provient du cadre d'agent, pas du modèle. Avec prise en charge de la vision, Muse Glimmer est idéal pour les flux de travail multimodaux.

Configuration matérielle requise

Muse Glimmer 30B utilise environ 58 Go pour des poids BF16 en pleine précision. Les quantifications dynamiques d'Unsloth tentent de récupérer autant de précision que possible grâce à la quantification, permettant à Muse Glimmer 30B de fonctionner sur de plus petits appareils comme les RTX 5090, etc.

Tableau : exigences matérielles recommandées pour l'inférence GGUF de Muse Glimmer 30B (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée).

2 bits
3 bits
4 bits
6 bits
8 bits

12-14 Go

14-15 Go

17 Go

20-22 Go

34 Go

Tableau détaillé des exigences :

Quantification
RAM/VRAM recommandée :
Exemples de matériel

2 bits (UD-Q2_K_XL)

12-14+ Go

RTX 4080

3 bits (UD-Q3_K_XL)

14-15 Go+

RTX 4090

4 bits (UD-Q4_K_XL, NVFP4)

17 Go+

Mac 32 Go

6 bits (UD-Q6_K_XL)

20-22 Go+

RTX 5090, Mac 48 Go

8 bits (UD-Q8_K_XL)

34 Go+

Mac 128 Go, DGX Spark

BF16 (pleine précision)

58 Go+

Mac 128 Go, DGX Spark

En règle générale, votre mémoire totale disponible devrait au moins dépasser la taille du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, llama.cpp peut quand même s'exécuter en utilisant un déchargement partiel vers la RAM/disque, mais la génération sera plus lente. Vous aurez également besoin de plus de calcul, selon la fenêtre de contexte que vous utilisez.

Paramètres recommandés

Il est recommandé d'utiliser les paramètres Muse Glimmer par défaut de Meta :

  • temperature = 1.0

  • top_p = 0.95

  • top_k = 64

Longueur maximale du contexte : 131,072 (par défaut) jusqu'à 262,144

Paramètres de raisonnement

Muse Glimmer prend en charge des niveaux d'effort de raisonnement contrôlables, notamment :

  • faible

  • moyen

  • élevé

  • très élevé

Tutoriels pour exécuter Muse Glimmer

Comme Muse Glimmer 30B quantifié existe en plusieurs tailles, le point de départ recommandé pour les modèles est Dynamique 4 bits (UD . Muse Glimmer 30B GGUF.

🦥 Guide Unsloth🦙 Guide Llama.cpp

🦥 Guide Unsloth

Muse Glimmer 30B peut désormais être exécuté et affiné dans Unsloth Desktop, notre nouvelle application de bureau open source pour l'IA locale. Unsloth vous permet d'exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Unsloth fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, pour une installation manuelle :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancez Unsloth et recherchez et téléchargez Muse Glimmer

Au premier lancement, allez dans l'onglet Model hub et recherchez Muse Glimmer dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter Muse Glimmer

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Desktop, cependant vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur du contexte, le template de chat et d'autres paramètres. Vous pouvez exécuter des fichiers GGUF et MLX.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

4

Servir Muse Glimmer avec l'API Unsloth

Vous pouvez utiliser unsloth run la commande et servir Muse Glimmer via une API en utilisant llama-server des options d'exécution, notamment la taille du contexte, les couches GPU, le multithreading, l'échantillonnage, la mise en réseau et la configuration des outils. Pour plus d'infos, consultez notre documentation de l'API ou unsloth start.

5

Unsloth est maintenant prêt

Vous pouvez également faire de nombreuses autres choses avec Muse Glimmer via Unsloth Desktop, comme :

🦙 Guide Llama.cpp

Pour ce guide, nous utiliserons Dynamic 4 bits pour Muse Glimmer 30B. Voir : Collection Muse Glimmer 30B

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge Metal est activée par défaut.

2

Si vous souhaitez utiliser llama.cpp directement pour charger des modèles, vous pouvez suivre les commandes ci-dessous, selon chaque modèle. UD-Q4_K_XL est le type de quantification. Vous pouvez également télécharger via Hugging Face (étape 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Il n'est pas nécessaire de définir la longueur du contexte, car llama.cpp utilise automatiquement la quantité exacte requise.

3

Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir UD-Q4_K_XL ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub et XET

4

Puis exécutez le modèle en mode conversation (avec vision mmproj-F16):

5

Déploiement de Llama-server

Pour déployer Muse Glimmer 30B sur llama-server, utilisez :

🔧 Affiner

Vous pouvez désormais affiner Muse Glimmer-30B de Meta avec Unsloth sur une carte de 24 Go! Muse Glimmer est un modèle agentique multimodal de 30 milliards de paramètres optimisé pour un déploiement local.

Nous fournissons plusieurs notebooks Kaggle qui offrent 30 heures gratuites avec 2 GPU Tesla T4 !

Kaggle conversationnel Muse Glimmer

Benchmarks

Catégorie
Référence
Muse Glimmer-30B Raisonnement élevé
Mode de réflexion Gemma4-31B
Mode de réflexion Qwen3.6-27B

Agentique général

MCP Atlas (public)

75.5

54.2

62.5

Q&R DeepSearch

74.6

61.7

71.1

𝛕3-Banking

23.5

15.1

16.7

WildClawBench

47.6

37.6

43.2

GDPVal-AA v2

953

811

1141

Gaia2

43.3

36.4

40.0

SkillsBench (avec compétences)

44.3

32.4

46.6

OSWorld-Verified

65.9

58.5

75.6

Codage agentique

SWE-Bench Pro

51.2

36.9

50.2

SWE-Bench Verified

76.0

66.6

77.2

TerminalBench 2.1 (avec terminus2)

51.7

43.4

60.7

SciCode

43.6

43.4

39.8

Multimodal

Raisonnement Charxiv

78.8

77.7

78.4

ScreenSpot Pro

75.4

75.9

76.1

OmniDocBench v1.5

75.8

72.5

77.8

MMMU Pro

74

73

75

Sécurité

Mémoires CI

Violation (↓) : 26.4 Couverture : 64.8

Violation (↓) : 12.1 Couverture : 53.0

Violation (↓) : 53.4 Couverture : 66.9

Siren AgentDojo

Taux de réussite de l'attaque (↓) : 28.4 Utilité : 94.2

Taux de réussite de l'attaque (↓) : 25.6 Utilité : 90.8

Taux de réussite de l'attaque (↓) : 40.3 Utilité : 92.7

Capacités générales et raisonnement

IFBench

77.0

76.0

70.8

AIME 2026

94.7

89.2

94.1

GPQA Diamond (AA)

83.5

85.7

84.2

HLE Text (AA)

22.0

23.6

23.1

AA-LCR

80.0

68.3

73.3

Beam128K

65.1

58.2

63.0

Mis à jour

Ce contenu vous a-t-il été utile ?