Leitfaden zur Feinabstimmung von Muse Glimmer
Trainiere Metas Muse-Glimmer-30B-Modell mit Unsloth.
Sie können jetzt mit Metas agentischem Modell Muse Glimmer mit 30 Mrd. Parametern Feintuning und Reinforcement Learning (RL) über Unsloth. Muse Glimmer unterstützt Vision und trainiert lokal mit 24 GB VRAM über Unsloth mit Unterstützung für Vision, Text, Audio und RL-Training.
Unsloth trainiert Muse Glimmer ca. 1,5× schneller mit ca. 50 % weniger VRAM als FA2-Setups (kein Genauigkeitsverlust)
Muse Glimmer feinabstimmen über unsere kostenlosen Kaggle-Notebooks:
Sie können Muse Glimmer auch mit Reinforcement Learning (RL) kostenlos oder auf 24 GB VRAM trainieren.
30B QLoRA funktioniert mit 24 GB und LoRA benötigt >40 GB
Exportieren/Speichern von Modellen in GGUF usw. und vollständiges Feintuning (FFT) funktioniert ebenfalls.
Wir haben Muse Glimmer außerdem optimiert, damit sie passt, einschließlich dieser Optimierungen:
offload_embedding = Truebehältembed_tokensim CPU-RAM und verschiebt nur die nachgeschlagenen Zeilen auf die GPU. Das Eingabe-Embedding von Muse Glimmer ist 202048 x 6656 in 16 Bit, wodurch beim Laden 2,5 GB zurückgewonnen werden – funktioniert derzeit nur auf einer einzelnen GPU (WIP für Multi-GPU-Setups)Dynamische 4-Bit-BnB-Quantisierungen, die das Modell von 56 GB auf 21 GB komprimieren und Feintunes auf 24-GB-Karten ermöglichen! Gemessen auf einer einzelnen 180-GiB-Karte bei
max_seq_length = 1024, Batchgröße 1, LoRA r=16: Gewichte 18,22 GiB nach dem Laden mit aktiviertem Offload (20,72 GiB ohne), und 22,57 GiB maximal reserviert während des Trainings. Planen Sie eine 24-GiB-Karte als realistische Mindestvoraussetzung ein.
Schnellstart
Muse Glimmer ist ein dichter kausaler Transformer mit einem dedizierten Wahrnehmungs-Encoder, der für autonome Agenten entwickelt wurde, die Planung, Werkzeugausführung, multimodales Verständnis und langkontextuelles Schlussfolgern benötigen.
Wenn Sie die Schlussfolgerungsfähigkeit erhalten möchten, mischen Sie Beispiele im Reasoning-Stil mit direkten Antworten. Vermeiden Sie es, nur auf kurze Antworten zu trainieren, da dies die Leistung beim mehrstufigen Schlussfolgern verringern kann.
Muse Glimmer unterstützt lange Kontexte von bis zu 131K+ Tokens, aber beginnen Sie das Feintuning zunächst mit kürzeren Kontexten.
Nach dem Feintuning können Sie Ihr Modell für lokale Inferenzformate nach NVFP4, FP8 oder GGUF exportieren.
Kostenlose Feintuning-Notebooks
Für kostenloses Muse-Glimmer-Feintuning über Unsloth, bieten wir mehrere Kaggle-Notebooks an, die 30 Stunden kostenlose GPU-Nutzung mit 2× Tesla T4-GPUs. Kaggle ist ein Google-Produkt, ähnlich wie Google Colab, und bietet eine bequeme Möglichkeit, Feintuning-Workflows auszuführen, ohne eigene GPU-Hardware zu benötigen.
Muse Glimmer Vision Kaggle
Muse Glimmer Dialog Kaggle

Reinforcement Learning RL
Wir haben Muse Glimmer auch erfolgreich dazu gebracht, GRPO / RL in einer kostenlosen Tesla-T4-x-2-Kaggle-Umgebung auszuführen – es passt gerade so, funktioniert aber!
Auf 2 x 16-GB-T4-GPUs num_generations = 2, max_seq_length = 1536 und einer Obergrenze von 128 Zeilen für den Log-Softmax benötigt 4,10 GiB GPU-VRAM. Derselbe Lauf mit 3072 Tokens benötigt 7,57 GiB und passt daher nicht.
Wir haben eine explizite Device-Map mit unsloth_zoo.device_map_plannererstellt, die ebenfalls den Logit-Spielraum auf der Haupt-GPU-Karte reserviert.
🦥 Unsloth-Leitfaden
Muse Glimmer kann ausgeführt und feinabgestimmt werden in Unsloth Desktop, unserer neuen Open-Source-Weboberfläche für lokale KI.
Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und NVIDIA-GPUs trainieren. Unterstützung für Intel-, MLX- und AMD-Training kommt noch in diesem Monat.

Unsloth installieren
Der einfachste Einstieg ist der Download der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.
Oder, wenn Sie die manuelle Installation bevorzugen:
macOS, Linux, WSL:
Windows PowerShell:
Muse Glimmer trainieren
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Anschließend sehen Sie einen kurzen Einrichtungsassistenten zur Auswahl eines Modells, Datensatzes und der Grundeinstellungen. Sie können ihn jederzeit überspringen.
Suchen Sie in der Suchleiste nach Muse Glimmer und wählen Sie das gewünschte Modell und den gewünschten Datensatz aus. Passen Sie anschließend Ihre Hyperparameter und die Kontextlänge nach Wunsch an.
Überblick über Muse Glimmer-30B
Parameter
~29,6 Mrd.
Schichten
52
Verborgene Dimension
6656
Aufmerksamkeit
Lokale, lokale, lokale, globale Wiederholung
Gleitfenster
2048
Attention-Köpfe
32 Query / 2 KV
FFN
SwiGLU
Kontextlänge
131,072+
Vision-Encoder
ViT-G/14 (~1,8 Mrd. Parameter)
Modalitäten
Text- und Bildeingabe, Textausgabe
Vokabular
202.048 Tokens
Muse Glimmer verwendet:
langkontextuelles Schlussfolgern
Planung des Werkzeugeinsatzes
Fehlerbehebung
Multimodales Verständnis
Kompatibilität mit Agenten-Frameworks
Steuerbarer Denkaufwand
Empfohlene Feintuning-Methode
LoRA-Feintuning
Für die meisten Nutzer ist LoRA der empfohlene Ansatz.
Vorteile:
Deutlich geringerer VRAM-Bedarf
Schnelleres Training
Kleinere Adapter-Dateien
Einfaches Teilen des Modells
Erhält die Fähigkeiten des Basismodells
Empfohlene Startkonfiguration:
Für schwierigere agentische Aufgaben:
Beginnen Sie kleiner und erhöhen Sie nur, wenn erforderlich.
QLoRA-Feintuning
QLoRA wird empfohlen, wenn der GPU-Speicher begrenzt ist.
Muse Glimmer wurde für eine effiziente lokale Bereitstellung einschließlich quantisierter Inferenz entwickelt. Dieselben Prinzipien machen QLoRA zu einem praktischen Feintuning-Ansatz.
Verwenden Sie QLoRA, wenn:
Training auf Consumer-GPUs
Feinabstimmung größerer Datensätze
Den Speicherverbrauch niedrig halten
Training mehrerer Adapter
Beispiel:
Multimodales Feintuning
Muse Glimmer enthält einen dedizierten Wahrnehmungs-Encoder für das Bildverständnis.
Für Vision-Aufgaben:
Den Wahrnehmungs-Encoder zunächst einfrieren.
Zuerst die Sprachschichten feinabstimmen.
Trainieren Sie die Vision-Komponenten nur, wenn Ihr Datensatz eine visuelle Anpassung erfordert.
Gute multimodale Datensätze umfassen:
Screenshot-Verständnis
Dokumenten-Schlussfolgern
Diagramm-Interpretation
GUI-Interaktion
Auf Bildern basierende Agenten-Workflows
Beispielformat:
Agentisches Feintuning
Muse Glimmer ist für autonome Agenten-Workflows optimiert.
Für Agenten-Datensätze fügen Sie hinzu:
Werkzeugbeschreibungen
Korrekte Funktionsaufrufe
Werkzeugausgaben
Wiederherstellung nach Fehlern
Beispiele für mehrstufige Planung
Umgang mit Berechtigungen
Finale nutzerseitige Antworten
Beispiel:
Datensatzvorbereitung
Muse Glimmer funktioniert am besten mit hochwertigen Instruktionsdatensätzen.
Empfohlene Datensätze:
Mehrturn-Gespräche
Werkzeugeinsatz-Verläufe
Programmieraufgaben
Agenten-Trajektorien
Vision-Sprach-Beispiele
Schlussfolgerungsbeispiele
Vermeiden Sie:
Doppelte Beispiele
Hochwertig generierte Antworten
Falsche Funktionsaufrufe
Inkonsistente Formatierung
Zur Bewahrung des Schlussfolgens:
Halten Sie die Schlussfolgerungsbeispiele vielfältig.
Fügen Sie endgültige Antworten hinzu.
Vermeiden Sie es, ausschließlich auf Chain-of-Thought-Ausgaben zu trainieren.
Trainings-Einstellungen
Eine gute Startkonfiguration:
Empfohlen:
Batchgröße
1-8
Gradientenakkumulation
4-16
Lernrate
2e-4 LoRA
Epochen
1-3
Optimierer
AdamW
Präzision
BF16
Für das Training mit langem Kontext:
Erhöhen Sie die Sequenzlänge schrittweise.
Überwachen Sie die VRAM-Nutzung.
Verwenden Sie Gradienten-Checkpointing.
Feintuning für Schlussfolgerungen
Muse Glimmer unterstützt steuerbare Schlussfolgerungsstärke:
Für komplexe Aufgaben:
Programmierung → hoch/xhoch
Agenten-Workflows → hoch/xhoch
Einfache Assistenten → mittel
Schnelle Antworten → niedrig
Beim Feintuning von Schlussfolgerungsmodellen:
Nehmen Sie schwierige Beispiele auf.
Nehmen Sie Fehler und Korrekturen auf.
Nehmen Sie mehrstufige Aufgaben auf.
Bewahren Sie die allgemeinen Fähigkeiten.
Ihr feinabgestimmtes Modell exportieren
Exportieren Sie nach dem Training Ihren Adapter:
Sie können LoRA-Adapter zusammenführen:
Exportformate können Folgendes umfassen:
Hugging-Face-Format
Safetensors
GGUF-kompatible Formate
Inferenz-Einstellungen
Empfohlene Generierungseinstellungen:
Für schwierige Schlussfolgerungsaufgaben:
Für schnelle Gespräche:
Hardwareanforderungen
Muse Glimmer ist für die lokale Bereitstellung optimiert.
Ungefähre Anforderungen:
LoRA
GPU mit hohem Speicherbedarf empfohlen
QLoRA
Consumer-GPUs möglich, abhängig von der Sequenzlänge
Vollständiges Feintuning
Multi-GPU-Systeme
Das Modell selbst kann effizient mit quantisierten Gewichten ausgeführt werden, wobei veröffentlichte 4-Bit-Varianten auf 24-GB- und 32-GB-Consumer-Hardware abzielen.
Sicherheits-Feintuning
Beim Bereitstellen von Muse Glimmer in agentischen Systemen:
Fügen Sie Prüfungen für Werkzeugberechtigungen hinzu.
Validieren Sie externe Aktionen.
Verlangen Sie eine Bestätigung für irreversible Vorgänge.
Testen Sie die Widerstandsfähigkeit gegen Prompt-Injection.
Bewerten Sie Datenschutzrisiken.
Empfohlene Sicherheitsdatensätze:
Beispiele für Werkzeugmissbrauch
Berechtigungsgrenzen
Umgang mit unsicheren Anweisungen
Beispiele zur Datenminimierung
Fehlerbehebung
Speicher voll
Versuchen Sie:
Sequenzlänge reduzieren
LoRA-Rang verringern
4-Bit-Laden aktivieren
Batchgröße reduzieren
Gradienten-Checkpointing aktivieren
Modellqualität sinkt
Versuchen Sie:
Lernrate reduzieren
Trainiere über weniger Epochen
Erhöhe die Datensatzqualität
Mische ursprüngliche Instruktionsbeispiele
Werkzeugaufrufe werden falsch
Hinzufügen:
Mehr Beispiele für Werkzeugaufrufe
Korrekte Schemata
Beispiele zur Fehlerbehebung
Mehrturn-Workflows
Zuletzt aktualisiert
War das hilfreich?




