For the complete documentation index, see llms.txt. This page is also available as Markdown.

Leitfaden zur Feinabstimmung von Muse Glimmer

Trainiere Metas Muse-Glimmer-30B-Modell mit Unsloth.

Sie können jetzt mit Metas agentischem Modell Muse Glimmer mit 30 Mrd. Parametern Feintuning und Reinforcement Learning (RL) über Unsloth. Muse Glimmer unterstützt Vision und trainiert lokal mit 24 GB VRAM über Unsloth mit Unterstützung für Vision, Text, Audio und RL-Training.

  • Unsloth trainiert Muse Glimmer ca. 1,5× schneller mit ca. 50 % weniger VRAM als FA2-Setups (kein Genauigkeitsverlust)

  • Muse Glimmer feinabstimmen über unsere kostenlosen Kaggle-Notebooks:

  • Sie können Muse Glimmer auch mit Reinforcement Learning (RL) kostenlos oder auf 24 GB VRAM trainieren.

  • 30B QLoRA funktioniert mit 24 GB und LoRA benötigt >40 GB

  • Exportieren/Speichern von Modellen in GGUF usw. und vollständiges Feintuning (FFT) funktioniert ebenfalls.

Wir haben Muse Glimmer außerdem optimiert, damit sie passt, einschließlich dieser Optimierungen:

  • offload_embedding = True behält embed_tokens im CPU-RAM und verschiebt nur die nachgeschlagenen Zeilen auf die GPU. Das Eingabe-Embedding von Muse Glimmer ist 202048 x 6656 in 16 Bit, wodurch beim Laden 2,5 GB zurückgewonnen werden – funktioniert derzeit nur auf einer einzelnen GPU (WIP für Multi-GPU-Setups)

  • Dynamische 4-Bit-BnB-Quantisierungen, die das Modell von 56 GB auf 21 GB komprimieren und Feintunes auf 24-GB-Karten ermöglichen! Gemessen auf einer einzelnen 180-GiB-Karte bei max_seq_length = 1024, Batchgröße 1, LoRA r=16: Gewichte 18,22 GiB nach dem Laden mit aktiviertem Offload (20,72 GiB ohne), und 22,57 GiB maximal reserviert während des Trainings. Planen Sie eine 24-GiB-Karte als realistische Mindestvoraussetzung ein.

Schnellstart

Muse Glimmer ist ein dichter kausaler Transformer mit einem dedizierten Wahrnehmungs-Encoder, der für autonome Agenten entwickelt wurde, die Planung, Werkzeugausführung, multimodales Verständnis und langkontextuelles Schlussfolgern benötigen.

  • Wenn Sie die Schlussfolgerungsfähigkeit erhalten möchten, mischen Sie Beispiele im Reasoning-Stil mit direkten Antworten. Vermeiden Sie es, nur auf kurze Antworten zu trainieren, da dies die Leistung beim mehrstufigen Schlussfolgern verringern kann.

  • Muse Glimmer unterstützt lange Kontexte von bis zu 131K+ Tokens, aber beginnen Sie das Feintuning zunächst mit kürzeren Kontexten.

  • Nach dem Feintuning können Sie Ihr Modell für lokale Inferenzformate nach NVFP4, FP8 oder GGUF exportieren.

Kostenlose Feintuning-Notebooks

Für kostenloses Muse-Glimmer-Feintuning über Unsloth, bieten wir mehrere Kaggle-Notebooks an, die 30 Stunden kostenlose GPU-Nutzung mit 2× Tesla T4-GPUs. Kaggle ist ein Google-Produkt, ähnlich wie Google Colab, und bietet eine bequeme Möglichkeit, Feintuning-Workflows auszuführen, ohne eigene GPU-Hardware zu benötigen.

Reinforcement Learning RL

Wir haben Muse Glimmer auch erfolgreich dazu gebracht, GRPO / RL in einer kostenlosen Tesla-T4-x-2-Kaggle-Umgebung auszuführen – es passt gerade so, funktioniert aber!

Auf 2 x 16-GB-T4-GPUs num_generations = 2, max_seq_length = 1536 und einer Obergrenze von 128 Zeilen für den Log-Softmax benötigt 4,10 GiB GPU-VRAM. Derselbe Lauf mit 3072 Tokens benötigt 7,57 GiB und passt daher nicht.

Wir haben eine explizite Device-Map mit unsloth_zoo.device_map_plannererstellt, die ebenfalls den Logit-Spielraum auf der Haupt-GPU-Karte reserviert.

Kaggle-Notebook für Reinforcement Learning, kostenlos, für Muse Glimmer

🦥 Unsloth-Leitfaden

Muse Glimmer kann ausgeführt und feinabgestimmt werden in Unsloth Desktop, unserer neuen Open-Source-Weboberfläche für lokale KI.

Mit Unsloth Studio können Sie Modelle lokal ausführen auf macOS, Windows, Linux und NVIDIA-GPUs trainieren. Unterstützung für Intel-, MLX- und AMD-Training kommt noch in diesem Monat.

1

Unsloth installieren

Der einfachste Einstieg ist der Download der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, wenn Sie die manuelle Installation bevorzugen:

macOS, Linux, WSL:

Windows PowerShell:

2

Muse Glimmer trainieren

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Anschließend sehen Sie einen kurzen Einrichtungsassistenten zur Auswahl eines Modells, Datensatzes und der Grundeinstellungen. Sie können ihn jederzeit überspringen.

Suchen Sie in der Suchleiste nach Muse Glimmer und wählen Sie das gewünschte Modell und den gewünschten Datensatz aus. Passen Sie anschließend Ihre Hyperparameter und die Kontextlänge nach Wunsch an.

3

Trainingsfortschritt überwachen

Nachdem Sie auf Training starten geklickt haben, können Sie den Trainingsfortschritt des Modells überwachen und beobachten. Der Trainingsverlust sollte stetig sinken. Nach Abschluss wird das Modell automatisch gespeichert.

4

Ihr feinabgestimmtes Modell exportieren

Nach Abschluss ermöglicht Ihnen Unsloth Studio, das Modell in Formate wie GGUF, Safetensors usw. zu exportieren.

5

Feinabgestimmtes Modell mit Originalmodell vergleichen

Klicken Sie auf Vergleichsmodus um den LoRA-Adapter und das Originalmodell zu vergleichen.

Überblick über Muse Glimmer-30B

Modellarchitektur
Dichter kausaler Transformer mit Wahrnehmungs-Encoder

Parameter

~29,6 Mrd.

Schichten

52

Verborgene Dimension

6656

Aufmerksamkeit

Lokale, lokale, lokale, globale Wiederholung

Gleitfenster

2048

Attention-Köpfe

32 Query / 2 KV

FFN

SwiGLU

Kontextlänge

131,072+

Vision-Encoder

ViT-G/14 (~1,8 Mrd. Parameter)

Modalitäten

Text- und Bildeingabe, Textausgabe

Vokabular

202.048 Tokens

Muse Glimmer verwendet:

  • langkontextuelles Schlussfolgern

  • Planung des Werkzeugeinsatzes

  • Fehlerbehebung

  • Multimodales Verständnis

  • Kompatibilität mit Agenten-Frameworks

  • Steuerbarer Denkaufwand

Empfohlene Feintuning-Methode

LoRA-Feintuning

Für die meisten Nutzer ist LoRA der empfohlene Ansatz.

Vorteile:

  • Deutlich geringerer VRAM-Bedarf

  • Schnelleres Training

  • Kleinere Adapter-Dateien

  • Einfaches Teilen des Modells

  • Erhält die Fähigkeiten des Basismodells

Empfohlene Startkonfiguration:

Für schwierigere agentische Aufgaben:

Beginnen Sie kleiner und erhöhen Sie nur, wenn erforderlich.

QLoRA-Feintuning

QLoRA wird empfohlen, wenn der GPU-Speicher begrenzt ist.

Muse Glimmer wurde für eine effiziente lokale Bereitstellung einschließlich quantisierter Inferenz entwickelt. Dieselben Prinzipien machen QLoRA zu einem praktischen Feintuning-Ansatz.

Verwenden Sie QLoRA, wenn:

  • Training auf Consumer-GPUs

  • Feinabstimmung größerer Datensätze

  • Den Speicherverbrauch niedrig halten

  • Training mehrerer Adapter

Beispiel:


Multimodales Feintuning

Muse Glimmer enthält einen dedizierten Wahrnehmungs-Encoder für das Bildverständnis.

Für Vision-Aufgaben:

  • Den Wahrnehmungs-Encoder zunächst einfrieren.

  • Zuerst die Sprachschichten feinabstimmen.

  • Trainieren Sie die Vision-Komponenten nur, wenn Ihr Datensatz eine visuelle Anpassung erfordert.

Gute multimodale Datensätze umfassen:

  • Screenshot-Verständnis

  • Dokumenten-Schlussfolgern

  • Diagramm-Interpretation

  • GUI-Interaktion

  • Auf Bildern basierende Agenten-Workflows

Beispielformat:

Agentisches Feintuning

Muse Glimmer ist für autonome Agenten-Workflows optimiert.

Für Agenten-Datensätze fügen Sie hinzu:

  • Werkzeugbeschreibungen

  • Korrekte Funktionsaufrufe

  • Werkzeugausgaben

  • Wiederherstellung nach Fehlern

  • Beispiele für mehrstufige Planung

  • Umgang mit Berechtigungen

  • Finale nutzerseitige Antworten

Beispiel:

Datensatzvorbereitung

Muse Glimmer funktioniert am besten mit hochwertigen Instruktionsdatensätzen.

Empfohlene Datensätze:

  • Mehrturn-Gespräche

  • Werkzeugeinsatz-Verläufe

  • Programmieraufgaben

  • Agenten-Trajektorien

  • Vision-Sprach-Beispiele

  • Schlussfolgerungsbeispiele

Vermeiden Sie:

  • Doppelte Beispiele

  • Hochwertig generierte Antworten

  • Falsche Funktionsaufrufe

  • Inkonsistente Formatierung

Zur Bewahrung des Schlussfolgens:

  • Halten Sie die Schlussfolgerungsbeispiele vielfältig.

  • Fügen Sie endgültige Antworten hinzu.

  • Vermeiden Sie es, ausschließlich auf Chain-of-Thought-Ausgaben zu trainieren.

Trainings-Einstellungen

Eine gute Startkonfiguration:

Empfohlen:

Einstellung
Wert

Batchgröße

1-8

Gradientenakkumulation

4-16

Lernrate

2e-4 LoRA

Epochen

1-3

Optimierer

AdamW

Präzision

BF16

Für das Training mit langem Kontext:

  • Erhöhen Sie die Sequenzlänge schrittweise.

  • Überwachen Sie die VRAM-Nutzung.

  • Verwenden Sie Gradienten-Checkpointing.

Feintuning für Schlussfolgerungen

Muse Glimmer unterstützt steuerbare Schlussfolgerungsstärke:

Für komplexe Aufgaben:

  • Programmierung → hoch/xhoch

  • Agenten-Workflows → hoch/xhoch

  • Einfache Assistenten → mittel

  • Schnelle Antworten → niedrig

Beim Feintuning von Schlussfolgerungsmodellen:

  • Nehmen Sie schwierige Beispiele auf.

  • Nehmen Sie Fehler und Korrekturen auf.

  • Nehmen Sie mehrstufige Aufgaben auf.

  • Bewahren Sie die allgemeinen Fähigkeiten.

Ihr feinabgestimmtes Modell exportieren

Exportieren Sie nach dem Training Ihren Adapter:

Sie können LoRA-Adapter zusammenführen:

Exportformate können Folgendes umfassen:

  • Hugging-Face-Format

  • Safetensors

  • GGUF-kompatible Formate

Inferenz-Einstellungen

Empfohlene Generierungseinstellungen:

Für schwierige Schlussfolgerungsaufgaben:

Für schnelle Gespräche:

Hardwareanforderungen

Muse Glimmer ist für die lokale Bereitstellung optimiert.

Ungefähre Anforderungen:

Trainingsmethode
Hardware

LoRA

GPU mit hohem Speicherbedarf empfohlen

QLoRA

Consumer-GPUs möglich, abhängig von der Sequenzlänge

Vollständiges Feintuning

Multi-GPU-Systeme

Das Modell selbst kann effizient mit quantisierten Gewichten ausgeführt werden, wobei veröffentlichte 4-Bit-Varianten auf 24-GB- und 32-GB-Consumer-Hardware abzielen.

Sicherheits-Feintuning

Beim Bereitstellen von Muse Glimmer in agentischen Systemen:

  • Fügen Sie Prüfungen für Werkzeugberechtigungen hinzu.

  • Validieren Sie externe Aktionen.

  • Verlangen Sie eine Bestätigung für irreversible Vorgänge.

  • Testen Sie die Widerstandsfähigkeit gegen Prompt-Injection.

  • Bewerten Sie Datenschutzrisiken.

Empfohlene Sicherheitsdatensätze:

  • Beispiele für Werkzeugmissbrauch

  • Berechtigungsgrenzen

  • Umgang mit unsicheren Anweisungen

  • Beispiele zur Datenminimierung

Fehlerbehebung

Speicher voll

Versuchen Sie:

  • Sequenzlänge reduzieren

  • LoRA-Rang verringern

  • 4-Bit-Laden aktivieren

  • Batchgröße reduzieren

  • Gradienten-Checkpointing aktivieren

Modellqualität sinkt

Versuchen Sie:

  • Lernrate reduzieren

  • Trainiere über weniger Epochen

  • Erhöhe die Datensatzqualität

  • Mische ursprüngliche Instruktionsbeispiele

Werkzeugaufrufe werden falsch

Hinzufügen:

  • Mehr Beispiele für Werkzeugaufrufe

  • Korrekte Schemata

  • Beispiele zur Fehlerbehebung

  • Mehrturn-Workflows

Zuletzt aktualisiert

War das hilfreich?