MiniMax M3 - So lokal ausführen
Führen Sie das MiniMax-M3-LLM lokal auf Ihrem eigenen Gerät aus!
MiniMax M3 ist ein neues ~428B (23B aktiv) offenes Modell für Coding, agentische Workflows, Cowork-Aufgaben und multimodalen Chat. Das multimodale Modell unterstützt Text-, Bild- und Videoeingaben und ein 1M-Kontext Fenster. Die unquantisierten bf16-Gewichte betragen ~855GB und der 1-Bit-GGUF reduziert dies auf nur 128GB (-85%): MiniMax-M3 GGUF
Das Modell ist auf Augenhöhe mit Gemini 3.1 Pro – mit 59 % auf SWE-Bench Pro, 66 % auf Terminal-Bench 2.1, 34,8 % auf SWE-fficiency und 28,8 % auf KernelBench Hard. Danke an MiniMax für den Zugriff am Tag Null.
Du kannst MiniMax M3 jetzt direkt in Unsloth Studio. Beispiel für MiniMax M3 in 5-Bit, lokal ausgeführt auf einem einzelnen M3 Ultra 512GB über Unsloth Studio:
MiniMax-M3 GGUFs sind derzeit experimentell. MiniMax-M3 selbst ist nativ multimodal, aber der aktuelle experimentelle GGUF ist nur textbasiert und unterstützt MiniMax Sparse Attention nicht.

⚙️ Nutzungsanleitung
Der kleinste GGUF-Quant, UD-IQ1_M, belegt 128GB Speicherplatz. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht einschließt, solltest du mindestens 133GB RAM haben, um das Modell auszuführen. Es wird empfohlen, UD-IQ3_XXS zu verwenden, das 159GB groß ist, für beste Ergebnisse.
Der 4-Bit UD-IQ4_XS Quant ist 208GB, während UD-Q4_K_XL mit 265GBgroß ist. Diese eignen sich besser für Systeme der Klasse 256GB+ oder 512GB, Multi-GPU-Server oder Systeme mit CPU-RAM plus GPU-Offloading.
Tabelle: Hardwareanforderungen für die Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)
133 GB
148 GB
164–200 GB
213–270 GB
325 GB
460–470 GB
Stelle für die beste Leistung sicher, dass dein insgesamt verfügbarer Speicher, einschließlich VRAM und System-RAM, die Größe der quantisierten Modelldatei mit einem komfortablen Puffer übersteigt.
Empfohlene Einstellungen
MiniMax empfiehlt für die beste Leistung die folgenden Parameter: temperature=1.0, top_p=0.95, top_k=40.
temperature = 1.0
top_p = 0.95
top_k = 40
Maximales Kontextfenster:
1,048,576Standard-Systemprompt:
Du bist ein hilfreicher Assistent. Dein Name ist MiniMax-M3 und wurde von MiniMax entwickelt.MiniMax-M3-Tutorials ausführen:
Für dieses Tutorial verwenden wir den kleinsten aktuellen Quant, UD-IQ1_M, da MiniMax-M3 sehr groß ist. Ersetze UD-IQ1_M durch UD-IQ4_XS, UD-Q4_K_XL, oder einen anderen Quant, wenn dein Rechner genug Speicher hat. Du kannst MiniMax-M3 jetzt in Unsloth Studio.
🦥 Unsloth Studio-Anleitung🦙 Llama.cpp-Anleitung
🦥 Unsloth Studio-Anleitung
Du kannst MiniMax M3 jetzt über Unsloth Studio ✨ ausführen. Stelle sicher, dass du v0.1.463-beta oder 2026.6.6.
MiniMax M3 kann jetzt in Unsloth Studioausgeführt und trainiert werden, unserer neuen Open-Source-Web-UI für lokale KI. Mit Unsloth Studio kannst du Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilend Tool-Aufrufe + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parameterabstimmung (Temp., Top-p usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Stelle sicher, dass du die neueste v0.1.463-beta oder 2026.6.6verwendest. Führe im Terminal aus:
MacOS, Linux, WSL:
Windows PowerShell:
MiniMax M3 suchen und herunterladen
Beim ersten Start musst du ein Passwort erstellen, um dein Konto zu sichern, und dich erneut anmelden.
Dann gehe zum Studio Chat -Tab und suche in der Suchleiste nach MiniMax M3 und lade dein gewünschtes Modell und den gewünschten Quant herunter.

MiniMax M3 ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen kannst du unseren Unsloth Studio Inferenzleitfaden.

🦙 Llama.cpp-Anleitung
Erhalte den KONKRETEN llama.cpp PR auf GitHub hier. Du kannst auch die Build-Anweisungen unten befolgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF , wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple-Mac-/Metal-Geräte, setze -DGGML_CUDA=OFF dann fahre wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Du kannst jetzt llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wähle zuerst den gewünschten Quantisierungstyp wie Q2_K_XL. Verwende außerdem export LLAMA_CACHE="folder" um zu erzwingen llama.cpp , dass es an einem bestimmten Speicherort gespeichert wird. Beachte, dass dieser Downloadvorgang sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Downloadprozess im nächsten Abschnitt zu verwenden.
Hinweis: MiniMax Sparse Attention wird noch nicht unterstützt, daher fällt die Inferenz auf dichte Attention zurück.
Wenn du das Modell manuell herunterladen möchtest, können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Du kannst --threads 32 für die Anzahl der CPU-Threads bearbeiten, --ctx-size 32768 für die Kontextlänge, --n-gpu-layers 2 für GPU-Offloading, für wie viele Schichten. Versuche, ihn anzupassen, wenn deinem GPU der Speicher ausgeht. Entferne ihn außerdem, wenn du nur CPU-Inferenz hast. Denk daran, dass MSA noch nicht unterstützt wird, also halte --ctx-size moderat – Attention über sehr lange Kontexte hinweg verbraucht viel Speicher.
📊 Benchmarks


Zuletzt aktualisiert
War das hilfreich?

