> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/minimax-m3.md).

# MiniMax M3 - So wird es lokal ausgeführt

MiniMax M3 ist ein neues **\~428B (23B aktiv)** offenes Modell für Programmierung, agentische Workflows, Coworking-Aufgaben und multimodalen Chat. Das multimodale Modell unterstützt Text-, Bild- und Videoeingaben und ein **1M-Kontext** **Fenster**. Die nicht quantisierten bf16-Gewichte betragen \~**855GB** und das 1-Bit-GGUF reduziert dies auf nur **128GB (-85%)**: [**MiniMax-M3 GGUF**](https://huggingface.co/unsloth/MiniMax-M3-GGUF)

Das Modell ist auf Augenhöhe mit Gemini 3.1 Pro – mit 59% auf SWE-Bench Pro, 66% auf Terminal-Bench 2.1, 34,8% auf SWE-fficiency und 28,8% auf KernelBench Hard. Danke an MiniMax für den Day-Zero-Zugang.

{% columns %}
{% column width="50%" %}
Sie können MiniMax M3 jetzt direkt in [Unsloth Studio](#unsloth-studio-guide). Beispiel eines lokal auf einem einzelnen M3 Ultra 512GB über Unsloth Studio laufenden 5-Bit-MiniMax M3:

{% hint style="info" %}
MiniMax-M3-GGUFs sind derzeit experimentell. MiniMax-M3 selbst ist nativ multimodal, aber das aktuelle experimentelle GGUF ist **nur Text** und unterstützt MiniMax Sparse Attention nicht.
{% endhint %}
{% endcolumn %}

{% column width="50%" %}

<figure><img src="/files/cec52fc6e43d52817103c80356991cca709771e4" alt="" width="375"><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### :gear: Anleitung

Der kleinste GGUF-Quant, `UD-IQ1_M`, verwendet **128GB** an Speicherplatz. Da die Dateigröße den KV-Cache und die Kontextzuweisung nicht einschließt, versuchen Sie, mindestens **133GB RAM** zum Ausführen des Modells zu haben. Es wird empfohlen, `UD-IQ3_XXS` zu verwenden, **159GB** für die besten Ergebnisse zu verwenden.

Der **4-Bit** `UD-IQ4_XS` Quant ist **208GB**, während `UD-Q4_K_XL` ist **265GB**. Sie eignen sich besser für Systeme der 256GB+- oder 512GB-Klasse, Multi-GPU-Server oder Systeme mit CPU-RAM plus GPU-Offload.

**Tabelle: Hardwareanforderungen für die Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder einheitlicher Speicher)

<table><thead><tr><th>1-Bit</th><th>2-Bit</th><th width="128">3-Bit</th><th>4-Bit</th><th>5-Bit</th><th>8-Bit</th></tr></thead><tbody><tr><td>133 GB</td><td>148 GB</td><td>164-200 GB</td><td>213-270 GB</td><td>325 GB</td><td>460-470 GB</td></tr></tbody></table>

{% hint style="success" %}
Für die beste Leistung stellen Sie sicher, dass Ihr insgesamt verfügbarer Speicher, einschließlich VRAM und System-RAM, die Dateigröße des quantisierten Modells mit einem bequemen Puffer übersteigt.
{% endhint %}

#### Empfohlene Einstellungen

MiniMax empfiehlt die folgenden Parameter für die beste Leistung: `temperature=1.0`, `top_p=0.95`, `top_k=40`.

{% columns %}
{% column %}

| `temperature = 1.0` |
| ------------------- |
| `top_p = 0.95`      |
| `top_k = 40`        |
| {% endcolumn %}     |

{% column %}

* **Maximales Kontextfenster:** `1,048,576`
* Standard-Systemprompt:

{% code overflow="wrap" %}

```
Du bist ein hilfreicher Assistent. Dein Name ist MiniMax-M3 und wurde von MiniMax entwickelt.
```

{% endcode %}
{% endcolumn %}
{% endcolumns %}

## MiniMax-M3-Tutorials ausführen:

Für dieses Tutorial verwenden wir den derzeit kleinsten Quant, `UD-IQ1_M`, weil MiniMax-M3 groß ist. Ersetzen Sie `UD-IQ1_M` mit `UD-IQ4_XS`, `UD-Q4_K_XL`, oder einen anderen Quant, wenn Ihr Rechner genügend Speicher hat. Sie können MiniMax-M3 jetzt in [Unsloth Studio](#run-in-unsloth-studio).

<a href="/pages/13b7da13a76945069ce02cb3e569b17283e5050e#unsloth-studio-guide" class="button primary">🦥 Unsloth-Studio-Anleitung</a><a href="/pages/13b7da13a76945069ce02cb3e569b17283e5050e#llama.cpp-guide" class="button primary">🦙 Llama.cpp-Anleitung</a>

### 🦥 Unsloth-Studio-Anleitung

{% hint style="success" %}
Sie können MiniMax M3 jetzt über [Unsloth Studio](#unsloth-studio-guide) ✨. Stellen Sie sicher, dass Sie > [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.6`.
{% endhint %}

MiniMax M3 kann jetzt ausgeführt und trainiert werden in [Unsloth Studio](/docs/de/neu/studio.md), unserer neuen Open-Source-Web-UI für lokale KI. Mit Unsloth Studio können Sie Modelle lokal ausführen auf **macOS**, **Windows**, Linux und:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](/docs/de/neu/studio.md#model-arena) Parameterabstimmung (temp, top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/37d41a9986d4b1f503942b2654532cfdd5149728" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Stellen Sie sicher, dass Sie die neueste [`v0.1.463-beta`](https://github.com/unslothai/unsloth/tree/v0.1.462-beta) oder `2026.6.6`. Führen Sie in Ihrem Terminal aus:

**macOS, Linux, WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth starten

**MacOS, Linux, WSL und Windows:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

Dann öffnen Sie `http://127.0.0.1:8888` (oder Ihre spezifische URL) in Ihrem Browser.
{% endstep %}

{% step %}

#### MiniMax M3 suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich erneut anmelden.

Gehen Sie dann zur [Unsloth Chat](/docs/de/neu/studio/chat.md) Registerkarte und suchen Sie im Suchfeld nach MiniMax M3 und laden Sie das gewünschte Modell und den gewünschten Quant herunter.

<figure><img src="/files/bb477459eac643da4060f9be6f76cb24b9dc0ca5" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### MiniMax M3 ausführen

Die Inferenzparameter sollten bei der Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst außerdem die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere [Inferenzanleitung für Unsloth Studio](/docs/de/neu/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/cec52fc6e43d52817103c80356991cca709771e4" alt=""><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Llama.cpp-Anleitung

{% stepper %}
{% step %}
Besorgen Sie sich den SPEZIFISCHEN `llama.cpp` PR auf [**GitHub hier**](https://github.com/ggml-org/llama.cpp/pull/24523). Sie können auch den untenstehenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz wünschen. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
git fetch origin pull/24523/head:minimax-m3
git checkout minimax-m3
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j --target llama-cli llama-server
```

{% endstep %}

{% step %}
Sie können jetzt `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wählen Sie zunächst den gewünschten Quantisierungstyp aus, zum Beispiel `Q2_K_XL`. Verwenden Sie außerdem `export LLAMA_CACHE="folder"` um zu erzwingen `llama.cpp` dass es an einem bestimmten Speicherort gespeichert wird. Beachten Sie, dass dieser Download-Vorgang sehr langsam sein kann, daher ist es wahrscheinlich am besten, den manuellen Download-Prozess im nächsten Abschnitt zu verwenden.

```bash
export LLAMA_CACHE="unsloth/MiniMax-M3-GGUF"
./build/bin/llama-cli \\
    -hf unsloth/MiniMax-M3-GGUF:UD-IQ1_M \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 40
```

{% hint style="info" %}
Hinweis: MiniMax Sparse Attention wird noch nicht unterstützt, daher greift die Inferenz auf dichte Attention zurück.
{% endhint %}
{% endstep %}

{% step %}
Wenn Sie das Modell manuell herunterladen möchten, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/MiniMax-M3-GGUF \\
    --local-dir unsloth/MiniMax-M3-GGUF \\
    --include "*UD-IQ1_M*" # Verwenden Sie "*UD-IQ4_XS*" für 4-Bit
```

{% endstep %}

{% step %}
Sie können `--threads 32` für die Anzahl der CPU-Threads, `--ctx-size 32768` für die Kontextlänge, `--n-gpu-layers 2` für GPU-Offloading auf wie viele Schichten. Probieren Sie, es anzupassen, wenn Ihrer GPU der Speicher ausgeht. Entfernen Sie es auch, wenn Sie nur CPU-Inferenz haben. Denken Sie daran, dass MSA noch nicht unterstützt wird, also behalten Sie `--ctx-size` moderat - dichte Attention bei sehr langen Kontexten wird viel Speicher benötigen.

{% code overflow="wrap" %}

```bash
./build/bin/llama-cli \\
    --model unsloth/MiniMax-M3-GGUF/UD-IQ1_M/MiniMax-M3-UD-IQ1_M-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --top-k 40
```

{% endcode %}
{% endstep %}
{% endstepper %}

## 📊 Benchmarks

<figure><img src="/files/21b047401655b14c454c98beb7772841342d4231" alt=""><figcaption></figcaption></figure>

<figure><img src="/files/83837fa94ba90056b77467887a69611b6d2db1fe" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/minimax-m3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
