For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiniMax-M2.7 - So lokal ausführen

Führe das MiniMax-M2.7-LLM lokal auf deinem eigenen Gerät aus!

MiniMax-M2.7 ist ein neues offenes Modell für agentisches Coding und Chat-Anwendungsfälle. Das Modell erreicht SOTA-Leistung in SWE-Pro (56,22 %) und Terminal Bench 2 (57,0 %).

Die 230B Parameter (10B aktiv) Modell ist der Nachfolger von MiniMax-M25 und hat ein 200K-Kontext Fenster. Das unquantisierte bf16 benötigt 457GB. Unsloth Dynamic 4-Bit GGUF reduziert die Größe auf 108GB (-60%) sodass es auf einem 128GB RAM Gerät: MiniMax-M2.7 GGUF

Alle Uploads verwenden Unsloth Dynamic 2.0 für SOTA-Quantisierungsleistung – daher werden wichtige Schichten auf höhere Bit-Tiefen hochgestuft (z. B. 8- oder 16-Bit). Vielen Dank an MiniMax für den Day-Zero-Zugriff.

⚙️ Nutzungsanleitung

Die 4-Bit-Dynamik-Quantisierung UD-IQ4_XS verwendet 108GB an Speicherplatz auf der Festplatte – das passt gut auf einen Mac mit 128GB Unified Memory für ~15+ Tokens/s und funktioniert auch schneller mit einem 1x16GB-GPU und 96GB RAM für 25+ Tokens/s. 2-Bit Quantisierungen oder die größte 2-Bit-Variante passen auf ein 96GB-Gerät.

Für nahezu voller Präzision, verwenden Sie Q8_0 (8-Bit), das 243GB nutzt und auf ein Gerät / einen Mac mit 256GB RAM für 15+ Tokens/s passt.

Empfohlene Einstellungen

MiniMax empfiehlt, für beste Leistung die folgenden Parameter zu verwenden: temperature=1.0, top_p = 0.95, top_k = 40.

Standardeinstellungen (die meisten Aufgaben)

temperature = 1.0

top_p = 0.95

top_k = 40

  • Maximales Kontextfenster: 196,608

  • Standard-System-Prompt:

Du bist ein hilfreicher Assistent. Dein Name ist MiniMax-M2.7 und wurde von MiniMax entwickelt.

MiniMax-M2.7-Tutorials ausführen:

Um MiniMax-M2.7 auf einem Gerät mit 128GB RAM zum Laufen zu bringen, verwenden wir die 4-Bit UD-IQ4_XS Quant. Du kannst MiniMax-M2.7 jetzt in llama.cpp und Unsloth Studio.

🦥 In Unsloth Studio ausführen

MiniMax-M2.7 kann jetzt in Unsloth Studio, unserer neuen Open-Source-Weboberfläche für lokale KI. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Führen Sie dies in Ihrem Terminal aus:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://localhost:8888 in Ihrem Browser.

3

MiniMax-M2.7 suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Sie sehen dann einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Sie können ihn jederzeit überspringen.

Sie können wählen UD-IQ4_XS (dynamische 4-Bit-Quantisierung) oder andere quantisierte Versionen wie UD-Q4_K_XL . Falls Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

Gehen Sie dann zur Unsloth Chat Registerkarte und suche in der Suchleiste nach MiniMax-M2.7 und lade das gewünschte Modell und die gewünschte Quantisierung herunter. Aufgrund der Größe wird der Download etwas dauern, bitte warte also. Um eine schnelle Inferenz zu gewährleisten, stelle sicher, dass du genügend RAM/VRAM, andernfalls funktioniert die Inferenz weiterhin, aber Unsloth lagert auf Ihre CPU aus.

4

MiniMax-M2.7 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

✨ In llama.cpp ausführen

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn Sie llama.cpp um Modelle direkt zu laden, kannst du Folgendes tun: (:IQ4_XS) ist der Quantisierungstyp. Du kannst auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwenden Sie export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp um an einem bestimmten Speicherort zu speichern. Denken Sie daran, dass das Modell nur eine maximale Kontextlänge von 200K hat.

Befolge dies für die meisten Standard- Anwendungsfälle:

3

Lade das Modell herunter (nach der Installation von pip install huggingface_hub hf_transfer). Du kannst UD-IQ4_XS (dynamische 4-Bit-Quantisierung) oder andere quantisierte Versionen wie UD-Q6_K_XL . Wir empfehlen, unsere dynamische 4-Bit-Quantisierung UD-IQ4_XS zu verwenden, um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

4

Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 16384 für die Kontextlänge, --n-gpu-layers 2 für das GPU-Offloading für wie viele Schichten. Versuchen Sie, ihn anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie ihn auch, wenn Sie nur CPU-Inferenz haben.

🦙 Llama-Server & OpenAIs Completion-Bibliothek

Um MiniMax-M2.7 in der Produktion bereitzustellen, verwenden wir llama-server oder die OpenAI-API. In einem neuen Terminal, z. B. über tmux, stelle das Modell wie folgt bereit:

Dann in einem neuen Terminal, nach dem Ausführen von pip install openai, führe aus:

📊 Benchmarks

GGUF-Benchmarks

Unten sind KLD-99%-Benchmarks für MiniMax-M2.7. Unten links ist besser:

Da MiniMax-M2.7 dieselbe Architektur wie MiniMax-M2.5 nutzt, sollten die GGUF-Quantisierungs-Benchmarks für M2.7 denen von M2.5 sehr ähnlich sein. Daher verweisen wir auch auf den früheren Quantisierungs-Benchmark für M2.5:

Benjamin Marie (Drittanbieter) benchmarkte MiniMax-M2.5 unter Verwendung von Unsloth-GGUF-Quantisierungen auf einem 750-Prompt-Mischsuite (LiveCodeBench v6, MMLU Pro, GPQA, Math500), wobei sowohl Gesamtgenauigkeit und relative Fehlerzunahme (wie viel häufiger das quantisierte Modell im Vergleich zum Original Fehler macht).

Unsloth-Quantisierungen schneiden unabhängig von ihrer Präzision bei Genauigkeit und relativem Fehler deutlich besser ab als ihre Nicht-Unsloth-Pendants (obwohl sie 8GB kleiner sind).

Wichtige Ergebnisse:

  • Bester Kompromiss aus Qualität und Größe hier: unsloth UD-Q4_K_XL. Es kommt dem Original am nächsten: nur 6,0 Punkte weniger, und „nur“ +22.8% mehr Fehler als die Baseline.

  • Andere Unsloth-Q4-Quantisierungen liegen eng beieinander (~64,5–64,9 Genauigkeit). IQ4_NL, MXFP4_MOE und UD-IQ2_XXS haben auf diesem Benchmark im Grunde alle die gleiche Qualität, mit ~33–35 % mehr Fehlern als das Original.

  • Unsloth-GGUFs schneiden deutlich besser ab als andere Nicht-Unsloth-GGUFs, z. B. siehe lmstudio-community - Q4_K_M (obwohl sie 8GB kleiner sind) und AesSedai - IQ3_S.

Offizielle Benchmarks

Zuletzt aktualisiert

War das hilfreich?