For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiniMax M3 - ローカル実行方法

MiniMax M3 LLMを自分のデバイスでローカル実行しましょう!

MiniMax M3 は新しい 約428B(23Bアクティブ) コード作成、エージェント的ワークフロー、共同作業タスク、マルチモーダルチャット向けのオープンモデルです。マルチモーダルモデルはテキスト、画像、動画入力をサポートし、 100万コンテキスト ウィンドウ。量子化前のbf16重みは約855GB で、1-bit GGUFではこれがわずか 128GB(-85%): MiniMax-M3 GGUF

このモデルはGemini 3.1 Proに匹敵する性能を示し、 SWE-Bench Proで59%、Terminal-Bench 2.1で66%、SWE-fficiencyで34.8%、KernelBench Hardで28.8%を記録しています。Day zeroアクセスを提供してくれたMiniMaxに感謝します。

MiniMax-M3 GGUFは現在実験的です。MiniMax-M3自体はネイティブなマルチモーダルですが、現在の実験的なGGUFは テキストのみ であり、MiniMax Sparse Attentionはサポートしていません。

⚙️ 使用ガイド

最小のGGUF量子化、 UD-IQ1_M128GB のディスク容量を使用します。ファイルサイズにはKVキャッシュやコンテキスト割り当ては含まれていないため、少なくとも 133GBのRAM を用意してモデルを実行してください。 UD-IQ3_XXS これは 159GB を使うことが推奨されます。

この 4ビット UD-IQ4_XS 量子化は 208GBで、 UD-Q4_K_XL265GBです。これらは256GB以上または512GBクラスのシステム、マルチGPUサーバー、あるいはCPU RAMとGPUオフロードを組み合わせたシステムにより適しています。

表:推論ハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、またはユニファイドメモリ)

1ビット
2ビット
3ビット
4ビット
5ビット
8ビット

133 GB

148 GB

164-200 GB

213-270 GB

325 GB

460-470 GB

推奨設定

MiniMaxは、最高の性能を得るために以下のパラメータを推奨しています: temperature=1.0, top_p=0.95, top_k=40.

temperature = 1.0

top_p = 0.95

top_k = 40

  • 最大コンテキストウィンドウ: 1,048,576

  • デフォルトのシステムプロンプト:

あなたは役立つアシスタントです。あなたの名前はMiniMax-M3で、MiniMaxによって作られました。

MiniMax-M3のチュートリアルを実行する:

このチュートリアルでは、MiniMax-M3は大きいため、現在の最小量子化であるUD-IQ1_Mを使用します。お使いのマシンに十分なメモリがある場合は、UD-IQ1_MをUD-IQ4_XS、UD-Q4_K_XL、または別の量子化に置き換えてください。これでUnslothでMiniMax-M3を実行できます。

Unslothガイド

Unslothをダウンロード

Unslothをダウンロード

https://unsloth.ai/download

https://unsloth.ai/download

Unslothガイド

Unslothをダウンロード

https://unsloth.ai/download

MiniMax M3はMacOS、Windows、Linux上のUnslothで実行できます。以下が可能です:

1

Unslothをインストール

最新の v0.1.463-beta または 2026.6.6を使用してください。ターミナルで実行:

MacOS、Linux、WSL:

Windows PowerShell:

2

Unslothを起動

MacOS、Linux、WSL、およびWindows:

3

MiniMax M3を検索してダウンロード

次に〜へ移動し Unsloth Chat タブを開き、検索バーでMiniMax M3を検索して、必要なモデルと量子化をダウンロードしてください。

4

MiniMax M3を実行

🦙 Llama.cppガイド

1

特定の llama.cpp PRを GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON-DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

2

現在は llama.cpp を直接使ってモデルを読み込み・ダウンロードできます。 ollama runと同じように。まず、 Q2_K_XLのように、希望する量子化タイプを選択してください。また、 export LLAMA_CACHE="folder" して llama.cpp を特定の場所に保存するよう強制できます。このダウンロード प्रक्रियाはかなり遅い場合があるため、次のセクションの手動ダウンロード手順を使うのがおそらく最善です。

注意:MiniMax Sparse Attentionはまだサポートされていないため、推論は密な注意にフォールバックします。

3

モデルを手動でダウンロードしたい場合は、以下のコードでダウンロードできます(次をインストールした後) pip install huggingface_hubをインストールした後)。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ

4

次を編集できます --threads 32 CPUスレッド数として --ctx-size 32768 コンテキスト長として --n-gpu-layers 2 GPUオフロードについて、何層にするか。GPUのメモリ不足になる場合は調整してみてください。CPUのみの推論の場合はこれも削除してください。MSAはまだサポートされていないことを忘れずに、 --ctx-size は控えめにしてください。非常に長いコンテキストでの密な注意は大量のメモリを使用します。

📊 ベンチマーク

最終更新

役に立ちましたか?