MiniMax M3 - ローカル実行方法
MiniMax M3 LLMを自分のデバイスでローカル実行しましょう!
MiniMax M3 は新しい 約428B(23Bアクティブ) コード作成、エージェント的ワークフロー、共同作業タスク、マルチモーダルチャット向けのオープンモデルです。マルチモーダルモデルはテキスト、画像、動画入力をサポートし、 100万コンテキスト ウィンドウ。量子化前のbf16重みは約855GB で、1-bit GGUFではこれがわずか 128GB(-85%): MiniMax-M3 GGUF
このモデルはGemini 3.1 Proに匹敵する性能を示し、 SWE-Bench Proで59%、Terminal-Bench 2.1で66%、SWE-fficiencyで34.8%、KernelBench Hardで28.8%を記録しています。Day zeroアクセスを提供してくれたMiniMaxに感謝します。
MiniMax-M3 GGUFは現在実験的です。MiniMax-M3自体はネイティブなマルチモーダルですが、現在の実験的なGGUFは テキストのみ であり、MiniMax Sparse Attentionはサポートしていません。

⚙️ 使用ガイド
最小のGGUF量子化、 UD-IQ1_Mは 128GB のディスク容量を使用します。ファイルサイズにはKVキャッシュやコンテキスト割り当ては含まれていないため、少なくとも 133GBのRAM を用意してモデルを実行してください。 UD-IQ3_XXS これは 159GB を使うことが推奨されます。
この 4ビット UD-IQ4_XS 量子化は 208GBで、 UD-Q4_K_XL は 265GBです。これらは256GB以上または512GBクラスのシステム、マルチGPUサーバー、あるいはCPU RAMとGPUオフロードを組み合わせたシステムにより適しています。
表:推論ハードウェア要件 (単位 = 合計メモリ:RAM + VRAM、またはユニファイドメモリ)
133 GB
148 GB
164-200 GB
213-270 GB
325 GB
460-470 GB
最良の性能を得るには、VRAM とシステムRAMを含む利用可能な総メモリが、量子化モデルファイルサイズを十分な余裕をもって上回っていることを確認してください。
推奨設定
MiniMaxは、最高の性能を得るために以下のパラメータを推奨しています: temperature=1.0, top_p=0.95, top_k=40.
temperature = 1.0
top_p = 0.95
top_k = 40
最大コンテキストウィンドウ:
1,048,576デフォルトのシステムプロンプト:
あなたは役立つアシスタントです。あなたの名前はMiniMax-M3で、MiniMaxによって作られました。MiniMax-M3のチュートリアルを実行する:
このチュートリアルでは、MiniMax-M3は大きいため、現在の最小量子化であるUD-IQ1_Mを使用します。お使いのマシンに十分なメモリがある場合は、UD-IQ1_MをUD-IQ4_XS、UD-Q4_K_XL、または別の量子化に置き換えてください。これでUnslothでMiniMax-M3を実行できます。
Unslothガイド
Unslothをダウンロード
Unslothをダウンロード
https://unsloth.ai/download
https://unsloth.ai/download
Unslothガイド
Unslothをダウンロード
https://unsloth.ai/download
これでMiniMax M3を次を通じて実行できます Unsloth ✨。> を使用してください v0.1.463-beta または 2026.6.6.
MiniMax M3はMacOS、Windows、Linux上のUnslothで実行できます。以下が可能です:
検索、ダウンロード、 GGUFの実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cpp経由の高速CPU+GPU推論
LLMの学習 VRAMを70%削減しつつ2倍高速

🦙 Llama.cppガイド
特定の llama.cpp PRを GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
現在は llama.cpp を直接使ってモデルを読み込み・ダウンロードできます。 ollama runと同じように。まず、 Q2_K_XLのように、希望する量子化タイプを選択してください。また、 export LLAMA_CACHE="folder" して llama.cpp を特定の場所に保存するよう強制できます。このダウンロード प्रक्रियाはかなり遅い場合があるため、次のセクションの手動ダウンロード手順を使うのがおそらく最善です。
注意:MiniMax Sparse Attentionはまだサポートされていないため、推論は密な注意にフォールバックします。
モデルを手動でダウンロードしたい場合は、以下のコードでダウンロードできます(次をインストールした後) pip install huggingface_hubをインストールした後)。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ
次を編集できます --threads 32 CPUスレッド数として --ctx-size 32768 コンテキスト長として --n-gpu-layers 2 GPUオフロードについて、何層にするか。GPUのメモリ不足になる場合は調整してみてください。CPUのみの推論の場合はこれも削除してください。MSAはまだサポートされていないことを忘れずに、 --ctx-size は控えめにしてください。非常に長いコンテキストでの密な注意は大量のメモリを使用します。
📊 ベンチマーク


最終更新
役に立ちましたか?


