MiniMax M3 - 如何在本地运行
在你自己的设备上本地运行 MiniMax M3 LLM!
MiniMax M3 是一个新的 ~428B(23B 活跃) 用于编码、智能体工作流、协作任务和多模态聊天的开源模型。该多模态模型支持文本、图像和视频输入,并具有 100 万上下文 窗口。未量化的 bf16 权重约为855GB 而 1-bit GGUF 将其降至仅 128GB(-85%): MiniMax-M3 GGUF
该模型的表现与 Gemini 3.1 Pro 相当——取得了 在 SWE-Bench Pro 上 59%、在 Terminal-Bench 2.1 上 66%、在 SWE-fficiency 上 34.8%,以及在 KernelBench Hard 上 28.8% 的成绩。感谢 MiniMax 提供首日访问权限。
你现在可以直接在 Unsloth Studio中运行 MiniMax M3。下面是在单台 M3 Ultra 512GB 上通过 Unsloth Studio 本地运行 5-bit MiniMax M3 的示例:
MiniMax-M3 GGUF 目前仍属实验性。MiniMax-M3 本身是原生多模态的,但当前的实验性 GGUF 是 仅文本 且不支持 MiniMax Sparse Attention。

⚙️ 使用指南
最小的 GGUF 量化版本, UD-IQ1_M,使用 128GB 的磁盘空间。由于文件大小不包含 KV 缓存和上下文分配,请尽量至少有 133GB 内存 来运行该模型。建议使用 UD-IQ3_XXS 其大小为 159GB 以获得最佳效果。
这个 4 位 UD-IQ4_XS 量化版本为 208GB,而 UD-Q4_K_XL 为 265GB。这些更适合 256GB+ 或 512GB 级别的系统、多 GPU 服务器,或具有 CPU 内存加 GPU 卸载的系统。
表:推理硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)
133 GB
148 GB
164-200 GB
213-270 GB
325 GB
460-470 GB
为获得最佳性能,请确保你可用的总内存(包括 VRAM 和系统 RAM)比量化模型文件大小高出足够裕量。
推荐设置
MiniMax 推荐以下参数以获得最佳性能: temperature=1.0, top_p=0.95, top_k=40.
temperature = 1.0
top_p = 0.95
top_k = 40
最大上下文窗口:
1,048,576默认系统提示词:
你是一个乐于助人的助手。你的名字是 MiniMax-M3,由 MiniMax 构建。运行 MiniMax-M3 教程:
在本教程中,我们将使用当前最小的量化版本, UD-IQ1_M,因为 MiniMax-M3 很大。将 UD-IQ1_M 替换为 UD-IQ4_XS, UD-Q4_K_XL,或者如果你的机器有足够内存,则使用其他量化版本。你现在可以在 Unsloth Studio.
🦥 Unsloth Studio 指南🦙 Llama.cpp 指南
🦥 Unsloth Studio 指南
你现在还可以通过 Unsloth Studio ✨。请确保你使用 v0.1.463-beta 或 2026.6.6.
MiniMax M3 现在可以在 Unsloth Studio中运行和训练,这是我们用于本地 AI 的全新开源 Web UI。Unsloth Studio 让你能够在本地运行模型,支持 MacOS, Windows、Linux 以及:

搜索并下载 MiniMax M3
首次启动时,你需要创建一个密码来保护你的账户,然后再次登录。
然后前往 Studio Chat 选项卡,在搜索栏中搜索 MiniMax M3,并下载你想要的模型和量化版本。

运行 MiniMax M3
使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。
欲了解更多信息,你可以查看我们的 Unsloth Studio 推理指南.

🦙 Llama.cpp 指南
获取特定的 llama.cpp 在 这里的 GitHub PR。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——默认已启用 Metal 支持。
你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 Q2_K_XL。还可以使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 保存到指定位置。注意,这个下载过程可能非常慢,因此最好使用下一节中的手动下载流程。
注意:尚不支持 MiniMax Sparse Attention,因此推理会回退到密集注意力。
如果你想手动下载模型,我们可以通过下面的代码下载模型(安装 pip install huggingface_hub)。如果下载卡住,请参见: Hugging Face Hub、XET 调试
你可以编辑 --threads 32 来设置 CPU 线程数, --ctx-size 32768 来设置上下文长度, --n-gpu-layers 2 来设置要进行 GPU 卸载的层数。如果你的 GPU 内存不足,请尝试调整它。如果你只使用 CPU 推理,也请移除它。请记住 MSA 尚不受支持,因此请将 --ctx-size 保持在适中水平——在非常长的上下文下,密集注意力会占用大量内存。
📊 基准测试


最后更新于
这有帮助吗?

