For the complete documentation index, see llms.txt. This page is also available as Markdown.

MiniMax M3 - 如何在本地运行

在你自己的设备上本地运行 MiniMax M3 LLM!

MiniMax M3 是一个新的 ~428B(23B 活跃) 用于编码、智能体工作流、协作任务和多模态聊天的开源模型。该多模态模型支持文本、图像和视频输入,并具有 100 万上下文 窗口。未量化的 bf16 权重约为855GB 而 1-bit GGUF 将其降至仅 128GB(-85%): MiniMax-M3 GGUF

该模型的表现与 Gemini 3.1 Pro 相当——取得了 在 SWE-Bench Pro 上 59%、在 Terminal-Bench 2.1 上 66%、在 SWE-fficiency 上 34.8%,以及在 KernelBench Hard 上 28.8% 的成绩。感谢 MiniMax 提供首日访问权限。

你现在可以直接在 Unsloth Studio中运行 MiniMax M3。下面是在单台 M3 Ultra 512GB 上通过 Unsloth Studio 本地运行 5-bit MiniMax M3 的示例:

MiniMax-M3 GGUF 目前仍属实验性。MiniMax-M3 本身是原生多模态的,但当前的实验性 GGUF 是 仅文本 且不支持 MiniMax Sparse Attention。

⚙️ 使用指南

最小的 GGUF 量化版本, UD-IQ1_M,使用 128GB 的磁盘空间。由于文件大小不包含 KV 缓存和上下文分配,请尽量至少有 133GB 内存 来运行该模型。建议使用 UD-IQ3_XXS 其大小为 159GB 以获得最佳效果。

这个 4 位 UD-IQ4_XS 量化版本为 208GB,而 UD-Q4_K_XL265GB。这些更适合 256GB+ 或 512GB 级别的系统、多 GPU 服务器,或具有 CPU 内存加 GPU 卸载的系统。

表:推理硬件需求 (单位 = 总内存:RAM + VRAM,或统一内存)

1 位
2 位
3 位
4 位
5 位
8 位

133 GB

148 GB

164-200 GB

213-270 GB

325 GB

460-470 GB

推荐设置

MiniMax 推荐以下参数以获得最佳性能: temperature=1.0, top_p=0.95, top_k=40.

temperature = 1.0

top_p = 0.95

top_k = 40

  • 最大上下文窗口: 1,048,576

  • 默认系统提示词:

你是一个乐于助人的助手。你的名字是 MiniMax-M3,由 MiniMax 构建。

运行 MiniMax-M3 教程:

在本教程中,我们将使用当前最小的量化版本, UD-IQ1_M,因为 MiniMax-M3 很大。将 UD-IQ1_M 替换为 UD-IQ4_XS, UD-Q4_K_XL,或者如果你的机器有足够内存,则使用其他量化版本。你现在可以在 Unsloth Studio.

🦥 Unsloth Studio 指南🦙 Llama.cpp 指南

🦥 Unsloth Studio 指南

MiniMax M3 现在可以在 Unsloth Studio中运行和训练,这是我们用于本地 AI 的全新开源 Web UI。Unsloth Studio 让你能够在本地运行模型,支持 MacOS, Windows、Linux 以及:

1

安装 Unsloth

请确保你使用最新的 v0.1.463-beta2026.6.6。在终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL 和 Windows:

然后打开 http://127.0.0.1:8888 (或你的特定 URL)在浏览器中打开。

3

搜索并下载 MiniMax M3

首次启动时,你需要创建一个密码来保护你的账户,然后再次登录。

然后前往 Studio Chat 选项卡,在搜索栏中搜索 MiniMax M3,并下载你想要的模型和量化版本。

4

运行 MiniMax M3

使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你还可以编辑上下文长度、聊天模板和其他设置。

欲了解更多信息,你可以查看我们的 Unsloth Studio 推理指南.

🦙 Llama.cpp 指南

1

获取特定的 llama.cpp这里的 GitHub PR。你也可以按照下面的构建说明进行操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后像往常一样继续——默认已启用 Metal 支持。

2

你现在可以直接使用 llama.cpp 来加载和下载模型,就像 ollama run。首先,选择你想要的量化类型,例如 Q2_K_XL。还可以使用 export LLAMA_CACHE="folder" 来强制 llama.cpp 保存到指定位置。注意,这个下载过程可能非常慢,因此最好使用下一节中的手动下载流程。

注意:尚不支持 MiniMax Sparse Attention,因此推理会回退到密集注意力。

3

如果你想手动下载模型,我们可以通过下面的代码下载模型(安装 pip install huggingface_hub)。如果下载卡住,请参见: Hugging Face Hub、XET 调试

4

你可以编辑 --threads 32 来设置 CPU 线程数, --ctx-size 32768 来设置上下文长度, --n-gpu-layers 2 来设置要进行 GPU 卸载的层数。如果你的 GPU 内存不足,请尝试调整它。如果你只使用 CPU 推理,也请移除它。请记住 MSA 尚不受支持,因此请将 --ctx-size 保持在适中水平——在非常长的上下文下,密集注意力会占用大量内存。

📊 基准测试

最后更新于

这有帮助吗?