For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron-3-Super:如何运行指南

在你的设备上本地运行并微调 NVIDIA Nemotron-3-Super-120B-A12B!

NVIDIA 发布 Nemotron-3-Super-120B-A12B,一款拥有 120B 参数的开放式混合推理 MoE 模型,具有 12B 活跃参数,继此前发布的 Nemotron-3-Nano,其 30B 对应版本。Nemotron-3-Super 旨在为多智能体 AI 提供高效率和高准确性。凭借 1M-token 的上下文窗口,它在 AIME 2025、Terminal Bench 和 SWE-Bench Verified 基准上在同尺寸级别中领先,同时实现了最高吞吐量。

Nemotron-3-Super 可运行在配备 64GB RAM、VRAM 或统一内存的设备上,并且现在可以在本地进行微调。感谢 NVIDIA 为 Unsloth 提供 day-zero 支持。

Nemotron 3 SuperNemotron 3 Nano

GGUF: Nemotron-3-Super-120B-A12B-GGUFNVFP4FP8BF16

⚙️ 使用指南

NVIDIA 建议在推理中使用以下设置:

通用聊天/指令(默认):

  • temperature = 1.0

  • top_p = 1.0

工具调用用例:

  • temperature = 0.6

  • top_p = 0.95

对于大多数本地使用场景,请设置:

  • max_new_tokens = 32,768 改为 262,144 用于最多 100 万 token 的标准提示

  • 随着你的 RAM/VRAM 允许,可增加该值以进行深度推理或长文本生成。

聊天模板格式可通过使用下面内容找到:

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)

Nemotron 3 聊天模板格式:

Nemotron 3 使用 <think> ,token ID 为 12;并使用 </think> ,token ID 为 13,用于推理。使用 --special 查看 llama.cpp 的 token。你可能还需要 --verbose-prompt 以查看 <think> ,因为它是预先添加的。

🖥️ 运行 Nemotron-3-Super-120B-A12B

根据你的用例,你需要使用不同的设置。一些 GGUF 之所以最终大小相近,是因为模型架构(例如 gpt-oss)的维度不能被 128 整除,因此部分内容无法量化到更低比特。访问 GGUF 这里.

该模型的 4-bit 版本需要约 64GB RAM - 72GB RAM。8-bit 需要 128GB。

Llama.cpp 教程(GGUF):

在 llama.cpp 中运行的说明(注意我们将使用 4 位以适配大多数设备):

1

获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。

2

你可以直接从 Hugging Face 拉取。随着你的 RAM/VRAM 允许,可以将上下文增加到 100 万。

针对以下情况请遵循这个 通用说明 使用场景:

针对以下情况请遵循这个 工具调用 使用场景:

3

通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer )。你可以选择 Q4_K_M 或其他量化版本,如 UD-Q4_K_XL 。我们建议至少使用 2-bit 动态量化 UD-Q2_K_XL 以平衡体积和准确性。如果下载卡住,请参见: Hugging Face Hub、XET 调试

4

然后以对话模式运行模型:

另外,请按需调整 上下文窗口 。确保你的硬件能够处理大于 256K 的上下文窗口。将其设置为 1M 可能会触发 CUDA OOM 并导致崩溃,因此默认值为 262,144。

🦥 Nemotron 3 和 RL 微调

Unsloth 现在支持对所有 Nemotron 模型进行微调,包括 Nemotron 3 Super 和 Nano。有关 Nano 的 notebook 示例,请参阅我们的 Nemotron 3 Nano 微调指南.

Nemotron 3 Super

  • 为保证稳定性,路由层微调默认已禁用。

  • Nemotron-3-Super-120B - bf16 LoRA 可在 256GB VRAM 上运行。如果你使用多 GPU,请添加 device_map = "balanced" 或者参考我们的 多 GPU 指南.

🦙Llama-server 服务与部署

要将 Nemotron 3 部署到生产环境,我们使用 llama-server 在一个新终端中,例如通过 tmux,按以下方式部署模型:

当你运行上面的命令时,你会得到:

然后在一个新终端中,在执行 pip install openai之后,执行:

这将打印

基准测试

与类似规模的模型相比,Nemotron 3 Super 具有竞争力,同时提供最高吞吐量。

最后更新于

这有帮助吗?