For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Nano - 如何运行指南

在你的设备上本地运行并微调 NVIDIA Nemotron 3 Nano!

NVIDIA 发布 Nemotron-3-Nano-4B,一个 4B 开放混合 MoE 模型,遵循 Nemotron-3-Super-120B-A12B 和 Nemotron-3-Nano-30B-A3B。Nemotron 家族专为快速、准确的编程、数学和智能体工作负载而设计。它们具有 100万 token 上下文 窗口,并且在推理、聊天和吞吐量基准测试中都具有竞争力。

Nemotron-3-Nano-4B 可在以下配置上运行: 5GB 的 RAM、VRAM 或统一内存。Nemotron-3-Nano-30A3B 可在以下配置上运行: 24GB RAM。现在可以通过以下方式在本地对 Nemotron 3 进行微调: Unsloth。感谢 NVIDIA 为 Unsloth 提供首日支持。

Nemotron-3-Nano-4BNemotron-3-Nano-30B-A3BNemotron 3 微调

⚙️ 使用指南

NVIDIA 建议在推理中使用以下设置:

通用聊天/指令(默认):

  • temperature = 1.0

  • top_p = 1.0

工具调用用例:

  • temperature = 0.6

  • top_p = 0.95

对于大多数本地使用场景,请设置:

  • max_new_tokens = 32,768 改为 262,144 用于最多 100 万 token 的标准提示

  • 随着你的 RAM/VRAM 允许,可增加该值以进行深度推理或长文本生成。

聊天模板格式可通过使用下面内容找到:

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)

Nemotron 3 聊天模板格式:

Nemotron 3 使用 <think> ,token ID 为 12;并使用 </think> ,token ID 为 13,用于推理。使用 --special 查看 llama.cpp 的 token。你可能还需要 --verbose-prompt 以查看 <think> ,因为它是预先添加的。

🖥️ 运行 Nemotron-3-Nano-4B

根据你的用例,你需要使用不同的设置。一些 GGUF 之所以最终大小相近,是因为模型架构(例如 gpt-oss)的维度不能被 128 整除,因此部分内容无法量化到更低位宽。

该模型的 4 位版本需要约 3GB RAM。8 位版本需要 5GB。

🦥 Unsloth Studio 指南

Nemotron 3 可以在以下环境中运行和微调: Unsloth Studio,我们新的用于本地 AI 的开源网页界面。使用 Unsloth Studio,你可以在以下平台本地运行模型: MacOS、Windows、Linux 和:

1

安装 Unsloth

在你的终端中运行:

MacOS、Linux、WSL:

Windows PowerShell:

2

启动 Unsloth

MacOS、Linux、WSL、Windows:

然后在浏览器中打开 http://localhost:8888

3

搜索并下载 Nemotron-3-Nano-4B

首次启动时,你需要创建密码以保护你的账户,并可在稍后重新登录。随后你会看到一个简短的引导向导,用于选择模型、数据集和基本设置。你可以随时跳过。

然后前往 Studio Chat 选项卡,在搜索栏中搜索 Nemotron-3-Nano-4B,并下载你想要的模型和量化版本。

4

运行 Nemotron-3-Nano-4B

在使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。

如需更多信息,你可以查看我们的 Unsloth Studio 推理指南.

Llama.cpp 教程:

在 llama.cpp 中运行的说明(我们将使用 8 位以接近全精度):

1

获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。

2

你可以直接从 Hugging Face 拉取。随着你的 RAM/VRAM 允许,可以将上下文增加到 100 万。

以下内容适用于 通用指令 用例:

以下内容适用于 工具调用 用例:

3

通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 Q8_0 或其他量化版本。

4

然后以对话模式运行模型:

另外,请按需调整 上下文窗口 。确保你的硬件能够处理大于 256K 的上下文窗口。将其设置为 1M 可能会触发 CUDA OOM 并导致崩溃,因此默认值为 262,144。

🖥️ 运行 Nemotron-3-Nano-30B-A3B

根据你的用例,你需要使用不同的设置。一些 GGUF 之所以最终大小相近,是因为模型架构(例如 gpt-oss)的维度不能被 128 整除,因此部分内容无法量化到更低位宽。

该模型的 4 位版本需要约 24GB RAM。8 位版本需要 36GB。

🦥 Unsloth Studio 指南

在本教程中,我们将使用 Unsloth Studio,这是我们用于运行和训练 LLM 的新网页界面。使用 Unsloth Studio,你可以在以下平台本地运行模型: Mac、Windows和 Linux,并且:

1

安装 Unsloth

MacOS、Linux、WSL:

Windows PowerShell:

2

设置 Unsloth Studio(仅需一次)

设置过程会自动安装 Node.js(通过 nvm)、构建前端、安装所有 Python 依赖,并构建带 CUDA 支持的 llama.cpp。

WSL 用户: 系统会提示你输入 sudo 密码以安装构建依赖(cmake, git, libcurl4-openssl-dev).

3

启动 Unsloth

MacOS、Linux、WSL:

Windows PowerShell:

然后在浏览器中打开 http://localhost:8888

4

搜索并下载 Nemotron-3-Nano-30B-A3B

首次启动时,你需要创建密码以保护你的账户,并可在稍后重新登录。随后你会看到一个简短的引导向导,用于选择模型、数据集和基本设置。你可以随时跳过。

然后前往 Studio Chat 选项卡,在搜索栏中搜索 Nemotron-3-Nano-4B,并下载你想要的模型和量化版本。

5

运行 Nemotron-3-Nano-30B-A3B

在使用 Unsloth Studio 时,推理参数应会自动设置,不过你仍然可以手动更改。你也可以编辑上下文长度、聊天模板和其他设置。

如需更多信息,你可以查看我们的 Unsloth Studio 推理指南.

Llama.cpp 教程:

在 llama.cpp 中运行的说明(注意我们将使用 4 位以适配大多数设备):

1

获取最新的 llama.cppGitHub 这里。你也可以按照下面的构建说明操作。将 -DGGML_CUDA=ON 改为 -DGGML_CUDA=OFF 如果你没有 GPU,或者只想进行 CPU 推理。 对于 Apple Mac / Metal 设备,设置 -DGGML_CUDA=OFF 然后照常继续——Metal 支持默认开启。

2

你可以直接从 Hugging Face 拉取。随着你的 RAM/VRAM 允许,可以将上下文增加到 100 万。

以下内容适用于 通用指令 用例:

以下内容适用于 工具调用 用例:

3

通过以下方式下载模型(在安装 pip install huggingface_hub hf_transfer 之后)。你可以选择 UD-Q4_K_XL 或其他量化版本。

4

然后以对话模式运行模型:

另外,请按需调整 上下文窗口 。确保你的硬件能够处理大于 256K 的上下文窗口。将其设置为 1M 可能会触发 CUDA OOM 并导致崩溃,因此默认值为 262,144。

Nemotron 3 使用 <think> ,token ID 为 12;并使用 </think> ,token ID 为 13,用于推理。使用 --special 查看 llama.cpp 的 token。你可能还需要 --verbose-prompt 以查看 <think> ,因为它是预先添加的。

🦥 Nemotron 3 和 RL 微调

Unsloth 现在支持所有 Nemotron 模型的微调,包括 Nemotron 3 Super 和 Nano。

4B 模型可以放在免费的 Colab GPU 上运行,但 30B 模型放不下。我们仍然为你准备了一个 80GB A100 Colab 笔记本来进行微调。Nemotron 3 Nano 的 16 位 LoRA 微调将使用大约 60GB VRAM:

关于 MoE 的微调——微调路由层可能不是个好主意,所以我们默认将其禁用。如果你想保留其推理能力(可选),可以使用直接答案和思维链示例的混合。数据集中至少使用 75% 推理25% 非推理 ,以让模型保留其推理能力。

强化学习 + NeMo Gym

我们与开源的 NVIDIA NeMo Gym 团队合作,以促进 RL 环境的普及。我们的协作使得可以在许多感兴趣的领域进行单轮 rollout RL 训练,包括数学、编程、工具使用等,使用来自 NeMo Gym 的训练环境和数据集:

🦙Llama-server 服务与部署

要将 Nemotron 3 部署到生产环境,我们使用 llama-server 在一个新终端中,例如通过 tmux,按以下方式部署模型:

当你运行上面的命令时,你会得到:

然后在一个新终端中,在执行 pip install openai之后,执行:

这将打印

基准测试

Nemotron-3-Nano-4B 是在其体量范围内表现最好的模型,包括吞吐量。

Nemotron-3-Nano-30B-A3B 是在所有基准测试中表现最好的模型,包括吞吐量。

最后更新于

这有帮助吗?