For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron-3-Super: 実行ガイド

NVIDIA Nemotron-3-Super-120B-A12Bをデバイス上でローカル実行・ファインチューニングしましょう!

NVIDIA がリリース Nemotron-3-Super-120B-A12B、12Bのアクティブパラメータを持つ120Bのオープンなハイブリッド推論MoEモデルで、先行してリリースされた Nemotron-3-Nano、その30B版に続くものです。Nemotron-3-Superは、マルチエージェントAI向けに高い効率と精度を実現するよう設計されています。 100万トークンの コンテキストウィンドウにより、AIME 2025、Terminal Bench、SWE-Bench Verifiedベンチマークで同クラスをリードし、さらに最高スループットを達成しています。

Nemotron-3-Superは、 64GB のRAM、VRAM、またはユニファイドメモリを搭載したデバイス上で動作し、現在はローカルでファインチューニング可能です。Unslothに初日サポートを提供してくれたNVIDIAに感謝します。

Nemotron 3 SuperNemotron 3 Nano

GGUF: Nemotron-3-Super-120B-A12B-GGUFNVFP4FP8BF16

⚙️ 使用ガイド

NVIDIA は推論用に次の設定を推奨しています:

一般的なチャット/インストラクション(デフォルト):

  • temperature = 1.0

  • top_p = 1.0

ツール呼び出しのユースケース:

  • temperature = 0.6

  • top_p = 0.95

ほとんどのローカル利用では、次のように設定します:

  • max_new_tokens = 32,768262,144 最大 100万トークンの標準プロンプト向け

  • 必要に応じて、RAM/VRAM の許す範囲で深い推論や長文生成向けに増やしてください。

チャットテンプレートの形式は、以下を使用すると確認できます:

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)

Nemotron 3 のチャットテンプレート形式:

Nemotron 3 は <think> トークン ID 12 で </think> トークン ID 13 で推論を行います。 --special を使うと llama.cpp のトークンを確認できます。必要に応じて --verbose-prompt を使って <think> 先頭に付加されているため表示してください。

🖥️ Nemotron-3-Super-120B-A12Bを実行

用途によって、異なる設定を使う必要があります。一部の GGUF は、モデルアーキテクチャ(たとえば gpt-oss)は128で割り切れない次元を持つため、一部は低ビットに量子化できません。GGUFにアクセス こちら.

このモデルの4ビット版には約64GB〜72GBのRAMが必要です。8ビット版には128GBが必要です。

Llama.cpp チュートリアル(GGUF):

llama.cpp で実行するための手順(ほとんどのデバイスに収まるよう 4-bit を使用します):

1

最新の llama.cppGitHub こちらから取得してください。以下のビルド手順に従うこともできます。 -DGGML_CUDA=ON-DGGML_CUDA=OFF に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合です。

2

Hugging Face から直接取得できます。RAM/VRAM が許す範囲でコンテキストを 100万 に増やせます。

以下を参照してください: 一般向けの説明 ユースケース:

以下を参照してください: ツール呼び出し ユースケース:

3

モデルのダウンロード( pip install huggingface_hub hf_transfer )。Q4_K_Mや、次のような他の量子化版を選べます UD-Q4_K_XL 。サイズと精度のバランスのため、少なくとも2ビットのDynamic量子化を使うことを推奨します UD-Q2_K_XL 。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ

4

その後、会話モードでモデルを実行します:

また、 コンテキストウィンドウ も必要に応じて調整してください。ハードウェアが 256K を超えるコンテキストウィンドウに対応できることを確認してください。1M に設定すると CUDA の OOM を引き起こしてクラッシュする可能性があるため、デフォルトは 262,144 です。

🦥 Nemotron 3 と RL のファインチューニング

Unslothは現在、Nemotron 3 SuperとNanoを含むすべてのNemotronモデルのファインチューニングをサポートしています。Nanoのノートブック例については、私たちのNemotron 3 Nanoファインチューニングガイド.

Nemotron 3 Super

  • 安定性のため、Router層のファインチューニングはデフォルトで無効になっています。

  • Nemotron-3-Super-120B - bf16 LoRAは256GBのVRAMで動作します。マルチGPUを使用している場合は、 device_map = "balanced" を追加するか、私たちの マルチGPUガイド.

🦙Llama-server のサービングとデプロイ

Nemotron 3 を本番環境にデプロイするには、次を使用します llama-server を使用します。新しいターミナルで、たとえば tmux 経由で、次のようにモデルをデプロイします:

上記を実行すると、次のようになります:

次に新しいターミナルで、 pip install openaiを実行した後、次を行います:

すると次を出力します

ベンチマーク

同規模のモデルと比べても、Nemotron 3 Superは競争力のある性能を発揮し、さらに最高スループットを提供します。

最終更新

役に立ちましたか?