🧩NVIDIA Nemotron 3 Ultra - ローカル実行方法
Nemotron-3-Ultra-550B-A55Bをデバイス上でローカル実行しましょう!
NVIDIA Nemotron 3 Ultra はオープン 5500億パラメータ、550億アクティブ 最先端の推論モデルであり、NVIDIA の 最大のモデル これまでにリリースされたものです。Nemotron-3-Ultra-550B-A55B は、長時間稼働する自律エージェントや、コーディング、深いリサーチのワークフロー全体にわたる推論向けに構築されています。これは 最も強力な西側のオープンモデルであり、新しい Open Model, Weights & Data License を採用しています。
最大 100万コンテキスト、Nemotron 3 Ultra は Hybrid Transformer-Mamba MoE アーキテクチャを採用し、長時間のセッションをまたいでエージェントの状態、ログ、計画を保持できます。GGUF は Nemotron-3-Ultra-550B-A55B 可変1bitではディスク容量を189GB使用します。また、NVFP4 を使用して事前学習されています。私たちはまた GGUF KLD ベンチマーク.
⚙️ 使用ガイド
NVIDIA は推論に次の設定を推奨しています:
temperature = 1.0top_p = 0.95
モデルサイズ
総パラメータ数 550B / アクティブパラメータ数 55B
コンテキスト長
最大 100万トークン
アーキテクチャ
Latent MoE を備えた Hybrid Transformer-Mamba MoE、Multi-Token Prediction(MTP は現在 GGUF では未サポート)
モデル入出力
テキスト入力、テキスト出力
チャットテンプレートは以下のとおりです:
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\nNemotron-3-Ultra を実行
このモデルの3ビット版には約256GBのRAMが必要で、4ビット版には約300GB、8ビット版には600GBが必要です。これらのガイドでは、3ビットを使用します UD-IQ3_XXS これは256GBのデバイスに収まり、サイズと精度のバランスが良好です。ユースケースに応じて、 異なる設定を使用する必要があります. GGUF: Nemotron-3-Ultra-550B-A55B
Unsloth Studio で実行llama.cpp で実行
🦥 Unsloth Studio ガイド
このチュートリアルでは、 Unsloth Studioは、LLM の実行と学習のための私たちの UI です。Unsloth Studio を使えば、モデルを実行し、画像とテキストをローカルで入力できます Mac、Windows、Linux 上で使用でき、次のことが可能です:
検索、ダウンロード、 GGUF を実行 および safetensor モデル
比較 モデルを 並べて
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-p など)
LLM を学習 VRAM を 70% 削減し、2倍高速

Nemotron-3-Ultra を検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。次に、 Unsloth Chat タブを開き、検索バーで Nemotron-3-Ultra を検索して、目的のモデルと量子化版をダウンロードしてください。
Nemotron-3-Ultra を実行
Unsloth Studio を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、 Unsloth Studio 推論ガイド.
🦙 Llama.cpp チュートリアル:
llama.cpp で実行する手順(ほとんどのデバイスに収まるよう4ビットを使用します):
最新の llama.cpp こちら GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON へ変更すると -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
以下のコードでモデルをダウンロードします( pip install huggingface_hubをインストールした後)。Q4_K_M や、次のような他の量子化版を選択できます UD-Q4_K_XL 。少なくとも2ビットの動的量子化を使用することを推奨します UD-Q2_K_XL 。サイズと精度のバランスを取るためです。ダウンロードが止まる場合は、こちらを参照してください: Hugging Face Hub、XETのデバッグ
次に、会話モードでモデルを実行します:
Llama-server による提供とデプロイ
Nemotron-3-Ultra をローカルにデプロイするには、 llama-serverを使用します。新しいターミナルで、たとえば tmux経由で、モデルをデプロイします:
モデルを手動でダウンロードした場合は、次を使用します:
次に、新しいターミナルで、OpenAI クライアントを以下でインストールした後、 pip install openai:

また、B200 4台では、生成速度として約40 tokens/s が確認されています!

Unsloth GGUF ベンチマーク
私たちの GGUF 量子化版についても KLD 分析を行いました。対数平均 KLD スケールでは、私たちの 動的手法 手法では、より重要な層は高精度のまま残し、残りはより低いビット数にします。

線形スケールでは:

公式ベンチマーク
Nemotron 3 Ultra は NVIDIA の最大の Nemotron 3 推論モデルであり、高スループットによりタスク完了までの時間を最適化しつつ、最先端の推論、コーディング、エージェントタスクで最高水準の精度を目指して配置されています。
Ultra は、短い単発応答ではなく持続的な推論にタスク成功が依存するワークロードに特に適しています:
大規模リポジトリ全体にわたる自律的なコーディングセッション
相反する証拠を含む多数の情報源にわたる深いリサーチ
ツール使用ループを持続するエンタープライズワークフロー
EDA / チップ設計の検証と故障解析
図1および図2に示すように、Nemotron 3 Ultra はエージェント生産性、指示追従、長文コンテキストタスクの精度で優れており、スループットも優秀で、他の主要なオープンモデルと比べてコストを30%削減します。
図1:Nemotron 3 Ultra は、エージェント生産性、コーディング、指示追従のエージェントベンチマークにおいて、オープンモデルの中で首位です。

図2:Nemotron 3 Ultra はコストを最大30%削減し、コスト効率フロンティアで首位です

NVIDIA によるその他のベンチマーク:
エージェント
Terminal Bench 2.1
56.4
55.5
59.3
67.2
49.9
49.2
54.2
GDPVal
46.7
47.6
54.7
50.4
34.6
54.6
50.2
SWE-Bench Verified
71.9
72.2
73.8
69.5
69.9
74.0
72.4
SWE-Bench Multilingual
67.7
69.2
73.8
65.9
67.7
71.9
72.1
ProfBench (Search)
56.0
52.0
46.0
56.0
53.0
59.9
57.0
PinchBench
90.0
77.6
81.2
90.2
86.6
88.6
91.3
TauBench V3
航空
81.5
75.3
85.0
85.8
76.5
80.8
80.8
小売
86.4
84.9
84.1
82.9
88.5
88.9
89.1
通信
92.9
89.6
96.9
97.8
98.0
96.3
98.3
銀行
22.6
14.6
12.8
23.1
20.9
25.9
26.7
平均
70.9
66.1
69.7
72.4
71.0
73.2
73.7
BrowseComp
44.4
54.1
59.4
61.3
40.5
59.4
46.9
Vals.ai Financial Agent 1.1
ウェブ検索なし
60.1
51.3
60.2
54.0
61.3
58.9
58.4
ウェブ検索あり
53.7
50.5
60.7
58.8
59.0
62.3
60.1
推論と知識
IOI 2025
570.0
--
456.5
585.0
441.3
580.1
--
LiveCodeBench (v6)
89.0
77.2
85.7
90.2
79.3
92.5
90.9
IMOAnswerBench(ツールなし)
88.6
68.3
86.8
91.1
83.1
93.0
91.1
IMOAnswerBench(ツールあり)
92.3
75.1
91.1
93.71
84.51
85.4
89.6
Apex-Shortlist(ツールなし)
74.9
28.9
71.1
77.4
61.4
85.8
82.4
Apex-Shortlist(ツールあり)
84.8
51.9
79.0
73.2
60.4
86.5
82.0
GPQA(ツールなし)
87.0
86.6
86.1
91.0
87.1
87.8
88.5
SciCode(サブタスク)
44.6
38.3
47.7
52.0
48.0
50.5
48.2
HLE(ツールなし)
26.7
23.1
27.2
34.8
28.5
37.7
32.2
HLE(ツールあり)
37.4
--
50.4
54.0
48.3
48.2
45.1
CritPt(ツールなし)
3.1
0.6
3.7
9.1
2.4
14.0
10.6
MMLU-Pro
86.8
81.9
85.9
88.1
88.3
87.5
86.4
OmniScience の正確性
24.1
20.5
31.3
35.5
35.9
46.8
39.9
OmniScience の非幻覚率
78.7
74.4
66.8
67.1
7.4
5.7
2.8
チャットと指示追従
IFBench(ゆるいプロンプト)
81.7
74.6
76.6
73.7
78.2
79.1
82.0
マルチチャレンジ
63.8
42.5
63.0
63.1
63.9
64.1
63.5
長文コンテキスト
AA-LCR
65.4
69.8
66.9
70.2
68.3
67.3
62.7
RULER (1M)
94.7
--
--
--
90.1
94.2
87.7
Longbench v2(≤ 100万)
61.9
--
--
--
68.9
62.1
57.0
多言語
MMLU-ProX(平均 en/de/fr/es/it/ja/zh/hi/pt/ko)
83.0
78.4
85.8
85.0
86.4
85.6
84.3
WMT24++(en→xx)
83.7
82.8
84.4
84.5
86.8
85.9
85.9
最終更新
役に立ちましたか?


