For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Ultra - ローカル実行方法

Nemotron-3-Ultra-550B-A55Bをデバイス上でローカル実行しましょう!

NVIDIA Nemotron 3 Ultra はオープン 5500億パラメータ、550億アクティブ 最先端の推論モデルであり、NVIDIA の 最大のモデル これまでにリリースされたものです。Nemotron-3-Ultra-550B-A55B は、長時間稼働する自律エージェントや、コーディング、深いリサーチのワークフロー全体にわたる推論向けに構築されています。これは 最も強力な西側のオープンモデルであり、新しい Open Model, Weights & Data License を採用しています。

最大 100万コンテキスト、Nemotron 3 Ultra は Hybrid Transformer-Mamba MoE アーキテクチャを採用し、長時間のセッションをまたいでエージェントの状態、ログ、計画を保持できます。GGUF は Nemotron-3-Ultra-550B-A55B 可変1bitではディスク容量を189GB使用します。また、NVFP4 を使用して事前学習されています。私たちはまた GGUF KLD ベンチマーク.

⚙️ 使用ガイド

NVIDIA は推論に次の設定を推奨しています:

  • temperature = 1.0

  • top_p = 0.95

詳細
Nemotron 3 Ultra

モデルサイズ

総パラメータ数 550B / アクティブパラメータ数 55B

コンテキスト長

最大 100万トークン

アーキテクチャ

Latent MoE を備えた Hybrid Transformer-Mamba MoE、Multi-Token Prediction(MTP は現在 GGUF では未サポート)

モデル入出力

テキスト入力、テキスト出力

チャットテンプレートは以下のとおりです:

<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\n

Nemotron-3-Ultra を実行

このモデルの3ビット版には約256GBのRAMが必要で、4ビット版には約300GB、8ビット版には600GBが必要です。これらのガイドでは、3ビットを使用します UD-IQ3_XXS これは256GBのデバイスに収まり、サイズと精度のバランスが良好です。ユースケースに応じて、 異なる設定を使用する必要があります. GGUF: Nemotron-3-Ultra-550B-A55B

Unsloth Studio で実行llama.cpp で実行

🦥 Unsloth Studio ガイド

このチュートリアルでは、 Unsloth Studioは、LLM の実行と学習のための私たちの UI です。Unsloth Studio を使えば、モデルを実行し、画像とテキストをローカルで入力できます Mac、Windows、Linux 上で使用でき、次のことが可能です:

1

Unsloth をインストール

MacOS、Linux、WSL:

Windows PowerShell:

2

Unsloth Studio のセットアップ(1回のみ)

セットアップにより、Node.js(nvm 経由)の自動インストール、フロントエンドのビルド、すべての Python 依存関係のインストール、CUDA サポート付きの llama.cpp のビルドが行われます。

WSL ユーザー向け: 次の入力を求められます: sudo ビルド依存関係をインストールするためのパスワード(cmake, git, libcurl4-openssl-dev).

3

Unsloth を起動

MacOS、Linux、WSL:

Windows PowerShell:

次に開きます http://127.0.0.1:8888 をブラウザーで。

4

Nemotron-3-Ultra を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。次に、 Unsloth Chat タブを開き、検索バーで Nemotron-3-Ultra を検索して、目的のモデルと量子化版をダウンロードしてください。

5

Nemotron-3-Ultra を実行

Unsloth Studio を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、 Unsloth Studio 推論ガイド.

6

Nemotron-3-Ultra の提供

次も使用できます unsloth studio run 次のように llama-server 経由でモデルを提供できます:

🦙 Llama.cpp チュートリアル:

llama.cpp で実行する手順(ほとんどのデバイスに収まるよう4ビットを使用します):

1

最新の llama.cpp こちら GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON へ変更すると -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

2

以下のコードでモデルをダウンロードします( pip install huggingface_hubをインストールした後)。Q4_K_M や、次のような他の量子化版を選択できます UD-Q4_K_XL 。少なくとも2ビットの動的量子化を使用することを推奨します UD-Q2_K_XL 。サイズと精度のバランスを取るためです。ダウンロードが止まる場合は、こちらを参照してください: Hugging Face Hub、XETのデバッグ

3

次に、会話モードでモデルを実行します:

Llama-server による提供とデプロイ

Nemotron-3-Ultra をローカルにデプロイするには、 llama-serverを使用します。新しいターミナルで、たとえば tmux経由で、モデルをデプロイします:

モデルを手動でダウンロードした場合は、次を使用します:

次に、新しいターミナルで、OpenAI クライアントを以下でインストールした後、 pip install openai:

また、B200 4台では、生成速度として約40 tokens/s が確認されています!

Unsloth GGUF ベンチマーク

私たちの GGUF 量子化版についても KLD 分析を行いました。対数平均 KLD スケールでは、私たちの 動的手法 手法では、より重要な層は高精度のまま残し、残りはより低いビット数にします。

線形スケールでは:

公式ベンチマーク

Nemotron 3 Ultra は NVIDIA の最大の Nemotron 3 推論モデルであり、高スループットによりタスク完了までの時間を最適化しつつ、最先端の推論、コーディング、エージェントタスクで最高水準の精度を目指して配置されています。

Ultra は、短い単発応答ではなく持続的な推論にタスク成功が依存するワークロードに特に適しています:

  • 大規模リポジトリ全体にわたる自律的なコーディングセッション

  • 相反する証拠を含む多数の情報源にわたる深いリサーチ

  • ツール使用ループを持続するエンタープライズワークフロー

  • EDA / チップ設計の検証と故障解析

図1および図2に示すように、Nemotron 3 Ultra はエージェント生産性、指示追従、長文コンテキストタスクの精度で優れており、スループットも優秀で、他の主要なオープンモデルと比べてコストを30%削減します。

図1:Nemotron 3 Ultra は、エージェント生産性、コーディング、指示追従のエージェントベンチマークにおいて、オープンモデルの中で首位です。

Image of a table showing Nemotron 3 Ultra leading among open models on agentic benchmarks for agent productivity, coding, and instruction following.

図2:Nemotron 3 Ultra はコストを最大30%削減し、コスト効率フロンティアで首位です

Nemotron 3 Ultra がコストを最大30%削減し、コスト効率フロンティアで首位であることを示す画像

NVIDIA によるその他のベンチマーク:

ベンチマーク
N-3-Ultra 550B-A55B
MiniMax-2.7 230B-A10B
GLM-5.1 744B-A40B
Kimi-K2.6 1T-A32B

エージェント

Terminal Bench 2.1

56.4

55.5

59.3

67.2

49.9

49.2

54.2

GDPVal

46.7

47.6

54.7

50.4

34.6

54.6

50.2

SWE-Bench Verified

71.9

72.2

73.8

69.5

69.9

74.0

72.4

SWE-Bench Multilingual

67.7

69.2

73.8

65.9

67.7

71.9

72.1

ProfBench (Search)

56.0

52.0

46.0

56.0

53.0

59.9

57.0

PinchBench

90.0

77.6

81.2

90.2

86.6

88.6

91.3

TauBench V3

航空

81.5

75.3

85.0

85.8

76.5

80.8

80.8

小売

86.4

84.9

84.1

82.9

88.5

88.9

89.1

通信

92.9

89.6

96.9

97.8

98.0

96.3

98.3

銀行

22.6

14.6

12.8

23.1

20.9

25.9

26.7

平均

70.9

66.1

69.7

72.4

71.0

73.2

73.7

BrowseComp

44.4

54.1

59.4

61.3

40.5

59.4

46.9

Vals.ai Financial Agent 1.1

ウェブ検索なし

60.1

51.3

60.2

54.0

61.3

58.9

58.4

ウェブ検索あり

53.7

50.5

60.7

58.8

59.0

62.3

60.1

推論と知識

IOI 2025

570.0

--

456.5

585.0

441.3

580.1

--

LiveCodeBench (v6)

89.0

77.2

85.7

90.2

79.3

92.5

90.9

IMOAnswerBench(ツールなし)

88.6

68.3

86.8

91.1

83.1

93.0

91.1

IMOAnswerBench(ツールあり)

92.3

75.1

91.1

93.71

84.51

85.4

89.6

Apex-Shortlist(ツールなし)

74.9

28.9

71.1

77.4

61.4

85.8

82.4

Apex-Shortlist(ツールあり)

84.8

51.9

79.0

73.2

60.4

86.5

82.0

GPQA(ツールなし)

87.0

86.6

86.1

91.0

87.1

87.8

88.5

SciCode(サブタスク)

44.6

38.3

47.7

52.0

48.0

50.5

48.2

HLE(ツールなし)

26.7

23.1

27.2

34.8

28.5

37.7

32.2

HLE(ツールあり)

37.4

--

50.4

54.0

48.3

48.2

45.1

CritPt(ツールなし)

3.1

0.6

3.7

9.1

2.4

14.0

10.6

MMLU-Pro

86.8

81.9

85.9

88.1

88.3

87.5

86.4

OmniScience の正確性

24.1

20.5

31.3

35.5

35.9

46.8

39.9

OmniScience の非幻覚率

78.7

74.4

66.8

67.1

7.4

5.7

2.8

チャットと指示追従

IFBench(ゆるいプロンプト)

81.7

74.6

76.6

73.7

78.2

79.1

82.0

マルチチャレンジ

63.8

42.5

63.0

63.1

63.9

64.1

63.5

長文コンテキスト

AA-LCR

65.4

69.8

66.9

70.2

68.3

67.3

62.7

RULER (1M)

94.7

--

--

--

90.1

94.2

87.7

Longbench v2(≤ 100万)

61.9

--

--

--

68.9

62.1

57.0

多言語

MMLU-ProX(平均 en/de/fr/es/it/ja/zh/hi/pt/ko)

83.0

78.4

85.8

85.0

86.4

85.6

84.3

WMT24++(en→xx)

83.7

82.8

84.4

84.5

86.8

85.9

85.9

最終更新

役に立ちましたか?