For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Ultra - comment l’exécuter localement

Exécutez Nemotron-3-Ultra-550B-A55B localement sur votre appareil !

NVIDIA Nemotron 3 Ultra est un modèle ouvert de 550B de paramètres, 55B actifs de raisonnement de pointe et c'est le plus grand modèle publié à ce jour. Nemotron-3-Ultra-550B-A55B est conçu pour des agents autonomes de longue durée et pour le raisonnement dans des flux de travail de codage et de recherche approfondie. C'est le modèle ouvert occidental le plus performant, et adopte la nouvelle licence Open Model, Weights & Data.

Avec jusqu'à 1M de contexte, Nemotron 3 Ultra utilise une architecture hybride Transformer-Mamba MoE et peut conserver l'état de l'agent, les journaux et les plans sur de longues sessions. Les GGUF sont à Nemotron-3-Ultra-550B-A55B avec du 1 bit dynamique occupant 189 Go d'espace disque. Il est également préentraîné avec NVFP4. Nous avons aussi réalisé Benchmarks KLD GGUF.

⚙️ Guide d'utilisation

NVIDIA recommande ces paramètres pour l'inférence :

  • temperature = 1.0

  • top_p = 0.95

Détail
Nemotron 3 Ultra

Taille du modèle

550B paramètres au total / 55B paramètres actifs

Longueur de contexte

Jusqu'à 1M de tokens

Architecture

Hybrid Transformer-Mamba MoE avec Latent MoE, prédiction multi-token (MTP actuellement non pris en charge pour les GGUF)

Entrée/sortie du modèle

Entrée texte, sortie texte

Le gabarit de conversation est comme ci-dessous :

<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\n

Exécuter Nemotron-3-Ultra

Les versions 3 bits du modèle nécessitent environ 256 Go de RAM, 4 bits nécessitent environ 300 Go et 8 bits nécessitent 600 Go. Pour ces guides, nous utiliserons la version 3 bits UD-IQ3_XXS qui tient sur un appareil de 256 Go et offre un bon équilibre entre taille et précision. Selon votre cas d'utilisation, vous devrez utiliser des paramètres différents. GGUF : Nemotron-3-Ultra-550B-A55B

Exécuter dans Unsloth StudioExécuter dans llama.cpp

🦥 Guide d'Unsloth Studio

Pour ce tutoriel, nous utiliserons Unsloth Studio, qui est notre interface pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir des images et du texte localement sur Mac, Windows, et Linux, et :

1

Installer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

2

Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge de CUDA.

Utilisateurs de WSL : vous serez invité à saisir votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).

3

Lancer Unsloth

MacOS, Linux, WSL :

Windows PowerShell :

Puis ouvrez http://127.0.0.1:8888 dans votre navigateur.

4

Recherchez et téléchargez Nemotron-3-Ultra

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Ensuite, allez dans l'onglet Unsloth Chat et recherchez Nemotron-3-Ultra dans la barre de recherche et téléchargez le modèle et la quantification souhaités.

5

Exécuter Nemotron-3-Ultra

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.

Pour plus d’informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

6

Servir Nemotron-3-Ultra

Vous pouvez également utiliser unsloth studio run pour servir le modèle via llama-server, comme ceci :

🦙 Tutoriel Llama.cpp :

Instructions pour l'exécution dans llama.cpp (notez que nous utiliserons 4 bits pour tenir sur la plupart des appareils) :

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude - la prise en charge de Metal est activée par défaut.

2

Téléchargez le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, consultez : Dépannage de Hugging Face Hub et XET

3

Puis exécutez le modèle en mode conversation :

Diffusion et déploiement via llama-server

Pour déployer Nemotron-3-Ultra localement, utilisez llama-server. Dans un nouveau terminal, par exemple via tmux, déployez le modèle :

Si vous avez téléchargé le modèle manuellement, utilisez :

Ensuite, dans un nouveau terminal, après avoir installé le client OpenAI avec pip install openai:

Et sur 4 B200, on observe environ 40 tokens/s pour la génération !

Benchmarks GGUF d'Unsloth

Nous avons également effectué une analyse KLD pour nos quantifications GGUF - sur une échelle logarithmique de la KLD moyenne, le modèle perd très peu de précision même lorsqu'il est quantifié jusqu'à 1 bit grâce à notre méthodologie dynamique où les couches les plus importantes sont conservées en précision plus élevée et le reste en bits plus faibles.

Sur une échelle linéaire :

Benchmarks officiels

Nemotron 3 Ultra est le plus grand modèle de raisonnement Nemotron 3 de NVIDIA et est positionné pour offrir une précision de pointe sur les tâches de raisonnement avancé, de codage et agentiques, tout en optimisant le temps nécessaire à l'exécution des tâches grâce à un débit élevé.

Ultra est particulièrement adapté aux charges de travail où la réussite de la tâche dépend d'un raisonnement soutenu plutôt que de réponses courtes en un seul tour :

  • Sessions de codage autonomes sur de grands dépôts

  • Recherche approfondie à partir de nombreuses sources avec des éléments contradictoires

  • Flux de travail d'entreprise avec des boucles persistantes d'utilisation d'outils

  • Vérification de la conception de circuits / puces et analyse des défaillances

Comme le montrent la Figure 1 et la Figure 2, Nemotron 3 Ultra est leader en précision sur la productivité des agents, le suivi d'instructions et les tâches à long contexte, et offre des performances globalement leaders, permettant d'économiser 30 % sur les coûts par rapport aux autres modèles ouverts leaders.

Figure 1 : Nemotron 3 Ultra est leader parmi les modèles ouverts sur les benchmarks agentiques pour la productivité des agents, le codage et le suivi d'instructions.

Image of a table showing Nemotron 3 Ultra leading among open models on agentic benchmarks for agent productivity, coding, and instruction following.

Figure 2 : Nemotron 3 Ultra permet d'économiser jusqu'à 30 % sur les coûts et est leader sur la frontière d'efficience des coûts

Image montrant que Nemotron 3 Ultra permet d'économiser jusqu'à 30 % sur les coûts et est leader sur la frontière d'efficience des coûts

Davantage de benchmarks de NVIDIA :

Benchmark
N-3-Ultra 550B-A55B
MiniMax-2.7 230B-A10B
GLM-5.1 744B-A40B
Kimi-K2.6 1T-A32B

Agentique

Terminal Bench 2.1

56.4

55.5

59.3

67.2

49.9

49.2

54.2

GDPVal

46.7

47.6

54.7

50.4

34.6

54.6

50.2

SWE-Bench Verified

71.9

72.2

73.8

69.5

69.9

74.0

72.4

SWE-Bench Multilingual

67.7

69.2

73.8

65.9

67.7

71.9

72.1

ProfBench (Search)

56.0

52.0

46.0

56.0

53.0

59.9

57.0

PinchBench

90.0

77.6

81.2

90.2

86.6

88.6

91.3

TauBench V3

Aérien

81.5

75.3

85.0

85.8

76.5

80.8

80.8

Commerce de détail

86.4

84.9

84.1

82.9

88.5

88.9

89.1

Télécom

92.9

89.6

96.9

97.8

98.0

96.3

98.3

Banque

22.6

14.6

12.8

23.1

20.9

25.9

26.7

Moyenne

70.9

66.1

69.7

72.4

71.0

73.2

73.7

BrowseComp

44.4

54.1

59.4

61.3

40.5

59.4

46.9

Vals.ai Financial Agent 1.1

sans recherche web

60.1

51.3

60.2

54.0

61.3

58.9

58.4

avec recherche web

53.7

50.5

60.7

58.8

59.0

62.3

60.1

Raisonnement et connaissances

IOI 2025

570.0

--

456.5

585.0

441.3

580.1

--

LiveCodeBench (v6)

89.0

77.2

85.7

90.2

79.3

92.5

90.9

IMOAnswerBench (sans outils)

88.6

68.3

86.8

91.1

83.1

93.0

91.1

IMOAnswerBench (avec outils)

92.3

75.1

91.1

93.71

84.51

85.4

89.6

Apex-Shortlist (sans outils)

74.9

28.9

71.1

77.4

61.4

85.8

82.4

Apex-Shortlist (avec outils)

84.8

51.9

79.0

73.2

60.4

86.5

82.0

GPQA (sans outils)

87.0

86.6

86.1

91.0

87.1

87.8

88.5

SciCode (sous-tâche)

44.6

38.3

47.7

52.0

48.0

50.5

48.2

HLE (sans outils)

26.7

23.1

27.2

34.8

28.5

37.7

32.2

HLE (avec outils)

37.4

--

50.4

54.0

48.3

48.2

45.1

CritPt (sans outils)

3.1

0.6

3.7

9.1

2.4

14.0

10.6

MMLU-Pro

86.8

81.9

85.9

88.1

88.3

87.5

86.4

Précision OmniScience

24.1

20.5

31.3

35.5

35.9

46.8

39.9

Non-hallucination OmniScience

78.7

74.4

66.8

67.1

7.4

5.7

2.8

Chat et suivi d'instructions

IFBench (prompt souple)

81.7

74.6

76.6

73.7

78.2

79.1

82.0

Multi-défis

63.8

42.5

63.0

63.1

63.9

64.1

63.5

Contexte long

AA-LCR

65.4

69.8

66.9

70.2

68.3

67.3

62.7

RULER (1M)

94.7

--

--

--

90.1

94.2

87.7

LongBench v2 (≤ 1M)

61.9

--

--

--

68.9

62.1

57.0

Multilingue

MMLU-ProX (moyenne en/de/fr/es/it/ja/zh/hi/pt/ko)

83.0

78.4

85.8

85.0

86.4

85.6

84.3

WMT24++ (en→xx)

83.7

82.8

84.4

84.5

86.8

85.9

85.9

Mis à jour

Ce contenu vous a-t-il été utile ?