🧩NVIDIA Nemotron 3 Ultra - comment l’exécuter localement
Exécutez Nemotron-3-Ultra-550B-A55B localement sur votre appareil !
NVIDIA Nemotron 3 Ultra est un modèle ouvert de 550B de paramètres, 55B actifs de raisonnement de pointe et c'est le plus grand modèle publié à ce jour. Nemotron-3-Ultra-550B-A55B est conçu pour des agents autonomes de longue durée et pour le raisonnement dans des flux de travail de codage et de recherche approfondie. C'est le modèle ouvert occidental le plus performant, et adopte la nouvelle licence Open Model, Weights & Data.
Avec jusqu'à 1M de contexte, Nemotron 3 Ultra utilise une architecture hybride Transformer-Mamba MoE et peut conserver l'état de l'agent, les journaux et les plans sur de longues sessions. Les GGUF sont à Nemotron-3-Ultra-550B-A55B avec du 1 bit dynamique occupant 189 Go d'espace disque. Il est également préentraîné avec NVFP4. Nous avons aussi réalisé Benchmarks KLD GGUF.
⚙️ Guide d'utilisation
NVIDIA recommande ces paramètres pour l'inférence :
temperature = 1.0top_p = 0.95
Taille du modèle
550B paramètres au total / 55B paramètres actifs
Longueur de contexte
Jusqu'à 1M de tokens
Architecture
Hybrid Transformer-Mamba MoE avec Latent MoE, prédiction multi-token (MTP actuellement non pris en charge pour les GGUF)
Entrée/sortie du modèle
Entrée texte, sortie texte
Le gabarit de conversation est comme ci-dessous :
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\nExécuter Nemotron-3-Ultra
Les versions 3 bits du modèle nécessitent environ 256 Go de RAM, 4 bits nécessitent environ 300 Go et 8 bits nécessitent 600 Go. Pour ces guides, nous utiliserons la version 3 bits UD-IQ3_XXS qui tient sur un appareil de 256 Go et offre un bon équilibre entre taille et précision. Selon votre cas d'utilisation, vous devrez utiliser des paramètres différents. GGUF : Nemotron-3-Ultra-550B-A55B
Exécuter dans Unsloth StudioExécuter dans llama.cpp
🦥 Guide d'Unsloth Studio
Pour ce tutoriel, nous utiliserons Unsloth Studio, qui est notre interface pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir des images et du texte localement sur Mac, Windows, et Linux, et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Comparer modèles côte à côte
Auto-réparation appel d’outils + recherche web
Exécution de code (Python, Bash)
Ajustement automatique de l’inférence des paramètres (temp, top-p, etc.)
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Configurer Unsloth Studio (une seule fois)
La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge de CUDA.
Utilisateurs de WSL : vous serez invité à saisir votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).
Recherchez et téléchargez Nemotron-3-Ultra
Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Ensuite, allez dans l'onglet Unsloth Chat et recherchez Nemotron-3-Ultra dans la barre de recherche et téléchargez le modèle et la quantification souhaités.
Exécuter Nemotron-3-Ultra
Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.
Pour plus d’informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.
🦙 Tutoriel Llama.cpp :
Instructions pour l'exécution dans llama.cpp (notez que nous utiliserons 4 bits pour tenir sur la plupart des appareils) :
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude - la prise en charge de Metal est activée par défaut.
Téléchargez le modèle via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, consultez : Dépannage de Hugging Face Hub et XET
Puis exécutez le modèle en mode conversation :
Diffusion et déploiement via llama-server
Pour déployer Nemotron-3-Ultra localement, utilisez llama-server. Dans un nouveau terminal, par exemple via tmux, déployez le modèle :
Si vous avez téléchargé le modèle manuellement, utilisez :
Ensuite, dans un nouveau terminal, après avoir installé le client OpenAI avec pip install openai:

Et sur 4 B200, on observe environ 40 tokens/s pour la génération !

Benchmarks GGUF d'Unsloth
Nous avons également effectué une analyse KLD pour nos quantifications GGUF - sur une échelle logarithmique de la KLD moyenne, le modèle perd très peu de précision même lorsqu'il est quantifié jusqu'à 1 bit grâce à notre méthodologie dynamique où les couches les plus importantes sont conservées en précision plus élevée et le reste en bits plus faibles.

Sur une échelle linéaire :

Benchmarks officiels
Nemotron 3 Ultra est le plus grand modèle de raisonnement Nemotron 3 de NVIDIA et est positionné pour offrir une précision de pointe sur les tâches de raisonnement avancé, de codage et agentiques, tout en optimisant le temps nécessaire à l'exécution des tâches grâce à un débit élevé.
Ultra est particulièrement adapté aux charges de travail où la réussite de la tâche dépend d'un raisonnement soutenu plutôt que de réponses courtes en un seul tour :
Sessions de codage autonomes sur de grands dépôts
Recherche approfondie à partir de nombreuses sources avec des éléments contradictoires
Flux de travail d'entreprise avec des boucles persistantes d'utilisation d'outils
Vérification de la conception de circuits / puces et analyse des défaillances
Comme le montrent la Figure 1 et la Figure 2, Nemotron 3 Ultra est leader en précision sur la productivité des agents, le suivi d'instructions et les tâches à long contexte, et offre des performances globalement leaders, permettant d'économiser 30 % sur les coûts par rapport aux autres modèles ouverts leaders.
Figure 1 : Nemotron 3 Ultra est leader parmi les modèles ouverts sur les benchmarks agentiques pour la productivité des agents, le codage et le suivi d'instructions.

Figure 2 : Nemotron 3 Ultra permet d'économiser jusqu'à 30 % sur les coûts et est leader sur la frontière d'efficience des coûts

Davantage de benchmarks de NVIDIA :
Agentique
Terminal Bench 2.1
56.4
55.5
59.3
67.2
49.9
49.2
54.2
GDPVal
46.7
47.6
54.7
50.4
34.6
54.6
50.2
SWE-Bench Verified
71.9
72.2
73.8
69.5
69.9
74.0
72.4
SWE-Bench Multilingual
67.7
69.2
73.8
65.9
67.7
71.9
72.1
ProfBench (Search)
56.0
52.0
46.0
56.0
53.0
59.9
57.0
PinchBench
90.0
77.6
81.2
90.2
86.6
88.6
91.3
TauBench V3
Aérien
81.5
75.3
85.0
85.8
76.5
80.8
80.8
Commerce de détail
86.4
84.9
84.1
82.9
88.5
88.9
89.1
Télécom
92.9
89.6
96.9
97.8
98.0
96.3
98.3
Banque
22.6
14.6
12.8
23.1
20.9
25.9
26.7
Moyenne
70.9
66.1
69.7
72.4
71.0
73.2
73.7
BrowseComp
44.4
54.1
59.4
61.3
40.5
59.4
46.9
Vals.ai Financial Agent 1.1
sans recherche web
60.1
51.3
60.2
54.0
61.3
58.9
58.4
avec recherche web
53.7
50.5
60.7
58.8
59.0
62.3
60.1
Raisonnement et connaissances
IOI 2025
570.0
--
456.5
585.0
441.3
580.1
--
LiveCodeBench (v6)
89.0
77.2
85.7
90.2
79.3
92.5
90.9
IMOAnswerBench (sans outils)
88.6
68.3
86.8
91.1
83.1
93.0
91.1
IMOAnswerBench (avec outils)
92.3
75.1
91.1
93.71
84.51
85.4
89.6
Apex-Shortlist (sans outils)
74.9
28.9
71.1
77.4
61.4
85.8
82.4
Apex-Shortlist (avec outils)
84.8
51.9
79.0
73.2
60.4
86.5
82.0
GPQA (sans outils)
87.0
86.6
86.1
91.0
87.1
87.8
88.5
SciCode (sous-tâche)
44.6
38.3
47.7
52.0
48.0
50.5
48.2
HLE (sans outils)
26.7
23.1
27.2
34.8
28.5
37.7
32.2
HLE (avec outils)
37.4
--
50.4
54.0
48.3
48.2
45.1
CritPt (sans outils)
3.1
0.6
3.7
9.1
2.4
14.0
10.6
MMLU-Pro
86.8
81.9
85.9
88.1
88.3
87.5
86.4
Précision OmniScience
24.1
20.5
31.3
35.5
35.9
46.8
39.9
Non-hallucination OmniScience
78.7
74.4
66.8
67.1
7.4
5.7
2.8
Chat et suivi d'instructions
IFBench (prompt souple)
81.7
74.6
76.6
73.7
78.2
79.1
82.0
Multi-défis
63.8
42.5
63.0
63.1
63.9
64.1
63.5
Contexte long
AA-LCR
65.4
69.8
66.9
70.2
68.3
67.3
62.7
RULER (1M)
94.7
--
--
--
90.1
94.2
87.7
LongBench v2 (≤ 1M)
61.9
--
--
--
68.9
62.1
57.0
Multilingue
MMLU-ProX (moyenne en/de/fr/es/it/ja/zh/hi/pt/ko)
83.0
78.4
85.8
85.0
86.4
85.6
84.3
WMT24++ (en→xx)
83.7
82.8
84.4
84.5
86.8
85.9
85.9
Mis à jour
Ce contenu vous a-t-il été utile ?


