> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/nemotron-3-ultra.md).

# NVIDIA Nemotron 3 Ultra - Comment exécuter localement

NVIDIA Nemotron 3 Ultra est un modèle ouvert **de 550B de paramètres, 55B actifs** de raisonnement de pointe et c'est le **plus grand modèle** publié à ce jour. Nemotron-3-Ultra-550B-A55B est conçu pour des agents autonomes de longue durée et pour le raisonnement dans des flux de travail de codage et de recherche approfondie. C'est le **modèle ouvert occidental le plus performant**, et adopte la nouvelle licence Open Model, Weights & Data.

Avec jusqu'à **1M de contexte**, Nemotron 3 Ultra utilise une architecture hybride Transformer-Mamba MoE et peut conserver l'état de l'agent, les journaux et les plans sur de longues sessions. Les GGUF sont à [Nemotron-3-Ultra-550B-A55B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF) avec du 1 bit dynamique occupant 189 Go d'espace disque. Il est également préentraîné avec NVFP4. Nous avons aussi réalisé [Benchmarks KLD GGUF](#kld-benchmarks).

### ⚙️ Guide d'utilisation

NVIDIA recommande ces paramètres pour l'inférence :

* `temperature = 1.0`
* `top_p = 0.95`

| Détail                  | Nemotron 3 Ultra                                                                                                         |
| ----------------------- | ------------------------------------------------------------------------------------------------------------------------ |
| Taille du modèle        | 550B paramètres au total / 55B paramètres actifs                                                                         |
| Longueur de contexte    | Jusqu'à 1M de tokens                                                                                                     |
| Architecture            | Hybrid Transformer-Mamba MoE avec Latent MoE, prédiction multi-token (MTP actuellement non pris en charge pour les GGUF) |
| Entrée/sortie du modèle | Entrée texte, sortie texte                                                                                               |

Le gabarit de conversation est comme ci-dessous :

{% code overflow="wrap" %}

```
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\n
```

{% endcode %}

### Exécuter Nemotron-3-Ultra

Les versions 3 bits du modèle nécessitent environ 256 Go de RAM, 4 bits nécessitent environ 300 Go et 8 bits nécessitent 600 Go. Pour ces guides, nous utiliserons la version 3 bits `UD-IQ3_XXS` qui tient sur un appareil de 256 Go et offre un bon équilibre entre taille et précision. Selon votre cas d'utilisation, vous devrez utiliser [des paramètres différents](#usage-guide). **GGUF :** [Nemotron-3-Ultra-550B-A55B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF)

<a href="/pages/6a9e6962437d50e1fa3a51a52b54a3231894414d#unsloth-studio-guide" class="button primary">Exécuter dans Unsloth Studio</a><a href="/pages/6a9e6962437d50e1fa3a51a52b54a3231894414d#llama.cpp-tutorial" class="button secondary">Exécuter dans llama.cpp</a>

### 🦥 Guide d'Unsloth Studio

Pour ce tutoriel, nous utiliserons [Unsloth Studio](/docs/fr/nouveau/studio.md), qui est notre interface pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir des images et du texte localement sur **Mac, Windows**, et Linux, et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* **Comparer** modèles **côte à côte**
* [**Auto-réparation** appel d’outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Ajustement automatique de l’inférence](https://unsloth.ai/docs/desktop#feature-deep-dive) des paramètres (temp, top-p, etc.)
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus rapide avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9d149ac4b773a56a635d40ab8347ea2896781ae6" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge de CUDA.

{% hint style="info" %}
**Utilisateurs de WSL :** vous serez invité à saisir votre `sudo` mot de passe pour installer les dépendances de compilation (`cmake`, `git`, `libcurl4-openssl-dev`).
{% endhint %}
{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL :**

```bash
source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888
```

**Windows PowerShell :**

```bash
unsloth studio
```

<div data-with-frame="true"><figure><img src="/files/fa3d706136ff9e7c9e614db9bb2d851ed981df1b" alt="" width="375"><figcaption></figcaption></figure></div>

Puis ouvrez `http://127.0.0.1:8888` dans votre navigateur.
{% endstep %}

{% step %}

#### Recherchez et téléchargez Nemotron-3-Ultra

Lors du premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Ensuite, allez dans l'onglet [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) et recherchez Nemotron-3-Ultra dans la barre de recherche et téléchargez le modèle et la quantification souhaités.
{% endstep %}

{% step %}

#### Exécuter Nemotron-3-Ultra

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.

Pour plus d’informations, vous pouvez consulter notre [Guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).
{% endstep %}

{% step %}

#### Servir Nemotron-3-Ultra

Vous pouvez également utiliser `unsloth studio run` pour servir le modèle via llama-server, comme ceci :

{% code overflow="wrap" %}

```bash
unsloth studio run --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF:UD-Q4_K_XL
```

{% endcode %}
{% endstep %}
{% endstepper %}

### 🦙 Tutoriel Llama.cpp :

Instructions pour l'exécution dans llama.cpp (notez que nous utiliserons 4 bits pour tenir sur la plupart des appareils) :

{% stepper %}
{% step %}
Obtenez la dernière version de `llama.cpp` sur [GitHub ici](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` en `-DGGML_CUDA=OFF` si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d’habitude - la prise en charge de Metal est activée par défaut.

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Téléchargez le modèle via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Vous pouvez choisir Q4\_K\_M ou d'autres versions quantifiées comme `UD-Q4_K_XL` . Nous recommandons d'utiliser au moins une quantification dynamique 2 bits `UD-Q2_K_XL` pour équilibrer taille et précision. Si les téléchargements se bloquent, consultez : [Dépannage de Hugging Face Hub, XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

{% code overflow="wrap" %}

```bash
pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
    --include "*UD-IQ3_XXS*" # Utilisez "*UD-Q2_K_XL*" pour une quantification dynamique 2 bits
```

{% endcode %}
{% endstep %}

{% step %}
Puis exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/UD-IQ3_XXS/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_XXS-00001-of-00006.gguf \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

#### Diffusion et déploiement via llama-server

Pour déployer Nemotron-3-Ultra localement, utilisez `llama-server`. Dans un nouveau terminal, par exemple via `tmux`, déployez le modèle :

```bash
./llama.cpp/llama-server \\
    -hf unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF:UD-IQ3_XXS \\
    --alias "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B" \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --port 8001
```

Si vous avez téléchargé le modèle manuellement, utilisez :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/UD-IQ3_XXS/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_XXS-00001-of-00006.gguf \\
    --alias "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B" \\
    --temp 1.0 \\
    --top-p 0.95 \\
    --port 8001
```

{% endcode %}

Ensuite, dans un nouveau terminal, après avoir installé le client OpenAI avec `pip install openai`:

```python
from openai import OpenAI
openai_client = OpenAI(
    base_url = "http://127.0.0.1:8001/v1",
    api_key = "sk-no-key-required",
)
completion = openai_client.chat.completions.create(
    model = "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B",
    messages = [
        {"role": "user", "content": "What is 2+2?"},
    ],
)
print(completion.choices[0].message.reasoning_content)
print(completion.choices[0].message.content)
```

<figure><img src="/files/25ff08b5863ffbe39a1c527a9d713d35037c11bc" alt=""><figcaption></figcaption></figure>

Et sur 4 B200, on observe environ 40 tokens/s pour la génération !

<figure><img src="/files/2d3feea14db7dc1ab490cc11d868606e194249ac" alt=""><figcaption></figcaption></figure>

### Benchmarks GGUF d'Unsloth

Nous avons également effectué une analyse KLD pour nos quantifications GGUF - sur une échelle logarithmique de la KLD moyenne, le modèle perd très peu de précision même lorsqu'il est quantifié jusqu'à 1 bit grâce à notre [méthodologie dynamique](/docs/fr/bases/dynamic-3.0-ggufs.md) où les couches les plus importantes sont conservées en précision plus élevée et le reste en bits plus faibles.

<figure><img src="/files/f662992149d0ac81edf6558ae18bb2141dc2f98b" alt=""><figcaption></figcaption></figure>

Sur une échelle linéaire :

<figure><img src="/files/0a0ed6c194dedb80405b96fef8791682cb613430" alt=""><figcaption></figcaption></figure>

### Benchmarks officiels

Nemotron 3 Ultra est le plus grand modèle de raisonnement Nemotron 3 de NVIDIA et est positionné pour offrir une précision de pointe sur les tâches de raisonnement avancé, de codage et agentiques, tout en optimisant le temps nécessaire à l'exécution des tâches grâce à un débit élevé.

Ultra est particulièrement adapté aux charges de travail où la réussite de la tâche dépend d'un raisonnement soutenu plutôt que de réponses courtes en un seul tour :

* Sessions de codage autonomes sur de grands dépôts
* Recherche approfondie à partir de nombreuses sources avec des éléments contradictoires
* Flux de travail d'entreprise avec des boucles persistantes d'utilisation d'outils
* Vérification de la conception de circuits / puces et analyse des défaillances

Comme le montrent la Figure 1 et la Figure 2, Nemotron 3 Ultra est leader en précision sur la productivité des agents, le suivi d'instructions et les tâches à long contexte, et offre des performances globalement leaders, permettant d'économiser 30 % sur les coûts par rapport aux autres modèles ouverts leaders.&#x20;

Figure 1 : Nemotron 3 Ultra est leader parmi les modèles ouverts sur les benchmarks agentiques pour la productivité des agents, le codage et le suivi d'instructions.

<div align="center" data-with-frame="true"><figure><img src="/files/e0c977823b94cca4d9c3b9c341eb46b1be9aa64e" alt="Image of a table showing Nemotron 3 Ultra leading among open models on agentic benchmarks for agent productivity, coding, and instruction following." width="536"><figcaption></figcaption></figure></div>

Figure 2 : Nemotron 3 Ultra permet d'économiser jusqu'à 30 % sur les coûts et est leader sur la frontière d'efficience des coûts

<div data-with-frame="true"><img src="/files/ff37212b0f36967e18b1d728d1833f5c0139f481" alt="Image montrant que Nemotron 3 Ultra permet d&#x27;économiser jusqu&#x27;à 30 % sur les coûts et est leader sur la frontière d&#x27;efficience des coûts" width="563"></div>

Davantage de benchmarks de NVIDIA :

| Benchmark                                         | N-3-Ultra 550B-A55B | MiniMax-2.7 230B-A10B | GLM-5.1 744B-A40B | Kimi-K2.6 1T-A32B |       |       |      |
| ------------------------------------------------- | :-----------------: | :-------------------: | :---------------: | :---------------: | :---: | :---: | :--: |
| **Agentique**                                     |                     |                       |                   |                   |       |       |      |
| Terminal Bench 2.1                                |         56.4        |          55.5         |        59.3       |        67.2       |  49.9 |  49.2 | 54.2 |
| GDPVal                                            |         46.7        |          47.6         |        54.7       |        50.4       |  34.6 |  54.6 | 50.2 |
| SWE-Bench Verified                                |         71.9        |          72.2         |        73.8       |        69.5       |  69.9 |  74.0 | 72.4 |
| SWE-Bench Multilingual                            |         67.7        |          69.2         |        73.8       |        65.9       |  67.7 |  71.9 | 72.1 |
| ProfBench (Search)                                |         56.0        |          52.0         |        46.0       |        56.0       |  53.0 |  59.9 | 57.0 |
| PinchBench                                        |         90.0        |          77.6         |        81.2       |        90.2       |  86.6 |  88.6 | 91.3 |
| TauBench V3                                       |                     |                       |                   |                   |       |       |      |
| Aérien                                            |         81.5        |          75.3         |        85.0       |        85.8       |  76.5 |  80.8 | 80.8 |
| Commerce de détail                                |         86.4        |          84.9         |        84.1       |        82.9       |  88.5 |  88.9 | 89.1 |
| Télécom                                           |         92.9        |          89.6         |        96.9       |        97.8       |  98.0 |  96.3 | 98.3 |
| Banque                                            |         22.6        |          14.6         |        12.8       |        23.1       |  20.9 |  25.9 | 26.7 |
| Moyenne                                           |         70.9        |          66.1         |        69.7       |        72.4       |  71.0 |  73.2 | 73.7 |
| BrowseComp                                        |         44.4        |          54.1         |        59.4       |        61.3       |  40.5 |  59.4 | 46.9 |
| Vals.ai Financial Agent 1.1                       |                     |                       |                   |                   |       |       |      |
| sans recherche web                                |         60.1        |          51.3         |        60.2       |        54.0       |  61.3 |  58.9 | 58.4 |
| avec recherche web                                |         53.7        |          50.5         |        60.7       |        58.8       |  59.0 |  62.3 | 60.1 |
| **Raisonnement et connaissances**                 |                     |                       |                   |                   |       |       |      |
| IOI 2025                                          |        570.0        |           --          |       456.5       |       585.0       | 441.3 | 580.1 |  --  |
| LiveCodeBench (v6)                                |         89.0        |          77.2         |        85.7       |        90.2       |  79.3 |  92.5 | 90.9 |
| IMOAnswerBench (sans outils)                      |         88.6        |          68.3         |        86.8       |        91.1       |  83.1 |  93.0 | 91.1 |
| IMOAnswerBench (avec outils)                      |         92.3        |          75.1         |        91.1       |       93.71       | 84.51 |  85.4 | 89.6 |
| Apex-Shortlist (sans outils)                      |         74.9        |          28.9         |        71.1       |        77.4       |  61.4 |  85.8 | 82.4 |
| Apex-Shortlist (avec outils)                      |         84.8        |          51.9         |        79.0       |        73.2       |  60.4 |  86.5 | 82.0 |
| GPQA (sans outils)                                |         87.0        |          86.6         |        86.1       |        91.0       |  87.1 |  87.8 | 88.5 |
| SciCode (sous-tâche)                              |         44.6        |          38.3         |        47.7       |        52.0       |  48.0 |  50.5 | 48.2 |
| HLE (sans outils)                                 |         26.7        |          23.1         |        27.2       |        34.8       |  28.5 |  37.7 | 32.2 |
| HLE (avec outils)                                 |         37.4        |           --          |        50.4       |        54.0       |  48.3 |  48.2 | 45.1 |
| CritPt (sans outils)                              |         3.1         |          0.6          |        3.7        |        9.1        |  2.4  |  14.0 | 10.6 |
| MMLU-Pro                                          |         86.8        |          81.9         |        85.9       |        88.1       |  88.3 |  87.5 | 86.4 |
| Précision OmniScience                             |         24.1        |          20.5         |        31.3       |        35.5       |  35.9 |  46.8 | 39.9 |
| Non-hallucination OmniScience                     |         78.7        |          74.4         |        66.8       |        67.1       |  7.4  |  5.7  |  2.8 |
| **Chat et suivi d'instructions**                  |                     |                       |                   |                   |       |       |      |
| IFBench (prompt souple)                           |         81.7        |          74.6         |        76.6       |        73.7       |  78.2 |  79.1 | 82.0 |
| Multi-défis                                       |         63.8        |          42.5         |        63.0       |        63.1       |  63.9 |  64.1 | 63.5 |
| **Contexte long**                                 |                     |                       |                   |                   |       |       |      |
| AA-LCR                                            |         65.4        |          69.8         |        66.9       |        70.2       |  68.3 |  67.3 | 62.7 |
| RULER (1M)                                        |         94.7        |           --          |         --        |         --        |  90.1 |  94.2 | 87.7 |
| LongBench v2 (≤ 1M)                               |         61.9        |           --          |         --        |         --        |  68.9 |  62.1 | 57.0 |
| **Multilingue**                                   |                     |                       |                   |                   |       |       |      |
| MMLU-ProX (moyenne en/de/fr/es/it/ja/zh/hi/pt/ko) |         83.0        |          78.4         |        85.8       |        85.0       |  86.4 |  85.6 | 84.3 |
| WMT24++ (en→xx)                                   |         83.7        |          82.8         |        84.4       |        84.5       |  86.8 |  85.9 | 85.9 |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/nemotron-3-ultra.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
