> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/nemotron-3-ultra.md).

# NVIDIA Nemotron 3 Ultra - Comment l'exécuter localement

NVIDIA Nemotron 3 Ultra est un modèle ouvert **de 550 milliards de paramètres, 55 milliards actifs** de raisonnement de pointe et est le **plus grand modèle** publié à ce jour. Nemotron-3-Ultra-550B-A55B est conçu pour des agents autonomes de longue durée et pour le raisonnement dans des flux de travail de codage et de recherche approfondie. C’est le **modèle ouvert occidental le plus puissant**, et adopte la nouvelle licence Open Model, Weights & Data.

Avec jusqu’à **fenêtre de contexte de 1M**, Nemotron 3 Ultra utilise une architecture hybride Transformer-Mamba MoE et peut conserver l’état de l’agent, les journaux et les plans sur de longues sessions. Les GGUF sont à [Nemotron-3-Ultra-550B-A55B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF) avec un 1 bit dynamique occupant 189 Go d’espace disque. Il est également préentraîné à l’aide de NVFP4. Nous avons aussi fait [Benchmarks GGUF KLD](#kld-benchmarks).

### ⚙️ Guide d'utilisation

NVIDIA recommande ces paramètres pour l’inférence :

* `temperature = 1.0`
* `top_p = 0,95`

| Détail               | Nemotron 3 Ultra                                                                                                          |
| -------------------- | ------------------------------------------------------------------------------------------------------------------------- |
| Taille du modèle     | 550 milliards de paramètres au total / 55 milliards de paramètres actifs                                                  |
| Longueur de contexte | Jusqu’à 1M de jetons                                                                                                      |
| Architecture         | Hybrid Transformer-Mamba MoE avec Latent MoE, prédiction multi-jetons (MTP actuellement non pris en charge pour les GGUF) |
| E/S du modèle        | Entrée texte, sortie texte                                                                                                |

Le modèle de chat est comme ci-dessous :

{% code overflow="wrap" %}

```
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\n
```

{% endcode %}

### Exécuter Nemotron-3-Ultra

Les versions 3 bits du modèle nécessitent environ 256 Go de RAM, 4 bits nécessitent environ 300 Go et 8 bits nécessitent 600 Go. Pour ces guides, nous utiliserons du 3 bits `UD-IQ3_XXS` qui tient sur un appareil de 256 Go et constitue un bon compromis entre taille et précision. Selon votre cas d’utilisation, vous devrez utiliser [des paramètres différents](#usage-guide). **GGUF :** [Nemotron-3-Ultra-550B-A55B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF)

<a href="/pages/6a9e6962437d50e1fa3a51a52b54a3231894414d#unsloth-studio-guide" class="button primary">Exécuter dans Unsloth Studio</a><a href="/pages/6a9e6962437d50e1fa3a51a52b54a3231894414d#llama.cpp-tutorial" class="button secondary">Exécuter dans llama.cpp</a>

### 🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons [Unsloth Studio](/docs/fr/nouveau/studio.md), qui est notre interface pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et saisir des images et du texte localement sur **Mac, Windows**, et Linux et :

{% columns %}
{% column %}

* Rechercher, télécharger, [exécuter des GGUF](/docs/fr/nouveau/studio.md#run-models-locally) et des modèles safetensor
* **Comparer** les modèles **côte à côte**
* [**Appels d'outils auto-réparateurs** appels d'outils](/docs/fr/nouveau/studio.md#execute-code--heal-tool-calling) + **recherche web**
* [**Exécution de code**](/docs/fr/nouveau/studio.md#run-models-locally) (Python, Bash)
* [Inférence automatique](/docs/fr/nouveau/studio.md#model-arena) réglage des paramètres (temp, top-p, etc.)
* [Entraîner des LLM](/docs/fr/nouveau/studio.md#no-code-training) 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9d149ac4b773a56a635d40ab8347ea2896781ae6" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

**MacOS, Linux, WSL :**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell :**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), construit le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

{% hint style="info" %}
**Utilisateurs WSL :** vous serez invité à saisir votre `sudo` mot de passe pour installer les dépendances de compilation (`cmake`, `git`, `libcurl4-openssl-dev`).
{% endhint %}
{% endstep %}

{% step %}

#### Lancer Unsloth

**MacOS, Linux, WSL :**

```bash
source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888
```

**Windows PowerShell :**

```bash
unsloth studio
```

<div data-with-frame="true"><figure><img src="/files/fa3d706136ff9e7c9e614db9bb2d851ed981df1b" alt="" width="375"><figcaption></figcaption></figure></div>

Puis ouvrez `http://127.0.0.1:8888` dans votre navigateur.
{% endstep %}

{% step %}

#### Rechercher et télécharger Nemotron-3-Ultra

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l' [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) onglet et recherchez Nemotron-3-Ultra dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.
{% endstep %}

{% step %}

#### Exécuter Nemotron-3-Ultra

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le template de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre [guide d'inférence Unsloth Studio](/docs/fr/nouveau/studio/chat.md).
{% endstep %}

{% step %}

#### Mise à disposition de Nemotron-3-Ultra

Vous pouvez aussi utiliser `unsloth studio run` pour servir le modèle via llama-server comme ceci :

{% code overflow="wrap" %}

```bash
unsloth studio run --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF:UD-Q4_K_XL
```

{% endcode %}
{% endstep %}
{% endstepper %}

### 🦙 Tutoriel Llama.cpp :

Instructions pour exécuter dans llama.cpp (notez que nous utiliserons du 4 bits pour s’adapter à la plupart des appareils) :

{% stepper %}
{% step %}
Obtenez la dernière `llama.cpp` sur [GitHub ici](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez `-DGGML_CUDA=ON` à `-DGGML_CUDA=OFF` si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. **Pour les appareils Apple Mac / Metal**, définissez `-DGGML_CUDA=OFF` puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Téléchargez le modèle via le code ci-dessous (après avoir installé `pip install huggingface_hub`). Vous pouvez choisir Q4\_K\_M ou d’autres versions quantifiées comme `UD-Q4_K_XL` . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits `UD-Q2_K_XL` pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : [Hugging Face Hub, débogage XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

{% code overflow="wrap" %}

```bash
pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF \\
    --include "*UD-IQ3_XXS*" # Utilisez "*UD-Q2_K_XL*" pour le 2 bits dynamique
```

{% endcode %}
{% endstep %}

{% step %}
Puis exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/UD-IQ3_XXS/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_XXS-00001-of-00006.gguf \\
    --temp 1.0 \
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

#### Mise à disposition et déploiement de llama-server

Pour déployer Nemotron-3-Ultra localement, utilisez `llama-server`. Dans un nouveau terminal, par exemple via `tmux`, déployez le modèle :

```bash
./llama.cpp/llama-server \\
    -hf unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF:UD-IQ3_XXS \\
    --alias "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B" \\
    --temp 1.0 \
    --top-p 0.95 \\
    --port 8001
```

Si vous avez téléchargé le modèle manuellement, utilisez :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B-GGUF/UD-IQ3_XXS/NVIDIA-Nemotron-3-Ultra-550B-A55B-UD-IQ3_XXS-00001-of-00006.gguf \\
    --alias "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B" \\
    --temp 1.0 \
    --top-p 0.95 \\
    --port 8001
```

{% endcode %}

Ensuite, dans un nouveau terminal, après avoir installé le client OpenAI avec `pip install openai`:

```python
from openai import OpenAI
openai_client = OpenAI(
    base_url = "http://127.0.0.1:8001/v1",
    api_key = "sk-no-key-required",
)
completion = openai_client.chat.completions.create(
    model = "unsloth/NVIDIA-Nemotron-3-Ultra-550B-A55B",
    messages = [
        {"role": "user", "content": "What is 2+2?"},
    ],
)
print(completion.choices[0].message.reasoning_content)
print(completion.choices[0].message.content)
```

<figure><img src="/files/25ff08b5863ffbe39a1c527a9d713d35037c11bc" alt=""><figcaption></figcaption></figure>

Et sur 4 B200, on observe environ 40 jetons/s pour la génération !

<figure><img src="/files/2d3feea14db7dc1ab490cc11d868606e194249ac" alt=""><figcaption></figcaption></figure>

### Benchmarks GGUF d’Unsloth

Nous avons également effectué une analyse KLD pour nos quantifications GGUF — sur une échelle KLD moyenne logarithmique, le modèle perd très peu de précision même lorsqu’il est quantifié jusqu’à 1 bit grâce à notre [méthodologie dynamique](/docs/fr/bases/unsloth-dynamic-2.0-ggufs.md) où les couches les plus importantes sont conservées avec une précision plus élevée et le reste avec moins de bits.

<figure><img src="/files/f662992149d0ac81edf6558ae18bb2141dc2f98b" alt=""><figcaption></figcaption></figure>

Sur une échelle linéaire :

<figure><img src="/files/0a0ed6c194dedb80405b96fef8791682cb613430" alt=""><figcaption></figcaption></figure>

### Benchmarks officiels

Nemotron 3 Ultra est le plus grand modèle de raisonnement Nemotron 3 de NVIDIA et est positionné pour offrir une précision de pointe sur le raisonnement frontalier, le codage et les tâches agentiques, tout en optimisant le temps nécessaire à l’exécution des tâches grâce à un débit élevé.

Ultra est particulièrement adapté aux charges de travail où la réussite de la tâche dépend d’un raisonnement soutenu plutôt que de courtes réponses en un seul tour :

* Sessions de codage autonomes dans de grands dépôts
* Recherche approfondie à travers de nombreuses sources avec des éléments de preuve contradictoires
* Flux de travail d’entreprise avec des boucles persistantes d’utilisation d’outils
* Vérification de conception EDA / puce et analyse des défaillances

Comme le montrent les figures 1 et 2, Nemotron 3 Ultra est en tête en matière de précision sur la productivité des agents, le suivi des instructions et les tâches à long contexte, et offre un débit de pointe, économisant 30 % de coûts par rapport à d’autres modèles ouverts de pointe.&#x20;

Figure 1 : Nemotron 3 Ultra est en tête parmi les modèles ouverts sur les benchmarks agentiques pour la productivité des agents, le codage et le suivi des instructions.

<div align="center" data-with-frame="true"><figure><img src="/files/e0c977823b94cca4d9c3b9c341eb46b1be9aa64e" alt="Image of a table showing Nemotron 3 Ultra leading among open models on agentic benchmarks for agent productivity, coding, and instruction following." width="536"><figcaption></figcaption></figure></div>

Figure 2 : Nemotron 3 Ultra permet d’économiser jusqu’à 30 % de coûts et mène la frontière d’efficacité des coûts

<div data-with-frame="true"><img src="/files/ff37212b0f36967e18b1d728d1833f5c0139f481" alt="Image montrant que Nemotron 3 Ultra permet d’économiser jusqu’à 30 % de coûts et mène la frontière d’efficacité des coûts" width="563"></div>

Plus de benchmarks de NVIDIA :

| Benchmark                                         | N-3-Ultra 550B-A55B | MiniMax-2.7 230B-A10B | GLM-5.1 744B-A40B | Kimi-K2.6 1T-A32B |       |       |      |
| ------------------------------------------------- | :-----------------: | :-------------------: | :---------------: | :---------------: | :---: | :---: | :--: |
| **Agentique**                                     |                     |                       |                   |                   |       |       |      |
| Terminal Bench 2.1                                |         56.4        |          55.5         |        59.3       |        67.2       |  49.9 |  49.2 | 54.2 |
| GDPVal                                            |         46.7        |          47.6         |        54.7       |        50.4       |  34.6 |  54.6 | 50.2 |
| SWE-Bench Verified                                |         71.9        |          72.2         |        73.8       |        69.5       |  69.9 |  74.0 | 72.4 |
| SWE-Bench Multilingual                            |         67.7        |          69.2         |        73.8       |        65.9       |  67.7 |  71.9 | 72.1 |
| ProfBench (Recherche)                             |         56.0        |          52.0         |        46.0       |        56.0       |  53.0 |  59.9 | 57.0 |
| PinchBench                                        |         90.0        |          77.6         |        81.2       |        90.2       |  86.6 |  88.6 | 91.3 |
| TauBench V3                                       |                     |                       |                   |                   |       |       |      |
| Compagnie aérienne                                |         81.5        |          75.3         |        85.0       |        85.8       |  76.5 |  80.8 | 80.8 |
| Commerce de détail                                |         86.4        |          84.9         |        84.1       |        82.9       |  88.5 |  88.9 | 89.1 |
| Télécommunications                                |         92.9        |          89.6         |        96.9       |        97.8       |  98.0 |  96.3 | 98.3 |
| Banque                                            |         22.6        |          14.6         |        12.8       |        23.1       |  20.9 |  25.9 | 26.7 |
| Moyenne                                           |         70.9        |          66.1         |        69.7       |        72.4       |  71.0 |  73.2 | 73.7 |
| BrowseComp                                        |         44.4        |          54.1         |        59.4       |        61.3       |  40.5 |  59.4 | 46.9 |
| Vals.ai Agent financier 1.1                       |                     |                       |                   |                   |       |       |      |
| sans recherche web                                |         60.1        |          51.3         |        60.2       |        54.0       |  61.3 |  58.9 | 58.4 |
| avec recherche web                                |         53.7        |          50.5         |        60.7       |        58.8       |  59.0 |  62.3 | 60.1 |
| **Raisonnement et connaissances**                 |                     |                       |                   |                   |       |       |      |
| IOI 2025                                          |        570.0        |           --          |       456.5       |       585.0       | 441.3 | 580.1 |  --  |
| LiveCodeBench (v6)                                |         89.0        |          77.2         |        85.7       |        90.2       |  79.3 |  92.5 | 90.9 |
| IMOAnswerBench (sans outils)                      |         88.6        |          68.3         |        86.8       |        91.1       |  83.1 |  93.0 | 91.1 |
| IMOAnswerBench (avec outils)                      |         92.3        |          75.1         |        91.1       |       93.71       | 84.51 |  85.4 | 89.6 |
| Apex-Shortlist (sans outils)                      |         74.9        |          28.9         |        71.1       |        77.4       |  61.4 |  85.8 | 82.4 |
| Apex-Shortlist (avec outils)                      |         84.8        |          51.9         |        79.0       |        73.2       |  60.4 |  86.5 | 82.0 |
| GPQA (sans outils)                                |         87.0        |          86.6         |        86.1       |        91.0       |  87.1 |  87.8 | 88.5 |
| SciCode (sous-tâche)                              |         44.6        |          38.3         |        47.7       |        52.0       |  48.0 |  50.5 | 48.2 |
| HLE (sans outils)                                 |         26.7        |          23.1         |        27.2       |        34.8       |  28.5 |  37.7 | 32.2 |
| HLE (avec outils)                                 |         37.4        |           --          |        50.4       |        54.0       |  48.3 |  48.2 | 45.1 |
| CritPt (sans outils)                              |         3.1         |          0.6          |        3.7        |        9.1        |  2.4  |  14.0 | 10.6 |
| MMLU-Pro                                          |         86.8        |          81.9         |        85.9       |        88.1       |  88.3 |  87.5 | 86.4 |
| Précision OmniScience                             |         24.1        |          20.5         |        31.3       |        35.5       |  35.9 |  46.8 | 39.9 |
| Non-hallucination OmniScience                     |         78.7        |          74.4         |        66.8       |        67.1       |  7.4  |  5.7  |  2.8 |
| **Chat et suivi d’instructions**                  |                     |                       |                   |                   |       |       |      |
| IFBench (prompt souple)                           |         81.7        |          74.6         |        76.6       |        73.7       |  78.2 |  79.1 | 82.0 |
| Multi-Challenge                                   |         63.8        |          42.5         |        63.0       |        63.1       |  63.9 |  64.1 | 63.5 |
| **Contexte long**                                 |                     |                       |                   |                   |       |       |      |
| AA-LCR                                            |         65.4        |          69.8         |        66.9       |        70.2       |  68.3 |  67.3 | 62.7 |
| RULER (1M)                                        |         94.7        |           --          |         --        |         --        |  90.1 |  94.2 | 87.7 |
| Longbench v2 (≤ 1M)                               |         61.9        |           --          |         --        |         --        |  68.9 |  62.1 | 57.0 |
| **Multilingue**                                   |                     |                       |                   |                   |       |       |      |
| MMLU-ProX (moyenne en/de/fr/es/it/ja/zh/hi/pt/ko) |         83.0        |          78.4         |        85.8       |        85.0       |  86.4 |  85.6 | 84.3 |
| WMT24++ (en→xx)                                   |         83.7        |          82.8         |        84.4       |        84.5       |  86.8 |  85.9 | 85.9 |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/nemotron-3-ultra.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
