> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/nemotron-3/nemotron-3-super.md).

# NVIDIA Nemotron-3-Super : guide d'exécution

NVIDIA publie **Nemotron-3-Super-120B-A12B**, un modèle MoE hybride de raisonnement ouvert de 120B avec 12B de paramètres actifs, faisant suite au lancement précédent de [Nemotron-3-Nano](/docs/fr/modeles/nemotron-3.md), son pendant de 30B. Nemotron-3-Super est conçu pour une grande efficacité et une grande précision pour l'IA multi-agent. Avec une **fenêtre de contexte de 1M de jetons** , il domine sa catégorie de taille sur les benchmarks AIME 2025, Terminal Bench et SWE-Bench Verified, tout en atteignant le débit le plus élevé.

Nemotron-3-Super fonctionne sur un appareil avec **64 Go** de RAM, de VRAM ou de mémoire unifiée et peut désormais être affiné localement. Merci à NVIDIA d'avoir offert à Unsloth une prise en charge dès le premier jour.

<a href="/pages/9ed8ddde53d68481706a3e7f68f59bb62e25a895#run-nemotron-3-super-120b" class="button primary">Nemotron 3 Super</a><a href="/pages/9ed8ddde53d68481706a3e7f68f59bb62e25a895" class="button secondary">Nemotron 3 Nano</a>

GGUF : [Nemotron-3-Super-120B-A12B-GGUF](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF) • [NVFP4](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4) • [FP8](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-FP8) • [BF16](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B)

### ⚙️ Guide d’utilisation

NVIDIA recommande ces paramètres pour l’inférence :

{% columns %}
{% column %}
**Chat/instructions générales (par défaut) :**

* `température = 1.0`
* `top_p = 1.0`
  {% endcolumn %}

{% column %}
**Cas d’usage d’appel d’outils :**

* `température = 0.6`
* `top_p = 0.95`
  {% endcolumn %}
  {% endcolumns %}

**Pour la plupart des utilisations locales, définissez :**

* `max_new_tokens` = `32,768` en `262,144` pour les invites standard avec un maximum de 1M de jetons
* Augmentez-le pour un raisonnement approfondi ou une génération de longue durée selon la capacité de votre RAM/VRAM.

Le format du modèle de conversation se trouve lorsque nous utilisons ce qui suit :

{% code overflow="wrap" %}

```python
tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)
```

{% endcode %}

{% hint style="success" %}
Comme le modèle a été entraîné avec NoPE, vous n’avez qu’à modifier `max_position_embeddings`. Le modèle n’utilise pas d’embeddings positionnels explicites, donc YaRN n’est pas nécessaire.
{% endhint %}

#### Format du modèle de conversation Nemotron 3 :

{% hint style="info" %}
Nemotron 3 utilise `<think>` avec l’ID de jeton 12 et `</think>` avec l’ID de jeton 13 pour le raisonnement. Utilisez `--special` pour voir les jetons pour llama.cpp. Vous devrez peut-être aussi utiliser `--verbose-prompt` pour voir `<think>` car il est préfixé.
{% endhint %}

{% code overflow="wrap" lineNumbers="true" %}

```
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>user\nWhat is 2+2?<|im_end|>\n<|im_start|>assistant\n<think>\n
```

{% endcode %}

### 🖥️ Exécuter Nemotron-3-Super-120B-A12B

Selon votre cas d’utilisation, vous devrez utiliser différents paramètres. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme [gpt-oss](/docs/fr/modeles/gpt-oss-how-to-run-and-fine-tune.md)) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à des bits plus faibles. Accédez aux GGUFs [ici](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF).

Les versions 4 bits du modèle nécessitent environ 64 Go de RAM - 72 Go de RAM. La version 8 bits nécessite 128 Go.

#### Tutoriel Llama.cpp (GGUF) :

Instructions pour l’exécution dans llama.cpp (notez que nous utiliserons du 4 bits pour convenir à la plupart des appareils) :

{% stepper %}
{% step %}
Obtenez la dernière version `llama.cpp` sur [GitHub ici](https://github.com/ggml-org/llama.cpp). Vous pouvez également suivre les instructions de compilation ci-dessous. Changez `-DGGML_CUDA=ON` en `-DGGML_CUDA=OFF` si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU.

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Vous pouvez le récupérer directement depuis Hugging Face. Vous pouvez augmenter le contexte jusqu’à 1M selon la capacité de votre RAM/VRAM.

Suivez ceci pour les cas d'utilisation de **instruction générale**  :

```bash
./llama.cpp/llama-cli \
    -hf unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-Q4_K_XL \
    --ctx-size 16384 \
    --temp 1.0 --top-p 1.0
```

Suivez ceci pour les cas d'utilisation de **appel d'outils**  :

```bash
./llama.cpp/llama-cli \
    -hf unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-Q4_K_XL \
    --ctx-size 32768 \\
    --temp 0.6 --top-p 0.95
```

{% endstep %}

{% step %}
Téléchargez le modèle via (après avoir installé `pip install huggingface_hub hf_transfer` ). Vous pouvez choisir Q4\_K\_M ou d’autres versions quantifiées comme `UD-Q4_K_XL` . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits `UD-Q2_K_XL` pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : [Hugging Face Hub, débogage XET](/docs/fr/bases/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF \
    --local-dir unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF \
    --include "*UD-Q4_K_XL*" # Utilisez "*UD-Q2_K_XL*" pour Dynamic 2bit
```

{% endstep %}

{% step %}
Puis exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
/llama.cpp/llama-cli \
    --model unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF/UD-Q4_K_XL/NVIDIA-Nemotron-3-Super-120B-A12B-UD-Q4_K_XL-00001-of-00003.gguf \
    --ctx-size 16384 \
    --seed 3407 \
    --prio 2 \
    --temp 0.6 \
    --top-p 0.95
```

{% endcode %}

<figure><img src="/files/1c47e00d9d93fb705f6035430f9f2d1fc154f0f3" alt=""><figcaption></figcaption></figure>

Aussi, ajustez **la fenêtre de contexte** selon les besoins. Assurez-vous que votre matériel peut gérer plus qu’une fenêtre de contexte de 256K. La régler à 1M peut déclencher une OOM CUDA et provoquer un plantage, c’est pourquoi la valeur par défaut est 262 144.
{% endstep %}
{% endstepper %}

### 🦥 Affinage de Nemotron 3 et RL

Unsloth prend désormais en charge l'affinage de tous les modèles Nemotron, y compris Nemotron 3 Super et Nano. Pour des exemples de notebook pour Nano, consultez notre guide d'affinage Nemotron 3 [Nano](/docs/fr/modeles/nemotron-3.md).

#### Nemotron 3 Super

* L'affinage de la couche routeur est désactivé par défaut pour des raisons de stabilité.
* Nemotron-3-Super-120B - LoRA bf16 fonctionne sur 256 Go de VRAM. Si vous utilisez plusieurs GPU, ajoutez     `device_map = "balanced"` ou suivez notre [Guide multiGPU](/docs/fr/bases/multi-gpu-training-with-unsloth.md).

### 🦙 Hébergement et déploiement de Llama-server

Pour déployer Nemotron 3 en production, nous utilisons `llama-server` Dans un nouveau terminal, par exemple via tmux, déployez le modèle via :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \
    --model unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF/UD-Q4_K_XL/NVIDIA-Nemotron-3-Super-120B-A12B-UD-Q4_K_XL-00001-of-00003.gguf \
    --alias "unsloth/NVIDIA-Nemotron-3-Super-120B-A12B" \
    --prio 3 \
    --min-p 0.01 \
    --temp 0.6 \
    --top-p 0.95 \
    --ctx-size 16384 \
    --port 8001
```

{% endcode %}

Lorsque vous exécutez ce qui précède, vous obtiendrez :

<figure><img src="/files/88a83c8461427311b44b66bde66aa1bbedc97960" alt=""><figcaption></figcaption></figure>

Puis dans un nouveau terminal, après avoir fait `pip install openai`, faites :

{% code overflow="wrap" %}

```python
from openai import OpenAI
import json
openai_client = OpenAI(
    base_url = "http://127.0.0.1:8001/v1",
    api_key = "sk-no-key-required",
)
completion = openai_client.chat.completions.create(
    model = "unsloth/NVIDIA-Nemotron-3-Super-120B-A12B",
    messages = [{"role": "user", "content": "What is 2+2?"},],
)
print(completion.choices[0].message.reasoning_content)
print(completion.choices[0].message.content)
```

{% endcode %}

Qui affichera

{% code overflow="wrap" %}

```
D'accord, l'utilisateur a demandé « Que fait 2+2 ? » Cela semble être une question d'arithmétique très simple.

Hmm, peut-être qu'ils testent si je suis attentif, ou peut-être s'agit-il d'un jeune enfant qui apprend les maths. Cela pourrait aussi être quelqu'un qui vérifie si je vais compliquer une question simple.

Je devrais rester simple puisqu'il n'y a aucune indication de piège dans la question. La réponse est définitivement 4 — pas besoin de remettre en question une addition de base.

Même si une partie de moi se demande s'ils préparent une blague (comme « 2+2=5 pour de grandes valeurs de 2 »), comme ils n'ont donné aucun contexte, je vais supposer qu'il s'agit d'une vraie question.

Mieux vaut répondre clairement et chaleureusement — cela pourrait les encourager à poser d'autres questions s'ils apprennent. Pas besoin de fioritures cependant ; il suffit d'énoncer le fait de manière utile.

2 + 2 égale **4**.

C'est un fait arithmétique fondamental en notation en base 10 (décimale). Si vous demandez dans un autre contexte (comme l'arithmétique modulaire, le binaire ou une blague/référence), n'hésitez pas à préciser — je suis heureux de m'adapter ! 😊
```

{% endcode %}

### Benchmarks

Par rapport à des modèles de taille similaire, Nemotron 3 Super affiche de bonnes performances, tout en offrant le débit le plus élevé.

<figure><img src="/files/c7ffe504c04c638a74dde116ae587b9ef46d20d4" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/nemotron-3/nemotron-3-super.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
