For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron-3-Super : guide d'exécution

Exécutez et fine-tunez NVIDIA Nemotron-3-Super-120B-A12B localement sur votre appareil !

NVIDIA publie Nemotron-3-Super-120B-A12B, un modèle MoE hybride de raisonnement ouvert de 120B avec 12B de paramètres actifs, faisant suite au lancement précédent de Nemotron-3-Nano, son pendant de 30B. Nemotron-3-Super est conçu pour une grande efficacité et une grande précision pour l'IA multi-agent. Avec une fenêtre de contexte de 1M de jetons , il domine sa catégorie de taille sur les benchmarks AIME 2025, Terminal Bench et SWE-Bench Verified, tout en atteignant le débit le plus élevé.

Nemotron-3-Super fonctionne sur un appareil avec 64 Go de RAM, de VRAM ou de mémoire unifiée et peut désormais être affiné localement. Merci à NVIDIA d'avoir offert à Unsloth une prise en charge dès le premier jour.

Nemotron 3 SuperNemotron 3 Nano

GGUF : Nemotron-3-Super-120B-A12B-GGUFNVFP4FP8BF16

⚙️ Guide d’utilisation

NVIDIA recommande ces paramètres pour l’inférence :

Chat/instructions générales (par défaut) :

  • température = 1.0

  • top_p = 1.0

Cas d’usage d’appel d’outils :

  • température = 0.6

  • top_p = 0.95

Pour la plupart des utilisations locales, définissez :

  • max_new_tokens = 32,768 en 262,144 pour les invites standard avec un maximum de 1M de jetons

  • Augmentez-le pour un raisonnement approfondi ou une génération de longue durée selon la capacité de votre RAM/VRAM.

Le format du modèle de conversation se trouve lorsque nous utilisons ce qui suit :

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)

Format du modèle de conversation Nemotron 3 :

Nemotron 3 utilise <think> avec l’ID de jeton 12 et </think> avec l’ID de jeton 13 pour le raisonnement. Utilisez --special pour voir les jetons pour llama.cpp. Vous devrez peut-être aussi utiliser --verbose-prompt pour voir <think> car il est préfixé.

🖥️ Exécuter Nemotron-3-Super-120B-A12B

Selon votre cas d’utilisation, vous devrez utiliser différents paramètres. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à des bits plus faibles. Accédez aux GGUFs ici.

Les versions 4 bits du modèle nécessitent environ 64 Go de RAM - 72 Go de RAM. La version 8 bits nécessite 128 Go.

Tutoriel Llama.cpp (GGUF) :

Instructions pour l’exécution dans llama.cpp (notez que nous utiliserons du 4 bits pour convenir à la plupart des appareils) :

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Changez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous souhaitez simplement une inférence CPU.

2

Vous pouvez le récupérer directement depuis Hugging Face. Vous pouvez augmenter le contexte jusqu’à 1M selon la capacité de votre RAM/VRAM.

Suivez ceci pour les cas d'utilisation de instruction générale :

Suivez ceci pour les cas d'utilisation de appel d'outils :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q4_K_M ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

Aussi, ajustez la fenêtre de contexte selon les besoins. Assurez-vous que votre matériel peut gérer plus qu’une fenêtre de contexte de 256K. La régler à 1M peut déclencher une OOM CUDA et provoquer un plantage, c’est pourquoi la valeur par défaut est 262 144.

🦥 Affinage de Nemotron 3 et RL

Unsloth prend désormais en charge l'affinage de tous les modèles Nemotron, y compris Nemotron 3 Super et Nano. Pour des exemples de notebook pour Nano, consultez notre guide d'affinage Nemotron 3 Nano.

Nemotron 3 Super

  • L'affinage de la couche routeur est désactivé par défaut pour des raisons de stabilité.

  • Nemotron-3-Super-120B - LoRA bf16 fonctionne sur 256 Go de VRAM. Si vous utilisez plusieurs GPU, ajoutez device_map = "balanced" ou suivez notre Guide multiGPU.

🦙 Hébergement et déploiement de Llama-server

Pour déployer Nemotron 3 en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux, déployez le modèle via :

Lorsque vous exécutez ce qui précède, vous obtiendrez :

Puis dans un nouveau terminal, après avoir fait pip install openai, faites :

Qui affichera

Benchmarks

Par rapport à des modèles de taille similaire, Nemotron 3 Super affiche de bonnes performances, tout en offrant le débit le plus élevé.

Mis à jour

Ce contenu vous a-t-il été utile ?