For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Nano - guide d'exécution

Exécutez et affinez NVIDIA Nemotron 3 Nano localement sur votre appareil !

NVIDIA publie Nemotron-3-Nano-4B, un modèle MoE hybride ouvert de 4B qui suit Nemotron-3-Super-120B-A12B et Nemotron-3-Nano-30B-A3B. La famille Nemotron est conçue pour le codage, les mathématiques et les charges de travail agentiques rapides et précises. Elle offre un contexte de 1 million de tokens fenêtre et sont compétitifs sur les benchmarks de raisonnement, de chat et de débit.

Nemotron-3-Nano-4B fonctionne avec 5GB de RAM, de VRAM ou de mémoire unifiée. Nemotron-3-Nano-30A3B fonctionne avec 24GB de RAM. Nemotron 3 peut désormais être fine-tuné localement via Unsloth. Merci à NVIDIA d’avoir offert à Unsloth une prise en charge dès le premier jour.

Nemotron-3-Nano-4BNemotron-3-Nano-30B-A3BFine-tuning de Nemotron 3

⚙️ Guide d'utilisation

NVIDIA recommande ces paramètres pour l'inférence :

Chat/instruction générale (par défaut) :

  • temperature = 1.0

  • top_p = 1.0

Cas d’utilisation d’appel d’outils :

  • temperature = 0.6

  • top_p = 0.95

Pour la plupart des utilisations locales, définissez :

  • max_new_tokens = 32,768 par 262,144 pour les invites standard avec un maximum de 1 million de tokens

  • Augmentez pour un raisonnement approfondi ou une génération longue, selon les capacités de votre RAM/VRAM.

Le format du modèle de chat est obtenu lorsque nous utilisons ce qui suit :

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "Combien font 1+1 ?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "Combien font 2+2 ?"}
    ], add_generation_prompt = True, tokenize = False,
)

Format du modèle de chat Nemotron 3 :

Nemotron 3 utilise <think> avec l’ID de token 12 et </think> avec l’ID de token 13 pour le raisonnement. Utilisez --special pour voir les tokens pour llama.cpp. Vous pourriez aussi avoir besoin de --verbose-prompt pour voir <think> puisqu’il est préfixé.

🖥️ Exécuter Nemotron-3-Nano-4B

Selon votre cas d’utilisation, vous devrez utiliser des paramètres différents. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à des bits plus faibles.

Les versions 4 bits du modèle nécessitent environ 3 Go de RAM. La version 8 bits nécessite 5 Go.

🦥 Guide d'Unsloth Studio

Nemotron 3 peut être exécuté et fine-tuné dans Unsloth Studio, notre nouvelle interface web open source pour l’IA locale. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Exécutez dans votre terminal :

macOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL, Windows :

Puis ouvrez http://localhost:8888 dans votre navigateur.

3

Recherchez et téléchargez Nemotron-3-Nano-4B

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Vous verrez ensuite un court assistant d’intégration pour choisir un modèle, un jeu de données et des paramètres de base. Vous pouvez le passer à tout moment.

Puis allez dans l’onglet Unsloth Chat onglet et recherchez Nemotron-3-Nano-4B dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécuter Nemotron-3-Nano-4B

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

Tutoriel Llama.cpp :

Instructions pour l’exécuter dans llama.cpp (nous utiliserons le 8 bits pour une précision quasi complète) :

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU.

2

Vous pouvez le télécharger directement depuis Hugging Face. Vous pouvez augmenter le contexte à 1 million selon les capacités de votre RAM/VRAM.

Suivez ceci pour les cas d’utilisation d’instructions générales :

Suivez ceci pour appel d’outils :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q8_0 ou d’autres versions quantifiées.

4

Ensuite, exécutez le modèle en mode conversation :

Ajustez également la fenêtre de contexte selon les besoins. Assurez-vous que votre matériel peut gérer une fenêtre de contexte supérieure à 256K. La régler à 1 million peut déclencher une erreur CUDA OOM et provoquer un crash, c’est pourquoi la valeur par défaut est 262 144.

🖥️ Exécuter Nemotron-3-Nano-30B-A3B

Selon votre cas d’utilisation, vous devrez utiliser des paramètres différents. Certains GGUF finissent par avoir une taille similaire parce que l’architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées à des bits plus faibles.

Les versions 4 bits du modèle nécessitent environ 24 Go de RAM. La version 8 bits nécessite 36 Go.

🦥 Guide d'Unsloth Studio

Pour ce tutoriel, nous utiliserons Unsloth Studio, qui est notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles localement sur Mac, Windows, et Linux, et :

1

Installer Unsloth

macOS, Linux, WSL :

Windows PowerShell :

2

Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), compile le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge de CUDA.

Utilisateurs de WSL : vous serez invité à saisir votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).

3

Lancer Unsloth

macOS, Linux, WSL :

Windows PowerShell :

Puis ouvrez http://localhost:8888 dans votre navigateur.

4

Recherchez et téléchargez Nemotron-3-Nano-30B-A3B

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Vous verrez ensuite un court assistant d’intégration pour choisir un modèle, un jeu de données et des paramètres de base. Vous pouvez le passer à tout moment.

Puis allez dans l’onglet Unsloth Chat onglet et recherchez Nemotron-3-Nano-4B dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

5

Exécuter Nemotron-3-Nano-30B-A3B

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

Tutoriel Llama.cpp :

Instructions pour l'exécution dans llama.cpp (notez que nous utiliserons 4 bits pour tenir sur la plupart des appareils) :

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Vous pouvez le télécharger directement depuis Hugging Face. Vous pouvez augmenter le contexte à 1 million selon les capacités de votre RAM/VRAM.

Suivez ceci pour les cas d’utilisation d’instructions générales :

Suivez ceci pour appel d’outils :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir UD-Q4_K_XL ou d’autres versions quantifiées.

4

Ensuite, exécutez le modèle en mode conversation :

Ajustez également la fenêtre de contexte selon les besoins. Assurez-vous que votre matériel peut gérer une fenêtre de contexte supérieure à 256K. La régler à 1 million peut déclencher une erreur CUDA OOM et provoquer un crash, c’est pourquoi la valeur par défaut est 262 144.

Nemotron 3 utilise <think> avec l’ID de token 12 et </think> avec l’ID de token 13 pour le raisonnement. Utilisez --special pour voir les tokens pour llama.cpp. Vous pourriez aussi avoir besoin de --verbose-prompt pour voir <think> puisqu’il est préfixé.

🦥 Fine-tuning de Nemotron 3 et RL

Unsloth prend désormais en charge le fine-tuning de tous les modèles Nemotron, y compris Nemotron 3 Super et Nano.

Le modèle 4B tient sur un GPU Colab gratuit cependant le modèle 30B ne tient pas. Nous avons quand même préparé un notebook Colab A100 de 80 Go pour que vous puissiez y effectuer le fine-tuning. Le fine-tuning LoRA en 16 bits de Nemotron 3 Nano utilisera environ 60 Go de VRAM:

Concernant le fine-tuning des MoE, il n’est probablement pas judicieux de fine-tuner la couche de routage, nous l’avons donc désactivée par défaut. Si vous souhaitez conserver ses capacités de raisonnement (facultatif), vous pouvez utiliser un mélange de réponses directes et d’exemples de raisonnement pas à pas. Utilisez au moins 75 % de raisonnement et 25 % sans raisonnement dans votre jeu de données pour que le modèle conserve ses capacités de raisonnement.

Apprentissage par renforcement + NeMo Gym

Nous avons collaboré avec l’open source NVIDIA NeMo Gym équipe pour permettre la démocratisation des environnements RL. Notre collaboration permet un entraînement RL par rollout à tour unique pour de nombreux domaines d’intérêt, notamment les mathématiques, le codage, l’utilisation d’outils, etc, en utilisant les environnements et jeux de données d’entraînement de NeMo Gym :

🦙 Diffusion et déploiement de Llama-server

Pour déployer Nemotron 3 en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux, déployez le modèle via :

Lorsque vous exécutez la commande ci-dessus, vous obtenez :

Puis, dans un nouveau terminal, après avoir effectué pip install openai, faites :

Ce qui affichera

Benchmarks

Nemotron-3-Nano-4B est le modèle offrant les meilleures performances pour sa taille, y compris en termes de débit.

Nemotron-3-Nano-30B-A3B est le modèle offrant les meilleures performances sur tous les benchmarks, y compris en termes de débit.

Mis à jour

Ce contenu vous a-t-il été utile ?