For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Nano Omni - comment exécuter en local

Exécutez et fine-tunez Nemotron-3-Nano-Omni-30B-A3B localement sur votre appareil !

NVIDIA Nemotron-3-Nano-Omni-30B-A3B est un modèle MoE hybride de raisonnement ouvert à 30B paramètres, dont 3B actifs, conçu pour des charges de travail agentiques multimodales incluant audio, vidéo, du texte, des images et des documents en entrée, avec une sortie texte. Le modèle fonctionne avec 25 Go de RAM pour le 4 bits et 36 Go pour le 8 bits.

Avec un contexte de 256K, Nemotron 3 Nano Omni est le omni le plus puissant modèle pour sa taille et le modèle multimodal ouvert le plus efficace. Nous avons collaboré avec NVIDIA pour une prise en charge dès le jour 0 ! GGUF : Nemotron-3-Nano-Omni-30B-A3B-Reasoning

⚙️ Guide d'utilisation

NVIDIA recommande ces paramètres pour l'inférence :

Mode de réflexion :

  • température = 0.6

  • top_p = 0.95

Mode instruct :

  • température = 0.2

Exécuter Nemotron-3-Nano-Omni

Selon votre cas d'utilisation, vous devrez utiliser des paramètres différents. Certains GGUF finissent par avoir une taille similaire parce que l'architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées avec moins de bits. GGUF : Nemotron-3-Nano-Omni-30B-A3B-Reasoning

Les versions 4 bits du modèle nécessitent ~25 Go de RAM. Le 8 bits nécessite 36 Go. Pour ces guides, nous utiliserons UD-Q4-K-XL qui offre un bon équilibre entre taille et précision.

Exécuter dans Unsloth StudioExécuter dans llama.cpp

🦥 Guide Unsloth Studio

Pour ce tutoriel, nous utiliserons Unsloth Studio, qui est notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et traiter des entrées audio, des images et du texte localement sur Mac, Windows, et Linux, et :

1

Installer Unsloth

MacOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell :

irm https://unsloth.ai/install.ps1 | iex
2

Configurer Unsloth Studio (une seule fois)

La configuration installe automatiquement Node.js (via nvm), construit le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.

Utilisateurs de WSL : vous serez invité à saisir votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).

3

Lancer Unsloth

MacOS, Linux, WSL :

source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888

Windows PowerShell :

unsloth studio -H 0.0.0.0 -p 8888

Puis ouvrez http://127.0.0.1:8888 dans votre navigateur.

4

Rechercher et télécharger NVIDIA-Nemotron-3-Nano-30B-A3B-Omni

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte, puis vous reconnecter plus tard. Ensuite, allez dans l'onglet Studio Chat et recherchez Nemotron-3-Nano-Omni dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

5

Exécuter Nemotron-3-Nano-30B-A3B-Omni

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth Studio.

🦙 Tutoriel Llama.cpp :

Instructions pour exécuter dans llama.cpp (notez que nous utiliserons le 4 bits pour convenir à la plupart des appareils) :

1

Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Commençons d'abord par obtenir une image ! Vous pouvez également téléverser des images. Nous utiliserons https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, qui est simplement notre mini-logo montrant comment les fine-tunes sont réalisés avec Unsloth :

Récupérons la 2e image à https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

3

Téléchargeons maintenant le modèle manuellement. Nous pouvons le faire via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub, XET

4

Puis exécutez le modèle en mode conversation :

5

Vous verrez alors ce qui suit :

6

Puis utilisez /image pour charger les deux images et demander « Qu'est-ce que cette image ? » :

7

Et pour l'image du paresseux :

Service et déploiement avec llama-server

Pour déployer Nemotron 3 Nano Omni localement, utilisez llama-server. Dans un nouveau terminal, par exemple via tmux, déployez le modèle :

Si vous avez téléchargé le modèle manuellement, utilisez :

Puis dans un nouveau terminal, après avoir installé le client OpenAI avec pip install openai:

Ce qui affichera quelque chose comme ci-dessous :

Entrée d'image via le serveur compatible OpenAI

Utilisons picture.png qui était l'image du paresseux comme dans NVIDIA Nemotron 3 Omni

Ce qui affichera quelque chose comme ci-dessous :

🦥 Fine-tuning de Nemotron 3 Nano Omni

Unsloth prend en charge toute la famille de modèles Nemotron . Nemotron 3 Nano Omni est utile pour les ensembles de données d'agents multimodaux. Vous pouvez entraîner sur l'audio, la vision ou le texte via Unsloth. Entrée vidéo l'ajustement fin n'est actuellement pas pris en charge.

Pour le texte uniquement et les notebooks, vous pouvez partir du flux d'ajustement fin existant de Nemotron 3 Nano. Pour les adaptateurs multimodaux, assurez-vous que votre ensemble de données inclut la modalité dont votre agent a réellement besoin :

  • Utilisation de l'ordinateur : captures d'écran, état de l'interface, curseur/contexte, action suivante attendue

  • Intelligence documentaire : PDF, captures d'écran, graphiques, tableaux, cibles d'extraction structurée

  • Compréhension audio : clips audio, images échantillonnées, résumés, horodatages, événements et questions de suivi

  • Boucles d'agent : exemples observation → raisonnement → action → validation

Pour Omni, ne réutilisez pas aveuglément les chiffres de VRAM du texte seul. Les encodeurs multimodaux, les poids du projecteur, les jetons d'image, les segments audio et le long contexte augmentent tous l'utilisation de la mémoire. Commencez avec des contextes plus courts et des tailles de lot plus petites, puis augmentez progressivement.

Benchmarks

Nemotron 3 Nano Omni est le modèle omni le plus puissant pour sa taille. C'est aussi le modèle multimodal ouvert le plus efficace, avec une précision de premier plan. Le modèle surpasse Qwen3-Omni-30B-A3B sur tous les benchmarks.

Mis à jour

Ce contenu vous a-t-il été utile ?