🧩NVIDIA Nemotron 3 Nano Omni - comment exécuter en local
Exécutez et fine-tunez Nemotron-3-Nano-Omni-30B-A3B localement sur votre appareil !
NVIDIA Nemotron-3-Nano-Omni-30B-A3B est un modèle MoE hybride de raisonnement ouvert à 30B paramètres, dont 3B actifs, conçu pour des charges de travail agentiques multimodales incluant audio, vidéo, du texte, des images et des documents en entrée, avec une sortie texte. Le modèle fonctionne avec 25 Go de RAM pour le 4 bits et 36 Go pour le 8 bits.
Avec un contexte de 256K, Nemotron 3 Nano Omni est le omni le plus puissant modèle pour sa taille et le modèle multimodal ouvert le plus efficace. Nous avons collaboré avec NVIDIA pour une prise en charge dès le jour 0 ! GGUF : Nemotron-3-Nano-Omni-30B-A3B-Reasoning
⚙️ Guide d'utilisation
NVIDIA recommande ces paramètres pour l'inférence :
Mode de réflexion :
température = 0.6top_p = 0.95
Mode instruct :
température = 0.2
Exécuter Nemotron-3-Nano-Omni
Selon votre cas d'utilisation, vous devrez utiliser des paramètres différents. Certains GGUF finissent par avoir une taille similaire parce que l'architecture du modèle (comme gpt-oss) a des dimensions non divisibles par 128, donc certaines parties ne peuvent pas être quantifiées avec moins de bits. GGUF : Nemotron-3-Nano-Omni-30B-A3B-Reasoning
Les versions 4 bits du modèle nécessitent ~25 Go de RAM. Le 8 bits nécessite 36 Go. Pour ces guides, nous utiliserons UD-Q4-K-XL qui offre un bon équilibre entre taille et précision.
Exécuter dans Unsloth StudioExécuter dans llama.cpp
Actuellement, aucun GGUF multimodal/vision ne fonctionne dans Ollama en raison de fichiers mmproj vision séparés. Utilisez des backends compatibles avec llama.cpp.
NE PAS utiliser CUDA 13.2 car vous pourriez obtenir des sorties incohérentes. NVIDIA travaille sur une correction.
🦥 Guide Unsloth Studio
Pour ce tutoriel, nous utiliserons Unsloth Studio, qui est notre nouvelle interface web pour exécuter et entraîner des LLM. Avec Unsloth Studio, vous pouvez exécuter des modèles et traiter des entrées audio, des images et du texte localement sur Mac, Windows, et Linux, et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Comparer les modèles côte à côte
Appel d'outils auto-réparateur + recherche web
Exécution de code (Python, Bash)
Inférence automatique ajustement des paramètres (temp, top-p, etc.)
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Configurer Unsloth Studio (une seule fois)
La configuration installe automatiquement Node.js (via nvm), construit le frontend, installe toutes les dépendances Python et compile llama.cpp avec la prise en charge CUDA.
Utilisateurs de WSL : vous serez invité à saisir votre sudo mot de passe pour installer les dépendances de compilation (cmake, git, libcurl4-openssl-dev).
Rechercher et télécharger NVIDIA-Nemotron-3-Nano-30B-A3B-Omni
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte, puis vous reconnecter plus tard. Ensuite, allez dans l'onglet Studio Chat et recherchez Nemotron-3-Nano-Omni dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Nemotron-3-Nano-30B-A3B-Omni
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth Studio.

🦙 Tutoriel Llama.cpp :
Instructions pour exécuter dans llama.cpp (notez que nous utiliserons le 4 bits pour convenir à la plupart des appareils) :
Obtenez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Commençons d'abord par obtenir une image ! Vous pouvez également téléverser des images. Nous utiliserons https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, qui est simplement notre mini-logo montrant comment les fine-tunes sont réalisés avec Unsloth :

Récupérons la 2e image à https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

Téléchargeons maintenant le modèle manuellement. Nous pouvons le faire via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Débogage de Hugging Face Hub, XET
Puis exécutez le modèle en mode conversation :
Vous verrez alors ce qui suit :

Puis utilisez /image pour charger les deux images et demander « Qu'est-ce que cette image ? » :


Et pour l'image du paresseux :

Service et déploiement avec llama-server
Pour déployer Nemotron 3 Nano Omni localement, utilisez llama-server. Dans un nouveau terminal, par exemple via tmux, déployez le modèle :
Si vous avez téléchargé le modèle manuellement, utilisez :
Puis dans un nouveau terminal, après avoir installé le client OpenAI avec pip install openai:
Ce qui affichera quelque chose comme ci-dessous :

Entrée d'image via le serveur compatible OpenAI
Utilisons picture.png qui était l'image du paresseux comme dans NVIDIA Nemotron 3 Omni
Ce qui affichera quelque chose comme ci-dessous :

🦥 Fine-tuning de Nemotron 3 Nano Omni
Unsloth prend en charge toute la famille de modèles Nemotron . Nemotron 3 Nano Omni est utile pour les ensembles de données d'agents multimodaux. Vous pouvez entraîner sur l'audio, la vision ou le texte via Unsloth. Entrée vidéo l'ajustement fin n'est actuellement pas pris en charge.
Pour le texte uniquement et les notebooks, vous pouvez partir du flux d'ajustement fin existant de Nemotron 3 Nano. Pour les adaptateurs multimodaux, assurez-vous que votre ensemble de données inclut la modalité dont votre agent a réellement besoin :
Utilisation de l'ordinateur : captures d'écran, état de l'interface, curseur/contexte, action suivante attendue
Intelligence documentaire : PDF, captures d'écran, graphiques, tableaux, cibles d'extraction structurée
Compréhension audio : clips audio, images échantillonnées, résumés, horodatages, événements et questions de suivi
Boucles d'agent : exemples observation → raisonnement → action → validation
Pour Omni, ne réutilisez pas aveuglément les chiffres de VRAM du texte seul. Les encodeurs multimodaux, les poids du projecteur, les jetons d'image, les segments audio et le long contexte augmentent tous l'utilisation de la mémoire. Commencez avec des contextes plus courts et des tailles de lot plus petites, puis augmentez progressivement.
Benchmarks
Nemotron 3 Nano Omni est le modèle omni le plus puissant pour sa taille. C'est aussi le modèle multimodal ouvert le plus efficace, avec une précision de premier plan. Le modèle surpasse Qwen3-Omni-30B-A3B sur tous les benchmarks.

Mis à jour
Ce contenu vous a-t-il été utile ?


