⚡NVIDIA Nemotron 3.5 Lightning : comment l'exécuter localement
NVIDIA Nemotron-3.5-Lightning-30B-A3B est un modèle MoE de raisonnement hybride ouvert de 30 milliards de paramètres, dont 3 milliards actifs, conçu pour l’exécution de tâches à grand volume dans des agents longue durée. Il est conçu pour des appels d’agent fréquents, notamment l’utilisation d’outils, la validation des sorties, la mise en forme des résultats et la délégation à des sous-agents. Le modèle fonctionne sur 20 Go de RAM pour le 4 bits et 33 Go pour le 8 bits.
Avec jusqu’à 1 M de contexte, Nemotron 3.5 Lightning est l’un des modèles d’exécution ouverts les plus rapides et les plus précis de sa taille. Vous pouvez exécuter Nemotron 3.5 localement via Unsloth Desktop et les Unsloth Dynamic GGUF. Merci à NVIDIA pour la prise en charge dès le jour zéro ! GGUF : Nemotron-3.5-Lightning-30B-A3B
Voir à droite : Nemotron-3.5 appelle des outils sans arrêt pendant 10 min dans Unsloth Desktop:

⚙️ Guide d’utilisation
NVIDIA recommande ces paramètres pour l’inférence :
Mode réflexion :
température = 0,6top_p = 0,95
Mode instruction :
température = 0,2
Exécuter Nemotron 3.5 Lightning
Selon votre cas d’usage, vous devrez utiliser des paramètres différents. Nemotron 3.5 Lightning active 3 milliards de paramètres par jeton, ce qui le rend assez rapide pour des appels répétés tout au long de workflows d’agents longue durée. GGUF : Nemotron-3.5-Lightning-30B-A3B
Les versions 4 bits du modèle nécessitent environ 20 Go de RAM. Le 8 bits nécessite 33 Go. Pour ces guides, nous utiliserons UD-Q4-K-XL qui offre un bon équilibre entre taille et précision.
🦥 Guide Unsloth Desktop
Pour ce tutoriel, nous utiliserons Unsloth Desktop, une application locale open source pour exécuter et entraîner des modèles. Avec Unsloth, vous pouvez exécuter des modèles localement sur Mac, Windows et Linux et :
Rechercher, télécharger et exécuter des modèles GGUF et safetensor
Comparer des modèles côte à côte
Utiliser l’auto-réparation des appels d’outils et la recherche sur le web
Exécuter l’exécution de code avec Python et Bash
Utiliser le réglage automatique des paramètres d’inférence
Entraînez des LLM 2x plus vite avec 70 % de VRAM en moins

Installer Unsloth
Le moyen le plus simple de commencer est de télécharger l’ application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez l’installer manuellement :
MacOS, Linux, WSL :
curl -fsSL https://unsloth.ai/install.sh | shWindows PowerShell :
irm https://unsloth.ai/install.ps1 | iexRechercher et télécharger Nemotron 3.5
Allez sur Unsloth Chat ou le hub de modèles et recherchez Nemotron 3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Nemotron 3.5 Lightning
Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez aussi éditer la longueur du contexte, le modèle de chat et d’autres paramètres.
Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth.

🦙 Tutoriel Llama.cpp :
Instructions pour exécuter dans llama.cpp (note : nous utiliserons le 4 bits pour convenir à la plupart des appareils) :
Obtenez la dernière version de llama.cpp et compilez-la. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU CUDA ou si vous souhaitez une inférence CPU. Pour les appareils Apple Mac et Metal, définissez -DGGML_CUDA=OFF. La prise en charge de Metal est activée par défaut.
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
--target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cppTéléchargeons maintenant le modèle manuellement. Nous pouvons le faire via le code ci-dessous après avoir installé huggingface_hub. Si les téléchargements se bloquent, voir : débogage du Hugging Face Hub, XET
pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
--local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
--include "*UD-Q4_K_XL*" # Utilisez "*UD-Q2_K_XL*" pour le dynamique 2 bitsExécutez le modèle en mode conversation :
./llama.cpp/llama-cli \\
--model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
--temp 0.6 \\
--top-p 0.95 \\
--min-p 0.01🦥 Fine-tuning de Nemotron 3.5 Lightning
Unsloth prend en charge l’entraînement postérieur pour toute la famille de modèles NVIDIA Nemotron. Nemotron 3.5 Lightning est utile pour des tâches spécialisées à haute fréquence au sein d’agents longue durée. Vous pouvez entraîner le modèle 2x plus vite avec 70 % de VRAM en moins grâce à Unsloth.
Les données utiles pour le fine-tuning peuvent inclure :
Appel d’outils : choisir le bon outil, produire des arguments valides et se remettre des erreurs d’outil
Validation des résultats : vérifier les sorties par rapport à des contraintes, des schémas ou à l’état attendu
Travail sur dépôt : commandes shell courantes, exécution de tests, mise en forme et résumés structurés
Délégation à des sous-agents : sélectionner un spécialiste, rédiger une tâche ciblée et intégrer le résultat
Traces d’agents longue durée : exemple observation → raisonnement → action → validation → récupération
Flux de travail métier : tâches répétitives propres à l’organisation, où la latence et la cohérence comptent
Ne dimensionnez pas le matériel de fine-tuning comme s’il s’agissait d’un modèle dense de 3B. Bien que seuls 3 milliards de paramètres soient actifs à chaque jeton, le modèle contient 30 milliards de paramètres au total. La longueur du contexte, le choix de l’optimiseur, la taille du lot et la longueur de séquence affecteront également l’utilisation de la mémoire.
Pour les notebooks et les instructions d’entraînement, partez du flux de fine-tuning Nemotron existant. Commencez avec des contextes plus courts et des tailles de lot plus petites, puis augmentez progressivement.
Benchmarks
Nemotron 3.5 Lightning se situe sur la frontière de Pareto précision-vitesse pour les petits modèles ouverts :
Jusqu’à une sortie 4x plus rapide que des modèles de taille similaire
86 % de précision sur PinchBench
Termine 10 000 tâches PinchBench 35 % plus vite que Qwen 3.6 35B à une précision similaire
L’Artificial Analysis Intelligence Index combine des évaluations de tâches agentiques, de codage, de raisonnement scientifique et d’intelligence générale. NVIDIA mesure aussi le temps nécessaire pour accomplir un travail utile d’agent, et pas seulement le débit brut en jetons par seconde.
Nemotron 3.5 Lightning est conçu pour se situer sous les modèles de raisonnement de pointe dans un système d’agent routé : la planification difficile est envoyée à un modèle plus grand, tandis que l’exécution à grand volume est envoyée à Lightning. NVIDIA prévoit de publier les poids, les données d’entraînement et les recettes sous OpenMDW-1.1, et NeMo Switchyard peut acheminer chaque requête vers le modèle le plus approprié.
Pour les détails complets du lancement de NVIDIA, consultez le annonce Nemotron 3.5 Lightning.
Mis à jour
Ce contenu vous a-t-il été utile ?

