For the complete documentation index, see llms.txt. This page is also available as Markdown.

NVIDIA Nemotron 3.5 Lightning : comment l'exécuter localement

NVIDIA Nemotron-3.5-Lightning-30B-A3B est un modèle MoE de raisonnement hybride ouvert de 30 milliards de paramètres, dont 3 milliards actifs, conçu pour l’exécution de tâches à grand volume dans des agents longue durée. Il est conçu pour des appels d’agent fréquents, notamment l’utilisation d’outils, la validation des sorties, la mise en forme des résultats et la délégation à des sous-agents. Le modèle fonctionne sur 20 Go de RAM pour le 4 bits et 33 Go pour le 8 bits.

Avec jusqu’à 1 M de contexte, Nemotron 3.5 Lightning est l’un des modèles d’exécution ouverts les plus rapides et les plus précis de sa taille. Vous pouvez exécuter Nemotron 3.5 localement via Unsloth Desktop et les Unsloth Dynamic GGUF. Merci à NVIDIA pour la prise en charge dès le jour zéro ! GGUF : Nemotron-3.5-Lightning-30B-A3B

Voir à droite : Nemotron-3.5 appelle des outils sans arrêt pendant 10 min dans Unsloth Desktop:

⚙️ Guide d’utilisation

NVIDIA recommande ces paramètres pour l’inférence :

Mode réflexion :

  • température = 0,6

  • top_p = 0,95

Mode instruction :

  • température = 0,2

Exécuter Nemotron 3.5 Lightning

Selon votre cas d’usage, vous devrez utiliser des paramètres différents. Nemotron 3.5 Lightning active 3 milliards de paramètres par jeton, ce qui le rend assez rapide pour des appels répétés tout au long de workflows d’agents longue durée. GGUF : Nemotron-3.5-Lightning-30B-A3B

Les versions 4 bits du modèle nécessitent environ 20 Go de RAM. Le 8 bits nécessite 33 Go. Pour ces guides, nous utiliserons UD-Q4-K-XL qui offre un bon équilibre entre taille et précision.

Exécuter dans Unsloth DesktopExécuter dans llama.cpp

🦥 Guide Unsloth Desktop

Pour ce tutoriel, nous utiliserons Unsloth Desktop, une application locale open source pour exécuter et entraîner des modèles. Avec Unsloth, vous pouvez exécuter des modèles localement sur Mac, Windows et Linux et :

  • Rechercher, télécharger et exécuter des modèles GGUF et safetensor

  • Comparer des modèles côte à côte

  • Utiliser l’auto-réparation des appels d’outils et la recherche sur le web

  • Exécuter l’exécution de code avec Python et Bash

  • Utiliser le réglage automatique des paramètres d’inférence

  • Entraînez des LLM 2x plus vite avec 70 % de VRAM en moins

1

Installer Unsloth

Le moyen le plus simple de commencer est de télécharger l’ application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez l’installer manuellement :

MacOS, Linux, WSL :

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell :

irm https://unsloth.ai/install.ps1 | iex
2

Rechercher et télécharger Nemotron 3.5

Allez sur Unsloth Chat ou le hub de modèles et recherchez Nemotron 3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter Nemotron 3.5 Lightning

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez aussi éditer la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence Unsloth.

🦙 Tutoriel Llama.cpp :

Instructions pour exécuter dans llama.cpp (note : nous utiliserons le 4 bits pour convenir à la plupart des appareils) :

1

Obtenez la dernière version de llama.cpp et compilez-la. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU CUDA ou si vous souhaitez une inférence CPU. Pour les appareils Apple Mac et Metal, définissez -DGGML_CUDA=OFF. La prise en charge de Metal est activée par défaut.

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
2

Téléchargeons maintenant le modèle manuellement. Nous pouvons le faire via le code ci-dessous après avoir installé huggingface_hub. Si les téléchargements se bloquent, voir : débogage du Hugging Face Hub, XET

pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # Utilisez "*UD-Q2_K_XL*" pour le dynamique 2 bits
3

Exécutez le modèle en mode conversation :

./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
    --temp 0.6 \\
    --top-p 0.95 \\
    --min-p 0.01

Nemotron 3.5 Lightning est livré avec MTP et des modèles brouillons DFlash et DSpark dédiés pour le décodage spéculatif. Ces modèles brouillons prédisent plusieurs jetons à l’avance, ce qui augmente la vitesse de sortie pour les charges de travail d’agents à grand volume.

🦥 Fine-tuning de Nemotron 3.5 Lightning

Unsloth prend en charge l’entraînement postérieur pour toute la famille de modèles NVIDIA Nemotron. Nemotron 3.5 Lightning est utile pour des tâches spécialisées à haute fréquence au sein d’agents longue durée. Vous pouvez entraîner le modèle 2x plus vite avec 70 % de VRAM en moins grâce à Unsloth.

Les données utiles pour le fine-tuning peuvent inclure :

  • Appel d’outils : choisir le bon outil, produire des arguments valides et se remettre des erreurs d’outil

  • Validation des résultats : vérifier les sorties par rapport à des contraintes, des schémas ou à l’état attendu

  • Travail sur dépôt : commandes shell courantes, exécution de tests, mise en forme et résumés structurés

  • Délégation à des sous-agents : sélectionner un spécialiste, rédiger une tâche ciblée et intégrer le résultat

  • Traces d’agents longue durée : exemple observation → raisonnement → action → validation → récupération

  • Flux de travail métier : tâches répétitives propres à l’organisation, où la latence et la cohérence comptent

Ne dimensionnez pas le matériel de fine-tuning comme s’il s’agissait d’un modèle dense de 3B. Bien que seuls 3 milliards de paramètres soient actifs à chaque jeton, le modèle contient 30 milliards de paramètres au total. La longueur du contexte, le choix de l’optimiseur, la taille du lot et la longueur de séquence affecteront également l’utilisation de la mémoire.

Pour les notebooks et les instructions d’entraînement, partez du flux de fine-tuning Nemotron existant. Commencez avec des contextes plus courts et des tailles de lot plus petites, puis augmentez progressivement.

Benchmarks

Nemotron 3.5 Lightning se situe sur la frontière de Pareto précision-vitesse pour les petits modèles ouverts :

  • Jusqu’à une sortie 4x plus rapide que des modèles de taille similaire

  • 86 % de précision sur PinchBench

  • Termine 10 000 tâches PinchBench 35 % plus vite que Qwen 3.6 35B à une précision similaire

L’Artificial Analysis Intelligence Index combine des évaluations de tâches agentiques, de codage, de raisonnement scientifique et d’intelligence générale. NVIDIA mesure aussi le temps nécessaire pour accomplir un travail utile d’agent, et pas seulement le débit brut en jetons par seconde.

Nemotron 3.5 Lightning est conçu pour se situer sous les modèles de raisonnement de pointe dans un système d’agent routé : la planification difficile est envoyée à un modèle plus grand, tandis que l’exécution à grand volume est envoyée à Lightning. NVIDIA prévoit de publier les poids, les données d’entraînement et les recettes sous OpenMDW-1.1, et NeMo Switchyard peut acheminer chaque requête vers le modèle le plus approprié.

Pour les détails complets du lancement de NVIDIA, consultez le annonce Nemotron 3.5 Lightning.

Mis à jour

Ce contenu vous a-t-il été utile ?