> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/fr/modeles/nemotron-3.5.md).

# NVIDIA Nemotron 3.5 Lightning : comment l'exécuter localement

NVIDIA Nemotron-3.5-Lightning-30B-A3B est un modèle MoE de raisonnement hybride ouvert de 30 milliards de paramètres, dont 3 milliards actifs, conçu pour l’exécution de tâches à grand volume dans des agents longue durée. Il est conçu pour des appels d’agent fréquents, notamment l’utilisation d’outils, la validation des sorties, la mise en forme des résultats et la délégation à des sous-agents. Le modèle fonctionne sur **20 Go de RAM** pour le 4 bits et 33 Go pour le 8 bits.

{% columns %}
{% column %}
Avec jusqu’à **1 M de contexte**, Nemotron 3.5 Lightning est l’un des modèles d’exécution ouverts les plus rapides et les plus précis de sa taille. Vous pouvez exécuter Nemotron 3.5 localement via Unsloth Desktop et les Unsloth Dynamic GGUF. Merci à NVIDIA pour la prise en charge dès le jour zéro !\
**GGUF :** [Nemotron-3.5-Lightning-30B-A3B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF)

Voir à droite : Nemotron-3.5 appelle des outils sans arrêt pendant 10 min dans [Unsloth Desktop](/docs/fr/desktop.md):
{% endcolumn %}

{% column %}

<figure><img src="/files/9a394f68cde6befc3133d66de808934825a0b9ed" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### ⚙️ Guide d’utilisation

NVIDIA recommande ces paramètres pour l’inférence :

{% columns %}
{% column %}
**Mode réflexion :**

* `température = 0,6`
* `top_p = 0,95`
  {% endcolumn %}

{% column %}
**Mode instruction :**

* `température = 0,2`
  {% endcolumn %}
  {% endcolumns %}

#### Exécuter Nemotron 3.5 Lightning

Selon votre cas d’usage, vous devrez utiliser des paramètres différents. Nemotron 3.5 Lightning active 3 milliards de paramètres par jeton, ce qui le rend assez rapide pour des appels répétés tout au long de workflows d’agents longue durée. **GGUF :** [Nemotron-3.5-Lightning-30B-A3B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF)

Les versions 4 bits du modèle nécessitent environ 20 Go de RAM. Le 8 bits nécessite 33 Go. Pour ces guides, nous utiliserons `UD-Q4-K-XL` qui offre un bon équilibre entre taille et précision.

<a href="/pages/482b559296a3890c5636805c9d1f9482db9008b1#unsloth-desktop-guide" class="button primary">Exécuter dans Unsloth Desktop</a><a href="/pages/482b559296a3890c5636805c9d1f9482db9008b1#llama.cpp-tutorial" class="button secondary">Exécuter dans llama.cpp</a>

#### 🦥 Guide Unsloth Desktop

Pour ce tutoriel, nous utiliserons [Unsloth Desktop](#unsloth-desktop-guide), une application locale open source pour exécuter et entraîner des modèles. Avec Unsloth, vous pouvez exécuter des modèles localement sur **Mac, Windows et Linux** et :

{% columns %}
{% column %}

* Rechercher, télécharger et exécuter des modèles GGUF et safetensor
* **Comparer** des modèles **côte à côte**
* Utiliser **l’auto-réparation** des appels d’outils et **la recherche sur le web**
* Exécuter **l’exécution de code** avec Python et Bash
* Utiliser le réglage automatique des paramètres d’inférence
* Entraînez des LLM 2x plus vite avec 70 % de VRAM en moins
  {% endcolumn %}

{% column %}

<figure><img src="/files/be82ce72b96e7c3b938a468c27fdad5c26257297" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Installer Unsloth

Le moyen le plus simple de commencer est de télécharger l’ [application Unsloth Desktop](/docs/fr/desktop.md). Fonctionne sur [macOS](/docs/fr/commencer/install/mac.md), [Windows](/docs/fr/commencer/install/windows-installation.md), et [Linux](/docs/fr/commencer/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Télécharger Unsloth</a>

* <i class="fa-apple">:apple:</i> [Télécharger pour macOS](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Télécharger pour Windows](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Télécharger pour Linux](https://unsloth.ai/download/linux)

Ou, si vous préférez l’installer manuellement :

MacOS, Linux, WSL :

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell :

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Rechercher et télécharger Nemotron 3.5

Allez sur [Unsloth Chat](/docs/fr/nouveau/studio/chat.md) ou le hub de modèles et recherchez Nemotron 3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

<figure><img src="/files/f147841759e323424c5d7a4ff228d782fc9e78c7" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Exécuter Nemotron 3.5 Lightning

Les paramètres d’inférence devraient être définis automatiquement lors de l’utilisation d’Unsloth ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez aussi éditer la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre [guide d’inférence Unsloth](/docs/fr/nouveau/studio/chat.md).

<figure><img src="/files/9a394f68cde6befc3133d66de808934825a0b9ed" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

#### 🦙 Tutoriel Llama.cpp :

Instructions pour exécuter dans llama.cpp (note : nous utiliserons le 4 bits pour convenir à la plupart des appareils) :

{% stepper %}
{% step %}
Obtenez la dernière version de [`llama.cpp`](https://github.com/ggml-org/llama.cpp) et compilez-la. Remplacez `-DGGML_CUDA=ON` par `-DGGML_CUDA=OFF` si vous n’avez pas de GPU CUDA ou si vous souhaitez une inférence CPU. **Pour les appareils Apple Mac et Metal**, définissez `-DGGML_CUDA=OFF`. La prise en charge de Metal est activée par défaut.

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Téléchargeons maintenant le modèle manuellement. Nous pouvons le faire via le code ci-dessous après avoir installé `huggingface_hub`. Si les téléchargements se bloquent, voir : débogage du Hugging Face Hub, XET

{% code overflow="wrap" %}

```bash
pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # Utilisez "*UD-Q2_K_XL*" pour le dynamique 2 bits
```

{% endcode %}
{% endstep %}

{% step %}
Exécutez le modèle en mode conversation :

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
    --temp 0.6 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

{% hint style="info" %}
Nemotron 3.5 Lightning est livré avec MTP et des modèles brouillons DFlash et DSpark dédiés pour le décodage spéculatif. Ces modèles brouillons prédisent plusieurs jetons à l’avance, ce qui augmente la vitesse de sortie pour les charges de travail d’agents à grand volume.
{% endhint %}

#### 🦥 Fine-tuning de Nemotron 3.5 Lightning

Unsloth prend en charge l’entraînement postérieur pour toute la famille de modèles NVIDIA Nemotron. Nemotron 3.5 Lightning est utile pour des tâches spécialisées à haute fréquence au sein d’agents longue durée. Vous pouvez entraîner le modèle 2x plus vite avec 70 % de VRAM en moins grâce à Unsloth.

Les données utiles pour le fine-tuning peuvent inclure :

* **Appel d’outils :** choisir le bon outil, produire des arguments valides et se remettre des erreurs d’outil
* **Validation des résultats :** vérifier les sorties par rapport à des contraintes, des schémas ou à l’état attendu
* **Travail sur dépôt :** commandes shell courantes, exécution de tests, mise en forme et résumés structurés
* **Délégation à des sous-agents :** sélectionner un spécialiste, rédiger une tâche ciblée et intégrer le résultat
* **Traces d’agents longue durée :** exemple observation → raisonnement → action → validation → récupération
* **Flux de travail métier :** tâches répétitives propres à l’organisation, où la latence et la cohérence comptent

Ne dimensionnez pas le matériel de fine-tuning comme s’il s’agissait d’un modèle dense de 3B. Bien que seuls 3 milliards de paramètres soient actifs à chaque jeton, le modèle contient 30 milliards de paramètres au total. La longueur du contexte, le choix de l’optimiseur, la taille du lot et la longueur de séquence affecteront également l’utilisation de la mémoire.

Pour les notebooks et les instructions d’entraînement, partez du flux de fine-tuning Nemotron existant. Commencez avec des contextes plus courts et des tailles de lot plus petites, puis augmentez progressivement.

#### Benchmarks

Nemotron 3.5 Lightning se situe sur la frontière de Pareto précision-vitesse pour les petits modèles ouverts :

* Jusqu’à **une sortie 4x plus rapide** que des modèles de taille similaire
* **86 % de précision** sur PinchBench
* Termine **10 000 tâches PinchBench 35 % plus vite** que Qwen 3.6 35B à une précision similaire

L’Artificial Analysis Intelligence Index combine des évaluations de tâches agentiques, de codage, de raisonnement scientifique et d’intelligence générale. NVIDIA mesure aussi le temps nécessaire pour accomplir un travail utile d’agent, et pas seulement le débit brut en jetons par seconde.

Nemotron 3.5 Lightning est conçu pour se situer sous les modèles de raisonnement de pointe dans un système d’agent routé : la planification difficile est envoyée à un modèle plus grand, tandis que l’exécution à grand volume est envoyée à Lightning. NVIDIA prévoit de publier les poids, les données d’entraînement et les recettes sous OpenMDW-1.1, et [NeMo Switchyard](https://developer.nvidia.com/topics/ai/nemotron) peut acheminer chaque requête vers le modèle le plus approprié.

Pour les détails complets du lancement de NVIDIA, consultez le [annonce Nemotron 3.5 Lightning](https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/).


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/fr/modeles/nemotron-3.5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
