> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/nemotron-3.5.md).

# NVIDIA Nemotron 3.5 Lightning: So führst du es lokal aus

NVIDIA Nemotron-3.5-Lightning-30B-A3B ist ein offenes hybrides Reasoning-MoE-Modell mit 30 Mrd. Parametern und 3 Mrd. aktiven Parametern, das für die Ausführung großer Aufgabenmengen in langlaufenden Agenten entwickelt wurde. Es ist für häufige Agentenaufrufe konzipiert, einschließlich Tool-Nutzung, Ausgabeverifizierung, Ergebnisformatierung und Delegierung an Unteragenten. Das Modell läuft auf **20 GB RAM** für 4-Bit und 33 GB für 8-Bit.

{% columns %}
{% column %}
Mit bis zu **1M Kontext**, ist Nemotron 3.5 Lightning eines der schnellsten und genauesten offenen Ausführungsmodelle seiner Größe. Du kannst Nemotron 3.5 lokal über Unsloth Desktop und Unsloth Dynamic GGUFs ausführen. Danke an NVIDIA für die Unterstützung ab Tag null!\
**GGUF:** [Nemotron-3.5-Lightning-30B-A3B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF)

Sieh rechts, wie Nemotron-3.5 10 Min. lang ununterbrochen Tools in [Unsloth Desktop](/docs/de/desktop.md):
{% endcolumn %}

{% column %}

<figure><img src="/files/44ef4b01901491e095ec055d21556e9a694bba36" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

#### ⚙️ Nutzungsleitfaden

NVIDIA empfiehlt für die Inferenz diese Einstellungen:

{% columns %}
{% column %}
**Denkmodus:**

* `temperature = 0.6`
* `top_p = 0.95`
  {% endcolumn %}

{% column %}
**Instruktionsmodus:**

* `temperature = 0.2`
  {% endcolumn %}
  {% endcolumns %}

#### Nemotron 3.5 Lightning ausführen

Je nach Anwendungsfall musst du unterschiedliche Einstellungen verwenden. Nemotron 3.5 Lightning aktiviert 3 Mrd. Parameter pro Token und ist damit schnell genug für wiederholte Aufrufe in langlaufenden Agenten-Workflows. **GGUF:** [Nemotron-3.5-Lightning-30B-A3B](https://huggingface.co/unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF)

Die 4-Bit-Versionen des Modells benötigen \~20 GB RAM. 8-Bit benötigt 33 GB. Für diese Anleitungen werden wir `UD-Q4-K-XL` verwenden, was ein guter Kompromiss zwischen Größe und Genauigkeit ist.

<a href="/pages/8ab6233f815dd63311118b34d99ca34bc6b7b70f#unsloth-desktop-guide" class="button primary">In Unsloth Desktop ausführen</a><a href="/pages/8ab6233f815dd63311118b34d99ca34bc6b7b70f#llama.cpp-tutorial" class="button secondary">In llama.cpp ausführen</a>

#### 🦥 Unsloth Desktop-Leitfaden

Für dieses Tutorial werden wir [Unsloth Desktop](#unsloth-desktop-guide), eine Open-Source-Lokal-App zum Ausführen und Trainieren von Modellen. Mit Unsloth kannst du Modelle lokal auf **Mac, Windows und Linux** und:

{% columns %}
{% column %}

* GGUFs und Safetensor-Modelle suchen, herunterladen und ausführen
* **Modelle** vergleichen **nebeneinander**
* Verwende **selbstheilende** Tool-Aufrufe und **Websuche**
* Ausführen **Codeausführung** mit Python und Bash
* Automatische Abstimmung der Inferenzparameter verwenden
* Trainiere LLMs 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="/files/ede4486e46323f15d00540b5fe874575d7121e7f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der [Unsloth-Desktop-App](/docs/de/desktop.md). Funktioniert auf [macOS](/docs/de/erste-schritte/install/mac.md), [Windows](/docs/de/erste-schritte/install/windows-installation.md), und [Linux](/docs/de/erste-schritte/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth herunterladen</a>

* <i class="fa-apple">:apple:</i> [Für macOS herunterladen](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Für Windows herunterladen](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Für Linux herunterladen](https://unsloth.ai/download/linux)

Oder, wenn du die manuelle Installation bevorzugst:

MacOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Nemotron 3.5 suchen und herunterladen

Gehe zu [Unsloth Chat](/docs/de/neu/studio/chat.md) oder Model Hub und suche in der Suchleiste nach Nemotron 3.5 und lade das gewünschte Modell und die gewünschte Quantisierung herunter.

<figure><img src="/files/1cda773d2e410abf87fc302c50dac420c3428daf" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Nemotron 3.5 Lightning ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unseren [Unsloth-Inferenzleitfaden](/docs/de/neu/studio/chat.md).

<figure><img src="/files/44ef4b01901491e095ec055d21556e9a694bba36" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

#### 🦙 Llama.cpp-Tutorial:

Anleitung zum Ausführen in llama.cpp (beachte, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):

{% stepper %}
{% step %}
Besorge dir die neueste [`llama.cpp`](https://github.com/ggml-org/llama.cpp) und baue es. Ändere `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn du keine CUDA-GPU hast oder CPU-Inferenz möchtest. **Für Apple-Mac- und Metal-Geräte**, setze `-DGGML_CUDA=OFF`. Metal-Unterstützung ist standardmäßig aktiviert.

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Jetzt laden wir das Modell manuell herunter. Das können wir mit dem folgenden Code nach der Installation von `huggingface_hub`. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

{% code overflow="wrap" %}

```bash
pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q2_K_XL*" für dynamisches 2-Bit
```

{% endcode %}
{% endstep %}

{% step %}
Führe das Modell im Gesprächsmodus aus:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
    --temp 0.6 \\
    --top-p 0.95 \\
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

{% hint style="info" %}
Nemotron 3.5 Lightning wird mit MTP sowie dedizierten DFlash- und DSpark-Draft-Modellen für spekulatives Decoding ausgeliefert. Diese Draft-Modelle sagen mehrere Tokens im Voraus voraus und erhöhen die Ausgabegeschwindigkeit für agentische Workloads mit hohem Volumen.
{% endhint %}

#### 🦥 Feinabstimmung von Nemotron 3.5 Lightning

Unsloth unterstützt Post-Training für die gesamte NVIDIA Nemotron-Modellfamilie. Nemotron 3.5 Lightning ist nützlich für spezialisierte, hochfrequente Arbeit innerhalb langlaufender Agenten. Mit Unsloth kannst du das Modell 2x schneller mit 70 % weniger VRAM trainieren.

Nützliche Feinabstimmungsdaten können Folgendes umfassen:

* **Tool-Aufrufe:** das richtige Tool auswählen, gültige Argumente erzeugen und sich von Tool-Fehlern erholen
* **Ergebnisvalidierung:** Ausgaben anhand von Einschränkungen, Schemata oder dem erwarteten Zustand prüfen
* **Repository-Arbeit:** Routine-Shell-Befehle, Testausführung, Formatierung und strukturierte Zusammenfassungen
* **Delegierung an Unteragenten:** einen Spezialisten auswählen, eine fokussierte Aufgabe schreiben und das Ergebnis integrieren
* **Langlaufende Agenten-Traces:** Beispiele für Beobachtung → Schlussfolgerung → Aktion → Validierung → Wiederherstellung
* **Domänen-Workflows:** wiederkehrende, organisationsspezifische Aufgaben, bei denen Latenz und Konsistenz wichtig sind

Dimensiere die Feinabstimmungshardware nicht so, als wäre dies ein dichtes 3B-Modell. Obwohl pro Token nur 3 Mrd. Parameter aktiv sind, enthält das Modell insgesamt 30 Mrd. Parameter. Kontextlänge, Wahl des Optimierers, Batchgröße und Sequenzlänge beeinflussen ebenfalls den Speicherverbrauch.

Für Notebooks und Trainingsanleitungen gehe von dem bestehenden Nemotron-Feinabstimmungs-Flow aus. Beginne mit kürzeren Kontexten und kleineren Batchgrößen und skaliere dann nach oben.

#### Benchmarks

Nemotron 3.5 Lightning liegt für kleine offene Modelle an der Pareto-Grenze zwischen Genauigkeit und Geschwindigkeit:

* Bis zu **4x schnellere Ausgabe** als ähnlich große Modelle
* **86 % Genauigkeit** auf PinchBench
* Schließt **10.000 PinchBench-Aufgaben 35 % schneller ab** als Qwen 3.6 35B bei ähnlicher Genauigkeit

Der Artificial Analysis Intelligence Index kombiniert Bewertungen über agentische Aufgaben, Coding, wissenschaftliches Schlussfolgern und allgemeine Intelligenz. NVIDIA misst außerdem die Zeit bis zum Abschluss nützlicher Agentenarbeit, nicht nur rohe Tokens pro Sekunde.

Nemotron 3.5 Lightning ist dafür ausgelegt, in einem gerouteten Agentensystem unter den Frontier-Reasoning-Modellen zu liegen: Schwierige Planung wird an ein größeres Modell weitergeleitet, während die hochvolumige Ausführung an Lightning geht. NVIDIA plant, die Gewichte, Trainingsdaten und Rezepte unter OpenMDW-1.1 zu veröffentlichen, und [NeMo Switchyard](https://developer.nvidia.com/topics/ai/nemotron) kann jede Anfrage an das am besten geeignete Modell weiterleiten.

Die vollständigen Startdetails von NVIDIA findest du in der [Ankündigung zu Nemotron 3.5 Lightning](https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/).


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/nemotron-3.5.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
