For the complete documentation index, see llms.txt. This page is also available as Markdown.

NVIDIA Nemotron 3.5 Lightning: Wie man lokal ausführt

NVIDIA Nemotron-3.5-Lightning-30B-A3B ist ein offenes hybrides Reasoning-MoE-Modell mit 30 Mrd. Parametern und 3 Mrd. aktiven Parametern, das für die Ausführung großer Aufgabenmengen in langlaufenden Agenten entwickelt wurde. Es ist für häufige Agentenaufrufe konzipiert, einschließlich Tool-Nutzung, Ausgabeverifizierung, Ergebnisformatierung und Delegierung an Unteragenten. Das Modell läuft auf 20 GB RAM für 4-Bit und 33 GB für 8-Bit.

Mit bis zu 1M Kontext, ist Nemotron 3.5 Lightning eines der schnellsten und genauesten offenen Ausführungsmodelle seiner Größe. Du kannst Nemotron 3.5 lokal über Unsloth Desktop und Unsloth Dynamic GGUFs ausführen. Danke an NVIDIA für die Unterstützung ab Tag null! GGUF: Nemotron-3.5-Lightning-30B-A3B

Sieh rechts, wie Nemotron-3.5 10 Min. lang ununterbrochen Tools in Unsloth Desktop:

⚙️ Nutzungsleitfaden

NVIDIA empfiehlt für die Inferenz diese Einstellungen:

Denkmodus:

  • temperature = 0.6

  • top_p = 0.95

Instruktionsmodus:

  • temperature = 0.2

Nemotron 3.5 Lightning ausführen

Je nach Anwendungsfall musst du unterschiedliche Einstellungen verwenden. Nemotron 3.5 Lightning aktiviert 3 Mrd. Parameter pro Token und ist damit schnell genug für wiederholte Aufrufe in langlaufenden Agenten-Workflows. GGUF: Nemotron-3.5-Lightning-30B-A3B

Die 4-Bit-Versionen des Modells benötigen ~20 GB RAM. 8-Bit benötigt 33 GB. Für diese Anleitungen werden wir UD-Q4-K-XL verwenden, was ein guter Kompromiss zwischen Größe und Genauigkeit ist.

In Unsloth Desktop ausführenIn llama.cpp ausführen

🦥 Unsloth Desktop-Leitfaden

Für dieses Tutorial werden wir Unsloth Desktop, eine Open-Source-Lokal-App zum Ausführen und Trainieren von Modellen. Mit Unsloth kannst du Modelle lokal auf Mac, Windows und Linux und:

  • GGUFs und Safetensor-Modelle suchen, herunterladen und ausführen

  • Modelle vergleichen nebeneinander

  • Verwende selbstheilende Tool-Aufrufe und Websuche

  • Ausführen Codeausführung mit Python und Bash

  • Automatische Abstimmung der Inferenzparameter verwenden

  • Trainiere LLMs 2x schneller mit 70 % weniger VRAM

1

Unsloth installieren

Der einfachste Einstieg ist das Herunterladen der Unsloth-Desktop-App. Funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, wenn du die manuelle Installation bevorzugst:

MacOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell:

irm https://unsloth.ai/install.ps1 | iex
2

Nemotron 3.5 suchen und herunterladen

Gehe zu Unsloth Chat oder Model Hub und suche in der Suchleiste nach Nemotron 3.5 und lade das gewünschte Modell und die gewünschte Quantisierung herunter.

3

Nemotron 3.5 Lightning ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen kannst du unseren Unsloth-Inferenzleitfaden.

🦙 Llama.cpp-Tutorial:

Anleitung zum Ausführen in llama.cpp (beachte, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):

1

Besorge dir die neueste llama.cpp und baue es. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine CUDA-GPU hast oder CPU-Inferenz möchtest. Für Apple-Mac- und Metal-Geräte, setze -DGGML_CUDA=OFF. Metal-Unterstützung ist standardmäßig aktiviert.

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
2

Jetzt laden wir das Modell manuell herunter. Das können wir mit dem folgenden Code nach der Installation von huggingface_hub. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # Verwende "*UD-Q2_K_XL*" für dynamisches 2-Bit
3

Führe das Modell im Gesprächsmodus aus:

./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
    --temp 0.6 \\
    --top-p 0.95 \\
    --min-p 0.01

Nemotron 3.5 Lightning wird mit MTP sowie dedizierten DFlash- und DSpark-Draft-Modellen für spekulatives Decoding ausgeliefert. Diese Draft-Modelle sagen mehrere Tokens im Voraus voraus und erhöhen die Ausgabegeschwindigkeit für agentische Workloads mit hohem Volumen.

🦥 Feinabstimmung von Nemotron 3.5 Lightning

Unsloth unterstützt Post-Training für die gesamte NVIDIA Nemotron-Modellfamilie. Nemotron 3.5 Lightning ist nützlich für spezialisierte, hochfrequente Arbeit innerhalb langlaufender Agenten. Mit Unsloth kannst du das Modell 2x schneller mit 70 % weniger VRAM trainieren.

Nützliche Feinabstimmungsdaten können Folgendes umfassen:

  • Tool-Aufrufe: das richtige Tool auswählen, gültige Argumente erzeugen und sich von Tool-Fehlern erholen

  • Ergebnisvalidierung: Ausgaben anhand von Einschränkungen, Schemata oder dem erwarteten Zustand prüfen

  • Repository-Arbeit: Routine-Shell-Befehle, Testausführung, Formatierung und strukturierte Zusammenfassungen

  • Delegierung an Unteragenten: einen Spezialisten auswählen, eine fokussierte Aufgabe schreiben und das Ergebnis integrieren

  • Langlaufende Agenten-Traces: Beispiele für Beobachtung → Schlussfolgerung → Aktion → Validierung → Wiederherstellung

  • Domänen-Workflows: wiederkehrende, organisationsspezifische Aufgaben, bei denen Latenz und Konsistenz wichtig sind

Dimensiere die Feinabstimmungshardware nicht so, als wäre dies ein dichtes 3B-Modell. Obwohl pro Token nur 3 Mrd. Parameter aktiv sind, enthält das Modell insgesamt 30 Mrd. Parameter. Kontextlänge, Wahl des Optimierers, Batchgröße und Sequenzlänge beeinflussen ebenfalls den Speicherverbrauch.

Für Notebooks und Trainingsanleitungen gehe von dem bestehenden Nemotron-Feinabstimmungs-Flow aus. Beginne mit kürzeren Kontexten und kleineren Batchgrößen und skaliere dann nach oben.

Benchmarks

Nemotron 3.5 Lightning liegt für kleine offene Modelle an der Pareto-Grenze zwischen Genauigkeit und Geschwindigkeit:

  • Bis zu 4x schnellere Ausgabe als ähnlich große Modelle

  • 86 % Genauigkeit auf PinchBench

  • Schließt 10.000 PinchBench-Aufgaben 35 % schneller ab als Qwen 3.6 35B bei ähnlicher Genauigkeit

Der Artificial Analysis Intelligence Index kombiniert Bewertungen über agentische Aufgaben, Coding, wissenschaftliches Schlussfolgern und allgemeine Intelligenz. NVIDIA misst außerdem die Zeit bis zum Abschluss nützlicher Agentenarbeit, nicht nur rohe Tokens pro Sekunde.

Nemotron 3.5 Lightning ist dafür ausgelegt, in einem gerouteten Agentensystem unter den Frontier-Reasoning-Modellen zu liegen: Schwierige Planung wird an ein größeres Modell weitergeleitet, während die hochvolumige Ausführung an Lightning geht. NVIDIA plant, die Gewichte, Trainingsdaten und Rezepte unter OpenMDW-1.1 zu veröffentlichen, und NeMo Switchyard kann jede Anfrage an das am besten geeignete Modell weiterleiten.

Die vollständigen Startdetails von NVIDIA findest du in der Ankündigung zu Nemotron 3.5 Lightning.

Zuletzt aktualisiert

War das hilfreich?