For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron-3-Super: Anleitung zum Ausführen

Führe NVIDIA Nemotron-3-Super-120B-A12B lokal auf deinem Gerät aus und feinabstimme es!

NVIDIA veröffentlicht Nemotron-3-Super-120B-A12B, ein offenes hybrides Reasoning-MoE-Modell mit 120B und 12B aktiven Parametern, nach dem früheren Start von Nemotron-3-Nano, seinem 30B-Pendant. Nemotron-3-Super ist auf hohe Effizienz und Genauigkeit für Multi-Agenten-KI ausgelegt. Mit einem 1M-Token Kontextfenster führt es in seiner Größenklasse bei den Benchmarks AIME 2025, Terminal Bench und SWE-Bench Verified, während es den höchsten Durchsatz erreicht.

Nemotron-3-Super läuft auf einem Gerät mit 64GB von RAM, VRAM oder Unified Memory und kann nun lokal feinabgestimmt werden. Danke an NVIDIA für die Day-Zero-Unterstützung von Unsloth.

Nemotron 3 SuperNemotron 3 Nano

GGUF: Nemotron-3-Super-120B-A12B-GGUFNVFP4FP8BF16

⚙️ Nutzungsanleitung

NVIDIA empfiehlt für die Inferenz diese Einstellungen:

Allgemeiner Chat-/Instruktionsmodus (Standard):

  • temperature = 1.0

  • top_p = 1.0

Anwendungsfälle für Tool-Calling:

  • temperature = 0.6

  • top_p = 0.95

Für die meiste lokale Nutzung setzen Sie:

  • max_new_tokens = 32,768 zu 262,144 für Standard-Prompts mit einem Maximum von 1 Mio. Tokens

  • Erhöhen Sie den Wert für tiefes Reasoning oder lange Generierung, soweit Ihr RAM/VRAM es zulässt.

Das Chat-Template-Format findet man, wenn man die folgende Verwendung nutzt:

tokenizer.apply_chat_template([
    {"role" : "user", "content" : "Was ist 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "Was ist 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)

Nemotron 3 Chat-Template-Format:

Nemotron 3 verwendet <think> mit Token-ID 12 und </think> mit Token-ID 13 für Reasoning. Verwenden Sie --special um die Token für llama.cpp zu sehen. Möglicherweise benötigen Sie auch --verbose-prompt um <think> zu sehen, da es vorangestellt wird.

🖥️ Führe Nemotron-3-Super-120B-A12B aus

Je nach Anwendungsfall müssen Sie unterschiedliche Einstellungen verwenden. Einige GGUFs landen in ähnlicher Größe, weil die Modellarchitektur (wie gpt-oss) hat Abmessungen, die nicht durch 128 teilbar sind, daher können Teile nicht auf niedrigere Bits quantisiert werden. GGUFs aufrufen hier.

Die 4-Bit-Versionen des Modells benötigen ~64GB RAM - 72GB RAM. 8-Bit benötigt 128GB.

Llama.cpp-Tutorial (GGUF):

Anweisungen zum Ausführen in llama.cpp (beachten Sie, dass wir 4-Bit verwenden werden, damit es auf die meisten Geräte passt):

1

Hole dir die neueste llama.cpp auf GitHub hier. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

2

Sie können direkt von Hugging Face herunterladen. Sie können den Kontext auf 1 Mio. erhöhen, soweit Ihr RAM/VRAM es zulässt.

Folge dem hier für allgemeine Anweisungs- Anwendungsfälle:

Folge dem hier für Tool-Aufruf Anwendungsfälle:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst Q4_K_M oder andere quantisierte Versionen wie wählen UD-Q4_K_XL . Wir empfehlen, mindestens 2-Bit Dynamic Quant UD-Q2_K_XL zu verwenden, um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Führen Sie das Modell dann im Konversationsmodus aus:

Passen Sie außerdem das Kontextfenster nach Bedarf an. Stellen Sie sicher, dass Ihre Hardware ein Kontextfenster von mehr als 256K bewältigen kann. Wenn Sie es auf 1 Mio. setzen, kann CUDA OOM auslösen und abstürzen, weshalb der Standardwert 262.144 ist.

🦥 Nemotron 3 und RL feinabstimmen

Unsloth unterstützt jetzt das Feinabstimmen aller Nemotron-Modelle, einschließlich Nemotron 3 Super und Nano. Beispiele für Notebooks von Nano findest du in unserem Nemotron 3 Nano-Feinabstimmungsleitfaden.

Nemotron 3 Super

  • Das Feinabstimmen der Router-Schicht ist standardmäßig aus Gründen der Stabilität deaktiviert.

  • Nemotron-3-Super-120B - bf16 LoRA funktioniert auf 256GB VRAM. Wenn du mehrere GPUs verwendest, füge device_map = "balanced" hinzu oder befolge unseren MultiGPU-Leitfaden.

🦙Llama-Server Serving & Deployment

Um Nemotron 3 für die Produktion bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. via tmux, stelle das Modell bereit mit:

Wenn du das Obige ausführst, erhältst du:

Dann in einem neuen Terminal, nachdem du pip install openaiausgeführt hast, mache:

Das wird ausgeben

Benchmarks

Im Vergleich zu ähnlich großen Modellen ist Nemotron 3 Super wettbewerbsfähig und bietet gleichzeitig den höchsten Durchsatz.

Zuletzt aktualisiert

War das hilfreich?