🧩NVIDIA Nemotron 3 Ultra - So lokal ausführen
Führen Sie Nemotron-3-Ultra-550B-A55B lokal auf Ihrem Gerät aus!
NVIDIA Nemotron 3 Ultra ist ein offenes 550B Parameter, 55B aktiv Frontier-Reasoning-Modell und ist NVIDIAs größtes Modell bislang veröffentlichtes. Nemotron-3-Ultra-550B-A55B ist für langlaufende autonome Agenten und Schlussfolgerungen über Coding- und Deep-Research-Workflows hinweg ausgelegt. Es ist das stärkste westliche Open-Modell, und verwendet die neue Open Model, Weights & Data License.
Mit bis zu 1 Mio. Kontext, verwendet Nemotron 3 Ultra eine Hybrid-Transformer-Mamba-MoE-Architektur und kann lange Agenten-Zustände, Protokolle und Pläne über längere Sitzungen hinweg beibehalten. GGUFs liegen bei Nemotron-3-Ultra-550B-A55B mit dynamischem 1-Bit und belegen 189 GB Festplattenspeicher. Es wurde außerdem mit NVFP4 vortrainiert. Wir haben außerdem GGUF-KLD-Benchmarks.
⚙️ Verwendungsanleitung
NVIDIA empfiehlt diese Einstellungen für die Inferenz:
temperature = 1.0top_p = 0.95
Modellgröße
550B Gesamtparameter / 55B aktive Parameter
Kontextlänge
Bis zu 1 Mio. Token
Architektur
Hybrid Transformer-Mamba MoE mit Latent MoE, Multi-Token Prediction (MTP wird derzeit für GGUFs nicht unterstützt)
Modell-E/A
Texteingabe, Textausgabe
Die Chat-Vorlage sieht wie folgt aus:
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\nNemotron-3-Ultra ausführen
Die 3-Bit-Versionen des Modells benötigen ca. 256 GB RAM, 4-Bit benötigen ca. 300 GB und 8-Bit benötigen 600 GB. Für diese Anleitungen verwenden wir 3-Bit UD-IQ3_XXS was auf ein 256-GB-Gerät passt und einen guten Kompromiss zwischen Größe und Genauigkeit darstellt. Je nach Anwendungsfall müssen Sie andere Einstellungen. GGUF: Nemotron-3-Ultra-550B-A55B
In Unsloth Studio ausführenIn llama.cpp ausführen
🦥 Unsloth-Studio-Anleitung
Für dieses Tutorial verwenden wir Unsloth Studio, was unsere Benutzeroberfläche zum Ausführen und Trainieren von LLMs ist. Mit Unsloth Studio können Sie Modelle ausführen und Bild- und Texteingaben lokal auf Mac, Windows, und Linux und:
Suchen, herunterladen, GGUFs ausführen und safetensor-Modelle
Vergleichen Modelle nebeneinander
Selbstheilend Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-p usw.)
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth Studio einrichten (einmalig)
Das Setup installiert automatisch Node.js (über nvm), baut das Frontend, installiert alle Python-Abhängigkeiten und baut llama.cpp mit CUDA-Unterstützung.
Für WSL-Nutzer: Sie werden nach Ihrem sudo Passwort gefragt, um Build-Abhängigkeiten zu installieren (cmake, git, libcurl4-openssl-dev).
Nemotron-3-Ultra suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern und sich später erneut anzumelden. Gehen Sie dann zum Studio-Chat Tab und suchen Sie in der Suchleiste nach Nemotron-3-Ultra und laden Sie Ihr gewünschtes Modell und die gewünschte Quantisierung herunter.
Nemotron-3-Ultra ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.
🦙 Llama.cpp-Tutorial:
Anleitung zum Ausführen in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, um auf die meisten Geräte zu passen):
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Laden Sie das Modell mit dem folgenden Code herunter (nachdem Sie pip install huggingface_hub). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine 2-Bit-Dynamik-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Falls Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Konversationsmodus aus:
Llama-Server-Bereitstellung & Deployment
Um Nemotron-3-Ultra lokal bereitzustellen, verwenden Sie llama-server. In einem neuen Terminal, zum Beispiel über tmux, stellen Sie das Modell bereit:
Wenn Sie das Modell manuell heruntergeladen haben, verwenden Sie:
Dann in einem neuen Terminal, nachdem Sie den OpenAI-Client mit pip install openai:

Und auf 4 B200s werden bei der Generierung rund 40 Token/s erreicht!

Unsloth-GGUF-Benchmarks
Wir haben auch KLD-Analysen für unsere GGUF-Quants durchgeführt - auf einer logarithmischen mittleren KLD-Skala verliert das Modell bei der Quantisierung bis hinunter zu sogar 1-Bit dank unserer nur sehr wenig Genauigkeit dynamischen Methodik bei der wichtigere Schichten in höherer Präzision und der Rest in niedrigeren Bits belassen wird.

Für eine lineare Skala:

Offizielle Benchmarks
Nemotron 3 Ultra ist NVIDIAs größtes Nemotron-3-Reasoning-Modell und ist auf führende Genauigkeit bei Frontier-Reasoning-, Coding- und agentischen Aufgaben ausgelegt, während es durch hohen Durchsatz die Zeit bis zur Aufgabenerledigung optimiert.
Ultra eignet sich besonders für Workloads, bei denen der Aufgabenerfolg von nachhaltigem Denken und Schlussfolgern statt von kurzen Einzeldialog-Antworten abhängt:
Autonome Coding-Sitzungen über große Repositories hinweg
Tiefgehende Recherche über viele Quellen mit widersprüchlichen Belegen
Unternehmens-Workflows mit persistenten toolnutzenden Schleifen
EDA-/Chipsdesign-Verifikation und Fehleranalyse
Wie in Abbildung 1 und Abbildung 2 gezeigt, führt Nemotron 3 Ultra bei der Genauigkeit in den Bereichen Agentenproduktivität, Anweisungsbefolgung und langen Kontextaufgaben und bietet führenden Durchsatz, wodurch im Vergleich zu anderen führenden offenen Modellen 30 % der Kosten eingespart werden.
Abbildung 1: Nemotron 3 Ultra führt unter den offenen Modellen bei agentischen Benchmarks für Agentenproduktivität, Coding und Anweisungsbefolgung.

Abbildung 2: Nemotron 3 Ultra spart bis zu 30 % der Kosten und führt an der Kosten-Effizienz-Frontier

Weitere Benchmarks von NVIDIA:
Agentisch
Terminal Bench 2.1
56.4
55.5
59.3
67.2
49.9
49.2
54.2
GDPVal
46.7
47.6
54.7
50.4
34.6
54.6
50.2
SWE-Bench Verified
71.9
72.2
73.8
69.5
69.9
74.0
72.4
SWE-Bench Multilingual
67.7
69.2
73.8
65.9
67.7
71.9
72.1
ProfBench (Search)
56.0
52.0
46.0
56.0
53.0
59.9
57.0
PinchBench
90.0
77.6
81.2
90.2
86.6
88.6
91.3
TauBench V3
Airline
81.5
75.3
85.0
85.8
76.5
80.8
80.8
Retail
86.4
84.9
84.1
82.9
88.5
88.9
89.1
Telekom
92.9
89.6
96.9
97.8
98.0
96.3
98.3
Banking
22.6
14.6
12.8
23.1
20.9
25.9
26.7
Durchschnitt
70.9
66.1
69.7
72.4
71.0
73.2
73.7
BrowseComp
44.4
54.1
59.4
61.3
40.5
59.4
46.9
Vals.ai Financial Agent 1.1
ohne Websuche
60.1
51.3
60.2
54.0
61.3
58.9
58.4
mit Websuche
53.7
50.5
60.7
58.8
59.0
62.3
60.1
Reasoning und Wissen
IOI 2025
570.0
--
456.5
585.0
441.3
580.1
--
LiveCodeBench (v6)
89.0
77.2
85.7
90.2
79.3
92.5
90.9
IMOAnswerBench (ohne Tools)
88.6
68.3
86.8
91.1
83.1
93.0
91.1
IMOAnswerBench (mit Tools)
92.3
75.1
91.1
93.71
84.51
85.4
89.6
Apex-Shortlist (ohne Tools)
74.9
28.9
71.1
77.4
61.4
85.8
82.4
Apex-Shortlist (mit Tools)
84.8
51.9
79.0
73.2
60.4
86.5
82.0
GPQA (ohne Tools)
87.0
86.6
86.1
91.0
87.1
87.8
88.5
SciCode (Teilaufgabe)
44.6
38.3
47.7
52.0
48.0
50.5
48.2
HLE (ohne Tools)
26.7
23.1
27.2
34.8
28.5
37.7
32.2
HLE (mit Tools)
37.4
--
50.4
54.0
48.3
48.2
45.1
CritPt (ohne Tools)
3.1
0.6
3.7
9.1
2.4
14.0
10.6
MMLU-Pro
86.8
81.9
85.9
88.1
88.3
87.5
86.4
OmniScience-Genauigkeit
24.1
20.5
31.3
35.5
35.9
46.8
39.9
OmniScience ohne Halluzinationen
78.7
74.4
66.8
67.1
7.4
5.7
2.8
Chat & Anweisungsbefolgung
IFBench (lockerer Prompt)
81.7
74.6
76.6
73.7
78.2
79.1
82.0
Multi-Challenge
63.8
42.5
63.0
63.1
63.9
64.1
63.5
Langer Kontext
AA-LCR
65.4
69.8
66.9
70.2
68.3
67.3
62.7
RULER (1M)
94.7
--
--
--
90.1
94.2
87.7
Longbench v2 (≤ 1M)
61.9
--
--
--
68.9
62.1
57.0
Mehrsprachig
MMLU-ProX (Durchschnitt en/de/fr/es/it/ja/zh/hi/pt/ko)
83.0
78.4
85.8
85.0
86.4
85.6
84.3
WMT24++ (en→xx)
83.7
82.8
84.4
84.5
86.8
85.9
85.9
Zuletzt aktualisiert
War das hilfreich?


