For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Ultra - So lokal ausführen

Führen Sie Nemotron-3-Ultra-550B-A55B lokal auf Ihrem Gerät aus!

NVIDIA Nemotron 3 Ultra ist ein offenes 550B Parameter, 55B aktiv Frontier-Reasoning-Modell und ist NVIDIAs größtes Modell bislang veröffentlichtes. Nemotron-3-Ultra-550B-A55B ist für langlaufende autonome Agenten und Schlussfolgerungen über Coding- und Deep-Research-Workflows hinweg ausgelegt. Es ist das stärkste westliche Open-Modell, und verwendet die neue Open Model, Weights & Data License.

Mit bis zu 1 Mio. Kontext, verwendet Nemotron 3 Ultra eine Hybrid-Transformer-Mamba-MoE-Architektur und kann lange Agenten-Zustände, Protokolle und Pläne über längere Sitzungen hinweg beibehalten. GGUFs liegen bei Nemotron-3-Ultra-550B-A55B mit dynamischem 1-Bit und belegen 189 GB Festplattenspeicher. Es wurde außerdem mit NVFP4 vortrainiert. Wir haben außerdem GGUF-KLD-Benchmarks.

⚙️ Verwendungsanleitung

NVIDIA empfiehlt diese Einstellungen für die Inferenz:

  • temperature = 1.0

  • top_p = 0.95

Details
Nemotron 3 Ultra

Modellgröße

550B Gesamtparameter / 55B aktive Parameter

Kontextlänge

Bis zu 1 Mio. Token

Architektur

Hybrid Transformer-Mamba MoE mit Latent MoE, Multi-Token Prediction (MTP wird derzeit für GGUFs nicht unterstützt)

Modell-E/A

Texteingabe, Textausgabe

Die Chat-Vorlage sieht wie folgt aus:

<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>assistant\n<think>\n

Nemotron-3-Ultra ausführen

Die 3-Bit-Versionen des Modells benötigen ca. 256 GB RAM, 4-Bit benötigen ca. 300 GB und 8-Bit benötigen 600 GB. Für diese Anleitungen verwenden wir 3-Bit UD-IQ3_XXS was auf ein 256-GB-Gerät passt und einen guten Kompromiss zwischen Größe und Genauigkeit darstellt. Je nach Anwendungsfall müssen Sie andere Einstellungen. GGUF: Nemotron-3-Ultra-550B-A55B

In Unsloth Studio ausführenIn llama.cpp ausführen

🦥 Unsloth-Studio-Anleitung

Für dieses Tutorial verwenden wir Unsloth Studio, was unsere Benutzeroberfläche zum Ausführen und Trainieren von LLMs ist. Mit Unsloth Studio können Sie Modelle ausführen und Bild- und Texteingaben lokal auf Mac, Windows, und Linux und:

1

Unsloth installieren

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth Studio einrichten (einmalig)

Das Setup installiert automatisch Node.js (über nvm), baut das Frontend, installiert alle Python-Abhängigkeiten und baut llama.cpp mit CUDA-Unterstützung.

Für WSL-Nutzer: Sie werden nach Ihrem sudo Passwort gefragt, um Build-Abhängigkeiten zu installieren (cmake, git, libcurl4-openssl-dev).

3

Unsloth starten

macOS, Linux, WSL:

Windows Powershell:

Dann öffnen Sie http://127.0.0.1:8888 in Ihrem Browser.

4

Nemotron-3-Ultra suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern und sich später erneut anzumelden. Gehen Sie dann zum Studio-Chat Tab und suchen Sie in der Suchleiste nach Nemotron-3-Ultra und laden Sie Ihr gewünschtes Modell und die gewünschte Quantisierung herunter.

5

Nemotron-3-Ultra ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere Unsloth-Studio-Inferenzanleitung.

6

Nemotron-3-Ultra bereitstellen

Sie können auch unsloth studio run verwenden, um das Modell über llama-server wie folgt bereitzustellen:

🦙 Llama.cpp-Tutorial:

Anleitung zum Ausführen in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, um auf die meisten Geräte zu passen):

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

2

Laden Sie das Modell mit dem folgenden Code herunter (nachdem Sie pip install huggingface_hub). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine 2-Bit-Dynamik-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Falls Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

3

Dann führen Sie das Modell im Konversationsmodus aus:

Llama-Server-Bereitstellung & Deployment

Um Nemotron-3-Ultra lokal bereitzustellen, verwenden Sie llama-server. In einem neuen Terminal, zum Beispiel über tmux, stellen Sie das Modell bereit:

Wenn Sie das Modell manuell heruntergeladen haben, verwenden Sie:

Dann in einem neuen Terminal, nachdem Sie den OpenAI-Client mit pip install openai:

Und auf 4 B200s werden bei der Generierung rund 40 Token/s erreicht!

Unsloth-GGUF-Benchmarks

Wir haben auch KLD-Analysen für unsere GGUF-Quants durchgeführt - auf einer logarithmischen mittleren KLD-Skala verliert das Modell bei der Quantisierung bis hinunter zu sogar 1-Bit dank unserer nur sehr wenig Genauigkeit dynamischen Methodik bei der wichtigere Schichten in höherer Präzision und der Rest in niedrigeren Bits belassen wird.

Für eine lineare Skala:

Offizielle Benchmarks

Nemotron 3 Ultra ist NVIDIAs größtes Nemotron-3-Reasoning-Modell und ist auf führende Genauigkeit bei Frontier-Reasoning-, Coding- und agentischen Aufgaben ausgelegt, während es durch hohen Durchsatz die Zeit bis zur Aufgabenerledigung optimiert.

Ultra eignet sich besonders für Workloads, bei denen der Aufgabenerfolg von nachhaltigem Denken und Schlussfolgern statt von kurzen Einzeldialog-Antworten abhängt:

  • Autonome Coding-Sitzungen über große Repositories hinweg

  • Tiefgehende Recherche über viele Quellen mit widersprüchlichen Belegen

  • Unternehmens-Workflows mit persistenten toolnutzenden Schleifen

  • EDA-/Chipsdesign-Verifikation und Fehleranalyse

Wie in Abbildung 1 und Abbildung 2 gezeigt, führt Nemotron 3 Ultra bei der Genauigkeit in den Bereichen Agentenproduktivität, Anweisungsbefolgung und langen Kontextaufgaben und bietet führenden Durchsatz, wodurch im Vergleich zu anderen führenden offenen Modellen 30 % der Kosten eingespart werden.

Abbildung 1: Nemotron 3 Ultra führt unter den offenen Modellen bei agentischen Benchmarks für Agentenproduktivität, Coding und Anweisungsbefolgung.

Image of a table showing Nemotron 3 Ultra leading among open models on agentic benchmarks for agent productivity, coding, and instruction following.

Abbildung 2: Nemotron 3 Ultra spart bis zu 30 % der Kosten und führt an der Kosten-Effizienz-Frontier

Bild, das zeigt, dass Nemotron 3 Ultra bis zu 30 % der Kosten spart und an der Kosten-Effizienz-Frontier führt

Weitere Benchmarks von NVIDIA:

Benchmark
N-3-Ultra 550B-A55B
MiniMax-2.7 230B-A10B
GLM-5.1 744B-A40B
Kimi-K2.6 1T-A32B

Agentisch

Terminal Bench 2.1

56.4

55.5

59.3

67.2

49.9

49.2

54.2

GDPVal

46.7

47.6

54.7

50.4

34.6

54.6

50.2

SWE-Bench Verified

71.9

72.2

73.8

69.5

69.9

74.0

72.4

SWE-Bench Multilingual

67.7

69.2

73.8

65.9

67.7

71.9

72.1

ProfBench (Search)

56.0

52.0

46.0

56.0

53.0

59.9

57.0

PinchBench

90.0

77.6

81.2

90.2

86.6

88.6

91.3

TauBench V3

Airline

81.5

75.3

85.0

85.8

76.5

80.8

80.8

Retail

86.4

84.9

84.1

82.9

88.5

88.9

89.1

Telekom

92.9

89.6

96.9

97.8

98.0

96.3

98.3

Banking

22.6

14.6

12.8

23.1

20.9

25.9

26.7

Durchschnitt

70.9

66.1

69.7

72.4

71.0

73.2

73.7

BrowseComp

44.4

54.1

59.4

61.3

40.5

59.4

46.9

Vals.ai Financial Agent 1.1

ohne Websuche

60.1

51.3

60.2

54.0

61.3

58.9

58.4

mit Websuche

53.7

50.5

60.7

58.8

59.0

62.3

60.1

Reasoning und Wissen

IOI 2025

570.0

--

456.5

585.0

441.3

580.1

--

LiveCodeBench (v6)

89.0

77.2

85.7

90.2

79.3

92.5

90.9

IMOAnswerBench (ohne Tools)

88.6

68.3

86.8

91.1

83.1

93.0

91.1

IMOAnswerBench (mit Tools)

92.3

75.1

91.1

93.71

84.51

85.4

89.6

Apex-Shortlist (ohne Tools)

74.9

28.9

71.1

77.4

61.4

85.8

82.4

Apex-Shortlist (mit Tools)

84.8

51.9

79.0

73.2

60.4

86.5

82.0

GPQA (ohne Tools)

87.0

86.6

86.1

91.0

87.1

87.8

88.5

SciCode (Teilaufgabe)

44.6

38.3

47.7

52.0

48.0

50.5

48.2

HLE (ohne Tools)

26.7

23.1

27.2

34.8

28.5

37.7

32.2

HLE (mit Tools)

37.4

--

50.4

54.0

48.3

48.2

45.1

CritPt (ohne Tools)

3.1

0.6

3.7

9.1

2.4

14.0

10.6

MMLU-Pro

86.8

81.9

85.9

88.1

88.3

87.5

86.4

OmniScience-Genauigkeit

24.1

20.5

31.3

35.5

35.9

46.8

39.9

OmniScience ohne Halluzinationen

78.7

74.4

66.8

67.1

7.4

5.7

2.8

Chat & Anweisungsbefolgung

IFBench (lockerer Prompt)

81.7

74.6

76.6

73.7

78.2

79.1

82.0

Multi-Challenge

63.8

42.5

63.0

63.1

63.9

64.1

63.5

Langer Kontext

AA-LCR

65.4

69.8

66.9

70.2

68.3

67.3

62.7

RULER (1M)

94.7

--

--

--

90.1

94.2

87.7

Longbench v2 (≤ 1M)

61.9

--

--

--

68.9

62.1

57.0

Mehrsprachig

MMLU-ProX (Durchschnitt en/de/fr/es/it/ja/zh/hi/pt/ko)

83.0

78.4

85.8

85.0

86.4

85.6

84.3

WMT24++ (en→xx)

83.7

82.8

84.4

84.5

86.8

85.9

85.9

Zuletzt aktualisiert

War das hilfreich?