For the complete documentation index, see llms.txt. This page is also available as Markdown.

🧩NVIDIA Nemotron 3 Nano Omni - Wie man lokal ausführt

Führe Nemotron-3-Nano-Omni-30B-A3B lokal auf deinem Gerät aus und feinabstimme es!

NVIDIA Nemotron-3-Nano-Omni-30B-A3B ist ein offenes 30B-Parameter-, 3B-aktive hybride Reasoning-MoE-Modell, entwickelt für multimodale agentische Workloads, einschließlich Audio, Video, Text, Bilder und Dokumente als Eingabe, mit Textausgabe. Das Modell läuft auf 25 GB RAM für 4-Bit und 36 GB für 8-Bit.

Mit einem 256K-Kontextist Nemotron 3 Nano Omni das stärkste Omni- Modell seiner Größe und das effizienteste offene multimodale Modell. Wir haben mit NVIDIA für Support ab Tag 0 zusammengearbeitet! GGUF: Nemotron-3-Nano-Omni-30B-A3B-Reasoning

⚙️ Nutzungsanleitung

NVIDIA empfiehlt diese Einstellungen für die Inferenz:

Denken-Modus:

  • Temperatur = 0,6

  • top_p = 0.95

Instruct-Modus:

  • Temperatur = 0,2

Nemotron-3-Nano-Omni ausführen

Je nach Anwendungsfall müssen Sie andere Einstellungen. Einige GGUFs landen in ähnlicher Größe, weil die Modellarchitektur (wie gpt-oss) Dimensionen hat, die nicht durch 128 teilbar sind, sodass Teile nicht auf niedrigere Bits quantisiert werden können. GGUF: Nemotron-3-Nano-Omni-30B-A3B-Reasoning

Die 4-Bit-Versionen des Modells benötigen ~25 GB RAM. 8-Bit benötigt 36 GB. Für diese Anleitungen verwenden wir UD-Q4-K-XL das ein guter Kompromiss zwischen Größe und Genauigkeit ist.

In Unsloth Studio ausführenIn llama.cpp ausführen

🦥 Unsloth Studio-Anleitung

Für dieses Tutorial verwenden wir Unsloth Studio, unsere neue Web-UI zum Ausführen und Trainieren von LLMs. Mit Unsloth Studio können Sie Modelle ausführen und Audio, Bild und Text lokal auf Mac, Windows, und Linux und:

1

Unsloth installieren

macOS, Linux, WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell:

irm https://unsloth.ai/install.ps1 | iex
2

Unsloth Studio einrichten (einmalig)

Das Setup installiert automatisch Node.js (über nvm), baut das Frontend, installiert alle Python-Abhängigkeiten und baut llama.cpp mit CUDA-Unterstützung.

WSL-Benutzer: Sie werden zur Eingabe Ihres sudo Passworts aufgefordert, um Build-Abhängigkeiten zu installieren (cmake, git, libcurl4-openssl-dev).

3

Unsloth starten

macOS, Linux, WSL:

source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888

Windows PowerShell:

unsloth studio -H 0.0.0.0 -p 8888

Dann öffnen Sie http://127.0.0.1:8888 in Ihrem Browser.

4

NVIDIA-Nemotron-3-Nano-30B-A3B-Omni suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum Unsloth Chat Registerkarte und suchen Sie in der Suchleiste nach Nemotron-3-Nano-Omni und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter.

5

Nemotron-3-Nano-30B-A3B-Omni ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Tutorial:

Anweisungen für die Ausführung in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Lass uns zuerst ein Bild holen! Du kannst auch Bilder hochladen. Wir werden https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, das einfach unser Mini-Logo ist, das zeigt, wie Finetunes mit Unsloth erstellt werden:

Lass uns das zweite Bild holen unter https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

3

Jetzt laden wir das Modell manuell herunter. Das können wir über den folgenden Code tun (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Konversationsmodus aus:

5

Danach sehen Sie Folgendes:

6

Dann verwende /image um beide Bilder zu laden und zu fragen "Was ist dieses Bild?":

7

Und für das Faultierbild:

Bereitstellung und Deployment mit llama-server

Um Nemotron 3 Nano Omni lokal bereitzustellen, verwenden Sie llama-server. In einem neuen Terminal, zum Beispiel über tmux, stellen Sie das Modell bereit:

Wenn Sie das Modell manuell heruntergeladen haben, verwenden Sie:

Dann in einem neuen Terminal, nach der Installation des OpenAI-Clients mit pip install openai:

Was etwa wie folgt aussieht:

Bildeingabe über den OpenAI-kompatiblen Server

Verwenden wir picture.png das das Faultierbild war, wie in 🦙 Llama.cpp-Tutorial:

Was etwa wie folgt aussieht:

🦥 Feinabstimmung von Nemotron 3 Nano Omni

Unsloth unterstützt die gesamte Nemotron Modellfamilie. Nemotron 3 Nano Omni ist nützlich für multimodale Agentendatensätze. Sie können über Unsloth auf Audio, Vision oder Text trainieren. Videoeingabe Feinabstimmung wird derzeit nicht unterstützt.

Für reinen Text und Notebooks können Sie mit dem vorhandenen Nemotron 3 Nano Feinabstimmungs-Flowbeginnen. Für multimodale Adapter sollten Sie sicherstellen, dass Ihr Datensatz die Modalität enthält, die Ihr Agent tatsächlich benötigt:

  • Computer-Nutzung: Screenshots, UI-Zustand, Cursor/Kontext, erwartete nächste Aktion

  • Dokumentenintelligenz: PDFs, Screenshots, Diagramme, Tabellen, strukturierte Extraktionsziele

  • Audioverständnis: Audioclips, gesampelte Frames, Zusammenfassungen, Zeitstempel, Ereignisse und Anschlussfragen

  • Agenten-Schleifen: Beobachtung → Reasoning → Aktion → Validierungsbeispiele

Verwenden Sie bei Omni nicht blind die VRAM-Zahlen für reinen Text erneut. Multimodale Encoder, Projektor-Gewichte, Bild-Token, Audio-Chunks und langer Kontext erhöhen den Speicherbedarf. Beginnen Sie mit kürzeren Kontexten und kleineren Batchgrößen und skalieren Sie dann hoch.

Benchmarks

Nemotron 3 Nano Omni ist das stärkste Omni-Modell seiner Größe. Es ist außerdem das effizienteste offene multimodale Modell mit führender Genauigkeit. Das Modell übertrifft Qwen3-Omni-30B-A3B in jedem Benchmark.

Zuletzt aktualisiert

War das hilfreich?