🧩NVIDIA Nemotron 3 Nano Omni - Wie man lokal ausführt
Führe Nemotron-3-Nano-Omni-30B-A3B lokal auf deinem Gerät aus und feinabstimme es!
NVIDIA Nemotron-3-Nano-Omni-30B-A3B ist ein offenes 30B-Parameter-, 3B-aktive hybride Reasoning-MoE-Modell, entwickelt für multimodale agentische Workloads, einschließlich Audio, Video, Text, Bilder und Dokumente als Eingabe, mit Textausgabe. Das Modell läuft auf 25 GB RAM für 4-Bit und 36 GB für 8-Bit.
Mit einem 256K-Kontextist Nemotron 3 Nano Omni das stärkste Omni- Modell seiner Größe und das effizienteste offene multimodale Modell. Wir haben mit NVIDIA für Support ab Tag 0 zusammengearbeitet! GGUF: Nemotron-3-Nano-Omni-30B-A3B-Reasoning
⚙️ Nutzungsanleitung
NVIDIA empfiehlt diese Einstellungen für die Inferenz:
Denken-Modus:
Temperatur = 0,6top_p = 0.95
Instruct-Modus:
Temperatur = 0,2
Nemotron-3-Nano-Omni ausführen
Je nach Anwendungsfall müssen Sie andere Einstellungen. Einige GGUFs landen in ähnlicher Größe, weil die Modellarchitektur (wie gpt-oss) Dimensionen hat, die nicht durch 128 teilbar sind, sodass Teile nicht auf niedrigere Bits quantisiert werden können. GGUF: Nemotron-3-Nano-Omni-30B-A3B-Reasoning
Die 4-Bit-Versionen des Modells benötigen ~25 GB RAM. 8-Bit benötigt 36 GB. Für diese Anleitungen verwenden wir UD-Q4-K-XL das ein guter Kompromiss zwischen Größe und Genauigkeit ist.
Derzeit funktioniert kein multimodaler/Vision-GGUF in Ollama wegen separater mmproj Vision-Dateien. Verwenden Sie llama.cpp-kompatible Backends.
Verwenden Sie NICHT CUDA 13.2 da Sie sonst Kauderwelsch-Ausgaben erhalten könnten. NVIDIA arbeitet an einer Lösung.
🦥 Unsloth Studio-Anleitung
Für dieses Tutorial verwenden wir Unsloth Studio, unsere neue Web-UI zum Ausführen und Trainieren von LLMs. Mit Unsloth Studio können Sie Modelle ausführen und Audio, Bild und Text lokal auf Mac, Windows, und Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Modelle vergleichen nebeneinander
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-P usw.)
LLMs trainieren 2x schneller mit 70 % weniger VRAM

NVIDIA-Nemotron-3-Nano-30B-A3B-Omni suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum Unsloth Chat Registerkarte und suchen Sie in der Suchleiste nach Nemotron-3-Nano-Omni und laden Sie Ihr gewünschtes Modell und Ihre gewünschte Quantisierung herunter.

Nemotron-3-Nano-30B-A3B-Omni ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

🦙 Llama.cpp-Tutorial:
Anweisungen für die Ausführung in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Lass uns zuerst ein Bild holen! Du kannst auch Bilder hochladen. Wir werden https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, das einfach unser Mini-Logo ist, das zeigt, wie Finetunes mit Unsloth erstellt werden:

Lass uns das zweite Bild holen unter https://files.worldwildlife.org/wwfcmsprod/images/Sloth_Sitting_iStock_3_12_2014/story_full_width/8l7pbjmj29_iStock_000011145477Large_mini__1_.jpg

Jetzt laden wir das Modell manuell herunter. Das können wir über den folgenden Code tun (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Konversationsmodus aus:
Danach sehen Sie Folgendes:

Dann verwende /image um beide Bilder zu laden und zu fragen "Was ist dieses Bild?":


Und für das Faultierbild:

Bereitstellung und Deployment mit llama-server
Um Nemotron 3 Nano Omni lokal bereitzustellen, verwenden Sie llama-server. In einem neuen Terminal, zum Beispiel über tmux, stellen Sie das Modell bereit:
Wenn Sie das Modell manuell heruntergeladen haben, verwenden Sie:
Dann in einem neuen Terminal, nach der Installation des OpenAI-Clients mit pip install openai:
Was etwa wie folgt aussieht:

Bildeingabe über den OpenAI-kompatiblen Server
Verwenden wir picture.png das das Faultierbild war, wie in 🦙 Llama.cpp-Tutorial:
Was etwa wie folgt aussieht:

🦥 Feinabstimmung von Nemotron 3 Nano Omni
Unsloth unterstützt die gesamte Nemotron Modellfamilie. Nemotron 3 Nano Omni ist nützlich für multimodale Agentendatensätze. Sie können über Unsloth auf Audio, Vision oder Text trainieren. Videoeingabe Feinabstimmung wird derzeit nicht unterstützt.
Für reinen Text und Notebooks können Sie mit dem vorhandenen Nemotron 3 Nano Feinabstimmungs-Flowbeginnen. Für multimodale Adapter sollten Sie sicherstellen, dass Ihr Datensatz die Modalität enthält, die Ihr Agent tatsächlich benötigt:
Computer-Nutzung: Screenshots, UI-Zustand, Cursor/Kontext, erwartete nächste Aktion
Dokumentenintelligenz: PDFs, Screenshots, Diagramme, Tabellen, strukturierte Extraktionsziele
Audioverständnis: Audioclips, gesampelte Frames, Zusammenfassungen, Zeitstempel, Ereignisse und Anschlussfragen
Agenten-Schleifen: Beobachtung → Reasoning → Aktion → Validierungsbeispiele
Verwenden Sie bei Omni nicht blind die VRAM-Zahlen für reinen Text erneut. Multimodale Encoder, Projektor-Gewichte, Bild-Token, Audio-Chunks und langer Kontext erhöhen den Speicherbedarf. Beginnen Sie mit kürzeren Kontexten und kleineren Batchgrößen und skalieren Sie dann hoch.
Benchmarks
Nemotron 3 Nano Omni ist das stärkste Omni-Modell seiner Größe. Es ist außerdem das effizienteste offene multimodale Modell mit führender Genauigkeit. Das Modell übertrifft Qwen3-Omni-30B-A3B in jedem Benchmark.

Zuletzt aktualisiert
War das hilfreich?


