For the complete documentation index, see llms.txt. This page is also available as Markdown.

NVIDIA Nemotron 3.5 Lightning: ローカルでの実行方法

NVIDIA Nemotron-3.5-Lightning-30B-A3B は、大量タスクの実行を長時間稼働するエージェント向けに構築された、オープンな 30B パラメータ・3B アクティブのハイブリッド推論 MoE モデルです。ツール使用、出力検証、結果の整形、サブエージェントへの委任を含む、頻繁なエージェント呼び出し向けに設計されています。このモデルは 20GB RAM 4-bit では 20GB、8-bit では 33GB が必要です。

最大 100万コンテキストまで対応し、Nemotron 3.5 Lightning は、そのサイズに対して最速かつ最も高精度なオープン実行モデルの 1 つです。Unsloth Desktop と Unsloth Dynamic GGUFs を使って、Nemotron 3.5 をローカルで実行できます。初日からのサポートに感謝します、NVIDIA! GGUF: Nemotron-3.5-Lightning-30B-A3B

右側を見てください。Nemotron-3.5 は 10 分間、絶え間なくツールを呼び出します Unsloth Desktop:

⚙️ 使い方ガイド

NVIDIA は推論に次の設定を推奨しています:

思考モード:

  • temperature = 0.6

  • top_p = 0.95

指示モード:

  • temperature = 0.2

Nemotron 3.5 Lightning を実行する

ユースケースによって、異なる設定を使う必要があります。Nemotron 3.5 Lightning はトークンごとに 3B パラメータを有効化するため、長時間稼働するエージェントのワークフロー全体で繰り返し呼び出しても十分高速です。 GGUF: Nemotron-3.5-Lightning-30B-A3B

このモデルの 4-bit 版には約 20GB の RAM が必要です。8-bit 版には 33GB が必要です。このガイドでは UD-Q4-K-XL を使用します。これはサイズと精度のバランスが良いです。

Unsloth Desktop で実行するllama.cpp で実行する

🦥 Unsloth Desktop ガイド

このチュートリアルでは Unsloth Desktopを使用します。これはモデルの実行と学習のためのオープンソースのローカルアプリです。Unsloth を使えば、モデルをローカルで実行できます。 Mac、Windows、Linux および:

  • GGUF と safetensor モデルを検索、ダウンロード、実行する

  • 比較 モデルを 並べて

  • 使用 自己修復の ツール呼び出しと ウェブ検索

  • 実行 コード実行 を Python と Bash で

  • 推論パラメータの自動調整を使用する

  • VRAM を 70% کمتر使い、LLM を 2 倍高速に学習する

1

Unsloth をインストールする

始める最も簡単な方法は、 Unsloth Desktop アプリをダウンロードすることです。対応環境: macOS, Windows、および Linux.

Unsloth をダウンロード

または、手動でインストールしたい場合:

MacOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows PowerShell:

irm https://unsloth.ai/install.ps1 | iex
2

Nemotron 3.5 を検索してダウンロードする

へ移動し Unsloth Chat または Model hub で検索バーに Nemotron 3.5 と入力し、希望するモデルと量子化版をダウンロードします。

3

Nemotron 3.5 Lightning を実行する

Unsloth を使用すると推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は、 Unsloth 推論ガイド.

🦙 Llama.cpp チュートリアル:

llama.cpp で実行する手順(ほとんどのデバイスに収めるため、4-bit を使用します):

1

最新の llama.cpp を入手してビルドします。 -DGGML_CUDA=ON-DGGML_CUDA=OFF に変更してください。CUDA GPU がない場合、または CPU 推論を使いたい場合です。 Apple Mac および Metal デバイスでは-DGGML_CUDA=OFFを設定します。Metal サポートは既定で有効です。

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
2

それではモデルを手動でダウンロードしましょう。まず huggingface_hubをインストールした後、下のコードで実行できます。ダウンロードが止まる場合は、Hugging Face Hub、XET のデバッグを参照してください

pip install huggingface_hub
hf download unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --local-dir unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # Dynamic 2bit では "*UD-Q2_K_XL*" を使用
3

会話モードでモデルを実行する:

./llama.cpp/llama-cli \\
    --model unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-UD-Q4_K_XL.gguf \\
    --temp 0.6 \\
    --top-p 0.95 \\
    --min-p 0.01

Nemotron 3.5 Lightning には、推測デコード用の MTP と専用の DFlash および DSpark のドラフトモデルが付属しています。これらのドラフトモデルは複数トークン先を予測し、大量のエージェントワークロードでの出力速度を高めます。

🦥 Nemotron 3.5 Lightning のファインチューニング

Unsloth は NVIDIA Nemotron モデルファミリー全体の後学習に対応しています。Nemotron 3.5 Lightning は、長時間稼働するエージェント内での特化した高頻度作業に役立ちます。Unsloth を使えば、VRAM を 70% 少なくして 2 倍高速にモデルを学習できます。

ファインチューニングに有用なデータには次のようなものがあります:

  • ツール呼び出し: 適切なツールの選択、有効な引数の生成、ツールエラーからの復旧

  • 結果検証: 出力が制約、スキーマ、または期待される状態に合っているか確認する

  • リポジトリ作業: 定型的なシェルコマンド、テスト実行、整形、構造化された要約

  • サブエージェントへの委任: 専門家の選択、焦点を絞ったタスクの作成、結果の統合

  • 長時間稼働するエージェントのトレース: 観察 → 推論 → 行動 → 検証 → 復旧 の例

  • ドメイン固有のワークフロー: レイテンシーと一貫性が重要な、組織固有の反復タスク

これは密な 3B モデルとしてファインチューニング用ハードウェアを見積もらないでください。各トークンで有効になるのは 3B パラメータだけですが、モデル全体では 30B のパラメータを持っています。コンテキスト長、最適化手法、バッチサイズ、シーケンス長もメモリ使用量に影響します。

ノートブックや学習手順では、既存の Nemotron ファインチューニングフローから始めてください。まずは短いコンテキストと小さいバッチサイズから始め、徐々に拡張します。

ベンチマーク

Nemotron 3.5 Lightning は、小規模なオープンモデルにおける精度と速度のパレートフロンティア上に位置します:

  • 最大 4倍高速な出力 同規模のモデルより

  • 86% の精度 PinchBench で

  • 10,000 件の PinchBench タスクを 35% 高速に完了 同程度の精度の Qwen 3.6 35B より

Artificial Analysis Intelligence Index は、エージェント的タスク、コーディング、科学的推論、一般知能にわたる評価を組み合わせたものです。NVIDIA は、単なる 1 秒あたりの生トークン数だけでなく、有用なエージェント作業の完了にかかる時間も測定しています。

Nemotron 3.5 Lightning は、ルーティングされたエージェントシステム内でフロンティア推論モデルの下に位置するよう設計されています。難しい計画はより大きなモデルにルーティングし、高頻度の実行は Lightning にルーティングします。NVIDIA は OpenMDW-1.1 の下で重み、学習データ、レシピを公開する予定であり、 NeMo Switchyard が各リクエストを最適なモデルに振り分けることができます。

NVIDIA の完全な発表内容については、 Nemotron 3.5 Lightning の発表.

最終更新

役に立ちましたか?