> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/moderu/nemotron-3.md).

# NVIDIA Nemotron 3 Nano - 実行方法ガイド

NVIDIA がリリース **Nemotron-3-Nano-4B**、以下に続く4BのオープンなハイブリッドMoEモデルで、 [Nemotron-3-Super-120B-A12B](/docs/jp/moderu/nemotron-3/nemotron-3-super.md) および Nemotron-3-Nano-30B-A3B。Nemotron ファミリーは、高速で正確なコーディング、数学、エージェント系ワークロード向けに設計されています。これらは **100万トークンのコンテキスト** ウィンドウを備えており、推論、チャット、スループットのベンチマーク全般で競争力があります。

Nemotron-3-Nano-4B は **5GB** の RAM、VRAM、またはユニファイドメモリで動作します。Nemotron-3-Nano-30A3B は **24GB** の RAM で動作します。Nemotron 3 は現在、以下を介してローカルでファインチューニングできます。 [Unsloth](https://github.com/unslothai/unsloth)。Unsloth に初日サポートを提供してくれた NVIDIA に感謝します。

<a href="/pages/6b8d31fd5301efc60f6ff33d32a66c700ccee8ba#run-nemotron-3-nano-4b" class="button primary">Nemotron-3-Nano-4B</a><a href="/pages/6b8d31fd5301efc60f6ff33d32a66c700ccee8ba#run-nemotron-3-nano-30b-a3b" class="button primary">Nemotron-3-Nano-30B-A3B</a><a href="https://unsloth.ai/docs/models/nemotron-3#fine-tuning-nemotron-3-and-rl" class="button secondary">Nemotron 3 のファインチューニング</a>

| [Nemotron-3-Nano-**4B**-GGUF](https://huggingface.co/unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF) | [Nemotron-3-**Nano-30B-A3B**-GGUF](https://huggingface.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF) |
| -------------------------------------------------------------------------------------------- | ----------------------------------------------------------------------------------------------- |

### ⚙️ 使用ガイド

NVIDIA は推論に次の設定を推奨しています：

{% columns %}
{% column %}
**一般的なチャット/指示（デフォルト）:**

* `temperature = 1.0`
* `top_p = 1.0`
  {% endcolumn %}

{% column %}
**ツール呼び出しのユースケース:**

* `temperature = 0.6`
* `top_p = 0.95`
  {% endcolumn %}
  {% endcolumns %}

**ほとんどのローカル利用では、次のように設定します:**

* `max_new_tokens` = `32,768` を `262,144` 最大 100 万トークンの標準プロンプト用
* 深い推論や長文生成では、RAM/VRAM に余裕がある範囲で増やしてください。

チャットテンプレートの形式は、以下を使用すると確認できます:

{% code overflow="wrap" %}

```python
tokenizer.apply_chat_template([
    {"role" : "user", "content" : "What is 1+1?"},
    {"role" : "assistant", "content" : "2"},
    {"role" : "user", "content" : "What is 2+2?"}
    ], add_generation_prompt = True, tokenize = False,
)
```

{% endcode %}

{% hint style="success" %}
モデルは NoPE で学習されているため、変更する必要があるのは `max_position_embeddings`だけです。モデルは明示的な位置埋め込みを使用しないため、YaRN は不要です。
{% endhint %}

#### Nemotron 3 のチャットテンプレート形式:

{% hint style="info" %}
Nemotron 3 は `<think>` をトークンID 12 で使用し、 `</think>` を推論用にトークンID 13 で使用します。以下を使用してください。 `--special` で llama.cpp のトークンを確認できます。必要に応じて `--verbose-prompt` で `<think>` を確認する必要があるかもしれません。先頭に付加されるためです。
{% endhint %}

{% code overflow="wrap" lineNumbers="true" %}

```
<|im_start|>system\n<|im_end|>\n<|im_start|>user\nWhat is 1+1?<|im_end|>\n<|im_start|>assistant\n<think></think>2<|im_end|>\n<|im_start|>user\nWhat is 2+2?<|im_end|>\n<|im_start|>assistant\n<think>\n
```

{% endcode %}

## 🖥️ Nemotron-3-Nano-4B を実行

用途によっては、異なる設定を使う必要があります。いくつかの GGUF は、モデルアーキテクチャ（たとえば [gpt-oss](/docs/jp/moderu/gpt-oss-how-to-run-and-fine-tune.md)）の次元が 128 で割り切れないため、サイズが似通っており、その一部をより低いビットに量子化できません。

モデルの4ビット版には約3GBのRAMが必要です。8ビット版には5GBが必要です。

### 🦥 Unsloth Studioガイド

Nemotron 3 は [Unsloth Studio](/docs/jp/shii/studio.md)で実行およびファインチューニングできます。これはローカルAI向けの新しいオープンソースのWeb UIです。Unsloth Studio を使えば、モデルをローカルで **MacOS、Windows**、Linux、および次の機能：

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUFの実行](/docs/jp/shii/studio.md#run-models-locally) およびsafetensorモデル
* [**自己修復** ツール呼び出し](/docs/jp/shii/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/shii/studio.md#run-models-locally) （Python、Bash）
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ調整（temp、top-pなど）
* llama.cpp経由の高速CPU＋GPU推論
* [LLMの学習](/docs/jp/shii/studio.md#no-code-training) VRAMを70%削減しつつ2倍高速
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/c32867f999db074387ac16732ce548485cc593de" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをインストール

ターミナルで実行：

**MacOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell：**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unslothを起動

**MacOS、Linux、WSL、Windows で:**

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

<div data-with-frame="true"><figure><img src="/files/698ae7636b7c9b8a8122c6fbdabc1bd2273fdb2c" alt="" width="375"><figcaption></figcaption></figure></div>

**次に開く `http://localhost:8888` をブラウザーで。**
{% endstep %}

{% step %}

#### Nemotron-3-Nano-4B を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。その後、モデル、データセット、基本設定を選ぶ簡単なオンボーディングウィザードが表示されます。いつでもスキップできます。

次に〜へ移動し [Unsloth Chat](/docs/jp/shii/studio/chat.md) タブを開き、検索バーで Nemotron-3-Nano-4B を検索して、希望のモデルと量子化版をダウンロードします。

<div data-with-frame="true"><figure><img src="/files/3fdd7f911dd28eedc74063f6d550adca59695839" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Nemotron-3-Nano-4B を実行

Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、次を参照してください [Unsloth Studio推論ガイド](/docs/jp/shii/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/44d9105dd956eac31f9586bcf01055a289b0ef3e" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### Llama.cpp チュートリアル:

llama.cpp で実行するための手順（ほぼ完全精度に近づけるために 8 ビットを使用します）:

{% stepper %}
{% step %}
最新の `llama.cpp` こちら [GitHub はこちら](https://github.com/ggml-org/llama.cpp)。以下のビルド手順に従うこともできます。変更してください `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` GPU がない場合、または CPU 推論のみを使用したい場合。

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Hugging Face から直接取得できます。RAM/VRAM に余裕がある範囲でコンテキストを 100 万まで増やせます。

以下は **一般的な指示** の

```bash
./llama.cpp/llama-cli \
    -hf unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF:Q8_0 \
    --ctx-size 16384 \
    --temp 1.0 --top-p 1.0
```

以下は **ツール呼び出し** の

```bash
./llama.cpp/llama-cli \
    -hf unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF:Q8_0 \
    --ctx-size 32768 \
    --temp 0.6 --top-p 0.95
```

{% endstep %}

{% step %}
（以下をインストールした後）モデルを次の方法でダウンロードしてください `pip install huggingface_hub hf_transfer` をインストールした後）。 `Q8_0` またはその他の量子化版。

```python
# !pip install huggingface_hub hf_transfer
import os
os.environ["HF_HUB_ENABLE_HF_TRANSFER"] = "1"
from huggingface_hub import snapshot_download
snapshot_download(
    repo_id = "unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF",
    local_dir = "unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF",
    allow_patterns = ["*Q8_0*"],
)
```

{% endstep %}

{% step %}
それでは、会話モードでモデルを実行します:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF/NVIDIA-Nemotron-3-Nano-4B-Q8_0.gguf \
    --ctx-size 16384 \
    --seed 3407 \
    --prio 2 \
    --temp 0.6 \
    --top-p 0.95
```

{% endcode %}

また、 **コンテキストウィンドウ** も必要に応じて調整してください。ハードウェアが 256K を超えるコンテキストウィンドウを処理できることを確認してください。1M に設定すると CUDA の OOM を引き起こしてクラッシュする可能性があるため、デフォルトは 262,144 です。
{% endstep %}
{% endstepper %}

## 🖥️ Nemotron-3-Nano-30B-A3B を実行

用途によっては、異なる設定を使う必要があります。いくつかの GGUF は、モデルアーキテクチャ（たとえば [gpt-oss](/docs/jp/moderu/gpt-oss-how-to-run-and-fine-tune.md)）の次元が 128 で割り切れないため、サイズが似通っており、その一部をより低いビットに量子化できません。

モデルの4ビット版には約24GBのRAMが必要です。8ビット版には36GBが必要です。

### 🦥 Unsloth Studioガイド

このチュートリアルでは、 [Unsloth Studio](/docs/jp/shii/studio.md)は、LLM の実行と学習のための新しいWeb UIです。Unsloth Studio を使えば、モデルをローカルで **Mac、Windows**、Linux 上で使用でき、次のことが可能です:

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUFの実行](/docs/jp/shii/studio.md#run-models-locally) およびsafetensorモデル
* **比較** モデルを **並べて**
* [**自己修復** ツール呼び出し](/docs/jp/shii/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/shii/studio.md#run-models-locally) （Python、Bash）
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ調整（temp、top-pなど）
* [LLMの学習](/docs/jp/shii/studio.md#no-code-training) VRAMを70%削減しつつ2倍高速
  {% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/c32867f999db074387ac16732ce548485cc593de" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをインストール

**MacOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell：**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Unsloth Studio のセットアップ（1回のみ）

セットアップにより、Node.js（nvm 経由）の自動インストール、フロントエンドのビルド、すべての Python 依存関係のインストール、CUDA サポート付きの llama.cpp のビルドが行われます。

{% hint style="info" %}
**WSL ユーザー向け:** 次の入力を求められます: `sudo` ビルド依存関係をインストールするためのパスワード（`cmake`, `git`, `libcurl4-openssl-dev`).
{% endhint %}
{% endstep %}

{% step %}

#### Unslothを起動

**MacOS、Linux、WSL：**

```bash
source unsloth_studio/bin/activate
unsloth studio -H 0.0.0.0 -p 8888
```

**Windows PowerShell:**

```bash
& .\unsloth_studio\Scripts\unsloth.exe studio -H 0.0.0.0 -p 8888
```

<div data-with-frame="true"><figure><img src="/files/698ae7636b7c9b8a8122c6fbdabc1bd2273fdb2c" alt="" width="375"><figcaption></figcaption></figure></div>

**次に開く `http://localhost:8888` をブラウザーで。**
{% endstep %}

{% step %}

#### Nemotron-3-Nano-30B-A3B を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。その後、モデル、データセット、基本設定を選ぶ簡単なオンボーディングウィザードが表示されます。いつでもスキップできます。

次に〜へ移動し [Unsloth Chat](/docs/jp/shii/studio/chat.md) タブを開き、検索バーで Nemotron-3-Nano-4B を検索して、希望のモデルと量子化版をダウンロードします。

<div data-with-frame="true"><figure><img src="/files/4c08a7090e3e8716d80637bf268c8530648c0065" alt="" width="375"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}

#### Nemotron-3-Nano-30B-A3B を実行

Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、次を参照してください [Unsloth Studio推論ガイド](/docs/jp/shii/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/44d9105dd956eac31f9586bcf01055a289b0ef3e" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### Llama.cpp チュートリアル:

llama.cpp で実行する手順（ほとんどのデバイスに収まるよう4ビットを使用します）：

{% stepper %}
{% step %}
最新の `llama.cpp` こちら [GitHub はこちら](https://github.com/ggml-org/llama.cpp)。以下のビルド手順に従うこともできます。変更してください `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` GPU がない場合、または CPU 推論のみを使用したい場合。 **Apple Mac / Metal デバイスの場合**、次を設定し `-DGGML_CUDA=OFF` その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
Hugging Face から直接取得できます。RAM/VRAM に余裕がある範囲でコンテキストを 100 万まで増やせます。

以下は **一般的な指示** の

```bash
./llama.cpp/llama-cli \
    -hf unsloth/Nemotron-3-Nano-30B-A3B-GGUF:UD-Q4_K_XL \
    --ctx-size 32768 \
    --temp 1.0 --top-p 1.0
```

以下は **ツール呼び出し** の

```bash
./llama.cpp/llama-cli \
    -hf unsloth/Nemotron-3-Nano-30B-A3B-GGUF:UD-Q4_K_XL \
    --ctx-size 32768 \
    --temp 0.6 --top-p 0.95
```

{% endstep %}

{% step %}
（以下をインストールした後）モデルを次の方法でダウンロードしてください `pip install huggingface_hub hf_transfer` をインストールした後）。 `UD-Q4_K_XL` またはその他の量子化版。

```python
# !pip install huggingface_hub hf_transfer
import os
os.environ["HF_HUB_ENABLE_HF_TRANSFER"] = "1"
from huggingface_hub import snapshot_download
snapshot_download(
    repo_id = "unsloth/Nemotron-3-Nano-30B-A3B-GGUF",
    local_dir = "unsloth/Nemotron-3-Nano-30B-A3B-GGUF",
    allow_patterns = ["*UD-Q4_K_XL*"],
)
```

{% endstep %}

{% step %}
それでは、会話モードでモデルを実行します:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/Nemotron-3-Nano-30B-A3B-GGUF/Nemotron-3-Nano-30B-A3B-UD-Q4_K_XL.gguf \
    --ctx-size 16384 \
    --seed 3407 \
    --prio 2 \
    --temp 0.6 \
    --top-p 0.95
```

{% endcode %}

また、 **コンテキストウィンドウ** も必要に応じて調整してください。ハードウェアが 256K を超えるコンテキストウィンドウを処理できることを確認してください。1M に設定すると CUDA の OOM を引き起こしてクラッシュする可能性があるため、デフォルトは 262,144 です。

{% hint style="info" %}
Nemotron 3 は `<think>` をトークンID 12 で使用し、 `</think>` を推論用にトークンID 13 で使用します。以下を使用してください。 `--special` で llama.cpp のトークンを確認できます。必要に応じて `--verbose-prompt` で `<think>` を確認する必要があるかもしれません。先頭に付加されるためです。
{% endhint %}
{% endstep %}
{% endstepper %}

### 🦥 Nemotron 3 と RL のファインチューニング

Unsloth は現在、Nemotron 3 Super と Nano を含むすべての Nemotron モデルのファインチューニングをサポートしています。&#x20;

4B モデルは無料の Colab GPU に収まりますが、30B モデルは収まりません。それでも、ファインチューニング用に 80GB の A100 Colab ノートブックをご用意しました。Nemotron 3 Nano の16ビット LoRA ファインチューニングでは、およそ **60GB の VRAM**:

* [Nemotron-3-Nano-30B-A3B SFT LoRA ノートブック](https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/Nemotron-3-Nano-30B-A3B_A100.ipynb)

{% embed url="<https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/Nemotron-3-Nano-30B-A3B_A100.ipynb>" %}

MoE のファインチューニングについては、ルーターレイヤーをファインチューニングするのはおそらく良い考えではないため、デフォルトで無効にしています。推論能力を維持したい場合（任意）、直接回答と Chain-of-Thought の例を混ぜて使えます。少なくとも <mark style="background-color:green;">75% の推論</mark> と <mark style="background-color:green;">25% の非推論</mark> をデータセットに含めて、モデルに推論能力を保持させてください。

#### :sparkles:強化学習 + NeMo Gym

私たちはオープンソースの NVIDIA [NeMo Gym](https://github.com/NVIDIA-NeMo/Gym/pull/492) チームと協力し、RL 環境の民主化を可能にしました。この共同作業により、NeMo Gym の学習環境とデータセットを使用して、数学、コーディング、ツール使用など、関心の高い多くの分野で単一ターンのロールアウト RL 学習が可能になります:

{% columns %}
{% column %}
[NeMo Gym Sudoku 強化学習ノートブック](https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/nemo_gym_sudoku.ipynb)

{% embed url="<https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/NeMo-Gym-Sudoku.ipynb>" %}
{% endcolumn %}

{% column %}
[NeMo Gym 複数環境による強化学習ノートブック](https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/NeMo-Gym-Multi-Environment.ipynb)

{% embed url="<https://colab.research.google.com/github/unslothai/notebooks/blob/main/nb/NeMo-Gym-Multi-Environment.ipynb>" %}
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
**NVIDIA 公式 Developer ブログで公開された最新の共同作業ガイドもぜひご覧ください:**

#### [Unsloth を使って NVIDIA GPU 上で LLM をファインチューニングする方法](https://blogs.nvidia.com/blog/rtx-ai-garage-fine-tuning-unsloth-dgx-spark/)

{% endhint %}

{% embed url="<https://blogs.nvidia.com/blog/rtx-ai-garage-fine-tuning-unsloth-dgx-spark/>" %}

### 🦙Llama-server の提供とデプロイ

Nemotron 3 を本番環境にデプロイするには、以下を使用します。 `llama-server` tmux などを使って新しいターミナルで、次のようにモデルをデプロイします:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/Nemotron-3-Nano-30B-A3B-GGUF/Nemotron-3-Nano-30B-A3B-UD-Q4_K_XL.gguf \
    --alias "unsloth/Nemotron-3-Nano-30B-A3B" \
    --prio 3 \
    --min-p 0.01 \
    --temp 0.6 \
    --top-p 0.95 \\
    --ctx-size 16384 \
    --port 8001
```

{% endcode %}

上記を実行すると、次が得られます:

<figure><img src="/files/852e5dda4afa2d7bb59b142a7eec5f0332c55f9c" alt="" width="563"><figcaption></figcaption></figure>

次に、新しいターミナルで `pip install openai`を行った後、次を実行します:

{% code overflow="wrap" %}

```python
from openai import OpenAI
import json
openai_client = OpenAI(
    base_url = "http://127.0.0.1:8001/v1",
    api_key = "sk-no-key-required",
)
completion = openai_client.chat.completions.create(
    model = "unsloth/Nemotron-3-Nano-30B-A3B",
    messages = [{"role": "user", "content": "What is 2+2?"},],
)
print(completion.choices[0].message.content)
```

{% endcode %}

次が出力されます

{% code overflow="wrap" %}

```
ユーザーは「2+2 はいくつ？」という簡単な質問をしています。答えは4です。回答してください。

2 + 2 = 4.
```

{% endcode %}

### ベンチマーク

Nemotron-3-Nano-4B は、スループットを含め、そのサイズに対して最も高性能なモデルです。

<figure><img src="/files/5844c2b4de7b6d0aaf5b0d3bfd14b31eb62dc739" alt="" width="375"><figcaption></figcaption></figure>

Nemotron-3-Nano-30B-A3B は、スループットを含むすべてのベンチマークで最も高性能なモデルです。

<figure><img src="/files/14413219b3975d227fdd18b1f6af3f88f0395ad2" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/moderu/nemotron-3.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
