> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/moderu/qwen3.8.md).

# Qwen3.8: ローカルでの実行方法

Qwen3.8-27Bを含むQwen3.8の量子化モデルをローカル環境で実行するガイドです。

Qwen3.8はQwenの新しいモデルファミリーで、Qwen3.8-**27B**、Qwen3.8-**2.4T-A95B** とQwen3.8-**Max**。Qwen3.8-27Bには **視覚** と推論機能、 **256Kのコンテキスト** ウィンドウがあり、 **17GBのRAM/VRAM** 構成でローカル実行できます。Qwen3.8はエージェント型コーディング、視覚、チャットのタスクに優れており、現在はUnsloth GGUF、NVFP4、 [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop)経由でも実行できます。Qwen3.8-2.4T-A95Bは、2.4Tパラメータ（95Bアクティブ）のモデルで、GPT-5.6 Solに匹敵します。

**8月19日更新:** Qwen3.8-27BのGGUFは現在 [Unsloth Dynamic V3.0](/docs/jp/ji-ben/dynamic-3.0-ggufs.md) を使用し、同じサイズで10%高い精度を実現し、他を大きく上回ります。

{% columns %}
{% column %} <a href="/pages/c107b4bfdcfe3f60b5f50e7db1acc53b4a2496d1#run-qwen3.8-guide" class="button primary">Qwen3.8実行ガイド</a><a href="https://unsloth.ai/download" class="button primary">Unslothをダウンロード</a>

初日アクセスを提供してくれたQwenに感謝します。Unslothの量子化版には次も含まれます:

* **Developer Roleのサポート** Codexのようなエージェント型ツール向け
* [MTP有効](/docs/jp/moderu/mtp.md) 高速推論向け
* **ツール呼び出し:** 入れ子のオブジェクトの解析を改善し、ツールの成功率を向上

フル精度のQwen3.8-2.4T-A95Bには4.9TBのストレージと1ビットの [Unsloth](https://github.com/unslothai/unsloth) Dynamic GGUFは **397GB（91%小さい）**&#x3067;、より大きいIQ1\_Sは508GBを要します。
{% endcolumn %}

{% column %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6aw6IjO7lnYJhSyzXYwq%2Fvolcano%20qwen.gif?alt=media&amp;token=94e56117-d10d-45e8-82dc-3e134b2b9359" alt=""><figcaption><p>Unsloth DesktopでのDynamic 4-bit Qwen3.8-27B</p></figcaption></figure>

Unslothの量子化版:

* [Qwen3.8-**27B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF)
* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
  {% endcolumn %}
  {% endcolumns %}

### :gear: 使用ガイド

#### Qwen3.8-27Bの要件:

Qwen3.8-**27B** 4ビット量子化版は、RTX 5080や4090、24GB RAM搭載Macなどの16～19GB VRAMで動作します。\
**表: ハードウェア要件** （単位 = 総メモリ: RAM + VRAM、または統合メモリ）

<table><thead><tr><th>1ビット</th><th>2ビット</th><th>3ビット</th><th>4ビット</th><th width="128">6ビット</th><th>8ビット</th><th>BF16</th></tr></thead><tbody><tr><td>7-8 GB</td><td>9-11 GB</td><td>12-14 GB</td><td>16-19 GB</td><td>23-26 GB</td><td>31 GB</td><td>56 GB</td></tr></tbody></table>

{% hint style="info" %}
使用したい場合は [MTP](/docs/jp/moderu/mtp.md) をより高速な推論のために使うなら、1～2GBの追加余裕を確保してください。
{% endhint %}

#### Qwen3.8-**2.4T** 要件:

* [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

| Dynamic 1ビット XXXS | Dynamic 1ビット Standard | Dynamic 2ビット | Q8\_0  | BF16（非損失） |
| ----------------- | --------------------- | ------------ | ------ | --------- |
| 397GB             | 508GB                 | 657 GB       | 2.6 TB | 4.9 TB    |

### 推奨設定

#### Qwen3.8-**27B設定:**

Qwen3.8-27Bは **ハイブリッド思考** 思考モードと非思考モードで既定設定が異なるモデルです。Extra highはデフォルトで有効なので、より短い思考トレースにしたい場合は [思考の労力を調整できます](#thinking--preserve-thinking):

| パラメータ                | 思考モード | Instruct（非思考）モード |
| -------------------- | ----- | ---------------- |
| `temperature`        | 1.0   | 0.7              |
| `top_p`              | 0.95  | 0.80             |
| `top_k`              | 20    | 20               |
| `min_p`              | 0.0   | 0.0              |
| `presence_penalty`   | 0.0   | 1.5              |
| `repetition_penalty` | 1.0   | 1.0              |

* **最大コンテキストウィンドウ:** `262,144` （YaRNにより1Mまで拡張可能）
* 思考モード: `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`
* Instruct（または非思考）モード: `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0`

#### Qwen3.8-**2.4T設定:**

Qwen3.8-2.4Tは **思考専用**で、Qwen3.8-Maxはハイブリッドです。

| デフォルト                   |
| ----------------------- |
| temperature = 1.0       |
| top\_p = 0.95           |
| top\_k = 20             |
| min\_p = 0.0            |
| presence\_penalty = 0.0 |

* コンテキスト長 = 最大 `1,010,000`
* `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0`

モデルが収まるなら、B200を使うと約20トークン/秒の生成、120トークン/秒超のスループットが得られます。目安はRAM+VRAMがおおよそ量子化サイズに等しいことです。そうでなくても動作しますが、ディスクへのオフロードのためかなり遅くなります。

### 💡 思考 + 思考の保持

{% columns %}
{% column %}
Qwen3.8には **思考の保持** があり、前回の会話の思考トレースを残します。使用トークン数は増えますが、会話を継続する際の精度を高める可能性があります。 [Unsloth](#run-qwen3.8-in-unsloth-desktop) にはQwen3.8向けの「Think」と「Preserved Thinking」の切り替えがあります（右を参照）:
{% endcolumn %}

{% column %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FLdgmjRrb5qhpbY9PwYe8%2FScreenshot%202026-08-14%20at%2011.26.15%E2%80%AFAM.png?alt=media&amp;token=6333f5ca-196d-46ae-9efd-2e522014e6db" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Qwen3.8-27Bは次をサポートしています: `reasoning_effort`。これは推論の深さを調整し、コストを制御するために使用できます。これらの切り替えはUnslothで自動的に有効になります:

* `xhigh` （デフォルト）: 綿密な分析を要する複雑なタスク向け
* `medium`: 精度と速度のバランス
* `low`: 速度とコストを重視した効率的な推論
* none

{% hint style="warning" %}
変更するには[ 思考 / 推論](#how-to-enable-or-disable-reasoning-and-thinking) の労力を `unsloth run` または `llama-server`では、次を使用します: `--chat-template-kwargs '{"reasoning_effort":"medium"}'`

もし **Windows** のPowerShellを使っているなら、次を使用します: `--chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"`

変更してください `medium` 希望する推論レベルに。
{% endhint %}

## Qwen3.8実行ガイド

Qwen3.8は現在、llama.cppとUnsloth Desktopで実行できます。大規模なQwen3.8-2.Tモデルでは、397GBの `IQ1_XXXS` 量子化版（Q1\_0と命名）を、アクセシビリティと精度の観点から最良の結果を得るために使用します。少なくとも450GBのRAMが必要です。量子化方式は自由に変更できます。

* Hugging Face: [Qwen3.8-27B-**GGUF**](https://huggingface.co/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4)
* ModelScope: [Qwen3.8-27B-**GGUF**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-GGUF) • [Qwen3.8-27B-**NVFP4**](https://www.modelscope.cn/models/unsloth/Qwen3.8-27B-NVFP4)
* **2.4T-A95B:** [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

<a href="/pages/c107b4bfdcfe3f60b5f50e7db1acc53b4a2496d1#run-qwen3.8-in-unsloth-desktop" class="button primary">Unsloth Desktopで実行</a><a href="/pages/c107b4bfdcfe3f60b5f50e7db1acc53b4a2496d1#run-qwen3.8-in-llama.cpp" class="button secondary">llama.cppで実行</a><a href="/pages/c107b4bfdcfe3f60b5f50e7db1acc53b4a2496d1#run-qwen3.8-in-llama.cpp" class="button secondary">NVFP4ガイド</a>

### 🦥 Unsloth DesktopでQwen3.8を実行

Qwen3.8は次で実行できます: [Unsloth Desktop](#run-qwen3.8-in-unsloth-desktop)ローカルAI向けのオープンソースUIアプリです。 **UnslothはRAMへ自動的にオフロードし、マルチGPU構成を検出します**。Unsloth Desktopを使えば、モデルをローカルで次の環境で実行できます: **MacOS、Windows**、Linux、さらに次を含みます:

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUFの実行](/docs/jp/xin-zhe/studio.md#run-models-locally)、MLXおよびsafetensorモデル
* [**自己修復** ツール呼び出し](/docs/jp/xin-zhe/studio/chat.md#auto-healing-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/desktop.md#code-execution) (Python、Bash)
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ調整（temp、top-pなど）
* MLXとllama.cppによる高速CPU+GPU推論
* [LLMを学習](/docs/jp/xin-zhe/studio.md#no-code-training) VRAMを70%削減し、2倍高速
  {% endcolumn %}

{% column %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F6IXaXdTVyvbrnjehlxys%2Fkimik3.gif?alt=media&amp;token=31e1213b-d7da-46e9-bc7f-3a8c402513fc" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをインストール

始める最も簡単な方法は、次をダウンロードすることです: [Unsloth Desktopアプリ](/docs/jp/desktop.md)。次で動作します: [macOS](/docs/jp/meru/install/mac.md), [Windows](/docs/jp/meru/install/windows-installation.md)、そして [Linux](/docs/jp/meru/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unslothをダウンロード</a>

* <i class="fa-apple">:apple:</i> [macOS向けにダウンロード](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Windows向けにダウンロード](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Linux向けにダウンロード](https://unsloth.ai/download/linux)

または、手動でインストールしたい場合は:

MacOS、Linux、WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### Qwen3.8を検索してダウンロード

へ移動 [Unsloth Chat](/docs/jp/xin-zhe/studio/chat.md) またはModel hubで検索バーにQwen3.8を入力し、目的のモデルと量子化版をダウンロードします。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fo53hIyoFypinWWLa1c0x%2FScreenshot%202026-08-14%20at%2012.42.38%E2%80%AFPM.png?alt=media&amp;token=a69de985-56ee-4ef3-8e10-f669cc168346" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Qwen3.8を実行

Unslothを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は次をご覧ください: [Unsloth推論ガイド](/docs/jp/xin-zhe/studio/chat.md).

たとえば、397GBのQwen3.8（91%小型化）をUnsloth Desktopで使うと、思考モードの切り替え、インラインキャンバス、ウェブ検索、コード実行などを有効にでき、ほかにも多くのことができます。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fb3IiYJzHzsp2698xTim4%2Fgiffyy%20gf.gif?alt=media&amp;token=f1bda1a1-b81f-43e2-ba10-dbdc9a29c0c0" alt="" width="563"><figcaption><p>Unsloth DesktopにおけるQwen3.8 2.4TのDynamic 1ビット 397GB、91%小型化GGUF</p></figcaption></figure>
{% endstep %}

{% step %}

#### Unsloth APIでQwen3.8を提供

次を使用できます: `unsloth run` コマンドを使って、次を用いてAPI経由でQwen3.8を提供します: `llama-server` ランタイムフラグには、コンテキストサイズ、GPUレイヤー、スレッディング、サンプリング、ネットワーク、ツール設定が含まれます。詳細は次をご覧ください: [APIドキュメント](/docs/jp/ji-ben/api.md) または [unsloth start](/docs/jp/lian-xie/unsloth-start.md).

{% code overflow="wrap" %}

```bash
unsloth run --model unsloth/qwen3.8-27B-GGUF:UD-Q4_K_XL
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0 \
    --reasoning-effort medium
```

{% endcode %}
{% endstep %}

{% step %}

#### Unslothの準備ができました

Unsloth Desktopを通じて、Qwen3.8でほかにも多くのことができます。例えば:

* **ツールを接続:** [Claude Code](/docs/jp/ji-ben/claude-code.md), [Codex](/docs/jp/ji-ben/codex.md), [ウェブ検索](/docs/jp/xin-zhe/studio/chat.md#advanced-web-search), [MCP](/docs/jp/ji-ben/mcp.md) など
* **モデルを学習:** テキスト、拡散モデルをファインチューニングし、 [埋め込み](/docs/jp/ji-ben/embedding-finetuning.md)など
* **メディアを生成:** 作成・学習 [画像](/docs/jp/ji-ben/diffusion-image.md)、動画、 [TTS](/docs/jp/ji-ben/text-to-speech-tts-fine-tuning.md) をローカルで

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FYShiiub5gs5pCQLX6d4U%2FScreenshot%202026-08-15%20at%2012.18.24%E2%80%AFAM.png?alt=media&amp;token=d6996797-a144-4113-b4c3-155cca6c39a0" alt=""><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### Qwen3.8-2.4T-A95Bの新しい1ビットデータ型

llama.cppのIQ1\_S（1重みあたり1.5625ビット）を、コードブックのエントリ数を減らすことで1.1875 bpwまで拡張しました。これは大規模モデルでうまく機能し、多くの精度を維持できることが分かりました。さらに、これらの新しいデータ型は、QATやQAD（量子化対応学習／蒸留）を必要としない後学習量子化（PTQ）にも適していることが分かりました。 [Qwen3.8-**2.4T-A95B**-GGUF](https://huggingface.co/unsloth/Qwen3.8-2.4T-A95B-GGUF)

命名上の問題のため、TQ2\_0、TQ1\_0、Q1\_0を使用しました。そうしないとHFリポジトリに表示されません。

<table><thead><tr><th>Dtype</th><th width="147.60000610351562">Naming</th><th width="114.39996337890625" align="right">BPW</th><th width="106.20001220703125" align="right"># entries</th><th width="113.413330078125" align="right">Index bits</th><th width="106.4000244140625" align="right">Block</th></tr></thead><tbody><tr><td>IQ1_S</td><td>IQ1_S</td><td align="right"><strong>1.5625</strong></td><td align="right">2048</td><td align="right">11</td><td align="right">50 B</td></tr><tr><td>UD-IQ1_XS</td><td>TQ2_0</td><td align="right">1.4375</td><td align="right">1024</td><td align="right">10</td><td align="right">46 B</td></tr><tr><td>UD-IQ1_XXS</td><td>TQ1_0</td><td align="right">1.3125</td><td align="right">512</td><td align="right">9</td><td align="right">42 B</td></tr><tr><td>UD-IQ1_XXXS</td><td>Q1_0</td><td align="right"><strong>1.1875</strong></td><td align="right">256</td><td align="right">8</td><td align="right">38 B</td></tr></tbody></table>

新しいデータ型についてはまだベンチマークを実行中ですが、他の大規模モデルでは **QAT / QADなしでも良い結果が得られています**:

| Dtype        |     GiB |      PPL |      KLD |  top-p |
| ------------ | ------: | -------: | -------: | -----: |
| IQ1\_S       | 553.204 | 2.578876 | 0.564553 | 78.882 |
| UD-IQ1\_XS   | 513.583 | 2.931261 | 0.690161 | 75.726 |
| UD-IQ1\_XXS  | 473.961 | 3.540383 | 0.876007 | 71.284 |
| UD-IQ1\_XXXS | 434.340 | 4.488796 | 1.109944 | 66.257 |

### :llama: llama.cppでQwen3.8を実行

{% stepper %}
{% step %}
専用のIQ1\_XXXSブランチを使用する必要があります [こちら](https://github.com/unslothai/llama.cpp/pull/61)。以下のビルド手順に従うこともできます。変更する `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` GPUがない場合、またはCPU推論のみを使いたい場合。 **Apple Mac / Metalデバイスでは**、次を設定し `-DGGML_CUDA=OFF` 、あとは通常どおり進めてください。Metalサポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone --branch iq1-narrow https://github.com/unslothai/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
標準の `IQ1_S` およびほかの量子化版だけを実行したい場合は、通常どおりllama.cppをコンパイルします:

{% code overflow="wrap" %}

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endcode %}
{% endstep %}

{% step %}
次をインストールした後、モデルを以下からダウンロードします: `pip install huggingface_hub`）。次を選択できます: `Q1_0` 用に `IQ1_XXXS` または次のような他の量子化版: `Q8_0` 。ダウンロードが止まる場合は、次を参照してください: [Hugging Face Hub、XET のデバッグ](/docs/jp/ji-ben/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

**Qwen3.8-27B:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-27B-GGUF \\
    --local-dir unsloth/Qwen3.8-27B-GGUF \\
    --include "*UD-Q4_K_XL*" # 3ビットの場合は "*UD-Q3_K_XL*" を使用
```

**Qwen3.8-2.4T:**

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --include "*Q1_0*" # 2ビットの場合は "*IQ2_XXS*" を使用
```

{% endstep %}

{% step %}
llama-cliでモデルを実行するには、以下のコードスニペットに従ってください:\
忘れずに [設定を変更](#recommended-settings) ユースケースに応じて。

**Qwen3.8-27B:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \\
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-Q1_0/Qwen3.8-2.4T-A95B-UD-Q1_0-00001-of-00010.gguf \\
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}
{% endstep %}

{% step %}
一般的なUD-IQ1\_Sを実行するには、次のようにします:

**Qwen3.8-2.4T:**

{% code overflow="wrap" %}

```bash
pip install -U "huggingface_hub[cli]"
hf download unsloth/Qwen3.8-2.4T-A95B-GGUF \\
    --local-dir unsloth/Qwen3.8-2.4T-A95B-GGFF \\
    --include "*IQ1_S*" # 2ビットの場合は "*IQ2_XXS*" を使用
```

{% endcode %}
{% endstep %}

{% step %}
そして実行します:

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Qwen3.8-2.4T-A95B-GGUF/UD-IQ1_S/Qwen3.8-2.4T-A95B-UD-IQ1_S-00001-of-00012.gguf \
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

### ⚡️NVFP4

Qwen3.6と同様に、私たちも新しい [動的NVFP4 Qwen3.8](/docs/jp/ji-ben/nvfp4.md)-27B量子化版で動作する **約1.5倍高速な** BF16チェックポイントより、 **より高い性能** と同等のファイルサイズです。Qwen3.8-27B NVFP4を実行 **1.5倍高速** で **24GBのVRAM。** 私たちはさらに追加しました **FP8 KVキャッシュのキャリブレーション** コンテキスト長を2倍に延長するために！NVFP4には、RTX 50X、DGX Spark（参照 [#dgx-spark-with-nvfp4-quants](#dgx-spark-with-nvfp4-quants "mention")）、B200、B300 GPUが必要です。古いGPUでは、私たちのGGUFはうまく動作します！NVFP4量子化版は [vLLM](#vllm) 現時点ではのみです（SGLangはサポートされていません）。

* [Qwen3.8-27B-**NVFP4**](https://huggingface.co/unsloth/Qwen3.8-27B-NVFP4) 量子化

<table><thead><tr><th width="90" align="right">バッチ</th><th width="114.5999755859375" align="right">BF16総tok/s</th><th width="122.60003662109375" align="right">NVFP4総tok/s</th><th width="122" align="right">高速化</th><th width="137.4000244140625" align="right">BF16ユーザーごと</th><th align="right">NVFP4ユーザーごと</th></tr></thead><tbody><tr><td align="right">1</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td><td align="right">1.49x</td><td align="right">89.8</td><td align="right"><strong>133.7</strong></td></tr><tr><td align="right">8</td><td align="right">649.4</td><td align="right"><strong>938.8</strong></td><td align="right">1.45x</td><td align="right">81.2</td><td align="right"><strong>117.3</strong></td></tr><tr><td align="right">32</td><td align="right">1983.0</td><td align="right"><strong>2787.0</strong></td><td align="right">1.41x</td><td align="right">62.0</td><td align="right"><strong>87.1</strong></td></tr><tr><td align="right">64</td><td align="right">3048.5</td><td align="right"><strong>4407.2</strong></td><td align="right">1.45x</td><td align="right">47.6</td><td align="right"><strong>68.9</strong></td></tr></tbody></table>

以下には、Qwen3.6で実施した以前のベンチマークも示します。16bit活性化を使う他のNVFP4実装と、私たちのNVFP4活性化を比較しています：

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F8zM7cg0Xgo2pAlop1iPW%2F01_qwen36_combined_throughput.png?alt=media&amp;token=23131a96-4c41-42d7-aa16-5bfb21bb44a3" alt="" width="563"><figcaption></figcaption></figure>

すべてのベンチマークは1台のB200、128並列で実施しています。より高い並列度では35Bを17,561トークン/秒まで引き上げられます。&#x20;

精度ベンチマークでは、Code、Chat、そして多くの分野でKLDとTop-1%一致率を実施しました。NVFP4はBF16に対して一貫して92%〜97%の精度回復を示します

| コーパス              |         KLD平均 | top-1一致率 |
| ----------------- | ------------: | -------: |
| zh                |       0.01628 |   93.55% |
| コード               |       0.02600 |   96.68% |
| refgen            |       0.03993 |   94.46% |
| チャット              |       0.05818 |   92.15% |
| ja / ko / ru / es | 0.0124-0.0155 |   94-95% |

Qwen 3.6の精度ベンチマークでは、FP8、BF16、NVIDIAのNVFP4、そして私たちのNVFP4sについてMMLU-Pro、AIME 2025、GPQAを実施し、より高速な量子化版がすべてで同様に動作することを示します：

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FFhOUUUlRBj3dafGnmvhK%2F03_qwen36_combined_accuracy(7).png?alt=media&amp;token=9178447f-d5ae-4489-9bdc-73b2b7b1631b" alt=""><figcaption></figcaption></figure>

詳細は、私たちの [Dynamic NVFP4量子化ブログ](/docs/jp/ji-ben/nvfp4.md).

NVFP4量子化版を実行するには、以下のQwen3.8-27Bを実行するコマンドを [vLLM](/docs/jp/ji-ben/inference-and-deployment/vllm-guide.md) または [SGLang](/docs/jp/ji-ben/inference-and-deployment/sglang-guide.md):

#### **vLLM:**

vLLMを別のvenvにインストールするには：

{% code overflow="wrap" expandable="true" %}

```bash
uv venv unsloth-nvfp4-env --python 3.13
source unsloth-nvfp4-env/bin/activate
uv pip install "vllm>=0.25.0" "flashinfer-python>=0.6.13" "nvidia-cutlass-dsl>=4.5.2" \\
    --torch-backend=auto
```

{% endcode %}

では、27B版をサーブするには：

```shell
vllm serve unsloth/Qwen3.8-27B-NVFP4
```

MTP / speculative decoding（デコードは高速化しますが、スループットはやや低下）を有効にするには、次を使用します：

```bash
vllm serve unsloth/Qwen3.8-27B-NVFP4
    --speculative-config '{"method": "mtp", "num_speculative_tokens": 2}'
```

Torchcodecの問題が出た場合は、以下を実行してからvllmを再起動してください。

{% code overflow="wrap" expandable="true" %}

```bash
sudo apt-get update
sudo apt-get install -y ffmpeg
```

{% endcode %}

#### **SGLang：**

SGLangを使用する場合は、必ず **SGLangバージョン v0.5.19** そうしないと、lm\_headをFP8に量子化しているため動作しません。

{% hint style="info" %}
vLLMには `CompressedTensorsW8A8Fp8` これをサポートするカーネルがありますが、SGLang v0.5.19はFP8のlm\_headを読み込めません。v0.5.19は現在動作します！
{% endhint %}

最新版をインストールした後のsglangでは：

{% code overflow="wrap" %}

```bash
uv pip install sglang sglang-kernel \\
  --extra-index-url https://sgl-project.github.io/whl/cu130/ \\
  --extra-index-url https://download.pytorch.org/whl/cu130 \\
  --index-strategy unsafe-best-match
```

{% endcode %}

その後、これをサーブできます：

```bash
sglang serve unsloth/Qwen3.8-27B-NVFP4
```

MTPを有効にするには、次を使用します：

{% code overflow="wrap" %}

```bash
sglang serve unsloth/Qwen3.8-27B-NVFP4 --speculative-algorithm EAGLE \\
    --speculative-num-steps 3 --speculative-eagle-topk 1  --speculative-num-draft-tokens 4
```

{% endcode %}

### :exploding\_head:量子化分析

NVFP4量子化版はBF16より1.5倍高速で、top-1%精度を92〜97%維持します。

私たちは使用しました [Dynamic 3.0 GGUFs](/docs/jp/ji-ben/dynamic-3.0-ggufs.md) Qwen3.8-27Bを大幅に改善するために！

Qwen3.8-27BのUD-3で示したtop-1%精度プロット：

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FVg5FHPxOpmaJ1r3ciw4u%2Fimage.png?alt=media&amp;token=107ef044-0181-489b-b6ae-da218e16c98b" alt=""><figcaption></figcaption></figure>

そしてQwen3.8の平均KLD：

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Ft8BnEqBLUQGUgu2cAKKI%2Fimage.png?alt=media&amp;token=912d5b6a-540f-4ee0-9208-f5ad45776341" alt=""><figcaption></figcaption></figure>

### 📊 ベンチマーク

GGUF量子化ベンチマークについては、上記の [量子化分析](#quantization-analysis) または [Dynamic V3.0記事](/docs/jp/ji-ben/dynamic-3.0-ggufs.md).

#### Qwen3.8-**27B**

表のベンチマークはさらに下をご覧ください：

<div><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWijY5wYmLx70Ao2ol7Tj%2Fqwen%20benchmark%201.jpeg?alt=media&amp;token=f69ebf50-cf35-426f-a610-8eeb32151d90" alt=""><figcaption></figcaption></figure> <figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FELa2vq8Wh3oelQi6Bf07%2Fqwen%20benchmark%202.jpeg?alt=media&amp;token=2cc6d085-630d-4fa1-9b50-784b22a1fb04" alt=""><figcaption></figcaption></figure></div>

#### テキスト性能

| ベンチマーク                                          | Qwen3.8-27B                | Qwen3.6-27B        | Qwen3.7-Plus       | Muse Glimmer-30B | Opus4.6 Max |
| ----------------------------------------------- | -------------------------- | ------------------ | ------------------ | ---------------- | ----------- |
| **コーディング**                                      |                            |                    |                    |                  |             |
| エージェント型ターミナルコーディングTerminal Bench 2.1 (Terminus) | 73.0                       | 63.4               | 64.0               | 51.7             | **78.2**    |
| エージェント型コーディングSWE-bench Pro                      | **61.7**                   | 53.5               | 57.6               | 51.2             | 53.4        |
| リポジトリレベルのコード生成NL2Repo-Bench                     | 42.3                       | 36.2               | 41.1               | --               | **47.6**    |
| エージェント型コーディングDeepSWE 1.1                        | **42.2**                   | 13.3               | 14.2               | --               | --          |
| ソフトウェア工学QwenSWEBench                            | **79.0**                   | 49.3               | 59.2               | --               | 63.8        |
| **エージェント**                                      |                            |                    |                    |                  |             |
| 長期的なオフィスワークCoWorkBench                          | **70.7**                   | 61.0               | 65.1               | --               | 68.2        |
| 専門職タスクJobBench                                  | **33.4**                   | 21.8               | 27.6               | --               | --          |
| 最先端エージェントタスクAgents' Last Exam                   | Pass\@1**20.4**スコア**42.9** | Pass\@110.6スコア27.3 | Pass\@113.2スコア33.6 | --               | --          |
| 一般                                              |                            |                    |                    |                  |             |
| 指示追従IFBench                                     | **79.5**                   | 69.1               | 79.1               | 77.0             | 62.5        |
| 科学的推論GPQA Diamond                               | 89.2                       | 87.8               | 90.3               | 83.5             | **91.3**    |
| 学際的推論HLE                                        | 30.8                       | 24.0               | 34.7               | 22.0             | **40.0**    |
| 競技プログラミングLiveCodeBench v6                       | **90.3**                   | 83.9               | 89.6               | --               | 88.8        |

#### Qwen3.8-**2.4T-A95B**

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWP0nBgaQcnnAGjqG1jyQ%2Fqwen3.8%20bench.jpg?alt=media&amp;token=92a0d19c-51cb-4df2-a4f5-334fe08e6a21" alt=""><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/moderu/qwen3.8.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
