> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/moderu/deepseek-v4.md).

# DeepSeek-V4: ローカルでの実行方法

DeepSeek-V4-Pro-0813とDeepSeek-V4-Flash-0731を自分のデバイスでローカル実行しましょう！

DeepSeek-V4、DeepSeek-V4-Flash-Vision-Exp、V4-**Pro-0813**、およびV4-**Flash-0731** は新しいオープンウェイトモデルです。Flashバリアントは284Bパラメータ（13Bがアクティブ）、V4-Proは1.6T（49Bがアクティブ）です。 **V4-Pro-0813**（リリース日： **8月13日**）はClaude-4.8-Opusに匹敵する性能を持ち、一方で **V4-Flash-0731**（リリース日： **7月31日**は、そのサイズクラスで最高の性能を実現し、 **V4-Proを上回ります** （プレビュー）。コーディング、エージェント型、チャットのワークフロー向けに構築され、 **100万トークンのコンテキストウィンドウ**を備えています。このガイドでは、Unsloth Dynamic GGUFと [Unsloth Desktop](/docs/jp/desktop.md).

で **ロスレスな** DeepSeekを使用するには、Q8（`UD-Q8_K_XL`）を使用してください。これは **7GB大きいだけ** で、Q4（`UD-Q4_K_XL`）よりもです。 ロスレスの8ビットGGUFは **162 GB** で、3ビットは **103GB** であり、 **110GBのRAM** を搭載したデバイスで実行できま&#x3059;**.** DeepSeek-V4-Flash-0731は、Terminal Bench 2.1で82.7%、DeepSWEで54.4%、NL2Repoで54.2%を記録しています。 [DSpark](#dspark-speculative-decoding) もGGUFで有効化され、最大 **2倍高速なデコード速度**!

{% hint style="success" %}
**8月31日：** DeepSeek-Flash-Vision-Expが利用可能になりました！

**8月13日：** DeepSeek-**V4-Pro-0813** がリリースされ、 [量子化モデルが現在](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) 実行可能です。
{% endhint %}

{% hint style="success" %}
**8月6日：DeepSeek-V4-Flash-0731でDSparkが有効化され、推論が1.5～1.9倍高速化されました！ DSparkは** [**Unsloth**](#unsloth-studio-guide)**.**

で自動的に有効になります。また、 [DeepSeek-V4チャットJinjaテンプレート](#deepseek-v4-chat-template-improvements)を改善し、4,000件を超える会話で公式ベースラインと同等であることを検証しました。
{% endhint %}

| [DeepSeek-V4-Pro-0813-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF) | [DeepSeek-V4-Flash-**0731**-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF) | [DeepSeek-V4-Flash-GGUF](https://huggingface.co/unsloth/DeepSeek-V4-Flash-GGUF) |
| ------------------------------------------------------------------------------------- | --------------------------------------------------------------------------------------------- | ------------------------------------------------------------------------------- |

<a href="/docs/jp/moderu/deepseek-v4.md#usage-guide" class="button primary">使用ガイド</a><a href="/docs/jp/moderu/deepseek-v4.md#run-deepseek-v4-flash-tutorials" class="button primary">実行チュートリアル</a>

### 📊 量子化分析

当社の `UD-Q8_K_XL` 量子化モデルは完全にロスレスです。DeepSeek-V4-Flashは [量子化対応トレーニング済み](/docs/jp/burogu/quantization-aware-training-qat.md)です。公式チェックポイントでは、ルーティングされたエキスパート（モデルの96%）がネイティブでMXFP4に、それ以外はFP8またはBF16で保存されています。GGUFのMXFP4はまさにその形式であるため、エキスパートをビット単位でそのまま再パックし、FP8は丸めなしでBF16に逆量子化されます。すべてのテンソルを公式DeepSeekウェイトと照合した結果、全1,328個がビット単位で同一でした。また推論時もロスレスを維持します（KLダイバージェンスは約0、トップトークン一致率100%）。

**非**-Unsloth のDeepSeek-V4-Flash GGUFは、これらの経路なしで変換されているため、公式ウェイトから乖離しています。 `UD-Q4_K_XL` は、同じビット完全一致のエキスパートを維持し、非エキスパートテンソル（モデルの4%）のみをQ8\_0に量子化するため、サイズと品質の両方でQ8に非常に近い位置にあります。

<div align="left"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FXjXSVsiH2ZIKlJ7iZPDx%2Fkldddd.webp?alt=media&amp;token=e1db5fca-b2b4-411e-8956-29127ef6bfe0" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHoYuIu6dNNuLrM4nmdbi%2Fpareto.png?alt=media&amp;token=1c7a44bb-13c3-4fc4-8d57-fb350ffe3c14" alt="" width="563"><figcaption></figcaption></figure></div>

公式ウェイトとの比較では、両方のUnsloth量子化モデルが品質とサイズの最前線に位置しています。UD-Q8\_K\_XLは唯一のロスレスな選択肢です。UD-Q4\_K\_XLは他のコミュニティ製MXFP4形式に匹敵し、より大きいにもかかわらず0.029 KLDとなるQ4\_Kエキスパート変換よりも高精度です。

<div align="left"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FxW5lIQID1dIRlVajHSWm%2Fper_layer.png?alt=media&amp;token=94dd4abc-e7ef-4aa8-8d2f-de8c98a69166" alt="" width="563"><figcaption></figcaption></figure></div>

レイヤー別の誤差内訳がその理由を示しています。ネイティブMXFP4エキスパートを維持することで、すべてのレイヤーでウェイト誤差は0%になります。エキスパートをQ4\_KまたはIQ2\_XXSに再量子化する変換では、ほぼすべてのウェイトが丸められます。Q4\_Kでは5%、IQ2\_XXSでは30%超です。

<div align="left"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FINDS7DqyP9TUAs4Bj9rS%2Fwhy_lossless.png?alt=media&amp;token=efdb261b-f969-42b8-89ec-bc25e8bbdaf3" alt="" width="563"><figcaption><p>当社のMXFP4は全840万ウェイトで誤差が完全にゼロですが、異なる4ビットグリッドであるQ4_Kでは各ウェイトを丸める必要があります（RMSE 5.2%）。</p></figcaption></figure></div>

一部のテンソルにQ8\_0とF16を使用してもロスレスではないことが判明しました。さらに、DeepSeekがMXFP4 / FP8を適切に機能させるためにQATを適用しているため、精度低下はより悪化します。そのため、それらはBF16のまま直接維持する必要がありました。真にロスレスな量子化にはUD-Q8\_K\_XLを使用し、UD-Q4\_K\_XLはBF16項目の一部をQ8\_0にダウンキャストします。

以下の完全なベンチマーク表については、 [GGUFベンチマークはこちらをご覧ください](#gguf-benchmarks).

### :speech\_balloon: DeepSeek V4チャットテンプレートの改善

DeepSeek-V4チャットJinjaテンプレートも改善し、4,000件を超える会話でゴールデンベースライン（公式DS4）と同等であることを検証しました。

追加したのは `reasoning_effort` で、以下を選択できます： `max、high` 。公式DeepSeek-V4と同様です。DS4に従って正しいシステムプロンプトを先頭に追加し、gpt-ossのスタイルに従いました。

ツール呼び出しについては、 `reasoning_content` はDS4用に保持されていましたが、Jinjaチャットテンプレートでは除外されていました。これを復元しました。

#### **思考の無効化、推論努力度の変更**

DeepSeek-V4はデフォルトで推論を使用します。また、推論努力度にも対応しており、 `reasoning_effort` は「high」、「max」、または無効にできます。

思考を無効にするには、以下を使用します： `--chat-template-kwargs '{"enable_thinking":false}'`。 **Windows**  PowerShellの場合は、以下を使用します： `--chat-template-kwargs "{\"enable_thinking\":false}"`

以下も使用できます： `--reasoning on` または `--reasoning off` 。llama.cppでも現在利用できます！

推論努力度のカスタマイズ、または推論を無効化するには、以下の例を使用してください：

```bash
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
```

### ⚙️ 使用ガイド

DeepSeek-V4-FlashはDeepSeek-V4-Proより小さく高速で、 **284B** パラメータ（13Bがアクティブ）と、 **100万トークンのコンテキストウィンドウ**を備えています。モデルには3つのモードがあります： **非思考**, **思考** **高** および **思考** **最大**.&#x20;

使用を推奨します： `UD-IQ3_XXS` これは **103GB** であり、最良の結果を得るためのものです。ファイルサイズにはKVキャッシュやコンテキスト割り当てが含まれないため、少なくとも **110GBのRAM** を確保してモデルを実行してください。

この `UD-Q8_K_XL` 量子化モデルは、完全な元の精度のDeepSeek-V4-Flashです。サイズは162GBで、少なくとも169GBの利用可能なRAM/VRAMを確保することが推奨されます。

**表：推論ハードウェア要件** （単位＝合計メモリ：RAM + VRAM、またはユニファイドメモリ）

<table><thead><tr><th>形式</th><th width="129.8004150390625">1ビット</th><th width="130.85650634765625">2ビット</th><th width="140.26702880859375">3ビット</th><th>4ビット（ほぼロスレス）</th><th>Q8_K_XL（ロスレス）</th></tr></thead><tbody><tr><td>標準</td><td>92 GB</td><td>102 GB</td><td>110～135 GB</td><td>162 GB</td><td>169 GB</td></tr><tr><td>DSpark</td><td>102 GB</td><td>112 GB</td><td>120～145 GB</td><td>172 GB</td><td>179 GB</td></tr></tbody></table>

{% hint style="info" %}
**DSparkは標準よりも多くのVRAMを使用する**ため、 **約10 GB** の追加RAM/VRAM余裕を見込んでください。
{% endhint %}

{% hint style="success" %}
最良のパフォーマンスを得るため、VRAMとシステムRAMを含む利用可能な総メモリが、量子化モデルファイルのサイズを十分な余裕をもって上回るようにしてください。
{% endhint %}

### 推奨設定

DeepSeekは最高のパフォーマンスのために以下のパラメータを推奨しています： `temperature = 1.0`, `top-p = 1.0`。 **DeepSeek-V4-Flash-0731** およびエージェント型シナリオでは、 `top-p = 0.95` を代わりに推奨し、 `top-p = 1.0` は他のタスク向けです。

**Think Highはデフォルトで有効です。** 無効になっている場合は、以下で有効にできます： `--chat-template-kwargs '{"enable_thinking":true}'` または、 [Unsloth](#unsloth-studio-guide)のUIドロップダウンから切り替えることができます。以下もご覧ください： [#deepseek-v4-chat-template-improvements](#deepseek-v4-chat-template-improvements "mention")

{% columns %}
{% column width="50%" %}

| DeepSeek-V4-Flash-0731     |
| -------------------------- |
| `temperature = 1.0`        |
| `top-p = 1.0`              |
| `top-p = 0.95` （エージェント型のみ） |
| {% endcolumn %}            |

{% column width="50%" %}

| 旧DeepSeek-V4-FlashおよびV4-Pro |
| --------------------------- |
| `temperature = 1.0`         |
| `top-p = 1.0`               |
| {% endcolumn %}             |
| {% endcolumns %}            |

* **最大コンテキストウィンドウ：** `1,048,576`
* Think Maxでは、コンテキストを少なくとも **384Kトークン**.

## DeepSeek-V4-Flash実行チュートリアル：

このチュートリアルでは3ビット量子化モデルを使用します `UD-IQ3_XXS`。これは128GB RAMのデバイスに収まります。 `UD-IQ3_XXS` を `UD-Q8_K_XL` （元の品質）または、お使いのマシンに十分なメモリがある場合は別の量子化モデルに置き換えてください。これでDeepSeek-V4-Flash-0731を [Unsloth Desktop](#run-in-unsloth-studio) . **で実行できます。DSparkは** [**Unsloth**](#unsloth-studio-guide)**.**

<a href="/docs/jp/moderu/deepseek-v4.md#unsloth-studio-guide" class="button primary">🦥 Unslothガイド</a><a href="/pages/7e26e08ac7ef8f627a7df931c96d2f819be44cd4#llama.cpp-guide" class="button primary">🦙 Llama.cppガイド</a><a href="/docs/jp/moderu/deepseek-v4.md#dspark-speculative-decoding" class="button secondary">⚡DSparkガイド</a>

### 🦥 Unslothガイド

DeepSeek-V4-Flash-0731は、ローカルAI向けの新しいオープンソースUIである [Unsloth](/docs/jp/xin-zhe/studio.md)で実行およびトレーニングできるようになりました。Unsloth Desktopでは、ローカルでモデルを **MacOS**, **Windows**、Linux、および以下で実行できます：

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUFの実行](/docs/jp/xin-zhe/studio.md#run-models-locally) およびsafetensorモデル
* [**自己修復型の** ツール呼び出し](/docs/jp/xin-zhe/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/xin-zhe/studio.md#run-models-locally) （Python、Bash）
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータチューニング（temp、top-pなど）
* llama.cppによる高速なCPU + GPU推論
* [LLMのトレーニング](/docs/jp/xin-zhe/studio.md#no-code-training) VRAM使用量を70%削減して2倍高速
  {% endcolumn %}

{% column %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FCwcXvmLERJSUNF6iNTiY%2Fdeepseek-v4-flash-0731-unsloth-studio.png?alt=media&amp;token=6fdc0216-d21e-42e7-bb57-8e1abf6e7f4f" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをインストール

最も簡単な始め方は、 [Unsloth Desktopアプリ](/docs/jp/desktop.md)をダウンロードすることです。対応OS： [macOS](/docs/jp/meru/install/mac.md), [Windows](/docs/jp/meru/install/windows-installation.md)、および [Linux](/docs/jp/meru/install/linux.md).

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unslothをダウンロード</a>

* <i class="fa-apple">:apple:</i> [macOS向けダウンロード](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Windows向けダウンロード](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Linux向けダウンロード](https://unsloth.ai/download/linux)

または、手動インストールをご希望の場合：

MacOS、Linux、WSL：

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell：

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### DeepSeek-V4-Flashを検索してダウンロード

以下に移動します： [Unsloth Chat](/docs/jp/xin-zhe/studio/chat.md) またはModel hubで、検索バーからDeepSeek-V4-Flashを検索し、希望するモデルと量子化モデルをダウンロードしてください。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FGEc90VxPAgTHulQe9zB0%2FScreenshot%202026-07-31%20at%208.01.35%E2%80%AFAM.png?alt=media&amp;token=2931411d-8f75-4bfe-918a-73fcafe918f9" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### DeepSeek-V4-Flash-0731を実行

Unslothを使用する場合、推論パラメータは自動設定されるはずですが、手動で変更することもできます。 **Think Highはデフォルトで有効**なので、右側のドロップダウンから非思考またはThink Maxに切り替えられます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。 **で実行できます。DSparkは** [**Unsloth**](#unsloth-studio-guide)**.**

詳細については、当社の [Unsloth推論ガイド](/docs/jp/xin-zhe/studio/chat.md).

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FlvJqDRKlWdAVkn3HXJZA%2F1000024247.png?alt=media&amp;token=e84fd31d-7720-40d5-aba1-ba65ac34ce97" alt=""><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Unsloth APIでDeepSeek-V4を提供

以下を使用できます： `unsloth run` コマンドを使用し、 `llama-server` のランタイムフラグを用いてAPI経由でDeepSeekを提供できます。コンテキストサイズ、GPUレイヤー、スレッド、サンプリング、ネットワーク、ツール設定などを含みます。詳細は当社の [APIドキュメント](/docs/jp/ji-ben/api.md) または [unsloth start](/docs/jp/lian-xie/unsloth-start.md).

```bash
unsloth run --model unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S
```

{% endstep %}

{% step %}

#### Unslothの準備ができました

Unsloth Desktopを使えば、DeepSeekで次のようなさまざまなこともできます：

* **ツールを接続：** [Claude Code](/docs/jp/ji-ben/claude-code.md), [Codex](/docs/jp/ji-ben/codex.md), [ウェブ検索](/docs/jp/xin-zhe/studio/chat.md#advanced-web-search), [MCP](/docs/jp/ji-ben/mcp.md) など
* **モデルをトレーニング：** テキスト、拡散モデル、 [埋め込み](/docs/jp/ji-ben/embedding-finetuning.md)などをファインチューニング
* **メディアを生成：** 作成およびトレーニング [画像](/docs/jp/ji-ben/diffusion-image.md)、動画、 [TTS](/docs/jp/ji-ben/text-to-speech-tts-fine-tuning.md) をローカルで
  {% endstep %}
  {% endstepper %}

### 🦙 Llama.cppガイド

{% stepper %}
{% step %}
最新の `llama.cpp` **を** [**GitHubでこちらから取得**](https://github.com/ggml-org/llama.cpp)できます。以下のビルド手順にも従えます。 `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` に変更してください。GPUがない場合、またはCPU推論のみを行いたい場合に使用します。 **Apple Mac / Metalデバイスの場合**は、以下を設定し、 `-DGGML_CUDA=OFF` その後は通常どおり続行してください。Metalサポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
これで、以下を使用できます： `llama.cpp` を直接使用してモデルを読み込み・ダウンロードできます。 `ollama run`と同様です。まず、次のように希望する量子化タイプを選択します： `IQ3_XXS`。また、 `export LLAMA_CACHE="folder"` を使用して、 `llama.cpp` を特定の場所に保存するよう強制します。このダウンロード処理は非常に遅くなる可能性があるため、次のセクションの手動ダウンロード手順を使用する方がよいでしょう。

```bash
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
    -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01
```

{% endstep %}

{% step %}
モデルを手動でダウンロードしたい場合は、以下のコードでモデルをダウンロードできます（ `pip install huggingface_hub`をインストールした後）。ダウンロードが停止する場合は、以下を参照してください： [Hugging Face Hub、XET のデバッグ](/docs/jp/ji-ben/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --include "*UD-IQ3_S*" # 4ビットには"*UD-IQ4_XS*"を使用
```

{% endstep %}

{% step %}
以下を編集できます： `--threads 32` ：CPUスレッド数用、 `--ctx-size 32768` ：コンテキスト長用、 `--n-gpu-layers 2` ：GPUにオフロードするレイヤー数用です。GPUのメモリが不足する場合は調整してみてください。CPUのみの推論では削除してください。

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_S/DeepSeek-V4-Flash-0731-UD-IQ3_S-00001-of-00004.gguf \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01
```

{% endcode %}
{% endstep %}
{% endstepper %}

## :zap:DSpark - 推測デコーディング

DeepSeek-V4-Flash-0731にはネイティブDSparkがあり、最大 **2倍高速なデコード速度**を実現できます！ DSparkはDeepSeekによる新しいアルゴリズムで、単純なMTPより優れており、この [論文](https://arxiv.org/abs/2607.05147)で紹介されました。DSparkによりDeepSeek-V4-Flashは **120トークン/秒** に到達します。これはB200 GPU上で、元の60トークン/秒のベースラインと比較したものです。 **DSparkは、** [**Unsloth**](#unsloth-studio-guide) **ローカルUIで自動的に有効になります。**

Llama.cppはDSparkを [PR 25784](https://github.com/ggml-org/llama.cpp/pull/25784) の一部として統合し、マルチGPUなどをさらに改善しました。以下を使用することを示します： `--spec-draft-n-max 3` は良いデフォルトであり、推論速度を1.9倍に高速化できます。より大きな値は遅くなるようです。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FRV0T1cVPpCnacNnywAsL%2Fimage.png?alt=media&amp;token=b570026f-4577-4a45-936f-98a650d644ac" alt=""><figcaption></figcaption></figure>

ドラフターとGGUFの両方をダウンロードしてください。Q8\_0を2つと、ロスレスなBF16を1つ用意しました。DSparkでは約10GB多くメモリを使用するため、128GBのマシンではIQ3\_XXSとQ8\_0が必要です。

{% code overflow="wrap" %}

```bash
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
    --include "*dspark-DeepSeek-V4-Flash-0731-Q8_0*" \
    --include "*UD-IQ3_XXS*" # 4ビットには"*UD-IQ4_XS*"を使用
```

{% endcode %}

次に、llama-cliまたはllama-serverで読み込みます：

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \
    --model unsloth/DeepSeek-V4-Flash-0731-GGUF/UD-IQ3_XXS/DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf \
    -md unsloth/DeepSeek-V4-Flash-0731-GGUF/dspark-DeepSeek-V4-Flash-0731-Q8_0.gguf \
    --temp 1.0 \
    --top-p 1.0 \
    --min-p 0.01 \
    --spec-type draft-dspark \
    --spec-draft-n-max 3 \
    -ngl 99 -ngld 99
```

{% endcode %}

元のDSpark論文からのベンチマークと、MTPに対してどの程度の性能かも示しています:

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FNXmTkimQGD9JzAq4OtK9%2Fimage.png?alt=media&amp;token=bab3816c-e3cd-4bd8-a234-6226520f45f6" alt=""><figcaption></figcaption></figure>

## 📊 ベンチマーク

### GGUFベンチマーク

以下に、Unslothおよび他の提供元による量子化モデルのベンチマークを比較した表を示します。基準 = 公式重み。4x B200上で、ctx 512のwikitext-2に対するパープレキシティとKLダイバージェンス。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FXjXSVsiH2ZIKlJ7iZPDx%2Fkldddd.webp?alt=media&amp;token=e1db5fca-b2b4-411e-8956-29127ef6bfe0" alt="" width="563"><figcaption></figcaption></figure>

| 量子化                               | サイズ（GB） | PPL    | 平均KLD         | RMS delta-p | 同じトップトークン | ビット完全一致の重み   |
| --------------------------------- | ------- | ------ | ------------- | ----------- | --------- | ------------ |
| 公式（基準）                            | 156.4   | 4.5319 | 0             | 0%          | 100%      | 100%         |
| **Unsloth UD-Q8\_K\_XL**          | 161.9   | 4.5319 | **\~0（ロスレス）** | 0.000%      | 100.000%  | **100.000%** |
| **Unsloth UD-Q4\_K\_XL**          | 155.1   | 4.5335 | 0.0102        | 3.40%       | 96.28%    | 97.46%       |
| bartowski MXFP4                   | 156.0   | 4.5351 | 0.0105        | 3.42%       | 96.18%    | 97.57%       |
| antirez Q4KExperts-F16（imatrix）   | 164.6   | 4.5743 | 0.0291        | 5.87%       | 93.95%    | 0.51%        |
| antirez Q4KExperts-F16            | 164.6   | 4.5726 | 0.0290        | 5.89%       | 93.94%    | 0.93%        |
| antirez mixed L37-42-Q4K（imatrix） | 97.6    | 5.8169 | 0.3605        | 21.15%      | 79.74%    | 0.41%        |
| antirez IQ2XXS（imatrix）           | 86.7    | 6.0808 | 0.4079        | 22.23%      | 78.15%    | 0.39%        |
| antirez IQ2XXS                    | 86.7    | 6.1518 | 0.4207        | 22.74%      | 77.92%    | 0.47%        |

### 公式ベンチマーク

DeepSeek-V4-Flash-0731は、はるかに少ない有効化パラメータを使用しているにもかかわらず、以下のベンチマークでDeepSeek-V4-Pro（Preview）を上回り、主要なプロプライエタリモデルと競争力を保っています。

| ベンチマーク                 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Flash（Preview） | DeepSeek-V4-Pro（Preview） | GLM-5.2 | Opus-4.8 |
| ---------------------- | :--------------------: | :------------------------: | :----------------------: | :-----: | :------: |
| Terminal Bench 2.1     |          82.7          |            61.8            |           72.1           |   81.0  |   85.0   |
| NL2Repo                |          54.2          |            39.4            |           38.5           |   48.9  |   69.7   |
| Cybergym               |          76.7          |            38.7            |           52.7           |    -    |   83.1   |
| DeepSWE                |          54.4          |             7.3            |           12.8           |   46.2  |   58.0   |
| Toolathlon-Verified    |          70.3          |            49.7            |           55.9           |   59.9  |   76.2   |
| Agents' Last Exam      |          25.2          |            15.8            |           16.5           |   23.8  |   25.7   |
| AutomationBench Public |          25.1          |            10.8            |           12.8           |   12.9  |   27.2   |
| DSBench-FullStack †    |          68.7          |            37.0            |           41.8           |   61.8  |   71.6   |
| DSBench-Hard †         |          59.6          |            25.8            |           31.1           |   54.5  |   71.7   |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/moderu/deepseek-v4.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
