For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8-Flash-Next: ローカルでの実行方法

Qwen3.8-Flash-Nextをローカルで実行するガイド。

Qwen3.8-Flash-Nextは、新しいオープンウェイトの 125Bパラメータの QwenのMoEマルチモーダルモデルです。新しいQwen4アーキテクチャ上に構築されており、262Kのコンテキストウィンドウと高度な推論をサポートします。 Qwen3.8-Flash-NextはClaude-4.6-Opus(Max)を上回り、 75GBのRAM/共有メモリでGPU VRAMなしで動作できます。モデルを実行するには、次のものをご利用ください。 GGUF をllama.cpp経由で、または Unsloth Desktopを使用してください。初日アクセスを提供してくれたQwenに感謝します。

1-bitは75GB で、Ngram / PLEには4-bitを使用します。これは 79%小さく 、BF16(355GB)よりも小さく、 トップ1%精度80%.

Qwen3.8-Flashを実行Unslothをダウンロード

4-bitのQwen3.8-FlashがUnslothで実行中

⚙️ 使用ガイド

Qwen3.8-Flash-Nextを Qwen3.8-Flash-Next をCPU上のシステムRAMで動かしても、VRAMを持つGPU上で動かしても、差は比較的小さい場合があります。独自のアーキテクチャにより、RAMまたは共有メモリを使った推論が可能で、他のモデルより一般的なGPU VRAMに近い性能を実現できます。そのため、Mac、NVIDIA DGX Sparkシステム、その他大容量メモリを持つデバイスに特に適しています。

少なくとも 75GBのRAMまたは共有メモリ が必要です。最小の1-bit量子化版が通常より大きいのは、新しいNgram層、またはルックアップテーブルのような各層埋め込みがあるためです。ただし、これは量子化がそれほど強くないことも意味し、より強く量子化されたモデルよりも元の精度をより多く保持できます。PLE / Ngram層をSSDにオフロードし、mmapを使うことで、CPUおよびGPU VRAMの使用量をさらに減らすこともできます。

Qwen3.8-Flash-Nextの要件:

最小の量子化版は75GB RAMで動作するため、96GB RAM/共有メモリ搭載デバイスが最適です。 表: ハードウェア要件 (単位 = 合計メモリ: RAM + VRAM、または共有メモリ)

1-bit
2-bit
3-bit
4-bit
5-bit
8-bit
BF16

75 GB

79 GB

90 GB

96-114 GB

163 GB

200 GB

355 GB

もし MTP を使ってより高速な推論をしたいなら、1〜2GBの追加の空き容量を確保してください。

推奨設定

Qwen3.8-Flash-Nextは ハイブリッド思考 モデルで、思考モードと非思考モードで既定設定が異なります。Extra highは既定で有効なので、より短い思考トレースが必要な場合は、 思考の強さを調整:

パラメータ
思考モード
Instruct(非思考)モード

temperature

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • コンテキスト長 = 最大 262,144

  • 思考モード: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Instruct(または非思考)モード: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

💡 思考 + 思考の保持

Qwen3.8-Flash-Nextには 思考の保持 があり、前回の会話の思考トレースを残します。これにより使用トークン数は増えますが、会話の継続時に精度が向上する可能性があります。 Unsloth にはQwen3.8向けの「Think」と思考保持の切り替えがあります(右を参照):

Qwen3.8-Flash-Nextには reasoning_effortのサポートがあり、推論の深さを調整しコストを制御できます。これらの切り替えはUnslothで自動的に有効になります:

  • xhigh (既定): 徹底した分析を要する複雑なタスク向け

  • medium: 精度と速度のバランス

  • low: 速度とコストを最適化する効率的な推論

  • none

量子化分析

Qwen3.8-Flashの量子化版に対してKLDを実行し、ディスク使用量を79%削減しながらトップ1%精度を80%回復できることを示しました。新しいアーキテクチャはPLE / Ngramを使用しており、これらはランダムアクセスパターンを持つため、それほど強く量子化されていません(最小4-bit)。これらを強く量子化するとモデルが損なわれるためです。

quant
GB
トップ1 %
平均KLD
99.9% KLD

UD-IQ1_S

72.5

77.325

0.396070

7.2126

UD-IQ1_M

74.5

79.691

0.314739

6.1965

UD-Q2_K_XL

78.9

82.715

0.224607

4.9121

UD-IQ3_XXS

82.0

85.414

0.165120

4.0375

UD-Q3_K_XL

90.0

88.315

0.106504

3.0538

UD-IQ4_XS

93.7

89.554

0.083630

2.3677

UD-Q4_K_XL

111.3

92.255

0.046893

1.5468

UD-Q5_K_XL

158.3

93.680

0.030415

1.0036

UD-Q6_K_XL

169.2

94.089

0.027091

0.8416

Q8_0

188.2

94.122

0.026574

0.8118

Qwen3.8-Flash-Next実行ガイド

これでQwen3.8-Flash-NextをUnsloth Desktopとllama.cppで実行できるようになりました。量子化タイプは自由に変更できます。

Unsloth Desktopで実行llama.cppで実行MTPガイド

🦥 UnslothでQwen3.8-Flash-Nextを実行

Qwen3.8-Flash-Nextは現在 Unsloth Desktop、ローカルAI向けのオープンソースUIアプリです。 Unslothは自動的にRAMへオフロードし、マルチGPU構成を検出します。Unsloth Desktopを使えば、次の環境でモデルをローカル実行できます MacOS、Windows、Linuxと:

1

Unslothをインストール

始める最も簡単な方法は、 Unsloth Desktopアプリをダウンロードすることです。対応環境: macOS, の場合は、および Linux.

Unslothをダウンロード

または、手動でインストールしたい場合は:

MacOS、Linux、WSL:

Windows PowerShell:

2

Qwen3.8-Flash-Nextを検索してダウンロード

次へ移動 Unsloth Chat またはModel hubに行き、検索バーでQwen3.8-Flashを検索して、希望するモデルと量子化版をダウンロードします。

3

Qwen3.8-Flash-Nextを実行

MTPは自動的に有効になりますが、無効化できます。Unslothを使う場合、推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は、次のガイドをご覧ください。 Unsloth推論ガイド.

たとえば、397GBのQwen3.8(91%小型化)をUnsloth Desktopで使うと、思考モードの切り替え、インラインキャンバス、ウェブ検索、コード実行などを有効にできます。

4

Unsloth APIでQwen3.8-Flash-Nextを提供

次のものを使えます: unsloth run コマンドを使って、 llama-server コンテキストサイズ、GPUレイヤー、スレッド、サンプリング、ネットワーク、ツール設定などのランタイムフラグでQwen3.8をAPI経由で提供できます。詳細は APIドキュメント または unsloth start.

5

Unslothの準備ができました

Unsloth Desktopを通じてQwen3.8-Flash-Nextで、ほかにもさまざまなことができます。たとえば:

🦙 llama.cppでQwen3.8-Flash-Nextを実行

1

llama.cppの最新バージョンをインストールしてください。以下のビルド手順に従うこともできます。GPUがない場合、またはCPU推論だけにしたい場合は、 -DGGML_CUDA=ON-DGGML_CUDA=OFF に変更してください。 Apple Mac / Metalデバイスの場合、次を設定し -DGGML_CUDA=OFF そのまま通常どおり続けてください - Metalサポートはデフォルトで有効です。

2

モデルを実行するには、次のようにします:

3

次に実行します:

MTPガイド

Qwen3.8-Flashは 1.7倍高速な推論でMTP (Multi-Token Prediction)を使っても精度低下なしで実行できます!MTPにより、Qwen3.8-Flashは 170 tokens/s を1基のRTX 6000 PRO GPUで達成でき、100トークンのベースラインと比べて高速です。MTPは、1ステップごとに1トークンを生成する代わりに、モデルが先の複数トークンを一度に予測できるようにすることで推論を高速化し、特にGPUで効果的です。

Qwen3.8-FlashをMTPで実行するには、MTPは既定で有効です Unsloth Desktop 、または独自のllama.cpp PRを使用できます。

古いMacのようにメモリ帯域幅が低いデバイスでは、得られる効果は小さくなります。共有MTPモジュールも作成しました(embed_tokensを除外し、メインモデルと共有)ので、ディスク容量、RAM、VRAMの使用量を約1〜2GB節約できます。

MTPタイプ
通常のMTP
共有MTP
節約量

BF16

7.77 GB

5.23 GB

2.54 GB

Q8_0

4.14 GB

2.79 GB

1.35 GB

Q4_K_M

2.79 GB

1.91 GB

880 MB

3-bitのMTP量子化版は91GB RAMで動作するため、96GB RAM/共有メモリ搭載デバイスが最適です。 表: MTPハードウェア要件 (単位 = 合計メモリ: RAM + VRAM、または共有メモリ)

1-bit
2-bit
3-bit
4-bit
5-bit
8-bit
BF16

76 GB

80 GB

91 GB

97-115 GB

164 GB

200 GB

355 GB

MTP Qwen3.8-Flashを実行

Qwen3.8-FlashをMTP付きで実行するには、必要なのは Unsloth Desktopをインストールすること 、またはUnslothの最新版に更新してからモデルを再ダウンロードするか、MTPファイルをダウンロードすることだけです。llama.cppの手順は下を参照してください。

Unsloth Desktopは次で動作します macOS, の場合は、および Linux.

Unslothをダウンロード

Unsloth Desktopでは、draftトークン数の変更やMTPのカスタマイズもできます。右サイドバーの詳細設定を使い、「詳細設定」を有効にすると、MTP / Ngramのspeculative decoding、draftトークン数などを選択できます:

MTP Llama.cppガイド

次に共有MTPモジュールをダウンロードします:

そしてそれをllama-serverで使うには:

📊 ベンチマーク

GGUF量子化ベンチマークについては、上記の 量子化分析 または Dynamic V3.0記事をご覧ください。.

最終更新

役に立ちましたか?