Qwen3.8-Flash-Next: ローカルでの実行方法
Qwen3.8-Flash-Nextをローカルで実行するガイド。
Qwen3.8-Flash-Nextは、新しいオープンウェイトの 125Bパラメータの QwenのMoEマルチモーダルモデルです。新しいQwen4アーキテクチャ上に構築されており、262Kのコンテキストウィンドウと高度な推論をサポートします。 Qwen3.8-Flash-NextはClaude-4.6-Opus(Max)を上回り、 75GBのRAM/共有メモリでGPU VRAMなしで動作できます。モデルを実行するには、次のものをご利用ください。 GGUF をllama.cpp経由で、または Unsloth Desktopを使用してください。初日アクセスを提供してくれたQwenに感謝します。
1-bitは75GB で、Ngram / PLEには4-bitを使用します。これは 79%小さく 、BF16(355GB)よりも小さく、 トップ1%精度80%.
MTP が登場!Qwen3.8-Flashを Unsloth Desktop!

⚙️ 使用ガイド
Qwen3.8-Flash-Nextを Qwen3.8-Flash-Next をCPU上のシステムRAMで動かしても、VRAMを持つGPU上で動かしても、差は比較的小さい場合があります。独自のアーキテクチャにより、RAMまたは共有メモリを使った推論が可能で、他のモデルより一般的なGPU VRAMに近い性能を実現できます。そのため、Mac、NVIDIA DGX Sparkシステム、その他大容量メモリを持つデバイスに特に適しています。
少なくとも 75GBのRAMまたは共有メモリ が必要です。最小の1-bit量子化版が通常より大きいのは、新しいNgram層、またはルックアップテーブルのような各層埋め込みがあるためです。ただし、これは量子化がそれほど強くないことも意味し、より強く量子化されたモデルよりも元の精度をより多く保持できます。PLE / Ngram層をSSDにオフロードし、mmapを使うことで、CPUおよびGPU VRAMの使用量をさらに減らすこともできます。
Qwen3.8-Flash-Nextの要件:
最小の量子化版は75GB RAMで動作するため、96GB RAM/共有メモリ搭載デバイスが最適です。 表: ハードウェア要件 (単位 = 合計メモリ: RAM + VRAM、または共有メモリ)
75 GB
79 GB
90 GB
96-114 GB
163 GB
200 GB
355 GB
推奨設定
Qwen3.8-Flash-Nextは ハイブリッド思考 モデルで、思考モードと非思考モードで既定設定が異なります。Extra highは既定で有効なので、より短い思考トレースが必要な場合は、 思考の強さを調整:
temperature
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
コンテキスト長 = 最大
262,144思考モード:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct(または非思考)モード:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
💡 思考 + 思考の保持
Qwen3.8-Flash-Nextには 思考の保持 があり、前回の会話の思考トレースを残します。これにより使用トークン数は増えますが、会話の継続時に精度が向上する可能性があります。 Unsloth にはQwen3.8向けの「Think」と思考保持の切り替えがあります(右を参照):

Qwen3.8-Flash-Nextには reasoning_effortのサポートがあり、推論の深さを調整しコストを制御できます。これらの切り替えはUnslothで自動的に有効になります:
xhigh(既定): 徹底した分析を要する複雑なタスク向けmedium: 精度と速度のバランスlow: 速度とコストを最適化する効率的な推論none
変更するには 思考 / 推論 の強さを unsloth run または llama-serverで、次を使用します: --chat-template-kwargs '{"reasoning_effort":"medium"}'
Windows の場合は PowerShellで次を使用します: --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
を medium 希望の推論レベルに変更してください。
量子化分析
Qwen3.8-Flashの量子化版に対してKLDを実行し、ディスク使用量を79%削減しながらトップ1%精度を80%回復できることを示しました。新しいアーキテクチャはPLE / Ngramを使用しており、これらはランダムアクセスパターンを持つため、それほど強く量子化されていません(最小4-bit)。これらを強く量子化するとモデルが損なわれるためです。


UD-IQ1_S
72.5
77.325
0.396070
7.2126
UD-IQ1_M
74.5
79.691
0.314739
6.1965
UD-Q2_K_XL
78.9
82.715
0.224607
4.9121
UD-IQ3_XXS
82.0
85.414
0.165120
4.0375
UD-Q3_K_XL
90.0
88.315
0.106504
3.0538
UD-IQ4_XS
93.7
89.554
0.083630
2.3677
UD-Q4_K_XL
111.3
92.255
0.046893
1.5468
UD-Q5_K_XL
158.3
93.680
0.030415
1.0036
UD-Q6_K_XL
169.2
94.089
0.027091
0.8416
Q8_0
188.2
94.122
0.026574
0.8118
Qwen3.8-Flash-Next実行ガイド
これでQwen3.8-Flash-NextをUnsloth Desktopとllama.cppで実行できるようになりました。量子化タイプは自由に変更できます。
Hugging Face: Qwen3.8-Flash-Next-GGUF
ModelScope: Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Nextが、ローカルで実行可能になりました Unsloth Desktop!
🦥 UnslothでQwen3.8-Flash-Nextを実行
Qwen3.8-Flash-Nextは現在 Unsloth Desktop、ローカルAI向けのオープンソースUIアプリです。 Unslothは自動的にRAMへオフロードし、マルチGPU構成を検出します。Unsloth Desktopを使えば、次の環境でモデルをローカル実行できます MacOS、Windows、Linuxと:
検索、ダウンロード、 GGUFの実行、MLXおよびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
MLXとllama.cppによる高速なCPU + GPU推論
LLMを学習 VRAMを70%削減して2倍高速

Unslothをインストール
始める最も簡単な方法は、 Unsloth Desktopアプリをダウンロードすることです。対応環境: macOS, の場合は、および Linux.
または、手動でインストールしたい場合は:
MacOS、Linux、WSL:
Windows PowerShell:
Qwen3.8-Flash-Nextを検索してダウンロード
次へ移動 Unsloth Chat またはModel hubに行き、検索バーでQwen3.8-Flashを検索して、希望するモデルと量子化版をダウンロードします。

Qwen3.8-Flash-Nextを実行
MTPは自動的に有効になりますが、無効化できます。Unslothを使う場合、推論パラメータは自動設定されるはずですが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細は、次のガイドをご覧ください。 Unsloth推論ガイド.
たとえば、397GBのQwen3.8(91%小型化)をUnsloth Desktopで使うと、思考モードの切り替え、インラインキャンバス、ウェブ検索、コード実行などを有効にできます。

Unsloth APIでQwen3.8-Flash-Nextを提供
次のものを使えます: unsloth run コマンドを使って、 llama-server コンテキストサイズ、GPUレイヤー、スレッド、サンプリング、ネットワーク、ツール設定などのランタイムフラグでQwen3.8をAPI経由で提供できます。詳細は APIドキュメント または unsloth start.
Unslothの準備ができました
Unsloth Desktopを通じてQwen3.8-Flash-Nextで、ほかにもさまざまなことができます。たとえば:
ツールを接続: , , , など
モデルを学習: テキスト、拡散、 埋め込みをファインチューニング、その他
メディアを生成: 作成して学習 、動画、 をローカルで

🦙 llama.cppでQwen3.8-Flash-Nextを実行
llama.cppの最新バージョンをインストールしてください。以下のビルド手順に従うこともできます。GPUがない場合、またはCPU推論だけにしたい場合は、 -DGGML_CUDA=ON を -DGGML_CUDA=OFF に変更してください。 Apple Mac / Metalデバイスの場合、次を設定し -DGGML_CUDA=OFF そのまま通常どおり続けてください - Metalサポートはデフォルトで有効です。
モデルを実行するには、次のようにします:
次に実行します:
MTPガイド
Qwen3.8-Flashは 1.7倍高速な推論で 、 MTP (Multi-Token Prediction)を使っても精度低下なしで実行できます!MTPにより、Qwen3.8-Flashは 170 tokens/s を1基のRTX 6000 PRO GPUで達成でき、100トークンのベースラインと比べて高速です。MTPは、1ステップごとに1トークンを生成する代わりに、モデルが先の複数トークンを一度に予測できるようにすることで推論を高速化し、特にGPUで効果的です。
Qwen3.8-FlashをMTPで実行するには、MTPは既定で有効です Unsloth Desktop 、または独自のllama.cpp PRを使用できます。


古いMacのようにメモリ帯域幅が低いデバイスでは、得られる効果は小さくなります。共有MTPモジュールも作成しました(embed_tokensを除外し、メインモデルと共有)ので、ディスク容量、RAM、VRAMの使用量を約1〜2GB節約できます。
BF16
7.77 GB
5.23 GB
2.54 GB
Q8_0
4.14 GB
2.79 GB
1.35 GB
Q4_K_M
2.79 GB
1.91 GB
880 MB
3-bitのMTP量子化版は91GB RAMで動作するため、96GB RAM/共有メモリ搭載デバイスが最適です。 表: MTPハードウェア要件 (単位 = 合計メモリ: RAM + VRAM、または共有メモリ)
76 GB
80 GB
91 GB
97-115 GB
164 GB
200 GB
355 GB
MTP Qwen3.8-Flashを実行
Qwen3.8-FlashをMTP付きで実行するには、必要なのは Unsloth Desktopをインストールすること 、またはUnslothの最新版に更新してからモデルを再ダウンロードするか、MTPファイルをダウンロードすることだけです。llama.cppの手順は下を参照してください。

MTP Llama.cppガイド
次に共有MTPモジュールをダウンロードします:
そしてそれをllama-serverで使うには:
📊 ベンチマーク
GGUF量子化ベンチマークについては、上記の 量子化分析 または Dynamic V3.0記事をご覧ください。.


最終更新
役に立ちましたか?

