Qwen3.8 - ローカルでの実行方法
Qwen3.8-27Bを含むQwen3.8の量子化モデルをローカル環境で実行するためのガイド。
Qwen3.8はQwenの新しいモデルファミリーで、Qwen3.8-27B、Qwen3.8-2.4T-A95B とQwen3.8-Max。Qwen3.8-27Bには 視覚 と推論機能、 256Kのコンテキスト ウィンドウがあり、 17GBのRAM/VRAM 構成でローカル実行できます。Qwen3.8はエージェント型コーディング、視覚、チャットのタスクに優れており、現在はUnsloth GGUF、NVFP4、 Unsloth Desktop経由でも実行できます。Qwen3.8-2.4T-A95Bは、2.4Tパラメータ(95Bアクティブ)のモデルで、GPT-5.6 Solに匹敵します。
8月19日更新: Qwen3.8-27BのGGUFは現在 Unsloth Dynamic V3.0 を使用し、同じサイズで10%高い精度を実現し、他を大きく上回ります。
⚙️ 使用ガイド
Qwen3.8-27Bの要件:
Qwen3.8-27B 4ビット量子化版は、RTX 5080や4090、24GB RAM搭載Macなどの16~19GB VRAMで動作します。 表: ハードウェア要件 (単位 = 総メモリ: RAM + VRAM、または統合メモリ)
7-8 GB
9-11 GB
12-14 GB
16-19 GB
23-26 GB
31 GB
56 GB
Qwen3.8-2.4T 要件:
397GB
508GB
657 GB
2.6 TB
4.9 TB
推奨設定
Qwen3.8-27B設定:
Qwen3.8-27Bは ハイブリッド思考 思考モードと非思考モードで既定設定が異なるモデルです。Extra highはデフォルトで有効なので、より短い思考トレースにしたい場合は 思考の労力を調整できます:
temperature
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
最大コンテキストウィンドウ:
262,144(YaRNにより1Mまで拡張可能)思考モード:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct(または非思考)モード:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
Qwen3.8-2.4T設定:
Qwen3.8-2.4Tは 思考専用で、Qwen3.8-Maxはハイブリッドです。
temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
presence_penalty = 0.0
コンテキスト長 = 最大
1,010,000temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
モデルが収まるなら、B200を使うと約20トークン/秒の生成、120トークン/秒超のスループットが得られます。目安はRAM+VRAMがおおよそ量子化サイズに等しいことです。そうでなくても動作しますが、ディスクへのオフロードのためかなり遅くなります。
💡 思考 + 思考の保持
Qwen3.8には 思考の保持 があり、前回の会話の思考トレースを残します。使用トークン数は増えますが、会話を継続する際の精度を高める可能性があります。 Unsloth にはQwen3.8向けの「Think」と「Preserved Thinking」の切り替えがあります(右を参照):

Qwen3.8-27Bは次をサポートしています: reasoning_effort。これは推論の深さを調整し、コストを制御するために使用できます。これらの切り替えはUnslothで自動的に有効になります:
xhigh(デフォルト): 綿密な分析を要する複雑なタスク向けmedium: 精度と速度のバランスlow: 速度とコストを重視した効率的な推論none
変更するには 思考 / 推論 の労力を unsloth run または llama-serverでは、次を使用します: --chat-template-kwargs '{"reasoning_effort":"medium"}'
もし Windows のPowerShellを使っているなら、次を使用します: --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
変更してください medium 希望する推論レベルに。
Qwen3.8実行ガイド
Qwen3.8は現在、llama.cppとUnsloth Desktopで実行できます。大規模なQwen3.8-2.Tモデルでは、397GBの IQ1_XXXS 量子化版(Q1_0と命名)を、アクセシビリティと精度の観点から最良の結果を得るために使用します。少なくとも450GBのRAMが必要です。量子化方式は自由に変更できます。
Hugging Face: Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
ModelScope: Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
2.4T-A95B: Qwen3.8-2.4T-A95B-GGUF
🦥 Unsloth DesktopでQwen3.8を実行
Qwen3.8は次で実行できます: Unsloth DesktopローカルAI向けのオープンソースUIアプリです。 UnslothはRAMへ自動的にオフロードし、マルチGPU構成を検出します。Unsloth Desktopを使えば、モデルをローカルで次の環境で実行できます: MacOS、Windows、Linux、さらに次を含みます:
検索、ダウンロード、 GGUFの実行、MLXおよびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
MLXとllama.cppによる高速CPU+GPU推論
LLMを学習 VRAMを70%削減し、2倍高速

Unslothをインストール
始める最も簡単な方法は、次をダウンロードすることです: Unsloth Desktopアプリ。次で動作します: macOS, Windows、そして Linux.
または、手動でインストールしたい場合は:
MacOS、Linux、WSL:
Windows PowerShell:
Qwen3.8を実行
Unslothを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細は次をご覧ください: Unsloth推論ガイド.
たとえば、397GBのQwen3.8(91%小型化)をUnsloth Desktopで使うと、思考モードの切り替え、インラインキャンバス、ウェブ検索、コード実行などを有効にでき、ほかにも多くのことができます。

Unsloth APIでQwen3.8を提供
次を使用できます: unsloth run コマンドを使って、次を用いてAPI経由でQwen3.8を提供します: llama-server ランタイムフラグには、コンテキストサイズ、GPUレイヤー、スレッディング、サンプリング、ネットワーク、ツール設定が含まれます。詳細は次をご覧ください: APIドキュメント または unsloth start.
Qwen3.8-2.4T-A95Bの新しい1ビットデータ型
llama.cppのIQ1_S(1重みあたり1.5625ビット)を、コードブックのエントリ数を減らすことで1.1875 bpwまで拡張しました。これは大規模モデルでうまく機能し、多くの精度を維持できることが分かりました。さらに、これらの新しいデータ型は、QATやQAD(量子化対応学習/蒸留)を必要としない後学習量子化(PTQ)にも適していることが分かりました。 Qwen3.8-2.4T-A95B-GGUF
命名上の問題のため、TQ2_0、TQ1_0、Q1_0を使用しました。そうしないとHFリポジトリに表示されません。
IQ1_S
IQ1_S
1.5625
2048
11
50 B
UD-IQ1_XS
TQ2_0
1.4375
1024
10
46 B
UD-IQ1_XXS
TQ1_0
1.3125
512
9
42 B
UD-IQ1_XXXS
Q1_0
1.1875
256
8
38 B
新しいデータ型についてはまだベンチマークを実行中ですが、他の大規模モデルでは QAT / QADなしでも良い結果が得られています:
IQ1_S
553.204
2.578876
0.564553
78.882
UD-IQ1_XS
513.583
2.931261
0.690161
75.726
UD-IQ1_XXS
473.961
3.540383
0.876007
71.284
UD-IQ1_XXXS
434.340
4.488796
1.109944
66.257
🦙 llama.cppでQwen3.8を実行
専用のIQ1_XXXSブランチを使用する必要があります こちら。以下のビルド手順に従うこともできます。変更する -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPUがない場合、またはCPU推論のみを使いたい場合。 Apple Mac / Metalデバイスでは、次を設定し -DGGML_CUDA=OFF 、あとは通常どおり進めてください。Metalサポートはデフォルトで有効です。
標準の IQ1_S およびほかの量子化版だけを実行したい場合は、通常どおりllama.cppをコンパイルします:
次をインストールした後、モデルを以下からダウンロードします: pip install huggingface_hub)。次を選択できます: Q1_0 用に IQ1_XXXS または次のような他の量子化版: Q8_0 。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XET デバッグ
Qwen3.8-27B:
Qwen3.8-2.4T:
一般的なUD-IQ1_Sを実行するには、次のようにします:
Qwen3.8-2.4T:
そして実行します:
⚡️NVFP4
Qwen3.6と同様に、私たちも新しい 動的NVFP4 Qwen3.8-27B量子化版で動作する 約1.5倍高速な BF16チェックポイントより、 より高い性能 と同等のファイルサイズです。Qwen3.8-27B NVFP4を実行 1.5倍高速 で 24GBのVRAM。 私たちはさらに追加しました FP8 KVキャッシュのキャリブレーション コンテキスト長を2倍に延長するために!NVFP4には、RTX 50X、DGX Spark(参照 Qwen3.8-27B)、B200、B300 GPUが必要です。古いGPUでは、私たちのGGUFはうまく動作します!NVFP4量子化版は vLLM 現時点ではのみです(SGLangはサポートされていません)。
1
89.8
133.7
1.49x
89.8
133.7
8
649.4
938.8
1.45x
81.2
117.3
32
1983.0
2787.0
1.41x
62.0
87.1
64
3048.5
4407.2
1.45x
47.6
68.9
以下には、Qwen3.6で実施した以前のベンチマークも示します。16bit活性化を使う他のNVFP4実装と、私たちのNVFP4活性化を比較しています:

すべてのベンチマークは1台のB200、128並列で実施しています。より高い並列度では35Bを17,561トークン/秒まで引き上げられます。
精度ベンチマークでは、Code、Chat、そして多くの分野でKLDとTop-1%一致率を実施しました。NVFP4はBF16に対して一貫して92%〜97%の精度回復を示します
zh
0.01628
93.55%
コード
0.02600
96.68%
refgen
0.03993
94.46%
チャット
0.05818
92.15%
ja / ko / ru / es
0.0124-0.0155
94-95%
Qwen 3.6の精度ベンチマークでは、FP8、BF16、NVIDIAのNVFP4、そして私たちのNVFP4sについてMMLU-Pro、AIME 2025、GPQAを実施し、より高速な量子化版がすべてで同様に動作することを示します:

詳細は、私たちの Dynamic NVFP4量子化ブログ.
NVFP4量子化版を実行するには、以下のQwen3.8-27Bを実行するコマンドを vLLM または SGLang:
vLLM:
vLLMを別のvenvにインストールするには:
では、27B版をサーブするには:
MTP / speculative decoding(デコードは高速化しますが、スループットはやや低下)を有効にするには、次を使用します:
Torchcodecの問題が出た場合は、以下を実行してからvllmを再起動してください。
SGLang:
SGLangを使用する場合は、必ず SGLangバージョン v0.5.19 そうしないと、lm_headをFP8に量子化しているため動作しません。
最新版をインストールした後のsglangでは:
その後、これをサーブできます:
MTPを有効にするには、次を使用します:
🤯量子化分析
NVFP4量子化版はBF16より1.5倍高速で、top-1%精度を92〜97%維持します。
私たちは使用しました Dynamic 3.0 GGUFs Qwen3.8-27Bを大幅に改善するために!
Qwen3.8-27BのUD-3で示したtop-1%精度プロット:

そしてQwen3.8の平均KLD:

📊 ベンチマーク
GGUF量子化ベンチマークについては、上記の 量子化分析 または Dynamic V3.0記事.
Qwen3.8-27B
表のベンチマークはさらに下をご覧ください:


テキスト性能
コーディング
エージェント型ターミナルコーディングTerminal Bench 2.1 (Terminus)
73.0
63.4
64.0
51.7
78.2
エージェント型コーディングSWE-bench Pro
61.7
53.5
57.6
51.2
53.4
リポジトリレベルのコード生成NL2Repo-Bench
42.3
36.2
41.1
--
47.6
エージェント型コーディングDeepSWE 1.1
42.2
13.3
14.2
--
--
ソフトウェア工学QwenSWEBench
79.0
49.3
59.2
--
63.8
エージェント
長期的なオフィスワークCoWorkBench
70.7
61.0
65.1
--
68.2
専門職タスクJobBench
33.4
21.8
27.6
--
--
最先端エージェントタスクAgents' Last Exam
Pass@120.4スコア42.9
Pass@110.6スコア27.3
Pass@113.2スコア33.6
--
--
一般
指示追従IFBench
79.5
69.1
79.1
77.0
62.5
科学的推論GPQA Diamond
89.2
87.8
90.3
83.5
91.3
学際的推論HLE
30.8
24.0
34.7
22.0
40.0
競技プログラミングLiveCodeBench v6
90.3
83.9
89.6
--
88.8
Qwen3.8-2.4T-A95B

最終更新
役に立ちましたか?




