For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8 - ローカルでの実行方法

Qwen3.8-27Bを含むQwen3.8の量子化モデルをローカル環境で実行するためのガイド。

Qwen3.8はQwenの新しいモデルファミリーで、Qwen3.8-27B、Qwen3.8-2.4T-A95B とQwen3.8-Max。Qwen3.8-27Bには 視覚 と推論機能、 256Kのコンテキスト ウィンドウがあり、 17GBのRAM/VRAM 構成でローカル実行できます。Qwen3.8はエージェント型コーディング、視覚、チャットのタスクに優れており、現在はUnsloth GGUF、NVFP4、 Unsloth Desktop経由でも実行できます。Qwen3.8-2.4T-A95Bは、2.4Tパラメータ(95Bアクティブ)のモデルで、GPT-5.6 Solに匹敵します。

8月19日更新: Qwen3.8-27BのGGUFは現在 Unsloth Dynamic V3.0 を使用し、同じサイズで10%高い精度を実現し、他を大きく上回ります。

Qwen3.8実行ガイドUnslothをダウンロード

初日アクセスを提供してくれたQwenに感謝します。Unslothの量子化版には次も含まれます:

  • Developer Roleのサポート Codexのようなエージェント型ツール向け

  • MTP有効 高速推論向け

  • ツール呼び出し: 入れ子のオブジェクトの解析を改善し、ツールの成功率を向上

フル精度のQwen3.8-2.4T-A95Bには4.9TBのストレージと1ビットの Unsloth Dynamic GGUFは 397GB(91%小さい)で、より大きいIQ1_Sは508GBを要します。

Unsloth DesktopでのDynamic 4-bit Qwen3.8-27B

Unslothの量子化版:

⚙️ 使用ガイド

Qwen3.8-27Bの要件:

Qwen3.8-27B 4ビット量子化版は、RTX 5080や4090、24GB RAM搭載Macなどの16~19GB VRAMで動作します。 表: ハードウェア要件 (単位 = 総メモリ: RAM + VRAM、または統合メモリ)

1ビット
2ビット
3ビット
4ビット
6ビット
8ビット
BF16

7-8 GB

9-11 GB

12-14 GB

16-19 GB

23-26 GB

31 GB

56 GB

使用したい場合は MTP をより高速な推論のために使うなら、1~2GBの追加余裕を確保してください。

Qwen3.8-2.4T 要件:

Dynamic 1ビット XXXS
Dynamic 1ビット Standard
Dynamic 2ビット
Q8_0
BF16(非損失)

397GB

508GB

657 GB

2.6 TB

4.9 TB

推奨設定

Qwen3.8-27B設定:

Qwen3.8-27Bは ハイブリッド思考 思考モードと非思考モードで既定設定が異なるモデルです。Extra highはデフォルトで有効なので、より短い思考トレースにしたい場合は 思考の労力を調整できます:

パラメータ
思考モード
Instruct(非思考)モード

temperature

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • 最大コンテキストウィンドウ: 262,144 (YaRNにより1Mまで拡張可能)

  • 思考モード: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Instruct(または非思考)モード: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

Qwen3.8-2.4T設定:

Qwen3.8-2.4Tは 思考専用で、Qwen3.8-Maxはハイブリッドです。

デフォルト

temperature = 1.0

top_p = 0.95

top_k = 20

min_p = 0.0

presence_penalty = 0.0

  • コンテキスト長 = 最大 1,010,000

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

モデルが収まるなら、B200を使うと約20トークン/秒の生成、120トークン/秒超のスループットが得られます。目安はRAM+VRAMがおおよそ量子化サイズに等しいことです。そうでなくても動作しますが、ディスクへのオフロードのためかなり遅くなります。

💡 思考 + 思考の保持

Qwen3.8には 思考の保持 があり、前回の会話の思考トレースを残します。使用トークン数は増えますが、会話を継続する際の精度を高める可能性があります。 Unsloth にはQwen3.8向けの「Think」と「Preserved Thinking」の切り替えがあります(右を参照):

Qwen3.8-27Bは次をサポートしています: reasoning_effort。これは推論の深さを調整し、コストを制御するために使用できます。これらの切り替えはUnslothで自動的に有効になります:

  • xhigh (デフォルト): 綿密な分析を要する複雑なタスク向け

  • medium: 精度と速度のバランス

  • low: 速度とコストを重視した効率的な推論

  • none

Qwen3.8実行ガイド

Qwen3.8は現在、llama.cppとUnsloth Desktopで実行できます。大規模なQwen3.8-2.Tモデルでは、397GBの IQ1_XXXS 量子化版(Q1_0と命名)を、アクセシビリティと精度の観点から最良の結果を得るために使用します。少なくとも450GBのRAMが必要です。量子化方式は自由に変更できます。

Unsloth Desktopで実行llama.cppで実行NVFP4ガイド

🦥 Unsloth DesktopでQwen3.8を実行

Qwen3.8は次で実行できます: Unsloth DesktopローカルAI向けのオープンソースUIアプリです。 UnslothはRAMへ自動的にオフロードし、マルチGPU構成を検出します。Unsloth Desktopを使えば、モデルをローカルで次の環境で実行できます: MacOS、Windows、Linux、さらに次を含みます:

1

Unslothをインストール

始める最も簡単な方法は、次をダウンロードすることです: Unsloth Desktopアプリ。次で動作します: macOS, Windows、そして Linux.

Unslothをダウンロード

または、手動でインストールしたい場合は:

MacOS、Linux、WSL:

Windows PowerShell:

2

Qwen3.8を検索してダウンロード

へ移動 Unsloth Chat またはModel hubで検索バーにQwen3.8を入力し、目的のモデルと量子化版をダウンロードします。

3

Qwen3.8を実行

Unslothを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細は次をご覧ください: Unsloth推論ガイド.

たとえば、397GBのQwen3.8(91%小型化)をUnsloth Desktopで使うと、思考モードの切り替え、インラインキャンバス、ウェブ検索、コード実行などを有効にでき、ほかにも多くのことができます。

Unsloth DesktopにおけるQwen3.8 2.4TのDynamic 1ビット 397GB、91%小型化GGUF
4

Unsloth APIでQwen3.8を提供

次を使用できます: unsloth run コマンドを使って、次を用いてAPI経由でQwen3.8を提供します: llama-server ランタイムフラグには、コンテキストサイズ、GPUレイヤー、スレッディング、サンプリング、ネットワーク、ツール設定が含まれます。詳細は次をご覧ください: APIドキュメント または unsloth start.

5

Unslothの準備ができました

Unsloth Desktopを通じて、Qwen3.8でほかにも多くのことができます。例えば:

Qwen3.8-2.4T-A95Bの新しい1ビットデータ型

llama.cppのIQ1_S(1重みあたり1.5625ビット)を、コードブックのエントリ数を減らすことで1.1875 bpwまで拡張しました。これは大規模モデルでうまく機能し、多くの精度を維持できることが分かりました。さらに、これらの新しいデータ型は、QATやQAD(量子化対応学習/蒸留)を必要としない後学習量子化(PTQ)にも適していることが分かりました。 Qwen3.8-2.4T-A95B-GGUF

命名上の問題のため、TQ2_0、TQ1_0、Q1_0を使用しました。そうしないとHFリポジトリに表示されません。

Dtype
Naming
BPW
# entries
Index bits
Block

IQ1_S

IQ1_S

1.5625

2048

11

50 B

UD-IQ1_XS

TQ2_0

1.4375

1024

10

46 B

UD-IQ1_XXS

TQ1_0

1.3125

512

9

42 B

UD-IQ1_XXXS

Q1_0

1.1875

256

8

38 B

新しいデータ型についてはまだベンチマークを実行中ですが、他の大規模モデルでは QAT / QADなしでも良い結果が得られています:

Dtype
GiB
PPL
KLD
top-p

IQ1_S

553.204

2.578876

0.564553

78.882

UD-IQ1_XS

513.583

2.931261

0.690161

75.726

UD-IQ1_XXS

473.961

3.540383

0.876007

71.284

UD-IQ1_XXXS

434.340

4.488796

1.109944

66.257

🦙 llama.cppでQwen3.8を実行

1

専用のIQ1_XXXSブランチを使用する必要があります こちら。以下のビルド手順に従うこともできます。変更する -DGGML_CUDA=ON-DGGML_CUDA=OFF GPUがない場合、またはCPU推論のみを使いたい場合。 Apple Mac / Metalデバイスでは、次を設定し -DGGML_CUDA=OFF 、あとは通常どおり進めてください。Metalサポートはデフォルトで有効です。

2

標準の IQ1_S およびほかの量子化版だけを実行したい場合は、通常どおりllama.cppをコンパイルします:

3

次をインストールした後、モデルを以下からダウンロードします: pip install huggingface_hub)。次を選択できます: Q1_0 用に IQ1_XXXS または次のような他の量子化版: Q8_0 。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XET デバッグ

Qwen3.8-27B:

Qwen3.8-2.4T:

4

llama-cliでモデルを実行するには、以下のコードスニペットに従ってください: 忘れずに 設定を変更 ユースケースに応じて。

Qwen3.8-27B:

Qwen3.8-2.4T:

5

一般的なUD-IQ1_Sを実行するには、次のようにします:

Qwen3.8-2.4T:

6

そして実行します:

⚡️NVFP4

Qwen3.6と同様に、私たちも新しい 動的NVFP4 Qwen3.8-27B量子化版で動作する 約1.5倍高速な BF16チェックポイントより、 より高い性能 と同等のファイルサイズです。Qwen3.8-27B NVFP4を実行 1.5倍高速 24GBのVRAM。 私たちはさらに追加しました FP8 KVキャッシュのキャリブレーション コンテキスト長を2倍に延長するために!NVFP4には、RTX 50X、DGX Spark(参照 Qwen3.8-27B)、B200、B300 GPUが必要です。古いGPUでは、私たちのGGUFはうまく動作します!NVFP4量子化版は vLLM 現時点ではのみです(SGLangはサポートされていません)。

バッチ
BF16総tok/s
NVFP4総tok/s
高速化
BF16ユーザーごと
NVFP4ユーザーごと

1

89.8

133.7

1.49x

89.8

133.7

8

649.4

938.8

1.45x

81.2

117.3

32

1983.0

2787.0

1.41x

62.0

87.1

64

3048.5

4407.2

1.45x

47.6

68.9

以下には、Qwen3.6で実施した以前のベンチマークも示します。16bit活性化を使う他のNVFP4実装と、私たちのNVFP4活性化を比較しています:

すべてのベンチマークは1台のB200、128並列で実施しています。より高い並列度では35Bを17,561トークン/秒まで引き上げられます。

精度ベンチマークでは、Code、Chat、そして多くの分野でKLDとTop-1%一致率を実施しました。NVFP4はBF16に対して一貫して92%〜97%の精度回復を示します

コーパス
KLD平均
top-1一致率

zh

0.01628

93.55%

コード

0.02600

96.68%

refgen

0.03993

94.46%

チャット

0.05818

92.15%

ja / ko / ru / es

0.0124-0.0155

94-95%

Qwen 3.6の精度ベンチマークでは、FP8、BF16、NVIDIAのNVFP4、そして私たちのNVFP4sについてMMLU-Pro、AIME 2025、GPQAを実施し、より高速な量子化版がすべてで同様に動作することを示します:

詳細は、私たちの Dynamic NVFP4量子化ブログ.

NVFP4量子化版を実行するには、以下のQwen3.8-27Bを実行するコマンドを vLLM または SGLang:

vLLM:

vLLMを別のvenvにインストールするには:

では、27B版をサーブするには:

MTP / speculative decoding(デコードは高速化しますが、スループットはやや低下)を有効にするには、次を使用します:

Torchcodecの問題が出た場合は、以下を実行してからvllmを再起動してください。

SGLang:

SGLangを使用する場合は、必ず SGLangバージョン v0.5.19 そうしないと、lm_headをFP8に量子化しているため動作しません。

vLLMには CompressedTensorsW8A8Fp8 これをサポートするカーネルがありますが、SGLang v0.5.19はFP8のlm_headを読み込めません。v0.5.19は現在動作します!

最新版をインストールした後のsglangでは:

その後、これをサーブできます:

MTPを有効にするには、次を使用します:

🤯量子化分析

NVFP4量子化版はBF16より1.5倍高速で、top-1%精度を92〜97%維持します。

私たちは使用しました Dynamic 3.0 GGUFs Qwen3.8-27Bを大幅に改善するために!

Qwen3.8-27BのUD-3で示したtop-1%精度プロット:

そしてQwen3.8の平均KLD:

📊 ベンチマーク

GGUF量子化ベンチマークについては、上記の 量子化分析 または Dynamic V3.0記事.

Qwen3.8-27B

表のベンチマークはさらに下をご覧ください:

テキスト性能

ベンチマーク
Qwen3.8-27B
Qwen3.6-27B
Qwen3.7-Plus
Muse Glimmer-30B
Opus4.6 Max

コーディング

エージェント型ターミナルコーディングTerminal Bench 2.1 (Terminus)

73.0

63.4

64.0

51.7

78.2

エージェント型コーディングSWE-bench Pro

61.7

53.5

57.6

51.2

53.4

リポジトリレベルのコード生成NL2Repo-Bench

42.3

36.2

41.1

--

47.6

エージェント型コーディングDeepSWE 1.1

42.2

13.3

14.2

--

--

ソフトウェア工学QwenSWEBench

79.0

49.3

59.2

--

63.8

エージェント

長期的なオフィスワークCoWorkBench

70.7

61.0

65.1

--

68.2

専門職タスクJobBench

33.4

21.8

27.6

--

--

最先端エージェントタスクAgents' Last Exam

Pass@120.4スコア42.9

Pass@110.6スコア27.3

Pass@113.2スコア33.6

--

--

一般

指示追従IFBench

79.5

69.1

79.1

77.0

62.5

科学的推論GPQA Diamond

89.2

87.8

90.3

83.5

91.3

学際的推論HLE

30.8

24.0

34.7

22.0

40.0

競技プログラミングLiveCodeBench v6

90.3

83.9

89.6

--

88.8

Qwen3.8-2.4T-A95B

最終更新

役に立ちましたか?