🌠Qwen3-Coder-Next: ローカルでの実行方法
Qwen3-Coder-Next を自分のデバイスでローカル実行するガイド!
Qwen は Qwen3-Coder-Next をリリースしました。80B の MoE モデル(有効パラメータ 3B)で、 256Kのコンテキスト 高速なエージェント型コーディングとローカル利用向けです。10〜20倍多い有効パラメータを持つモデルに匹敵する性能です。
動作には 46GB の RAM/VRAM/統合メモリ(8ビットでは85GB)が必要で、超高速なコード応答向けの非推論モードです。このモデルは、長期的な推論、複雑なツール使用、実行失敗からの復旧に優れています。
2月19日更新: llama.cpp がパースを修正したため、ツール呼び出しはこれまで以上に改善されているはずです。
NEW! 参照 量子化ベンチマーク 私たちの Dynamic GGUF 向けです!
2月4日: llama.cpp 計算を修正するバグを修正しました ベクトル化された key_gdiff。 これにより、以前のループや出力の問題が解消されます。GGUF を更新しました。どうか 再ダウンロードしてください と 更新 llama.cpp より良い出力のために。
Codex と Claude Code でモデルを実行する方法も学べます。 ファインチューニング、Qwen3-Next-Coder は Unsloth の bf16 LoRA で単一の B200 GPU に収まります。
Qwen3-Coder-Next Unsloth Dynamic GGUF 実行するには: unsloth/Qwen3-Coder-Next-GGUF
⚙️ 使用ガイド
46GB の RAM や統合メモリがありませんか?心配いりません。3ビットのようなより小さな量子化モデルを実行できます。モデルサイズは、計算資源の合計( ディスク容量 + RAM + VRAM ≥ 量子化サイズ)に等しいのが理想です。 量子化モデルがデバイスに完全に収まるなら、20トークン/秒以上を期待できます。収まらない場合でもオフロードで動作しますが、速度は遅くなります。
最適な性能を得るには、Qwen は次の設定を推奨しています:
Temperature = 1.0Top_P = 0.95Top_K = 40Min_P = 0.01(llama.cpp のデフォルトは 0.05 です)繰り返しペナルティ= 無効または 1.0
最大 262,144 コンテキストをネイティブでサポートしますが、次に設定できます 32,768 トークンにするとメモリ使用量を減らせます。
🖥️ Qwen3-Coder-Next を実行
ユースケースに応じて、異なる設定を使う必要があります。このガイドでは 4 ビットを使用しているため、約 46GB の RAM/統合メモリが必要です。最高の性能のため、少なくとも 3 ビット精度の使用を推奨します。
🦥 Unsloth Studioガイド
Qwen3-Coder-Next は次で実行およびファインチューニングできます: Unsloth Studioで実行およびファインチューニングできます。これはローカルAI向けの新しいオープンソースのWeb UIです。Unsloth Studio を使えば、モデルをローカルで MacOS、Windows、Linux、および次の機能:
検索、ダウンロード、 GGUFの実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cpp経由の高速CPU+GPU推論
LLMの学習 VRAMを70%削減しつつ2倍高速

Unslothをインストール
ターミナルで実行:
MacOS、Linux、WSL:
Windows PowerShell:
インストールはすぐ完了し、約1~2分かかります。
Unslothを起動
MacOS、Linux、WSL、およびWindows:
次に開く http://localhost:8888 をブラウザーで。
Qwen3-Coder-Next を検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。すると、モデル、データセット、基本設定を選ぶ簡単なセットアップウィザードが表示されます。いつでもスキップして、そのままチャットに進むことができます。
次に〜へ移動し Unsloth Chat タブを開いて Qwen3-Coder-Next を検索バーに入力し、希望するモデルと量子化版をダウンロードしてください。

Qwen3-Coder-Next を実行
Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、次を参照してください Unsloth Studio推論ガイド.

Llama.cpp チュートリアル(GGUF):
llama.cpp で実行する手順(ほとんどのデバイスに収まるよう4ビットを使用します):
最新の llama.cpp こちら GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
Hugging Face から直接取得できます。RAM/VRAM に収まるなら、コンテキストを 256K に増やすことができます。Using --fit on を使うと、コンテキスト長も自動で決定されます。
推奨パラメータを使用できます: temperature=1.0, top_p=0.95, top_k=40
(以下をインストールした後)モデルを次の方法でダウンロードしてください pip install huggingface_hubをインストールした後)。 UD-Q4_K_XL または他の量子化版。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETデバッグ
それでは、会話モードでモデルを実行します:
また、 コンテキストウィンドウ 必要に応じて、最大 262,144
🦙Llama-server の提供とデプロイ
本番環境に Qwen3-Coder-Next をデプロイするには、次を使用します llama-server tmux などで新しいターミナルを開きます。次に、次の方法でモデルをデプロイします:
その後、新しいターミナルで、次を行ってから pip install openai、モデルを実行できます:
次のように出力されます:
HTML を抽出して実行したところ、生成された Flappy Bird ゲームの例はうまく動作しました!

👾 OpenAI Codex と Claude Code
ローカルのコーディング・エージェント系ワークロードでモデルを実行するには、ガイドに従ってください。次を使用します: llama-server 先ほど設定したものを使い、モデル名を、以下で返される正確な ID に設定します GET /v1/models (その --alias 上の値、 unsloth/Qwen3-Coder-Next)。正しい Qwen3-Coder-Next のパラメータと使用手順に従ってください。
たとえば Claude Code の手順に従うと、次のように表示されます:

その後、たとえば次のように尋ねられます チェスの Python ゲームを作成してください :



次のエラーが表示されたら API エラー: 400 {"error":{"code":400,"message":"リクエスト(16582 トークン)が利用可能なコンテキストサイズ(16384 トークン)を超えています。コンテキストサイズを増やしてください","type":"exceed_context_size_error","n_prompt_tokens":16582,"n_ctx":16384}} つまり、コンテキスト長を増やすか、次を参照する必要があります Qwen3-Coder-Next

🎱 vLLM における FP8 Qwen3-Coder-Next
新しい FP8 Dynamic 量子化 を使って、プレミアムで高速な推論を行えます。まず nightly 版の vLLM をインストールします。次を変更します --extra-index-url https://wheels.vllm.ai/nightly/cu130 を、次で確認した CUDA バージョンに合わせて変更してください nvidia-smi - のみ cu129 と cu130 が現在サポートされています。
vLLM / SGLang を使用している場合は、スループットを25%以上向上できる FP8-Dynamic 量子化を試してください!参照 Qwen3-Coder-Next
次に配信します Unsloth のダイナミック FP8 版 のモデルです。さらに FP8 を有効にすると、次を追加することで KV キャッシュのメモリ使用量を 50% 削減できます: --kv-cache-dtype fp8 4 GPU で提供しましたが、1 GPU しかない場合は、次を使用してください CUDA_VISIBLE_DEVICES='0' そして次を設定します --tensor-parallel-size 1 またはこの引数を削除してください。以下を tmux 新しいターミナルで起動し、その後 CTRL+B+D を押してください。次を使用します tmux attach-session -t0 元に戻るには。
以下のようなものが表示されるはずです。参照 Qwen3-Coder-Next Qwen3-Coder-Next を OpenAI API と tool calling で実際に使う方法は、こちらを参照してください - これは vLLM と llama-server で動作します。

🔧Qwen3-Coder-Next でのツール呼び出し
新しいターミナルで、2つの数値を足す、Pythonコードを実行する、Linux関数を実行するなど、さまざまなツールを作成します:
その後、以下の関数を使用します(コピーして貼り付けて実行してください)。これにより関数呼び出しを自動的に解析し、任意のモデルに対して OpenAI エンドポイントを呼び出します:
以下では、さまざまなユースケースでツール呼び出しを実行する複数の方法を紹介します:
生成されたPythonコードを実行

任意のターミナル関数を実行
ファイルが作成されたことを確認できました。本当に作成されていました!

参照 Tool Calling Guide ツール呼び出しのさらなる例については。
📐ベンチマーク
GGUF量子化ベンチマーク
以下は、第三者の評価者によって実施された量子化ベンチマークです。


ベンチマークは、Aider Polyglotサーバー上で第三者の貢献者によって実行され、Aider PolyglotベンチマークにおけるUnsloth GGUF量子化(スコア対VRAM)を比較しています。特筆すべきは、3ビット UD-IQ3_XXS 量子化は BF16 性能にかなり近く、 3ビットは妥当な最小値として ほとんどのユースケースに適しています。
NVFP4 BF16参照をわずかに上回っており、これは試行回数の少なさによるサンプリングノイズかもしれません。しかし、全体的な傾向としては: 1ビット → 2ビット → 3ビット → 6ビット 着実に改善しており、このベンチマークがUnsloth GGUF間の有意な品質差を捉えていることを示唆しています。 非Unsloth FP8は両方よりも性能が悪いように見えます UD-IQ3_XXS と UD-Q6_K_XL、これは量子化パイプラインの違い、あるいはやはりサンプリング不足を反映している可能性があります。
Benjamin Marie(第三者)がベンチマークを実施 Qwen3-Coder-Next UnslothとQwenのGGUFを使って、ある 750プロンプトの混合スイートで (LiveCodeBench v6、MMLU Pro、GPQA、Math500)、両方を報告: 全体精度 と 相対誤差増加 (量子化モデルが元モデルよりどれだけ頻繁に誤りを起こすか)。
グラフは明らかに、UnslothのQ4_K_M量子化が標準のQ4_K_Mより優れていることを示しています。Q3_K_Mは予想どおりLive Code Bench v6では劣りますが、驚くべきことにHumanEvalでは標準のQ4_K_Mよりかなり良好です。 最も効率的に動作しているようで、少なくともQ4_K_Mを使うことを推奨します。
Qwen3-Coder-Nextベンチマーク
Qwen3-Coder-Nextは、その規模に対して最高性能のモデルであり、その性能は10~20倍多くのアクティブパラメータを持つモデルに匹敵します。
SWE-Bench Verified(SWE-Agent使用)
70.6
70.2
74.2
74.8
SWE-Bench Multilingual(SWE-Agent使用)
62.8
62.3
63.7
66.2
SWE-Bench Pro(SWE-Agent使用)
44.3
40.9
40.6
34.6
Terminal-Bench 2.0(Terminus-2 json使用)
36.2
39.3
37.1
32.6
Aider
66.2
69.9
52.1
61.0



最終更新
役に立ちましたか?

