> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/ji-ben/claude-code.md).

# Claude Code でローカル LLM を実行する方法

このステップごとのガイドでは、スクリーンショット付きで、オープンLLMとAPIをClaude Codeに完全ローカルで接続する方法を紹介します。Qwen3.6、DeepSeek、Gemmaのような任意のオープンモデルで実行できます。

{% columns %}
{% column width="58.333333333333336%" %}
このチュートリアルでは、以下のオープンモデルを使用します： [Gemma 4](/docs/jp/moderu/gemma-4.md) と [Qwen3.5](/docs/jp/moderu/qwen3.5.md) これは強力なエージェント向け＆コーディング向けモデルです（24GB RAM/ユニファイドメモリ搭載デバイスで動作します）。

推論には、次を使用します [Unsloth Desktop](https://github.com/unslothai/unsloth) と [`llama.cpp`](https://github.com/ggml-org/llama.cpp) これにより、macOS、Linux、WindowsでLLMを実行／提供できます。ほかのモデルを使っても構いません。モデルの量子化版には、Unslothを利用します [Dynamic GGUF](/docs/jp/ji-ben/dynamic-3.0-ggufs.md) 精度を維持しながら、任意の量子化LLMを実行するためのものです。
{% endcolumn %}

{% column width="41.666666666666664%" %}

<figure><img src="/files/c7759bdcfceef3f51b87d20f4c8b15da1a3a0ab1" alt=""><figcaption><p>Qwen3.5 をローカルで使用して動作する Claude Code。</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

<a href="/pages/ee610b22aa43d29d8415fd27eb7de15ba88f7385#claude-code-setup" class="button primary" data-icon="claude">Claude Codeのセットアップ</a><a href="/pages/ee610b22aa43d29d8415fd27eb7de15ba88f7385#quickstart-tutorials" class="button primary">📖 ローカルモデルのセットアップチュートリアル</a>

## <i class="fa-claude">:claude:</i> Claude Codeのセットアップ

ローカルLLMを設定する前に、Claude Codeをインストールする必要があります。Claude Codeはターミナルベースのコーディングエージェントで、コードベースを理解し、自然言語を使って複雑なGitワークフローを処理します。

{% tabs %}
{% tab title="macOS、Linux、WSL" %}

#### **Claude Codeをインストールします：**

Claude Codeをインストールするには、以下をターミナルに貼り付けてください：

```bash
curl -fsSL https://claude.ai/install.sh | bash
```

インストール後、プロジェクトフォルダに移動し、次を入力します `claude` の `シェル` で開始します。

```bash
cd ~/projects/my-project 
claude
```

{% endtab %}

{% tab title="Windows" %}

#### **Claude Codeをインストールします：**

次を入力してください `PowerShell` Claude Codeをインストールするには：

```powershell
irm https://claude.ai/install.ps1 | iex
```

インストール後、プロジェクトフォルダに移動し、次を入力します `claude` の `PowerShell` で開始します。

<pre class="language-powershell"><code class="lang-powershell"><strong>cd /path/to/your/project
</strong>claude
</code></pre>

<div data-with-frame="true"><figure><img src="/files/6446d4b7e2f6a4d22ac7d089f2f5ec725b1dd8ce" alt="" width="563"><figcaption></figcaption></figure></div>
{% endtab %}
{% endtabs %}

### :detective:Claude Codeで推論が90%遅くなる問題の修正

{% hint style="warning" %}
Claude Codeは最近、Claude Code Attributionヘッダーを先頭に追加するようになりました。これにより **KVキャッシュが無効化され、ローカルモデルでは推論が90%遅くなります**.
{% endhint %}

この attribution は、次の先頭に追加される1行です **システムプロンプトの先頭** (`x-anthropic-billing-header: cc_version=...; cch=...;`）その値はリクエストごとに変わるため、プロンプトの接頭辞全体が毎ターンKVキャッシュにヒットしません。

最も簡単な修正は、Claude Code起動時にインラインで無効化することです。編集するファイルはありません：

{% code overflow="wrap" %}

```bash
claude --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0","CLAUDE_CODE_ENABLE_TELEMETRY":"0"}}' --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% endcode %}

{% hint style="info" %}
最近のClaude Codeリリースでは次も有効です `export CLAUDE_CODE_ATTRIBUTION_HEADER=0`；古いビルドではシェル変数を無視していたため、 `--settings` 上記の形式（または下記の設定ファイル）が確実です。
{% endhint %}

永続化するには、次を追加します `CLAUDE_CODE_ATTRIBUTION_HEADER` を0に設定して、次の中に入れます `"env"` の中で `~/.claude/settings.json`。たとえば次を実行します `cat > ~/.claude/settings.json` その後、以下を追加します（貼り付けたらENTERを押してからCTRL+Dで保存します）。以前の `~/.claude/settings.json` ファイルがある場合は、単に `"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"` を"env"セクションに追加し、設定ファイルの他の部分はそのままにしてください。

<pre class="language-json"><code class="lang-json">{
  "promptSuggestionEnabled": false,
  "env": {
    "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    <a data-footnote-ref href="#user-content-fn-1">"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"</a>
  },
  "attribution": {
    "commit": "",
    "pr": ""
  },
  "plansDirectory" : "./plans",
  "prefersReducedMotion" : true,
  "terminalProgressBarEnabled" : false,
  "effortLevel" : "high"
}
</code></pre>

## 📖 クイックスタートチュートリアル

{% columns %}
{% column %}
始める前に、使用する特定のモデルのセットアップを完了する必要があります。ここでは [Unsloth](/docs/jp/shii/studio.md) （Web UI）とllama.cppを使用します。これらは、Mac、Linux、Windowsデバイス上でLLMを実行・提供するためのオープンソースフレームワークです。

Unslothには独自の自己修復 [ツール呼び出し](/docs/jp/shii/studio/chat.md#auto-healing-tool-calling) と [Web検索](/docs/jp/shii/studio/chat.md#code-execution) 機能もあります。右側に、Unslothに接続されたClaude Codeの例を示します：
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/77e863c5bd956050b90ee75739b6a07e63ef9f71" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

<a href="/pages/ee610b22aa43d29d8415fd27eb7de15ba88f7385#connect-claude-code" class="button primary" data-icon="claude">Claude Codeを接続</a><a href="/pages/ee610b22aa43d29d8415fd27eb7de15ba88f7385#unsloth-tutorial" class="button primary">🦥 Unslothチュートリアル</a><a href="https://unsloth.ai/docs/basics/claude-code#llama.cpp-tutorial" class="button primary"> llama.cppチュートリアル</a>

## 🦥 Unslothチュートリアル

このチュートリアルでは、 [Unsloth](https://github.com/unslothai/unsloth)を使って、UI経由でローカルモデルをClaude Codeに提供/接続します。UnslothはWindows、WSL、Linux、macOSで動作します。

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUF を実行](/docs/jp/shii/studio.md#run-models-locally) および safetensor モデル
* [**自己修復** ツール呼び出し](/docs/jp/shii/studio.md#execute-code--heal-tool-calling) + **Web検索**
* [**コード実行**](/docs/jp/shii/studio.md#run-models-locally) （Python、Bash）
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ選択（temp、top-pなど）
* llama.cppによる高速なCPU + GPU推論
* [LLM を学習](/docs/jp/shii/studio.md#no-code-training) VRAM を 70% 少なくして 2 倍高速

インストール手順は以下を参照してください：
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/c219df5fc541689071df02c2a6ac347cbb9a4847" alt=""><figcaption><p>Unslothで動作しているQwen3.6の2ビットの例です。</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをダウンロード

始める最も簡単な方法は、次のものをインストールすることです [Unsloth Desktop](/docs/jp/desktop.md) アプリです。対応環境は [macOS](/docs/jp/meru/install/mac.md)、Linux、 [Windows](/docs/jp/meru/install/windows-installation.md), [NVIDIA](/docs/jp/meru/install/pip-install.md), [AMD](/docs/jp/meru/install/amd.md)、Intel、およびCPU構成です。

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unslothをダウンロード</a>

* <i class="fa-apple">:apple:</i> [macOS版をダウンロード](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Windows版をダウンロード](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Linux版をダウンロード](https://unsloth.ai/download/linux)

あるいは、手動インストールを希望する場合:

**macOS、Linux、WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### インストール

1. Unslothインストーラを開き（`.dmg`, `.exe` ファイル）
2. MacではUnslothをアプリケーションにドラッグし、Windowsではセットアップを完了してください。
3. アプリを起動し、インストール完了を待ちます
   {% endstep %}

{% step %}

#### モデルを選択

上部の『モデルを選択』ドロップダウンまたは『Model hub』タブを開き、デバイスに合ったモデルと量子化を選んでダウンロードします。完了したら、すぐにチャットを開始できます。セットアップは不要です。

<figure><img src="/files/158354856e78d615be54ae9d6435c9ce561b7d4e" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Unslothの準備が整いました

チャットを始めるには、メッセージを入力してEnterを押します。

* **ツールを接続：** [Claude Code](/docs/jp/ji-ben/claude-code.md), [Codex](/docs/jp/ji-ben/codex.md)、ウェブ検索、 [MCP](/docs/jp/ji-ben/mcp.md) など
* **モデルを学習：** テキスト、拡散モデル、埋め込みなどをファインチューニング
* **メディアを生成：** 画像、動画、TTSをローカルで作成・学習

<figure><img src="/files/e80de67ed3ea23603ff90d3a5750d20c31d2e56d" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### モデル読み込み + APIガイド

{% stepper %}
{% step %}

#### モデルを選択

APIを使用する前に、 **モデルを選択** チャットページ左上のドロップダウンからモデルを読み込みます。

<figure><img src="/files/e29038cb1426e393aee3cb144c904bc7a9438f27" alt=""><figcaption></figcaption></figure>

このガイドでは、以下を使用します： `unsloth/gemma-4-26B-A4B-it-GGUF` 推奨の `UD-Q4_K_XL` 量子化を使用します。
{% endstep %}

{% step %}

#### モデルのテスト

クライアントを使用する前に、短いメッセージを送信します：

<div data-with-frame="true"><figure><img src="/files/6037fb7bcfd78472b5ddadc37e90255377de6580" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
これで、モデルが正しく読み込まれ、応答可能な状態であることを確認できます。
{% endhint %}
{% endstep %}

{% step %}

#### **Unsloth APIキー**

Unslothで **Settings → API** を開き、APIキーを表示または作成します。

<figure><img src="/files/ff7840d9317331aed891f8636717121d17346f61" alt=""><figcaption></figcaption></figure>

APIキーはパスワードのように扱い、スクリーンショットやリポジトリで公開しないでください。
{% endstep %}
{% endstepper %}

## ⚙️ Claude Codeを接続

Claude Code用のローカルLLMを設定したので、次にClaude Codeがあなたのツールで動作するよう構成します。簡単に接続するには次の方法があります `unsloth start` 以下の方法を使うか、 [手動で](#connect-manually).

### ⚡ 次を使ってClaude Codeを実行 `unsloth start`

モデルを指定してClaudeを直接起動するには、次を実行します：

```bash
unsloth start claude \\
    --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0 \
    --chat-template-kwargs '{"reasoning_effort":"medium"}'
```

Unslothが使用すべき正しいパラメータを自動で選択しますが、変更も可能です。

Unsloth Studioにモデルを読み込んだ状態で、プロジェクトフォルダを開いて次を実行します：

```bash
unsloth start claude
```

<figure><img src="/files/2d81e9d70856dd1806197b7b5b95e90f54e05f84" alt="Claude Code connected to a local model through Unsloth Studio"><figcaption><p>Unsloth Studioに読み込まれたモデルを使って実行中のClaude Code。</p></figcaption></figure>

この起動では、Unslothがローカルエンドポイント、APIキー、モデル、コンテキスト長を設定します。通常のClaude Code設定はそのままです。

Claude Codeはすでに通常のセッションストアに会話を保存しているため、 `--persist` は不要です。最新のセッションを続けるには：

```bash
unsloth start claude --continue
```

完全な `unsloth start` コマンドラインからモデルを読み込む方法、リモートUnslothサーバー、詳細オプションの参考資料です。

このガイドの残りでは、手動での `llama.cpp` 設定を扱います。

#### 🔌 手動で接続

手動で設定したい場合は、まず次の環境変数を設定してください。これらの変数はデフォルトではセッション間で保持されません。

{% tabs %}
{% tab title="macOS、Linux、WSL" %}
**設定：** ローカルAPI URLを設定します：

```bash
export ANTHROPIC_BASE_URL="http://localhost:8888"
```

Unsloth Studio → Settings → API からキーをコピーするか、次を付けて起動したときのコンソールから取得し、 `unsloth run`そこで次のように表示されるので、 `sk-unsloth-...`それを設定します。

{% code overflow="wrap" %}

```bash
export ANTHROPIC_AUTH_TOKEN="sk-unsloth-xxxxxxxxxxxx"
```

{% endcode %}

空の `ANTHROPIC_API_KEY` も設定して、Claude Codeがクラウドキーを要求しないようにします：

```bash
export ANTHROPIC_API_KEY=""
```

オプション：現在Unslothに読み込まれているモデル名をデフォルトとして使います。

```bash
export ANTHROPIC_MODEL="unsloth/gemma-4-26B-A4B-it-GGUF"
```

モデルIDは、次に表示されるものを `GET http://localhost:8888/v1/models` （次に渡すのと同じ文字列です `claude --model`).
{% endtab %}

{% tab title="Windows" %}
**設定：** PowerShellでローカルAPI URLを設定します：

```powershell
$env:ANTHROPIC_BASE_URL = "http://localhost:8888"
```

次からキーをコピーして **Unsloth Studio → Settings → API**、それを設定します：

```powershell
$env:ANTHROPIC_AUTH_TOKEN = "sk-unsloth-xxxxxxxxxxxx"
```

**オプション：** 現在Unslothに読み込まれているモデル名をデフォルトとして設定します。

```powershell
$env:ANTHROPIC_MODEL = "gemma-4-26B-A4B-it-GGUF"
```

{% hint style="info" %}
モデル名は、現在Unsloth Studioに読み込まれているモデルにしてください。
{% endhint %}
{% endtab %}
{% endtabs %}

### Claude Codeを起動

現在Unslothに読み込まれているモデルでClaude Codeを起動します。

使用するのは `gemma-4-26B-A4B-it-GGUF`ですが、Unsloth互換のモデルなら何でも使えます。

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% hint style="info" %}
ローカルモデルをさらに高速化したい場合は、次のオプションでも起動できます `--bare --exclude-dynamic-system-prompt-sections`。下記の「オプション：システムプロンプトを縮小」を参照してください。
{% endhint %}

Claude Codeが選択したモデルを開いて表示するはずです。

<figure><img src="/files/e9e413e7e368d9a71991359639c187c961c9df7e" alt=""><figcaption></figcaption></figure>

{% hint style="warning" %}
次を参照 [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") を先に確認し、KVキャッシュの無効化でオープンモデルが90%遅くなる問題を修正してください。
{% endhint %}

高品質なSFTデータセットを調査して順位付けするには、次のプロンプトを試してください：

{% code overflow="wrap" %}

```
project/でのみ作業してください。CLAUDE.mdを探さないでください—これがそれです。Hugging Faceで10個の実在するinstruction/chat/SFTデータセットを見つけるためにWeb検索を使い、調査しながら発見内容を簡潔に要約し、各データセットがSFTに関連する理由を説明してください。その後、rank、dataset name、creator、3〜5個の関連タグ、短い平易な英語での要約、そしてSFTに役立つ理由を含む、洗練されたMarkdownレポートとしてsft_report.mdを作成してください。巨大なメタデータのダンプ、貼り付けた生の説明、過剰に長いタグ一覧、関係のないデータセットは含めず、すべてを簡潔で読みやすくしてください。sft_report.mdに10件のきれいでよく書かれたデータセット項目が入ったらタスク完了です。最後は「Unslothでモデルのファインチューニングに成功しました！」で締めてください。
```

{% endcode %}

プロンプトを送信すると、エージェントがWebを検索し、結果を評価して、最終レポートを作成します。数分かかる場合があります。

ワークフローによっては、操作の承認や追加のプロンプトへの回答が必要になる場合があります。

<figure><img src="/files/005168c61b85a54d19b975aabb80d13cd9a2744c" alt="" width="563"><figcaption></figcaption></figure>

{% hint style="info" %}
ワークフローによっては、操作の承認や追加のフォローアッププロンプトへの回答が必要になる場合があります。
{% endhint %}

完了すると、生成された `sft_report.md` は次のような見た目になります。

<figure><img src="/files/e715b723832b82e56b869e98f3a9eb662a261dad" alt="" width="375"><figcaption></figcaption></figure>

{% hint style="warning" %}
もし次が表示されたら `APIに接続できません（ConnectionRefused）` と表示されたら、 `ANTHROPIC_BASE_URL` 経由で `unset ANTHROPIC_BASE_URL`

オープンモデルが90%遅いと感じたら、 [まずこちらを確認してください](#fixing-90-slower-inference-in-claude-code) KVキャッシュの無効化を修正するためです。
{% endhint %}

### オプション：システムプロンプトを縮小

Claude CodeはAnthropicのホスト型モデル向けに作られているため、デフォルトのシステムプロンプトは大きめです。ローカルモデルでは、起動時に2つのフラグを追加することで、応答を速くし、KVキャッシュの再利用を改善するためにこれを削減できます：

{% code overflow="wrap" %}

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF --bare --exclude-dynamic-system-prompt-sections
```

{% endcode %}

{% hint style="info" %}
`--bare` hooks、skills、plugins、MCPサーバー、CLAUDE.mdの自動検出をスキップし（ClaudeはBashとファイルの読み取り／編集は保持します）、 `--exclude-dynamic-system-prompt-sections` 各マシン固有のセクションをプロンプトの接頭辞から外します。どちらもプロンプトを短くし、KVキャッシュの再利用を改善するため、ローカルモデルが目に見えて高速になります。これらはオプションであり、上記の接続設定は変更しません。
{% endhint %}

### オプション：Unslothサーバーを調整

Claude CodeはUnslothで実行中のモデルを使います。起動時にサーバーの動作をカスタマイズできます。

```bash
# コーディングエージェント向けに提供：--disable-tools はエージェント自身のツールをそのまま通します
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF \
  --disable-tools \
  --reasoning off \
  -p 8888
```

{% hint style="warning" %}
次を使用: `--disable-tools` Claude Code（または外部のコーディングエージェント）を動かすときの設定です。デフォルトではUnsloth Studioが独自のサーバー側ツールを実行し、エージェントのツール呼び出しを吸収してしまうため、Claude Codeは回答してもファイルを編集しません。 `--disable-tools` パススルーに切り替わるため、Claude Code自身のWrite/Edit/Bashツールが使われます。
{% endhint %}

次を使用: `--reasoning off` で思考をオフにするか、 `--reasoning on` 推論対応モデルでオンにします。

```bash
# APIをローカルネットワークに公開
unsloth run \
  --model unsloth/gemma-4-26B-A4B-it-GGUF \
  -H 0.0.0.0 \
  -p 8888
```

これでサーバーは次で起動します `0.0.0.0:8888`。これにより、ローカルネットワーク上の他のデバイスが接続できます。

次を使用: `-p` サーバーが実行するポートを変更します。次を使用してください `-H 0.0.0.0` ネットワーク上のスマートフォン、ノートパソコン、その他のデバイスから接続したい場合は、これを使います。

より高度なランタイム設定については、メインの [APIチューニング](https://unsloth.ai/docs/basics/api#unsloth-run-command) セクションを参照してください。

## 🦙 Llama.cpp チュートリアル

始める前に、使用する特定のモデルのセットアップを完了する必要があります。ここでは `llama.cpp` これは、Mac、Linux、WindowsなどのデバイスでLLMを実行するためのオープンソースフレームワークです。Llama.cppには `llama-server` が含まれており、LLMを効率的に提供・デプロイできます。モデルはポート8001で提供され、すべてのエージェントツールは単一のOpenAI互換エンドポイントを通してルーティングされます。

#### Qwen3.5チュートリアル

使用するのは [Qwen3.5](/docs/jp/moderu/qwen3.5.md)-35B-A3Bと、速く正確なコーディング作業のための特定の設定です。十分なVRAMがなく、 **より賢い** モデルが欲しいなら、 **Qwen3.5-27B** は優れた選択です。ただし約2倍遅くなります。あるいは9B、4B、2Bなどの他のQwen3.5バリアントも使えます。

{% hint style="info" %}
次の条件ならQwen3.5-27Bを使ってください **より賢い** モデルが欲しい場合、またはVRAMが足りない場合です。ただし35B-A3Bより約2倍遅くなります。あるいは次を使うこともできます [**Qwen3-Coder-Next**](/docs/jp/moderu/qwen3-coder-next.md) これは、十分なVRAMがあれば非常に優れています。
{% endhint %}

{% stepper %}
{% step %}

#### llama.cpp をインストール

インストールする必要があります `llama.cpp` Claude Codeなどで使うローカルLLMをデプロイ／提供するためのものです。正しいGPUバインディングと最大性能を確保するため、公式のビルド手順に従います。次を変更してください `-DGGML_CUDA=ON` に `-DGGML_CUDA=OFF` に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合です。 **Apple Mac / Metal デバイスの場合**、 `-DGGML_CUDA=OFF` を設定し、その後は通常どおり続けてください。Metal サポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev git-all -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

<figure><img src="/files/ae5f3315e19104577ac3d697dc2e49532dde5331" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### モデルをローカルにダウンロードして使用

次の方法でモデルをダウンロードします `huggingface_hub` Python内で（次でインストールした後に `pip install huggingface_hub hf_transfer`）。次を使います： **UD-Q4\_K\_XL** サイズと精度のバランスが最適な量子化です。すべての Unsloth GGUF アップロードは、次の場所で見つけられます： [こちらのコレクション](/docs/jp/meru/unsloth-model-catalog.md)。ダウンロードが止まる場合は、次を参照してください： [Hugging Face Hub、XETデバッグ](/docs/jp/ji-ben/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Qwen3.5-35B-A3B-GGUF \\
    --local-dir unsloth/Qwen3.5-35B-A3B-GGUF \\
    --include "*UD-Q4_K_XL*" # 動的2bitには "*UD-Q2_K_XL*" を使用
```

<figure><img src="/files/870f74435ac5d7469d68de67de56a0e6bc274975" alt=""><figcaption></figcaption></figure>

{% hint style="success" %}
次を使いました： `unsloth/Qwen3.5-35B-A3B-GGUF` ですが、27Bのような別バリアントや、次のような他のモデルも使えます `unsloth/`[`Qwen3-Coder-Next`](/docs/jp/moderu/qwen3-coder-next.md)`-GGUF`.
{% endhint %}

<figure><img src="/files/95477a113efead8e33b2a3a879c8b9b96e17336a" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Llama-server を起動

エージェント向けワークロードでQwen3.5をデプロイするには、次を使います `llama-server`。次を適用します [Qwen推奨のサンプリングパラメータ](/docs/jp/moderu/qwen3.5.md#recommended-settings) 思考モード用： `temp 0.6`, `top_p 0.95` , `top-k 20`。思考モード以外や他のタスクでは、これらの数値は変わることに注意してください。

新しいターミナルでこのコマンドを実行してください（次を使うか `tmux` 、または新しいターミナルを開いてください）。以下は **24GB GPU（RTX 4090）にぴったり収まり（23GBを使用）** `--fit on` も自動でオフロードされますが、性能が悪い場合は次を減らしてください： `--ctx-size` .

{% hint style="info" %}
次を使いました： `--cache-type-k q8_0 --cache-type-v q8_0` VRAM使用量を減らすためのKVキャッシュ量子化用です。完全精度では、次を使用します `--cache-type-k bf16 --cache-type-v bf16` 。注：bf16 KVキャッシュは一部のマシンでやや遅い場合があります。
{% endhint %}

```bash
./llama.cpp/llama-server \
    --model unsloth/Qwen3.5-35B-A3B-GGUF/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf \\
    --alias "unsloth/Qwen3.5-35B-A3B" \\
    --temp 0.6 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.00 \\
    --port 8001 \
    --kv-unified \
    --cache-type-k q8_0 --cache-type-v q8_0
```

{% hint style="success" %}
Qwen3.5では思考を無効化することもでき、エージェント向けコーディング作業の性能向上につながります。llama.cppで思考を無効化するには、llama-serverコマンドに次を追加します：

`--chat-template-kwargs "{\"enable_thinking\": false}"`

<img src="/files/8b0978556a2ca166922fd17bdf1b4ad45910b87a" alt="" data-size="original">
{% endhint %}
{% endstep %}
{% endstepper %}

### llama-serverでClaude Codeを起動

{% hint style="success" %}
次を使いました： `unsloth/GLM-4.7-Flash-GGUF` 、しかし次のようなものなら何でも使えます： `unsloth/Qwen3.6-27B-GGUF`.
{% endhint %}

{% hint style="warning" %}
次を参照 [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") を先に確認し、KVキャッシュの無効化でオープンモデルが90%遅くなる問題を修正してください。
{% endhint %}

プロジェクトフォルダに移動し（`mkdir project ; cd project`）次を実行します：

```bash
claude --model unsloth/GLM-4.7-Flash
```

Qwen3.6-35B-A3Bを使うには、単に次のように変更します：

```bash
claude --model unsloth/Qwen3.6-35B-A3B
```

<div data-with-frame="true"><figure><img src="/files/31b7e88d00ab4d4f12cc3d5b3997ec89aa0af809" alt="" width="563"><figcaption></figcaption></figure></div>

Claude Codeが承認なしでコマンドを実行するように設定するには、次を実行します **（注意：これにより、Claude Codeは承認なしで好きなようにコードを実行・操作します！）**

{% code overflow="wrap" %}

```bash
claude --model unsloth/GLM-4.7-Flash --dangerously-skip-permissions
```

{% endcode %}

次のプロンプトを試して、簡単なUnslothファインチューニングをインストール・実行してください：

{% code overflow="wrap" %}

```
cwdのproject/でのみ作業してください。CLAUDE.mdを探さないでください—これがそれです。uvを使って仮想環境経由でUnslothをインストールしてください。可能なら `python -m venv unsloth_env` を使い、その後 `source unsloth_env/bin/activate` を実行してください。方法は https://unsloth.ai/docs/get-started/install/pip-install を見てください（取得して読んでください）。その後、https://github.com/unslothai/unsloth に記載の簡単なUnslothのファインチューニング実行を行ってください。使用できるGPUは1基です。
```

{% endcode %}

<div data-with-frame="true"><figure><img src="/files/429dfd4bc37e01e11079daca85db2100db70faa6" alt="" width="563"><figcaption></figcaption></figure></div>

少し待つと、Unslothがuv経由でvenvにインストールされ、読み込まれます：

<div data-with-frame="true"><figure><img src="/files/7bbabd596e0fbbfe8767284fb319e36f1d01bfc8" alt="" width="563"><figcaption></figcaption></figure></div>

そして最後に、Unslothでファインチューニングに成功したモデルが表示されます！

<div data-with-frame="true"><figure><img src="/files/06a9998ee498e38088efd6de5a8a0a6370befe0c" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="warning" %}
もし次が表示されたら `APIに接続できません（ConnectionRefused）` と表示されたら、 `ANTHROPIC_BASE_URL` 経由で `unset ANTHROPIC_BASE_URL`

オープンモデルが90%遅いと感じたら、 [まずこちらを確認してください](#fixing-90-slower-inference-in-claude-code) KVキャッシュの無効化を修正するためです。
{% endhint %}

[^1]: これは必ず使ってください！


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/ji-ben/claude-code.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
