> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/ji-ben/claude-code.md).

# Claude Code でローカル LLM を実行する方法

ローカル端末で Claude Code とオープンモデルを使うためのガイド。

このステップバイステップガイドでは、スクリーンショット付きで、オープンLLMとAPIをClaude Codeに完全にローカルで接続する方法を紹介します。Qwen3.6、DeepSeek、Gemmaなどの任意のオープンモデルで実行できます。

{% columns %}
{% column width="58.333333333333336%" %}
このチュートリアルでは、次のオープンモデルを使います: [Gemma 4](/docs/jp/moderu/gemma-4.md) と [Qwen3.5](/docs/jp/moderu/qwen3.5.md) これらは強力なエージェント系およびコーディング向けモデルです（24GB RAM/ユニファイドメモリ搭載デバイスで動作します）。

推論には、次を使用します [Unsloth Desktop](https://github.com/unslothai/unsloth) と [`llama.cpp`](https://github.com/ggml-org/llama.cpp) これは、macOS、Linux、Windows上でLLMを実行/提供できるようにします。他のモデルも使用できます。モデルの量子化には、Unslothを使用します [Dynamic GGUF](/docs/jp/ji-ben/dynamic-3.0-ggufs.md) 精度を保ちながら、量子化済みLLMを実行するためです。
{% endcolumn %}

{% column width="41.666666666666664%" %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FpXE6kCHjh8qOEaggf94M%2FScreenshot_20260718_122426.png?alt=media&amp;token=a59e4c8c-efdb-451b-b1f8-621955564f6d" alt=""><figcaption><p>Qwen3.5でローカル実行しているClaude Code。</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

<a href="/docs/jp/ji-ben/claude-code.md#claude-code-setup" class="button primary" data-icon="claude">Claude Codeのセットアップ</a><a href="/docs/jp/ji-ben/claude-code.md#quickstart-tutorials" class="button primary">📖 ローカルモデルのセットアップチュートリアル</a>

## <i class="fa-claude">:claude:</i> Claude Codeのセットアップ

ローカルLLMをセットアップする前に、Claude Codeをインストールする必要があります。Claude Codeは、コードベースを理解し、自然言語を使って複雑なGitワークフローを処理するターミナルベースのコーディングエージェントです。

{% tabs %}
{% tab title="macOS、Linux、WSL" %}

#### **Claude Codeをインストールする：**

Claude Codeをインストールするために、ターミナルに貼り付けてください：

```bash
curl -fsSL https://claude.ai/install.sh | bash
```

インストール後、プロジェクトフォルダに移動します。次に `claude` を `シェル` に入力して開始します。

```bash
cd ~/projects/my-project 
claude
```

{% endtab %}

{% tab title="Windows" %}

#### **Claude Codeをインストールする：**

次に入る `PowerShell` でClaude Codeをインストールします：

```powershell
irm https://claude.ai/install.ps1 | iex
```

インストール後、プロジェクトフォルダに移動します。次に `claude` を `powershell` に入力して開始します。

<pre class="language-powershell"><code class="lang-powershell"><strong>cd /path/to/your/project
</strong>claude
</code></pre>

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F49Pt77DNcx9d50uwiXWy%2Fimage.png?alt=media&amp;token=f1561255-861b-481d-9c75-824d5bf297a7" alt="" width="563"><figcaption></figcaption></figure></div>
{% endtab %}
{% endtabs %}

### :detective:Claude Codeにおける推論速度90%低下の修正

{% hint style="warning" %}
Claude Codeは最近、Claude Code Attributionヘッダーを前置・追加するようになりましたが、これが **KVキャッシュを無効化し、ローカルモデルでの推論を90%遅くします**.
{% endhint %}

この属性情報は、 **システムプロンプトの先頭** (`x-anthropic-billing-header: cc_version=...; cch=...;`）に行として前置され、その値はリクエストごとに変わるため、プロンプト接頭辞全体が毎回KVキャッシュにヒットしません。

最も簡単な修正は、Claude Codeを起動する際にインラインで無効化することです。編集するファイルはありません：

{% code overflow="wrap" %}

```bash
claude --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0","CLAUDE_CODE_ENABLE_TELEMETRY":"0"}}' --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% endcode %}

{% hint style="info" %}
最近のClaude Codeリリースでは、 `export CLAUDE_CODE_ATTRIBUTION_HEADER=0`も尊重されます。古いビルドではシェル変数が無視されるため、 `--settings` の形式（または下の設定ファイル）が確実です。
{% endhint %}

永続化するには、 `CLAUDE_CODE_ATTRIBUTION_HEADER` を0に設定して `"env"` を `~/.claude/settings.json`に追加します。たとえば次を実行します： `cat > ~/.claude/settings.json` その後、下記を追加します（貼り付けたらEnterを押してからCTRL+Dで保存します）。以前の `~/.claude/settings.json` ファイルがある場合は、 `"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"` を"env"セクションに追加し、設定ファイルの他の部分は変更しないでください。

<pre class="language-json"><code class="lang-json">{
  "promptSuggestionEnabled": false,
  "env": {
    "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    <a data-footnote-ref href="#user-content-fn-1">"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"</a>
  },
  "attribution": {
    "commit": "",
    "pr": ""
  },
  "plansDirectory" : "./plans",
  "prefersReducedMotion" : true,
  "terminalProgressBarEnabled" : false,
  "effortLevel" : "high"
}
</code></pre>

## 📖 クイックスタートチュートリアル

{% columns %}
{% column %}
始める前に、まず使用する特定のモデルのセットアップを完了する必要があります。私たちは [Unsloth](/docs/jp/xin-zhe/studio.md) （Web UI）と llama.cpp を使います。これらは、Mac、Linux、Windows デバイス上で LLM を実行・提供するためのオープンソースフレームワークです。

Unsloth には独自の自己修復機能もあります [ツール呼び出し](/docs/jp/xin-zhe/studio/chat.md#auto-healing-tool-calling) と [Web 検索](/docs/jp/xin-zhe/studio/chat.md#code-execution) 機能があります。右側は、Unsloth に接続された Claude Code の例です:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1s98Id9xclzwMfxjXw2O%2Funsloth%20api%20cropped.png?alt=media&amp;token=64fac263-ca5b-4447-a740-41f58ec94904" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

<a href="/docs/jp/ji-ben/claude-code.md#connect-claude-code" class="button primary" data-icon="claude">Claude Codeを接続する</a><a href="/docs/jp/ji-ben/claude-code.md#unsloth-tutorial" class="button primary">🦥 Unsloth チュートリアル</a><a href="https://unsloth.ai/docs/basics/claude-code#llama.cpp-tutorial" class="button primary"> llama.cppチュートリアル</a>

## 🦥 Unsloth チュートリアル

このチュートリアルでは、 [Unsloth](https://github.com/unslothai/unsloth)を使って、UI 経由でローカルモデルを Claude Code に提供・接続します。Unsloth は Windows、WSL、Linux、MacOS で動作します。

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUF を実行](/docs/jp/xin-zhe/studio.md#run-models-locally) および safetensor モデル
* [**自己修復** ツール呼び出し](/docs/jp/xin-zhe/studio.md#execute-code--heal-tool-calling) + **Web 検索**
* [**コード実行**](/docs/jp/xin-zhe/studio.md#run-models-locally) (Python、Bash)
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ選択（temp、top-pなど）
* llama.cpp による高速 CPU + GPU 推論
* [LLM を学習](/docs/jp/xin-zhe/studio.md#no-code-training) VRAM を70%削減し、2倍高速

以下にインストール手順を示します:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FY3nfB43TEk7k11zcE4wm%2Fthe%20big%20one.gif?alt=media&amp;token=335be087-7375-4f89-9039-71195ee44ab8" alt=""><figcaption><p>Unsloth 上で動作する Qwen3.6 2-bit の例。</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unslothをダウンロード

始める最も簡単な方法は、 [Unsloth Desktop](/docs/jp/desktop.md) アプリをインストールすることです。対応環境は [macOS](/docs/jp/meru/install/mac.md)、Linux、 [Windows](/docs/jp/meru/install/windows-installation.md), [NVIDIA](/docs/jp/meru/install/pip-install.md), [AMD](/docs/jp/meru/install/amd.md)、Intel、および CPU 構成です。

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unslothをダウンロード</a>

* <i class="fa-apple">:apple:</i> [macOS用をダウンロード](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Windows用をダウンロード](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Linux用をダウンロード](https://unsloth.ai/download/linux)

または、手動インストールを希望する場合:

**macOS、Linux、WSL：**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell：**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### インストール

1. Unsloth インストーラーを開きます（`.dmg`, `.exe` ファイル）
2. Mac では Unsloth を Applications にドラッグするか、Windows ではセットアップを完了します。
3. アプリを起動し、インストール完了まで待ちます
   {% endstep %}

{% step %}

#### モデルを選択

上部の「Select model」ドロップダウンまたは「Model hub」タブを開き、デバイスに合うモデルと量子化方式を選んでダウンロードします。完了したら、そのままチャットを始められます - セットアップは不要です。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FNCEVgKLJI0goPqjgcg9B%2Fmodel%20hub%20models.png?alt=media&amp;token=533b5e3c-a901-4b33-963e-4a703cc9d5a6" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### これでUnslothの準備は完了です

チャットを始めるには、メッセージを入力して Enter を押します。

* **ツールを接続:** [Claude Code](/docs/jp/ji-ben/claude-code.md), [Codex](/docs/jp/ji-ben/codex.md)、ウェブ検索、 [MCP](/docs/jp/ji-ben/mcp.md) など
* **モデルを学習:** テキスト、拡散モデル、埋め込みなどをファインチューニング
* **メディアを生成:** 画像、動画、TTS をローカルで作成・学習

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FpAGvwjGD0iVMZKBoyu7m%2Fgreeennn.png?alt=media&amp;token=d17a5528-8375-444c-9aff-f9e9f7903bcd" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### モデル読み込み + API ガイド

{% stepper %}
{% step %}

#### モデルを選択

API を使う前に、 **Select model** ドロップダウンからモデルを読み込みます。これはチャットページの左上にあります。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FuZqd6tcZ5LgMSh4ZND5x%2Fexport-1778505117710-24fps.gif?alt=media&amp;token=9defec95-5404-4654-9c33-67be967c9820" alt=""><figcaption></figcaption></figure>

このガイドでは、次を使います: `unsloth/gemma-4-26B-A4B-it-GGUF` 推奨の `UD-Q4_K_XL` 量子化方式。
{% endstep %}

{% step %}

#### モデルをテスト

クライアントを使う前に、簡単なメッセージを送ってください:

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F2Ivilke0aJX8AHWDwSmr%2Fimage.png?alt=media&amp;token=9f9380b9-f963-4861-a17b-fd0fe16684d4" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
これで、モデルが正しく読み込まれ、応答の準備ができていることを確認できます。
{% endhint %}
{% endstep %}

{% step %}

#### **Unsloth API キー**

Unsloth で **Settings → API** APIキーを表示または作成します。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FAZwaRmBVPpXA2SFhMGW9%2Fexport-1778506924396-30fps.gif?alt=media&amp;token=96f3f1a7-fce4-4508-b1b0-e8b6294dc423" alt=""><figcaption></figcaption></figure>

として表示されます。API キーはパスワードのように扱い、スクリーンショットやリポジトリに公開しないでください。
{% endstep %}
{% endstepper %}

## ⚙️ Claude Codeを接続

ローカルLLMをClaude Code用にセットアップしたので、次はClaude Codeをあなたのツールで動作するよう設定します。簡単に接続する方法は `unsloth start` 以下を使うか、 [手動で](#connect-manually).

### ⚡ Claude Codeを `unsloth start`

モデルを指定してClaudeを直接起動するには、次を実行します：

```bash
unsloth start claude \
    --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0 \
    --reasoning-effort medium
```

{% hint style="success" %}
設定/サンプリングフラグが設定されていない場合、Unslothはコンテキスト長、temperatureなどを含め、そのモデルに最適/推奨の設定を自動選択します。
{% endhint %}

Unsloth Studio でモデルが読み込まれている状態で、プロジェクトフォルダを開き、次を実行します:

```bash
unsloth start claude
```

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FB1CAedMQxexmFjLLLG5A%2FScreenshot_20260714_151401.png?alt=media&amp;token=c7badb92-b565-467d-bd90-35f8fba44f29" alt="Claude Code connected to a local model through Unsloth Studio"><figcaption><p>Unsloth Studioに読み込まれているモデルに対して実行中のClaude Code。</p></figcaption></figure>

この起動では、Unslothがローカルエンドポイント、APIキー、モデル、コンテキスト長を設定します。通常のClaude Code設定はそのままです。

Claude Codeは会話を通常のセッションストアに保持しているので、 `--persist` は不要です。最新のセッションは次で続行できます：

```bash
unsloth start claude --continue
```

完全な `unsloth start` コマンドライン、リモートUnslothサーバー、詳細オプションからモデルを読み込むためのリファレンスです。

このガイドの残りの部分では、手動 `llama.cpp` セットアップを説明します。

#### 🔌 手動で接続

手動で設定したい場合は、まず次の環境変数を設定できます。これらの変数は、デフォルトではセッション間で保持されません。

{% tabs %}
{% tab title="MacOS、Linux、WSL" %}
**設定：** ローカルAPI URLを設定します：

```bash
export ANTHROPIC_BASE_URL="http://localhost:8888"
```

Unsloth Studio → Settings → APIからキーをコピーするか、起動時にコンソールから取得して（ `unsloth run`で、次のように表示されるので `sk-unsloth-...`）、それを設定します。

{% code overflow="wrap" %}

```bash
export ANTHROPIC_AUTH_TOKEN="sk-unsloth-xxxxxxxxxxxx"
```

{% endcode %}

また、空の `ANTHROPIC_API_KEY` を設定して、Claude Codeがクラウドキーを要求しないようにします：

```bash
export ANTHROPIC_API_KEY=""
```

オプション：現在Unslothに読み込まれているモデル名を既定値として使用します。

```bash
export ANTHROPIC_MODEL="unsloth/gemma-4-26B-A4B-it-GGUF"
```

に表示されているとおり、完全なモデルIDを正確に使用してください `GET http://localhost:8888/v1/models` （次に渡すのと同じ文字列です `claude --model`).
{% endtab %}

{% tab title="Windows" %}
**設定：** PowerShellでローカルAPI URLを設定します：

```powershell
$env:ANTHROPIC_BASE_URL = "http://localhost:8888"
```

からキーをコピーして **Unsloth Studio → Settings → API**、次のように設定します：

```powershell
$env:ANTHROPIC_AUTH_TOKEN = "sk-unsloth-xxxxxxxxxxxx"
```

**オプション：** Unslothに現在読み込まれているモデル名を既定値として使用します。

```powershell
$env:ANTHROPIC_MODEL = "gemma-4-26B-A4B-it-GGUF"
```

{% hint style="info" %}
モデル名は、現在Unsloth Studioに読み込まれているモデルである必要があります。
{% endhint %}
{% endtab %}
{% endtabs %}

### Claude Codeを起動

現在Unslothに読み込まれているモデルでClaude Codeを起動します。

次を使用します `gemma-4-26B-A4B-it-GGUF`。ただし、任意のUnsloth互換モデルを使用できます。

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% hint style="info" %}
ローカルモデルをさらに高速化するには、次を付けて起動することもできます `--bare --exclude-dynamic-system-prompt-sections`。下の「オプション：システムプロンプトを縮小する」を参照してください。
{% endhint %}

Claude Codeが開き、選択したモデルが表示されるはずです。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FilIbwzXF5WyEzHSTzNgj%2Fimage.png?alt=media&amp;token=0dcd2039-3bf5-4e73-b761-a73b28543d3b" alt=""><figcaption></figcaption></figure>

{% hint style="warning" %}
参照してください [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") 最初に、KVキャッシュの無効化によってオープンモデルが90%遅くなる問題を修正します。
{% endhint %}

高品質なSFTデータセットを調査してランキングするためのこのプロンプトを試してください：

{% code overflow="wrap" %}

```
project/ の中だけで作業できます。CLAUDE.md を探さないでください—これがそれです。uv経由の仮想環境を使ってUnslothをインストールしてください。可能であれば、`python -m venv unsloth_env` を使い、その後 `source unsloth_env/bin/activate` を実行してください。インストール方法は https://unsloth.ai/docs/get-started/install/pip-install を参照して読んでください。その後、https://github.com/unslothai/unsloth に記載されている簡単なUnslothのファインチューニング実行を行ってください。1 GPUが利用できます。Hugging Face上で実在するinstruction/chat/SFTデータセットを10個ウェブ検索し、調査結果を簡潔に要約し、各データセットがSFTに関連する理由を調査しながら説明し、その後 sft_report.md を、順位、データセット名、作成者、関連タグ3〜5個、簡潔な平易英語の要約、SFTに役立つ理由を含む洗練されたMarkdownレポートとして作成してください。大きなメタデータのダンプ、貼り付けた生の説明、過剰に長いタグ一覧、無関係なデータセットは含めず、すべて簡潔で読みやすくしてください。タスクは sft_report.md に10件のきれいでよく書かれたデータセット項目が含まれた時点で完了とし、最後に「Successfully finetuned a model with Unsloth!」で締めてください。
```

{% endcode %}

プロンプトを送信すると、エージェントがウェブを検索し、結果を評価して、最終レポートを作成します。これには数分かかる場合があります。

一部のワークフローでは、アクションの承認やフォローアップのプロンプトへの回答が必要になる場合があります。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F1YVUcdNbQoPtje5RbbBp%2Fimage.png?alt=media&amp;token=c12e8f31-2698-41be-ab71-17f093f75b0c" alt="" width="563"><figcaption></figcaption></figure>

{% hint style="info" %}
一部のワークフローでは、アクションの承認やフォローアップのプロンプトへの回答が必要になる場合があります。
{% endhint %}

完了すると、生成された `sft_report.md` はこのようになります。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWRvFItbYmBXgxebQKL8e%2Fimage.png?alt=media&amp;token=c0196814-5dc7-4c43-a2cc-29721704dff4" alt="" width="375"><figcaption></figcaption></figure>

{% hint style="warning" %}
次の表示が出たら `APIに接続できません (ConnectionRefused)` 、 `ANTHROPIC_BASE_URL` 経由 `unset ANTHROPIC_BASE_URL`

オープンモデルが90%遅いと感じる場合は、 [まずここを参照してください](#fixing-90-slower-inference-in-claude-code) KVキャッシュが無効化される問題を修正するためです。
{% endhint %}

### オプション：システムプロンプトを縮小する

Claude CodeはAnthropicのホスト型モデル向けに作られているため、デフォルトのシステムプロンプトは大きめです。ローカルモデルでは、起動時に2つのフラグを追加することで、応答を高速化し、KVキャッシュの再利用を改善するためにこれを短縮できます：

{% code overflow="wrap" %}

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF --bare --exclude-dynamic-system-prompt-sections
```

{% endcode %}

{% hint style="info" %}
`--bare` フック、スキル、プラグイン、MCPサーバー、CLAUDE.mdの自動検出をスキップします（ClaudeはBashとファイルの読み書き/編集は保持します）。また、 `--exclude-dynamic-system-prompt-sections` 機械ごとのセクションをプロンプト接頭辞から外します。どちらもプロンプトを短くし、KVキャッシュの再利用を改善するため、ローカルモデルが明らかに高速になります。これらは任意であり、上記の接続設定は変更しません。
{% endhint %}

### 任意：Unsloth サーバーを調整

Claude CodeはUnslothで実行中のモデルを使用します。起動時にサーバーの動作をカスタマイズできます。

```bash
# コーディングエージェント向けに提供：--disable-tools はエージェント自身のツールを通過させます
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  --disable-tools \\
  --reasoning off \
  -p 8888
```

{% hint style="warning" %}
を使ってください `--disable-tools` Claude Code（または他の外部コーディングエージェント）を動かすときに使用します。デフォルトでは、Unsloth Studioは独自のサーバー側ツールを実行し、それがエージェントのツール呼び出しを飲み込んでしまうため、Claude Codeは応答するだけでファイルを編集しません。 `--disable-tools` パススルーに切り替わり、Claude Code自身のWrite/Edit/Bashツールが使用されます。
{% endhint %}

を使ってください `--reasoning off` 思考をオフにするには、または `--reasoning on` 推論をサポートするモデルでオンにするには、

```bash
# ローカルネットワーク上に API を公開
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_XL \
  -H 0.0.0.0 \\
  -p 8888
```

これによりサーバーが `0.0.0.0:8888`で起動し、ローカルネットワーク上の他のデバイスが接続できるようになります。

を使ってください `-p` サーバーを実行するポートを変更します。 `-H 0.0.0.0` スマートフォン、ノートPC、またはネットワーク上の他のデバイスを接続したい場合はこれを使用してください。

より高度な実行時設定については、メインの [API チューニング](https://unsloth.ai/docs/basics/api#unsloth-run-command) セクションを参照してください。

## 🦙 Llama.cpp チュートリアル

始める前に、まず使用する特定のモデルのセットアップを完了する必要があります。私たちは `llama.cpp` これは、Mac、Linux、WindowsなどのデバイスでLLMを実行するためのオープンソースフレームワークです。Llama.cppには `llama-server` が含まれており、LLMを効率的に提供・デプロイできます。モデルはポート8001で提供され、すべてのエージェントツールは単一のOpenAI互換エンドポイントを経由します。

#### Qwen3.5チュートリアル

次を使用します [Qwen3.5](/docs/jp/moderu/qwen3.5.md)-35B-A3Bと、高速で正確なコーディングタスク向けの特定設定です。十分なVRAMがなく、 **より賢い** モデルが欲しい場合は、 **Qwen3.5-27B** が良い選択ですが、約2倍遅くなります。または、9B、4B、2Bなどの他のQwen3.5バリアントも使用できます。

{% hint style="info" %}
次の場合はQwen3.5-27Bを使ってください **より賢い** モデルが必要な場合、またはVRAMが足りない場合です。ただし、35B-A3Bより約2倍遅くなります。あるいは [**Qwen3-Coder-Next**](/docs/jp/moderu/qwen3-coder-next.md) を使用できます。十分なVRAMがあれば、これは非常に優秀です。
{% endhint %}

{% stepper %}
{% step %}

#### llama.cpp をインストール

インストールする必要があります `llama.cpp` Claude Codeなどで使用するローカルLLMをデプロイ/提供するためです。正しいGPUバインディングと最大性能のため、公式のビルド手順に従います。 `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` に変更してください。GPU がない場合、または CPU 推論だけを使いたい場合は。 **Apple Mac / Metal デバイスでは**、次を設定し `-DGGML_CUDA=OFF` その後は通常どおり続けてください。Metal サポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev git-all -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F4DmycqgjxOz6TOQd9PLJ%2Fimage.png?alt=media&amp;token=c94db0b5-8e4a-4043-b2a3-c68bad93213e" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### モデルをダウンロードしてローカルで使用

モデルをダウンロードするには `huggingface_hub` を使用します（Pythonで `pip install huggingface_hub hf_transfer`）を使ってモデルをダウンロードします。最適なサイズと精度のバランスのために **UD-Q4\_K\_XL** 量子化を使用します。すべての Unsloth GGUF アップロードは、私たちの [コレクションこちら](/docs/jp/meru/unsloth-model-catalog.md)で見つけられます。ダウンロードが止まる場合は、 [Hugging Face Hub、XET のデバッグ](/docs/jp/ji-ben/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Qwen3.5-35B-A3B-GGUF \
    --local-dir unsloth/Qwen3.5-35B-A3B-GGUF \
    --include "*UD-Q4_K_XL*" # Dynamic 2bit には "*UD-Q2_K_XL*" を使用
```

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FRfXofrNzl1ypjfMTz15o%2Fimage.png?alt=media&amp;token=8009de90-cd11-46ed-85b5-fca5c07b66fc" alt=""><figcaption></figcaption></figure>

{% hint style="success" %}
私たちは `unsloth/Qwen3.5-35B-A3B-GGUF` を使ってインストールした後）。ただし、27Bなどの別バリアントや、次のような別モデルも使用できます `unsloth/`[`Qwen3-Coder-Next`](/docs/jp/moderu/qwen3-coder-next.md)`-GGUF`.
{% endhint %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FxlIrQGQ0cevb1ckkSFy5%2Fimage.png?alt=media&amp;token=b1a42562-927a-4ad2-85f8-29c2993c46aa" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Llama-server を起動

エージェント的なワークロード用にQwen3.5をデプロイするには、 `llama-server`. 次を適用します [Qwen推奨のサンプリングパラメータ](/docs/jp/moderu/qwen3.5.md#recommended-settings) 推論モードでは： `temp 0.6`, `top_p 0.95` , `top-k 20`。非推論モードや他のタスクを使う場合は、これらの数値が変わることに注意してください。

このコマンドを新しいターミナルで実行してください（ `tmux` を使うか、新しいターミナルを開いてください）。以下は **24GB GPU（RTX 4090）にぴったり収まります（23GB使用）** `--fit on` でも自動オフロードされますが、性能が悪い場合は `--ctx-size` .

{% hint style="info" %}
私たちは `--cache-type-k q8_0 --cache-type-v q8_0` VRAM使用量を減らすためのKVキャッシュ量子化用です。完全精度には `--cache-type-k bf16 --cache-type-v bf16` .注：bf16 KVキャッシュは、マシンによってはやや遅くなる場合があります。
{% endhint %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/Qwen3.5-35B-A3B-GGUF/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf \
    --alias "unsloth/Qwen3.5-35B-A3B" \
    --temp 0.6 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.00 \
    --port 8001 \\
    --kv-unified \\
    --cache-type-k q8_0 --cache-type-v q8_0
```

{% hint style="success" %}
Qwen3.5ではthinkingを無効化することもでき、エージェント系のコーディング作業で性能が向上することがあります。llama.cppでthinkingを無効にするには、llama-serverコマンドに次を追加します：

`--chat-template-kwargs "{\"enable_thinking\": false}"`

<img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F373wtRRbMcobtjV5e6xf%2Fkerkekke.png?alt=media&amp;token=2cd3b8c7-93b6-41cb-8bce-41f1aee819eb" alt="" data-size="original">
{% endhint %}
{% endstep %}
{% endstepper %}

### llama-serverでClaude Codeを起動

{% hint style="success" %}
私たちは `unsloth/GLM-4.7-Flash-GGUF` を使いましたが、 `unsloth/Qwen3.6-27B-GGUF`.
{% endhint %}

{% hint style="warning" %}
参照してください [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") 最初に、KVキャッシュの無効化によってオープンモデルが90%遅くなる問題を修正します。
{% endhint %}

プロジェクトフォルダに移動して（`mkdir project ; cd project`)、次を実行します：

```bash
claude --model unsloth/GLM-4.7-Flash
```

Qwen3.6-35B-A3Bを使うには、単に次に変更します：

```bash
claude --model unsloth/Qwen3.6-35B-A3B
```

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fnyc5BnXQiXPRZnyuYZt3%2Fimage.png?alt=media&amp;token=72011cb6-abed-4a41-99b0-104ef5d0111f" alt="" width="563"><figcaption></figcaption></figure></div>

承認なしでコマンドを実行するようClaude Codeを設定するには、次を実行します **（注意：これにより、Claude Codeは承認なしで好きなようにコードを実行・実行処理するようになります！）**

{% code overflow="wrap" %}

```bash
claude --model unsloth/GLM-4.7-Flash --dangerously-skip-permissions
```

{% endcode %}

このプロンプトを試して、簡単な Unsloth のファインチューニングをインストールして実行してください：

{% code overflow="wrap" %}

```
cwd project/ の中だけで作業できます。CLAUDE.md は探さないでください - これがそれです。uv経由で仮想環境を使ってUnslothをインストールしてください。可能なら `python -m venv unsloth_env` を使い、その後 `source unsloth_env/bin/activate` を実行してください。方法については https://unsloth.ai/docs/get-started/install/pip-install を参照して読んでください。次に、https://github.com/unslothai/unsloth に記載の簡単なUnslothのファインチューニング実行を行ってください。1 GPUにアクセスできます。
```

{% endcode %}

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FBkpEsVssYZG9wHvvWMRH%2Fimage.png?alt=media&amp;token=e1a8283f-49ed-4b78-8052-d8970f069d5b" alt="" width="563"><figcaption></figcaption></figure></div>

少し待つと、uv経由のvenvにUnslothがインストールされ、読み込まれます：

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHATFwDrR1gP44XFbzWcv%2Fimage.png?alt=media&amp;token=6ff63733-686d-4b08-bdd5-66a6fa4aa34c" alt="" width="563"><figcaption></figcaption></figure></div>

そして最後に、Unslothでファインチューニングに成功したモデルが表示されます！

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FZjQ6askaixcYOMrr2qMi%2Fimage.png?alt=media&amp;token=e0e0047d-b6a2-421f-a86b-68e093a3a17a" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="warning" %}
次の表示が出たら `APIに接続できません (ConnectionRefused)` 、 `ANTHROPIC_BASE_URL` 経由 `unset ANTHROPIC_BASE_URL`

オープンモデルが90%遅いと感じる場合は、 [まずここを参照してください](#fixing-90-slower-inference-in-claude-code) KVキャッシュが無効化される問題を修正するためです。
{% endhint %}

[^1]: これは必ず使ってください！


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/ji-ben/claude-code.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
