> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/ji-ben/codex.md).

# OpenAI Codex でローカル LLM を実行する方法

端末上で OpenAI Codex とオープンモデルをローカルに使う方法。

このステップバイステップのガイドでは、オープンな LLM と API を OpenAI Codex に接続する方法を紹介します **完全にローカルで**、スクリーンショット付きで解説します。Codex に必要なのは、OpenAI Responses API を話すローカルエンドポイントだけです。Qwen、DeepSeek、Gemma など、任意のオープンモデルで実行できます。

このチュートリアルでは、次のオープンモデルを使います: [Gemma 4](/docs/jp/moderu/gemma-4.md) および [Qwen3.5](/docs/jp/moderu/qwen3.5.md) 。これらは優れたエージェント系・コーディング系モデルです（24GB RAM / ユニファイドメモリ搭載デバイスで動作します）。推論には [Unsloth Studio](https://github.com/unslothai/unsloth) および [`llama.cpp`](https://github.com/ggml-org/llama.cpp) を使います。これにより、macOS、Linux、Windows で LLM を実行／提供できます。ほかのモデルにも差し替え可能で、その場合はスクリプトと Codex 設定内のモデル名を更新するだけです。

<a href="/docs/jp/ji-ben/codex.md#setup-codex" class="button primary" data-icon="openai">Codex のセットアップ</a><a href="/docs/jp/ji-ben/codex.md#quickstart-tutorials" class="button primary">📖 ローカルモデルのセットアップチュートリアル</a>

モデルの量子化には、Unsloth の [**Dynamic GGUF**](/docs/jp/ji-ben/dynamic-3.0-ggufs.md) を使うので、できるだけ精度を保ちながら量子化済み GGUF モデルを実行できます。

{% hint style="info" %}
Codex は 2026 年 1 月以降でかなり変わりました。現在は [**OpenAI Responses API**](https://platform.openai.com/docs/api-reference/responses) **のみ**を使用し、Chat Completions のサポートは廃止されました。 [Unsloth Studio](#unsloth-tutorial) は両方をサポートしているので、ここでは `wire_api = "responses"` をこのガイド全体で使います。
{% endhint %}

### <i class="fa-openai">:openai:</i> Codex のセットアップ

[Codex](https://github.com/openai/codex) は、ローカルで動作する OpenAI 公式のコーディングエージェントです。ChatGPT 向けに設計されていますが、 **カスタム API エンドポイント**をサポートしているため、ローカル LLM でも動作します。後ほど Unsloth Studio の `/v1/responses` エンドポイントを指定します。

{% tabs %}
{% tab title="Linux / WSL" %}
ターミナルで実行:

```bash
apt update
sudo apt install nodejs npm -y
npm install -g @openai/codex
```

{% endtab %}

{% tab title="Windows" %}
Windows PowerShell で実行:

```powershell
winget install --id OpenAI.Codex
```

{% hint style="info" %}
**Codex デスクトップアプリを使いたいですか？** Microsoft Store からインストール:

```powershell
winget install --id 9PLM9XGG6VKS --source msstore
```

または [Microsoft アプリ ストア](https://apps.microsoft.com/detail/9plm9xgg6vks)から。アプリは同じ `%USERPROFILE%\.codex\config.toml`を読み込むため、後で設定するプロバイダー構成はどちらでも適用されます。
{% endhint %}

{% hint style="info" %}
**WSL を使いたいですか？** PowerShell を管理者として開き、 `wsl --install`を実行し、再起動してから、Ubuntu 内で上の Linux タブに従ってください。Windows ホスト上の Unsloth に到達するには、少しだけネットワークの工夫が必要です - WSL のヒントは「Codex を Unsloth に接続する」を参照してください。
{% endhint %}
{% endtab %}

{% tab title="MacOS" %}
ターミナルで実行:

<pre class="language-bash"><code class="lang-bash"><strong>bash brew install --cask codex
</strong></code></pre>

{% endtab %}
{% endtabs %}

インストールはこれで完了です - **まだ実行しないでください `codex` を**。素のまま実行すると、OpenAI の「ChatGPT でサインイン」ピッカーが開きます（モーダルなので、抜け道はありません）。ローカルプロファイルを設定したら、\
`codex --oss --profile unsloth_api` または `codex --oss --profile llama_cpp` はその画面を完全にスキップします。カスタムプロバイダーの既定値は `requires_openai_auth = false`です。まずローカルモデルサーバーを起動してから、Codex をそのサーバーに向けて起動します。

## 📖 クイックスタートチュートリアル <a href="#quickstart-tutorials" id="quickstart-tutorials"></a>

始める前に、まず使用する特定のモデルのセットアップを完了する必要があります。私たちは [Unsloth](https://unsloth.ai/docs/new/studio) （Web UI）と llama.cpp を使います。これらは、Mac、Linux、Windows デバイス上で LLM を実行・提供するためのオープンソースフレームワークです。

{% columns %}
{% column %}
始める前に、まず使用する特定のモデルのセットアップを完了する必要があります。私たちは [Unsloth](/docs/jp/xin-zhe/studio.md) （Web UI）と llama.cpp を使います。これらは、Mac、Linux、Windows デバイス上で LLM を実行・提供するためのオープンソースフレームワークです。

Unsloth には独自の自己修復機能もあります [ツール呼び出し](/docs/jp/xin-zhe/studio/chat.md#auto-healing-tool-calling) および [ウェブ検索](/docs/jp/xin-zhe/studio/chat.md#code-execution) 機能があります。右側は、Unsloth に接続された Claude Code の例です:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FEGEKo6oPthjtSf0shavs%2F127.0.0.1_8889_chat%20(2).png?alt=media&amp;token=c59c7110-402c-4d21-96c5-cd96c921a184" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

<a href="/docs/jp/ji-ben/codex.md#unsloth-tutorial" class="button primary">🦥 Unsloth チュートリアル</a><a href="/pages/c87896ff7159620f4c01bb39fe9df1fd1a55274e#llama.cpp-tutorial" class="button primary">🦙 llama.cpp チュートリアル</a>

## 🦥 Unsloth チュートリアル

このチュートリアルでは、 [Unsloth](https://github.com/unslothai/unsloth)を使って、UI 経由でローカルモデルを Claude Code に提供・接続します。Unsloth は Windows、WSL、Linux、MacOS で動作します。

{% columns %}
{% column %}

* 検索、ダウンロード、 [GGUF を実行](/docs/jp/xin-zhe/studio.md#run-models-locally) および safetensor モデル
* [**自己修復** ツール呼び出し](/docs/jp/xin-zhe/studio.md#execute-code--heal-tool-calling) + **ウェブ検索**
* [**コード実行**](/docs/jp/xin-zhe/studio.md#run-models-locally) （Python、Bash）
* [自動推論](https://unsloth.ai/docs/desktop#feature-deep-dive) パラメータ調整（temp、top-p など）
* llama.cpp 経由の高速CPU + GPU推論
* [LLM を学習](/docs/jp/xin-zhe/studio.md#no-code-training) VRAM 70%削減で2倍高速

以下にインストール手順を示します:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FY3nfB43TEk7k11zcE4wm%2Fthe%20big%20one.gif?alt=media&amp;token=335be087-7375-4f89-9039-71195ee44ab8" alt=""><figcaption><p>Unsloth 上で動作する Qwen3.6 2-bit の例。</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}

#### Unsloth をダウンロード

始める最も簡単な方法は、 [Unsloth Desktop](/docs/jp/desktop.md) アプリをインストールすることです。対応環境は [MacOS](/docs/jp/meru/install/mac.md)、Linux、 [Windows](/docs/jp/meru/install/windows-installation.md), [NVIDIA](/docs/jp/meru/install/pip-install.md), [AMD](/docs/jp/meru/install/amd.md)、Intel、および CPU 構成です。

<a href="https://unsloth.ai/download" class="button primary" data-icon="down-to-bracket">Unsloth をダウンロード</a>

* <i class="fa-apple">:apple:</i> [macOS 用をダウンロード](https://unsloth.ai/download/mac)
* <i class="fa-windows">:windows:</i> [Windows 用をダウンロード](https://unsloth.ai/download/windows)
* <i class="fa-linux">:linux:</i> [Linux 用をダウンロード](https://unsloth.ai/download/linux)

または、手動インストールを希望する場合:

**MacOS、Linux、WSL:**

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell:**

```bash
irm https://unsloth.ai/install.ps1 | iex
```

{% endstep %}

{% step %}

#### インストール

1. Unsloth インストーラーを開きます（`.dmg`, `.exe` ファイル）
2. Mac では Unsloth を Applications にドラッグするか、Windows ではセットアップを完了します。
3. アプリを起動し、インストール完了まで待ちます
   {% endstep %}

{% step %}

#### モデルを選択

上部の「Select model」ドロップダウンまたは「Model hub」タブを開き、デバイスに合うモデルと量子化方式を選んでダウンロードします。完了したら、そのままチャットを始められます - セットアップは不要です。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FNCEVgKLJI0goPqjgcg9B%2Fmodel%20hub%20models.png?alt=media&amp;token=533b5e3c-a901-4b33-963e-4a703cc9d5a6" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Unsloth の準備ができました

チャットを始めるには、メッセージを入力して Enter を押します。

* **ツールを接続:** [Claude Code](/docs/jp/ji-ben/claude-code.md), [Codex](/docs/jp/ji-ben/codex.md)、ウェブ検索、 [MCP](/docs/jp/ji-ben/mcp.md) など
* **モデルを学習:** テキスト、拡散モデル、埋め込みなどをファインチューニング
* **メディアを生成:** 画像、動画、TTS をローカルで作成・学習

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FpAGvwjGD0iVMZKBoyu7m%2Fgreeennn.png?alt=media&amp;token=d17a5528-8375-444c-9aff-f9e9f7903bcd" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}
{% endstepper %}

### モデル読み込み + API ガイド

{% stepper %}
{% step %}

#### モデルを選択

API を使う前に、 **Select model** ドロップダウンからモデルを読み込みます。これはチャットページの左上にあります。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FuZqd6tcZ5LgMSh4ZND5x%2Fexport-1778505117710-24fps.gif?alt=media&amp;token=9defec95-5404-4654-9c33-67be967c9820" alt=""><figcaption></figcaption></figure>

このガイドでは、次を使います: `unsloth/gemma-4-26B-A4B-it-GGUF` 推奨の `UD-Q4_K_XL` 量子化方式。
{% endstep %}

{% step %}

#### モデルをテスト

クライアントを使う前に、簡単なメッセージを送ってください:

<div data-with-frame="true"><figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F2Ivilke0aJX8AHWDwSmr%2Fimage.png?alt=media&amp;token=9f9380b9-f963-4861-a17b-fd0fe16684d4" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
これで、モデルが正しく読み込まれ、応答の準備ができていることを確認できます。
{% endhint %}
{% endstep %}

{% step %}

#### **Unsloth API キー**

Unsloth で **Settings → API** を開くと、API キーの表示または作成ができます。Unsloth をヘッドレスで `unsloth run`で起動した場合は、キーはコンソールにも `sk-unsloth-...`.

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FAZwaRmBVPpXA2SFhMGW9%2Fexport-1778506924396-30fps.gif?alt=media&amp;token=96f3f1a7-fce4-4508-b1b0-e8b6294dc423" alt=""><figcaption></figcaption></figure>

として表示されます。API キーはパスワードのように扱い、スクリーンショットやリポジトリに公開しないでください。
{% endstep %}
{% endstepper %}

### オプション: 実行時設定を調整

モデルを `unsloth run`.

```bash
# 推論を有効にし、より大きなコンテキストウィンドウを使用
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \\
  --reasoning on \\
  -c 131072
```

推論対応モデルは `を` または `で llama.cpp でも使えます！`で起動できます。 `-c` フラグは利用可能なコンテキストウィンドウを制御します。

```bash
# カスタムポートでコーディングエージェント向けに提供
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \\
  --disable-tools \\
  -p 8888
```

を使ってください `-p` を使うと、API を別のポートで実行できます。

{% hint style="info" %}
外部のコーディングエージェントを使う場合は、 `--disable-tools`を追加してください。これにより Unsloth Studio はパススルーに切り替わり、エージェント自身のツールが転送され、Unsloth がサーバー側で組み込みツールを実行する代わりに、エージェントが実行するツール呼び出しとして返されます。
{% endhint %}

より高度な実行時設定については、メインの [API チューニング](https://unsloth.ai/docs/basics/api#unsloth-run-command) セクションを参照してください。

## ⚙️ Codex に接続

Codex 用のローカル LLM をセットアップしたので、次はツールで Codex を動作させる設定を行います。簡単に接続するには `unsloth start` 以下を使うか、 [手動で](#connect-manually).

### ⚡ OpenAI Codex をモデルと一緒に実行 `unsloth start`

Codex をモデルと直接起動するには、次を実行します:

```bash
unsloth start Code \\
    --model unsloth/qwen3.8-27B-GGUF-GGUF:UD-Q4_K_XL
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.0 \
    --reasoning-effort medium
```

{% hint style="success" %}
設定/サンプリングフラグが設定されていない場合、Unslothはコンテキスト長、temperatureなどを含め、そのモデルに最適/推奨の設定を自動選択します。
{% endhint %}

Unsloth Studio に GGUF モデルを読み込んだら、プロジェクトフォルダを開いて次を実行します:

```bash
unsloth start codex
```

Unsloth は起動時に、隔離された Codex ホームと Unsloth 管理の Responses プロバイダーを作成します。通常の `~/.codex` の設定はそのまま残ります。

Codex の状態は既定で一時的です。保持したい場合は `--persist` を使って、Unsloth が管理する設定とセッションを保持します:

```bash
unsloth start codex --persist
unsloth start codex --persist resume --last
```

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FzXhTRRhKnT7tc5A4su0w%2FScreenshot_20260714_150727.png?alt=media&amp;token=1ad76079-1127-443e-8e2b-96545269003e" alt="OpenAI Codex running with a local GGUF model through Unsloth Studio"><figcaption><p>Unsloth Studio の Responses エンドポイントを通じて、ローカル GGUF モデルに接続された Codex。</p></figcaption></figure>

> Codexは現在、 `llama-server` 経由で提供されるGGUFモデルを必要とします。

完全な `unsloth start` を参照して、モデル読み込み、永続化、すべてのラッパーオプションを確認してください。

このガイドの残りの部分では、完全に手動での Codex プロバイダー設定を扱います。

#### 🔌 手動で接続

このセクションは手動設定用です。Unsloth Studio、llama.cpp、またはほかの OpenAI 互換ローカルサーバーを使った場合でも同じです。Codex に必要なのは 3 つの値です。 **API キー**、 **ベース URL**、そして **モデル名**です。以下の例では Unsloth Studio を使います。llama.cpp では、同じ形式で `llama_cpp` セクションの profile を使ってください。

{% stepper %}
{% step %}

#### **Unsloth プロバイダーを設定**

Codex は `~/.codex/config.toml` を macOS/Linux/WSL 上で、または `%USERPROFILE%\.codex\config.toml` を Windows 上で探します。作成または編集してください:

{% code title="\~/.codex/config.toml" overflow="wrap" %}

```toml
# `codex --oss` で使われる既定のローカルプロバイダー
oss_provider = "unsloth_api"

[model_providers.unsloth_api]
name                  = "Unsloth Studio"
base_url              = "http://localhost:8888/v1"
env_key               = "UNSLOTH_STUDIO_AUTH_TOKEN"
wire_api              = "responses"
requires_openai_auth  = false
```

{% endcode %}

次に、Unsloth 用の Codex プロファイルを作成します:

{% code title="\~/.codex/unsloth\_api.config.toml" overflow="wrap" %}

```toml
model_provider = "unsloth_api"
model = "unsloth/gemma-4-26B-A4B-it-GGUF"
```

{% endcode %}

{% hint style="info" %}
`model` は、サーバーが `GET http://localhost:8888/v1/models`で報告する ID と一致している必要があります。Unsloth Studio はリポジトリの完全な ID を公開します（例: `unsloth/gemma-4-26B-A4B-it-GGUF`）。以下の llama.cpp セクションでは `--alias "unsloth/gemma-4-26B-A4B"`を使うので、Codex を llama-server に向ける場合は、そちらの短い ID を使ってください。
{% endhint %}

{% hint style="info" %}
この設定は `unsloth_api` Codex モデルプロバイダーを登録し、Unsloth Studio を指し、 `unsloth_api` codex --oss の既定のローカルプロバイダーとして `codex --oss`。別の `unsloth_api` profile は、Codex を `--profile unsloth_api`で起動した場合にのみ Unsloth プロバイダーとモデルを選択するので、通常の Codex 設定は変更されません。Codex は API キーを、という名前の環境変数から読み取ります `UNSLOTH_STUDIO_AUTH_TOKEN`。実際のキーは次の手順で設定します。
{% endhint %}

| 項目                     | 機能                                                                                                  |
| ---------------------- | --------------------------------------------------------------------------------------------------- |
| `base_url`             | ローカルサーバーのエンドポイント + `/v1`                                                                            |
| `env_key`              | **Codex が API キーを読み取る環境変数の** 名前。キーそのものではありません。                                                      |
| `wire_api`             | `responses`。Codex は現在、OpenAI の Responses API のみを使用します。                                              |
| `requires_openai_auth` | `false` は、このプロバイダーでの「ChatGPT でサインイン」画面を Codex にスキップさせます。既定値もすでに `false`ですが、明示しておきます。                |
| `model`                | サーバーが公開するモデル ID です。 `GET <base_url>/models` を実行して、正確な文字列を確認してください。                                  |
| `oss_provider`         | <p>設定 <code>unsloth\_api</code> Codex を `--oss` で起動したときの既定のローカルプロバイダーとして<br><code>--oss</code>.</p> |
| `requires_openai_auth` | `false` はこのプロバイダーでの「ChatGPT でサインイン」画面を Codex にスキップさせます。                                             |

{% hint style="warning" %}
OpenAI は `wire_api = "chat"` のサポートを削除しました。常に `wire_api = "responses"`を使ってください。 `wire_api = "chat"`を設定すると、Codex は起動を拒否します `` `wire_api = "chat"` はもうサポートされていません。修正方法: プロバイダー設定で `wire_api = "responses"` に設定してください。 ``
{% endhint %}

{% hint style="info" %}
Unsloth モデルを切り替えるたびに、複数のプロファイルファイルを作成できます。必要なものを `codex --profile <profile-name>`.
{% endhint %}
{% endstep %}

{% step %}

#### API キーの env var を設定

で書いたのと同じ env var 名を使ってください `env_key`。上の Unsloth Studio の例では、 `env_key = "UNSLOTH_STUDIO_AUTH_TOKEN"`なので、 `UNSLOTH_STUDIO_AUTH_TOKEN` を Codex を実行する同じターミナルで設定します:

{% code title="macOS / Linux / WSL" %}

```bash
export UNSLOTH_STUDIO_AUTH_TOKEN=YOUR_TOKEN
```

{% endcode %}

{% code title="Windows PowerShell" %}

```powershell
$env:UNSLOTH_STUDIO_AUTH_TOKEN = "YOUR_TOKEN"
```

{% endcode %}

もし `env_key`を変更したなら、コマンド内の変数名も変更してください。たとえば、 `env_key = "LLAMA_CPP_API_KEY"` を使う llama.cpp プロファイルでは `LLAMA_CPP_API_KEY`が必要で、 `UNSLOTH_STUDIO_AUTH_TOKEN`.

**セッション用 vs 永続:** 上のコマンドは現在のターミナルにのみ適用されます。永続化するには:

* **macOS / Linux / WSL:** 次の `export` 行を `~/.bashrc` （bash）または `~/.zshrc` （zsh）に追加します。
* **Windows:** を 1 回実行するか、または次の `setx UNSLOTH_STUDIO_AUTH_TOKEN "YOUR_TOKEN"` を `$env:` PowerShell の `$PROFILE`.

{% hint style="warning" %}
**Windows 上の Unsloth と一緒に WSL 内で Codex を実行していますか？** WSL は別のネットワーク名前空間なので、 `localhost` は WSL 内からは Unsloth に届きません。 `config.toml` を編集して、代わりに Windows ホスト IP を使ってください:

```bash
# WSL 内から Windows ホスト IP を取得
ip route | grep default | awk '{print $3}'
```

次に `base_url = "http://<that-ip>:8888/v1"`を設定します。WSL2 のミラーリングネットワーキングを有効にしている場合（`.wslconfig` → `networkingMode=mirrored`), `localhost` ）、ネイティブ Windows と同じように動作します。
{% endhint %}
{% endstep %}

{% step %}

#### **Codex を起動**

```bash
mkdir my-project && cd my-project
codex --oss --profile unsloth_api
```

{% hint style="info" %}
**新しいディレクトリで最初に起動するとき** Codex は *"このディレクトリの内容を信頼しますか？"* - を選びます *はい、続行します。* これはディレクトリごとの信頼確認プロンプトで、ChatGPT のログインではありません（そちらは \`requires\_openai\_auth = false\` のためスキップされます）。同じディレクトリでの次回以降の起動では、このプロンプトは表示されません。
{% endhint %}

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FWLWGwxYFup5JCptPghfx%2Fimage.png?alt=media&amp;token=e47961e9-20b6-4ec7-adec-919c819dc740" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
**表示される `次のモデルのメタデータが` unsloth/gemma-4-26B-A4B `見つかりませんでした。フォールバックのメタデータを使用します`?** Codex には、OpenAI 自身のモデル向けにコンテキストウィンドウ、ツール対応、入力モダリティの組み込みテーブルが付属しています。それ以外の場合は、安全な既定値にフォールバックします。この警告は、OpenAI 以外のスラッグごとにセッションにつき 1 回表示されます。機能は問題なく動くので、無視してかまいません。

**修正するには:** 追加します `model_context_window = 131072` を `~/.codex/config.toml` の先頭に追加して、Codex がフォールバック推定ではなく Gemma 4 の実際の 128K コンテキストを使うようにします。ツール対応と入力モダリティも完全に制御したい場合は、 `model_catalog_json` を `[profiles.unsloth_api]` 内の、カスタム `ModelInfo` エントリを含む JSON ファイルに向けてください。
{% endhint %}

この `--profile unsloth_api` フラグは Codex に `~/.codex/unsloth_api.config.toml`を読み込ませることを意味し、Unsloth Studio のプロバイダーとモデルが選択されます。 `--oss` を追加すると、Codex のローカル OSS プロバイダーフローで実行されます。モデル名は Codex のステータスバーに表示されます。

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F0EDBeLBbGfnBbW2Osnh9%2Fimage.png?alt=media&amp;token=e96a4905-5816-4c12-bd4d-a3a41500ef29" alt=""><figcaption></figcaption></figure>

追加 `--search` でウェブ検索を有効にします:

```bash
codex --oss --profile unsloth_api --search
```

すべての承認プロンプトを回避するには **（警告：これにより、Codex は承認なしで好きなようにコードを実行・処理するようになります！）**:

{% code overflow="wrap" %}

```bash
codex --oss --profile unsloth_api --search --dangerously-bypass-approvals-and-sandbox
```

{% endcode %}
{% endstep %}
{% endstepper %}

### 実際のタスクを試す

このプロンプトを試して、簡単な Unsloth のファインチューニングをインストールして実行してください：

{% code overflow="wrap" %}

```
cwd の project/ でのみ作業できます。AGENTS.md を探さないでください。これがそれです。
uv を使って仮想環境経由で Unsloth をインストールします。方法は
https://unsloth.ai/docs/get-started/install/pip-install を参照してください（取得して読んでください）。
その後、以下で説明されている簡単な Unsloth のファインチューニング実行を行ってください：
https://github.com/unslothai/unsloth。1 GPU を利用できます。
```

{% endcode %}

そして少し待てば、Unsloth で正常にファインチューニングされたモデルが表示されます！

<figure><img src="https://735611837-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FFPuzCCHWIIXwuvTloNDh%2Fexport-1778571001272-30fps.gif?alt=media&amp;token=2bcaeaf1-a906-4169-b4ac-f17388ebaebb" alt=""><figcaption></figcaption></figure>

### 切断または元に戻す

以下なしで Codex を起動 `-p unsloth_api` すると、デフォルトのプロバイダーが使われます。あるいは `[profiles.unsloth_api]` および `[model_providers.unsloth_api]` から `~/.codex/config.toml`.

```bash
unset UNSLOTH_STUDIO_AUTH_TOKEN
```

Unsloth Studio は起動したままでも停止しても構いません。停止中は何も介入しません。

### トラブルシューティング

| 症状                                 | 考えられる原因                                                        | 修正                                                                                               |
| ---------------------------------- | -------------------------------------------------------------- | ------------------------------------------------------------------------------------------------ |
| `... のモデルメタデータが見つかりません`            | OpenAI 以外のスラッグで、組み込みメタデータがありません                                | 無害な警告です。副作用を抑えるには、 `model_context_window = 131072` を `~/.codex/config.toml`に設定するか、               |
| Codex は GPT だと言います                 | Codex は OpenAI を参照するシステムプロンプトを挿入します。ローカルモデルはそれを反映します           | ルーティングのバグではありません。Unsloth のアクティビティパネルで確認してください。自己申告を変えるにはシステムプロンプトを上書きします。                        |
| `接続が拒否されました`                       | Unsloth が実行されていないか、ポートが違います                                    | Unsloth が `http://localhost:8888`で起動していることを確認してください。 `base_url` を `config.toml`                  |
| `wire_api = "chat" はもうサポートされていません` | レガシー `wire_api = "chat"` を設定内で                                 | に切り替えてください `wire_api = "responses"`                                                              |
| `モデルが見つかりません`                      | モデル ID の টাইポ                                                  | `GET http://localhost:8888/v1/models` を見て、正確な ID をコピーしてください                                      |
| 生成途中で OOM                          | コンテキストが VRAM に対して大きすぎます                                        | Unsloth でコンテキストを減らす **設定 → 推論**、またはより小さい量子化を使ってください                                              |
| Codex に「ChatGPT でサインイン」ピッカーが表示される  | <p>素の状態で起動した <code>codex</code> （なし<br><code>--oss</code>)</p> | 終了（Ctrl+C）してから、次で再起動してください `codex --oss --profile unsloth_api`. カスタムプロバイダーではそれはスキップされます          |
| ツール呼び出しが不安定                        | 自己修復フォールバックが必要                                                 | Unsloth の [自己修復ツール呼び出し](file:///1382377/new/studio/#execute-code--heal-tool-calling) はデフォルトで有効です |
| WSL: `接続が拒否されました` を `localhost`    | WSL のネットワーク名前空間                                                | で Windows ホストの IP を使うか、 `base_url`、または WSL2 のミラーリングネットワークを有効にしてください                              |

## 🦙 Llama.cpp チュートリアル

また、 `llama.cpp` を直接使うこともできます。デプロイする必要があります `llama-server` これは、Mac、Linux、Windows デバイス上で LLM を効率的に実行・提供するためのオープンソースフレームワークです。モデルは **ポート 8001** で提供され、すべてのエージェントのツール呼び出しはその単一の OpenAI 互換エンドポイントを経由します。

{% hint style="info" %}
llama.cpp のエンドポイントは **ポート 8001** になります `8888` の代わりに（Unsloth Studio のデフォルト）。Codex の `base_url` をそれに合わせて調整してください `~/.codex/config.toml`.
{% endhint %}

{% stepper %}
{% step %}

#### **llama.cpp をインストール**

インストールする必要があります `llama.cpp` Codex で使うローカル LLM をデプロイ／提供するために。正しい GPU バインディングと最大性能のため、公式のビルド手順に従います。 `-DGGML_CUDA=ON` を `-DGGML_CUDA=OFF` に変更してください。GPUがない場合やCPU推論だけを使いたい場合です。 **Apple Mac / Metal デバイスの場合**、 `-DGGML_CUDA=OFF` を設定してから、あとは通常どおり進めてください。Metal サポートはデフォルトで有効です。

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev git-all -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first \\
    --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}

#### **モデルをダウンロードしてローカルで使用**

以下の `hf` CLI（`pip install huggingface_hub hf_transfer`）を使ってモデルをダウンロードします。最適なサイズと精度のバランスのために **UD-Q4\_K\_XL** 量子化を使用します。すべての Unsloth GGUF アップロードは、私たちの [コレクションこちら](file:///1382377/get-started/unsloth-model-catalog.md)で見つけられます。ダウンロードが止まる場合は、 [https://hugging-face-hub-xet-debugging.md](https://hugging-face-hub-xet-debugging.md "mention").

```bash
hf download unsloth/gemma-4-26B-A4B-it-GGUF \\
    --local-dir unsloth/gemma-4-26B-A4B-it-GGUF \\
    --include "*UD-Q4_K_XL*"
```

{% hint style="info" %}
**視覚サポートが必要ですか？** 追加 `--include "*mmproj-BF16*"` を付けて vision projector も取得し、その後 `--mmproj unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-BF16.gguf` を `llama-server`を渡します。Codex 自体はテキストのみなので、これは任意です。
{% endhint %}

{% hint style="success" %}
私たちは `unsloth/gemma-4-26B-A4B-it-GGUF`を使いましたが、 `unsloth/Qwen3.6-35B-A3B-GGUF` のようなものなら何でも使えます - 参照： [Qwen3.6-35B-A3B](/docs/jp/moderu/qwen3.6.md).
{% endhint %}
{% endstep %}

{% step %}

#### **Llama-server を起動**

エージェント的なワークロード向けに Gemma-4-26B-A4B をデプロイするために、私たちは `llama-server`を使用します。Google 推奨のサンプリングパラメータ（`temp 1.0`, `top_p 0.95`, `top_k 64`）を適用し、 `--jinja` を有効にして正しいツール呼び出しサポートを行います。

このコマンドを新しいターミナルで実行してください（ `tmux` を使うか、新しいターミナルを開いてください）。以下は **24GB GPU（RTX 4090）に余裕で収まり** 約18GB です。 `--fit on` でも自動オフロードされますが、性能が悪い場合は `--ctx-size`.

```bash
./llama.cpp/llama-server \\
    --model unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\
    --alias "unsloth/gemma-4-26B-A4B" \\
    --temp 1.0 \
    --top-p 0.95 \
    --top-k 64 \\
    --port 8001 \\
    --kv-unified \\
    --cache-type-k q8_0 --cache-type-v q8_0 \\
    --batch-size 4096 --ubatch-size 1024
```

{% hint style="info" %}
私たちは `--cache-type-k q8_0 --cache-type-v q8_0` を使って KV キャッシュを量子化し、VRAM 使用量を減らします。品質低下が見られる場合は、代わりに `bf16` を使ってください（`--cache-type-k bf16 --cache-type-v bf16`）、ただし VRAM は 2 倍になります。
{% endhint %}

{% hint style="success" %}
**思考を無効にする** と、エージェント的なコーディングタスクの性能が向上する場合があります。Gemma 4 はチャットテンプレート経由でデフォルトで思考が有効になっています。無効にするには、llama-server コマンドに次のフラグを追加してください：

**macOS / Linux / WSL:**

`--chat-template-kwargs '{"enable_thinking":false}'`

**Windows PowerShell:**

`--chat-template-kwargs "{\"enable_thinking\":false}"`
{% endhint %}
{% endstep %}

{% step %}

#### **Codex をポート 8001 に向ける**

あなたの `~/.codex/config.toml` を編集して llama-server のポートを使うようにしてください：

{% code title="\~/.codex/config.toml" %}

```toml
[model_providers.llama_cpp]
name      = "llama.cpp"
base_url  = "http://localhost:8001/v1"
env_key   = "LLAMA_CPP_API_KEY"
wire_api  = "responses"
```

{% endcode %}

その後、新しいプロファイルで起動します：

```bash
codex --oss llama_cpp
```

llama-server は本物のキーを必要としないため、認証トークンは何でも設定できます：

{% code title="macOS / Linux / WSL" %}

```bash
export LLAMA_CPP_API_KEY=sk-no-key-required
```

{% endcode %}

{% code title="Windows PowerShell" %}

```powershell
$env:LLAMA_CPP_API_KEY = "sk-no-key-required"
```

{% endcode %}
{% endstep %}
{% endstepper %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/ji-ben/codex.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
