> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/jp/xin-zhe/studio/chat.md).

# Unsloth Studioでモデルを実行する方法

[Unsloth Studio](/docs/jp/xin-zhe/studio.md) AIモデルをコンピュータ上で100%オフラインで実行できます。Hugging Faceやローカルファイルから、GGUFやsafetensorsのようなモデル形式を実行できます。

* **MacOS、CPU、Windows、Linux、WSL のすべての環境で動作します！GPUは不要です**
* [**自己修復ツール呼び出し**](#auto-healing-tool-calling)**,** 高度な [**ウェブ検索**](#advanced-web-search), [**コード実行**](#code-execution)
* UnslothをOpenAI互換の推論として使用 [**APIエンドポイント**](/docs/jp/ji-ben/api.md) または [プロバイダーを接続](/docs/jp/tong-he/connections.md)
* 検索 + ダウンロード + 実行 + [比較](#model-arena) GGUF、LoRAアダプタ、safetensorsなど、あらゆるモデル。
* [**自動推論パラメータ**](#auto-parameter-tuning) の調整（temp、top-pなど）とチャットテンプレートの編集
* 画像、音声、PDF、コード、DOCX、その他のファイル形式をアップロードして会話できます。

<figure><img src="/files/aaa485b9d8df9f23ca7f9a74dd165134622cc5e3" alt="" width="563"><figcaption></figcaption></figure>

### Unsloth Studio Chatの使用

{% hint style="success" %}
Unsloth Studio Chatは自動的に **マルチGPU構成** で動作します。
{% endhint %}

{% columns %}
{% column %}

#### コード実行

Unsloth Studioでは、LLMはJavaScriptだけでなくBashやPythonも実行できます。さらにClaude Artifactsのようにプログラムをサンドボックス化できるため、モデルはコードをテストし、ファイルを生成し、実際の計算で回答を検証できます。

これにより、モデルの回答はより信頼性が高く、正確になります。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/d643c6f319ac0b555c11cc9bb355888c0154d9b7" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### 自動修復ツール呼び出し

Unsloth Studioは [ツール呼び出し](#id-50-tool-calling-accuracy)を可能にするだけでなく、壊れたツール呼び出しや不正な形式のツール呼び出しを自動修正し、50%改善します。

つまり、推論出力は常に **壊れたツール呼び出しなしで** 得られます。&#x20;

例: Qwen3.5-4B は20以上のサイトを検索してソースを引用し、その思考トレース内でウェブ検索を行いました。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/44d9105dd956eac31f9586bcf01055a289b0ef3e" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### 高度なウェブ検索

Unslothのウェブ検索は、サイトの要約をただ走査するのではなく、実際にページへ直接アクセスして関連情報やデータを収集します。これにより、より正確で、より詳細な情報とコンテキストを出力できます。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/aaa485b9d8df9f23ca7f9a74dd165134622cc5e3" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### UnslothをAPIエンドポイントとして使用

今では、次のようなツールを通じてローカルLLMを使用できます [Claude Code](/docs/jp/ji-ben/claude-code.md) と [Codex](/docs/jp/ji-ben/codex.md) をUnslothの [APIエンドポイント](#use-unsloth-as-an-api-endpoint)に接続することで。これにより、Unslothの推論を使って、QwenやGemmaのモデルをこれらのツールで直接実行できるようになります。これには自己修復ツール呼び出し、ウェブ検索などの機能が含まれます。
{% endcolumn %}

{% column %}

<figure><img src="/files/77e863c5bd956050b90ee75739b6a07e63ef9f71" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### 自動推論設定

次のような推論パラメータは **temperature**, **top-p**, **top-k**, [**MTP**](/docs/jp/moderu/qwen3.6.md#mtp-guide) Qwen3.5 のような新しいモデル向けに自動で事前設定されるため、設定を気にせず最適な出力を得られます。パラメータを手動で調整したり、システムプロンプトを編集したりすることもできます。

llama.cppのスマートな自動コンテキストにより、コンテキスト長の調整はもはや必要ありません。必要なコンテキストだけを使用し、余分なものは読み込みません。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9b0b9892e8b662cbc435f13f00a5ad38f8db8457" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### プロバイダーを接続

[Unslothは](/docs/jp/tong-he/connections.md) OpenAI、Anthropic、Ollama、llama.cpp、vLLM、その他に接続します。

APIキーまたはモデルサーバーのURLを追加し、ローカルモデルやクラウドモデルと同じチャットインターフェースで外部モデルを使用できます。 [プロンプトキャッシュ](/docs/jp/tong-he/connections.md#prompt-caching)、ツール呼び出し、思考、そしてOpenAIのようなプロバイダー固有の機能で実行できます [ウェブ検索](#web-search-and-thinking) と [コード実行](#code-execution).
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9b0b9892e8b662cbc435f13f00a5ad38f8db8457" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### モデルを検索して実行

Hugging Face経由で任意のモデルを検索・ダウンロードするか、ローカルファイルを使用できます。

Unslothは幅広いモデルタイプをサポートしています。 **GGUF**、視覚言語モデル、音声合成モデルが含まれます。次のような最新モデルを実行できます [Qwen3.5](/docs/jp/moderu/qwen3.5.md) またはNVIDIA [Nemotron 3](/docs/jp/moderu/nemotron-3.md).

画像、音声、PDF、コード、DOCX、その他のファイル形式をアップロードして会話できます。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/9468944971814e81c22a3a467b5eb2468cd1c8ed" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% columns %}
{% column %}

#### チャットワークスペース

プロンプトを入力し、任意のドキュメント、画像（webp、png）、コードファイル、txt、音声を追加コンテキストとして添付すると、モデルの応答をリアルタイムで確認できます。

思考 + ウェブ検索 をオン/オフ切り替え。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/3a0e72692466694a3fa842f51e8edec280a5c5cd" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

### **+50% ツール呼び出し精度**

Unslothには、ツール呼び出しを改善するいくつかの独自機能があります。

* Unslothのすべてのモデルでのツール呼び出しは **30%〜80%高精度です**.
* ウェブ検索は、要約だけでなく実際のWebコンテンツを取得します。
* 許可されるツール呼び出しの最大数は **25回以上です。**
* ツール呼び出しはより確実に終了し、ループや繰り返し呼び出しが減ります。
* ツール呼び出しの修復と重複排除ロジックの改善により、XMLが出力に漏れるのを防ぎます。

以下でテスト結果を確認できます `unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL)` ウェブ検索、コード実行、思考を有効にした状態で:

| 指標            | 通常のツール呼び出し | Unslothのツール呼び出し |
| ------------- | ---------- | --------------- |
| 応答内のXML漏れ     | 10/10      | 0/10            |
| 使用されたURL取得回数  | 0          | 10回中4回          |
| 正しい曲名で実行された回数 | 0/10       | 2/10            |
| 平均ツール呼び出し回数   | 5.5        | 3.8             |
| 平均応答時間        | 12.3秒      | 9.8秒            |

### モデルアリーナ

Unsloth Chatでは、同じプロンプトを使って任意の2つのモデルを並べて比較できます。例: ベースモデルとLoRAアダプタを比較。推論はまず1つ目のモデルを読み込み、次に2つ目を読み込みます（並列推論は開発中です）。

<div data-with-frame="true"><figure><img src="/files/6338694a5689a1272c830162a86559778536fc1b" alt="" width="563"><figcaption></figcaption></figure></div>

{% columns %}
{% column %}
学習後、同じプロンプトでベースモデルとファインチューニング済みモデルを並べて比較し、何が変わったか、結果が改善したかを確認できます。

このワークフローにより、ファインチューニングによってモデルの応答がどう変わったか、また用途に対して結果が改善したかを簡単に確認できます。
{% endcolumn %}

{% column %}

<div align="center" data-with-frame="true"><figure><img src="/files/a110f0d8a2c99deb04e2270595d401597bb9407b" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
Unsloth Studio Chatは自動的に **マルチGPU構成** で動作します。
{% endhint %}

### 古い / 既存のGGUFモデルの使用

{% columns %}
{% column %}
**4月1日の更新:** 既存のフォルダを選択して、Unslothに検出させられるようになりました。

**3月27日の更新:** Unsloth Studioは現在 **古い / 既存のモデルを自動検出します** Hugging Face、LM Studioなどからダウンロードされたもの。
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/08e445b8964d5f915626a551f5f8782386c7aa92" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

**手動手順:** Unsloth Studioは、Hugging Face Hubのキャッシュにダウンロードされたモデルを検出します `(C:\Users{your_username}.cache\huggingface\hub)`。LM Studio経由でダウンロードしたGGUFモデルがある場合、それらは `C:\Users\{your_username}.cache\lm-studio\models` ***または*** `C:\Users{your_username}\lm-studio\models` に保存され、デフォルトではllama.cppからは見えません。Unsloth Studioで読み込むには、それらの.ggufファイルをHugging Face Hubのキャッシュディレクトリ（またはllama.cppがアクセスできる別のパス）に移動またはコピーする必要があります。

Unslothでモデルやアダプタをファインチューニングした後、GGUFにエクスポートして、Unsloth Chat内で **llama.cpp** を使ってローカル推論を直接実行できます。Unsloth Studioはllama.cppとHugging Faceによって支えられています。

### ファイルをコンテキストとして追加

Unsloth Chatは会話内でマルチモーダル入力を直接サポートします。ドキュメント、画像、音声をプロンプトの追加コンテキストとして添付できます。

<div data-with-frame="true"><figure><img src="/files/ae72b1c5627b0aa3d6099a1642a593a4c3a6c6ea" alt="" width="563"><figcaption></figcaption></figure></div>

これにより、PDF、スクリーンショット、参照資料などの実世界の入力をモデルがどう扱うかを簡単にテストできます。ファイルはローカルで処理され、モデルのコンテキストとして含まれます。

### **モデルファイルの削除**

古いモデルファイルは、モデル検索のゴミ箱アイコンから削除するか、デフォルトのHugging Faceキャッシュディレクトリから該当するキャッシュ済みモデルフォルダを削除して消せます。デフォルトでは、Hugging Faceは `~/.cache/huggingface/hub/` をmacOS/Linux/WSLで、また `C:\Users\<username>\.cache\huggingface\hub\` をWindowsで使用します。

* **MacOS、Linux、WSL：** `~/.cache/huggingface/hub/`
* **Windows:** `%USERPROFILE%\.cache\huggingface\hub\`

もし `HF_HUB_CACHE` または `HF_HOME` が設定されている場合は、その場所を使用してください。LinuxとWSLでは、 `XDG_CACHE_HOME` でもデフォルトのキャッシュルートを変更できます。

### **UnslothがGPUを検出しない、または使用しない**

DockerでモデルがGPUを特に使っていない場合は、次を試してください:

最新のイメージを手動で取得:

```bash
 docker pull unsloth/unsloth:latest
```

* GPUアクセスを有効にしてコンテナを起動:
  * `docker run`: `--gpus all`
  * Docker Compose: `capabilities: [gpu]`
* Linuxでは、NVIDIA Container Toolkitがインストールされていることを確認してください。
* Windowsでは:
  * 次を確認してください `nvcc --version` が以下に表示されるCUDAバージョンと一致していることを `nvidia-smi`
  * 以下を参照: <https://docs.docker.com/desktop/features/gpu/>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/jp/xin-zhe/studio/chat.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
