For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral 3.5 - ローカルでの実行方法

Mistral 3.5 モデルを自分のデバイスでローカルに実行またはファインチューニングするためのガイド

Mistral が Mistral-Medium-3.5-128B をリリースしました。これは新しい dense な 128B パラメータのマルチモーダル・ハイブリッド推論モデルです。テキストと画像入力、テキスト出力、256K のコンテキストウィンドウをサポートし、推論、コーディング、長文コンテキスト、ツール使用、エージェント的ワークフロー、マルチモーダルな文書/画像理解に優れています。

Mistral Medium 3.5 は、自身の5倍のサイズのモデルに対しても非常に競争力のある性能を発揮します。約64GBのRAMでローカル実行できます。GGUF: Mistral-Medium-3.5-128B-GGUF

使用ガイド

GGUF の Vision は現時点ではサポートされています。サポートは後ほど追加されます。

表: Mistral Medium 3.5 の推奨ハードウェア要件。単位は総メモリ(RAM + VRAM、またはユニファイドメモリ)です。

Mistral 3.5
3-bit
4-bit
8-bit

Medium 3.5 128B

64 GB

80 GB

128-170 GB

利用可能な総メモリは、ダウンロードする量子化済みモデルのサイズを少なくとも上回っている必要があります。そうでない場合でも、llama.cpp は RAM / ディスクへの部分オフロードで実行できますが、生成速度は遅くなります。長いコンテキスト、より大きなバッチ、ツールを多用するエージェント実行、画像プロンプトには、さらに多くのメモリが必要です。

推奨設定

Mistral 推奨の推論設定を使用してください:

  • reasoning_effort="none" → 高速な即時応答、チャット、抽出、簡単な指示向け。

  • reasoning_effort="high" → 推論モード。複雑なプロンプト、コーディング、リサーチ、数学、エージェント利用に推奨。

推奨サンプリングのデフォルト:

  • 使用する temperature = 0.7reasoning_effort="high".

  • 使用する temperature = 0.0 へ変更すると 0.7reasoning_effort="none"、タスクに応じて。

  • 反復ペナルティとプレゼンスペナルティは無効のままにするか、 1.0 ループが見られる場合を除きます。

  • 最大コンテキスト長は 262,144

推論モード

Mistral Medium 3.5 は即時指示モードと、'high' オプション付きの推論モードをサポートしています。

llama.cpp / llama-server で高推論を有効にするには:

推論を無効にするには:

Windows PowerShell をお使いの場合は、次を使用してください:

Mistral 3.5 チュートリアルを実行

Mistral Medium 3.5 は dense な 128B モデルなので、ローカル推論の出発点としては Dynamic 4-bit GGUF が推奨されます。GGUF: unsloth/Mistral-Medium-3.5-128B-GGUF

Unsloth Studio で実行llama.cpp で実行

🦥 Unsloth Studio ガイド

このチュートリアルでは、 Unsloth Studioを使用します。これは LLM の実行と学習のための新しい Web UI です。Unsloth Studio では、モデルを実行し、 音声、画像とテキストをローカルで Mac、Windows、Linux 上で使用でき、次のことが可能です:

1

Unsloth をインストール

MacOS、Linux、WSL:

Windows PowerShell:

2

Unsloth Studio のセットアップ(1回のみ)

セットアップにより、Node.js(nvm 経由)の自動インストール、フロントエンドのビルド、すべての Python 依存関係のインストール、CUDA サポート付きの llama.cpp のビルドが行われます。

WSL ユーザー向け: 次の入力を求められます: sudo ビルド依存関係をインストールするためのパスワード(cmake, git, libcurl4-openssl-dev).

3

Unsloth を起動

MacOS、Linux、WSL:

Windows PowerShell:

次に開きます http://localhost:8888 をブラウザーで。

4

Mistral Medium 3.5 を検索してダウンロード

初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。次に、 Unsloth Chat タブに移動し、検索バーで Mistral 3.5 を検索して、希望のモデルと量子化版をダウンロードしてください。

5

Mistral 3.5 を実行

Unsloth Studio を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。

詳細については、 Unsloth Studio 推論ガイド.

🦙 Llama.cpp ガイド

このガイドでは、Mistral Medium 3.5 に Unsloth Dynamic 4-bit を使用します。詳細は以下を参照してください: unsloth/Mistral-Medium-3.5-128B-GGUF.

これらのチュートリアルでは、高速なローカル推論のために llama.cpp を使用します。特に CPU のみ、または大容量ユニファイドメモリ機をお持ちの場合に適しています。

1. llama.cpp をビルド

最新の llama.cpp を GitHub で入手してください。変更するのは -DGGML_CUDA=ON へ変更すると -DGGML_CUDA=OFF GPU がない場合、または CPU 推論だけを使いたい場合は、これを設定してください。Apple Mac / Metal デバイスでは、 -DGGML_CUDA=OFF;Metal サポートはデフォルトで有効です。

2. Hugging Face から直接実行

高推論モードの場合:

3. モデルを手動でダウンロード

インストール後、 huggingface_hubhf_transfer:

ダウンロードが止まる場合は、次を設定してください:

4. ローカル GGUF を実行

マルチモーダルプロジェクターの GGUF が含まれている場合は、次を使用します:

Llama-server のデプロイ

llama-server 上で Mistral Medium 3.5 をデプロイするには、次を使用します:

推論モードの場合:

Windows PowerShell をお使いの場合は、次を使用してください:

OpenAI 互換のリクエストで llama-server を叩けます:

Mistral 3.5 のベストプラクティス

プロンプト例

シンプルな推論プロンプト

使用する reasoning_effort="high" このスタイルのプロンプトに向いています。

OCR / 文書プロンプト

OCR や文書抽出では、画像を先に置き、構造化された出力を求めてください。

マルチモーダル比較プロンプト

コーディングエージェントプロンプト

使用する reasoning_effort="high" および、コードベースの探索のためのツール呼び出し。

JSON / 関数呼び出しプロンプト

ベンチマーク

最終更新

役に立ちましたか?