Mistral 3.5 - ローカルでの実行方法
Mistral 3.5 モデルを自分のデバイスでローカルに実行またはファインチューニングするためのガイド
Mistral が Mistral-Medium-3.5-128B をリリースしました。これは新しい dense な 128B パラメータのマルチモーダル・ハイブリッド推論モデルです。テキストと画像入力、テキスト出力、256K のコンテキストウィンドウをサポートし、推論、コーディング、長文コンテキスト、ツール使用、エージェント的ワークフロー、マルチモーダルな文書/画像理解に優れています。
Mistral Medium 3.5 は、自身の5倍のサイズのモデルに対しても非常に競争力のある性能を発揮します。約64GBのRAMでローカル実行できます。GGUF: Mistral-Medium-3.5-128B-GGUF
2026年5月1日更新: Mistral と協力して、一部の実装に影響していた Mistral Medium 3.5 の推論問題を修正し、その修正を含む更新済み GGUF をリリースしました(Unsloth とは無関係 または当社の量子化版です)。この問題は YaRN の解析上の癖によって引き起こされ、 transformers と llama.cppを含むいくつかの実装に影響していました。 mscale_all_dim から 1 へ変更すると 0 解決しました。また、 mmproj ファイルが正しく生成されない問題も修正しました。
Mistral はすでに私たちの修正を公式リポジトリに取り込みました!
使用ガイド
表: Mistral Medium 3.5 の推奨ハードウェア要件。単位は総メモリ(RAM + VRAM、またはユニファイドメモリ)です。
Medium 3.5 128B
64 GB
80 GB
128-170 GB
推奨設定
Mistral 推奨の推論設定を使用してください:
reasoning_effort="none"→ 高速な即時応答、チャット、抽出、簡単な指示向け。reasoning_effort="high"→ 推論モード。複雑なプロンプト、コーディング、リサーチ、数学、エージェント利用に推奨。
推奨サンプリングのデフォルト:
使用する
temperature = 0.7はreasoning_effort="high".使用する
temperature = 0.0へ変更すると0.7はreasoning_effort="none"、タスクに応じて。反復ペナルティとプレゼンスペナルティは無効のままにするか、
1.0ループが見られる場合を除きます。最大コンテキスト長は
262,144
推論モード
Mistral Medium 3.5 は即時指示モードと、'high' オプション付きの推論モードをサポートしています。
llama.cpp / llama-server で高推論を有効にするには:
推論を無効にするには:
Windows PowerShell をお使いの場合は、次を使用してください:
Mistral 3.5 チュートリアルを実行
Mistral Medium 3.5 は dense な 128B モデルなので、ローカル推論の出発点としては Dynamic 4-bit GGUF が推奨されます。GGUF: unsloth/Mistral-Medium-3.5-128B-GGUF
現在、マルチモーダル/ビジョンの GGUF は Ollama 別個の mmproj ビジョンファイルのため動作しません。llama.cpp 互換のバックエンドを使用してください。
使用しないでください CUDA 13.2 そうしないと、意味不明な出力になる場合があります。NVIDIA が修正に取り組んでいます。
🦥 Unsloth Studio ガイド
このチュートリアルでは、 Unsloth Studioを使用します。これは LLM の実行と学習のための新しい Web UI です。Unsloth Studio では、モデルを実行し、 音声、画像とテキストをローカルで Mac、Windows、Linux 上で使用でき、次のことが可能です:
検索、ダウンロード、 GGUF を実行 および safetensor モデル
比較 モデルを 並べて
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-p など)
LLM を学習 VRAM を 70% 削減し、2倍高速

Mistral Medium 3.5 を検索してダウンロード
初回起動時には、アカウントを保護するためのパスワードを作成し、後で再度サインインする必要があります。次に、 Unsloth Chat タブに移動し、検索バーで Mistral 3.5 を検索して、希望のモデルと量子化版をダウンロードしてください。
Mistral 3.5 を実行
Unsloth Studio を使用すると推論パラメータは自動設定されますが、手動で変更することもできます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、 Unsloth Studio 推論ガイド.
🦙 Llama.cpp ガイド
このガイドでは、Mistral Medium 3.5 に Unsloth Dynamic 4-bit を使用します。詳細は以下を参照してください: unsloth/Mistral-Medium-3.5-128B-GGUF.
これらのチュートリアルでは、高速なローカル推論のために llama.cpp を使用します。特に CPU のみ、または大容量ユニファイドメモリ機をお持ちの場合に適しています。
1. llama.cpp をビルド
最新の llama.cpp を GitHub で入手してください。変更するのは -DGGML_CUDA=ON へ変更すると -DGGML_CUDA=OFF GPU がない場合、または CPU 推論だけを使いたい場合は、これを設定してください。Apple Mac / Metal デバイスでは、 -DGGML_CUDA=OFF;Metal サポートはデフォルトで有効です。
2. Hugging Face から直接実行
高推論モードの場合:
3. モデルを手動でダウンロード
インストール後、 huggingface_hub と hf_transfer:
ダウンロードが止まる場合は、次を設定してください:
4. ローカル GGUF を実行
マルチモーダルプロジェクターの GGUF が含まれている場合は、次を使用します:
Llama-server のデプロイ
llama-server 上で Mistral Medium 3.5 をデプロイするには、次を使用します:
推論モードの場合:
Windows PowerShell をお使いの場合は、次を使用してください:
OpenAI 互換のリクエストで llama-server を叩けます:
Mistral 3.5 のベストプラクティス
プロンプト例
シンプルな推論プロンプト
使用する reasoning_effort="high" このスタイルのプロンプトに向いています。
OCR / 文書プロンプト
OCR や文書抽出では、画像を先に置き、構造化された出力を求めてください。
マルチモーダル比較プロンプト
コーディングエージェントプロンプト
使用する reasoning_effort="high" および、コードベースの探索のためのツール呼び出し。
JSON / 関数呼び出しプロンプト
ベンチマーク


最終更新
役に立ちましたか?


