Unslothの更新情報
最新リリース、改善、修正に関するUnslothの変更履歴。
最新の変更を使うには、 Unsloth を更新.
Qwen3.8-Flash + GLM-5.3 が2倍高速
実行 Qwen3.8-Flash-Next と GLM-5.3-Flash 最大 2倍高速 な高速デコードと追加の MTP により、今ではデフォルトで有効です。このリリースにはさらに 170件以上の改善 が含まれ、学習、チャット、ハードウェア対応、API、性能の各方面にわたります。
MTP による Qwen と GLM の生成高速化に加え、ツール利用の改善と推奨 Qwen 設定も含まれます。
すべてのチャット、とくに長い会話で UI/UX の遅延が大幅に軽減
新たに対応: MiniMax-Music3、Higgs、MOSS の音声モデル。進捗追跡やクリップ管理も含まれます。
ローカルサーバーと接続済みプロバイダー全体で、モデル読み込みの信頼性が向上。
ツール呼び出し、返信、メディア、会話ブランチを保持する、より安全なチャット編集。
マルチGPU学習、メモリ収まり、モデル配置、GGUF エクスポートを改善。
AMD/ROCm のインストール、検出、GPU 互換性がより堅牢に。
MCP、Deep Research、OAuth、並列ツール呼び出し、エージェントワークフローの信頼性向上。
向けの新しい OpenAI 互換 API: 動画、音声、MLX 配信モデル.
デスクトップ更新、LAN ポート制御、ダウンロード、GPU メモリのクリーンアップを改善。
Qwen3.8-Flash-Next + GLM-5.3
Qwen3.8-Flash-Next, GLM-5.3-Flash + GLM-5.3 が、今や Unsloth でローカル実行できます!
Qwen3.8-Flash は 75GB RAM で動作
GLM-5.3-Flash は 102GB RAM + VRAM で動作
RAM オフロードが最大5倍高速
繰り返し Auto Compaction が今では安定して動作
チャット、信頼性、性能の改善が100件以上

Qwen3.8-Flash-Next
125B のマルチモーダル推論モデルと、Qwen4 のアーキテクチャの初期プレビュー。
1-bit Dynamic GGUF は 75GB RAM または統合メモリで動作
テキストと画像で最大 262K のコンテキスト
推論モードは None、Low、Medium、Extra High
Preserved Thinking により長いチャットでの一貫性が向上
GLM-5.3-Flash
18B のアクティブパラメータを持つ 320B マルチモーダルモデル。
1-bit モデルは 102GB の RAM + VRAM 合計で動作
テキスト、画像、文書で最大 1M のコンテキスト
推論モードは Low、High、Max
コーディング、エージェント、視覚性能の改善
Unsloth の改善
大きな GGUF は GPU とシステム RAM に自動で分割
読み込み前にメモリ見積もりを確認
切断後にチャットが復元
複数画像の視覚処理と MCP 画像対応の改善
チャットを JSONL としてエクスポート
Auto Compaction の制御を改善
Linux、NVIDIA Wayland、AMD、Windows の修正
新しいモデルを実行または学習するには、Unsloth Desktop をダウンロードできます:
自動圧縮 + LAN アクセス
先週の Qwen3.8-27B と Unsloth Desktop へのサポート、ありがとうございます! 私たちの 新しい v0.1.801-beta リリースでは、200件以上の PR を統合し、次のような多くの新機能や修正を導入しました:
自動圧縮(実験的) コンテキスト制限を超える長いチャット向け
リモート & LAN アクセス(プレビュー) Cloudflare リンクなしで簡単にネットワークアクセスするため
より高速なチャット ストリーミング性能の改善、UI 遅延の低減、長い会話の滑らかさ向上。
対応: カスタム llama.cpp ビルド。Cache RAM、Mmap、Mlock、Checkpoints、Spe Decoding KV Cache、Vision のオン/オフ切り替え
Unsloth Dynamic v3.0 をリリースしました。新しい Qwen3.8-27B Dynamic v3.0 GGUF は、他のどれよりも 1位精度が10%以上高くなっています。Unsloth で動作します。
自動圧縮(実験的)
長いチャットは、古いターンを検索可能なアーカイブへ移すことで、コンテキスト制限を超えられるようになりました。
古いターンは必要なときだけ削除され、検索可能なまま残ります。
新鮮なコンテキストのエポックにより、チャットを恒久的に削らずに想起性能が向上します。
要約ではなく検索を使うため、精度が向上します。
リモート & LAN アクセス(プレビュー)
ネットワーク上の他のデバイスから Unsloth にアクセスできます。
新しいリモートアクセス設定。
LAN 制御、QR コード、自動起動オプション。
セキュリティのためデフォルトでは無効。
チャットの改善
長いチャットをより高速にし、スレッド処理を改善。
Projects はチャット、ファイル、ワークスペースを整理します。
プロンプトのキューイング、ショートカット、
edit_file、およびツール対応の改善を追加。
ハードウェア、推論、API
カスタム llama.cpp ビルドと Intel XPU をサポート。
より多くの推論制御(cache、mmap、mlock、checkpoints、speculative decoding、vision)。
GPU の検証、VRAM 処理、互換性を改善。
Responses API での構造化出力。
llama-server の復旧を改善。
Qwen3.8 を実行または学習するには、Unsloth Desktop をダウンロードできます:
Qwen3.8
Qwen3.8-27B と Qwen3.8-2.4T が、今や Unsloth でローカル実行できます!
Unsloth Dynamic GGUF を使えば 17GB RAM で動作します。Qwen3.8-27B を Unsloth でファインチューニングすることもできます。Qwen3.8-27B は、そのサイズで断然最強のモデルです。NVFP4 の量子化もアップロードしました。

その他の Unsloth の更新には次が含まれます:
Qwen3.8-27B + 追加の llama-server 引数を許可 + カスタム VRAM 切り替え
外部プロバイダーでツール呼び出し + ツール対応 + Codex でのログイン
高速 FP8 により MiniMax-H3 の推論が10倍高速(3分対30分)
GGUF の推論が10%高速化 + Bypass 権限の修正
接続済み API プロバイダー は、独自の検索または Unsloth Desktop 内蔵の検索とツールを使用できます。ツールの結果はモデルに返され、複数ステップのタスクを継続できます。
Codex サブスクリプションでサインインし、Chat 内で Codex ツールを使用できます。
Qwen3.8 を実行または学習するには、Unsloth Desktop をダウンロードできます:
Unsloth Desktop の紹介
Unsloth Desktop 🦥 の紹介 - モデルをローカルで実行・学習する最初のデスクトップアプリです。 オープンソース。Mac、Windows、Linux で動作
• MLX、拡散画像/動画、音声、GGUF をサポート • Claude Code と Codex をローカル LLM に接続 • 50%高精度の自己修復ツール呼び出し + サンドボックス化されたコード実行 • CPU + マルチGPU 構成で動作 - NVIDIA、AMD、Intel、Mac • VRAM を70%削減してモデルを2倍高速で学習 • プライベート Web 検索、Deep Research、RAG、MCP + エクスポート(NVFP4、GGUF) • Unsloth の OpenAI 互換 API とクラウドモデルを使用 • LLM を安全にリモート展開し、どこからでもアクセス
今すぐ Unsloth Desktop をダウンロードできます:
Meta Muse Glimmer が登場!
Meta は、Meta Superintelligence Labs から初のオープンモデルである Muse Glimmer をリリースしました。Muse Glimmer は Meta による疎ではない 30B パラメータモデルで、ローカルのエージェント的・コーディング作業向けに構築されています。Apache 2.0 ライセンスで公開されており、最高の性能を得るには Unsloth と Unsloth Dynamic の量子化を使って Muse Glimmer 30B を実行できます。
Muse Glimmer 30B はローカルで実行できます 20GB RAM/VRAM の構成で、Mac や GPU を含みます。さらに、Unsloth を使って Muse Glimmer 30B を 20GB VRAM.
で学習・ファインチューニングすることもできます。Unsloth Desktop アプリから Muse Glimmer を実行・ファインチューニングできます:
Kimi K3 + Deep Research + 並列チャット
皆さん、こんにちは! Kimi K3 が、今や Unsloth Dynamic GGUF でローカル実行でき、Unsloth は複数のチャットを並列生成で維持でき、新しい Deep Research モードはローカルモデルを使って計画し、読み、情報源を引用します。
このリリースでは、さらに AMD と Intel GPU のサポート、DoRA 学習、そして多くのインストーラ、MLX、エクスポート、推論の修正も追加されています。
Kimi K3
Moonshot AI の Kimi K3 は、104B のアクティブパラメータ、ネイティブな視覚サポート、1M コンテキストウィンドウを備えた 2.8T パラメータの MoE モデルです。Kimi K3 は推論専用で、Unsloth は low、high、max の推論強度をサポートします。
私たちの Kimi K3 Dynamic GGUF を Unsloth 経由で実行できます。Unsloth は複数 GPU 構成を自動検出し、モデル層をシステムメモリへオフロードできます。
Kimi K3 は非常に大きなモデルなので、ハードウェアはそれに応じて計画してください:
UD-IQ1_Sはディスク容量 595GB です。UD-Q4_K_XLはディスク容量 1.51TB です。損失なし推論には、
UD-Q8_K_XLを使用してください。これはディスク容量 1.56TB です。
完全版の Kimi K3 ガイド を読み、さらに Unsloth Dynamic 2.0 GGUF.
並列チャット
Unsloth は、今や複数の会話を同時に実行できます。 新しいチャット を開始すると、前の回答は生成されたままになり、アクティブな各会話には独自の進捗インジケーターと停止コントロールが付きます。
デフォルトで 4 つの llama-server スロット。Web UI で調整可能。
ツール、アップロード、自己修復、エージェントはチャット間で分離されたままです。
他を中断したりサーバーを再起動したりせずに、1つのチャットだけ停止できます。
メモリが限られている場合、Unsloth はスロット数を減らします。
モデルの再読み込みでも、確認後にアクティブなチャットは停止されます。
Deep Research
Deep Research はローカルモデルを完全なリサーチワークフローに変えます。質問を与えると、計画を作成し、Web を検索し、証拠を整理し、引用付きレポートを作成します。
リサーチ開始前に計画を確認・編集できます。
作業中は進捗と収集済みソースを追跡できます。
完了したリサーチを失わずに再開またはキャンセルできます。
ソース選択を制御するために、Web サイトを許可またはブロックできます。
ソースと引用は各実行ごとに保存されたままになります。
書き始める前に、Unsloth は未対応の主張、矛盾、未解決の欠落をチェックします。直接的な証拠のない推奨は、検証可能な推論としてマークされます。
1回の実行は各チャットにつき1つまでアクティブにできます。Deep Research は現在ローカルモデルで動作します。任意の全ページ grounding により、上位の検索結果を要約前に一時的な RAG に読み込めます。これを有効にするには UNSLOTH_RESEARCH_AUTO_SCRAPE=1を設定します。スクレイピング時間が追加され、追加のコンテキストが必要なため、デフォルトでは無効のままです。
AMD サポートの改善
この更新は、最初の AMD リリースとセットアップガイド を基に、さらに多くの GPU と、より信頼性の高い ROCm 推論・学習をサポートします。
RDNA2、Radeon、Ryzen、Strix Halo、ワークステーション GPU の検出を改善。
MI50 と Radeon VII は、Linux で16-bit LoRA とフルファインチューニングをサポート。
4-bit の NaN、ライブラリ競合、長い RDNA 起動停止を修正。
未対応の Windows HIP GPU は Vulkan にフォールバックできます。
Vulkan デバイスは実際の名前が表示され、個別に選択できます。
クリーンな Windows インストールでは Winget や開発者ツールが不要になりました。
学習、モデル、プラットフォーム更新
Intel XPU により、Intel Arc およびデータセンター GPU でのローカルチャットと学習が可能になります。
DoRA は LoRA とフルファインチューニングに加えて利用できます。
大きなエクスポートでは、GPU 0 のメモリ制限を避けるため、表示されているすべての GPU を使用できます。
MLX はストリーミングデータセット、継続事前学習、コールバック、より良い VLM と LoRA 対応を追加します。
誤っていた
flash_attention_2のモデル出力を修正。Unsloth と保存ユーティリティは bitsandbytes なしで動作するようになりました。
修正
.jsonデータセットと Qwen3.5/3.6 MoE および GRPO ノートブックのセットアップ。Hub のダウンロードフォルダを見つけやすく開きやすくしました。
リリースノートは Unsloth の更新ポップアップで確認できます。
unsloth start --as-subagentで、Codex、Claude Code、Pi がタスクをローカルの Unsloth モデルに委任できます。
AMD サポートが登場しました!
皆さん、こんにちは!このリリースでは、ローカル LLM の学習と推論が AMD GPU で Windows、WSL、Linux 全体に対応します。
本日より、私たちの AMD との連携、カスタム Triton カーネル、数値演算アルゴリズムにより、AMD の Radeon、Instinct、Vulkan、Ryzen、データセンター GPU で500以上のモデルを学習・実行できるようになります。VRAM を70%削減し、精度を落とさずに最大2倍高速です。最適化された ROCm ビルドは GGUF と Safetensors の推論もサポートします。
7月23日アップデート
追加 RDNA2、Gorgon Halo、Vulkan サポート + Strix Halo / その他の AMD GPU で AMD インストール時に GPU を検出しない問題を修正
RDNA4 の改善、HIP / ROCm 失敗の自動修復と検出
統合メモリが2倍高速 AMD safetensors の読み込み + 統合メモリデバイス向けの大幅に高速化した gradient checkpointing
追加 音声ディクテーション / whisper.cpp 高速なテキスト読み上げの予備サポート
インストール時のロールバック環境が 5GB のディスク容量を食っていた問題を修正 - 今では自動クリーンアップ
AMD でローカル LLM を学習
AMD GPU 上で、ローカルにモデルを学習、実行、RL、チャット、デプロイできます。
Windows、WSL、Linux 全体で AMD GPU の検出とインストールの信頼性を向上。
AMD MI300X および MI325X GPU 向けの ROCm 互換性を改善。
以下を通じて Unsloth にリモートアクセス:
unsloth studio --secureCloudflare 経由の無料 HTTPS
お使いのハードウェアでより大きなモデルを実行
自動 GPU 配置を使うか、使用する GPU とモデル層を正確に選択できます。
MoE の expert 層をシステムメモリへ移し、大きなモデルを収めやすくします。
モデルを複数 GPU に分割するか、Tensor Parallelism を使います。
各モデルと量子化ごとにハードウェア設定を個別保存。
より高速なチャット再開と、より信頼性の高いダウンロード
アイドル状態のモデルが VRAM を解放したあと、会話全体を再構築せずに長いチャットを再開できます。
停止した Hugging Face XET のダウンロードは、自動的に標準 HTTP で再試行されます。
モデル読み込み時に毎回再ダウンロードする代わりに、既存の GGUF ファイルを再利用します。
検索、ツール、エージェントの改善
Web 検索で PDF 論文、マニュアル、その他の PDF 結果を読み取れるようになりました。
並列ツール呼び出し、推論出力、ツールの再試行がより信頼性高く動作します。
新しいオプトインの MCP エンドポイントにより、対応 AI クライアントはモデルと学習履歴を確認し、学習を開始/停止し、チェックポイントを読み込み、レシピを検証し、GGUF をエクスポートできます。
これを有効にするには
UNSLOTH_STUDIO_ENABLE_MCP=1を設定し、必要なベアラートークンをUNSLOTH_STUDIO_MCP_TOKEN.
学習とエクスポートの修正
マルチモーダルモデルでのテキストのみ学習では、パッキング前に長い例が切り詰められなくなりました。
ファインチューニングした Qwen3.5 と Qwen3.6 の MTP モデルが、GGUF に正しくエクスポートされるようになりました。
最終書き込み段階で GGUF エクスポートを止めていた可能性のある Windows の権限エラーを修正。
見逃していた方へ
前回の Studio リリースでは、Dynamic NVFP4 モデル、より深いパーソナライズ、7つの新しい表示言語、より安全なエージェント、Vulkan GPU アクセラレーションが追加されました。
Dynamic NVFP4:
Unsloth Dynamic NVFP4 は、精度に敏感な層を FP8 または BF16 に保ちつつ、残りを W4A4 で実行します。NVIDIA Blackwell GPU では、これにより最大2.5倍高速な推論が可能になり、調整済み FP8 KV キャッシュによりコンテキストを最大2倍長くできます。
こちらを読む Dynamic NVFP4 ガイド を読み、拡張された NVFP4 コレクションを探索してください。Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash、Gemma 4 を含みます。
Studio を自分好みにカスタマイズ:
Standard、Classic、Minimal のカラーパレットから選べます。それぞれにライトモードとダークモードがあります。色のカスタマイズ、フォントのインポート、フォントサイズ、コントラスト、モーション軽減などの調整も可能です。
Unsloth には、ディクテーション、カスタム辞書設定、読み上げ用の Voice 設定タブも含まれます。
新しい言語:
Unsloth Studio は、簡体字中国語、日本語、ブラジルポルトガル語に加え、フランス語、ドイツ語、スペイン語、ヒンディー語、アラビア語、ロシア語、韓国語でも利用可能になりました。ブラウザー言語の自動検出がデフォルトになります。
より安全なエージェント:
4段階のツール呼び出し権限セレクター-確認, 自分に代わって承認, オフ と フルアクセス—エージェントをより細かく制御できます。エージェントのワークスペース分離と、より安全なインストーラチェックも、意図しない変更のリスクを減らします。
パーソナライズ、NVFP4、言語
皆さん、Unsloth にたくさんの新しい更新、特にカスタマイズが入りました。Unsloth は今や自分好みに設定できます:3つのカラーパレットとカスタム色・フォント、7つの新しい表示言語、ディクテーションと読み上げ用の新しい Voice 設定タブ。エージェントは4段階のツール呼び出し権限セレクター(確認、自分に代わって承認、オフ、フルアクセス)とワークスペース分離でより安全になり、Intel GPU は新しい Vulkan による GPU アクセラレーション推論をついに利用できます llama.cpp 対応。
さらに、ネイティブ対応も追加しました Inklingを。これは 9750億パラメータのオープンモデルで、410億のアクティブパラメータと最大100万トークンのコンテキストウィンドウを備えています。Apache 2.0 ライセンスで公開されており、テキスト、画像、音声を受け取り、テキストを生成します。
Dynamic NVFP4
私たちは NVFP4 コレクション に、Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash、Gemma 4 の量子化版を追加しました。
こちらを読む Dynamic NVFP4 ガイド 詳細はこちら。
Unsloth を自分好みに設定
Unsloth はもはやライトモードとダークモードだけではありません:
から選択できます Standard, Classic、そして Minimal のパレットを、それぞれライト版とダーク版付きで。
アクセント、背景、前景の色をカスタマイズできます。
UI、見出し、チャット、コードのフォントを自分のものに差し替えられます。
フォントサイズ、コントラスト、動き、カーソル動作、フォントスムージングを調整できます。
検索設定と同期設定をデバイス間で同期。
ライトモードとダークモードは、それぞれ独自のカスタマイズ値を保持します。
7つの新しい言語
Unsloth は今や、簡体字中国語、日本語、ポルトガル語に加えて、フランス語、ドイツ語、スペイン語、ヒンディー語、アラビア語、ロシア語、韓国語をサポートします。ブラウザー言語の自動検出がデフォルトになりました。
音声設定
新しい Voice タブで、ディクテーション、発音辞書、読み上げの操作が追加されました。音声入力と音声出力のサポートは近日公開予定で、完全な音声会話はまだ開発中です。
より安全なエージェントとツール呼び出し
旧バイパス切り替えは、4段階の権限セレクターになりました:
確認: すべてのツール呼び出しを承認します。
自分に代わって承認: 読み取り専用の操作は自動で実行し、危険の可能性があるものでは一時停止します。
オフ: ツール呼び出しを無効化します。
フルアクセス: すべての呼び出しを許可し、サンドボックスを無効化します。
これらの制御は、ターミナル、Python、Web 検索、RAG、MCP ツールに適用されます。エージェントには分離されたワークスペース、 --persistを使った再開可能なセッション、より安全なリモートインストーラ警告、ライブのツール出力ストリーミング、改善された Web 抽出も備わります。
Vulkanと llama.cpp
新しいVulkan llama.cpp バックエンドにより、Intel GPUでCPUにフォールバックする代わりにGPUアクセラレーション推論が可能になります。既存のVRAM管理、自動コンテキストサイズ調整、複数GPU選択、レイヤーのオフロードをサポートします。
AMDユーザーは次を設定すると有効にできます:
UNSLOTH_FORCE_VULKAN=1更新の信頼性、モデル状態の復元、停止した生成の中断も改善しました。
モデルとトレーニング
このリリースには以下も含まれます:
ネイティブInkling対応と、B200のマルチGPU改善。
DeepSeek-V4のeager attentionと、学習可能なFP8グループ化エキスパート。
チャットテンプレートのマーカーを自動検出することで、後半のみ学習を確実に行えます。
無効化されたgradient checkpointingの正しい処理。
RoPEスケーリングとコンテキスト拡張の改善。
停止したトレーニング実行の強制停止。
新しいモデルアーキテクチャと、より新しいTransformersリリースへの自動ルーティング。
DeepSeek-V4 + NVFP4
Unslothは今や、学習後にNVFP4、FP8、imatrix GGUFをエクスポートできるようになりました。llama-swap APIシステムとして動作し、日本語とブラジルポルトガル語のサポートを追加し、MLX、safetensors、tool calling、healingサポートなども含みます。Unsloth coreはGRPOを1.3倍高速化し、停止したダウンロードのHTTPフォールバックを追加し、オフラインモードを改善し、MoE学習を3〜5倍高速化し、多くのバグを修正します。このリリース系列では unsloth>=2026.7.1.
DeepSeek-V4-Flash が、Thinkingトグルと改善されたチャットテンプレート修正でサポートされるようになりました。

より賢いOpenAI互換API提供
より安全なモデル切り替えと、より良いエージェントツール復旧で、1つのローカルAPIエンドポイントを実行できます。
APIリクエストは、ダウンロード済みのローカルGGUF間の自動切り替えを有効にできます。一方、未知のモデル名は安全に現在のモデルを使い続けます。
/v1/modelsは、ローカル.ggufパスの代わりに、クリーンなモデルIDとローカルGGUFカタログを返すようになりました。アイドル時の自動アンロードで非アクティブ後にVRAMを解放でき、tool-call healingもリクエストごとに制御できるようになりました。
エクスポートの改善
エクスポートはより柔軟になり、不要なダウンロードを避けます。
ポータブルFP8/INT8、GGUF LoRA、ソース一致エクスポート、imatrix GGUF、圧縮FP8/FP4を含む複数のエクスポート形式を一度に選択できます。
複数チェックポイントのエクスポートで、ベースモデルの繰り返しダウンロードをさらに減らせます。
FP8、INT8、GGUF-LoRAのエクスポートは
trust_remote_codeを尊重するようになり、GGUFエクスポートは不足している量子化設定をより確実に処理します。
RAGとファイルチャット
ファイルチャットは実際の文書でさらに便利になりました。
RAG添付は、文書全体のコンテキストを使用でき、埋め込みモデルとHugging Face検索をカスタマイズできます。
ファイルチャットは、右から左へのテキスト、インド系文字、DOCXの表を含む、より多くのPDFやWord文書を正しく読み取ります。
ローカルRAGのチェックは、プロキシ環境の背後でもより信頼性が高くなりました。
Unslothの磨き込みと信頼性
日常利用がよりスムーズで安定して感じられるはずです。
長時間のトレーニングやチャット実行が、静かにフリーズしにくくなりました。
比較モード、モデル切り替え、モデルキャンセル、Hubの閲覧、Hub Discoverの信頼性が向上しました。
プロジェクトのエクスポート、チャットのエクスポート、設定、ガイドツアー、ファイルダイアログ、更新画面、推論UIがよりきれいで一貫したものになりました。
インストーラ、ハードウェア、プラットフォームの修正
Unslothは、より多くのプラットフォームでより確実にインストール・実行できます。
macOSのインストールでは、ビルド済み
llama.cppが利用可能な場合、CMakeやHomebrewが不要になり、Apple Siliconサポートではスペースを含むパスやユニファイドメモリのサイズ調整をより適切に扱います。Windowsの起動、UTF-8処理、ROCmのRAG埋め込み、ROCm on WSLのGPUサポートが改善されました。
Blackwell GPUのビルド済み選択、GGUFの収まりチェック、vision/mmproj GGUFのtensor parallelism、ローカル
llama.cppの再利用が、より信頼性の高いものになりました。
トレーニング、モデル、カーネル
より多くの環境で、トレーニングとモデルの読み込みがより信頼できるようになりました。
GRPOはデフォルトでシーケンスパッキングをサポートし、共有プロンプトの繰り返しを避け、DDPのlogitスケーリングを正しく処理するようになりました。
フルファインチューニング、RL精度設定、gradient checkpointing、DDP RoPEバッファ、MoE LoRA検出を修正しました。
FP8量子化/逆量子化、Transformers v5でのLlama 3 RoPEスケーリング、PEFT 0.19のLoRA再読み込み、
fast_generateのエラーメッセージが改善されました。
GLM 5.2 + Hub + 3倍長いコンテキスト
GLM-5.2 がUnsloth Studioでサポートされるようになりました!すべての推論レベルをサポート。 3倍長いコンテキスト長 は、MTPを使った新しい自動フィットアルゴリズムで実現できるようになり、より長いチャットが可能になりました。権限バイパスモード、分岐可能なチャット、キュー可能なチャット、モデル発見用の新しいHub、parallel modules + HTTPS Cloudflareサポートなども追加! unsloth studio --secure を使って、安全なHTTPSのグローバルアクセスを有効にしましょう!
より良いコンテキスト長アルゴリズム
に従って PR 1 と PR 2、Unsloth Studioのメモリ使用量とコンテキスト長の判定を大幅に改善し、全体で3倍長いコンテキストを実現しました:
1x 32GBパイプライン(約31 GB空き)
f16
23,040
64,000
q8_0
43,520
114,944
q4_0
82,432
199,680
2x 32GBパイプライン
任意
262,144
262,144
2x 24GB tensor(約23 GB空き)
f16
134,049
262,144
q8_0
252,329
262,144
チャットキャンバス、分岐、キューイング
アシスタントメッセージをその場で編集し、スレッド内の任意の地点から再実行できます。
スレッドを分岐させ、元の会話を失わずに会話を枝分かれできます。
何も残さない一時的な(シークレット)チャット。
生成がまだ実行中でも、待たずに新しいプロンプトをキューに入れられます。
チャットの「アーティファクト」は現在 キャンバスで、インラインの HTMLキャンバスカード は自動レンダリングされ、Codeビューがあり、DiffusionGemmaでは生コードが折りたたまれずにインライン表示されたままになります。
チャット検索はすべてのメッセージを対象にし、自分のメッセージを最初に表示するようになりました。
Hub(再設計)
トレンドフィード、検索、カスタムモデルパス対応を備えたフルページのHub。
分割ビューのフィードでREADMEをプレビューし、ダウンロード前に読めます。
ダウンロードの既定はより高速な Xet 転送になり、転送が止まった場合は自動でHTTPフォールバックします。
モデル読み込み前に読み込みオプションを設定できる、新しい「選択時に読み込む」トグル。
DiffusionGemmaと将来のGemma派生モデル向けにGoogleロゴを表示。
モデルと推論
DeepSeek-OCRやその他の視覚モデルが、エラーなく読み込まれ実行されるようになりました。
最新のvLLM(0.22+)での高速推論を修正し、再び高速化が機能するようになりました。
tensor parallelismはより信頼性が高くなりました。より高速なMTP経路が失敗しても、クラッシュせずに自動で復旧します。
DiffusionGemmaでは、ノイズ除去中の画像生成がライブ表示され、正確な速度統計も表示されるようになりました。
セキュリティとCloudflare暗号化Studio
新しい
--secureCloudflare限定モードにより、エンドツーエンド暗号化されたStudioを実現し、サーバー側ツールは--secureの下で有効なままになります。unsloth studio --secure!必要なときはBypass Permissionsモードを使って確認を省き、ツールサンドボックスを無効にできます。
Hugging Faceのウイルススキャンと、リポジトリ内の危険なファイルを自動検出。
ログとAPI
新しい APIサーバーモニター をUnslothに追加。
API呼び出しが高速化され、レイテンシーが減少
ログが大幅に整理され、スループットとレイテンシーが表示され、肥大化したログの多くを削除しました。
ハードウェアとバックエンド
Blackwell RTX 50Xおよび60X GPUのサポートを改善
CPUではなくGPUにサイレントにダウングレードされる不具合を修正
torchaoのバージョンは、インストール済みのtorchから選択されるようになりました。
インストーラは、壊れたPyTorchやCPU専用のPyTorchインストールを自動修復し、NVIDIA + AMDのWin/Linux/Mac/WSL全体でサイレントCPUフォールバックを警告するようになりました。
トレーニング開始時にチャットモデルのVRAMを解放しますが、GPUが本当に逼迫している場合にのみ行い、それ以外では不要な再読み込みはしません。
llama-serverが起動時に致命的クラッシュした場合、Unslothは単に失敗するのではなく、復旧手順を順に試すようになりました。
トレーニングと一般修正、並列モジュール
MLXトレーニングの更新。
vLLMでのGRPOトレーニング信頼性を改善。
トレーニング開始の信頼性を向上し、無効なVLMバッチに対してより明確なエラーを表示。
クラッシュ、再起動、中断されたシャットダウン後に残ったバックエンドプロセスを、より確実にクリーンアップするようになりました。
エクスポート、チャット、トレーニング、レシピはすべて個別化/分離されています!つまり、今では4つを並行して実行できます!トレーニングやエクスポートを待っている間に、チャットや推論ができます!
Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexDiffusionGemma + Gemma 4 MTP
最新の v0.1.464-beta または 2026.6.7. DiffusionGemma, Gemma 4 MTP と MiniMax-M3 がすべてサポートされるようになりました。
実行して学習 DiffusionGemma 経由で Unsloth Studio.
Gemma 4 MTP が登場しました!実行 Gemma 4 はMTPで約2倍高速。
Gemma 4では音声チャットがサポートされました(
wav,mp3,m4a,flac,webm).Gemma 4にPreserve Thinkを追加。

Hub + ダウンロードマネージャー(実験的)
新しい Hub ページを追加し、Hugging Faceのモデルやデータセットを閲覧、ダウンロード、管理できるようにしました。
Unslothは、すでにマシン上にあるモデルとデータセットを検出し、ダウンロード済みアセットと並べて表示できるようになりました。
ダウンロード済み GGUFモデル は今や直接 実行 / 新しいチャット アクションを持ちます。
RAG / ファイル付きチャット(実験的)
追加 ファイル付きチャット がUnslothに追加され、自分の文書や知識ベースに対して質問できるようになります。
ハイブリッド検索、引用、PDFプレビュー、スレッドごとの文書、組み込みの
search_knowledge_baseツールをサポートします。
新しい更新ボタン + ハードウェアサポート
Unslothは今や、常に最新の llama.cppビルド済み をCUDA、ROCm、Windows、Linux、macOS全体で使用します。
アプリ内の llama.cppを更新 ボタンを追加し、Unslothを再インストールせずにローカルバックエンドを更新できるようにしました。
Windows / WSLのAMDサポートを改善し、 Strix Halo ROCmサポート, BlackwellのCUDA選択、そしてより明確なインストーラメッセージを追加。
ローカルチャット、ツール、API互換性
ローカル tool calling の信頼性が向上し、ツールカードの並び順が改善され、重複するツールループが減り、GGUF visionモデルでのツール使用もサポートされました。
改善された OpenAI互換API とAnthropic互換APIの動作を、ローカルUnslothサーバー向けに改善しました。エラー、トークン使用量、停止理由、 Claude Code互換性.
トレーニングと修正
チャット、メニュー、モデルピッカー、ダークモード、インポート/エクスポート、設定全体にわたって多くのUI磨き込み修正を追加しました。
Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iexGemma 4 12B、新UI、MCP、プロジェクト
この更新は主にGemma 4 12B、MCP、プロジェクト、Canvas、CUDA 13.3、新しいチャットUIに焦点を当てています。来週はさらに大きな更新を予定しています。

Gemma 4 12B
Googleが公開 Gemma 4 12B、8GB RAMでローカル実行できる新しいモデル。 GGUF / ガイド
Gemma 4 12B Unifiedは画像、音声、256Kコンテキストをサポートします。Unsloth Studio経由でモデルを実行・学習できます。
MCP
リモート
MCPサーバーサポート。カスタムヘッダーとOAuthを含みますローカルのコマンドベース
MCPサーバーサポートMCPをチャットコンポーザーから有効化できるようになりましたよく使われる
MCPサーバー向けの組み込みプリセット
新しいチャットUI
プロジェクト、Canvas、
MCP、RAG、比較コントロールは、今やプラスメニューにあります検索とCodeコントロールはコンポーザーからよりアクセスしやすくなりました
メニュー、オーバーレイ、アイコン、クリック可能なコントロールはUnsloth全体でより一貫しました
プロジェクト
関連するチャットを専用のプロジェクトワークスペースに整理
既存のチャットをプロジェクトに移動
サイドバーから直接プロジェクトを作成・管理
実験的Canvas / アーティファクト
生成されたHTMLを、Unsloth Studio内の専用キャンバスパネルで開きます
ブラウザベースの可視化やCDNから読み込まれるパッケージを含む、インタラクティブな出力をサポート
レンダリングされたプレビューとソースコードを切り替えられます
インストール、ランタイム、ハードウェア
Windowsのビルド済みインストールでは、早期の
CUDA Toolkitチェックが不要になりましたLinux
llama.cppのビルド済みは、検出されたランタイムに一致するようになりましたcudartメジャーROCmgfx検出がビルド済み選択に引き継がれるようになりましたBlackwell,B300とARM64Linuxサポートの更新
Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iex使用しないでください unsloth studio update もう使わないでください。パッケージングでは最新の更新が取得されないためです!
CUDA 13.3、Windows、Mac
Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iex使用しないでください unsloth studio update もう使わないでください。パッケージングでは最新の更新が取得されないためです!
Macの更新
再有効化
llama.cppApple Silicon(M1-M4)向けのビルド済みバイナリ - Mac OS 14 / 15 / 26(Tahoe)Apple SiliconのMac OS 13(Ventura)はソースビルド
Mac OS 13.3 / 14 / 15 / 26(Tahoe)向けIntel(x86_64)は
llama.cppビルド済みバイナリを使用Max 13.0 - 13.2向けIntelはソースビルド
Windowsの更新
CUDA 13.3
llama.cppビルド済みバイナリがWindowsで動作するようになりましたCUDA 13.2、CUDA 13.1以下では、WindowsデバイスはCUDA 12.4フォールバックを使用します - CUDA 13.1のバイナリはまもなく対応予定です。
CUDA 13.3更新
CUDA 13.3のLinux以外のバイナリは動作します。今のところは引き続きCUDA 13.1を使います
CUDA 13.3はCUDA 13.2の文字化け問題を解決します - https://github.com/unslothai/unsloth/issues/4849 を参照
Blackwell GPUの更新
現時点ではBlackwellは
llama.cppのビルド済みバイナリのリリースが遅れます。CUDA 12.4が動作しないためです - すぐに解決に取り組んでいます。
刷新前の更新。
皆さん、今週か来週に来る可能性が高い大規模な刷新の前に、もう1回ほど更新を行っています。今回の刷新では、多くのことが変わります。特に新しい主要機能や多くのデザイン変更があります。
新機能: API呼び出しサポート 画像生成+編集、正しいWeb検索、コード実行、自動プロンプトキャッシュも追加。接続 OpenAI, Anthropic など。
以下の 英語以外の言語 例:日本語、中国語、インド系言語など
前回のリリースを見逃した方も多いかもしれません。これは1日しか公開されませんでした。追加した内容:
外部推論バックエンドに接続: vLLM, Ollama, llama-server
セキュリティ改善
MTP自動推測デコード MTP GGUF向け。お使いのハードウェアに最適化された設定を取得できます。
APIプロバイダー呼び出しと外部接続
Unslothを任意のAPIクラウドプロバイダー(OpenAI、Anthropic、OpenRouterなど)に接続できるようになりました
組み込みWeb検索 OpenAI、Anthropic、OpenRouter、Kimi向け
組み込みコード実行 OpenAIとAnthropic向け(Anthropicのコンテナは永続化され、ターン間で再利用されます)
OpenAIとAnthropicモデルでプロンプトキャッシュが有効になり、コストを50〜90%削減します。
画像生成+編集
ローカルプロバイダー(llama.cpp / vLLM / Ollama)ではAPIキーが任意になりました
クラウドプロバイダー追加時にモデルを自動読み込み
その他のUnsloth Studio更新
OpenDocumentのチャット添付
o3の推論サマリーペイロード
英語以外の言語(例:日本語、中国語)での送信/プロンプトが正しく動作するようになりました
IMEコンポーザーの強化、RTL
dir="auto"、長いログ行の切り捨て修正UI でのツール推論トレースの表示
完全オフライン対応: キャッシュされた GGUF 検出と、推論・学習の両方に対するオフライン DNS 自動検出
Unsloth Studio のセキュリティ改善
認証のレート制限。リバースプロキシに対応し、プロキシ経由でも回避されません
厳格化されたブロックリストを持つサンドボックス化されたワーカー(bash、
hf アップロード,NOFILE)パスの制限により、ワーカーが処理中の tmp ディレクトリから抜け出せません
Unsloth API 全体で厳格なスキーマ検証
CSP / セキュリティヘッダーを強化(正当な favicon ホストのみ許可)
削除しました
torch.loadへのフォールバックtraining_args.binそのため、信頼できない pickle がモデル読み込み時に実行されることはありませんTauri デスクトップ版のリリースフローを強化
フロントエンド認証: singleflight によるトークン更新、変更時の現在のパスワード入力、動作するログアウト、共有 422 ヘルパー
キャンセル時のクリーンアップは、処理中の tmp ディレクトリに厳密に限定され、ユーザー状態を削除することはありません
MTP + Unsloth の修正
Unsloth に多数のバグ修正、UI・UX 修正を追加しました! 最新の更新を取得するには:
macOS、Linux、WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows:
irm https://unsloth.ai/install.ps1 | iex修正
修正
unsloth studio updateうまく動作していないで固まる問題を修正
reset-passwordページオフラインモードのサポートをさらに追加
Mac、CPU、GPU で MTP が速くならない問題を改善 - 今ではずっと良くなりました!
更新後にデスクトップショートカットが動作しない問題を修正
UI/UX のバグ修正を大量に実施
Qwen3.6 MTP + API 接続
Unsloth にたくさんの新しい更新があります v0.1.41-beta:
GGUF 推論が約 2 倍高速化 自動的に有効化される MTP
API呼び出しサポート 用の OpenAI, Anthropic など。自動プロンプトキャッシュ、ウェブ検索、コード実行付き
外部推論バックエンドに接続: vLLM, Ollama, llama-server
実験的 MLX 推論
以下の 英語以外の言語
セキュリティ 改善

MTP の speculative decoding サポートにより、推論が 1.4~2 倍高速化!
MTP自動推測デコード MTP GGUF 向け。付属の llama.cpp のプリビルドが古い、または MTP に対して古すぎる場合に警告します
MTP 対応の新しい llama.cpp プリビルドバイナリ!
APIプロバイダー呼び出しと外部接続
Unslothを任意のAPIクラウドプロバイダー(OpenAI、Anthropic、OpenRouterなど)に接続できるようになりました
組み込みWeb検索 OpenAI、Anthropic、OpenRouter、Kimi向け
組み込みコード実行 OpenAIとAnthropic向け(Anthropicのコンテナは永続化され、ターン間で再利用されます)
OpenAIとAnthropicモデルでプロンプトキャッシュが有効になり、コストを50〜90%削減します。
ローカルプロバイダー(llama.cpp / vLLM / Ollama)ではAPIキーが任意になりました
クラウドプロバイダー追加時にモデルを自動読み込み
MLX 推論(実験的)
MLX の量子化モデルと通常モデルを、Mac マシン上でローカル実行できるようになりました!
思考、ツール、ウェブ検索を近日中に追加します!
その他のUnsloth Studio更新
英語以外の言語(例:日本語、中国語)での送信/プロンプトが正しく動作するようになりました
OpenDocumentのチャット添付
o3の推論サマリーペイロード
IMEコンポーザーの強化、RTL
dir="auto"、長いログ行の切り捨て修正UI でのツール推論トレースの表示
完全オフライン対応: キャッシュされた GGUF 検出と、推論・学習の両方に対するオフライン DNS 自動検出
UI/UX を大幅に磨き込み: ダークテーマのリファクタリング、右サイドバーの再設計、時間帯ごとのナマケモノのマスコット、閉じられてコピー可能なトースト、より大きなチャット入力欄、コード実行設定の磨き込み、入力欄のアクションピルのスタイリング、より細い Discord ボタン
学習の更新
Gemma の attention mask 修正
複数画像 GRPO
GRPO の hidden state 返却実験
新しい継続事前学習(CPT)学習手法を第一級オプションとして追加
修正のために Gemma-4 MoE LoRA エクストラクタを登録
grouped_mm縮約クラッシュ任意で有効化できる fused
lm_head+ cross-entropy forward、UNSLOTH_RETURN_LOGITS=1 の下では単一 matmul パスUNSLOTH_RETURN_LOGITS=1評価用のバッチサイズを渡す
評価/学習パスは現在、
HF_DATASETS_OFFLINEと併せてHF_HUB_OFFLINE
Unsloth Studio のセキュリティ改善
認証のレート制限。リバースプロキシに対応し、プロキシ経由でも回避されません
厳格化されたブロックリストを持つサンドボックス化されたワーカー(bash、
hf アップロード,NOFILE)パスの制限により、ワーカーが処理中の tmp ディレクトリから抜け出せません
Unsloth API 全体で厳格なスキーマ検証
CSP / セキュリティヘッダーを強化(正当な favicon ホストのみ許可)
削除しました
torch.loadへのフォールバックtraining_args.binそのため、信頼できない pickle がモデル読み込み時に実行されることはありませんTauri デスクトップ版のリリースフローを強化
フロントエンド認証: singleflight によるトークン更新、変更時の現在のパスワード入力、動作するログアウト、共有 422 ヘルパー
キャンセル時のクリーンアップは、処理中の tmp ディレクトリに厳密に限定され、ユーザー状態を削除することはありません
Unsloth API エンドポイント
v0.1.39-beta のバグ修正 2026年5月5日
チャット履歴が表示されない問題(既存のチャット履歴は失われません)と、添付が正しく追加されない問題を修正しました。このバグは表示のみの問題でした - 使用してください 2026.5.2 または直接呼び出してください curl -fsSL https://unsloth.ai/install.sh | sh 更新するには
次のようなツールと一緒にローカル LLM を使えます: Claude Code と Codex Unsloth の API エンドポイントに接続することで。これにより、次のようなモデルを実行できます: Qwen と Gemma をローカルで。自己修復ツール呼び出し、コード実行、ウェブ検索などの追加機能付きで。
Unsloth を API 推論エンドポイントとして使う利点は、セットアップが簡単で高速なだけでなく、Unsloth が次の機能を提供するからです:
自己修復ツール呼び出しこれにより、壊れた、または不正な形式のツール呼び出しを 50% 削減できます
コード実行 のサポートにより、Bash と Python を実行して、より正確なコード出力を得られます。
高度な ウェブ検索 ページに訪問し、実際に読み込んで詳細情報を集めます。
推論設定の自動設定 GGUF モデル向け(temp、top-k など)

新しいモデル
実行できる新しいモデルもいくつか追加しました。NVIDIA を含む Nemotron 3 Nano Omni、IBM Granite 4.1 と Mistral 3.5 Medium。私たちは Mistral が transformers と GGUF での実装に関するいくつかの問題を解決するのを支援しました。
Unsloth の更新
停止した Unsloth の学習実行をチェックポイントから再開できるようになりました。
チャットスレッドがより確実に自動保存・永続化されるようになりました。
マルチプロセス構成での DPO 学習のハングを修正しました。
MROPE の更新により、VLM GRPO のサポートが改善しました。
Unsloth の停止ボタンが生成を正しく停止するようになりました。
ブラウザ更新後にチャットテンプレートが消える問題を修正。
完全新規の UI 再設計
みなさん、チャットと学習に重点を置くために、Unsloth Studio の UI と UX を全面的に刷新しました:
コミュニティのフィードバックをもとに折りたたみ可能なサイドバーを追加

チャットを削除したり、過去の会話を検索できるようになりました


Qwen3.6 のような対応モデル向けに、新しい「思考を保持」トグルを追加
よりクリーンで一貫性のあるデザインになり、ナビゲーションも簡単に
プロフィール画像や名前などを変更できるオプションを備えた設定ページを拡張

Hugging Face トークンを二度入力する必要はもうありません
gpt-oss に low・medium・high の思考トグルが追加されました。
Linux CUDA でも最新の llama.cpp プリビルドを使用するようになりました
多数のバグ修正、一貫性と安定性の改善
Kimi-K2.6 を実行できるようになりました!
実験的な API サポートも追加しました。ガイドや告知などは来週公開します。
Qwen3.6 は以前から Unsloth Studio で実行と学習に対応していました。今すぐ Qwen3.6-27B を学習・実行できます!
Qwen3.6-27B + Kimi K2.6
Qwen3.6-27B Unsloth Studio で実行(18GB RAM)およびファインチューニングできるようになりました。Kimi K2.6 も Unsloth で実行できます(350GB RAM)。
Unsloth Studio に多くの更新が入ったので、アップデートしてください。詳細と解説は数日以内に公開します。
Qwen3.6
Qwen3.6 Unsloth Studio で実行およびファインチューニングできるようになりました。このモデルは 23GB RAM で動作し、ほぼすべてのベンチマークで最強の中規模 LLM です。
Gemma 4 アップデート + MiniMax-M2.7
Gemma 4 GGUF は、Google の公式チャットテンプレート修正(ツール呼び出しの修正・改善)と最新の llama.cpp 修正で更新されました。最新の llama.cpp に更新し、量子化モデルを再ダウンロードすれば、 未使用トークン の問題はもう発生しないはずです。
MiniMax-M2.7 が公開されました! 128GB RAM / unified memory で、私たちの GGUF を使って 4-bit 量子化でローカル実行できます。 MiniMax-M2.7 GGUF
Gemma 4 の修正
Gemma 4 を更新しました 多数の修正を含む。これらのバグは共通のもので、すべての学習パッケージと実装に影響し、 Unsloth に起因するものではありませんでした。私たちはバグを特定して修正し、Gemma 4 の学習は現在 Unsloth で正しく動作します。
必要なのは 8GB VRAM で学習すること Gemma-4-E2B をローカルで。Unsloth は Gemma 4 を学習します VRAM を約 60% 少なく使いながら、約 1.5 倍高速 FA2 構成よりも速く。Gemma 4 学習の完全ガイドとノートブックは、 ブログをご覧ください.
Gemma 4 学習の修正
勾配蓄積 で損失爆発が起きなくなりました。以前は、損失が次の値まで急上昇することがありました 300~400;期待される損失はおよそ 10~15.
修正した IndexError 影響していた 26B と 31B の推論における
transformers.次のモデルの文字化け出力を修正 E2B/E4B のとき
use_cache=False。参照: issue #45242.修正 float16 音声 からのオーバーフロー
-1e9の値。
損失が次より大きい場合は 13~15、 たとえば 100 または 300 - 勾配蓄積が誤って処理されている可能性があります。これは両方で修正済みです Unsloth と Unsloth Studio.
Gemma 4 の量子化モデル再アップロード
Gemma 4 GGUF も更新したため、再ダウンロードが必要です。繰り返しになりますが、これらの量子化問題は Unsloth に関連したものでも、Unsloth によって引き起こされたものでもありません:
CUDA: 結合前にバッファの重なりを確認 - 重要な修正
<unused24>トークン - PR #21566kv-cache:異種 iSWA の attention rotation をサポート - PR #21513vocab:Gemma 4 の BPE デトークナイザに byte token の処理を追加 - PR #21488変換:設定「add bos」== TrueGemma 4 向け - PR #21500共通:Gemma 4 専用パーサーを追加 - PR #21418llama-model:読み取りfinal_logit_softcappingGemma 4 向け - PR #21390llama:Gemma 4 向けのカスタム改行分割を追加 - PR #21406
Unsloth Studio の更新
追加 speculative decoding サポート(ngram-mod、デフォルトで有効)
Llama.cpp を更新し、すべての Gemma 4 修正を含む最新バージョンを使用するようにしました
Qwen3.5 と Gemma 4 の学習問題を修正
Gemma 4 モデルのエクスポートと保存を有効化
ターミナルと Python ツールのサンドボックスセキュリティを強化
レシピが Chat で読み込まれたモデルを使用できるようにする
移動時(およびタブ切り替え時)に空のチャットスレッドが表示される問題を修正し、新しいチャットフローを安定化
LLM でないレシピの実行を許可し、実行時には Data タブを先頭に移動
重複ダウンロードを防ぐため、HF のキャッシュ済みリポジトリの大文字小文字を再利用
Google - Gemma 4
次のモデルを実行・学習できるようになりました Gemma 4 Unsloth でのモデル。
Intel Mac が動作するようになりました
小型モデルのツール呼び出しがより安定し、途中で切れなくなりました
Windows、Linux、Mac、WSL デバイス向けのプリコンパイル済みバイナリ - CPU と GPU
非ビジョンモデル向けに Speculative Decoding を追加(残念ながら Gemma-4 はビジョンモデルで、Qwen3.5 も同様)
コンテキスト長が正しく適用されるようになりました。
ウェブ検索が要約だけでなく、実際のウェブコンテンツを取得するようになりました
HF API 呼び出しを 90% 削減 - レート制限が減少
ツール呼び出し精度が 50% 向上 + さらなるサポート
すべてのモデルのツール呼び出しは現在 30%~80% 精度が向上しました。
ウェブ検索が要約だけでなく、実際のウェブコンテンツを取得するようになりました
許可されるツール呼び出し数を 10 から 25 に増やしました
ツール呼び出しがより適切に終了するようになり、ループ / 繰り返しが減少します
さらに ツール呼び出しの修復 および重複排除ロジックにより、ツール呼び出しから XML が漏れるのも防止
次でテスト済み
unsloth/Qwen3.5-4B-GGUF(UD-Q4_K_XL)ウェブ検索 + コード実行 + 思考を有効化。
応答内の XML 漏れ
10/10
0/10
使用された URL フェッチ
0
10 回中 4 回
正しい曲名で実行された回数
0/10
2/10
平均ツール呼び出し数
5.5
3.8
平均応答時間
12.3秒
9.8秒
新機能
追加 カスタムフォルダ そのため、どのフォルダでも任意の GGUF を使用できます。現在は Chat の詳細設定と Custom Folders からアクセスできます
更新ボタン 表示されるようになりました
インストールスクリプトのスタイルをすべて更新しました!
予備的な 推論と学習のための自動マルチ GPU サポート - 1 枚の GPU に収まらない大規模モデルに便利 - Unsloth auto が GPU リソースを割り当てます
Intel Mac はそのままで動作するはずです
よりスムーズで高速になった Unsloth
大規模モデルのダウンロードタイムアウトを修正 - タイムアウトはもう発生しません。
Hugging Face のレート制限を修正 - HF API 呼び出しを 90% 削減
Windows での bun を修正し、インストールを高速化
新しい重要な更新
前回のリリースからまだ 2 日しか経っていませんが、より重要な更新があります:
推論が 20~30% 高速化しました。 以前は、ツール呼び出しとリピートペナルティが原因で推論速度が通常より遅くなることがありました。推論 tokens/s は現在、次と同等の性能になるはずです
llama-server/llama.cpp.古いモデルや既存のモデルを自動検出するようになりました からダウンロードされた LM Studio、Hugging Face、 および同様のソース。
推論 token/s 速度が正しく計算されるようになりました。 以前は tokens/s に起動時間が含まれていたため、表示速度が実際より遅く見えていました。現在は「真の」推論速度を反映するはずです。
CPU 使用率が急上昇しなくなりました。 以前は、インラインクエリの ID が再描画ごとに変わり、その結果
useLiveQueryが継続的に再購読されていました。Unsloth Studio に終了用の x ボタンが追加され、正しく終了するようになりました。 以前は、デスクトップアイコンから開いた後に閉じても正しく終了しませんでした。現在は、ショートカットから起動するとターミナルも開き、そのターミナルを閉じると Unsloth Studio が完全に終了します。以前のセッションからまだ開いている場合は、コンピュータを再起動するか、次を実行してください
lsof -i :8888その後kill -9 <PID>.さらに優れたツール呼び出しとウェブ検索 エラーを減らして。
次に関する新しい情報を多数追加したドキュメント更新 モデルの削除、アンインストール など。
Windows と Linux 全体で、よりクリーンで賢いインストールおよびセットアップログに。 出力は一貫した書式で読みやすくなり、よりスムーズな体験のためにデフォルトでは静かになり、より豊かな
--verbose診断情報を、完全な技術詳細が必要なときに利用できます。学習履歴を表示できるようになりました!
Unsloth Studio 公開後の最初のリリース
みなさん、これは Unsloth Studio を公開してから初めてのリリースです。新機能と修正がたくさんあります:
Unsloth Studio を更新できるようになりました! 同じインストールコマンドで更新してください。
Windows CPU または GPU がシームレスに動作するようになりました。再インストールしてください!
アプリのショートカット。インストール後は、スタート/Launch とデスクトップのショートカットアイコンから、Windows、MacOS、Linux で起動できるようになりました。
事前コンパイル済み
llama.cppバイナリ とmamba_ssm- インストールが6倍高速化! バイナリのサイズも300MB未満。インストールサイズを50%削減 (7GB以上の節約)、インストールは2倍高速化し、解決も高速化。PyPIサイズは50%小さくなりました。
ツール呼び出しが改善されました。 llama.cpp の解析が改善され、チャットに生のツールマークアップが表示されず、推論が高速化、新しい「ツール出力」パネル、タイマー。
MacOS と CPU には データレシピ 複数ファイルのアップロードで有効化されました。
Linux 向けの AMD サポートは予備対応 Linux のみのマシン向け - 自動検出します。
設定サイドバーを再設計。 設定は現在、次の項目にグループ化されています モデル、サンプリング、ツール、設定
コンテキスト長 現在は調整可能です。なお、llama.cpp は次の方法で必要な正確なコンテキストを賢く使用するため、これは不要であることに注意してください
--fit を有効にした場合複数ファイルのアップロード。 データレシピは、PDF、DOCX、TXT、MD の複数のドラッグ&ドロップアップロードをサポートするようになり、バックエンド抽出、アップロードの保存、プレビューの改善が行われました。
Colab 無料の T4 GPU を使う Unsloth Studio の問題が修正されました! ここで試す。事前コンパイル済みバイナリのおかげで、20倍高速でもあります!
チャットの可観測性が向上。 Unsloth は現在、次を表示します
llama-server実行時間と使用状況、コンテキストウィンドウ使用量バー、さらに詳細なソースのホバーカード。全体的により良いUX - クリック可能なリンク、改善された LaTeX 解析、デフォルトカード用のツール / コード / Web ツールチップなど、さらに多く!
LiteLLM - Unsloth Studio と Unsloth は ではありませんでした 最近の LiteLLM 侵害の影響を受けていませんでした。Nemo Data Designer が LiteLLM を使用していたのは
1.80、影響を受けたものではなく1.82.7または1.82.8、その後完全に削除しました。新しい1行のインストールコマンドができました。次を実行するだけです:
修正事項:
Windows/セットアップの改善。 Windows での無言終了、Anaconda/conda-forge の起動時クラッシュ、壊れた非 NVIDIA の Windows インストール、初期 CUDA / 古い venv のセットアップチェックの欠落を修正しました。
システムプロンプトを修正しました。 GGUF 以外のテキストおよび画像推論で再び動作します。
永続的なシステムプロンプトとプリセット。 カスタムのシステムプロンプトとチャットプリセットが、再読み込みやページ移動後も保持されるようになりました。
GGUF エクスポートを拡張。 LoRA/PEFT だけでなく、フルファインチューニングも GGUF にエクスポートできるようになりました。ベースモデルの解決はより信頼性が高くなり、未対応のエクスポートオプションは UI で無効化されます。
チャットのスクロール/レイアウト修正。 生成中のスクロール位置の問題、思考パネルのレイアウトずれ、推論パネルを折りたたむ際のビューポートのジャンプを修正しました。
より賢いポート競合検出。 Unsloth はループバック競合を検出し、可能な場合は妨げているプロセスを特定できるようになり、フォールバックポートのメッセージもより明確になりました。
最終更新
役に立ちましたか?

