For the complete documentation index, see llms.txt. This page is also available as Markdown.

Unslothの更新情報

最新リリース、改善、修正に関するUnslothの変更履歴。

最新の変更を使うには、 Unsloth を更新.

Qwen3.8-Flash + GLM-5.3 が2倍高速

実行 Qwen3.8-Flash-NextGLM-5.3-Flash 最大 2倍高速 な高速デコードと追加の MTP により、今ではデフォルトで有効です。このリリースにはさらに 170件以上の改善 が含まれ、学習、チャット、ハードウェア対応、API、性能の各方面にわたります。

  • MTP による Qwen と GLM の生成高速化に加え、ツール利用の改善と推奨 Qwen 設定も含まれます。

  • すべてのチャット、とくに長い会話で UI/UX の遅延が大幅に軽減

  • 新たに対応: MiniMax-Music3、Higgs、MOSS の音声モデル。進捗追跡やクリップ管理も含まれます。

  • ローカルサーバーと接続済みプロバイダー全体で、モデル読み込みの信頼性が向上。

  • ツール呼び出し、返信、メディア、会話ブランチを保持する、より安全なチャット編集。

  • マルチGPU学習、メモリ収まり、モデル配置、GGUF エクスポートを改善。

  • AMD/ROCm のインストール、検出、GPU 互換性がより堅牢に。

  • MCP、Deep Research、OAuth、並列ツール呼び出し、エージェントワークフローの信頼性向上。

  • 向けの新しい OpenAI 互換 API: 動画、音声、MLX 配信モデル.

  • デスクトップ更新、LAN ポート制御、ダウンロード、GPU メモリのクリーンアップを改善。

Qwen3.8-Flash-NextGLM-5.3-FlashGLM-5.3

Qwen3.8-Flash-Next + GLM-5.3

Qwen3.8-Flash-Next, GLM-5.3-Flash + GLM-5.3 が、今や Unsloth でローカル実行できます!

  • Qwen3.8-Flash は 75GB RAM で動作

  • GLM-5.3-Flash は 102GB RAM + VRAM で動作

  • RAM オフロードが最大5倍高速

  • 繰り返し Auto Compaction が今では安定して動作

  • チャット、信頼性、性能の改善が100件以上

Qwen3.8-Flash-NextGLM-5.3-FlashGLM-5.3

Qwen3.8-Flash-Next

125B のマルチモーダル推論モデルと、Qwen4 のアーキテクチャの初期プレビュー。

  • 1-bit Dynamic GGUF は 75GB RAM または統合メモリで動作

  • テキストと画像で最大 262K のコンテキスト

  • 推論モードは None、Low、Medium、Extra High

  • Preserved Thinking により長いチャットでの一貫性が向上

GLM-5.3-Flash

18B のアクティブパラメータを持つ 320B マルチモーダルモデル。

  • 1-bit モデルは 102GB の RAM + VRAM 合計で動作

  • テキスト、画像、文書で最大 1M のコンテキスト

  • 推論モードは Low、High、Max

  • コーディング、エージェント、視覚性能の改善

Unsloth の改善

  • 大きな GGUF は GPU とシステム RAM に自動で分割

  • 読み込み前にメモリ見積もりを確認

  • 切断後にチャットが復元

  • 複数画像の視覚処理と MCP 画像対応の改善

  • チャットを JSONL としてエクスポート

  • Auto Compaction の制御を改善

  • Linux、NVIDIA Wayland、AMD、Windows の修正

新しいモデルを実行または学習するには、Unsloth Desktop をダウンロードできます:

Unsloth Desktop をダウンロード

自動圧縮 + LAN アクセス

先週の Qwen3.8-27B と Unsloth Desktop へのサポート、ありがとうございます! 私たちの 新しい v0.1.801-beta リリースでは、200件以上の PR を統合し、次のような多くの新機能や修正を導入しました:

  • 自動圧縮(実験的) コンテキスト制限を超える長いチャット向け

  • リモート & LAN アクセス(プレビュー) Cloudflare リンクなしで簡単にネットワークアクセスするため

  • より高速なチャット ストリーミング性能の改善、UI 遅延の低減、長い会話の滑らかさ向上。

  • 対応: カスタム llama.cpp ビルド。Cache RAM、Mmap、Mlock、Checkpoints、Spe Decoding KV Cache、Vision のオン/オフ切り替え

  • Unsloth Dynamic v3.0 をリリースしました。新しい Qwen3.8-27B Dynamic v3.0 GGUF は、他のどれよりも 1位精度が10%以上高くなっています。Unsloth で動作します。

自動圧縮(実験的)

長いチャットは、古いターンを検索可能なアーカイブへ移すことで、コンテキスト制限を超えられるようになりました。

  • 古いターンは必要なときだけ削除され、検索可能なまま残ります。

  • 新鮮なコンテキストのエポックにより、チャットを恒久的に削らずに想起性能が向上します。

  • 要約ではなく検索を使うため、精度が向上します。

リモート & LAN アクセス(プレビュー)

ネットワーク上の他のデバイスから Unsloth にアクセスできます。

  • 新しいリモートアクセス設定。

  • LAN 制御、QR コード、自動起動オプション。

  • セキュリティのためデフォルトでは無効。

チャットの改善

  • 長いチャットをより高速にし、スレッド処理を改善。

  • Projects はチャット、ファイル、ワークスペースを整理します。

  • プロンプトのキューイング、ショートカット、 edit_file、およびツール対応の改善を追加。

ハードウェア、推論、API

  • カスタム llama.cpp ビルドと Intel XPU をサポート。

  • より多くの推論制御(cache、mmap、mlock、checkpoints、speculative decoding、vision)。

  • GPU の検証、VRAM 処理、互換性を改善。

  • Responses API での構造化出力。

  • llama-server の復旧を改善。

Qwen3.8 を実行または学習するには、Unsloth Desktop をダウンロードできます:

Unsloth Desktop をダウンロード

Qwen3.8

Qwen3.8-27B と Qwen3.8-2.4T が、今や Unsloth でローカル実行できます!

Unsloth Dynamic GGUF を使えば 17GB RAM で動作します。Qwen3.8-27B を Unsloth でファインチューニングすることもできます。Qwen3.8-27B は、そのサイズで断然最強のモデルです。NVFP4 の量子化もアップロードしました。

Qwen3.8 実行ガイドMuse Glimmer をファインチューニング

その他の Unsloth の更新には次が含まれます:

  • Qwen3.8-27B + 追加の llama-server 引数を許可 + カスタム VRAM 切り替え

  • 外部プロバイダーでツール呼び出し + ツール対応 + Codex でのログイン

  • 高速 FP8 により MiniMax-H3 の推論が10倍高速(3分対30分)

  • GGUF の推論が10%高速化 + Bypass 権限の修正

  • 接続済み API プロバイダー は、独自の検索または Unsloth Desktop 内蔵の検索とツールを使用できます。ツールの結果はモデルに返され、複数ステップのタスクを継続できます。

  • Codex サブスクリプションでサインインし、Chat 内で Codex ツールを使用できます。

Qwen3.8 を実行または学習するには、Unsloth Desktop をダウンロードできます:

Unsloth Desktop をダウンロード

Unsloth Desktop の紹介

Unsloth Desktop 🦥 の紹介 - モデルをローカルで実行・学習する最初のデスクトップアプリです。 オープンソース。Mac、Windows、Linux で動作

• MLX、拡散画像/動画、音声、GGUF をサポート • Claude Code と Codex をローカル LLM に接続 • 50%高精度の自己修復ツール呼び出し + サンドボックス化されたコード実行 • CPU + マルチGPU 構成で動作 - NVIDIA、AMD、Intel、Mac • VRAM を70%削減してモデルを2倍高速で学習 • プライベート Web 検索、Deep Research、RAG、MCP + エクスポート(NVFP4、GGUF) • Unsloth の OpenAI 互換 API とクラウドモデルを使用 • LLM を安全にリモート展開し、どこからでもアクセス

今すぐ Unsloth Desktop をダウンロードできます:

Unsloth Desktop をダウンロード

Meta Muse Glimmer が登場!

Meta は、Meta Superintelligence Labs から初のオープンモデルである Muse Glimmer をリリースしました。Muse Glimmer は Meta による疎ではない 30B パラメータモデルで、ローカルのエージェント的・コーディング作業向けに構築されています。Apache 2.0 ライセンスで公開されており、最高の性能を得るには Unsloth と Unsloth Dynamic の量子化を使って Muse Glimmer 30B を実行できます。

Muse Glimmer を実行Muse Glimmer をファインチューニング

Muse Glimmer 30B はローカルで実行できます 20GB RAM/VRAM の構成で、Mac や GPU を含みます。さらに、Unsloth を使って Muse Glimmer 30B を 20GB VRAM.

で学習・ファインチューニングすることもできます。Unsloth Desktop アプリから Muse Glimmer を実行・ファインチューニングできます:

Unsloth Desktop をダウンロード

Kimi K3 + Deep Research + 並列チャット

皆さん、こんにちは! Kimi K3 が、今や Unsloth Dynamic GGUF でローカル実行でき、Unsloth は複数のチャットを並列生成で維持でき、新しい Deep Research モードはローカルモデルを使って計画し、読み、情報源を引用します。

このリリースでは、さらに AMD と Intel GPU のサポート、DoRA 学習、そして多くのインストーラ、MLX、エクスポート、推論の修正も追加されています。

Kimi K3

Moonshot AI の Kimi K3 は、104B のアクティブパラメータ、ネイティブな視覚サポート、1M コンテキストウィンドウを備えた 2.8T パラメータの MoE モデルです。Kimi K3 は推論専用で、Unsloth は low、high、max の推論強度をサポートします。

私たちの Kimi K3 Dynamic GGUF を Unsloth 経由で実行できます。Unsloth は複数 GPU 構成を自動検出し、モデル層をシステムメモリへオフロードできます。

Kimi K3 は非常に大きなモデルなので、ハードウェアはそれに応じて計画してください:

  • UD-IQ1_S はディスク容量 595GB です。

  • UD-Q4_K_XL はディスク容量 1.51TB です。

  • 損失なし推論には、 UD-Q8_K_XLを使用してください。これはディスク容量 1.56TB です。

完全版の Kimi K3 ガイド を読み、さらに Unsloth Dynamic 2.0 GGUF.

並列チャット

Unsloth は、今や複数の会話を同時に実行できます。 新しいチャット を開始すると、前の回答は生成されたままになり、アクティブな各会話には独自の進捗インジケーターと停止コントロールが付きます。

  • デフォルトで 4 つの llama-server スロット。Web UI で調整可能。

  • ツール、アップロード、自己修復、エージェントはチャット間で分離されたままです。

  • 他を中断したりサーバーを再起動したりせずに、1つのチャットだけ停止できます。

  • メモリが限られている場合、Unsloth はスロット数を減らします。

  • モデルの再読み込みでも、確認後にアクティブなチャットは停止されます。

Deep Research

Deep Research はローカルモデルを完全なリサーチワークフローに変えます。質問を与えると、計画を作成し、Web を検索し、証拠を整理し、引用付きレポートを作成します。

  • リサーチ開始前に計画を確認・編集できます。

  • 作業中は進捗と収集済みソースを追跡できます。

  • 完了したリサーチを失わずに再開またはキャンセルできます。

  • ソース選択を制御するために、Web サイトを許可またはブロックできます。

  • ソースと引用は各実行ごとに保存されたままになります。

  • 書き始める前に、Unsloth は未対応の主張、矛盾、未解決の欠落をチェックします。直接的な証拠のない推奨は、検証可能な推論としてマークされます。

1回の実行は各チャットにつき1つまでアクティブにできます。Deep Research は現在ローカルモデルで動作します。任意の全ページ grounding により、上位の検索結果を要約前に一時的な RAG に読み込めます。これを有効にするには UNSLOTH_RESEARCH_AUTO_SCRAPE=1を設定します。スクレイピング時間が追加され、追加のコンテキストが必要なため、デフォルトでは無効のままです。

AMD サポートの改善

この更新は、最初の AMD リリースとセットアップガイド を基に、さらに多くの GPU と、より信頼性の高い ROCm 推論・学習をサポートします。

  • RDNA2、Radeon、Ryzen、Strix Halo、ワークステーション GPU の検出を改善。

  • MI50 と Radeon VII は、Linux で16-bit LoRA とフルファインチューニングをサポート。

  • 4-bit の NaN、ライブラリ競合、長い RDNA 起動停止を修正。

  • 未対応の Windows HIP GPU は Vulkan にフォールバックできます。

  • Vulkan デバイスは実際の名前が表示され、個別に選択できます。

  • クリーンな Windows インストールでは Winget や開発者ツールが不要になりました。

学習、モデル、プラットフォーム更新

  • Intel XPU により、Intel Arc およびデータセンター GPU でのローカルチャットと学習が可能になります。

  • DoRA は LoRA とフルファインチューニングに加えて利用できます。

  • 大きなエクスポートでは、GPU 0 のメモリ制限を避けるため、表示されているすべての GPU を使用できます。

  • MLX はストリーミングデータセット、継続事前学習、コールバック、より良い VLM と LoRA 対応を追加します。

  • 誤っていた flash_attention_2 のモデル出力を修正。

  • Unsloth と保存ユーティリティは bitsandbytes なしで動作するようになりました。

  • 修正 .json データセットと Qwen3.5/3.6 MoE および GRPO ノートブックのセットアップ。

  • Hub のダウンロードフォルダを見つけやすく開きやすくしました。

  • リリースノートは Unsloth の更新ポップアップで確認できます。

  • unsloth start --as-subagent で、Codex、Claude Code、Pi がタスクをローカルの Unsloth モデルに委任できます。

AMD サポートが登場しました!

皆さん、こんにちは!このリリースでは、ローカル LLM の学習と推論が AMD GPU で Windows、WSL、Linux 全体に対応します。

クイックスタート機能GitHub

本日より、私たちの AMD との連携、カスタム Triton カーネル、数値演算アルゴリズムにより、AMD の Radeon、Instinct、Vulkan、Ryzen、データセンター GPU で500以上のモデルを学習・実行できるようになります。VRAM を70%削減し、精度を落とさずに最大2倍高速です。最適化された ROCm ビルドは GGUF と Safetensors の推論もサポートします。

7月23日アップデート

  1. 追加 RDNA2、Gorgon Halo、Vulkan サポート + Strix Halo / その他の AMD GPU で AMD インストール時に GPU を検出しない問題を修正

  2. RDNA4 の改善、HIP / ROCm 失敗の自動修復と検出

  3. 統合メモリが2倍高速 AMD safetensors の読み込み + 統合メモリデバイス向けの大幅に高速化した gradient checkpointing

  4. 追加 音声ディクテーション / whisper.cpp 高速なテキスト読み上げの予備サポート

  5. インストール時のロールバック環境が 5GB のディスク容量を食っていた問題を修正 - 今では自動クリーンアップ

AMD でローカル LLM を学習

  • AMD GPU 上で、ローカルにモデルを学習、実行、RL、チャット、デプロイできます。

  • Windows、WSL、Linux 全体で AMD GPU の検出とインストールの信頼性を向上。

  • AMD MI300X および MI325X GPU 向けの ROCm 互換性を改善。

  • 以下を通じて Unsloth にリモートアクセス: unsloth studio --secure Cloudflare 経由の無料 HTTPS

お使いのハードウェアでより大きなモデルを実行

  • 自動 GPU 配置を使うか、使用する GPU とモデル層を正確に選択できます。

  • MoE の expert 層をシステムメモリへ移し、大きなモデルを収めやすくします。

  • モデルを複数 GPU に分割するか、Tensor Parallelism を使います。

  • 各モデルと量子化ごとにハードウェア設定を個別保存。

より高速なチャット再開と、より信頼性の高いダウンロード

  • アイドル状態のモデルが VRAM を解放したあと、会話全体を再構築せずに長いチャットを再開できます。

  • 停止した Hugging Face XET のダウンロードは、自動的に標準 HTTP で再試行されます。

  • モデル読み込み時に毎回再ダウンロードする代わりに、既存の GGUF ファイルを再利用します。

検索、ツール、エージェントの改善

  • Web 検索で PDF 論文、マニュアル、その他の PDF 結果を読み取れるようになりました。

  • 並列ツール呼び出し、推論出力、ツールの再試行がより信頼性高く動作します。

  • 新しいオプトインの MCP エンドポイントにより、対応 AI クライアントはモデルと学習履歴を確認し、学習を開始/停止し、チェックポイントを読み込み、レシピを検証し、GGUF をエクスポートできます。

    • これを有効にするには UNSLOTH_STUDIO_ENABLE_MCP=1 を設定し、必要なベアラートークンを UNSLOTH_STUDIO_MCP_TOKEN.

学習とエクスポートの修正

  • マルチモーダルモデルでのテキストのみ学習では、パッキング前に長い例が切り詰められなくなりました。

  • ファインチューニングした Qwen3.5 と Qwen3.6 の MTP モデルが、GGUF に正しくエクスポートされるようになりました。

  • 最終書き込み段階で GGUF エクスポートを止めていた可能性のある Windows の権限エラーを修正。

見逃していた方へ

前回の Studio リリースでは、Dynamic NVFP4 モデル、より深いパーソナライズ、7つの新しい表示言語、より安全なエージェント、Vulkan GPU アクセラレーションが追加されました。

Dynamic NVFP4:

Unsloth Dynamic NVFP4 は、精度に敏感な層を FP8 または BF16 に保ちつつ、残りを W4A4 で実行します。NVIDIA Blackwell GPU では、これにより最大2.5倍高速な推論が可能になり、調整済み FP8 KV キャッシュによりコンテキストを最大2倍長くできます。

こちらを読む Dynamic NVFP4 ガイド を読み、拡張された NVFP4 コレクションを探索してください。Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash、Gemma 4 を含みます。

Studio を自分好みにカスタマイズ:

Standard、Classic、Minimal のカラーパレットから選べます。それぞれにライトモードとダークモードがあります。色のカスタマイズ、フォントのインポート、フォントサイズ、コントラスト、モーション軽減などの調整も可能です。

Unsloth には、ディクテーション、カスタム辞書設定、読み上げ用の Voice 設定タブも含まれます。

新しい言語:

Unsloth Studio は、簡体字中国語、日本語、ブラジルポルトガル語に加え、フランス語、ドイツ語、スペイン語、ヒンディー語、アラビア語、ロシア語、韓国語でも利用可能になりました。ブラウザー言語の自動検出がデフォルトになります。

より安全なエージェント:

4段階のツール呼び出し権限セレクター-確認, 自分に代わって承認, オフフルアクセス—エージェントをより細かく制御できます。エージェントのワークスペース分離と、より安全なインストーラチェックも、意図しない変更のリスクを減らします。

パーソナライズ、NVFP4、言語

皆さん、Unsloth にたくさんの新しい更新、特にカスタマイズが入りました。Unsloth は今や自分好みに設定できます:3つのカラーパレットとカスタム色・フォント、7つの新しい表示言語、ディクテーションと読み上げ用の新しい Voice 設定タブ。エージェントは4段階のツール呼び出し権限セレクター(確認、自分に代わって承認、オフ、フルアクセス)とワークスペース分離でより安全になり、Intel GPU は新しい Vulkan による GPU アクセラレーション推論をついに利用できます llama.cpp 対応。

さらに、ネイティブ対応も追加しました Inklingを。これは 9750億パラメータのオープンモデルで、410億のアクティブパラメータと最大100万トークンのコンテキストウィンドウを備えています。Apache 2.0 ライセンスで公開されており、テキスト、画像、音声を受け取り、テキストを生成します。

Dynamic NVFP4

私たちは NVFP4 コレクション に、Qwen3.6、Qwen3.5、Inkling、GLM-4.7 Flash、Gemma 4 の量子化版を追加しました。

こちらを読む Dynamic NVFP4 ガイド 詳細はこちら。

Unsloth を自分好みに設定

Unsloth はもはやライトモードとダークモードだけではありません:

  • から選択できます Standard, Classic、そして Minimal のパレットを、それぞれライト版とダーク版付きで。

  • アクセント、背景、前景の色をカスタマイズできます。

  • UI、見出し、チャット、コードのフォントを自分のものに差し替えられます。

  • フォントサイズ、コントラスト、動き、カーソル動作、フォントスムージングを調整できます。

  • 検索設定と同期設定をデバイス間で同期。

ライトモードとダークモードは、それぞれ独自のカスタマイズ値を保持します。

7つの新しい言語

Unsloth は今や、簡体字中国語、日本語、ポルトガル語に加えて、フランス語、ドイツ語、スペイン語、ヒンディー語、アラビア語、ロシア語、韓国語をサポートします。ブラウザー言語の自動検出がデフォルトになりました。

音声設定

新しい Voice タブで、ディクテーション、発音辞書、読み上げの操作が追加されました。音声入力と音声出力のサポートは近日公開予定で、完全な音声会話はまだ開発中です。

より安全なエージェントとツール呼び出し

旧バイパス切り替えは、4段階の権限セレクターになりました:

  • 確認: すべてのツール呼び出しを承認します。

  • 自分に代わって承認: 読み取り専用の操作は自動で実行し、危険の可能性があるものでは一時停止します。

  • オフ: ツール呼び出しを無効化します。

  • フルアクセス: すべての呼び出しを許可し、サンドボックスを無効化します。

これらの制御は、ターミナル、Python、Web 検索、RAG、MCP ツールに適用されます。エージェントには分離されたワークスペース、 --persistを使った再開可能なセッション、より安全なリモートインストーラ警告、ライブのツール出力ストリーミング、改善された Web 抽出も備わります。

Vulkanと llama.cpp

新しいVulkan llama.cpp バックエンドにより、Intel GPUでCPUにフォールバックする代わりにGPUアクセラレーション推論が可能になります。既存のVRAM管理、自動コンテキストサイズ調整、複数GPU選択、レイヤーのオフロードをサポートします。

AMDユーザーは次を設定すると有効にできます:

UNSLOTH_FORCE_VULKAN=1

更新の信頼性、モデル状態の復元、停止した生成の中断も改善しました。

モデルとトレーニング

このリリースには以下も含まれます:

  • ネイティブInkling対応と、B200のマルチGPU改善。

  • DeepSeek-V4のeager attentionと、学習可能なFP8グループ化エキスパート。

  • チャットテンプレートのマーカーを自動検出することで、後半のみ学習を確実に行えます。

  • 無効化されたgradient checkpointingの正しい処理。

  • RoPEスケーリングとコンテキスト拡張の改善。

  • 停止したトレーニング実行の強制停止。

  • 新しいモデルアーキテクチャと、より新しいTransformersリリースへの自動ルーティング。

DeepSeek-V4 + NVFP4

Unslothは今や、学習後にNVFP4、FP8、imatrix GGUFをエクスポートできるようになりました。llama-swap APIシステムとして動作し、日本語とブラジルポルトガル語のサポートを追加し、MLX、safetensors、tool calling、healingサポートなども含みます。Unsloth coreはGRPOを1.3倍高速化し、停止したダウンロードのHTTPフォールバックを追加し、オフラインモードを改善し、MoE学習を3〜5倍高速化し、多くのバグを修正します。このリリース系列では unsloth>=2026.7.1.

DeepSeek-V4-Flash が、Thinkingトグルと改善されたチャットテンプレート修正でサポートされるようになりました。

より賢いOpenAI互換API提供

より安全なモデル切り替えと、より良いエージェントツール復旧で、1つのローカルAPIエンドポイントを実行できます。

  • APIリクエストは、ダウンロード済みのローカルGGUF間の自動切り替えを有効にできます。一方、未知のモデル名は安全に現在のモデルを使い続けます。

  • /v1/models は、ローカル .gguf パスの代わりに、クリーンなモデルIDとローカルGGUFカタログを返すようになりました。

  • アイドル時の自動アンロードで非アクティブ後にVRAMを解放でき、tool-call healingもリクエストごとに制御できるようになりました。

エクスポートの改善

エクスポートはより柔軟になり、不要なダウンロードを避けます。

  • ポータブルFP8/INT8、GGUF LoRA、ソース一致エクスポート、imatrix GGUF、圧縮FP8/FP4を含む複数のエクスポート形式を一度に選択できます。

  • 複数チェックポイントのエクスポートで、ベースモデルの繰り返しダウンロードをさらに減らせます。

  • FP8、INT8、GGUF-LoRAのエクスポートは trust_remote_codeを尊重するようになり、GGUFエクスポートは不足している量子化設定をより確実に処理します。

RAGとファイルチャット

ファイルチャットは実際の文書でさらに便利になりました。

  • RAG添付は、文書全体のコンテキストを使用でき、埋め込みモデルとHugging Face検索をカスタマイズできます。

  • ファイルチャットは、右から左へのテキスト、インド系文字、DOCXの表を含む、より多くのPDFやWord文書を正しく読み取ります。

  • ローカルRAGのチェックは、プロキシ環境の背後でもより信頼性が高くなりました。

Unslothの磨き込みと信頼性

日常利用がよりスムーズで安定して感じられるはずです。

  • 長時間のトレーニングやチャット実行が、静かにフリーズしにくくなりました。

  • 比較モード、モデル切り替え、モデルキャンセル、Hubの閲覧、Hub Discoverの信頼性が向上しました。

  • プロジェクトのエクスポート、チャットのエクスポート、設定、ガイドツアー、ファイルダイアログ、更新画面、推論UIがよりきれいで一貫したものになりました。

インストーラ、ハードウェア、プラットフォームの修正

Unslothは、より多くのプラットフォームでより確実にインストール・実行できます。

  • macOSのインストールでは、ビルド済み llama.cpp が利用可能な場合、CMakeやHomebrewが不要になり、Apple Siliconサポートではスペースを含むパスやユニファイドメモリのサイズ調整をより適切に扱います。

  • Windowsの起動、UTF-8処理、ROCmのRAG埋め込み、ROCm on WSLのGPUサポートが改善されました。

  • Blackwell GPUのビルド済み選択、GGUFの収まりチェック、vision/mmproj GGUFのtensor parallelism、ローカル llama.cpp の再利用が、より信頼性の高いものになりました。

トレーニング、モデル、カーネル

より多くの環境で、トレーニングとモデルの読み込みがより信頼できるようになりました。

  • GRPOはデフォルトでシーケンスパッキングをサポートし、共有プロンプトの繰り返しを避け、DDPのlogitスケーリングを正しく処理するようになりました。

  • フルファインチューニング、RL精度設定、gradient checkpointing、DDP RoPEバッファ、MoE LoRA検出を修正しました。

  • FP8量子化/逆量子化、Transformers v5でのLlama 3 RoPEスケーリング、PEFT 0.19のLoRA再読み込み、 fast_generate のエラーメッセージが改善されました。

GLM 5.2 + Hub + 3倍長いコンテキスト

GLM-5.2 がUnsloth Studioでサポートされるようになりました!すべての推論レベルをサポート。 3倍長いコンテキスト長 は、MTPを使った新しい自動フィットアルゴリズムで実現できるようになり、より長いチャットが可能になりました。権限バイパスモード、分岐可能なチャット、キュー可能なチャット、モデル発見用の新しいHub、parallel modules + HTTPS Cloudflareサポートなども追加! unsloth studio --secure を使って、安全なHTTPSのグローバルアクセスを有効にしましょう!

より良いコンテキスト長アルゴリズム

に従って PR 1PR 2、Unsloth Studioのメモリ使用量とコンテキスト長の判定を大幅に改善し、全体で3倍長いコンテキストを実現しました:

シナリオ
KV

1x 32GBパイプライン(約31 GB空き)

f16

23,040

64,000

q8_0

43,520

114,944

q4_0

82,432

199,680

2x 32GBパイプライン

任意

262,144

262,144

2x 24GB tensor(約23 GB空き)

f16

134,049

262,144

q8_0

252,329

262,144

チャットキャンバス、分岐、キューイング

  • アシスタントメッセージをその場で編集し、スレッド内の任意の地点から再実行できます。

  • スレッドを分岐させ、元の会話を失わずに会話を枝分かれできます。

  • 何も残さない一時的な(シークレット)チャット。

  • 生成がまだ実行中でも、待たずに新しいプロンプトをキューに入れられます。

  • チャットの「アーティファクト」は現在 キャンバスで、インラインの HTMLキャンバスカード は自動レンダリングされ、Codeビューがあり、DiffusionGemmaでは生コードが折りたたまれずにインライン表示されたままになります。

  • チャット検索はすべてのメッセージを対象にし、自分のメッセージを最初に表示するようになりました。

Hub(再設計)

  • トレンドフィード、検索、カスタムモデルパス対応を備えたフルページのHub。

  • 分割ビューのフィードでREADMEをプレビューし、ダウンロード前に読めます。

  • ダウンロードの既定はより高速な Xet 転送になり、転送が止まった場合は自動でHTTPフォールバックします。

  • モデル読み込み前に読み込みオプションを設定できる、新しい「選択時に読み込む」トグル。

  • DiffusionGemmaと将来のGemma派生モデル向けにGoogleロゴを表示。

モデルと推論

  • DeepSeek-OCRやその他の視覚モデルが、エラーなく読み込まれ実行されるようになりました。

  • 最新のvLLM(0.22+)での高速推論を修正し、再び高速化が機能するようになりました。

  • tensor parallelismはより信頼性が高くなりました。より高速なMTP経路が失敗しても、クラッシュせずに自動で復旧します。

  • DiffusionGemmaでは、ノイズ除去中の画像生成がライブ表示され、正確な速度統計も表示されるようになりました。

セキュリティとCloudflare暗号化Studio

  • 新しい --secure Cloudflare限定モードにより、エンドツーエンド暗号化されたStudioを実現し、サーバー側ツールは --secureの下で有効なままになります。 unsloth studio --secure!

  • 必要なときはBypass Permissionsモードを使って確認を省き、ツールサンドボックスを無効にできます。

  • Hugging Faceのウイルススキャンと、リポジトリ内の危険なファイルを自動検出。

ログとAPI

  • 新しい APIサーバーモニター をUnslothに追加。

  • API呼び出しが高速化され、レイテンシーが減少

  • ログが大幅に整理され、スループットとレイテンシーが表示され、肥大化したログの多くを削除しました。

ハードウェアとバックエンド

  • Blackwell RTX 50Xおよび60X GPUのサポートを改善

  • CPUではなくGPUにサイレントにダウングレードされる不具合を修正

  • torchaoのバージョンは、インストール済みのtorchから選択されるようになりました。

  • インストーラは、壊れたPyTorchやCPU専用のPyTorchインストールを自動修復し、NVIDIA + AMDのWin/Linux/Mac/WSL全体でサイレントCPUフォールバックを警告するようになりました。

  • トレーニング開始時にチャットモデルのVRAMを解放しますが、GPUが本当に逼迫している場合にのみ行い、それ以外では不要な再読み込みはしません。

  • llama-serverが起動時に致命的クラッシュした場合、Unslothは単に失敗するのではなく、復旧手順を順に試すようになりました。

トレーニングと一般修正、並列モジュール

  • MLXトレーニングの更新。

  • vLLMでのGRPOトレーニング信頼性を改善。

  • トレーニング開始の信頼性を向上し、無効なVLMバッチに対してより明確なエラーを表示。

  • クラッシュ、再起動、中断されたシャットダウン後に残ったバックエンドプロセスを、より確実にクリーンアップするようになりました。

  • エクスポート、チャット、トレーニング、レシピはすべて個別化/分離されています!つまり、今では4つを並行して実行できます!トレーニングやエクスポートを待っている間に、チャットや推論ができます!

Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

DiffusionGemma + Gemma 4 MTP

最新の v0.1.464-beta または 2026.6.7. DiffusionGemma, Gemma 4 MTPMiniMax-M3 がすべてサポートされるようになりました。

  • 実行して学習 DiffusionGemma 経由で Unsloth Studio.

  • Gemma 4 MTP が登場しました!実行 Gemma 4 はMTPで約2倍高速。

  • Gemma 4では音声チャットがサポートされました(wav, mp3, m4a, flac, webm).

  • Gemma 4にPreserve Thinkを追加。

Hub + ダウンロードマネージャー(実験的)

  • 新しい Hub ページを追加し、Hugging Faceのモデルやデータセットを閲覧、ダウンロード、管理できるようにしました。

  • Unslothは、すでにマシン上にあるモデルとデータセットを検出し、ダウンロード済みアセットと並べて表示できるようになりました。

  • ダウンロード済み GGUFモデル は今や直接 実行 / 新しいチャット アクションを持ちます。

RAG / ファイル付きチャット(実験的)

  • 追加 ファイル付きチャット がUnslothに追加され、自分の文書や知識ベースに対して質問できるようになります。

  • ハイブリッド検索、引用、PDFプレビュー、スレッドごとの文書、組み込みの search_knowledge_base ツールをサポートします。

新しい更新ボタン + ハードウェアサポート

  • Unslothは今や、常に最新の llama.cppビルド済み をCUDA、ROCm、Windows、Linux、macOS全体で使用します。

  • アプリ内の llama.cppを更新 ボタンを追加し、Unslothを再インストールせずにローカルバックエンドを更新できるようにしました。

  • Windows / WSLのAMDサポートを改善し、 Strix Halo ROCmサポート, BlackwellのCUDA選択、そしてより明確なインストーラメッセージを追加。

ローカルチャット、ツール、API互換性

  • ローカル tool calling の信頼性が向上し、ツールカードの並び順が改善され、重複するツールループが減り、GGUF visionモデルでのツール使用もサポートされました。

  • 改善された OpenAI互換API とAnthropic互換APIの動作を、ローカルUnslothサーバー向けに改善しました。エラー、トークン使用量、停止理由、 Claude Code互換性.

トレーニングと修正

  • 改善された MLXサポート を改善されたモデルラベル、生成速度統計、以下の修正とともに追加 VLMトレーニング.

  • いくつかの トレーニングデータセット の特殊ケースを修正しました。Hugging Faceキャッシュが書き込み不可の場合や、カスタムデータセットマッピングも含みます。

  • チャット、メニュー、モデルピッカー、ダークモード、インポート/エクスポート、設定全体にわたって多くのUI磨き込み修正を追加しました。

Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Gemma 4 12B、新UI、MCP、プロジェクト

この更新は主にGemma 4 12B、MCP、プロジェクト、Canvas、CUDA 13.3、新しいチャットUIに焦点を当てています。来週はさらに大きな更新を予定しています。

Gemma 4 12B

Googleが公開 Gemma 4 12B、8GB RAMでローカル実行できる新しいモデル。 GGUF / ガイド

Gemma 4 12B Unifiedは画像、音声、256Kコンテキストをサポートします。Unsloth Studio経由でモデルを実行・学習できます。

MCP

  • リモート MCP サーバーサポート。カスタムヘッダーとOAuthを含みます

  • ローカルのコマンドベース MCP サーバーサポート

  • MCP をチャットコンポーザーから有効化できるようになりました

  • よく使われる MCP サーバー向けの組み込みプリセット

新しいチャットUI

  • プロジェクト、Canvas、 MCP、RAG、比較コントロールは、今やプラスメニューにあります

  • 検索とCodeコントロールはコンポーザーからよりアクセスしやすくなりました

  • メニュー、オーバーレイ、アイコン、クリック可能なコントロールはUnsloth全体でより一貫しました

プロジェクト

  • 関連するチャットを専用のプロジェクトワークスペースに整理

  • 既存のチャットをプロジェクトに移動

  • サイドバーから直接プロジェクトを作成・管理

実験的Canvas / アーティファクト

  • 生成されたHTMLを、Unsloth Studio内の専用キャンバスパネルで開きます

  • ブラウザベースの可視化やCDNから読み込まれるパッケージを含む、インタラクティブな出力をサポート

  • レンダリングされたプレビューとソースコードを切り替えられます

インストール、ランタイム、ハードウェア

  • Windowsのビルド済みインストールでは、早期の CUDA Toolkit チェックが不要になりました

  • Linux llama.cpp のビルド済みは、検出されたランタイムに一致するようになりました cudart メジャー

  • ROCm gfx検出がビルド済み選択に引き継がれるようになりました

  • Blackwell, B300ARM64 Linuxサポートの更新

Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

CUDA 13.3、Windows、Mac

Unslothを更新するか、新しいUnsloth Studioをインストールするには、次を使用してください:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

Macの更新

  • 再有効化 llama.cpp Apple Silicon(M1-M4)向けのビルド済みバイナリ - Mac OS 14 / 15 / 26(Tahoe)

  • Apple SiliconのMac OS 13(Ventura)はソースビルド

  • Mac OS 13.3 / 14 / 15 / 26(Tahoe)向けIntel(x86_64)は llama.cpp ビルド済みバイナリを使用

  • Max 13.0 - 13.2向けIntelはソースビルド

Windowsの更新

  • CUDA 13.3 llama.cpp ビルド済みバイナリがWindowsで動作するようになりました

  • CUDA 13.2、CUDA 13.1以下では、WindowsデバイスはCUDA 12.4フォールバックを使用します - CUDA 13.1のバイナリはまもなく対応予定です。

CUDA 13.3更新

  • CUDA 13.3のLinux以外のバイナリは動作します。今のところは引き続きCUDA 13.1を使います

  • CUDA 13.3はCUDA 13.2の文字化け問題を解決します - https://github.com/unslothai/unsloth/issues/4849 を参照

Blackwell GPUの更新

  • 現時点ではBlackwellは llama.cpp のビルド済みバイナリのリリースが遅れます。CUDA 12.4が動作しないためです - すぐに解決に取り組んでいます。

刷新前の更新。

皆さん、今週か来週に来る可能性が高い大規模な刷新の前に、もう1回ほど更新を行っています。今回の刷新では、多くのことが変わります。特に新しい主要機能や多くのデザイン変更があります。

  • 新機能: API呼び出しサポート 画像生成+編集、正しいWeb検索、コード実行、自動プロンプトキャッシュも追加。接続 OpenAI, Anthropic など。

  • 以下の 英語以外の言語 例:日本語、中国語、インド系言語など

前回のリリースを見逃した方も多いかもしれません。これは1日しか公開されませんでした。追加した内容:

  • 外部推論バックエンドに接続: vLLM, Ollama, llama-server

  • セキュリティ改善

  • MTP自動推測デコード MTP GGUF向け。お使いのハードウェアに最適化された設定を取得できます。

APIプロバイダー呼び出しと外部接続

  • Unslothを任意のAPIクラウドプロバイダー(OpenAI、Anthropic、OpenRouterなど)に接続できるようになりました

  • 組み込みWeb検索 OpenAI、Anthropic、OpenRouter、Kimi向け

  • 組み込みコード実行 OpenAIとAnthropic向け(Anthropicのコンテナは永続化され、ターン間で再利用されます)

  • OpenAIとAnthropicモデルでプロンプトキャッシュが有効になり、コストを50〜90%削減します。

  • 画像生成+編集

  • ローカルプロバイダー(llama.cpp / vLLM / Ollama)ではAPIキーが任意になりました

  • クラウドプロバイダー追加時にモデルを自動読み込み

その他のUnsloth Studio更新

  • OpenDocumentのチャット添付

  • o3の推論サマリーペイロード

  • 英語以外の言語(例:日本語、中国語)での送信/プロンプトが正しく動作するようになりました

  • IMEコンポーザーの強化、RTL dir="auto"、長いログ行の切り捨て修正

  • UI でのツール推論トレースの表示

  • 完全オフライン対応: キャッシュされた GGUF 検出と、推論・学習の両方に対するオフライン DNS 自動検出

Unsloth Studio のセキュリティ改善

  • 認証のレート制限。リバースプロキシに対応し、プロキシ経由でも回避されません

  • 厳格化されたブロックリストを持つサンドボックス化されたワーカー(bash、 hf アップロード, NOFILE)

  • パスの制限により、ワーカーが処理中の tmp ディレクトリから抜け出せません

  • Unsloth API 全体で厳格なスキーマ検証

  • CSP / セキュリティヘッダーを強化(正当な favicon ホストのみ許可)

  • 削除しました torch.load へのフォールバック training_args.bin そのため、信頼できない pickle がモデル読み込み時に実行されることはありません

  • Tauri デスクトップ版のリリースフローを強化

  • フロントエンド認証: singleflight によるトークン更新、変更時の現在のパスワード入力、動作するログアウト、共有 422 ヘルパー

  • キャンセル時のクリーンアップは、処理中の tmp ディレクトリに厳密に限定され、ユーザー状態を削除することはありません

MTP + Unsloth の修正

Unsloth に多数のバグ修正、UI・UX 修正を追加しました! 最新の更新を取得するには:

macOS、Linux、WSL:

curl -fsSL https://unsloth.ai/install.sh | sh

Windows:

irm https://unsloth.ai/install.ps1 | iex

修正

  1. 修正 unsloth studio update うまく動作していない

  2. で固まる問題を修正 reset-password ページ

  3. オフラインモードのサポートをさらに追加

  4. Mac、CPU、GPU で MTP が速くならない問題を改善 - 今ではずっと良くなりました!

  5. 更新後にデスクトップショートカットが動作しない問題を修正

  6. UI/UX のバグ修正を大量に実施

Qwen3.6 MTP + API 接続

Unsloth にたくさんの新しい更新があります v0.1.41-beta:

  • GGUF 推論が約 2 倍高速化 自動的に有効化される MTP

  • API呼び出しサポート 用の OpenAI, Anthropic など。自動プロンプトキャッシュ、ウェブ検索、コード実行付き

  • 外部推論バックエンドに接続: vLLM, Ollama, llama-server

  • 実験的 MLX 推論

  • 以下の 英語以外の言語

  • セキュリティ 改善

Qwen3.6 チュートリアルを実行MTP ガイド

MTP の speculative decoding サポートにより、推論が 1.4~2 倍高速化!

  • MTP自動推測デコード MTP GGUF 向け。付属の llama.cpp のプリビルドが古い、または MTP に対して古すぎる場合に警告します

  • MTP 対応の新しい llama.cpp プリビルドバイナリ!

APIプロバイダー呼び出しと外部接続

  • Unslothを任意のAPIクラウドプロバイダー(OpenAI、Anthropic、OpenRouterなど)に接続できるようになりました

  • 組み込みWeb検索 OpenAI、Anthropic、OpenRouter、Kimi向け

  • 組み込みコード実行 OpenAIとAnthropic向け(Anthropicのコンテナは永続化され、ターン間で再利用されます)

  • OpenAIとAnthropicモデルでプロンプトキャッシュが有効になり、コストを50〜90%削減します。

  • ローカルプロバイダー(llama.cpp / vLLM / Ollama)ではAPIキーが任意になりました

  • クラウドプロバイダー追加時にモデルを自動読み込み

MLX 推論(実験的)

  • MLX の量子化モデルと通常モデルを、Mac マシン上でローカル実行できるようになりました!

  • 思考、ツール、ウェブ検索を近日中に追加します!

その他のUnsloth Studio更新

  • 英語以外の言語(例:日本語、中国語)での送信/プロンプトが正しく動作するようになりました

  • OpenDocumentのチャット添付

  • o3の推論サマリーペイロード

  • IMEコンポーザーの強化、RTL dir="auto"、長いログ行の切り捨て修正

  • UI でのツール推論トレースの表示

  • 完全オフライン対応: キャッシュされた GGUF 検出と、推論・学習の両方に対するオフライン DNS 自動検出

  • UI/UX を大幅に磨き込み: ダークテーマのリファクタリング、右サイドバーの再設計、時間帯ごとのナマケモノのマスコット、閉じられてコピー可能なトースト、より大きなチャット入力欄、コード実行設定の磨き込み、入力欄のアクションピルのスタイリング、より細い Discord ボタン

学習の更新

  • Gemma の attention mask 修正

  • 複数画像 GRPO

  • GRPO の hidden state 返却実験

  • 新しい継続事前学習(CPT)学習手法を第一級オプションとして追加

  • 修正のために Gemma-4 MoE LoRA エクストラクタを登録 grouped_mm 縮約クラッシュ

  • 任意で有効化できる fused lm_head + cross-entropy forward、UNSLOTH_RETURN_LOGITS=1 の下では単一 matmul パス UNSLOTH_RETURN_LOGITS=1

  • 評価用のバッチサイズを渡す

  • 評価/学習パスは現在、 HF_DATASETS_OFFLINE と併せて HF_HUB_OFFLINE

Unsloth Studio のセキュリティ改善

  • 認証のレート制限。リバースプロキシに対応し、プロキシ経由でも回避されません

  • 厳格化されたブロックリストを持つサンドボックス化されたワーカー(bash、 hf アップロード, NOFILE)

  • パスの制限により、ワーカーが処理中の tmp ディレクトリから抜け出せません

  • Unsloth API 全体で厳格なスキーマ検証

  • CSP / セキュリティヘッダーを強化(正当な favicon ホストのみ許可)

  • 削除しました torch.load へのフォールバック training_args.bin そのため、信頼できない pickle がモデル読み込み時に実行されることはありません

  • Tauri デスクトップ版のリリースフローを強化

  • フロントエンド認証: singleflight によるトークン更新、変更時の現在のパスワード入力、動作するログアウト、共有 422 ヘルパー

  • キャンセル時のクリーンアップは、処理中の tmp ディレクトリに厳密に限定され、ユーザー状態を削除することはありません

Unsloth API エンドポイント

v0.1.39-beta のバグ修正 2026年5月5日

チャット履歴が表示されない問題(既存のチャット履歴は失われません)と、添付が正しく追加されない問題を修正しました。このバグは表示のみの問題でした - 使用してください 2026.5.2 または直接呼び出してください curl -fsSL https://unsloth.ai/install.sh | sh 更新するには

次のようなツールと一緒にローカル LLM を使えます: Claude CodeCodex Unsloth の API エンドポイントに接続することで。これにより、次のようなモデルを実行できます: QwenGemma をローカルで。自己修復ツール呼び出し、コード実行、ウェブ検索などの追加機能付きで。

Unsloth を API 推論エンドポイントとして使う利点は、セットアップが簡単で高速なだけでなく、Unsloth が次の機能を提供するからです:

新しいモデル

実行できる新しいモデルもいくつか追加しました。NVIDIA を含む Nemotron 3 Nano Omni、IBM Granite 4.1Mistral 3.5 Medium。私たちは Mistral が transformers と GGUF での実装に関するいくつかの問題を解決するのを支援しました。

Unsloth の更新

  • 停止した Unsloth の学習実行をチェックポイントから再開できるようになりました。

  • チャットスレッドがより確実に自動保存・永続化されるようになりました。

  • マルチプロセス構成での DPO 学習のハングを修正しました。

  • MROPE の更新により、VLM GRPO のサポートが改善しました。

  • Unsloth の停止ボタンが生成を正しく停止するようになりました。

  • ブラウザ更新後にチャットテンプレートが消える問題を修正。

完全新規の UI 再設計

みなさん、チャットと学習に重点を置くために、Unsloth Studio の UI と UX を全面的に刷新しました:

  • コミュニティのフィードバックをもとに折りたたみ可能なサイドバーを追加

  • チャットを削除したり、過去の会話を検索できるようになりました

  • Qwen3.6 のような対応モデル向けに、新しい「思考を保持」トグルを追加

  • よりクリーンで一貫性のあるデザインになり、ナビゲーションも簡単に

  • プロフィール画像や名前などを変更できるオプションを備えた設定ページを拡張

  • Hugging Face トークンを二度入力する必要はもうありません

  • gpt-oss に low・medium・high の思考トグルが追加されました。

  • Linux CUDA でも最新の llama.cpp プリビルドを使用するようになりました

  • 多数のバグ修正、一貫性と安定性の改善

  • Kimi-K2.6 を実行できるようになりました!

  • 実験的な API サポートも追加しました。ガイドや告知などは来週公開します。

Qwen3.6 は以前から Unsloth Studio で実行と学習に対応していました。今すぐ Qwen3.6-27B を学習・実行できます!

Qwen3.6-27B + Kimi K2.6

Qwen3.6-27B Unsloth Studio で実行(18GB RAM)およびファインチューニングできるようになりました。Kimi K2.6 も Unsloth で実行できます(350GB RAM)。

Unsloth Studio に多くの更新が入ったので、アップデートしてください。詳細と解説は数日以内に公開します。

Qwen3.6

Qwen3.6 Unsloth Studio で実行およびファインチューニングできるようになりました。このモデルは 23GB RAM で動作し、ほぼすべてのベンチマークで最強の中規模 LLM です。

Gemma 4 アップデート + MiniMax-M2.7

Gemma 4 GGUF は、Google の公式チャットテンプレート修正(ツール呼び出しの修正・改善)と最新の llama.cpp 修正で更新されました。最新の llama.cpp に更新し、量子化モデルを再ダウンロードすれば、 未使用トークン の問題はもう発生しないはずです。 MiniMax-M2.7 が公開されました! 128GB RAM / unified memory で、私たちの GGUF を使って 4-bit 量子化でローカル実行できます。 MiniMax-M2.7 GGUF

Gemma 4 の修正

Gemma 4 を更新しました 多数の修正を含む。これらのバグは共通のもので、すべての学習パッケージと実装に影響し、 Unsloth に起因するものではありませんでした。私たちはバグを特定して修正し、Gemma 4 の学習は現在 Unsloth で正しく動作します。

必要なのは 8GB VRAM で学習すること Gemma-4-E2B をローカルで。Unsloth は Gemma 4 を学習します VRAM を約 60% 少なく使いながら、約 1.5 倍高速 FA2 構成よりも速く。Gemma 4 学習の完全ガイドとノートブックは、 ブログをご覧ください.

Gemma 4 学習の修正

  1. 勾配蓄積 で損失爆発が起きなくなりました。以前は、損失が次の値まで急上昇することがありました 300~400;期待される損失はおよそ 10~15.

  2. 修正した IndexError 影響していた 26B31B の推論における transformers.

  3. 次のモデルの文字化け出力を修正 E2B/E4B のとき use_cache=False。参照: issue #45242.

  4. 修正 float16 音声 からのオーバーフロー -1e9 の値。

損失が次より大きい場合は 13~15、 たとえば 100 または 300 - 勾配蓄積が誤って処理されている可能性があります。これは両方で修正済みです UnslothUnsloth Studio.

Gemma 4 の量子化モデル再アップロード

Gemma 4 GGUF も更新したため、再ダウンロードが必要です。繰り返しになりますが、これらの量子化問題は Unsloth に関連したものでも、Unsloth によって引き起こされたものでもありません:

  1. CUDA: 結合前にバッファの重なりを確認 - 重要な修正 <unused24> トークン - PR #21566

  2. kv-cache:異種 iSWA の attention rotation をサポート - PR #21513

  3. vocab:Gemma 4 の BPE デトークナイザに byte token の処理を追加 - PR #21488

  4. 変換:設定 「add bos」== True Gemma 4 向け - PR #21500

  5. 共通:Gemma 4 専用パーサーを追加 - PR #21418

  6. llama-model:読み取り final_logit_softcapping Gemma 4 向け - PR #21390

  7. llama:Gemma 4 向けのカスタム改行分割を追加 - PR #21406

Unsloth Studio の更新

  • 追加 speculative decoding サポート(ngram-mod、デフォルトで有効)

  • Llama.cpp を更新し、すべての Gemma 4 修正を含む最新バージョンを使用するようにしました

  • Qwen3.5 と Gemma 4 の学習問題を修正

  • Gemma 4 モデルのエクスポートと保存を有効化

  • ターミナルと Python ツールのサンドボックスセキュリティを強化

  • レシピが Chat で読み込まれたモデルを使用できるようにする

  • 移動時(およびタブ切り替え時)に空のチャットスレッドが表示される問題を修正し、新しいチャットフローを安定化

  • LLM でないレシピの実行を許可し、実行時には Data タブを先頭に移動

  • 重複ダウンロードを防ぐため、HF のキャッシュ済みリポジトリの大文字小文字を再利用

Google - Gemma 4

  • 次のモデルを実行・学習できるようになりました Gemma 4 Unsloth でのモデル。

  • Intel Mac が動作するようになりました

  • 2 つの Gemma-4 修正用の llama.cpp プリコンパイル済みバイナリ:

    • vocab: Gemma4 トークナイザを修正 (#21343)

    • 修正: gemma 4 テンプレート (#21326)

  • 小型モデルのツール呼び出しがより安定し、途中で切れなくなりました

  • Windows、Linux、Mac、WSL デバイス向けのプリコンパイル済みバイナリ - CPU と GPU

  • 非ビジョンモデル向けに Speculative Decoding を追加(残念ながら Gemma-4 はビジョンモデルで、Qwen3.5 も同様)

  • コンテキスト長が正しく適用されるようになりました。

  • ウェブ検索が要約だけでなく、実際のウェブコンテンツを取得するようになりました

  • HF API 呼び出しを 90% 削減 - レート制限が減少

ツール呼び出し精度が 50% 向上 + さらなるサポート

  • すべてのモデルのツール呼び出しは現在 30%~80% 精度が向上しました。

  • ウェブ検索が要約だけでなく、実際のウェブコンテンツを取得するようになりました

  • 許可されるツール呼び出し数を 10 から 25 に増やしました

  • ツール呼び出しがより適切に終了するようになり、ループ / 繰り返しが減少します

  • さらに ツール呼び出しの修復 および重複排除ロジックにより、ツール呼び出しから XML が漏れるのも防止

  • 次でテスト済み unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL)ウェブ検索 + コード実行 + 思考を有効化。

指標
以前
以後

応答内の XML 漏れ

10/10

0/10

使用された URL フェッチ

0

10 回中 4 回

正しい曲名で実行された回数

0/10

2/10

平均ツール呼び出し数

5.5

3.8

平均応答時間

12.3秒

9.8秒

新機能

  • 追加 カスタムフォルダ そのため、どのフォルダでも任意の GGUF を使用できます。現在は Chat の詳細設定と Custom Folders からアクセスできます

  • 更新ボタン 表示されるようになりました

  • インストールスクリプトのスタイルをすべて更新しました!

  • 予備的な 推論と学習のための自動マルチ GPU サポート - 1 枚の GPU に収まらない大規模モデルに便利 - Unsloth auto が GPU リソースを割り当てます

  • Intel Mac はそのままで動作するはずです

よりスムーズで高速になった Unsloth

  • 大規模モデルのダウンロードタイムアウトを修正 - タイムアウトはもう発生しません。

  • Hugging Face のレート制限を修正 - HF API 呼び出しを 90% 削減

  • Windows での bun を修正し、インストールを高速化

新しい重要な更新

前回のリリースからまだ 2 日しか経っていませんが、より重要な更新があります:

  • 推論が 20~30% 高速化しました。 以前は、ツール呼び出しとリピートペナルティが原因で推論速度が通常より遅くなることがありました。推論 tokens/s は現在、次と同等の性能になるはずです llama-server / llama.cpp.

  • 古いモデルや既存のモデルを自動検出するようになりました からダウンロードされた LM Studio、Hugging Face、 および同様のソース。

  • 推論 token/s 速度が正しく計算されるようになりました。 以前は tokens/s に起動時間が含まれていたため、表示速度が実際より遅く見えていました。現在は「真の」推論速度を反映するはずです。

  • CPU 使用率が急上昇しなくなりました。 以前は、インラインクエリの ID が再描画ごとに変わり、その結果 useLiveQuery が継続的に再購読されていました。

  • Unsloth Studio に終了用の x ボタンが追加され、正しく終了するようになりました。 以前は、デスクトップアイコンから開いた後に閉じても正しく終了しませんでした。現在は、ショートカットから起動するとターミナルも開き、そのターミナルを閉じると Unsloth Studio が完全に終了します。以前のセッションからまだ開いている場合は、コンピュータを再起動するか、次を実行してください lsof -i :8888 その後 kill -9 <PID>.

  • さらに優れたツール呼び出しとウェブ検索 エラーを減らして。

  • 次に関する新しい情報を多数追加したドキュメント更新 モデルの削除、アンインストール など。

  • Windows と Linux 全体で、よりクリーンで賢いインストールおよびセットアップログに。 出力は一貫した書式で読みやすくなり、よりスムーズな体験のためにデフォルトでは静かになり、より豊かな --verbose 診断情報を、完全な技術詳細が必要なときに利用できます。

  • 学習履歴を表示できるようになりました!

Unsloth Studio 公開後の最初のリリース

みなさん、これは Unsloth Studio を公開してから初めてのリリースです。新機能と修正がたくさんあります:

  • Unsloth Studio を更新できるようになりました! 同じインストールコマンドで更新してください。

  • Windows CPU または GPU がシームレスに動作するようになりました。再インストールしてください!

  • アプリのショートカット。インストール後は、スタート/Launch とデスクトップのショートカットアイコンから、Windows、MacOS、Linux で起動できるようになりました。

  • 事前コンパイル済み llama.cpp バイナリmamba_ssm - インストールが6倍高速化! バイナリのサイズも300MB未満。

  • インストールサイズを50%削減 (7GB以上の節約)、インストールは2倍高速化し、解決も高速化。PyPIサイズは50%小さくなりました。

  • ツール呼び出しが改善されました。 llama.cpp の解析が改善され、チャットに生のツールマークアップが表示されず、推論が高速化、新しい「ツール出力」パネル、タイマー。

  • MacOS と CPU には データレシピ 複数ファイルのアップロードで有効化されました。

  • Linux 向けの AMD サポートは予備対応 Linux のみのマシン向け - 自動検出します。

  • 設定サイドバーを再設計。 設定は現在、次の項目にグループ化されています モデル、サンプリング、ツール、設定

  • コンテキスト長 現在は調整可能です。なお、llama.cpp は次の方法で必要な正確なコンテキストを賢く使用するため、これは不要であることに注意してください --fit を有効にした場合

  • 複数ファイルのアップロード。 データレシピは、PDF、DOCX、TXT、MD の複数のドラッグ&ドロップアップロードをサポートするようになり、バックエンド抽出、アップロードの保存、プレビューの改善が行われました。

  • Colab 無料の T4 GPU を使う Unsloth Studio の問題が修正されました! ここで試す。事前コンパイル済みバイナリのおかげで、20倍高速でもあります!

  • チャットの可観測性が向上。 Unsloth は現在、次を表示します llama-server 実行時間と使用状況、コンテキストウィンドウ使用量バー、さらに詳細なソースのホバーカード。

  • 全体的により良いUX - クリック可能なリンク、改善された LaTeX 解析、デフォルトカード用のツール / コード / Web ツールチップなど、さらに多く!

  • LiteLLM - Unsloth Studio と Unsloth は ではありませんでした 最近の LiteLLM 侵害の影響を受けていませんでした。Nemo Data Designer が LiteLLM を使用していたのは 1.80、影響を受けたものではなく 1.82.7 または 1.82.8、その後完全に削除しました。

  • 新しい1行のインストールコマンドができました。次を実行するだけです:

修正事項:

  • Windows/セットアップの改善。 Windows での無言終了、Anaconda/conda-forge の起動時クラッシュ、壊れた非 NVIDIA の Windows インストール、初期 CUDA / 古い venv のセットアップチェックの欠落を修正しました。

  • システムプロンプトを修正しました。 GGUF 以外のテキストおよび画像推論で再び動作します。

  • 永続的なシステムプロンプトとプリセット。 カスタムのシステムプロンプトとチャットプリセットが、再読み込みやページ移動後も保持されるようになりました。

  • GGUF エクスポートを拡張。 LoRA/PEFT だけでなく、フルファインチューニングも GGUF にエクスポートできるようになりました。ベースモデルの解決はより信頼性が高くなり、未対応のエクスポートオプションは UI で無効化されます。

  • チャットのスクロール/レイアウト修正。 生成中のスクロール位置の問題、思考パネルのレイアウトずれ、推論パネルを折りたたむ際のビューポートのジャンプを修正しました。

  • より賢いポート競合検出。 Unsloth はループバック競合を検出し、可能な場合は妨げているプロセスを特定できるようになり、フォールバックポートのメッセージもより明確になりました。

新しいツール呼び出し + Windows の安定性向上

  • Claude Artifacts が動作するようになり、HTML をチャット内でスネークゲームのように実行できます

  • ツール呼び出しの精度が 30% 向上、特に小型モデルで + ツール呼び出し用タイマー

  • ツール + Web 検索の出力を保存可能 + 自動修復ツールのオン/オフ切り替え

  • 多数のバグ修正 - Windows の CPU で動作、Mac はよりスムーズに、インストールはより高速かつ小型に

最終更新

役に立ちましたか?