Inkling - ローカル実行方法
Thinking Machine LabsのInklingマルチモーダルモデルをローカルで実行する方法を学びましょう。
Thinking Machines Labs の Inkling は、以下からなるオープンウェイトのマルチモーダルモデルです。 Inkling-Small 新しい 276B (12Bアクティブ)のモデルと、以前の 975B (41B)パラメータモデルです。Apache 2.0 の下でライセンスされており、これらのモデルは 100万トークンのコンテキストウィンドウをサポートし、以下のネイティブなマルチモーダル入力に対応しています。 テキスト, 画像、および 音声, を入力として受け取り、 テキスト を出力として生成します。Inkling は、コーディング、エージェント的処理やツール呼び出し、RAG、チャット、多言語、マルチモーダルのワークロードで優れています。
Dynamic 2-bit は、サイズを 82% 小さくしながら 81% のトップ1%精度に達します。これは、私たちの Unsloth Dyanmic GGUF 手法でモデルを 82% 小さくしても、モデルが 82%「賢くなくなる」ことを意味するわけではありません。劣化は約 18% にとどまります。Unsloth にゼロデイアクセスを提供してくれた Thinking Machines Lab (TML) に感謝します。 Inkling-Small-GGUF と Inkling-GGUF
⚙️ 使用ガイド
1ビットのダイナミック量子化 UD-IQ1_S は 270GB のディスク容量が必要です。これには Mac Studio Ultra、または少なくとも RAM+VRAM が 290GB 程度あるマシンが必要になります。
この 1ビット この量子化は 290GB の RAM に収まり、6/8ビットには 900GB の RAM が必要です。右側で、Inkling に Sudoku の HTML ゲームを作らせた 1ビット GGUF の動作例をご覧ください。
Unsloth における 1ビット Inkling GGUF は右を参照してください。

表:推論ハードウェア要件 (単位 = 総メモリ: RAM + VRAM、またはユニファイドメモリ):
Inkling-Small
89 GB
128 GB
132 - 170 GB
256 GB
543 GB
Inkling
325 GB
450 GB
600 GB
870 GB
1900 GB
表: 975B Inkling のトップ1%保持率(精度回復):
74.2%-77.4%
81.0%
88.7%
94.4%
99.8%
100.0%
最良の性能を得るには、VRAM とシステムRAMを含む利用可能な総メモリが、量子化モデルファイルサイズを十分な余裕をもって上回っていることを確認してください。


推奨設定
Inkling には Non-thinking モードと Thinking モードがあります。 Unsloth Studio UI で Thinking と Non-Thinking を簡単に切り替えられます。
ほとんどの用途では以下の設定を使ってください:
temperature = 1.0
top_p = 1.0(オフ)
最大コンテキストウィンドウ:
1,048,576.
チャットテンプレートと思考の強さ
Inkling は、「Thinking effort level:」という興味深いシステムプロンプトの要素を使っており、0.00 から 0.99 までの数値になっています。以下をトークナイズすると:
以下のようになります:
思考を無効化し、推論の強度を変更する
Inkling はデフォルトで推論を使用します。また、推論の強さとして、 reasoning_effort none = 0、low = 0.2、medium = 0.7、high = 0.9、xhigh = 0.99、max = 0.99 を指定できます。
思考を無効にするには、 --chat-template-kwargs '{"reasoning_effort":'none'}'を使ってください。 Windows のPowershellを使っている場合は、次を使用してください: --chat-template-kwargs "{\"reasoning_effort\":'none'}"
推論強度のカスタマイズや推論の無効化には、以下の例を使ってください:
Inkling は、1ビットの動的量子化でも、思考を挟みながらの処理とツール呼び出しを行えます。

Inkling チュートリアルを実行:
Inkling は Unsloth 上で MacOS、Windows、Linux で動作します。次のことができます:
検索、ダウンロード、 GGUFの実行 およびsafetensorモデル
自己修復 ツール呼び出し + ウェブ検索
コード実行 (Python、Bash)
自動推論 パラメータ調整(temp、top-pなど)
llama.cpp経由の高速CPU+GPU推論
LLMの学習 VRAMを70%削減しつつ2倍高速

Unsloth のインストールと起動
インストールするには、ターミナルで次を実行してください:
MacOS、Linux、WSL:
Windows PowerShell:
Unslothを起動
MacOS、Linux、WSL、およびWindows:
検索してダウンロード Inkling
次に〜へ移動し Unsloth Chat タブを開いて Inkling を検索バーで検索し、必要なモデルと量子化版をダウンロードしてください。モデルを実行するのに十分な計算資源があることを確認してください。

Inkling を実行
Unsloth Studioを使うと推論パラメータは自動設定されますが、手動でも変更できます。コンテキスト長、チャットテンプレート、その他の設定も編集できます。
詳細については、次を参照してください Unsloth Studio推論ガイド.

🦙 llama.cpp で Inkling を実行
このガイドでは UD-IQ1_S 量子化では少なくとも 290GB の RAM が必要になります。量子化タイプは自由に変更できます。これらのチュートリアルでは、 llama.cpp を高速ローカル推論に使用します。GGUF: Inkling-GGUF
Unslothをダウンロード
Unslothガイド
https://unsloth.ai/download
特定の llama.cpp PRを GitHub はこちら。以下のビルド手順に従うこともできます。変更してください -DGGML_CUDA=ON を -DGGML_CUDA=OFF GPU がない場合、または CPU 推論のみを使用したい場合。 Apple Mac / Metal デバイスの場合、次を設定し -DGGML_CUDA=OFF その後は通常どおり続行してください。Metal サポートはデフォルトで有効です。
現在は llama.cpp を直接使ってモデルを読み込み・ダウンロードできます。 ollama runと同じように。まず、 Q2_K_XLのように、希望する量子化タイプを選択してください。また、 export LLAMA_CACHE="folder" して llama.cpp を特定の場所に保存するよう強制できます。このダウンロード प्रक्रियाはかなり遅い場合があるため、次のセクションの手動ダウンロード手順を使うのがおそらく最善です。
Inkling-Small 276B:
Inkling 975B:
モデルを手動でダウンロードしたい場合は、以下のコードでダウンロードできます(次をインストールした後) pip install huggingface_hubをインストールした後)。ダウンロードが止まる場合は、次を参照してください: Hugging Face Hub、XETのデバッグ
Inkling-Small 276B:
Inkling 975B:
次を編集できます --threads 32 CPUスレッド数として --ctx-size 32768 コンテキスト長として --n-gpu-layers 2 GPU オフロード時に何層にするかを指定します。GPU がメモリ不足になった場合は調整してみてください。CPU のみで推論する場合は削除してください。VRAM 使用量を減らすために llama.cpp に Flash Attention の bias fused kernel も実装しましたが、できるだけ --ctx-size 控えめにしておくのがよいです!
Inkling-Small 276B:
Inkling 975B:
📐量子化分析
また、Inkling-GGUF の量子化精度を評価するために KLD(KL ダイバージェンス)ベンチマークも実施しました。まず、ffn_up と ffn_gate の exp に 6ビットを使った 8ビット + 6ビットの量子化ミックスをモデル向けに作成し、逆量子化の観点では RMSE が 1e-4 以下であることを確認しました。ffn_down を量子化すると誤差がさらに 10 倍増えたため、8/6ビット量子化ではそれを Q8_0 のまま維持しています。
純粋なトップ1%精度では、 1ビットの動的量子化はサイズを 86% 小さくしながら、精度は約 74.2% です。! 動的 2-bit はサイズを 82% 小さくしながら、精度は約 81% です。これは、いくつかの層をより高い精度に動的量子化してもモデルが使い物にならなくなるわけではなく、完全に無意味になるわけでもないことを示しています。層を選択的に量子化すれば、多くの精度を回復できることが分かります!
では、「74% の精度」とは実際には何を意味するのでしょうか?
これは、26% の確率でモデルが意味不明な文字列や誤った結果を出すという意味ではありません。むしろ、上位候補のうち 26% では、2番目に確率の高い答えを選ぶことがある、という意味です。
たとえば「詩を作って」と頼むと、結果は大きく異なります。74% の確率では BF16 ベースラインに近い詩になりますが、26% では別の詩になるものの、それでも正しいです。創造性やサンプリングが関わらない事実質問では、モデルは常に同じ答えを再現します(たとえば「2+2 は?」では、5 ではなく常に 4 と答えます)。

📊 ベンチマーク
Inkling のベンチマークは、下の表形式でも確認できます:
Inkling の結果は effort=0.99 で報告されています。比較スコアは 2026年7月14日に生成されました。Nemotron 3 Ultra、Kimi K2.5、Kimi K2.6、GLM 5.2、DeepSeek V4 Pro はオープンウェイトモデルです。Gemini 3.1 Pro、Claude Fable 5、GPT 5.6 Sol はクローズドウェイトモデルです。
推論
HLE(テキストのみ)
29.7%
26.6%
29.4%
35.9%
40.1%
35.9%
44.7%
53.3%
47.2%
HLE(ツールあり)
46.0%
37.4%
50.2%
54.0%
54.7%
48.2%
51.4%
64.5%
55.0%
AIME 2026
97.1%
94.2%
95.8%
96.4%
99.2%
96.7%
98.3%
–
99.9%
GPQA Diamond
87.2%
86.7%
87.9%
91.1%
89.5%
88.8%
94.1%
92.6%
94.1%
Agentic(コーディング)
SWEBench Verified
77.6%
70.7%
76.8%
80.2%
–
80.6%
80.6%
95.0%
–
SWEBench Pro(Public)
54.3%
46.4%
50.7%
58.6%
62.1%
55.4%
54.2%
80.0%
64.6%
Terminal Bench 2.1(Best Harness)
63.8
56.4
51.3
71.3
82.7
64
73.8
84.6
89.5
GDPVal-AA v2
1233
1164
1009
1190
1514
1307
962
1760
1748
Agentic(一般)
MCP Atlas
74.1%
44.7%
64.0%
68.1%
77.8%
73.2%
78.2%
83.3%
81.8%
Tau 3 Banking
23.7%
13.8%
13.2%
20.6%
26.8%
25.8%
16.5%
26.8%
33.0%
事実性
BrowseComp(Ctx 付き)
77.1%
–
74.9%
83.2%
–
83.4%
85.9%
88.0%
89.4%
SimpleQA Verified
43.9%
32.4%
36.9%
38.7%
38.1%
57.0%
77.3%
68.3%
71.6%
AA Omniscience
1.0%
-1.0%
-8.0%
6.0%
4.0%
-10.0%
33.0%
40.0%
22.0%
チャット
IFBench
79.8%
81.4%
70.2%
76.0%
73.3%
76.5%
77.1%
63.5%
72.7%
Global-MMLU-Lite
88.7%
85.6%
84.0%
88.4%
89.2%
89.3%
92.7%
93.3%
91.8%
ビジョン
MMMU Pro(Standard 10)
73.3%
–
75.0%
79.0%
–
–
82.0%
84.2%
83.0%
Charxiv RQ
78.1%
–
77.5%
80.4%
–
–
80.2%
86.5%
84.7%
Charxiv RQ(python 付き)
82.0%
–
78.7%
86.7%
–
–
89.9%
89.4%
87.8%
音声
Audio MC
56.6%
–
–
–
–
–
66.8%
–
–
MMAU
77.2%
–
–
–
–
–
82.5%
–
–
VoiceBench
91.4%
–
–
–
–
–
94.3%
–
–
安全性
FORTRESS(敵対的)
78.0%
77.6%
54.1%
65.6%
71.3%
36.0%
65.2%
96.0%
82.4%
FORTRESS(無害)
95.9%
90.5%
98.3%
97.2%
90.0%
98.5%
98.0%
55.1%
98.1%
StrongREJECT
98.6%
98.7%
99.5%
99.8%
98.5%
98.6%
98.0%
98.7%
98.5%
最終更新
役に立ちましたか?

