Inkling - Wie man lokal ausführt
Erfahre, wie du die multimodalen Inkling-Modelle von Thinking Machine Labs lokal ausführst.
Inkling von Thinking Machines Labs sind multimodale Open-Weight-Modelle, bestehend aus: Inkling-Small das neue 276B (12B aktiv) Modell und das frühere 975B (41B) Parameter-Modell. Lizenziert unter Apache 2.0 unterstützen die Modelle ein Kontextfenster von 1 Mio. Tokens, nativen multimodalen Input für Text, Bild und Audio, und erzeugt Text als Ausgabe. Inkling glänzt bei Coding, agentischem Arbeiten und Tool-Aufrufen, RAG, Chat, mehrsprachigen und multimodalen Workloads.
Dynamische 2-Bit erreicht 81 % Top-1%-Genauigkeit und ist dabei 82 % kleiner. Dies zeigt: Wenn wir das Modell mit unserem um 82 % verkleinern Unsloth Dynamic GGUF-Methode – das bedeutet NICHT, dass das Modell 82 % „dümmer“ wird – es ist nur eine Verschlechterung von etwa 18 % zu sehen. Danke an Thinking Machines Lab (TML) für den Tag-Null-Zugriff auf Unsloth. Inkling-Small-GGUF und Inkling-GGUF
Inkling-Tutorials ausführenQuantisierungsergebnisse
⚙️ Nutzungsanleitung
Die dynamische 1-Bit-Quantisierung UD-IQ1_S verwendet 270GB an Speicherplatz – dafür braucht man einen Mac Studio Ultra oder Maschinen mit mindestens so viel RAM+VRAM, dass es etwa 290 GB sind.
Die 1-Bit Die Quantisierung passt auf 290 GB RAM, und 6/8-Bit erfordert 900 GB RAM. Rechts sieht man das 1-Bit-GGUF in Aktion, wo wir Inkling gebeten haben, ein Sudoku-HTML-Spiel zu erstellen.
Rechts ist das 1-Bit-Inkling-GGUF in Unsloth zu sehen:

Tabelle: Hardwareanforderungen für Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory):
Inkling-Small
89 GB
128 GB
132 - 170 GB
256 GB
543 GB
Inkling
325 GB
450 GB
600 GB
870 GB
1900 GB
Tabelle: Beibehaltener Top-1%-Wert (Genauigkeitswiederherstellung) für 975B Inkling:
74.2%-77.4%
81.0%
88.7%
94.4%
99.8%
100.0%
Für beste Leistung stellen Sie sicher, dass Ihr gesamter verfügbarer Speicher, einschließlich VRAM und Systemspeicher, die Dateigröße des quantisierten Modells mit ausreichend Puffer übersteigt.


Empfohlene Einstellungen
Inkling hat Nicht-Denken- und Denkmodi. In Unsloth Studio kann man Denken und Nicht-Denken ganz einfach per UI umschalten.
Verwenden Sie diese Einstellungen für die meisten Anwendungsfälle:
Temperatur = 1.0
top_p = 1.0 (Aus)
Maximales Kontextfenster:
1,048,576.
Chat-Template & Denkaufwand
Inkling verwendet eine interessante Komponente im System-Prompt namens „Thinking effort level:“, bei der es sich um eine Zahl von 0.00 bis 0.99 handelt! Das Folgende wird tokenisiert:
erhält man Folgendes:
Denken deaktivieren, den Reasoning-Aufwand ändern
Inkling verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Aufwände, bei reasoning_effort denen none = 0, low = 0.2, medium = 0.7, high = 0.9, xhigh = 0.99 und max = 0.99 sein kann.
Um das Denken zu deaktivieren, verwenden Sie --chat-template-kwargs '{"reasoning_effort":'none'}'. Wenn Sie auf Windows PowerShell sind, verwenden Sie: --chat-template-kwargs "{\"reasoning_effort\":'none'}"
Für die Anpassung des Reasoning-Aufwands oder um Reasoning zu deaktivieren, verwenden Sie die folgenden Beispiele:
Inkling kann auch abwechselnd denken und Tools aufrufen – sogar mit der dynamischen 1-Bit-Quantisierung!

Inkling-Tutorials ausführen:
Inkling läuft in Unsloth unter MacOS, Windows und Linux. Sie können:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-P usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren und starten
Um es zu installieren, führe in deinem Terminal aus:
macOS, Linux, WSL:
Windows PowerShell:
Unsloth starten
MacOS, Linux, WSL und Windows:
Suchen und herunterladen Inkling
Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach Inkling in der Suchleiste und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Stelle sicher, dass du genügend Rechenleistung hast, um das Modell auszuführen.

Inkling ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

🦙 Inkling in llama.cpp ausführen
Für diese Anleitung werden wir die UD-IQ1_S Quantisierung, die mindestens 290 GB RAM erfordert. Sie können den Quantisierungstyp gerne ändern. Für diese Tutorials werden wir verwenden llama.cpp für schnelle lokale Inferenz verwenden. GGUF: Inkling-GGUF
Unsloth herunterladen
Unsloth-Leitfaden
https://unsloth.ai/download
Den spezifischen llama.cpp Pull Request auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Jetzt kannst du llama.cpp direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie ollama run. Wähle zuerst den gewünschten Quantisierungstyp wie Q2_K_XL. Verwende außerdem export LLAMA_CACHE="folder" um zu erzwingen, llama.cpp zum Speichern an einem bestimmten Ort. Beachte, dass dieser Downloadprozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, im nächsten Abschnitt den manuellen Downloadprozess zu verwenden.
Inkling-Small 276B:
Inkling 975B:
Wenn du das Modell manuell herunterladen möchtest, können wir das Modell über den folgenden Code herunterladen (nach der Installation von pip install huggingface_hub). Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Inkling-Small 276B:
Inkling 975B:
Sie können --threads 32 für die Anzahl der CPU-Threads, --ctx-size 32768 für die Kontextlänge, --n-gpu-layers 2 für GPU-Offloading, je nachdem wie viele Layer. Versuchen Sie, ihn anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie ihn auch, wenn Sie nur CPU-Inferenz haben. Wir haben in llama.cpp ebenfalls einen Fusion-Kernel für Flash-Attention-Bias implementiert, um den VRAM-Verbrauch zu senken – aber am besten beibehalten --ctx-size weiterhin moderat!
Inkling-Small 276B:
Inkling 975B:
📐Quantisierungsanalyse
Wir führten auch KLD-Benchmarks (KL-Divergenz) durch, um die Genauigkeit unserer Quantisierungen von Inkling-GGUF zu bewerten. Zuerst erstellten wir eine Mischung aus 8-Bit- und 6-Bit-Quantisierung für das Modell, mit 6 Bit für die ffn_up- und ffn_gate-Exps, und stellten fest, dass der RMSE bei der Dequantisierung 1e-4 oder weniger betrug – die Quantisierung von ffn_down erhöhte den Fehler um das Zehnfache, daher wird das für die 8/6-Bit-Quantisierung in Q8_0 belassen
Bei reiner Top-1-%-Genauigkeit, dynamische 1-Bit erreicht etwa 74,2 % Genauigkeit und ist dabei 86 % kleiner! Dynamische 2-Bit erreicht etwa 81 % Genauigkeit und ist dabei 82 % kleiner. Dies zeigt, dass das dynamische Quantisieren einiger Layer auf höhere Präzision das Modell nicht unbrauchbar und völlig nutzlos macht – wir zeigen, dass selektives Quantisieren von Layern viel Genauigkeit zurückgewinnen kann!
Aber was bedeutet „74 % Genauigkeit“ eigentlich?
Das bedeutet NICHT, dass das Modell in 26 % der Fälle Kauderwelsch oder falsche Ergebnisse ausgibt – vielmehr heißt es, dass es bei 26 % der Top-Fälle eher die zweithäufigst wahrscheinliche Antwort wählen könnte.
Zum Beispiel führt die Aufforderung „Erstelle ein Gedicht“ zu sehr unterschiedlichen Ergebnissen – in 74 % der Fälle sind es dem BF16-Baseline-Modell ähnliche Gedichte, in 26 % jedoch ein anderes Gedicht, das aber immer noch korrekt ist. Bei faktischen Antworten, bei denen Kreativität und Sampling keine Rolle spielen, wird das Modell immer dieselbe Antwort abrufen (zum Beispiel bei „Was ist 2+2“ wird es immer 4 sagen, niemals 5)

📊 Benchmarks
Weiter unten können Sie Inkling-Benchmarks in Tabellenform ansehen:
Die Inkling-Ergebnisse werden bei effort=0.99 angegeben. Vergleichswerte wurden am 14. Jul. 2026 generiert. Nemotron 3 Ultra, Kimi K2.5, Kimi K2.6, GLM 5.2 und DeepSeek V4 Pro sind Open-Weights-Modelle; Gemini 3.1 Pro, Claude Fable 5 und GPT 5.6 Sol sind Closed-Weights-Modelle.
Schlussfolgern
HLE (nur Text)
29.7%
26.6%
29.4%
35.9%
40.1%
35.9%
44.7%
53.3%
47.2%
HLE (mit Tools)
46.0%
37.4%
50.2%
54.0%
54.7%
48.2%
51.4%
64.5%
55.0%
AIME 2026
97.1%
94.2%
95.8%
96.4%
99.2%
96.7%
98.3%
–
99.9%
GPQA Diamond
87.2%
86.7%
87.9%
91.1%
89.5%
88.8%
94.1%
92.6%
94.1%
Agentisch (Coding)
SWEBench Verified
77.6%
70.7%
76.8%
80.2%
–
80.6%
80.6%
95.0%
–
SWEBench Pro (öffentlich)
54.3%
46.4%
50.7%
58.6%
62.1%
55.4%
54.2%
80.0%
64.6%
Terminal Bench 2.1 (bestes Harness)
63.8
56.4
51.3
71.3
82.7
64
73.8
84.6
89.5
GDPVal-AA v2
1233
1164
1009
1190
1514
1307
962
1760
1748
Agentisch (allgemein)
MCP Atlas
74.1%
44.7%
64.0%
68.1%
77.8%
73.2%
78.2%
83.3%
81.8%
Tau 3 Banking
23.7%
13.8%
13.2%
20.6%
26.8%
25.8%
16.5%
26.8%
33.0%
Faktizität
BrowseComp (mit Kontext)
77.1%
–
74.9%
83.2%
–
83.4%
85.9%
88.0%
89.4%
SimpleQA verifiziert
43.9%
32.4%
36.9%
38.7%
38.1%
57.0%
77.3%
68.3%
71.6%
AA Omniscience
1.0%
-1.0%
-8.0%
6.0%
4.0%
-10.0%
33.0%
40.0%
22.0%
Chat
IFBench
79.8%
81.4%
70.2%
76.0%
73.3%
76.5%
77.1%
63.5%
72.7%
Global-MMLU-Lite
88.7%
85.6%
84.0%
88.4%
89.2%
89.3%
92.7%
93.3%
91.8%
Vision
MMMU Pro (Standard 10)
73.3%
–
75.0%
79.0%
–
–
82.0%
84.2%
83.0%
Charxiv RQ
78.1%
–
77.5%
80.4%
–
–
80.2%
86.5%
84.7%
Charxiv RQ (mit Python)
82.0%
–
78.7%
86.7%
–
–
89.9%
89.4%
87.8%
Audio
Audio MC
56.6%
–
–
–
–
–
66.8%
–
–
MMAU
77.2%
–
–
–
–
–
82.5%
–
–
VoiceBench
91.4%
–
–
–
–
–
94.3%
–
–
Sicherheit
FORTRESS (gegnerisch)
78.0%
77.6%
54.1%
65.6%
71.3%
36.0%
65.2%
96.0%
82.4%
FORTRESS (harmlos)
95.9%
90.5%
98.3%
97.2%
90.0%
98.5%
98.0%
55.1%
98.1%
StrongREJECT
98.6%
98.7%
99.5%
99.8%
98.5%
98.6%
98.0%
98.7%
98.5%
Zuletzt aktualisiert
War das hilfreich?

