Inkling - comment l’exécuter localement
Découvrez comment exécuter localement les modèles multimodaux Inkling de Thinking Machine Labs.
Les modèles Inkling de Thinking Machines Labs sont des modèles multimodaux à poids ouverts comprenant : Inkling-Small le nouveau 276B (12B actifs) et le modèle antérieur 975B (41B) paramètres. Sous licence Apache 2.0, les modèles prennent en charge une fenêtre de contexte d’1 million de jetons, une entrée multimodale native pour texte, image, et de l’audio, et génère texte en sortie. Inkling excelle en codage, en tâches agentiques et d’appel d’outils, en RAG, en chat, en multilingue et en charges de travail multimodales.
La quantification dynamique 2 bits atteint 81 % de précision top 1 % tout en étant 82 % plus petite. Cela montre que si nous réduisons le modèle de 82 % avec notre Unsloth Dyanmic méthode GGUF - cela ne signifie PAS que le modèle devient 82 % « plus bête » - on observe seulement une dégradation d’environ 18 %. Merci à Thinking Machines Lab (TML) d’avoir donné à Unsloth un accès dès le premier jour. Inkling-Small-GGUF et Inkling-GGUF
Exécuter les tutoriels InklingRésultats de quantification
⚙️ Guide d'utilisation
La quantification dynamique 1 bit UD-IQ1_S utilise 270GB d’espace disque - cela nécessitera un Mac Studio Ultra ou des machines disposant d’au moins 290 Go de RAM+VRAM, environ.
La 1 bit La quantification tiendra dans 290 Go de RAM et le 6/8 bits nécessite 900 Go de RAM. Voyez le GGUF 1 bit en action à droite, où nous avons demandé à Inkling de créer un jeu Sudoku en HTML.
Voir à droite le GGUF Inkling 1 bit dans Unsloth :

Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée) :
Inkling-Small
89 Go
128 Go
132 - 170 Go
256 Go
543 Go
Inkling
325 Go
450 Go
600 Go
870 Go
1900 Go
Tableau : Top-1 % conservé (récupération de la précision) pour Inkling 975B :
74.2%-77.4%
81.0%
88.7%
94.4%
99.8%
100.0%
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible, y compris la VRAM et la RAM système, dépasse largement la taille du fichier du modèle quantifié.


Paramètres recommandés
Inkling dispose de modes sans raisonnement et avec raisonnement. Dans Unsloth Studio vous pouvez facilement basculer entre le mode avec raisonnement et le mode sans raisonnement grâce à une interface utilisateur.
Utilisez ces paramètres pour la plupart des cas d'utilisation :
température = 1.0
top_p = 1,0 (désactivé)
Fenêtre de contexte maximale :
1,048,576.
Modèle de chat et niveaux d’effort de raisonnement
Inkling utilise un composant de prompt système intéressant « Thinking effort level: » où la valeur est un nombre de 0,00 à 0,99 ! En tokenisant ce qui suit :
obtiendra ce qui suit :
Désactiver la pensée, modifier l'effort de raisonnement
Inkling utilise le raisonnement par défaut. Il prend également en charge des niveaux d’effort de raisonnement où reasoning_effort peuvent être none = 0, low = 0.2, medium = 0.7, high = 0.9, xhigh = 0.99 et max = 0.99.
Pour désactiver la pensée, utilisez --chat-template-kwargs '{"reasoning_effort":'none'}'. Si vous êtes sur Windows PowerShell, utilisez : --chat-template-kwargs "{\"reasoning_effort\":'none'}"
Pour personnaliser l'effort de raisonnement ou désactiver le raisonnement, utilisez les exemples ci-dessous :
Inkling gère aussi un raisonnement entremêlé et l’appel d’outils - même avec la quantification dynamique 1 bit !

Exécuter les tutoriels Inkling :
Inkling fonctionne dans Unsloth sur MacOS, Windows et Linux. Vous pouvez :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer et lancer Unsloth
Pour l'installer, exécutez dans votre terminal :
macOS, Linux, WSL :
Windows PowerShell :
Lancer Unsloth
MacOS, Linux, WSL et Windows :
Rechercher et télécharger Inkling
Puis allez dans l’onglet Unsloth Chat onglet et recherchez Inkling dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous d'avoir suffisamment de calcul pour exécuter le modèle.

Exécuter Inkling
Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

🦙 Exécuter Inkling dans llama.cpp
Dans ce guide, nous utiliserons la UD-IQ1_S quantification qui nécessitera au moins 290 Go de RAM. N’hésitez pas à changer le type de quantification. Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide. GGUF : Inkling-GGUF
Télécharger Unsloth
Guide Unsloth
https://unsloth.ai/download
Obtenez le PR SPÉCIFIQUE llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Vous pouvez désormais utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, comme Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.
Inkling-Small 276B :
Inkling 975B :
Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET
Inkling-Small 276B :
Inkling 975B :
Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --ctx-size 32768 pour la longueur du contexte, --n-gpu-layers 2 pour le déchargement sur GPU, selon le nombre de couches. Essayez de l’ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous faites de l’inférence uniquement sur CPU. Nous avons également implémenté dans llama.cpp un noyau fusionné Flash Attention avec biais pour réduire l’utilisation de la VRAM - mais il vaut mieux le garder --ctx-size modéré malgré tout !
Inkling-Small 276B :
Inkling 975B :
📐Analyse de la quantification
Nous avons également exécuté des benchmarks KLD (divergence KL) pour évaluer la précision de nos quantifications d’Inkling-GGUF. Nous avons d’abord créé un mélange de quantification 8 bits + 6 bits pour le modèle, avec du 6 bits pour les exps ffn_up et ffn_gate, et nous avons constaté que le RMSE était de 1e-4 ou moins en termes de déquantification - quantifier ffn_down augmentait l’erreur de 10x, donc cela reste en Q8_0 pour la quantification 8/6 bits
Sur la précision top-1 % pure, la quantification dynamique 1 bit atteint environ 74,2 % de précision tout en étant 86 % plus petite! La quantification dynamique 2 bits atteint environ 81 % de précision tout en étant 82 % plus petite. Cela montre que quantifier dynamiquement certaines couches avec une précision plus élevée ne rend pas le modèle inutilisable et totalement inutile - nous montrons qu’une quantification sélective des couches peut récupérer beaucoup de précision !
Mais qu’implique réellement une « précision de 74 % » ?
Cela ne signifie PAS que 26 % du temps le modèle produit du charabia ou de mauvaises réponses - cela signifie plutôt que dans 26 % des cas, parmi les meilleurs choix, il peut davantage sélectionner la deuxième réponse la plus probable.
Par exemple, demander « Crée un poème » produira des résultats très différents - 74 % du temps, ce seront des poèmes similaires à la référence BF16, mais 26 % du temps ce sera un autre poème, tout en restant correct. Pour les réponses factuelles où la créativité et l’échantillonnage n’interviennent pas, le modèle restituera toujours la même réponse (par exemple « Combien font 2+2 », il dira toujours 4, jamais 5)

📊 Benchmarks
Vous pouvez consulter plus bas les benchmarks d’Inkling sous forme de tableau :
Les résultats d’Inkling sont rapportés avec effort=0.99. Les scores de comparaison sont générés le 14 juil. 2026. Nemotron 3 Ultra, Kimi K2.5, Kimi K2.6, GLM 5.2 et DeepSeek V4 Pro sont des modèles à poids ouverts ; Gemini 3.1 Pro, Claude Fable 5 et GPT 5.6 Sol sont des modèles à poids fermés.
Raisonnement
HLE (texte uniquement)
29.7%
26.6%
29.4%
35.9%
40.1%
35.9%
44.7%
53.3%
47.2%
HLE (avec outils)
46.0%
37.4%
50.2%
54.0%
54.7%
48.2%
51.4%
64.5%
55.0%
AIME 2026
97.1%
94.2%
95.8%
96.4%
99.2%
96.7%
98.3%
–
99.9%
GPQA Diamond
87.2%
86.7%
87.9%
91.1%
89.5%
88.8%
94.1%
92.6%
94.1%
Agentique (codage)
SWEBench vérifié
77.6%
70.7%
76.8%
80.2%
–
80.6%
80.6%
95.0%
–
SWEBench Pro (Public)
54.3%
46.4%
50.7%
58.6%
62.1%
55.4%
54.2%
80.0%
64.6%
Terminal Bench 2.1 (meilleur banc d’essai)
63.8
56.4
51.3
71.3
82.7
64
73.8
84.6
89.5
GDPVal-AA v2
1233
1164
1009
1190
1514
1307
962
1760
1748
Agentique (général)
MCP Atlas
74.1%
44.7%
64.0%
68.1%
77.8%
73.2%
78.2%
83.3%
81.8%
Tau 3 Banking
23.7%
13.8%
13.2%
20.6%
26.8%
25.8%
16.5%
26.8%
33.0%
Factualité
BrowseComp (avec contexte)
77.1%
–
74.9%
83.2%
–
83.4%
85.9%
88.0%
89.4%
SimpleQA vérifié
43.9%
32.4%
36.9%
38.7%
38.1%
57.0%
77.3%
68.3%
71.6%
AA Omniscience
1.0%
-1.0%
-8.0%
6.0%
4.0%
-10.0%
33.0%
40.0%
22.0%
Chat
IFBench
79.8%
81.4%
70.2%
76.0%
73.3%
76.5%
77.1%
63.5%
72.7%
Global-MMLU-Lite
88.7%
85.6%
84.0%
88.4%
89.2%
89.3%
92.7%
93.3%
91.8%
Vision
MMMU Pro (Standard 10)
73.3%
–
75.0%
79.0%
–
–
82.0%
84.2%
83.0%
Charxiv RQ
78.1%
–
77.5%
80.4%
–
–
80.2%
86.5%
84.7%
Charxiv RQ (avec Python)
82.0%
–
78.7%
86.7%
–
–
89.9%
89.4%
87.8%
Audio
Audio MC
56.6%
–
–
–
–
–
66.8%
–
–
MMAU
77.2%
–
–
–
–
–
82.5%
–
–
VoiceBench
91.4%
–
–
–
–
–
94.3%
–
–
Sécurité
FORTRESS (adversarial)
78.0%
77.6%
54.1%
65.6%
71.3%
36.0%
65.2%
96.0%
82.4%
FORTRESS (bénin)
95.9%
90.5%
98.3%
97.2%
90.0%
98.5%
98.0%
55.1%
98.1%
StrongREJECT
98.6%
98.7%
99.5%
99.8%
98.5%
98.6%
98.0%
98.7%
98.5%
Mis à jour
Ce contenu vous a-t-il été utile ?

