For the complete documentation index, see llms.txt. This page is also available as Markdown.

Inkling - comment l’exécuter localement

Découvrez comment exécuter localement les modèles multimodaux Inkling de Thinking Machine Labs.

Les modèles Inkling de Thinking Machines Labs sont des modèles multimodaux à poids ouverts comprenant : Inkling-Small le nouveau 276B (12B actifs) et le modèle antérieur 975B (41B) paramètres. Sous licence Apache 2.0, les modèles prennent en charge une fenêtre de contexte d’1 million de jetons, une entrée multimodale native pour texte, image, et de l’audio, et génère texte en sortie. Inkling excelle en codage, en tâches agentiques et d’appel d’outils, en RAG, en chat, en multilingue et en charges de travail multimodales.

La quantification dynamique 2 bits atteint 81 % de précision top 1 % tout en étant 82 % plus petite. Cela montre que si nous réduisons le modèle de 82 % avec notre Unsloth Dyanmic méthode GGUF - cela ne signifie PAS que le modèle devient 82 % « plus bête » - on observe seulement une dégradation d’environ 18 %. Merci à Thinking Machines Lab (TML) d’avoir donné à Unsloth un accès dès le premier jour. Inkling-Small-GGUF et Inkling-GGUF

Exécuter les tutoriels InklingRésultats de quantification

⚙️ Guide d'utilisation

La quantification dynamique 1 bit UD-IQ1_S utilise 270GB d’espace disque - cela nécessitera un Mac Studio Ultra ou des machines disposant d’au moins 290 Go de RAM+VRAM, environ.

La 1 bit La quantification tiendra dans 290 Go de RAM et le 6/8 bits nécessite 900 Go de RAM. Voyez le GGUF 1 bit en action à droite, où nous avons demandé à Inkling de créer un jeu Sudoku en HTML.

Voir à droite le GGUF Inkling 1 bit dans Unsloth :

Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée) :

Modèle
2 bits
3 bits
4 bits
6/8 bits
BF16

Inkling-Small

89 Go

128 Go

132 - 170 Go

256 Go

543 Go

Inkling

325 Go

450 Go

600 Go

870 Go

1900 Go

Tableau : Top-1 % conservé (récupération de la précision) pour Inkling 975B :

1 bit
2 bits
3 bits
4 bits
6/8 bits
BF16

74.2%-77.4%

81.0%

88.7%

94.4%

99.8%

100.0%

Sudoku avec Inkling 1 bit
Analyse audio avec Inkling 1 bit

Paramètres recommandés

Inkling dispose de modes sans raisonnement et avec raisonnement. Dans Unsloth Studio vous pouvez facilement basculer entre le mode avec raisonnement et le mode sans raisonnement grâce à une interface utilisateur.

Utilisez ces paramètres pour la plupart des cas d'utilisation :

Paramètres par défaut (la plupart des tâches)

température = 1.0

top_p = 1,0 (désactivé)

  • Fenêtre de contexte maximale : 1,048,576.

Modèle de chat et niveaux d’effort de raisonnement

Inkling utilise un composant de prompt système intéressant « Thinking effort level: » où la valeur est un nombre de 0,00 à 0,99 ! En tokenisant ce qui suit :

obtiendra ce qui suit :

Désactiver la pensée, modifier l'effort de raisonnement

Inkling utilise le raisonnement par défaut. Il prend également en charge des niveaux d’effort de raisonnement où reasoning_effort peuvent être none = 0, low = 0.2, medium = 0.7, high = 0.9, xhigh = 0.99 et max = 0.99.

Pour désactiver la pensée, utilisez --chat-template-kwargs '{"reasoning_effort":'none'}'. Si vous êtes sur Windows PowerShell, utilisez : --chat-template-kwargs "{\"reasoning_effort\":'none'}"

Pour personnaliser l'effort de raisonnement ou désactiver le raisonnement, utilisez les exemples ci-dessous :

Inkling gère aussi un raisonnement entremêlé et l’appel d’outils - même avec la quantification dynamique 1 bit !

Exécuter les tutoriels Inkling :

Inkling fonctionne dans Unsloth sur MacOS, Windows et Linux. Vous pouvez :

Exemple multimodal de GGUF Inkling 1 bit
1

Installer et lancer Unsloth

Pour l'installer, exécutez dans votre terminal :

macOS, Linux, WSL :

Windows PowerShell :

Lancer Unsloth

MacOS, Linux, WSL et Windows :

2

Rechercher et télécharger Inkling

Puis allez dans l’onglet Unsloth Chat onglet et recherchez Inkling dans la barre de recherche et téléchargez le modèle et la quantification souhaités. Assurez-vous d'avoir suffisamment de calcul pour exécuter le modèle.

3

Exécuter Inkling

Les paramètres d'inférence doivent être définis automatiquement lors de l'utilisation d'Unsloth Studio ; toutefois, vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le gabarit de conversation et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre Guide d'inférence Unsloth Studio.

Inkling 1 bit exécuté dans Unsloth Studio

🦙 Exécuter Inkling dans llama.cpp

Dans ce guide, nous utiliserons la UD-IQ1_S quantification qui nécessitera au moins 290 Go de RAM. N’hésitez pas à changer le type de quantification. Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide. GGUF : Inkling-GGUF

Télécharger Unsloth

Guide Unsloth

https://unsloth.ai/download

1

Obtenez le PR SPÉCIFIQUE llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence sur CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Vous pouvez désormais utiliser llama.cpp directement pour charger et télécharger des modèles, tout comme ollama run. D'abord, sélectionnez le type de quantification souhaité, comme Q2_K_XL. Utilisez aussi export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer vers un emplacement spécifique. Notez que ce processus de téléchargement peut être très lent, il vaut donc probablement mieux utiliser le processus de téléchargement manuel dans la section suivante.

Inkling-Small 276B :

Inkling 975B :

3

Si vous souhaitez télécharger le modèle manuellement, nous pouvons le télécharger via le code ci-dessous (après avoir installé pip install huggingface_hub). Si les téléchargements se bloquent, voir : Dépannage de Hugging Face Hub et XET

Inkling-Small 276B :

Inkling 975B :

4

Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --ctx-size 32768 pour la longueur du contexte, --n-gpu-layers 2 pour le déchargement sur GPU, selon le nombre de couches. Essayez de l’ajuster si votre GPU manque de mémoire. Supprimez-le aussi si vous faites de l’inférence uniquement sur CPU. Nous avons également implémenté dans llama.cpp un noyau fusionné Flash Attention avec biais pour réduire l’utilisation de la VRAM - mais il vaut mieux le garder --ctx-size modéré malgré tout !

Inkling-Small 276B :

Inkling 975B :

📐Analyse de la quantification

Nous avons également exécuté des benchmarks KLD (divergence KL) pour évaluer la précision de nos quantifications d’Inkling-GGUF. Nous avons d’abord créé un mélange de quantification 8 bits + 6 bits pour le modèle, avec du 6 bits pour les exps ffn_up et ffn_gate, et nous avons constaté que le RMSE était de 1e-4 ou moins en termes de déquantification - quantifier ffn_down augmentait l’erreur de 10x, donc cela reste en Q8_0 pour la quantification 8/6 bits

Sur la précision top-1 % pure, la quantification dynamique 1 bit atteint environ 74,2 % de précision tout en étant 86 % plus petite! La quantification dynamique 2 bits atteint environ 81 % de précision tout en étant 82 % plus petite. Cela montre que quantifier dynamiquement certaines couches avec une précision plus élevée ne rend pas le modèle inutilisable et totalement inutile - nous montrons qu’une quantification sélective des couches peut récupérer beaucoup de précision !

Mais qu’implique réellement une « précision de 74 % » ?

Cela ne signifie PAS que 26 % du temps le modèle produit du charabia ou de mauvaises réponses - cela signifie plutôt que dans 26 % des cas, parmi les meilleurs choix, il peut davantage sélectionner la deuxième réponse la plus probable.

Par exemple, demander « Crée un poème » produira des résultats très différents - 74 % du temps, ce seront des poèmes similaires à la référence BF16, mais 26 % du temps ce sera un autre poème, tout en restant correct. Pour les réponses factuelles où la créativité et l’échantillonnage n’interviennent pas, le modèle restituera toujours la même réponse (par exemple « Combien font 2+2 », il dira toujours 4, jamais 5)

📊 Benchmarks

Vous pouvez consulter plus bas les benchmarks d’Inkling sous forme de tableau :

Les résultats d’Inkling sont rapportés avec effort=0.99. Les scores de comparaison sont générés le 14 juil. 2026. Nemotron 3 Ultra, Kimi K2.5, Kimi K2.6, GLM 5.2 et DeepSeek V4 Pro sont des modèles à poids ouverts ; Gemini 3.1 Pro, Claude Fable 5 et GPT 5.6 Sol sont des modèles à poids fermés.

Inkling
Nemotron 3 Ultra
Kimi K2.5
Kimi K2.6
GLM 5.2
DeepSeek V4 Pro
Gemini 3.1 Pro (high)
Claude Fable 5 (max)
GPT 5.6 Sol (xhigh)

Raisonnement

HLE (texte uniquement)

29.7%

26.6%

29.4%

35.9%

40.1%

35.9%

44.7%

53.3%

47.2%

HLE (avec outils)

46.0%

37.4%

50.2%

54.0%

54.7%

48.2%

51.4%

64.5%

55.0%

AIME 2026

97.1%

94.2%

95.8%

96.4%

99.2%

96.7%

98.3%

99.9%

GPQA Diamond

87.2%

86.7%

87.9%

91.1%

89.5%

88.8%

94.1%

92.6%

94.1%

Agentique (codage)

SWEBench vérifié

77.6%

70.7%

76.8%

80.2%

80.6%

80.6%

95.0%

SWEBench Pro (Public)

54.3%

46.4%

50.7%

58.6%

62.1%

55.4%

54.2%

80.0%

64.6%

Terminal Bench 2.1 (meilleur banc d’essai)

63.8

56.4

51.3

71.3

82.7

64

73.8

84.6

89.5

GDPVal-AA v2

1233

1164

1009

1190

1514

1307

962

1760

1748

Agentique (général)

MCP Atlas

74.1%

44.7%

64.0%

68.1%

77.8%

73.2%

78.2%

83.3%

81.8%

Tau 3 Banking

23.7%

13.8%

13.2%

20.6%

26.8%

25.8%

16.5%

26.8%

33.0%

Factualité

BrowseComp (avec contexte)

77.1%

74.9%

83.2%

83.4%

85.9%

88.0%

89.4%

SimpleQA vérifié

43.9%

32.4%

36.9%

38.7%

38.1%

57.0%

77.3%

68.3%

71.6%

AA Omniscience

1.0%

-1.0%

-8.0%

6.0%

4.0%

-10.0%

33.0%

40.0%

22.0%

Chat

IFBench

79.8%

81.4%

70.2%

76.0%

73.3%

76.5%

77.1%

63.5%

72.7%

Global-MMLU-Lite

88.7%

85.6%

84.0%

88.4%

89.2%

89.3%

92.7%

93.3%

91.8%

Vision

MMMU Pro (Standard 10)

73.3%

75.0%

79.0%

82.0%

84.2%

83.0%

Charxiv RQ

78.1%

77.5%

80.4%

80.2%

86.5%

84.7%

Charxiv RQ (avec Python)

82.0%

78.7%

86.7%

89.9%

89.4%

87.8%

Audio

Audio MC

56.6%

66.8%

MMAU

77.2%

82.5%

VoiceBench

91.4%

94.3%

Sécurité

FORTRESS (adversarial)

78.0%

77.6%

54.1%

65.6%

71.3%

36.0%

65.2%

96.0%

82.4%

FORTRESS (bénin)

95.9%

90.5%

98.3%

97.2%

90.0%

98.5%

98.0%

55.1%

98.1%

StrongREJECT

98.6%

98.7%

99.5%

99.8%

98.5%

98.6%

98.0%

98.7%

98.5%

Mis à jour

Ce contenu vous a-t-il été utile ?