> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/modelle/inkling.md).

# Inkling - So führst du es lokal aus

Inkling von Thinking Machines Labs sind multimodale Open-Weight-Modelle, bestehend aus: **Inkling-Small** das neue **276B** (12B aktiv) Modell und das frühere **975B** (41B) Parameter-Modell. Lizenziert unter Apache 2.0 unterstützen die Modelle ein Kontextfenster von 1 Mio. Tokens, nativen multimodalen Input für **Text**, **Bild** und **Audio**, und erzeugt **Text** als Ausgabe. Inkling glänzt bei Coding, agentischem Arbeiten und Tool-Aufrufen, RAG, Chat, mehrsprachigen und multimodalen Workloads.

Dynamische 2-Bit erreicht 81 % Top-1%-Genauigkeit und ist dabei 82 % kleiner. Dies zeigt: Wenn wir das Modell mit unserem um 82 % verkleinern [Unsloth Dynamic ](/docs/de/grundlagen/dynamic-3.0-ggufs.md)GGUF-Methode – das bedeutet NICHT, dass das Modell 82 % „dümmer“ wird – es ist nur eine Verschlechterung von etwa 18 % zu sehen. Danke an Thinking Machines Lab (TML) für den Tag-Null-Zugriff auf Unsloth. [**Inkling-Small-GGUF**](https://huggingface.co/unsloth/Inkling-Small-GGUF) und [**Inkling-GGUF**](https://huggingface.co/unsloth/inkling-GGUF)

<a href="/pages/cc36ad5cfcc5c68f83fe3c3689b837e20e43cd83#run-inkling-tutorials" class="button primary">Inkling-Tutorials ausführen</a><a href="/pages/cc36ad5cfcc5c68f83fe3c3689b837e20e43cd83#quantization-analysis" class="button secondary">Quantisierungsergebnisse</a>

#### &#x20;:gear: Nutzungsanleitung

{% columns %}
{% column width="50%" %}
Die dynamische 1-Bit-Quantisierung `UD-IQ1_S` verwendet **270GB** an Speicherplatz – dafür braucht man einen Mac Studio Ultra oder Maschinen mit mindestens so viel RAM+VRAM, dass es etwa 290 GB sind.

Die **1-Bit** Die Quantisierung passt auf 290 GB RAM, und 6/8-Bit erfordert 900 GB RAM. Rechts sieht man das 1-Bit-GGUF in Aktion, wo wir Inkling gebeten haben, ein Sudoku-HTML-Spiel zu erstellen.

Rechts ist das 1-Bit-Inkling-GGUF in Unsloth zu sehen:
{% endcolumn %}

{% column width="50%" %}

<figure><img src="/files/c2b2b4e67af87df67aa2d0b2a27b6e9238b5e8a9" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

**Tabelle: Hardwareanforderungen für Inferenz** (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory):

| Modell        | 2-Bit  | 3-Bit  | 4-Bit        | 6/8-Bit | BF16    |
| ------------- | ------ | ------ | ------------ | ------- | ------- |
| Inkling-Small | 89 GB  | 128 GB | 132 - 170 GB | 256 GB  | 543 GB  |
| Inkling       | 325 GB | 450 GB | 600 GB       | 870 GB  | 1900 GB |

**Tabelle: Beibehaltener Top-1%-Wert (Genauigkeitswiederherstellung) für 975B Inkling:**

| 1-Bit       | 2-Bit | 3-Bit | 4-Bit | 6/8-Bit | BF16   |
| ----------- | ----- | ----- | ----- | ------- | ------ |
| 74.2%-77.4% | 81.0% | 88.7% | 94.4% | 99.8%   | 100.0% |

{% hint style="success" %}
Für beste Leistung stellen Sie sicher, dass Ihr gesamter verfügbarer Speicher, einschließlich VRAM und Systemspeicher, die Dateigröße des quantisierten Modells mit ausreichend Puffer übersteigt.
{% endhint %}

<div align="left"><figure><img src="/files/0e499b27affa2f4c96ab73145f079c2dd3a92723" alt=""><figcaption><p>Sudoku mit Inkling 1-Bit</p></figcaption></figure> <figure><img src="/files/73b810f2527d7bdcf64f484b58078e4bc25f5372" alt=""><figcaption><p>Audio-Parsing mit 1-Bit-Inkling</p></figcaption></figure></div>

### Empfohlene Einstellungen

Inkling hat Nicht-Denken- und Denkmodi. In [Unsloth Studio](#run-glm-5.2-in-unsloth-studio) kann man Denken und Nicht-Denken ganz einfach per UI umschalten.

Verwenden Sie diese Einstellungen für die meisten Anwendungsfälle:

| Standardeinstellungen (die meisten Aufgaben) |
| -------------------------------------------- |
| `Temperatur` = 1.0                           |
| `top_p` = 1.0 (Aus)                          |

* **Maximales Kontextfenster:** `1,048,576`.

#### Chat-Template & Denkaufwand

Inkling verwendet eine interessante Komponente im System-Prompt namens „Thinking effort level:“, bei der es sich um eine Zahl von 0.00 bis 0.99 handelt! Das Folgende wird tokenisiert:

{% code overflow="wrap" expandable="true" %}

```python
from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("unsloth/inkling")
tokenizer.apply_chat_template([
    {"role" : "user", "content" : "Was ist 1+1?"},
    {"role" : "assistant", "content" : "2!"},
    {"role" : "user", "content" : "Was ist 2+2?"},
] , tokenize = False, reasoning_effort = "xhigh")
```

{% endcode %}

erhält man Folgendes:

{% code overflow="wrap" expandable="true" %}

```
<|message_system|><|content_text|>Denkaufwand-Stufe: 0.99<|end_message|><|message_user|><|content_text|>Was ist 1+1?<|end_message|><|message_model|><|content_text|>2!<|end_message|><|content_model_end_sampling|><|message_user|><|content_text|>Was ist 2+2?<|end_message|>
```

{% endcode %}

#### Denken deaktivieren, den Reasoning-Aufwand ändern

Inkling verwendet standardmäßig Reasoning. Es unterstützt auch Reasoning-Aufwände, bei `reasoning_effort` denen none = 0, low = 0.2, medium = 0.7, high = 0.9, xhigh = 0.99 und max = 0.99 sein kann.

Um das Denken zu deaktivieren, verwenden Sie `--chat-template-kwargs '{"reasoning_effort":'none'}'`. Wenn Sie auf **Windows** PowerShell sind, verwenden Sie: `--chat-template-kwargs "{\"reasoning_effort\":'none'}"`

Für die Anpassung des Reasoning-Aufwands oder um Reasoning zu deaktivieren, verwenden Sie die folgenden Beispiele:

{% code overflow="wrap" expandable="true" %}

```bash
--chat-template-kwargs '{"reasoning_effort":"none"}'
--chat-template-kwargs '{"reasoning_effort":"low"}'
--chat-template-kwargs '{"reasoning_effort":"medium"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"reasoning_effort":"xhigh"}'
--chat-template-kwargs '{"reasoning_effort":"max"}'
```

{% endcode %}

{% columns %}
{% column %}
Inkling kann auch abwechselnd denken und Tools aufrufen – sogar mit der dynamischen 1-Bit-Quantisierung!
{% endcolumn %}

{% column %}

<figure><img src="/files/643b57f4033d09b8d24e5722a62932100d8eefef" alt=""><figcaption></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

## Inkling-Tutorials ausführen:

Inkling läuft in Unsloth unter MacOS, Windows und Linux. Sie können:

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilende** Tool-Aufrufe](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Code-Ausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](https://unsloth.ai/docs/desktop#feature-deep-dive) Parametertuning (Temp, Top-P usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM
  {% endcolumn %}

{% column %}

<figure><img src="/files/cac11c8e4cda4f2e25ea49d06bb6e8f6fbde33fb" alt=""><figcaption><p>multimodales 1-Bit-Inkling-GGUF-Beispiel</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% stepper %}
{% step %}
**Unsloth installieren und starten**

Um es zu installieren, führe in deinem Terminal aus:

macOS, Linux, WSL:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Windows PowerShell:

```bash
irm https://unsloth.ai/install.ps1 | iex
```

**Unsloth starten**

MacOS, Linux, WSL und Windows:
{% endstep %}

{% step %}
**Suchen und herunterladen** Inkling

Gehen Sie dann zur [Unsloth Chat](/docs/de/neu/studio/chat.md) Registerkarte und suche nach **Inkling** in der Suchleiste und lade dein gewünschtes Modell und deine gewünschte Quantisierung herunter. Stelle sicher, dass du genügend Rechenleistung hast, um das Modell auszuführen.

<div data-with-frame="true"><figure><img src="/files/35bec2d4aee804e52790a7e42332729ba144826c" alt="" width="563"><figcaption></figcaption></figure></div>
{% endstep %}

{% step %}
**Inkling ausführen**

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer [Unsloth-Studio-Inferenzanleitung](/docs/de/neu/studio/chat.md).

<div data-with-frame="true"><figure><img src="/files/92db3d9e52912efa1454a7e0697a06f7c10dadb6" alt=""><figcaption><p>1-Bit-Inkling läuft in Unsloth Studio</p></figcaption></figure></div>
{% endstep %}
{% endstepper %}

### 🦙 Inkling in llama.cpp ausführen

Für diese Anleitung werden wir die `UD-IQ1_S` Quantisierung, die mindestens 290 GB RAM erfordert. Sie können den Quantisierungstyp gerne ändern. Für diese Tutorials werden wir verwenden [llama.cpp](llama.cpphttps://github.com/ggml-org/llama.cpp) für schnelle lokale Inferenz verwenden. GGUF: [**Inkling-GGUF**](https://huggingface.co/unsloth/Inkling-GGUF)&#x20;

#### Unsloth herunterladen

### Unsloth-Leitfaden

<https://unsloth.ai/download>

{% stepper %}
{% step %}
Den spezifischen `llama.cpp` Pull Request auf [GitHub hier](https://github.com/ggml-org/llama.cpp/pull/25731). Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
gh pr checkout 25731
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

{% endstep %}

{% step %}
Jetzt kannst du `llama.cpp` direkt verwenden, um Modelle zu laden und herunterzuladen, genau wie `ollama run`. Wähle zuerst den gewünschten Quantisierungstyp wie `Q2_K_XL`. Verwende außerdem `export LLAMA_CACHE="folder"` um zu erzwingen, `llama.cpp` zum Speichern an einem bestimmten Ort. Beachte, dass dieser Downloadprozess sehr langsam sein kann, daher ist es wahrscheinlich am besten, im nächsten Abschnitt den manuellen Downloadprozess zu verwenden.

**Inkling-Small 276B:**

```bash
export LLAMA_CACHE="unsloth/Inkling-Small-GGUF"
./build/bin/llama-cli \",
    -hf unsloth/Inkling-Small-GGUF:UD-Q3_K_XL \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

**Inkling 975B:**

{% code overflow="wrap" %}

```bash
export LLAMA_CACHE="unsloth/Inkling-GGUF"
./build/bin/llama-cli \",
    -hf unsloth/Inkling-GGUF:UD-IQ1_S \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}

{% step %}
Wenn du das Modell manuell herunterladen möchtest, können wir das Modell über den folgenden Code herunterladen (nach der Installation von `pip install huggingface_hub`). Wenn Downloads hängen bleiben, siehe: [Debugging für Hugging Face Hub, XET](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

**Inkling-Small 276B:**

```bash
hf download unsloth/Inkling-Small-GGUF \\
    --local-dir unsloth/Inkling-Small-GGUF \\
    --include "*UD-Q3_K_XL*" # Verwenden Sie "*UD-Q4_K_XL*" für 4-Bit
```

**Inkling 975B:**

{% code overflow="wrap" %}

```bash
hf download unsloth/Inkling-GGUF \\
    --local-dir unsloth/Inkling-GGUF \\
    --include "*UD-IQ1_S*" # Verwenden Sie "*UD-Q2_K_XL*" für 2-Bit
```

{% endcode %}
{% endstep %}

{% step %}
Sie können `--threads 32` für die Anzahl der CPU-Threads, `--ctx-size 32768` für die Kontextlänge, `--n-gpu-layers 2` für GPU-Offloading, je nachdem wie viele Layer. Versuchen Sie, ihn anzupassen, wenn Ihrem GPU der Speicher ausgeht. Entfernen Sie ihn auch, wenn Sie nur CPU-Inferenz haben. Wir haben in llama.cpp ebenfalls einen Fusion-Kernel für Flash-Attention-Bias implementiert, um den VRAM-Verbrauch zu senken – aber am besten beibehalten `--ctx-size` weiterhin moderat!

**Inkling-Small 276B:**

{% code overflow="wrap" %}

```bash
./build/bin/llama-cli \",
    --model unsloth/Inkling-Small-GGUF/UD-Q3_K_XL/Inkling-Small-UD-Q3_K_XL-00001-of-00004.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

{% endcode %}

**Inkling 975B:**

{% code overflow="wrap" %}

```bash
./build/bin/llama-cli \",
    --model unsloth/Inkling-GGUF/UD-IQ1_S/inkling-UD-IQ1_S-00001-of-00007.gguf \\
    --temp 1.0 \\
    --top-p 1.0 \\
    --min-p 0.0
```

{% endcode %}
{% endstep %}
{% endstepper %}

### :triangular\_ruler:Quantisierungsanalyse

Wir führten auch KLD-Benchmarks (KL-Divergenz) durch, um die Genauigkeit unserer Quantisierungen von Inkling-GGUF zu bewerten. Zuerst erstellten wir eine Mischung aus 8-Bit- und 6-Bit-Quantisierung für das Modell, mit 6 Bit für die ffn\_up- und ffn\_gate-Exps, und stellten fest, dass der RMSE bei der Dequantisierung 1e-4 oder weniger betrug – die Quantisierung von ffn\_down erhöhte den Fehler um das Zehnfache, daher wird das für die 8/6-Bit-Quantisierung in Q8\_0 belassen

Bei reiner Top-1-%-Genauigkeit, **dynamische 1-Bit erreicht etwa 74,2 % Genauigkeit und ist dabei 86 % kleiner**! Dynamische 2-Bit erreicht etwa 81 % Genauigkeit und ist dabei 82 % kleiner. Dies zeigt, dass das dynamische Quantisieren einiger Layer auf höhere Präzision das Modell nicht unbrauchbar und völlig nutzlos macht – wir zeigen, dass selektives Quantisieren von Layern viel Genauigkeit zurückgewinnen kann!

<figure><img src="/files/a5a3a5b655fc36a82d884d2af6a0113330d30855" alt="" width="563"><figcaption></figcaption></figure>

**Aber was bedeutet „74 % Genauigkeit“ eigentlich?**

Das bedeutet NICHT, dass das Modell in 26 % der Fälle Kauderwelsch oder falsche Ergebnisse ausgibt – vielmehr heißt es, dass es bei 26 % der Top-Fälle eher die zweithäufigst wahrscheinliche Antwort wählen könnte.

Zum Beispiel führt die Aufforderung „Erstelle ein Gedicht“ zu sehr unterschiedlichen Ergebnissen – in 74 % der Fälle sind es dem BF16-Baseline-Modell ähnliche Gedichte, in 26 % jedoch ein anderes Gedicht, das aber immer noch korrekt ist. Bei faktischen Antworten, bei denen Kreativität und Sampling keine Rolle spielen, wird das Modell immer dieselbe Antwort abrufen (zum Beispiel bei „Was ist 2+2“ wird es immer 4 sagen, niemals 5)

<figure><img src="/files/261af97b48c588c9a0f875e8dbc717adfc58d431" alt="" width="563"><figcaption></figcaption></figure>

## 📊 Benchmarks

Weiter unten können Sie Inkling-Benchmarks in Tabellenform ansehen:

Die Inkling-Ergebnisse werden bei effort=0.99 angegeben. Vergleichswerte wurden am 14. Jul. 2026 generiert. Nemotron 3 Ultra, Kimi K2.5, Kimi K2.6, GLM 5.2 und DeepSeek V4 Pro sind Open-Weights-Modelle; Gemini 3.1 Pro, Claude Fable 5 und GPT 5.6 Sol sind Closed-Weights-Modelle.

|                           |                                     | Inkling | Nemotron 3 Ultra | Kimi K2.5 | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro | Gemini 3.1 Pro (hoch) | Claude Fable 5 (max) | GPT 5.6 Sol (xhigh) |
| ------------------------- | ----------------------------------- | ------- | ---------------- | --------- | --------- | ------- | --------------- | --------------------- | -------------------- | ------------------- |
| **Schlussfolgern**        |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | HLE (nur Text)                      | 29.7%   | 26.6%            | 29.4%     | 35.9%     | 40.1%   | 35.9%           | 44.7%                 | 53.3%                | 47.2%               |
|                           | HLE (mit Tools)                     | 46.0%   | 37.4%            | 50.2%     | 54.0%     | 54.7%   | 48.2%           | 51.4%                 | 64.5%                | 55.0%               |
|                           | AIME 2026                           | 97.1%   | 94.2%            | 95.8%     | 96.4%     | 99.2%   | 96.7%           | 98.3%                 | –                    | 99.9%               |
|                           | GPQA Diamond                        | 87.2%   | 86.7%            | 87.9%     | 91.1%     | 89.5%   | 88.8%           | 94.1%                 | 92.6%                | 94.1%               |
| **Agentisch (Coding)**    |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | SWEBench Verified                   | 77.6%   | 70.7%            | 76.8%     | 80.2%     | –       | 80.6%           | 80.6%                 | 95.0%                | –                   |
|                           | SWEBench Pro (öffentlich)           | 54.3%   | 46.4%            | 50.7%     | 58.6%     | 62.1%   | 55.4%           | 54.2%                 | 80.0%                | 64.6%               |
|                           | Terminal Bench 2.1 (bestes Harness) | 63.8    | 56.4             | 51.3      | 71.3      | 82.7    | 64              | 73.8                  | 84.6                 | 89.5                |
|                           | GDPVal-AA v2                        | 1233    | 1164             | 1009      | 1190      | 1514    | 1307            | 962                   | 1760                 | 1748                |
| **Agentisch (allgemein)** |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | MCP Atlas                           | 74.1%   | 44.7%            | 64.0%     | 68.1%     | 77.8%   | 73.2%           | 78.2%                 | 83.3%                | 81.8%               |
|                           | Tau 3 Banking                       | 23.7%   | 13.8%            | 13.2%     | 20.6%     | 26.8%   | 25.8%           | 16.5%                 | 26.8%                | 33.0%               |
| **Faktizität**            |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | BrowseComp (mit Kontext)            | 77.1%   | –                | 74.9%     | 83.2%     | –       | 83.4%           | 85.9%                 | 88.0%                | 89.4%               |
|                           | SimpleQA verifiziert                | 43.9%   | 32.4%            | 36.9%     | 38.7%     | 38.1%   | 57.0%           | 77.3%                 | 68.3%                | 71.6%               |
|                           | AA Omniscience                      | 1.0%    | -1.0%            | -8.0%     | 6.0%      | 4.0%    | -10.0%          | 33.0%                 | 40.0%                | 22.0%               |
| **Chat**                  |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | IFBench                             | 79.8%   | 81.4%            | 70.2%     | 76.0%     | 73.3%   | 76.5%           | 77.1%                 | 63.5%                | 72.7%               |
|                           | Global-MMLU-Lite                    | 88.7%   | 85.6%            | 84.0%     | 88.4%     | 89.2%   | 89.3%           | 92.7%                 | 93.3%                | 91.8%               |
| **Vision**                |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | MMMU Pro (Standard 10)              | 73.3%   | –                | 75.0%     | 79.0%     | –       | –               | 82.0%                 | 84.2%                | 83.0%               |
|                           | Charxiv RQ                          | 78.1%   | –                | 77.5%     | 80.4%     | –       | –               | 80.2%                 | 86.5%                | 84.7%               |
|                           | Charxiv RQ (mit Python)             | 82.0%   | –                | 78.7%     | 86.7%     | –       | –               | 89.9%                 | 89.4%                | 87.8%               |
| **Audio**                 |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | Audio MC                            | 56.6%   | –                | –         | –         | –       | –               | 66.8%                 | –                    | –                   |
|                           | MMAU                                | 77.2%   | –                | –         | –         | –       | –               | 82.5%                 | –                    | –                   |
|                           | VoiceBench                          | 91.4%   | –                | –         | –         | –       | –               | 94.3%                 | –                    | –                   |
| **Sicherheit**            |                                     |         |                  |           |           |         |                 |                       |                      |                     |
|                           | FORTRESS (gegnerisch)               | 78.0%   | 77.6%            | 54.1%     | 65.6%     | 71.3%   | 36.0%           | 65.2%                 | 96.0%                | 82.4%               |
|                           | FORTRESS (harmlos)                  | 95.9%   | 90.5%            | 98.3%     | 97.2%     | 90.0%   | 98.5%           | 98.0%                 | 55.1%                | 98.1%               |
|                           | StrongREJECT                        | 98.6%   | 98.7%            | 99.5%     | 99.8%     | 98.5%   | 98.6%           | 98.0%                 | 98.7%                | 98.5%               |


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/modelle/inkling.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
