> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/grundlagen/claude-code.md).

# Wie man lokale LLMs mit Claude Code ausführt

Diese Schritt-für-Schritt-Anleitung zeigt Ihnen, wie Sie offene LLMs und APIs vollständig lokal mit Claude Code verbinden – inklusive Screenshots. Verwenden Sie ein beliebiges offenes Modell wie Qwen3.6, DeepSeek und Gemma.

{% columns %}
{% column width="58.333333333333336%" %}
Für dieses Tutorial verwenden wir die offenen Modelle: [Gemma 4](/docs/de/modelle/gemma-4.md) und [Qwen3.5](/docs/de/modelle/qwen3.5.md) die leistungsstarke agentische und Coding-Modelle sind (funktioniert auf einem Gerät mit 24 GB RAM/Unified Memory).

Für die Inferenz verwenden wir [Unsloth Studio](https://github.com/unslothai/unsloth) und [`llama.cpp`](https://github.com/ggml-org/llama.cpp) womit Sie LLMs auf macOS, Linux und Windows ausführen/servieren können. Sie können jedes andere Modell verwenden. Für Modell-Quants verwenden wir Unsloth [Dynamische GGUFs](/docs/de/grundlagen/unsloth-dynamic-2.0-ggufs.md) um jedes quantisierte LLM auszuführen und dabei die Genauigkeit zu erhalten.
{% endcolumn %}

{% column width="41.666666666666664%" %}

<figure><img src="/files/71dc8d04c5322ed18a0af5f03d72f1ec3f286b24" alt=""><figcaption><p>Claude Code, lokal mit Qwen3.5 ausgeführt.</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

<a href="/pages/d12c953ceacbd6c3e44f3aa911056928e0488f5b#claude-code-setup" class="button primary" data-icon="claude">Claude Code-Einrichtung</a><a href="/pages/d12c953ceacbd6c3e44f3aa911056928e0488f5b#quickstart-tutorials" class="button primary">📖 Tutorial zum Einrichten eines lokalen Modells</a>

## <i class="fa-claude">:claude:</i> Claude Code-Einrichtung

Bevor wir unser lokales LLM einrichten, müssen wir Claude Code installieren. Claude Code ist ein terminalbasierter Coding-Agent, der Ihre Codebasis versteht und komplexe Git-Workflows mithilfe natürlicher Sprache handhabt.

{% tabs %}
{% tab title="macOS, Linux, WSL" %}

#### **Claude Code installieren:**

Fügen Sie dies in Ihr Terminal ein, um Claude Code zu installieren:

```bash
curl -fsSL https://claude.ai/install.sh | bash
```

Nach der Installation wechseln Sie in Ihren Projektordner. Dann geben Sie `claude` in die `Shell` ein, um zu beginnen.

```bash
cd ~/projects/my-project 
claude
```

{% endtab %}

{% tab title="Windows" %}

#### **Claude Code installieren:**

Wechseln Sie in `PowerShell` um Claude Code zu installieren:

```powershell
irm https://claude.ai/install.ps1 | iex
```

Nach der Installation wechseln Sie in Ihren Projektordner. Dann geben Sie `claude` in die `PowerShell` ein, um zu beginnen.

<pre class="language-powershell"><code class="lang-powershell"><strong>cd /path/to/your/project
</strong>claude
</code></pre>

<div data-with-frame="true"><figure><img src="/files/dc60e37e6bd78543c5dcf44efe33f0dedd4500e7" alt="" width="563"><figcaption></figcaption></figure></div>
{% endtab %}
{% endtabs %}

### :detective:Behebung einer 90 % langsameren Inferenz in Claude Code

{% hint style="warning" %}
Claude Code fügt kürzlich einen Claude Code Attribution-Header voran und hinzu, was **den KV-Cache ungültig macht und die Inferenz mit lokalen Modellen 90 % langsamer werden lässt**.
{% endhint %}

Die Attribution ist eine Zeile, die dem **Anfang des System-Prompts** (`x-anthropic-billing-header: cc_version=...; cch=...;` vorangestellt wird, deren Wert sich bei jeder Anfrage ändert, sodass das gesamte Prompt-Präfix bei jedem Durchlauf den KV-Cache verfehlt.

Die einfachste Lösung besteht darin, ihn beim Start von Claude Code inline zu deaktivieren, sodass keine Datei bearbeitet werden muss:

{% code overflow="wrap" %}

```bash
claude --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0","CLAUDE_CODE_ENABLE_TELEMETRY":"0"}}' --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% endcode %}

{% hint style="info" %}
Neuere Claude-Code-Versionen berücksichtigen auch `export CLAUDE_CODE_ATTRIBUTION_HEADER=0`; ältere Builds ignorierten die Shell-Variable, daher ist die `--settings` -Form oben (oder die unten stehende Einstellungsdatei) die zuverlässige Wahl.
{% endhint %}

Um es dauerhaft zu machen, fügen Sie `CLAUDE_CODE_ATTRIBUTION_HEADER` auf 0 gesetzt in `"env"` in `~/.claude/settings.json`. Zum Beispiel: `cat > ~/.claude/settings.json` dann fügen Sie den untenstehenden Inhalt hinzu (beim Einfügen ENTER drücken und dann STRG+D zum Speichern). Wenn Sie bereits eine `~/.claude/settings.json` Datei haben, fügen Sie einfach `"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"` zum Abschnitt "env" hinzu und lassen Sie den Rest der Einstellungsdatei unverändert.

<pre class="language-json"><code class="lang-json">{
  "promptSuggestionEnabled": false,
  "env": {
    "CLAUDE_CODE_ENABLE_TELEMETRY": "0",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1",
    <a data-footnote-ref href="#user-content-fn-1">"CLAUDE_CODE_ATTRIBUTION_HEADER" : "0"</a>
  },
  "attribution": {
    "commit": "",
    "pr": ""
  },
  "plansDirectory" : "./plans",
  "prefersReducedMotion" : true,
  "terminalProgressBarEnabled" : false,
  "effortLevel" : "high"
}
</code></pre>

## 📖 Schnellstart-Tutorials

{% columns %}
{% column %}
Bevor wir beginnen, müssen wir zuerst das Setup für das konkrete Modell abschließen, das du verwenden wirst. Wir nutzen [Unsloth](/docs/de/neu/studio.md) (eine Web-UI) und llama.cpp, die Open-Source-Frameworks sind, um LLMs auf deinen Mac-, Linux- und Windows-Geräten auszuführen und bereitzustellen.

Unsloth hat außerdem einzigartige selbstheilende [Tool-Calling](/docs/de/neu/studio/chat.md#auto-healing-tool-calling) und [Websuche](/docs/de/neu/studio/chat.md#code-execution) Fähigkeiten. Rechts siehst du Claude Code, verbunden mit Unsloth:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/4d7f67e24fb64209883a9782fb1c8e4d7782a66f" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

<a href="/pages/d12c953ceacbd6c3e44f3aa911056928e0488f5b#connect-claude-code" class="button primary" data-icon="claude">Claude Code verbinden</a><a href="/pages/d12c953ceacbd6c3e44f3aa911056928e0488f5b#unsloth-tutorial" class="button primary">🦥 Unsloth-Tutorial</a><a href="https://unsloth.ai/docs/basics/claude-code#llama.cpp-tutorial" class="button primary"> llama.cpp-Tutorial</a>

## 🦥 Unsloth-Tutorial

In diesem Tutorial werden wir lokale Modelle über eine UI mit Claude Code verbinden/bereitstellen, indem wir [Unsloth](https://github.com/unslothai/unsloth). Unsloth funktioniert unter Windows, WSL, Linux und macOS.

{% columns %}
{% column %}

* Suchen, herunterladen, [GGUFs ausführen](/docs/de/neu/studio.md#run-models-locally) und Safetensor-Modelle
* [**Selbstheilendes** Tool-Calling](/docs/de/neu/studio.md#execute-code--heal-tool-calling) + **Websuche**
* [**Codeausführung**](/docs/de/neu/studio.md#run-models-locally) (Python, Bash)
* [Automatische Inferenz](/docs/de/neu/studio.md#model-arena) Parameterauswahl (temp, top-p usw.)
* Schnelle CPU- + GPU-Inferenz über llama.cpp
* [LLMs trainieren](/docs/de/neu/studio.md#no-code-training) 2x schneller mit 70 % weniger VRAM

Siehe unten für Installationsanweisungen:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/16c0b18ba770d26abf1c3a92209b60c094a825a0" alt=""><figcaption><p>Beispiel für Qwen3.6 mit 2-Bit, ausgeführt in Unsloth.</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

{% tabs %}
{% tab title="macOS" %}

#### Schritt 1: Unsloth einrichten

Starten Sie das `Terminal` auf dem Mac und installieren Sie dann Unsloth, indem Sie den folgenden Befehl eingeben.

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Unsloth beginnt nun mit der Einrichtung der Umgebung und der Installation der erforderlichen Pakete, wie unten gezeigt. Geben Sie **Y** ein und drücken Sie `Enter` wenn Sie gefragt werden, ob Sie Unsloth jetzt starten möchten. Dadurch wird Unsloth auf Ihrem lokalen **8888** Port gestartet.

<figure><img src="/files/6337582368e5e994ddb66c8a622177d6c41fc7de" alt="" width="375"><figcaption></figcaption></figure>

{% hint style="info" %}
Wenn Sie sich dafür entschieden haben, Unsloth während der Installation nicht zu starten, können Sie die Unsloth-App jederzeit mit `unsloth studio -p 8888` starten. Wenn Sie möchten, dass Ihre Unsloth-Instanz für Clients außerhalb Ihres PCs/Computers erreichbar ist, fügen Sie `-H 0.0.0.0` zum `unsloth studio` Befehl hinzu.
{% endhint %}

#### Schritt 2: Unsloth starten

Öffnen Sie Ihren bevorzugten Browser und geben Sie `http://127.0.0.1:8888` in das URL-Feld ein. Wenn Sie Unsloth zum ersten Mal installieren, werden Sie zur Passwort-Seite weitergeleitet, wo Sie ein neues Passwort erstellen müssen. Danach sollte Unsloth nun auf der Chat-Seite geöffnet werden, wie unten gezeigt.

<figure><img src="/files/3c82d946a8c4f751f5b7fbd693e1efe2cf2a63af" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}

{% tab title="Windows" %}

#### Schritt 1: Unsloth einrichten

Öffnen Sie das Startmenü, suchen Sie nach `PowerShell`und starten Sie es. Kopieren Sie den Installationsbefehl und geben Sie ihn ein:

```powershell
irm https://unsloth.ai/install.ps1 | iex
```

die Installation wird automatisch beginnen. Nachdem die Installation abgeschlossen ist, fragt PowerShell, ob Sie Unsloth Studio starten möchte&#x6E;**.**

<figure><img src="/files/6337582368e5e994ddb66c8a622177d6c41fc7de" alt="" width="375"><figcaption></figcaption></figure>

Sie können es auch mit dem folgenden Befehl starten:

```bash
unsloth studio -H 0.0.0.0 -p 8888
```

{% hint style="info" %}
Wenn Sie möchten, dass Ihre Instanz für Clients außerhalb Ihres PCs/Computers erreichbar ist.\
Fügen Sie `-H 0.0.0.0` zum `unsloth studio` Befehl hinzu.
{% endhint %}

#### Schritt 2: Unsloth starten

Öffnen Sie `http://127.0.0.1:8888` in Ihrem Browser. Beim ersten Start erstellen Sie ein neues Passwort, um zur Chat-Seite fortzufahren. **Unsloth Studio** ist jetzt installiert und einsatzbereit.

<figure><img src="/files/3c82d946a8c4f751f5b7fbd693e1efe2cf2a63af" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}

{% tab title="Linux, WSL" %}

#### Schritt 1: Unsloth einrichten

{% tabs %}
{% tab title="Linux" %}
Öffnen Sie Ihre Terminal-Anwendung. Sie können sie starten, indem Sie `Strg + Alt + T`drücken oder nach `Terminal` im Anwendungsmenü Ihres Systems suchen.
{% endtab %}

{% tab title="WSL" %}
Klicken Sie im Windows-Startmenü und geben Sie den Namen Ihrer installierten Distribution ein (z. B. `Ubuntu`), und öffnen Sie sie dann.

{% hint style="warning" %}
Unter **WSL**, stellen Sie sicher, dass Ihre **NVIDIA-Treiber** sind installiert auf **Windows** (nicht innerhalb von WSL) und dass das **CUDA Toolkit** in Ihrer WSL-Distribution installiert ist. Weitere Details finden Sie unten unter Systemanforderungen.
{% endhint %}
{% endtab %}
{% endtabs %}

Um zu installieren, kopieren Sie den Installationsbefehl und führen Sie ihn aus:

```bash
curl -fsSL https://unsloth.ai/install.sh | sh
```

Dann:

1. Klicken Sie in das Terminalfenster
2. Fügen Sie den Befehl mit ein `Strg + Umschalt + V`
3. Drücken Sie `Enter`

Unsloth beginnt nun mit der Einrichtung der Umgebung und der Installation der erforderlichen Pakete, wie unten gezeigt. Geben Sie **Y** ein und drücken Sie `Enter` wenn Sie gefragt werden, ob Sie Unsloth jetzt starten möchten. Dadurch wird Unsloth auf Ihrem lokalen **8888** Port gestartet.

<figure><img src="/files/60186603d4e3143e8206b08cac871169665f0eb5" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
Wenn Sie sich dafür entschieden haben, Unsloth während der Installation nicht zu starten, können Sie die Unsloth-App jederzeit mit `unsloth studio -p 8888` starten. Wenn Sie möchten, dass Ihre Unsloth-Instanz für Clients außerhalb Ihres PCs/Computers erreichbar ist, fügen Sie `-H 0.0.0.0` zum `unsloth studio` Befehl hinzu.
{% endhint %}

#### Schritt 2: Unsloth starten

Öffnen Sie Ihren bevorzugten Browser und geben Sie `http://127.0.0.1:8888` in das URL-Feld ein. Wenn Sie Unsloth zum ersten Mal installieren, werden Sie zur Passwort-Seite weitergeleitet, wo Sie ein neues Passwort erstellen müssen. Danach sollte Unsloth nun auf der Chat-Seite geöffnet werden, wie unten gezeigt.

<figure><img src="/files/fab3a64e6e14bb8ee47919b963bf11d7da3202ee" alt="" width="375"><figcaption></figcaption></figure>
{% endtab %}
{% endtabs %}

### Anleitung zum Laden von Modellen + API

{% stepper %}
{% step %}

#### Modell auswählen

Bevor du die API verwendest, lade ein Modell aus dem **Modell auswählen** Dropdown oben links auf der Chat-Seite.

<figure><img src="/files/35a6966ece42497bdc299b98050269c7636c7c98" alt=""><figcaption></figcaption></figure>

In diesem Leitfaden verwenden wir: `unsloth/gemma-4-26B-A4B-it-GGUF` mit der empfohlenen `UD-Q4_K_XL` Quantisierung.
{% endstep %}

{% step %}

#### Das Modell testen

Bevor du den Client verwendest, sende eine kurze Nachricht:

<div data-with-frame="true"><figure><img src="/files/245fe14776c68639a801acfab0d58e75d6cf1ce4" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="info" %}
Das bestätigt, dass das Modell korrekt geladen wurde und bereit ist zu antworten.
{% endhint %}
{% endstep %}

{% step %}

#### **Unsloth-API-Schlüssel**

Öffne in Unsloth **Einstellungen → API** um deinen API-Schlüssel anzuzeigen oder zu erstellen.

<figure><img src="/files/96dbb4b6e52ce8bc33d050cacf1e90d03b66c1ae" alt=""><figcaption></figcaption></figure>

Behandle deinen API-Schlüssel wie ein Passwort und vermeide es, ihn in Screenshots oder Repositories offenzulegen.
{% endstep %}
{% endstepper %}

## ⚙️ Claude Code verbinden

Jetzt, da wir das lokale LLM für Claude Code eingerichtet haben, konfigurieren wir Claude Code so, dass es mit Ihrem Tool funktioniert. Sie können sich entweder einfach verbinden mit `unsloth start` unten oder es [manuell](#connect-manually).

### ⚡ Claude Code ausführen mit `unsloth start`

Um Claude direkt mit einem Modell zu starten, führen Sie aus:

```bash
unsloth start claude \\
  --model unsloth/gemma-4-E2B-it-GGUF:UD-Q4_K_XL \\
  --context-length 32768
```

Öffne bei einem in Unsloth Studio geladenen Modell deinen Projektordner und führe aus:

```bash
unsloth start claude
```

<figure><img src="/files/090f12de77326b94f443cf743bf3318b7416910e" alt="Claude Code connected to a local model through Unsloth Studio"><figcaption><p>Claude Code, ausgeführt gegen das in Unsloth Studio geladene Modell.</p></figcaption></figure>

Unsloth setzt für diesen Start den lokalen Endpunkt, den API-Schlüssel, das Modell und die Kontextlänge. Ihre normale Claude-Code-Konfiguration bleibt unverändert.

Claude Code speichert Unterhaltungen bereits in seinem normalen Sitzungsspeicher, daher `--persist` nicht erforderlich. Setzen Sie Ihre neueste Sitzung fort mit:

```bash
unsloth start claude --continue
```

Siehe die vollständige `unsloth start` Referenz zum Laden eines Modells über die Befehlszeile, entfernte Unsloth-Server und erweiterte Optionen.

Der Rest dieser Anleitung behandelt die manuelle `llama.cpp` Einrichtung.

#### 🔌 Manuell verbinden

Wenn Sie es lieber manuell einrichten möchten, können Sie damit beginnen, die folgenden Umgebungsvariablen festzulegen. Diese Variablen bleiben standardmäßig nicht zwischen Sitzungen erhalten.

{% tabs %}
{% tab title="MacOS, Linux, WSL" %}
**Konfiguration:** Setzen Sie die lokale API-URL:

```bash
export ANTHROPIC_BASE_URL="http://localhost:8888"
```

Kopieren Sie Ihren Schlüssel aus Unsloth Studio → Einstellungen → API (oder aus der Konsole, wenn Sie es mit `unsloth run` starten, wo er ausgegeben wird als `sk-unsloth-...`), und setzen Sie ihn dann. Setzen Sie außerdem einen leeren `ANTHROPIC_API_KEY` damit Claude Code nicht nach einem Cloud-Schlüssel fragt:

```bash
export ANTHROPIC_API_KEY=""
```

Optional: Verwenden Sie den Namen des aktuell in Unsloth geladenen Modells als Standard.

```bash
export ANTHROPIC_MODEL="unsloth/gemma-4-26B-A4B-it-GGUF"
```

Verwenden Sie die vollständige Modell-ID genau so, wie sie in `GET http://localhost:8888/v1/models` erscheint (dieselbe Zeichenfolge, die Sie an `claude --model`).
{% endtab %}

{% tab title="Windows" %}
**Konfiguration:** Setzen Sie die lokale API-URL in PowerShell:

```powershell
$env:ANTHROPIC_BASE_URL = "http://localhost:8888"
```

Kopieren Sie Ihren Schlüssel aus **Unsloth Studio → Einstellungen → API**und setzen Sie ihn dann:

```powershell
$env:ANTHROPIC_AUTH_TOKEN = "sk-unsloth-xxxxxxxxxxxx"
```

**Optional:** Verwenden Sie den Namen des aktuell in Unsloth geladenen Modells als Standard.

```powershell
$env:ANTHROPIC_MODEL = "gemma-4-26B-A4B-it-GGUF"
```

{% hint style="info" %}
Der Modellname sollte das Modell sein, das aktuell in Unsloth Studio geladen ist.
{% endhint %}
{% endtab %}
{% endtabs %}

### Claude Code starten

Starten Sie Claude Code mit dem aktuell in Unsloth geladenen Modell.

Wir verwenden `gemma-4-26B-A4B-it-GGUF` , aber Sie können jedes mit Unsloth kompatible Modell verwenden.

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF
```

{% hint style="info" %}
Für einen zusätzlichen Geschwindigkeitsschub bei lokalen Modellen können Sie außerdem mit `--bare --exclude-dynamic-system-prompt-sections` starten. Siehe unten Optional: die Systemeingabeaufforderung verkleinern.
{% endhint %}

Claude Code sollte das ausgewählte Modell öffnen und anzeigen.

<figure><img src="/files/754efbbba589910e6ca1eed3af043812cac256e9" alt=""><figcaption></figcaption></figure>

{% hint style="warning" %}
Siehe [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") zuerst, um zu beheben, dass offene Modelle aufgrund der KV-Cache-Invalidierung 90 % langsamer sind.
{% endhint %}

Probieren Sie diese Eingabeaufforderung aus, um hochwertige SFT-Datensätze zu recherchieren und zu bewerten:

{% code overflow="wrap" %}

```
Sie dürfen nur in project/ arbeiten. Suchen Sie nicht nach CLAUDE.md — das ist es. Verwenden Sie die Websuche, um 10 echte Instruction-/Chat-/SFT-Datensätze auf Hugging Face zu finden, fassen Sie Ihre Ergebnisse kurz zusammen und erklären Sie bei der Recherche, warum jeder Datensatz für SFT relevant ist. Erstellen Sie dann sft_report.md als ausgearbeiteten Markdown-Bericht mit Rang, Datensatzname, Ersteller, 3–5 relevanten Tags, einer kurzen Zusammenfassung in einfachem Englisch und der Begründung, warum er für SFT nützlich ist. Halten Sie alles knapp und lesbar, ohne riesige Metadaten-Dumps, eingefügte Rohbeschreibungen, übergroße Tag-Listen oder nicht verwandte Datensätze. Die Aufgabe ist abgeschlossen, sobald sft_report.md 10 saubere, gut geschriebene Datensatz-Einträge enthält, und endet mit: “Successfully finetuned a model with Unsloth!"
```

{% endcode %}

Nachdem Sie die Eingabeaufforderung abgeschickt haben, sucht der Agent im Web, bewertet die Ergebnisse und schreibt den endgültigen Bericht. Dies kann einige Minuten dauern.

Einige Workflows erfordern möglicherweise, dass Sie Aktionen genehmigen oder Folgeaufforderungen beantworten.

<figure><img src="/files/d7273f89484e689eba23f584ac8357b9958e556b" alt="" width="563"><figcaption></figcaption></figure>

{% hint style="info" %}
Einige Workflows erfordern möglicherweise, dass Sie Aktionen genehmigen oder Folgeaufforderungen beantworten.
{% endhint %}

Nach Abschluss wird die generierte `sft_report.md` etwa so aussehen.

<figure><img src="/files/53c1eee2d5dd765686fe47c37e14eaecde8352ab" alt="" width="375"><figcaption></figcaption></figure>

{% hint style="warning" %}
Wenn du `Verbindung zur API nicht möglich (ConnectionRefused)`  , denken Sie daran, `ANTHROPIC_BASE_URL` über `unset ANTHROPIC_BASE_URL`

Wenn Sie feststellen, dass offene Modelle 90 % langsamer sind, [sehen Sie zuerst hier nach](#fixing-90-slower-inference-in-claude-code) um zu beheben, dass der KV-Cache ungültig wird.
{% endhint %}

### Optional: die Systemeingabeaufforderung verkleinern

Claude Code wurde für die gehosteten Modelle von Anthropic entwickelt, daher ist seine Standard-Systemeingabeaufforderung groß. Bei lokalen Modellen können Sie sie für schnellere Antworten und bessere KV-Cache-Wiederverwendung verkleinern, indem Sie beim Start zwei Flags hinzufügen:

{% code overflow="wrap" %}

```shellscript
claude --model unsloth/gemma-4-26B-A4B-it-GGUF --bare --exclude-dynamic-system-prompt-sections
```

{% endcode %}

{% hint style="info" %}
`--bare` überspringt die automatische Erkennung von Hooks, Skills, Plugins, MCP-Servern und CLAUDE.md (Claude behält Bash sowie Datei-Lesen/Bearbeiten), und `--exclude-dynamic-system-prompt-sections` verschiebt gerätespezifische Abschnitte aus dem Prompt-Präfix heraus. Beide verkleinern die Eingabeaufforderung und verbessern die KV-Cache-Wiederverwendung, wodurch lokale Modelle spürbar schneller werden. Sie sind optional und ändern die obige Verbindungs-Einrichtung nicht.
{% endhint %}

### Optional: Den Unsloth-Server anpassen

Claude Code verwendet das Modell, das in Unsloth läuft. Sie können anpassen, wie sich der Server beim Start verhält.

```bash
# Für einen Coding-Agenten bereitstellen: --disable-tools leitet die eigenen Tools des Agenten weiter
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \\
  --disable-tools \\
  --reasoning off \\
  -p 8888
```

{% hint style="warning" %}
Verwende `--disable-tools` beim Steuern von Claude Code (oder einem anderen externen Coding-Agenten). Standardmäßig führt Unsloth Studio seine eigenen serverseitigen Tools aus, wodurch die Tool-Aufrufe des Agenten abgefangen werden, sodass Claude Code zwar antwortet, aber niemals Dateien bearbeitet. `--disable-tools` wechselt zum Durchreichen, sodass Claude Codes eigene Write/Edit/Bash-Tools verwendet werden.
{% endhint %}

Verwende `--reasoning off` um das Denken auszuschalten, oder `--reasoning on` um es für Modelle, die Schlussfolgern unterstützen, einzuschalten.

```bash
# Die API in Ihrem lokalen Netzwerk bereitstellen
unsloth run \\
  --model unsloth/gemma-4-26B-A4B-it-GGUF \\
  -H 0.0.0.0 \\
  -p 8888
```

Dadurch startet der Server auf `0.0.0.0:8888`, sodass andere Geräte in Ihrem lokalen Netzwerk eine Verbindung herstellen können.

Verwende `-p` um zu ändern, auf welchem Port der Server läuft. Verwenden Sie `-H 0.0.0.0` wenn sich Telefone, Laptops oder andere Geräte in Ihrem Netzwerk verbinden sollen.

Für eine erweiterte Laufzeitkonfiguration siehe den Hauptabschnitt [API-Optimierung](https://unsloth.ai/docs/basics/api#unsloth-run-command) .

## 🦙 Llama.cpp-Tutorial

Bevor wir beginnen, müssen wir zuerst das Setup für das konkrete Modell abschließen, das du verwenden wirst. Wir nutzen `llama.cpp` das ein Open-Source-Framework zum Ausführen von LLMs auf Ihren Mac-, Linux-, Windows- usw\.-Geräten ist. Llama.cpp enthält `llama-server` womit Sie LLMs effizient bereitstellen und deployen können. Das Modell wird auf Port 8001 bereitgestellt, wobei alle Agent-Tools über einen einzigen OpenAI-kompatiblen Endpunkt geleitet werden.

#### Qwen3.5-Tutorial

Wir werden verwenden [Qwen3.5](/docs/de/modelle/qwen3.5.md)-35B-A3B und spezielle Einstellungen für schnelle, genaue Coding-Aufgaben. Wenn Sie nicht genug VRAM haben und ein **intelligenteres** model, **Qwen3.5-27B** ist eine gute Wahl, aber es wird etwa doppelt so langsam sein, oder Sie können andere Qwen3.5-Varianten wie 9B, 4B oder 2B verwenden.

{% hint style="info" %}
Verwenden Sie Qwen3.5-27B, wenn Sie ein **intelligenteres** Modell wollen oder nicht genug VRAM haben. Es wird jedoch etwa doppelt so langsam sein wie 35B-A3B. Oder Sie können [**Qwen3-Coder-Next**](/docs/de/modelle/qwen3-coder-next.md) das fantastisch ist, wenn Sie genug VRAM haben.
{% endhint %}

{% stepper %}
{% step %}

#### llama.cpp installieren

Wir müssen `llama.cpp` um lokale LLMs für Claude Code usw. bereitzustellen/zu servieren. Wir folgen den offiziellen Build-Anweisungen für korrekte GPU-Bindings und maximale Leistung. Ändern Sie `-DGGML_CUDA=ON` zu `-DGGML_CUDA=OFF` wenn Sie keine GPU haben oder nur CPU-Inferenz wünschen. **Für Apple-Mac-/Metal-Geräte**, setzen Sie `-DGGML_CUDA=OFF` und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev git-all -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

<figure><img src="/files/9e02e015e443976792468a0e4d1e61f222e855b1" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Modelle lokal herunterladen und verwenden

Laden Sie das Modell über `huggingface_hub` in Python (nach der Installation über `pip install huggingface_hub hf_transfer`). Wir verwenden die **UD-Q4\_K\_XL** Quantisierung für das beste Verhältnis von Größe und Genauigkeit. Alle Unsloth-GGUF-Uploads findest du in unserer [Sammlung hier](/docs/de/los-gehts/unsloth-model-catalog.md). Wenn Downloads hängen bleiben, siehe [Hugging Face Hub, XET-Debugging](/docs/de/grundlagen/troubleshooting-and-faqs/hugging-face-hub-xet-debugging.md)

```bash
hf download unsloth/Qwen3.5-35B-A3B-GGUF \
    --local-dir unsloth/Qwen3.5-35B-A3B-GGUF \
    --include "*UD-Q4_K_XL*" # Verwenden Sie "*UD-Q2_K_XL*" für dynamische 2-Bit
```

<figure><img src="/files/b045ea7c36778d9bcfb8acba28dbccaa7ed22de6" alt=""><figcaption></figcaption></figure>

{% hint style="success" %}
Wir haben `unsloth/Qwen3.5-35B-A3B-GGUF`  , aber Sie können eine andere Variante wie 27B oder ein anderes Modell wie `unsloth/`[`Qwen3-Coder-Next`](/docs/de/modelle/qwen3-coder-next.md)`-GGUF`.
{% endhint %}

<figure><img src="/files/77c71a7eb85cb947c1602c6558df47b7e4f957eb" alt="" width="563"><figcaption></figcaption></figure>
{% endstep %}

{% step %}

#### Starte den Llama-Server

Um Qwen3.5 für agentische Workloads bereitzustellen, verwenden wir `llama-server`. Wir wenden [Qwens empfohlene Sampling-Parameter](/docs/de/modelle/qwen3.5.md#recommended-settings) für den Thinking-Modus an: `temp 0.6`, `top_p 0.95` , `top-k 20`. Beachten Sie, dass sich diese Werte ändern, wenn Sie den Non-Thinking-Modus oder andere Aufgaben verwenden.

Führe diesen Befehl in einem neuen Terminal aus (verwende `tmux` oder öffne ein neues Terminal). Das Folgende sollte **passt perfekt in eine 24-GB-GPU (RTX 4090) (verwendet 23 GB)** `--fit auf` wird auch automatisch auslagern, aber wenn du schlechte Leistung bemerkst, reduziere `--ctx-size` .

{% hint style="info" %}
Wir haben `--cache-type-k q8_0 --cache-type-v q8_0` für die KV-Cache-Quantisierung zur Verringerung des VRAM-Verbrauchs. Für volle Präzision verwenden Sie `--cache-type-k bf16 --cache-type-v bf16` .Hinweis: Der bf16-KV-Cache kann auf manchen Maschinen etwas langsamer sein.
{% endhint %}

```bash
./llama.cpp/llama-server \\
    --model unsloth/Qwen3.5-35B-A3B-GGUF/Qwen3.5-35B-A3B-UD-Q4_K_XL.gguf \
    --alias "unsloth/Qwen3.5-35B-A3B" \
    --temp 0.6 \\
    --top-p 0.95 \\
    --top-k 20 \\
    --min-p 0.00 \\
    --port 8001 \\
    --kv-unified \\
    --cache-type-k q8_0 --cache-type-v q8_0
```

{% hint style="success" %}
Sie können das Thinking bei Qwen3.5 auch deaktivieren, was die Leistung bei agentischem Coding verbessern kann. Um das Thinking mit llama.cpp zu deaktivieren, fügen Sie dies dem llama-server-Befehl hinzu:

`--chat-template-kwargs "{\"enable_thinking\": false}"`

<img src="/files/97cefe30500398f36322e3abca6ac84ae206c488" alt="" data-size="original">
{% endhint %}
{% endstep %}
{% endstepper %}

### Starten Sie Claude Code mit llama-server

{% hint style="success" %}
Wir haben `unsloth/GLM-4.7-Flash-GGUF` , aber du kannst alles verwenden wie `unsloth/Qwen3.6-27B-GGUF`.
{% endhint %}

{% hint style="warning" %}
Siehe [#fixing-90-slower-inference-in-claude-code](#fixing-90-slower-inference-in-claude-code "mention") zuerst, um zu beheben, dass offene Modelle aufgrund der KV-Cache-Invalidierung 90 % langsamer sind.
{% endhint %}

Navigieren Sie zu Ihrem Projektordner (`mkdir project ; cd project`) und führen Sie aus:

```bash
claude --model unsloth/GLM-4.7-Flash
```

Um Qwen3.6-35B-A3B zu verwenden, ändern Sie es einfach zu:

```bash
claude --model unsloth/Qwen3.6-35B-A3B
```

<div data-with-frame="true"><figure><img src="/files/a527b9eda682e762510bcc0ac431ea8092f0e51a" alt="" width="563"><figcaption></figcaption></figure></div>

Um Claude Code so einzustellen, dass Befehle ohne Genehmigungen ausgeführt werden, tun Sie **(ACHTUNG: Dadurch wird Claude Code Code nach Belieben ausführen und ausführen, ohne jegliche Genehmigungen!)**

{% code overflow="wrap" %}

```bash
claude --model unsloth/GLM-4.7-Flash --dangerously-skip-permissions
```

{% endcode %}

Probiere diesen Prompt aus, um ein einfaches Unsloth-Finetuning zu installieren und auszuführen:

{% code overflow="wrap" %}

```
Sie dürfen nur im cwd project/ arbeiten. Suchen Sie nicht nach CLAUDE.md - das ist es. Installieren Sie Unsloth über eine virtuelle Umgebung mit uv. Verwenden Sie `python -m venv unsloth_env` und dann, falls möglich, `source unsloth_env/bin/activate`. Siehe https://unsloth.ai/docs/get-started/install/pip-install für die Vorgehensweise (abrufen und lesen). Führen Sie dann einen einfachen Unsloth-Finetuning-Lauf aus, der in https://github.com/unslothai/unsloth beschrieben ist. Sie haben Zugriff auf 1 GPU.
```

{% endcode %}

<div data-with-frame="true"><figure><img src="/files/e0a425cc7c492be7351cfc77d143adb530640a77" alt="" width="563"><figcaption></figcaption></figure></div>

Nach kurzer Wartezeit wird Unsloth über uv in einer venv installiert und geladen:

<div data-with-frame="true"><figure><img src="/files/1872f761f8d387ce7f11b0a4624f30b618c23ed0" alt="" width="563"><figcaption></figcaption></figure></div>

und schließlich werden Sie ein erfolgreich mit Unsloth feinabgestimmtes Modell sehen!

<div data-with-frame="true"><figure><img src="/files/b529ad04568468ccc24a43889b11ecace803a97d" alt="" width="563"><figcaption></figcaption></figure></div>

{% hint style="warning" %}
Wenn du `Verbindung zur API nicht möglich (ConnectionRefused)`  , denken Sie daran, `ANTHROPIC_BASE_URL` über `unset ANTHROPIC_BASE_URL`

Wenn Sie feststellen, dass offene Modelle 90 % langsamer sind, [sehen Sie zuerst hier nach](#fixing-90-slower-inference-in-claude-code) um zu beheben, dass der KV-Cache ungültig wird.
{% endhint %}

[^1]: Muss verwendet werden!


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/grundlagen/claude-code.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
