For the complete documentation index, see llms.txt. This page is also available as Markdown.

Wie man lokale LLMs mit Claude Code ausführt

Leitfaden zur Verwendung offener Modelle mit Claude Code auf deinem lokalen Gerät.

Diese Schritt-für-Schritt-Anleitung zeigt dir, wie du offene LLMs und APIs vollständig lokal mit Claude Code verbindest – inklusive Screenshots. Ausführen mit jedem offenen Modell wie Qwen3.6, DeepSeek und Gemma.

Für dieses Tutorial verwenden wir die offenen Modelle: Gemma 4 und Qwen3.5 die starke agentische und Coding-Modelle sind (funktioniert auf einem Gerät mit 24 GB RAM/Unified Memory).

Für die Inferenz verwenden wir Unsloth Desktop und llama.cpp das es dir ermöglicht, LLMs unter macOS, Linux und Windows auszuführen/bereitzustellen. Du kannst jedes andere Modell verwenden. Für Modell-Quants nutzen wir Unsloth Dynamic GGUFs um jedes quantisierte LLM auszuführen und dabei die Genauigkeit beizubehalten.

Claude Code, der mit Qwen3.5 lokal ausgeführt wird.

Claude-Code-Einrichtung📖 Anleitung zur Einrichtung eines lokalen Modells

Claude-Code-Einrichtung

Bevor wir unser lokales LLM einrichten, müssen wir Claude Code installieren. Claude Code ist ein terminalbasierter Coding-Agent, der deine Codebasis versteht und komplexe Git-Workflows mithilfe natürlicher Sprache handhabt.

Claude Code installieren:

Füge dies in dein Terminal ein, um Claude Code zu installieren:

curl -fsSL https://claude.ai/install.sh | bash

Nach der Installation wechsle in deinen Projektordner. Tippe dann claude in die Shell um zu beginnen.

cd ~/projects/my-project 
claude

Claude Code installieren:

Gib ein in PowerShell um Claude Code zu installieren:

irm https://claude.ai/install.ps1 | iex

Nach der Installation wechsle in deinen Projektordner. Tippe dann claude in die powershell um zu beginnen.

cd /pfad/zu/deinem/projekt
claude

🕵️Behebung von 90 % langsamerer Inferenz in Claude Code

Die Attribution ist eine Zeile, die an den Beginn des System-Prompts (x-anthropic-billing-header: cc_version=...; cch=...;) vorangestellt wird, dessen Wert sich bei jeder Anfrage ändert, sodass der gesamte Prompt-Präfix bei jedem Durchlauf den KV-Cache verfehlt.

Die einfachste Lösung ist, sie direkt beim Start von Claude Code zu deaktivieren, sodass keine Datei bearbeitet werden muss:

claude --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0","CLAUDE_CODE_ENABLE_TELEMETRY":"0"}}' --model unsloth/gemma-4-26B-A4B-it-GGUF

Neuere Claude-Code-Versionen beachten außerdem export CLAUDE_CODE_ATTRIBUTION_HEADER=0; ältere Builds ignorierten die Shell-Variable, daher ist die --settings Variante oben (oder die Konfigurationsdatei unten) die zuverlässige Wahl.

Um es dauerhaft zu machen, füge CLAUDE_CODE_ATTRIBUTION_HEADER mit dem Wert 0 in "env" in ~/.claude/settings.jsonein. Zum Beispiel: cat > ~/.claude/settings.json und füge dann den folgenden Inhalt ein (nach dem Einfügen ENTER drücken und dann STRG+D, um zu speichern). Wenn du bereits eine ~/.claude/settings.json Datei hast, füge einfach "CLAUDE_CODE_ATTRIBUTION_HEADER" : "0" zum Abschnitt "env" hinzu und lasse den Rest der Konfigurationsdatei unverändert.

📖 Schnellstart-Tutorials

Bevor wir beginnen, müssen wir zunächst die Einrichtung für das konkrete Modell abschließen, das du verwenden wirst. Wir verwenden Unsloth (eine Web-UI) und llama.cpp, die Open-Source-Frameworks zum Ausführen und Bereitstellen von LLMs auf deinen Mac-, Linux- und Windows-Geräten sind.

Unsloth hat außerdem einzigartige selbstheilende Tool-Aufruf- und Websuche Funktionen. Siehe rechts Claude Code, verbunden mit Unsloth:

Claude Code verbinden🦥 Unsloth-Tutorial llama.cpp-Tutorial

🦥 Unsloth-Tutorial

Für dieses Tutorial stellen wir lokale Modelle über eine UI für Claude Code bereit/verbinden sie, indem wir Unslothverwenden. Unsloth funktioniert unter Windows, WSL, Linux und macOS.

Siehe unten für Installationsanweisungen:

Beispiel für ein in Unsloth laufendes Qwen3.6 mit 2 Bit.
1

Unsloth herunterladen

Der einfachste Einstieg ist die Installation der Unsloth Desktop -App. Sie unterstützt macOS, Linux, Windows, NVIDIA, AMD, Intel- und CPU-Setups.

Unsloth herunterladen

Oder, wenn du die manuelle Installation bevorzugst:

macOS, Linux, WSL:

Windows PowerShell:

2

Installieren

  1. Öffne den Unsloth-Installer (.dmg, .exe Dateien)

  2. Ziehe Unsloth auf dem Mac in den Ordner „Applications“ oder schließe das Setup unter Windows ab.

  3. Starte die App und warte, bis die Installation abgeschlossen ist

3

Wähle ein Modell

Öffne oben das Dropdown „Select model“ oder den Tab „Model hub“, wähle ein Modell und eine Quantisierung, die zu deinem Gerät passt, und lade es dann herunter. Sobald es fertig ist, kannst du mit dem Chatten beginnen – keine Einrichtung erforderlich.

4

Unsloth ist jetzt bereit

Um mit dem Chatten zu beginnen, tippe eine Nachricht ein und drücke Enter.

  • Tools verbinden: Claude Code, Codex, Websuche, MCP und mehr

  • Modelle trainieren: Text, Diffusion, Embeddings und mehr feinabstimmen

  • Medien erzeugen: Bilder, Videos und TTS lokal erstellen und trainieren

Modelllade- und API-Anleitung

1

Modell auswählen

Bevor du die API verwendest, lade ein Modell aus dem Modell auswählen Dropdown oben links auf der Chat-Seite.

In dieser Anleitung verwenden wir: unsloth/gemma-4-26B-A4B-it-GGUF mit der empfohlenen UD-Q4_K_XL Quantisierung.

2

Modell testen

Bevor du den Client verwendest, sende eine kurze Nachricht:

Das bestätigt, dass das Modell korrekt geladen wurde und bereit ist zu antworten.

3

Unsloth-API-Schlüssel

Öffne in Unsloth Einstellungen → API um deinen API-Schlüssel anzuzeigen oder zu erstellen.

Behandle deinen API-Schlüssel wie ein Passwort und vermeide, ihn in Screenshots oder Repositories offenzulegen.

⚙️ Claude Code verbinden

Jetzt, da wir das lokale LLM für Claude Code eingerichtet haben, konfigurieren wir Claude Code so, dass es mit deinem Tool funktioniert. Du kannst dich entweder einfach verbinden mit unsloth start unten verbinden oder es manuell.

⚡ Claude Code ausführen mit unsloth start

Um Claude direkt mit einem Modell zu starten, führe aus:

Unsloth wählt automatisch die richtigen Parameter aus, aber du kannst sie trotzdem ändern.

Öffnen Sie bei einem in Unsloth Studio geladenen Modell Ihren Projektordner und führen Sie Folgendes aus:

Claude Code connected to a local model through Unsloth Studio
Claude Code, das gegen das in Unsloth Studio geladene Modell läuft.

Unsloth setzt für diesen Start den lokalen Endpunkt, den API-Schlüssel, das Modell und die Kontextlänge. Deine normale Claude-Code-Konfiguration bleibt unberührt.

Claude Code speichert Unterhaltungen bereits in seinem normalen Sitzungsspeicher, daher --persist wird nicht benötigt. Setze deine letzte Sitzung fort mit:

Siehe die vollständige unsloth start Referenz zum Laden eines Modells über die Kommandozeile, entfernte Unsloth-Server und erweiterte Optionen.

Der Rest dieser Anleitung behandelt die manuelle llama.cpp Einrichtung.

🔌 Manuell verbinden

Wenn du die Einrichtung lieber manuell vornehmen möchtest, kannst du damit beginnen, die folgenden Umgebungsvariablen zu setzen. Diese Variablen bleiben standardmäßig nicht zwischen Sitzungen erhalten.

Konfiguration: Lokale API-URL setzen:

Kopiere deinen Schlüssel aus Unsloth Studio → Einstellungen → API (oder aus der Konsole, wenn du es mit unsloth runstartest, wo er als sk-unsloth-...ausgegeben wird), und setze ihn dann.

Setze außerdem ein leeres ANTHROPIC_API_KEY damit Claude Code nicht nach einem Cloud-Schlüssel fragt:

Optional: Verwende den Namen des aktuell in Unsloth geladenen Modells als Standard.

Verwende die vollständige Modell-ID genau so, wie sie in GET http://localhost:8888/v1/models erscheint (derselbe String, den du an claude --model).

Konfiguration: Lokale API-URL in Powershell setzen:

Kopiere deinen Schlüssel aus Unsloth Studio → Einstellungen → APIund setze ihn dann:

Optional: Verwende den Namen des aktuell in Unsloth geladenen Modells, um ihn als Standard festzulegen.

Der Modellname sollte das Modell sein, das derzeit in Unsloth Studio geladen ist.

Claude Code starten

Claude Code mit dem derzeit in Unsloth geladenen Modell starten.

Wir werden gemma-4-26B-A4B-it-GGUFverwenden, aber du kannst jedes mit Unsloth kompatible Modell verwenden.

Für einen zusätzlichen Geschwindigkeits-Boost bei lokalen Modellen kannst du auch starten mit --bare --exclude-dynamic-system-prompt-sections. Siehe unten Optional: den System-Prompt verkleinern.

Claude Code sollte das ausgewählte Modell öffnen und anzeigen.

Probiere diesen Prompt aus, um hochwertige SFT-Datensätze zu recherchieren und zu bewerten:

Nachdem du den Prompt abgeschickt hast, wird der Agent das Web durchsuchen, die Ergebnisse bewerten und den Abschlussbericht schreiben. Das kann ein paar Minuten dauern.

Einige Workflows erfordern möglicherweise, dass du Aktionen genehmigst oder Rückfragen beantwortest.

Einige Workflows erfordern möglicherweise, dass du Aktionen genehmigst oder Folgefragen beantwortest.

Sobald abgeschlossen, wird die erzeugte sft_report.md ähnlich aussehen wie dies.

Optional: den System-Prompt verkleinern

Claude Code wurde für Anthropic-Hosting-Modelle entwickelt, daher ist der Standard-System-Prompt groß. Bei lokalen Modellen kannst du ihn für schnellere Antworten und bessere KV-Cache-Wiederverwendung kürzen, indem du beim Start zwei Flags hinzufügst:

--bare überspringt die automatische Erkennung von Hooks, Skills, Plugins, MCP-Servern und CLAUDE.md (Claude behält Bash- sowie Datei-Lese-/Bearbeitungsfunktionen), und --exclude-dynamic-system-prompt-sections verschiebt machinespezifische Abschnitte aus dem Prompt-Präfix heraus. Beides verkleinert den Prompt und verbessert die KV-Cache-Wiederverwendung, was lokale Modelle spürbar schneller macht. Sie sind optional und ändern die obige Verbindungseinrichtung nicht.

Optional: den Unsloth-Server anpassen

Claude Code verwendet das in Unsloth laufende Modell. Du kannst das Verhalten des Servers beim Start anpassen.

Verwende --reasoning off um das Denken auszuschalten, oder --reasoning on um es für Modelle einzuschalten, die Reasoning unterstützen.

Dies startet den Server auf 0.0.0.0:8888, sodass sich andere Geräte in Ihrem lokalen Netzwerk verbinden können.

Verwende -p um zu ändern, auf welchem Port der Server läuft. Verwende -H 0.0.0.0 wenn Handys, Laptops oder andere Geräte in deinem Netzwerk eine Verbindung herstellen sollen.

Für eine weitergehende Laufzeitkonfiguration siehe den Hauptabschnitt API-Abstimmung Abschnitt.

🦙 Llama.cpp-Tutorial

Bevor wir beginnen, müssen wir zunächst die Einrichtung für das konkrete Modell abschließen, das du verwenden wirst. Wir verwenden llama.cpp das ein Open-Source-Framework zum Ausführen von LLMs auf deinen Mac-, Linux-, Windows- usw.-Geräten ist. Llama.cpp enthält llama-server das es ermöglicht, LLMs effizient bereitzustellen und zu deployen. Das Modell wird auf Port 8001 bereitgestellt, wobei alle Agent-Tools über einen einzigen OpenAI-kompatiblen Endpunkt geleitet werden.

Qwen3.5-Tutorial

Wir werden Qwen3.5-35B-A3B und spezielle Einstellungen für schnelle, genaue Coding-Aufgaben verwenden. Wenn du nicht genug VRAM hast und ein intelligenteres Modell Qwen3.5-27B ist eine großartige Wahl, aber es wird etwa 2x langsamer sein, oder du kannst andere Qwen3.5-Varianten wie 9B, 4B oder 2B verwenden.

Verwende Qwen3.5-27B, wenn du ein intelligenteres Modell möchtest oder wenn du nicht genug VRAM hast. Es wird jedoch etwa 2x langsamer sein als 35B-A3B. Oder du kannst Qwen3-Coder-Next verwenden, das fantastisch ist, wenn du genug VRAM hast.

1

llama.cpp installieren

Wir müssen llama.cpp um lokale LLMs bereitzustellen/bereitzustellen, damit sie in Claude Code usw. verwendet werden können. Wir folgen den offiziellen Build-Anweisungen für korrekte GPU-Bindings und maximale Leistung. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder einfach CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Modelle lokal herunterladen und verwenden

Lade das Modell herunter über huggingface_hub in Python (nach der Installation über pip install huggingface_hub hf_transfer). Wir verwenden die UD-Q4_K_XL Quantisierung für das beste Größen-/Genauigkeitsverhältnis. Alle Unsloth-GGUF-Uploads finden Sie in unserer Sammlung hier. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

3

Starten Sie den Llama-Server

Um Qwen3.5 für agentische Workloads bereitzustellen, verwenden wir llama-server. Wir wenden an von Qwen empfohlene Sampling-Parameter für den Thinking-Modus: temp 0.6, top_p 0.95 , top-k 20. Beachte, dass sich diese Werte ändern, wenn du Nicht-Thinking-Modus oder andere Aufgaben verwendest.

Führen Sie diesen Befehl in einem neuen Terminal aus (verwenden Sie tmux oder öffnen Sie ein neues Terminal). Das Folgende sollte passt perfekt in eine 24GB-GPU (RTX 4090) (verwendet 23GB) --fit auf wird ebenfalls automatisch auslagern, aber wenn Sie schlechte Leistung sehen, reduzieren Sie --ctx-size .

Wir haben --cache-type-k q8_0 --cache-type-v q8_0 für KV-Cache-Quantisierung zur Verringerung des VRAM-Verbrauchs. Für volle Präzision verwende --cache-type-k bf16 --cache-type-v bf16 .Hinweis: bf16-KV-Cache kann auf manchen Maschinen etwas langsamer sein.

Claude Code mit llama-server starten

Wechsle in deinen Projektordner (mkdir project ; cd project) und führe aus:

Um Qwen3.6-35B-A3B zu verwenden, ändere es einfach zu:

Um Claude Code so einzustellen, dass Befehle ohne jegliche Genehmigungen ausgeführt werden, tue dies (ACHTUNG: Dadurch wird Claude Code Code ohne jegliche Genehmigungen ausführen, ganz wie es ihm gefällt!)

Probiere diesen Prompt aus, um ein einfaches Unsloth-Finetuning zu installieren und auszuführen:

Nach kurzer Wartezeit wird Unsloth über uv in einer venv installiert und geladen:

und schließlich wirst du ein erfolgreich mit Unsloth feinabgestimmtes Modell sehen!

Zuletzt aktualisiert

War das hilfreich?