Wie man MCP-Server mit lokalen LLMs verwendet
Erfahren Sie anhand von Screenshots, wie Sie MCP-Server mit Open-AI-Modellen verbinden.
Diese Schritt-für-Schritt-Anleitung zeigt dir, wie du verbindest Model Context Protocol (MCP) Server mit lokalen LLMs wie Qwen oder Gemma, sodass jedes Modell, das du ausführst, über MCP externe Tools und Dienste aufrufen kann. Durch die Verbindung von MCP mit einem lokalen Modell kann es sicher deine lokalen Dateien, Apps, Datenbanken und Tools nutzen, statt nur aus dem Gedächtnis zu chatten, um einen nützlicheren, privaten und austauschbaren KI-Assistenten zu bauen, der in deiner realen Umgebung handeln kann.
Wir werden die Open-Source-Repos Unsloth und llama.cpp verwenden, da sie beliebte Frameworks für lokale Modellinferenz/Deployment sind. MCP funktioniert für lokale GGUF-Modelle und Cloud- Provider-Modelle. Wir zeigen auch, wie mehrere MCP-Server genutzt werden können.
MCP-Tools arbeiten zusammen mit anderen Modellfähigkeiten wie Codeausführung und Websuche, sodass ein einzelnes Modell im selben Thread im Web suchen, Code ausführen und deine verbundenen Dienste aufrufen kann.
Anwendungsfälle
Sobald ein MCP-Server verbunden ist, kannst du dein lokales Modell bitten, viele automatisierte Aufgaben auszuführen. Einige Beispiele:
Dokumente durchsuchen: „Finde die relevanten Dokumente und fasse die Einrichtungsschritte zusammen.“ - Context7 kann verwendet werden.
Eine Codebasis analysieren: „Mappe dieses Repo aus und erkläre, wo Authentifizierung, Abrechnung und Datenzugriff stattfinden.“ - Das offizielle GitHub-MCP und GitMCP können zur Analyse von Repos verwendet werden.
Das Web mit Embeddings durchsuchen - Exas MCP-Server kann für semantische Websuchen mit kontextbezogener Embedding-Unterstützung verwendet werden.
Website-UIs debuggen - Die Playwright- und Chrome-DevTools-MCP-Server können verwendet werden, um Websites zu steuern und Fehlerbehebungen für Probleme zu finden.
Schnellstart
Wir werden zwei Wege verwenden, um dein lokales Modell auf deinem Gerät mit MCP-Servern zu verbinden. Beide nutzen Open-Source-Pakete: Unsloth und llama.cpp um dein Modell auszuführen, zu hosten und bereitzustellen.
Unsloth MCP-AnleitungLlama.cpp MCP-Anleitung
🦥 Unsloth-Anleitung
In diesem Beispiel verwenden wir Unsloth, um jedes lokale Modell wie Qwen3.6 oder Gemma 4 mit den MCP-Servern zu verbinden: Vercel, Context7, Exa und Hugging Face. Dann fragen wir ein Modell, was es damit tun kann. Die gleichen Schritte funktionieren für jeden MCP-Server.
Unsloth Studio einrichten
Jetzt müssen wir installieren und einrichten Unsloth, was es dir ermöglicht, die Cloud-Modelle in einer UI-Oberfläche auszuführen. Siehe hier für ausführlichere Anweisungen.
Schritt 1: Unsloth einrichten
Starte das Terminal auf dem Mac und installiere dann Unsloth, indem du den folgenden Befehl eingibst.
curl -fsSL https://unsloth.ai/install.sh | shDie Umgebung und die erforderlichen Pakete werden nun installiert. Gib Y ein und drücke Enter, wenn du aufgefordert wirst fortzufahren. Nach Abschluss der Einrichtung ist der Server lokal auf Port verfügbar 8888.

Wenn du das Starten der App während der Installation übersprungen hast, kannst du sie später mit unsloth studio -p 8888. Um Verbindungen von anderen Geräten in deinem Netzwerk zuzulassen, verwende unsloth studio -H 0.0.0.0 -p 8888 stattdessen.
Schritt 2: Unsloth starten
Öffne deinen bevorzugten Browser und gib http://127.0.0.1:8888 in das URL-Feld ein. Wenn dies deine erste Installation von Unsloth ist, wirst du zur Passwortseite weitergeleitet, auf der du ein neues Passwort erstellen musst. Danach solltest du die Chat-Seite wie unten gezeigt sehen.
Schritt 1: Unsloth einrichten
Öffne das Startmenü, suche nach PowerShellund starte es. Kopiere & gib den Installationsbefehl ein:
es wird automatisch mit der Installation beginnen. Nachdem die Installation abgeschlossen ist, fragt PowerShell, ob du Unsloth Studio starten möchtest.

Du kannst es auch mit dem folgenden Befehl starten:
Wenn du deine Instanz für Clients außerhalb deines PCs/Computers zugänglich machen möchtest,
füge -H 0.0.0.0 zum unsloth studio Befehl hinzu.
Schritt 2: Unsloth starten
Öffne http://127.0.0.1:8888 in deinem Browser. Beim ersten Start erstelle ein neues Passwort, um zur Chat-Seite fortzufahren. Unsloth Studio ist jetzt installiert und einsatzbereit.
Schritt 1: Unsloth einrichten
Öffne deine Terminal-Anwendung. Du kannst sie starten, indem du Ctrl + Alt + Tdrückst oder indem du nach Terminal im Anwendungsmenü deines Systems suchst.
Klicke auf das Windows-Startmenü, gib den Namen deiner installierten Distribution ein (z. B. Ubuntu), und öffne sie dann.
Unter WSL, stelle sicher, dass deine NVIDIA-Treiber installiert sind auf Windows (nicht in WSL) und dass das CUDA-Toolkit in deiner WSL-Distribution installiert ist. Weitere Details findest du unten bei den Systemanforderungen.
Um zu installieren, kopiere und führe den Installationsbefehl aus:
Dann:
Klicke in das Terminalfenster
Füge den Befehl mit
Ctrl + Shift + VDrücke
Enter
Unsloth beginnt nun, die Umgebung einzurichten und die erforderlichen Pakete zu installieren, wie unten gezeigt. Gib Y und drücke Enter wenn du gefragt wirst, ob du Studio jetzt starten möchtest. Dadurch wird Unsloth auf deinem lokalen 8888 Port gestartet.

Wenn du dich entschieden hast, Unsloth während des Installationsvorgangs nicht zu starten, kannst du die Unsloth-App jederzeit mit unsloth studio -p 8888 . Wenn du deine Unsloth-Instanz für Clients außerhalb deines PCs/Computers zugänglich machen möchtest, füge -H 0.0.0.0 zum unsloth studio Befehl hinzu.
Schritt 2: Unsloth starten
Öffne deinen bevorzugten Browser und gib http://127.0.0.1:8888 in das URL-Feld ein. Wenn dies deine erste Installation von Unsloth ist, wirst du zur Passwortseite weitergeleitet, auf der du ein neues Passwort erstellen musst. Danach sollte Unsloth jetzt auf der Chat-Seite wie unten gezeigt geöffnet werden.
MCP aktivieren
Klicke in der Chat-Symbolleiste auf „MCP“.

Unsloth Studio unterstützt standardmäßig MCP für Context7, Exa und Hugging Face. Das Aktivieren von Exa Websuche deaktiviert das standardmäßige Suchwerkzeug, das wir haben.
Eigene MCP-Server hinzufügen
Um den Vercel-MCP-Server hinzuzufügen, klicke auf „Benutzerdefinierten MCP hinzufügen“, und es erscheint ein Pop-up:

Fülle die Serverdetails aus:
Anzeigename: eine freundliche Bezeichnung, z. B.
Vercel.URL: der Basis-Endpunkt des Servers, z. B.
https://mcp.vercel.com.Wähle unten eine Authentifizierungsmethode.
Für Server, die browserbasierte Authentifizierung erfordern (GitHub, Linear, Vercel usw.), aktiviere OAuth-Anmeldung verwenden. Beim ersten Verbindungsaufbau öffnet sich ein Browserfenster, damit du Unsloth autorisieren kannst.
Für Server, die sich mit einem Token authentifizieren, lass OAuth deaktiviert und klicke Header hinzufügen unter Benutzerdefinierten Headern. Füge einen Authorization Header mit deinem Token hinzu:

Testen & hinzufügen
Klicke auf Verbindung testen um zu bestätigen, dass Unsloth den Server erreichen kann. Sobald es erfolgreich ist, klicke Server hinzufügen um es zu speichern.
Falls Verbindung testen dies fehlschlägt, überprüfe, ob die URL der Basis-Endpunkt des Servers ist (nicht eine Dokumentationsseite) und ob deine Authentifizierungsmethode korrekt ist. Siehe die Fehlerbehebung unten.

Geladene Tools überprüfen
Der Server erscheint nun in der MCP-Server-Liste. Unsloth ruft seine Tools automatisch ab und zeigt eine Bestätigung an, z. B. „Vercel“ aktualisiert (18 Tools).
Jeder Server hat Steuerelemente zum umschalten ihn ein/aus, aktualisieren seiner Tools, bearbeiten oder löschen ihn. Stelle sicher, dass sowohl der Schalter des Servers als auch der MCP-Server verwenden Hauptschalter aktiviert sind, und schließe dann den Dialog.
Er wird hervorgehoben, wenn er aktiviert ist. Du kannst ihn auch wieder deaktivieren, indem du einfach erneut darauf klickst.

Im Chat verwenden
Wähle ein beliebiges Modell aus dem Modell auswählen Dropdown-Menü und beginne zu chatten. Das Modell kann nun bei Bedarf selbstständig die Tools des Servers aufrufen.
Oben wurde ein lokales gemma-4-E2B-it-GGUF gefragt "Kannst du den Vercel-MCP-Server verwenden?" und meldete die Aktionen, die es durchführen kann: Projekte verwalten, Protokolle analysieren, Teams auflisten, Zugriffslinks generieren, Domains prüfen und die Vercel-Dokumentation durchsuchen.

Mehrere MCP-Server verwenden
Wie wäre es mit dem Aufruf mehrerer MCP-Server, z. B. 3? Wir verwenden die standardmäßig von Unsloth Studio bereitgestellten MCP-Server Exa, Context7 und Hugging Face und aktivieren alle 3.
Wenn du fragst "Kann Unsloth Qwen-Finetuning unterstützen", liefert Exa dazu ausführliche Details:

Dann als Folgefrage "Suche in den Unsloth-Dokumenten, wie das geht", und Context7 wird für die Doku verwendet:

Dann tippe "Suche bei Hugging Face nach unsloth/Qwen-Modellen", und der MCP-Server von Hugging Face wird aufgerufen:

Ein weiteres spezifisches Anwendungsbeispiel
Sobald ein Server verbunden ist, bitte das Modell, in normaler Sprache echte Arbeit zu erledigen. Einige Beispiele mit dem Vercel-Server:
Einen fehlschlagenden Build debuggen: "Rufe die Build-Logs für mein neuestes Deployment ab und sag mir, warum es fehlgeschlagen ist."
Bereitstellungsstatus prüfen: "Liste meine neuesten Deployments und ihren Status auf."
Die Doku durchsuchen: "Durchsuche die Vercel-Dokumentation, wie man eine benutzerdefinierte Domain einrichtet."
Domain-Recherche: "Ist
myproject.devverfügbar, und wie viel würde es kosten?"
🦙 Llama.cpp-Anleitung
Starte llama-server mit einem GGUF
Wir verwenden Gemma 4 E4B GGUF in diesem Beispiel:
Für das größere Modell Gemma 4 26B-A4B:
Für weitere Anpassungen der Inferenzparameter siehe unseren Gemma-4-Leitfaden.
Du kannst den Server testen:
Erstelle eine MCP-Dateisystem-Sandbox
Kopiere den absoluten Pfad. Erstelle einen separaten Projektordner für deinen MCP-Host:
Erstelle server_config.json:
Ersetze den Pfad durch deinen echten Workspace-Pfad. IBMs mcp-cli Dokumentation verwendet dieselbe server_config.json Struktur und dieselbe npx -y @modelcontextprotocol/server-filesystem /path/to/allowed/files Dateisystemkonfiguration.
Führe einen terminalbasierten MCP-Host gegen llama.cpp aus
Verwende IBMs mcp-cli; es ist ein MCP-Client/-Host für die Kommandozeile mit Chat-Modus, Tool-Erkennung und Unterstützung für benutzerdefinierte OpenAI-kompatible Provider. Die Doku empfiehlt uvx mcp-cli --help, Unterstützung für Projekte server_config.json, und Unterstützung für benutzerdefinierte OpenAI-kompatible Provider zur Laufzeit über --api-base und --api-key.
mcp-cli benötigt zum Starten eine Konfigurationsdatei. Daher ist es notwendig, einen Schritt hinzuzufügen, um sie zu erstellen. Zum Beispiel:
Dann ausführen:
Dann versuche:
Dann:
mcp-cli hat standardmäßig eine Bestätigung für Tool-Aufrufe aktiviert, sodass du vor der Ausführung von Tools Eingabeaufforderungen sehen solltest.
Vollständiges Codebeispiel:
Fehlerbehebung
Wenn ein Server keine Verbindung herstellt oder seine Tools nicht erscheinen, prüfe, ob die URL die Basis-Endpunkt des Servers ist (z. B. https://mcp.vercel.com), nicht eine Doku- oder Dashboard-Seite. Bei OAuth-Servern schließe die Browser-Anmeldung ab, wenn sie sich öffnet; bei tokenbasierten Servern überprüfe den Authorization Header und dass der Token gültig ist.
Klicke auf Aktualisieren wenn die Tools nach der Verbindung nicht angezeigt werden, und stelle sicher, dass sowohl der einzelne Server-Schalter als auch der MCP-Server verwenden Hauptschalter aktiviert sind.
Sicherheitshinweise
Verbinde nur MCP-Server, denen du vertraust. Prüfe angeforderte Berechtigungen und lasse die menschliche Bestätigung für Aktionen aktiviert, die private Daten lesen, Deployments ändern, Domains kaufen oder Projekte modifizieren. Sei besonders vorsichtig, wenn du MCP-Server mit Websuche oder anderen Tools kombinierst, da prompt-injizierte Inhalte versuchen können, unerwünschte Tool-Aufrufe auszulösen.
Beliebte MCP-Server
Hier ist eine Liste einiger beliebter und nützlicher MCP-Server, mit denen du dich verbinden kannst:
GitHub MCP
Repos, Issues, PRs, Codesuche, Actions
Offizielles GitHub-MCP mit Remote- und lokaler Einrichtung, das Repos, Issues, Pull Requests, Actions, Codesicherheit und mehr abdeckt. (GitHub)
Context7
Frische Bibliotheksdokumentation und Beispiele
Lädt aktuelle, versionsspezifische Dokumentation für Coding-Assistenten, statt sich auf veraltete Trainingsdaten zu verlassen. Verwendet https://mcp.context7.com/mcp. (GitHub)
Notion MCP
Dokumente, Notizen, Aufgaben, Projektwissen
Gut für Teams, die Notion für Spezifikationen, PRDs, Roadmaps oder Notizen verwenden. Gehostetes MCP kann Arbeitsbereichsinhalte lesen und schreiben. (Notion-Entwickler)
Slack MCP
Suche in Teamgesprächen
Ermöglicht KI-Tools, Slack-Nachrichten, -Kanäle, -Dateien, -Threads und Mitgliederinformationen abzufragen; die Aktionen hängen von den Berechtigungen ab. (Slack)
Linear MCP
Issues, Projekte, Produkt-Workflows
Offizielles Remote-MCP zum Finden, Erstellen und Aktualisieren von Linear-Issues, -Projekten, -Kommentaren und zugehörigen Objekten. (Linear)
Vercel MCP
Deployments, Protokolle, Dokumentation, Domains
Nützlich für Frontend-/Web-Workflows: Deployments, Protokolle, Dokumentation und Projektkontext prüfen. Prüfen Sie zuerst die Client-Kompatibilität. (Vercel)
Sentry MCP
Fehlerbehebung in der Produktion
Hilft Agenten, Sentry-Issues, Traces, Fehler und Leistungsdaten in Entwicklungs-Workflows mit menschlicher Beteiligung zu untersuchen. (GitHub)
Dateisystem / lokale Dateien MCP
Lokale Projektdateien
Nützlich für lokale LLM-Setups, normalerweise über stdio. Referenzserver sollten am besten als Beispiele oder Ausgangspunkte betrachtet werden. (GitHub)
Zuletzt aktualisiert
War das hilfreich?

