For the complete documentation index, see llms.txt. This page is also available as Markdown.

GLM-4.7-Flash: Wie man lokal ausführt

Führe GLM-4.7-Flash lokal auf deinem Gerät aus und feinabstimme es!

GLM-4.7-Flash ist Z.ais neues 30B-MoE-Reasoning-Modell für den lokalen Einsatz, das erstklassige Leistung für Coding, agentische Workflows und Chat bietet. Es verwendet ~3,6 Mrd. Parameter, unterstützt 200K Kontext und führt bei SWE-Bench, GPQA sowie Reasoning-/Chat-Benchmarks.

GLM-4.7-Flash läuft auf 24 GB RAM/VRAM/Unified Memory (32 GB für volle Präzision), und du kannst jetzt mit Unsloth feinabstimmen. Um GLM 4.7 Flash mit vLLM auszuführen, siehe GLM-4.7-Flash in vLLM

AusführungstutorialFeinabstimmung

GLM-4.7-Flash GGUF zum Ausführen: unsloth/GLM-4.7-Flash-GGUF

⚙️ Nutzungsanleitung

Für die beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher (VRAM + Systemspeicher) größer ist als die Größe der quantisierten Modelldatei, die du herunterlädst. Falls nicht, kann llama.cpp weiterhin per SSD/HDD-Offloading laufen, aber die Inferenz wird langsamer.

Nach Rücksprache mit dem Z.ai-Team empfehlen sie, ihre GLM-4.7-Sampling-Parameter zu verwenden:

Standardeinstellungen (die meisten Aufgaben)
Terminal Bench, SWE Bench verifiziert

temperature = 1.0

temperature = 0.7

top_p = 0.95

top_p = 1.0

Wiederholungsstrafe = deaktiviert oder 1.0

Wiederholungsstrafe = deaktiviert oder 1.0

  • Für den allgemeinen Anwendungsfall: --temp 1.0 --top-p 0.95

  • Für Tool-Calling: --temp 0.7 --top-p 1.0

  • Wenn du llama.cpp verwendest, setze --min-p 0.01 da der Standardwert von llama.cpp 0.05 ist

  • Manchmal musst du ausprobieren, welche Zahlen für deinen Anwendungsfall am besten funktionieren.

  • Maximales Kontextfenster: 202,752

🖥️ GLM-4.7-Flash ausführen

Je nach Anwendungsfall müssen Sie unterschiedliche Einstellungen verwenden. Einige GGUFs landen in ähnlicher Größe, weil die Modellarchitektur (wie gpt-oss) Dimensionen hat, die nicht durch 128 teilbar sind, sodass Teile nicht auf niedrigere Bits quantisiert werden können.

Da diese Anleitung 4-Bit verwendet, benötigst du etwa 18 GB RAM/Unified Memory. Für die beste Leistung empfehlen wir, mindestens 4-Bit-Präzision zu verwenden.

🦥 Unsloth Studio-Anleitung

GLM-4.7-Flash kann ausgeführt und feinabgestimmt werden in Unsloth Studiounserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

Führen Sie dies in Ihrem Terminal aus:

macOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffnen Sie http://localhost:8888 in Ihrem Browser.

3

GLM-4.7-Flash suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Sie sehen dann einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Sie können ihn jederzeit überspringen.

Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach GLM-4.7-Flash in die Suchleiste eingeben und das gewünschte Modell und die gewünschte Quantisierung herunterladen.

4

GLM-4.7-Flash ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

Llama.cpp-Tutorial (GGUF):

Anweisungen für die Ausführung in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):

1

Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Du kannst direkt von Hugging Face ziehen. Du kannst den Kontext auf 200K erhöhen, sofern dein RAM/VRAM es zulässt.

Du kannst auch Z.ais empfohlene GLM-4.7-Sampling-Parameter ausprobieren:

  • Für den allgemeinen Anwendungsfall: --temp 1.0 --top-p 0.95

  • Für Tool-Calling: --temp 0.7 --top-p 1.0

  • Denk daran, die Wiederholungsstrafe zu deaktivieren!

Befolge dies für allgemeine Anweisungen Anwendungsfälle:

Befolge dies für Tool-Aufrufe Anwendungsfälle:

3

Laden Sie das Modell über herunter (nach der Installation von pip install huggingface_hub). Sie können UD-Q4_K_XL oder andere quantisierte Versionen. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Konversationsmodus aus:

Passen Sie außerdem das Kontextfenster je nach Bedarf, bis zu 202752

Wiederholungen und Schleifen reduzieren

Das bedeutet, dass du jetzt Z.ais empfohlene Parameter verwenden und großartige Ergebnisse erzielen kannst:

  • Für den allgemeinen Anwendungsfall: --temp 1.0 --top-p 0.95

  • Für Tool-Calling: --temp 0.7 --top-p 1.0

  • Wenn du llama.cpp verwendest, setze --min-p 0.01 da der Standardwert von llama.cpp 0.05 ist

  • Denk daran, die Wiederholungsstrafe zu deaktivieren! Oder setze --repeat-penalty 1.0

Wir haben "scoring_func": "sigmoid" zu config.json für das Hauptmodell - siehe.

🐦Flappy-Bird-Beispiel mit UD-Q4_K_XL

Als Beispiel haben wir den folgenden langen Dialog mithilfe von UD-Q4_K_XL über ./llama.cpp/llama-cli --model unsloth/GLM-4.7-Flash-GGUF/GLM-4.7-Flash-UD-Q4_K_XL.gguf --fit on --temp 1.0 --top-p 0.95 --min-p 0.01 :

wodurch das folgende Flappy-Bird-Spiel in HTML-Form gerendert wurde:

Flappy-Bird-Spiel in HTML (erweiterbar)

Und wir haben einige Screenshots gemacht (4-Bit funktioniert):

🦥 Feinabstimmung von GLM-4.7-Flash

Unsloth unterstützt jetzt die Feinabstimmung von GLM-4.7-Flash, allerdings musst du transformers v5. Das 30B-Modell passt nicht auf eine kostenlose Colab-GPU; du kannst jedoch unser Notebook verwenden. Die 16-Bit-LoRA-Feinabstimmung von GLM-4.7-Flash benötigt etwa 60 GB VRAM:

Beim Feinabstimmen von MoEs ist es wahrscheinlich keine gute Idee, die Router-Schicht mitzutrainieren, daher haben wir sie standardmäßig deaktiviert. Wenn du seine Reasoning-Fähigkeiten erhalten möchtest (optional), kannst du eine Mischung aus direkten Antworten und Chain-of-Thought-Beispielen verwenden. Verwende mindestens 75 % Reasoning und 25 % Nicht-Reasoning in Ihrem Datensatz, damit das Modell seine Reasoning-Fähigkeiten beibehält.

🦙 Llama-Server-Bereitstellung & Deployment

Um GLM-4.7-Flash produktiv bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. via tmux, stelle das Modell bereit mit:

Dann in einem neuen Terminal, nach dem Ausführen von pip install openai, führe aus:

Was Folgendes ausgibt

💻 GLM-4.7-Flash in vLLM

Du kannst jetzt unsere neue dynamische FP8-Quantisierung des Modells für Premium- und schnelle Inferenz verwenden. Installiere zuerst die Nightly-Version von vLLM:

Dann bereitstellen die dynamische FP8-Version von Unsloth des Modells. Wir haben FP8 aktiviert, um die KV-Cache-Speichernutzung um 50 % zu reduzieren, und zwar auf 4 GPUs. Wenn du 1 GPU hast, verwende CUDA_VISIBLE_DEVICES='0' und setze --tensor-parallel-size 1 oder entfernen Sie dieses Argument. Um FP8 zu deaktivieren, entfernen Sie --quantization fp8 --kv-cache-dtype fp8

Sie können das bereitgestellte Modell dann über die OpenAI-API aufrufen:

vLLM GLM-4.7-Flash spekulative Dekodierung

Wir haben festgestellt, dass die Verwendung des MTP-(Multi-Token-Prediction)-Moduls von GLM 4.7 Flash den Generierungsdurchsatz von 13.000 Tokens auf 1 B200 auf 1.300 Tokens senkt! (10x langsamer) Auf Hopper sollte es hoffentlich in Ordnung sein.

Nur 1.300 Tokens/s Durchsatz auf 1xB200 (130 Tokens/s Decoding pro Benutzer)

Und 13.000 Tokens/s Durchsatz auf 1xB200 (immer noch 130 Tokens/s Decoding pro Benutzer)

🔨Tool-Aufrufe mit GLM-4.7-Flash

Siehe Tool Calling Guide für weitere Details dazu, wie Tool-Calling funktioniert. In einem neuen Terminal (wenn du tmux verwendest, nutze CTRL+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:

Dann verwenden wir die folgenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:

Nachdem GLM-4.7-Flash über llama-server wie in GLM-4.7-Flash oder siehe Tool Calling Guide für weitere Details können wir dann einige Tool-Aufrufe durchführen:

Tool-Aufruf für mathematische Operationen für GLM 4.7

Tool-Aufruf zur Ausführung von generiertem Python-Code für GLM-4.7-Flash

Benchmarks

GLM-4.7-Flash ist das leistungsstärkste 30B-Modell über alle Benchmarks hinweg, mit Ausnahme von AIME 25.

Benchmark
GLM-4.7-Flash
Qwen3-30B-A3B-Thinking-2507
GPT-OSS-20B

AIME 25

91.6

85.0

91.7

GPQA

75.2

73.4

71.5

LCB v6

64.0

66.0

61.0

HLE

14.4

9.8

10.9

SWE-bench Verified

59.2

22.0

34.0

τ²-Bench

79.5

49.0

47.7

BrowseComp

42.8

2.29

28.3

Zuletzt aktualisiert

War das hilfreich?