GLM-4.7-Flash: Wie man lokal ausführt
Führe GLM-4.7-Flash lokal auf deinem Gerät aus und feinabstimme es!
GLM-4.7-Flash ist Z.ais neues 30B-MoE-Reasoning-Modell für den lokalen Einsatz, das erstklassige Leistung für Coding, agentische Workflows und Chat bietet. Es verwendet ~3,6 Mrd. Parameter, unterstützt 200K Kontext und führt bei SWE-Bench, GPQA sowie Reasoning-/Chat-Benchmarks.
GLM-4.7-Flash läuft auf 24 GB RAM/VRAM/Unified Memory (32 GB für volle Präzision), und du kannst jetzt mit Unsloth feinabstimmen. Um GLM 4.7 Flash mit vLLM auszuführen, siehe GLM-4.7-Flash in vLLM
Update vom 21. Jan.: llama.cpp einen Fehler behoben, bei dem die falsche scoring_func: "softmax" (sollte "sigmoid"sein). Dies verursachte Schleifen und schlechte Ausgaben. Wir haben die GGUFs aktualisiert – bitte lade das Modell erneut herunter, um deutlich bessere Ausgaben zu erhalten.
Du kannst jetzt Z.ais empfohlene Parameter verwenden und großartige Ergebnisse erzielen:
Für den allgemeinen Anwendungsfall:
--temp 1.0 --top-p 0.95Für Tool-Calling:
--temp 0.7 --top-p 1.0Wiederholungsstrafe: Deaktiviere sie oder setze
--repeat-penalty 1.0
22. Jan.: Schnellere Inferenz ist da, da der FA-Fix für CUDA jetzt zusammengeführt wurde.
GLM-4.7-Flash GGUF zum Ausführen: unsloth/GLM-4.7-Flash-GGUF
⚙️ Nutzungsanleitung
Für die beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher (VRAM + Systemspeicher) größer ist als die Größe der quantisierten Modelldatei, die du herunterlädst. Falls nicht, kann llama.cpp weiterhin per SSD/HDD-Offloading laufen, aber die Inferenz wird langsamer.
Nach Rücksprache mit dem Z.ai-Team empfehlen sie, ihre GLM-4.7-Sampling-Parameter zu verwenden:
temperature = 1.0
temperature = 0.7
top_p = 0.95
top_p = 1.0
Wiederholungsstrafe = deaktiviert oder 1.0
Wiederholungsstrafe = deaktiviert oder 1.0
Für den allgemeinen Anwendungsfall:
--temp 1.0 --top-p 0.95Für Tool-Calling:
--temp 0.7 --top-p 1.0Wenn du llama.cpp verwendest, setze
--min-p 0.01da der Standardwert von llama.cpp 0.05 istManchmal musst du ausprobieren, welche Zahlen für deinen Anwendungsfall am besten funktionieren.
Vorerst empfehlen wir nicht empfehlen wir nicht diese GGUF mit Ollama wegen möglicher Probleme mit der Kompatibilität des Chat-Templates. Die GGUF funktioniert gut mit llama.cpp (oder Backends wie z. B. LM Studio, Jan).
Denk daran, die Wiederholungsstrafe zu deaktivieren! Oder setze --repeat-penalty 1.0
Maximales Kontextfenster:
202,752
🖥️ GLM-4.7-Flash ausführen
Je nach Anwendungsfall müssen Sie unterschiedliche Einstellungen verwenden. Einige GGUFs landen in ähnlicher Größe, weil die Modellarchitektur (wie gpt-oss) Dimensionen hat, die nicht durch 128 teilbar sind, sodass Teile nicht auf niedrigere Bits quantisiert werden können.
Da diese Anleitung 4-Bit verwendet, benötigst du etwa 18 GB RAM/Unified Memory. Für die beste Leistung empfehlen wir, mindestens 4-Bit-Präzision zu verwenden.
Vorerst empfehlen wir nicht empfehlen wir nicht diese GGUF mit Ollama wegen möglicher Probleme mit der Kompatibilität des Chat-Templates. Die GGUF funktioniert gut mit llama.cpp (oder Backends wie z. B. LM Studio, Jan).
Denk daran, die Wiederholungsstrafe zu deaktivieren! Oder setze --repeat-penalty 1.0
🦥 Unsloth Studio-Anleitung
GLM-4.7-Flash kann ausgeführt und feinabgestimmt werden in Unsloth Studiounserer neuen Open-Source-Web-UI für lokale KI ausgeführt und feinabgestimmt werden. Mit Unsloth Studio können Sie Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Code-Ausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-P usw.)
Schnelle CPU- + GPU-Inferenz über llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Führen Sie dies in Ihrem Terminal aus:
macOS, Linux, WSL:
Windows PowerShell:
Die Installation wird schnell sein und dauert ca. 1–2 Minuten.
Unsloth starten
MacOS, Linux, WSL und Windows:
Dann öffnen Sie http://localhost:8888 in Ihrem Browser.
GLM-4.7-Flash suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Sie sehen dann einen kurzen Einrichtungsassistenten, um ein Modell, einen Datensatz und grundlegende Einstellungen auszuwählen. Sie können ihn jederzeit überspringen.
Gehen Sie dann zur Unsloth Chat Registerkarte und suche nach GLM-4.7-Flash in die Suchleiste eingeben und das gewünschte Modell und die gewünschte Quantisierung herunterladen.

GLM-4.7-Flash ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Weitere Informationen finden Sie in unserer Unsloth-Studio-Inferenzanleitung.

Llama.cpp-Tutorial (GGUF):
Anweisungen für die Ausführung in llama.cpp (beachten Sie, dass wir 4-Bit verwenden, damit es auf die meisten Geräte passt):
Holen Sie sich die neueste llama.cpp auf GitHub hier. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Du kannst direkt von Hugging Face ziehen. Du kannst den Kontext auf 200K erhöhen, sofern dein RAM/VRAM es zulässt.
Du kannst auch Z.ais empfohlene GLM-4.7-Sampling-Parameter ausprobieren:
Für den allgemeinen Anwendungsfall:
--temp 1.0 --top-p 0.95Für Tool-Calling:
--temp 0.7 --top-p 1.0Denk daran, die Wiederholungsstrafe zu deaktivieren!
Befolge dies für allgemeine Anweisungen Anwendungsfälle:
Befolge dies für Tool-Aufrufe Anwendungsfälle:
Laden Sie das Modell über herunter (nach der Installation von pip install huggingface_hub). Sie können UD-Q4_K_XL oder andere quantisierte Versionen. Wenn Downloads hängen bleiben, siehe Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Konversationsmodus aus:
Passen Sie außerdem das Kontextfenster je nach Bedarf, bis zu 202752
➿Wiederholungen und Schleifen reduzieren
UPDATE AM 21. JAN.: llama.cpp hat einen Fehler behoben, bei dem die falsche "scoring_func": "softmax" verwendet wurde, was zu Schleifen und schlechten Ausgaben führte (sollte sigmoid sein). Wir haben die GGUFs aktualisiert. Bitte lade das Modell erneut herunter, um deutlich bessere Ausgaben zu erhalten.
Das bedeutet, dass du jetzt Z.ais empfohlene Parameter verwenden und großartige Ergebnisse erzielen kannst:
Für den allgemeinen Anwendungsfall:
--temp 1.0 --top-p 0.95Für Tool-Calling:
--temp 0.7 --top-p 1.0Wenn du llama.cpp verwendest, setze
--min-p 0.01da der Standardwert von llama.cpp 0.05 istDenk daran, die Wiederholungsstrafe zu deaktivieren! Oder setze
--repeat-penalty 1.0
Wir haben "scoring_func": "sigmoid" zu config.json für das Hauptmodell - siehe.
Vorerst empfehlen wir nicht empfehlen wir nicht diese GGUF mit Ollama wegen möglicher Probleme mit der Kompatibilität des Chat-Templates. Die GGUF funktioniert gut mit llama.cpp (oder Backends wie z. B. LM Studio, Jan).
🐦Flappy-Bird-Beispiel mit UD-Q4_K_XL
Als Beispiel haben wir den folgenden langen Dialog mithilfe von UD-Q4_K_XL über ./llama.cpp/llama-cli --model unsloth/GLM-4.7-Flash-GGUF/GLM-4.7-Flash-UD-Q4_K_XL.gguf --fit on --temp 1.0 --top-p 0.95 --min-p 0.01 :
wodurch das folgende Flappy-Bird-Spiel in HTML-Form gerendert wurde:
Und wir haben einige Screenshots gemacht (4-Bit funktioniert):


🦥 Feinabstimmung von GLM-4.7-Flash
Unsloth unterstützt jetzt die Feinabstimmung von GLM-4.7-Flash, allerdings musst du transformers v5. Das 30B-Modell passt nicht auf eine kostenlose Colab-GPU; du kannst jedoch unser Notebook verwenden. Die 16-Bit-LoRA-Feinabstimmung von GLM-4.7-Flash benötigt etwa 60 GB VRAM:
Bei der Verwendung einer A100 mit 40 GB VRAM kann es manchmal zu einem Speichermangel kommen. Für reibungslosere Läufe benötigst du H100/A100 mit 80 GB VRAM.
Beim Feinabstimmen von MoEs ist es wahrscheinlich keine gute Idee, die Router-Schicht mitzutrainieren, daher haben wir sie standardmäßig deaktiviert. Wenn du seine Reasoning-Fähigkeiten erhalten möchtest (optional), kannst du eine Mischung aus direkten Antworten und Chain-of-Thought-Beispielen verwenden. Verwende mindestens 75 % Reasoning und 25 % Nicht-Reasoning in Ihrem Datensatz, damit das Modell seine Reasoning-Fähigkeiten beibehält.
🦙 Llama-Server-Bereitstellung & Deployment
Um GLM-4.7-Flash produktiv bereitzustellen, verwenden wir llama-server In einem neuen Terminal, z. B. via tmux, stelle das Modell bereit mit:
Dann in einem neuen Terminal, nach dem Ausführen von pip install openai, führe aus:
Was Folgendes ausgibt
💻 GLM-4.7-Flash in vLLM
Du kannst jetzt unsere neue dynamische FP8-Quantisierung des Modells für Premium- und schnelle Inferenz verwenden. Installiere zuerst die Nightly-Version von vLLM:
Dann bereitstellen die dynamische FP8-Version von Unsloth des Modells. Wir haben FP8 aktiviert, um die KV-Cache-Speichernutzung um 50 % zu reduzieren, und zwar auf 4 GPUs. Wenn du 1 GPU hast, verwende CUDA_VISIBLE_DEVICES='0' und setze --tensor-parallel-size 1 oder entfernen Sie dieses Argument. Um FP8 zu deaktivieren, entfernen Sie --quantization fp8 --kv-cache-dtype fp8
Sie können das bereitgestellte Modell dann über die OpenAI-API aufrufen:
⭐ vLLM GLM-4.7-Flash spekulative Dekodierung
Wir haben festgestellt, dass die Verwendung des MTP-(Multi-Token-Prediction)-Moduls von GLM 4.7 Flash den Generierungsdurchsatz von 13.000 Tokens auf 1 B200 auf 1.300 Tokens senkt! (10x langsamer) Auf Hopper sollte es hoffentlich in Ordnung sein.
Nur 1.300 Tokens/s Durchsatz auf 1xB200 (130 Tokens/s Decoding pro Benutzer)

Und 13.000 Tokens/s Durchsatz auf 1xB200 (immer noch 130 Tokens/s Decoding pro Benutzer)

🔨Tool-Aufrufe mit GLM-4.7-Flash
Siehe Tool Calling Guide für weitere Details dazu, wie Tool-Calling funktioniert. In einem neuen Terminal (wenn du tmux verwendest, nutze CTRL+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:
Dann verwenden wir die folgenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:
Nachdem GLM-4.7-Flash über llama-server wie in GLM-4.7-Flash oder siehe Tool Calling Guide für weitere Details können wir dann einige Tool-Aufrufe durchführen:
Tool-Aufruf für mathematische Operationen für GLM 4.7

Tool-Aufruf zur Ausführung von generiertem Python-Code für GLM-4.7-Flash

Benchmarks
GLM-4.7-Flash ist das leistungsstärkste 30B-Modell über alle Benchmarks hinweg, mit Ausnahme von AIME 25.

AIME 25
91.6
85.0
91.7
GPQA
75.2
73.4
71.5
LCB v6
64.0
66.0
61.0
HLE
14.4
9.8
10.9
SWE-bench Verified
59.2
22.0
34.0
τ²-Bench
79.5
49.0
47.7
BrowseComp
42.8
2.29
28.3
Zuletzt aktualisiert
War das hilfreich?

