Qwen3.8-Flash-Next: Wie man lokal ausführt
Leitfaden zum lokalen Ausführen von Qwen3.8-Flash-Next.
Qwen3.8-Flash-Next ist ein neues Open-Weight-Modell, 125B-Parameter multimodales MoE-Modell von Qwen. Auf der neuen Qwen4-Architektur aufgebaut, unterstützt es ein Kontextfenster von 262K und fortgeschrittenes Schlussfolgern. Qwen3.8-Flash-Next übertrifft Claude-4.6-Opus (Max) und kann lokal auf Geräten mit 75 GB RAM/Unified Memory ohne erforderlichen GPU-VRAM ausgeführt werden. Um das Modell auszuführen, verwenden Sie unsere GGUFs über llama.cpp oder Unsloth Desktop. Vielen Dank an Qwen für den Zugriff ab Tag 0.
1-Bit sind 75 GB und verwendet 4-Bit für den Ngram / PLE. Das ist 79 % kleiner als BF16 (355 GB) und behält eine Top-1%-Genauigkeit von 80 %.
MTP ist da! Führen Sie Qwen3.8-Flash 1,3- bis 1,7-mal schneller aus in Unsloth Desktop!

⚙️ Nutzungsanleitung
Egal, ob Sie Qwen3.8-Flash-Next auf einer CPU mit Systemspeicher oder auf einer GPU mit VRAM ausführen, macht relativ wenig Unterschied. Seine einzigartige Architektur ermöglicht Inferenz mit RAM oder Unified Memory und erreicht eine Leistung, die näher an GPU-VRAM liegt als bei anderen Modellen üblich ist. Dadurch eignet es sich besonders gut für Macs, NVIDIA-DGX-Spark-Systeme und andere Geräte mit großen Speicherkapazitäten.
Sie benötigen mindestens 75 GB RAM oder Unified Memory um das Modell auszuführen. Seine kleinste 1-Bit-quantisierte Version ist größer als üblich, da es neue Ngram-Schichten bzw. pro Schicht Embeddings gibt, die wie eine Nachschlagetabelle funktionieren. Das bedeutet jedoch auch, dass die Quantisierung weniger aggressiv ist, sodass das Modell mehr von seiner ursprünglichen Genauigkeit behält als stärker quantisierte Modelle. Sie können die PLE-/Ngram-Schicht auch auf die SSD auslagern und mmap verwenden, wodurch weniger CPU- und GPU-VRAM genutzt wird.
Anforderungen für Qwen3.8-Flash-Next:
Die kleinste Quantisierung funktioniert mit 75 GB RAM, daher ist ein Gerät mit 96 GB RAM/Unified Memory am besten. Tabelle: Hardwareanforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)
75 GB
79 GB
90 GB
96-114 GB
163 GB
200 GB
355 GB
Empfohlene Einstellungen
Qwen3.8-Flash-Next ist ein hybrider Denk- Modell mit unterschiedlichen Standardeinstellungen für Denk- und Nicht-Denk-Modi. Extra High ist standardmäßig aktiviert. Wenn Sie also kürzere Denkspuren möchten, können Sie den Denkaufwand anpassen:
Temperatur
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
Kontextlänge = bis zu
262,144Denkmodus:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Instruct- (oder Nicht-Denk-) Modus:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
💡 Denken + Denken beibehalten
Qwen3.8-Flash-Next hat Denken beibehalten wodurch die Denkspur aus dem vorherigen Gespräch erhalten bleibt. Das erhöht die Anzahl der verwendeten Tokens, kann aber die Genauigkeit in fortgesetzten Gesprächen verbessern. Unsloth hat Schalter für 'Think' und beibehaltenes Denken für Qwen3.8 (siehe rechts):

Qwen3.8-Flash-Next wird mit Unterstützung für reasoning_effortgeliefert, mit dem sich die Tiefe des Schlussfolgerns anpassen und die Kosten steuern lassen. Diese Schalter werden in Unsloth automatisch aktiviert:
xhigh(Standard): für komplexe Aufgaben, die gründliche Analyse erfordernmittel: Ausgleich zwischen Genauigkeit und Geschwindigkeitniedrig: effizientes Schlussfolgern, optimiert auf Geschwindigkeit und Kostennone
Um Denk-/Schlussfolgerungs- Aufwand in unsloth run oder llama-serverzu ändern, verwenden Sie --chat-template-kwargs '{"reasoning_effort":"medium"}'
Wenn Sie unter Windows Powershell sind, verwenden Sie: --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
Ändern Sie mittel auf das gewünschte Schlussfolgerungsniveau.
Quantisierungsanalyse
Wir haben KLD für Qwen3.8-Flash-Quants ausgeführt und zeigen, dass eine Wiederherstellung der Top-1%-Genauigkeit von 80 % mit 79 % weniger Festplattenspeicher möglich ist. Die neue Architektur verwendet PLE / Ngrams, und diese werden nicht so stark quantisiert (mindestens 4-Bit), da sie ein Zufriffsmuster mit zufälligem Zugriff haben, und eine starke Quantisierung würde dem Modell schaden.


UD-IQ1_S
72.5
77.325
0.396070
7.2126
UD-IQ1_M
74.5
79.691
0.314739
6.1965
UD-Q2_K_XL
78.9
82.715
0.224607
4.9121
UD-IQ3_XXS
82.0
85.414
0.165120
4.0375
UD-Q3_K_XL
90.0
88.315
0.106504
3.0538
UD-IQ4_XS
93.7
89.554
0.083630
2.3677
UD-Q4_K_XL
111.3
92.255
0.046893
1.5468
UD-Q5_K_XL
158.3
93.680
0.030415
1.0036
UD-Q6_K_XL
169.2
94.089
0.027091
0.8416
Q8_0
188.2
94.122
0.026574
0.8118
Anleitung zum Ausführen von Qwen3.8-Flash-Next
Sie können Qwen3.8-Flash-Next jetzt in Unsloth Desktop und llama.cpp ausführen. Sie können den Quantisierungstyp frei ändern.
Hugging Face: Qwen3.8-Flash-Next-GGUF
ModelScope: Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Next kann jetzt lokal ausgeführt werden in Unsloth Desktop!
🦥 Qwen3.8-Flash-Next in Unsloth ausführen
Qwen3.8-Flash-Next kann jetzt ausgeführt werden in Unsloth Desktop, einer Open-Source-UI-App für lokale KI. Unsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Desktop können Sie Modelle lokal ausführen auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen, MLX- und Safetensor-Modelle
Selbstheilende Tool-Aufrufe + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parameter-Tuning (Temp, Top-p usw.)
Schnelle CPU- + GPU-Inferenz über MLX und llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Unsloth installieren
Am einfachsten starten Sie, indem Sie die Unsloth Desktop-Appherunterladen. Funktioniert auf macOS, Windows, und Linux.
Oder, wenn Sie lieber manuell installieren möchten:
MacOS, Linux, WSL:
Windows PowerShell:
Qwen3.8-Flash-Next suchen und herunterladen
Gehen Sie zu Unsloth Chat oder zum Model Hub und suchen Sie in der Suchleiste nach Qwen3.8-Flash und laden Sie das gewünschte Modell und die gewünschte Quantisierung herunter.

Qwen3.8-Flash-Next ausführen
MTP ist automatisch aktiviert, aber Sie können es deaktivieren. Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.
Für weitere Informationen können Sie unsere Unsloth-Inferenzanleitung.
Zum Beispiel ermöglicht Ihnen die Verwendung von Unsloth Desktop mit dem 397 GB großen Qwen3.8 (-91 % kleiner) das Umschalten von Denkmodi, Inline-Canvas, Websuche und Codeausführung und vieles mehr.

Qwen3.8-Flash-Next über die Unsloth-API bereitstellen
Sie können unsloth run Befehl verwenden und Qwen3.8 über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layer, Threading, Sampling, Netzwerk und Werkzeugkonfiguration. Weitere Informationen finden Sie in unseren API-Dokumentation oder unsloth start.
Unsloth ist jetzt bereit
Sie können mit Qwen3.8-Flash-Next über Unsloth Desktop auch viele andere Dinge tun, wie:
Werkzeuge verbinden: , , , und mehr
Modelle trainieren: Text, Diffusion, Embeddingund mehr feinabstimmen
Medien generieren: Erstellen und trainieren , Video, lokal

🦙 Qwen3.8-Flash-Next in llama.cpp ausführen
Installieren Sie die neueste Version von llama.cpp. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac- / Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Um das Modell auszuführen, können Sie Folgendes tun:
Dann zum Ausführen:
MTP-Anleitung
Qwen3.8-Flash kann mit 1,3 bis 1,7x schnellerer Inferenz über MTP (Multi-Token Prediction) ohne Genauigkeitsverlust ausgeführt werden! MTP ermöglicht es Qwen3.8-Flash, 170 Token/s auf 1x RTX 6000 PRO GPU zu erreichen, verglichen mit der 100-Token-Basislinie. MTP beschleunigt die Inferenz, indem ein Modell mehrere kommende Tokens auf einmal vorhersagt, anstatt pro Schritt nur einen Token zu erzeugen, und ist besonders auf GPUs wirksam.
Um Qwen3.8-Flash mit MTP auszuführen, ist MTP in Unsloth Desktop standardmäßig aktiviert oder Sie können unseren benutzerdefinierten llama.cpp-PR verwenden.


Die Gewinne sind auf Geräten mit geringerer Speicherbandbreite, wie älteren Macs, kleiner. Wir haben sowohl gemeinsame MTP-Module erstellt (schließt die embed_tokens aus und teilt sie mit dem Hauptmodell), um Speicherplatz sowie RAM- und VRAM-Nutzung um etwa 1 bis 2 GB zu sparen.
BF16
7,77 GB
5,23 GB
2,54 GB
Q8_0
4,14 GB
2,79 GB
1,35 GB
Q4_K_M
2,79 GB
1,91 GB
880 MB
Die 3-Bit-MTP-Quantisierung funktioniert mit 91 GB RAM, daher ist ein Gerät mit 96 GB RAM/Unified Memory am besten. Tabelle: MTP-Hardwareanforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)
76 GB
80 GB
91 GB
97-115 GB
164 GB
200 GB
355 GB
MTP Qwen3.8-Flash ausführen
Um Qwen3.8-Flash mit MTP auszuführen, müssen Sie nur Unsloth Desktop installieren oder auf die neueste Version von Unsloth aktualisieren und dann das Modell erneut herunterladen oder die MTP-Datei herunterladen. Weitere Anweisungen für llama.cpp finden Sie weiter unten.
Unsloth Desktop funktioniert auf macOS, Windows, und Linux.
In Unsloth Desktop können Sie auch die Anzahl der Draft-Tokens ändern oder MTP anpassen. Verwenden Sie die erweiterten Einstellungen in der rechten Seitenleiste, aktivieren Sie "Erweiterte Einstellungen" und Sie können MTP-/Ngram-Speculative-Decoding, die Anzahl der Draft-Tokens und mehr auswählen:

MTP Llama.cpp-Anleitung
Dann um das geteilte MTP-Modul herunterzuladen:
Und um llama-server damit zu verwenden:
📊 Benchmarks
Für GGUF-Quantisierungs-Benchmarks können Sie oben unsere Quantisierungsanalyse oder Dynamic V3.0-Artikel.


Zuletzt aktualisiert
War das hilfreich?

