For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8-Flash-Next: Wie man lokal ausführt

Leitfaden zum lokalen Ausführen von Qwen3.8-Flash-Next.

Qwen3.8-Flash-Next ist ein neues Open-Weight-Modell, 125B-Parameter multimodales MoE-Modell von Qwen. Auf der neuen Qwen4-Architektur aufgebaut, unterstützt es ein Kontextfenster von 262K und fortgeschrittenes Schlussfolgern. Qwen3.8-Flash-Next übertrifft Claude-4.6-Opus (Max) und kann lokal auf Geräten mit 75 GB RAM/Unified Memory ohne erforderlichen GPU-VRAM ausgeführt werden. Um das Modell auszuführen, verwenden Sie unsere GGUFs über llama.cpp oder Unsloth Desktop. Vielen Dank an Qwen für den Zugriff ab Tag 0.

1-Bit sind 75 GB und verwendet 4-Bit für den Ngram / PLE. Das ist 79 % kleiner als BF16 (355 GB) und behält eine Top-1%-Genauigkeit von 80 %.

Qwen3.8-Flash ausführenUnsloth herunterladen

4-Bit Qwen3.8-Flash, ausgeführt in Unsloth

⚙️ Nutzungsanleitung

Egal, ob Sie Qwen3.8-Flash-Next auf einer CPU mit Systemspeicher oder auf einer GPU mit VRAM ausführen, macht relativ wenig Unterschied. Seine einzigartige Architektur ermöglicht Inferenz mit RAM oder Unified Memory und erreicht eine Leistung, die näher an GPU-VRAM liegt als bei anderen Modellen üblich ist. Dadurch eignet es sich besonders gut für Macs, NVIDIA-DGX-Spark-Systeme und andere Geräte mit großen Speicherkapazitäten.

Sie benötigen mindestens 75 GB RAM oder Unified Memory um das Modell auszuführen. Seine kleinste 1-Bit-quantisierte Version ist größer als üblich, da es neue Ngram-Schichten bzw. pro Schicht Embeddings gibt, die wie eine Nachschlagetabelle funktionieren. Das bedeutet jedoch auch, dass die Quantisierung weniger aggressiv ist, sodass das Modell mehr von seiner ursprünglichen Genauigkeit behält als stärker quantisierte Modelle. Sie können die PLE-/Ngram-Schicht auch auf die SSD auslagern und mmap verwenden, wodurch weniger CPU- und GPU-VRAM genutzt wird.

Anforderungen für Qwen3.8-Flash-Next:

Die kleinste Quantisierung funktioniert mit 75 GB RAM, daher ist ein Gerät mit 96 GB RAM/Unified Memory am besten. Tabelle: Hardwareanforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

1-Bit
2-Bit
3-Bit
4-Bit
5-Bit
8-Bit
BF16

75 GB

79 GB

90 GB

96-114 GB

163 GB

200 GB

355 GB

Wenn Sie MTP für schnellere Inferenz verwenden möchten, sollten Sie 1–2 GB zusätzlichen Spielraum einplanen.

Empfohlene Einstellungen

Qwen3.8-Flash-Next ist ein hybrider Denk- Modell mit unterschiedlichen Standardeinstellungen für Denk- und Nicht-Denk-Modi. Extra High ist standardmäßig aktiviert. Wenn Sie also kürzere Denkspuren möchten, können Sie den Denkaufwand anpassen:

Parameter
Denkmodus
Instruct- (Nicht-Denk-) Modus

Temperatur

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • Kontextlänge = bis zu 262,144

  • Denkmodus: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Instruct- (oder Nicht-Denk-) Modus: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

💡 Denken + Denken beibehalten

Qwen3.8-Flash-Next hat Denken beibehalten wodurch die Denkspur aus dem vorherigen Gespräch erhalten bleibt. Das erhöht die Anzahl der verwendeten Tokens, kann aber die Genauigkeit in fortgesetzten Gesprächen verbessern. Unsloth hat Schalter für 'Think' und beibehaltenes Denken für Qwen3.8 (siehe rechts):

Qwen3.8-Flash-Next wird mit Unterstützung für reasoning_effortgeliefert, mit dem sich die Tiefe des Schlussfolgerns anpassen und die Kosten steuern lassen. Diese Schalter werden in Unsloth automatisch aktiviert:

  • xhigh (Standard): für komplexe Aufgaben, die gründliche Analyse erfordern

  • mittel: Ausgleich zwischen Genauigkeit und Geschwindigkeit

  • niedrig: effizientes Schlussfolgern, optimiert auf Geschwindigkeit und Kosten

  • none

Quantisierungsanalyse

Wir haben KLD für Qwen3.8-Flash-Quants ausgeführt und zeigen, dass eine Wiederherstellung der Top-1%-Genauigkeit von 80 % mit 79 % weniger Festplattenspeicher möglich ist. Die neue Architektur verwendet PLE / Ngrams, und diese werden nicht so stark quantisiert (mindestens 4-Bit), da sie ein Zufriffsmuster mit zufälligem Zugriff haben, und eine starke Quantisierung würde dem Modell schaden.

Quant
GB
Top-1 %
mittlere KLD
99,9 % KLD

UD-IQ1_S

72.5

77.325

0.396070

7.2126

UD-IQ1_M

74.5

79.691

0.314739

6.1965

UD-Q2_K_XL

78.9

82.715

0.224607

4.9121

UD-IQ3_XXS

82.0

85.414

0.165120

4.0375

UD-Q3_K_XL

90.0

88.315

0.106504

3.0538

UD-IQ4_XS

93.7

89.554

0.083630

2.3677

UD-Q4_K_XL

111.3

92.255

0.046893

1.5468

UD-Q5_K_XL

158.3

93.680

0.030415

1.0036

UD-Q6_K_XL

169.2

94.089

0.027091

0.8416

Q8_0

188.2

94.122

0.026574

0.8118

Anleitung zum Ausführen von Qwen3.8-Flash-Next

Sie können Qwen3.8-Flash-Next jetzt in Unsloth Desktop und llama.cpp ausführen. Sie können den Quantisierungstyp frei ändern.

In Unsloth Desktop ausführenIn llama.cpp ausführenMTP-Anleitung

🦥 Qwen3.8-Flash-Next in Unsloth ausführen

Qwen3.8-Flash-Next kann jetzt ausgeführt werden in Unsloth Desktop, einer Open-Source-UI-App für lokale KI. Unsloth lagert automatisch in den RAM aus und erkennt Multi-GPU-Setups. Mit Unsloth Desktop können Sie Modelle lokal ausführen auf MacOS, Windows, Linux und:

1

Unsloth installieren

Am einfachsten starten Sie, indem Sie die Unsloth Desktop-Appherunterladen. Funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

Oder, wenn Sie lieber manuell installieren möchten:

MacOS, Linux, WSL:

Windows PowerShell:

2

Qwen3.8-Flash-Next suchen und herunterladen

Gehen Sie zu Unsloth Chat oder zum Model Hub und suchen Sie in der Suchleiste nach Qwen3.8-Flash und laden Sie das gewünschte Modell und die gewünschte Quantisierung herunter.

3

Qwen3.8-Flash-Next ausführen

MTP ist automatisch aktiviert, aber Sie können es deaktivieren. Die Inferenzparameter sollten bei Verwendung von Unsloth automatisch gesetzt werden, Sie können sie jedoch weiterhin manuell ändern. Sie können auch die Kontextlänge, das Chat-Template und andere Einstellungen bearbeiten.

Für weitere Informationen können Sie unsere Unsloth-Inferenzanleitung.

Zum Beispiel ermöglicht Ihnen die Verwendung von Unsloth Desktop mit dem 397 GB großen Qwen3.8 (-91 % kleiner) das Umschalten von Denkmodi, Inline-Canvas, Websuche und Codeausführung und vieles mehr.

4

Qwen3.8-Flash-Next über die Unsloth-API bereitstellen

Sie können unsloth run Befehl verwenden und Qwen3.8 über eine API bereitstellen mit llama-server Laufzeit-Flags, einschließlich Kontextgröße, GPU-Layer, Threading, Sampling, Netzwerk und Werkzeugkonfiguration. Weitere Informationen finden Sie in unseren API-Dokumentation oder unsloth start.

5

Unsloth ist jetzt bereit

Sie können mit Qwen3.8-Flash-Next über Unsloth Desktop auch viele andere Dinge tun, wie:

🦙 Qwen3.8-Flash-Next in llama.cpp ausführen

1

Installieren Sie die neueste Version von llama.cpp. Sie können auch den Build-Anweisungen unten folgen. Ändern Sie -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur CPU-Inferenz möchten. Für Apple-Mac- / Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Um das Modell auszuführen, können Sie Folgendes tun:

3

Dann zum Ausführen:

MTP-Anleitung

Qwen3.8-Flash kann mit 1,3 bis 1,7x schnellerer Inferenz über MTP (Multi-Token Prediction) ohne Genauigkeitsverlust ausgeführt werden! MTP ermöglicht es Qwen3.8-Flash, 170 Token/s auf 1x RTX 6000 PRO GPU zu erreichen, verglichen mit der 100-Token-Basislinie. MTP beschleunigt die Inferenz, indem ein Modell mehrere kommende Tokens auf einmal vorhersagt, anstatt pro Schritt nur einen Token zu erzeugen, und ist besonders auf GPUs wirksam.

Um Qwen3.8-Flash mit MTP auszuführen, ist MTP in Unsloth Desktop standardmäßig aktiviert oder Sie können unseren benutzerdefinierten llama.cpp-PR verwenden.

Die Gewinne sind auf Geräten mit geringerer Speicherbandbreite, wie älteren Macs, kleiner. Wir haben sowohl gemeinsame MTP-Module erstellt (schließt die embed_tokens aus und teilt sie mit dem Hauptmodell), um Speicherplatz sowie RAM- und VRAM-Nutzung um etwa 1 bis 2 GB zu sparen.

MTP-Typ
Allgemeines MTP
Geteiltes MTP
Einsparungen

BF16

7,77 GB

5,23 GB

2,54 GB

Q8_0

4,14 GB

2,79 GB

1,35 GB

Q4_K_M

2,79 GB

1,91 GB

880 MB

Die 3-Bit-MTP-Quantisierung funktioniert mit 91 GB RAM, daher ist ein Gerät mit 96 GB RAM/Unified Memory am besten. Tabelle: MTP-Hardwareanforderungen (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

1-Bit
2-Bit
3-Bit
4-Bit
5-Bit
8-Bit
BF16

76 GB

80 GB

91 GB

97-115 GB

164 GB

200 GB

355 GB

MTP Qwen3.8-Flash ausführen

Um Qwen3.8-Flash mit MTP auszuführen, müssen Sie nur Unsloth Desktop installieren oder auf die neueste Version von Unsloth aktualisieren und dann das Modell erneut herunterladen oder die MTP-Datei herunterladen. Weitere Anweisungen für llama.cpp finden Sie weiter unten.

Unsloth Desktop funktioniert auf macOS, Windows, und Linux.

Unsloth herunterladen

In Unsloth Desktop können Sie auch die Anzahl der Draft-Tokens ändern oder MTP anpassen. Verwenden Sie die erweiterten Einstellungen in der rechten Seitenleiste, aktivieren Sie "Erweiterte Einstellungen" und Sie können MTP-/Ngram-Speculative-Decoding, die Anzahl der Draft-Tokens und mehr auswählen:

MTP Llama.cpp-Anleitung

Dann um das geteilte MTP-Modul herunterzuladen:

Und um llama-server damit zu verwenden:

📊 Benchmarks

Für GGUF-Quantisierungs-Benchmarks können Sie oben unsere Quantisierungsanalyse oder Dynamic V3.0-Artikel.

Zuletzt aktualisiert

War das hilfreich?