💜Qwen3.5 - Lokal ausführen
Führe die neuen Qwen3.5-LLMs lokal auf deinem lokalen Gerät aus, einschließlich Medium: Qwen3.5-35B-A3B, 27B, 122B-A10B und Small: Qwen3.5-0.8B, 2B, 4B, 9B und 397B-A17B!
Qwen3.5 ist Alibabas neue Modellfamilie, einschließlich Qwen3.5-35B-A3B, 27B, 122B-A10B und 397B-A17B und die neue Klein Serie: Qwen3.5-0.8B, 2B, 4B und 9B. Die multimodalen hybriden Reasoning-LLMs liefern für ihre Größe die stärksten Leistungen. Sie unterstützen 256K Kontext für 201 Sprachen und haben Thinking + Nicht-Denken und eignen sich hervorragend für agentisches Coding, Vision, Chat und Langkontext-Aufgaben. Die 35B- und 27B-Modelle laufen auf einem 22-GB-Mac-/RAM-Gerät. Siehe alle GGUFs hier.
Qwen3.5-Tutorials ausführenQwen3.5 feinabstimmen
Aktualisierung vom 17. März: Sie können Qwen3.5 jetzt in Unsloth Studio.
Aktualisierung vom 5. März: Qwen3.5- erneut herunterladen35B, 27B, 122B und 397B.
Alle GGUFs sind jetzt aktualisiert mit einem verbesserten Quantisierungs algorithmus.
Alle nutzen unsere neuen imatrix-Daten. Sehen Sie einige Verbesserungen in Chat-, Coding-, Langkontext- und Tool-Calling-Anwendungsfällen.
Tool-Calling verbessert nach unseren Chat-Template-Korrekturen. Der Fix ist universell und gilt für jede Qwen3.5-Format und jede Uploader.
Sehen Sie sich neue GGUF-Benchmarks an für Unsloth-Leistungsergebnisse + unsere MXFP4-Untersuchung.
Wir entfernen MXFP4-Layer aus 3 Qwen3.5-GGUFs: Q2_K_XL, Q3_K_XL und Q4_K_XL.
Alle Uploads verwenden Unsloth Dynamic 2.0 für erstklassige Quantisierungsleistung – daher werden bei 4-Bit wichtige Layer auf 8 oder 16 Bit hochgestuft. Vielen Dank an Qwen für den Day-Zero-Zugriff für Unsloth. Sie können auch feinabstimmen Qwen3.5 mit Unsloth.
Um Thinking zu aktivieren oder zu deaktivieren, siehe Qwen3.5.Qwen3.5 Small-Modelle sind standardmäßig deaktiviert.
⚙️ Nutzungsanleitung
Tabelle: Hardwareanforderungen für Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)
Für beste Leistung stelle sicher, dass dein insgesamt verfügbarer Speicher (VRAM + System-RAM) größer ist als die Größe der quantisierten Modelldatei, die du herunterlädst. Wenn nicht, kann llama.cpp immer noch über SSD/HDD-Offloading laufen, aber die Inferenz wird langsamer sein.
Zwischen 27B und 35B-A3B, verwenden Sie 27B, wenn Sie etwas genauere Ergebnisse möchten und es nicht auf Ihr Gerät passt. Entscheiden Sie sich für 35B-A3B, wenn Sie deutlich schnellere Inferenz möchten.
Empfohlene Einstellungen
Maximales Kontextfenster:
262,144(kann via YaRN auf 1M erweitert werden)presence_penalty = 0.0 bis 2.0standardmäßig ist dies deaktiviert, aber um Wiederholungen zu reduzieren, können Sie dies verwenden; allerdings kann ein höherer Wert zu einem leichten Leistungsabfall führenAngemessene Ausgabelänge:
32,768Tokens für die meisten Anfragen
Wenn Sie Kauderwelsch erhalten, ist Ihre Kontextlänge möglicherweise zu niedrig eingestellt. Oder versuchen Sie --cache-type-k bf16 --cache-type-v bf16 was helfen könnte.
Da Qwen3.5 hybrides Reasoning ist, haben der Thinking- und der Non-Thinking-Modus unterschiedliche Einstellungen:
Thinking-Modus:
temperature = 1.0
temperature = 0.6
top_p = 0.95
top_p = 0.95
top_k = 20
top_k = 20
min_p = 0.0
min_p = 0.0
presence_penalty = 1.5
presence_penalty = 0.0
repeat_penalty = deaktiviert oder 1.0
repeat_penalty = deaktiviert oder 1.0
Thinking-Modus für allgemeine Aufgaben:
Thinking-Modus für präzise Coding-Aufgaben:
Instruct-(Non-Thinking)-Moduseinstellungen:
temperature = 0.7
temperature = 1.0
top_p = 0.8
top_p = 0.95
top_k = 20
top_k = 20
min_p = 0.0
min_p = 0.0
presence_penalty = 1.5
presence_penalty = 1.5
repeat_penalty = deaktiviert oder 1.0
repeat_penalty = deaktiviert oder 1.0
Um Thinking/Reasoning zu deaktivieren, verwenden Sie --chat-template-kwargs '{"enable_thinking":false}'
Wenn Sie unter Windows PowerShell, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"
Verwenden Sie 'true' und 'false' austauschbar.
Bei Qwen3.5 0.8B, 2B, 4B und 9B ist Reasoning standardmäßig deaktiviert. Um es zu aktivieren, verwenden Sie: --chat-template-kwargs '{"enable_thinking":true}'
Instruct (Non-Thinking) für allgemeine Aufgaben:
Instruct (Non-Thinking) für Reasoning-Aufgaben:
Qwen3.5-Inferenz-Tutorials:
Da Qwen3.5 in vielen verschiedenen Größen erhältlich ist, verwenden wir Dynamic 4-Bit MXFP4_MOE GGUF-Varianten für alle Inferenz-Workloads. Klicken Sie unten, um zu den jeweiligen Modellanweisungen zu gelangen:
In Unsloth Studio ausführenQwen3.5-35B-A3B27B122B-A10B397B-A17BKlein (0.8B - 9B)
Unsloths dynamische GGUF-Uploads:
presence_penalty = 0.0 bis 2.0 standardmäßig ist dies deaktiviert, aber um Wiederholungen zu reduzieren, können Sie dies verwenden; allerdings kann ein höherer Wert zu leichter Leistungsabfall.
Derzeit funktioniert kein Qwen3.5-GGUF in Ollama aufgrund separater mmproj-Vision-Dateien. Verwenden Sie mit llama.cpp kompatible Backends.
🦥 Unsloth Studio-Leitfaden
Qwen3.5 kann ausgeführt und feinabgestimmt werden in Unsloth Studio, unserer neuen Open-Source-Web-UI für lokale KI, ausgeführt werden. Mit Unsloth Studio kannst du Modelle lokal auf MacOS, Windows, Linux und:
Suchen, herunterladen, GGUFs ausführen und Safetensor-Modelle
Selbstheilendes Tool-Calling + Websuche
Codeausführung (Python, Bash)
Automatische Inferenz Parametertuning (Temp, Top-P usw.)
Schnelle CPU- + GPU-Inferenz via llama.cpp
LLMs trainieren 2x schneller mit 70 % weniger VRAM

Qwen3.5 suchen und herunterladen
Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum Studio Chat Tab und suchen Sie in der Suchleiste nach Qwen3.5 und laden Sie Ihr gewünschtes Modell und die gewünschte Quantisierung herunter.

Qwen3.5 ausführen
Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.
Weitere Informationen findest du in unserem Unsloth-Studio-Inferenzleitfaden.

🦙 Llama.cpp-Leitfäden
Qwen3.5-35B-A3B
Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 24-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. Da das Modell bei voller F16-Präzision nur etwa 72 GB groß ist, müssen wir uns nicht allzu sehr um die Leistung sorgen. GGUF: Qwen3.5-35B-A3B-GGUF
Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.
Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.
Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.
Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:
Thinking-Modus:
Präzise Coding-Aufgaben (z. B. WebDev):
Allgemeine Aufgaben:
Non-Thinking-Modus:
Allgemeine Aufgaben:
Reasoning-Aufgaben:
Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Gesprächsmodus aus:
Qwen3.5 Small (0.8B • 2B • 4B • 9B)
Für Qwen3.5 0.8B, 2B, 4B und 9B, ist Reasoning deaktiviert standardmäßig. Um es zu aktivieren, verwenden Sie: --chat-template-kwargs '{"enable_thinking":true}'
Unter Windows verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":true}"
Für die Qwen3.5 Small-Serie müssen Sie, da sie so klein ist, in den Skripten lediglich den Modellnamen auf die gewünschte Variante ändern. Für diesen speziellen Leitfaden verwenden wir die 9B-Parameter-Variante. Um sie alle in nahezu voller Präzision auszuführen, benötigen Sie lediglich ein Gerät mit 12 GB RAM / VRAM / Unified Memory. GGUFs:
Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.
Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_XL) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.
Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:
Um eine andere Variante als 9B zu verwenden, können Sie das '9B' ändern zu: 0.8B, 2B oder 4B usw.
Thinking-Modus (standardmäßig deaktiviert)
Qwen3.5 Small-Modelle deaktivieren Thinking standardmäßig. Verwenden Sie llama-server, um es zu aktivieren.
Allgemeine Aufgaben:
Um eine andere Variante als 9B zu verwenden, können Sie das '9B' ändern zu: 0.8B, 2B oder 4B usw.
Der Non-Thinking-Modus ist bereits standardmäßig aktiviert
Allgemeine Aufgaben:
Reasoning-Aufgaben:
Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Gesprächsmodus aus:
Qwen3.5-27B
Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 18-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. GGUF: Qwen3.5-27B-GGUF
Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.
Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.
Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:
Thinking-Modus:
Präzise Coding-Aufgaben (z. B. WebDev):
Allgemeine Aufgaben:
Non-Thinking-Modus:
Allgemeine Aufgaben:
Reasoning-Aufgaben:
Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Gesprächsmodus aus:
Qwen3.5-122B-A10B
Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 70-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. GGUF: Qwen3.5-122B-A10B-GGUF
Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.
Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.
Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:
Thinking-Modus:
Präzise Coding-Aufgaben (z. B. WebDev):
Allgemeine Aufgaben:
Non-Thinking-Modus:
Allgemeine Aufgaben:
Reasoning-Aufgaben:
Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE (dynamische 4-Bit) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Dann führen Sie das Modell im Gesprächsmodus aus:
Qwen3.5-397B-A17B
Qwen3.5-397B-A17B befindet sich in derselben Leistungsklasse wie Gemini 3 Pro, Claude Opus 4.5 und GPT-5.2. Der vollständige 397B-Checkpoint belegt auf der Festplatte etwa 807 GB, aber mit Unsloths 397B-GGUFs können Sie ausführen:
3-Bit: passt auf 192GB RAM Systeme (z. B. ein Mac mit 192 GB)
4-Bit (MXFP4): passt auf 256GB RAM. Unsloth dynamische 4-Bit UD-Q4_K_XL ist ~214GB auf der Festplatte - lässt sich direkt auf einem 256GB M3 Ultra
Läuft auf einem einzelnen 24GB GPU + 256GB Systemspeicher via MoE-Offloading, erreicht 25+ Tokens/s
8-Bit benötigt ~512GB RAM/VRAM
Siehe 397B-Quantisierungs-Benchmarks darüber, wie sich Unsloth-GGUFs schlagen.
Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.
Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Denken Sie daran, dass das Modell nur eine maximale Kontextlänge von 256K hat.
Folge dem hier für Thinking Modus:
Folge dem hier für Non-Thinking Modus:
Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE (dynamische 4-Bit) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging
Du kannst --threads 32 für die Anzahl der CPU-Threads ändern, --n-gpu-layers 2 für GPU-Offloading, für wie viele Schichten. Versuche, dies anzupassen, wenn deinem GPU der Speicher ausgeht. Entferne es auch, wenn du nur CPU-Inferenz hast.
👾 LM Studio-Leitfaden
Für diesen Leitfaden verwenden wir LM Studio, eine einheitliche UI-Oberfläche zum Ausführen von LLMs. Der Umschalter '💡Thinking' und 'Non-Thinking' erscheint möglicherweise standardmäßig nicht, daher benötigen wir einige zusätzliche Schritte, um ihn zum Laufen zu bringen.
Herunterladen LM Studio für Ihr Gerät. Öffnen Sie dann Model Search, suchen Sie nach 'unsloth/qwen3.5', und laden Sie das gewünschte GGUF (Quant) herunter.

Anweisungen zum Thinking-Umschalter: Öffnen Sie nach dem Herunterladen Ihr Terminal / PowerShell und versuchen Sie: lms --help. Wenn LM Studio dann mit vielen Befehlen normal erscheint, führen Sie aus:
Dadurch erhalten Sie eine YAML-Datei, die es Ihrem GGUF ermöglicht, dass der Umschalter '💡Thinking' und 'Non-Thinking' angezeigt wird. Sie können 4b auf die gewünschte Quantisierung ändern, die Sie haben möchten.

Andernfalls können Sie zu unserer LM-Studio-Seite gehen und die spezifische YAML-Datei herunterladen.
Starten Sie LM Studio neu und laden Sie dann Ihr heruntergeladenes Modell (mit dem spezifischen Thinking-Umschalter, den Sie heruntergeladen haben). Sie sollten nun sehen, dass der Thinking-Umschalter aktiviert ist. Vergessen Sie nicht, die korrekten Parameter.

🦙 Llama-Server-Bereitstellung & OpenAIs Completion-Bibliothek
Um Qwen3.5-397B-A17B in der Produktion einzusetzen, verwenden wir llama-server Öffne in einem neuen Terminal, zum Beispiel via tmux, und stelle das Modell bereit mit:
Dann in einem neuen Terminal, nachdem du pip install openaiausgeführt hast:
🤔 Wie man Reasoning & Thinking aktiviert oder deaktiviert
Für die folgenden Befehle können Sie 'true' und 'false' austauschbar verwenden.
Unsloth Studio hat für Thinking-Modelle automatisch einen 'Think'-Umschalter.
Um den Think-Umschalter für LM Studio zu erhalten, lesen Sie unseren Leitfaden.

Um deaktivieren Thinking/Reasoning innerhalb von llama-server deaktivieren:
Wenn Sie unter Windows oder PowerShell, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"
Um aktivieren Thinking/Reasoning innerhalb von llama-server deaktivieren:
Wenn Sie unter Windows oder PowerShell, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":true}"
Bei Qwen3.5 0.8B, 2B, 4B und 9B ist Reasoning standardmäßig deaktiviert. Um es zu aktivieren, verwenden Sie: --chat-template-kwargs '{"enable_thinking":true}'
Und unter Windows oder PowerShell: --chat-template-kwargs "{\"enable_thinking\":true}"
Als Beispiel, um bei Qwen3.5-9B Thinking zu aktivieren (standardmäßig deaktiviert):
Und dann in Python:

👨💻 OpenAI Codex & Claude Code
Um das Modell über lokale agentische Coding-Workloads auszuführen, können Sie unserer Anleitung folgen. Verwenden Sie die llama-server wir gerade eben eingerichtet haben, und setzen Sie den Modellnamen auf die genaue ID, die es unter GET /v1/models (die --alias den obigen Wert, z. B. unsloth/Qwen3.5-9B-GGUF). Befolgen Sie die korrekten Qwen3.5-Parameter und Gebrauchsanweisungen.
Nachdem Sie beispielsweise die Anweisungen für Claude Code befolgt haben, sehen Sie:

Wir können dann zum Beispiel fragen Erstelle ein Python-Spiel für Schach :



🔨Tool-Calling mit Qwen3.5
Siehe Tool Calling Guide für weitere Details dazu, wie man Tool-Calling durchführt. In einem neuen Terminal (wenn du tmux verwendest, nutze STRG+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:
Wir verwenden dann die folgenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:
Nach dem Start von Qwen3.5 über llama-server wie in Qwen3.5 oder siehe Tool Calling Guide für weitere Details, können wir dann einige Tool-Aufrufe durchführen.
📊 Benchmarks
Unsloth GGUF Benchmarks
Wir haben die Qwen3.5-35B Unsloth Dynamic-Quants aktualisiert als SOTA gelten bei nahezu allen Bits. Wir haben über 150 KL-Divergenz-Benchmarks durchgeführt, insgesamt 9 TB an GGUFs. Wir haben alle Forschungsartefakte hochgeladen. Wir haben außerdem einen Tool-Calling Chat-Template Fehler (betrifft alle Quant-Uploader)
Alle GGUFs sind jetzt aktualisiert mit einem verbesserten Quantisierungs algorithmus.
Alle nutzen unsere neuen imatrix-Daten. Sehen Sie einige Verbesserungen in Chat-, Coding-, Langkontext- und Tool-Calling-Anwendungsfällen.
Die Qwen3.5-35B-A3B-GGUFs wurden aktualisiert, um die neuen Fixes zu verwenden (112B und 27B werden noch konvertiert; laden Sie sie erneut herunter, sobald sie aktualisiert sind)
99,9 % KL-Divergenz zeigen SOTA auf der Pareto-Frontier für UD-Q4_K_XL, IQ3_XXS und mehr.
MXFP4 wird ausgemustert aus allen GGUF-Quants: Q2_K_XL, Q3_K_XL und Q4_K_XL, außer reinem MXFP4_MOE.


LESEN SIE HIER UNSERE DETAILLIERTE QWEN3.5-ANALYSE + BENCHMARKS:
Qwen3.5 GGUF-BenchmarksQwen3.5-397B-A17B Benchmarks

Benjamin Marie (Drittanbieter) benchmarkte Qwen3.5-397B-A17B unter Verwendung von Unsloth-GGUFs auf einer gemischten Suite mit 750 Prompts (LiveCodeBench v6, MMLU Pro, GPQA, Math500), wobei sowohl die Gesamtgenauigkeit und die relative Fehlerzunahme (wie viel häufiger das quantisierte Modell im Vergleich zum Original Fehler macht).
Wichtige Ergebnisse (Genauigkeit; Veränderung gegenüber dem Original; relative Fehlerzunahme):
Originalgewichte: 81.3%
UD-Q4_K_XL: 80.5% (−0,8 Punkte; +4,3 % relative Fehlerzunahme)
UD-Q3_K_XL: 80.7% (−0,6 Punkte; +3,5 % relative Fehlerzunahme)
UD-Q4_K_XL und UD-Q3_K_XL bleiben dem Original extrem nahe, deutlich unter einem Genauigkeitsverlust von 1 Punkt bei dieser Suite, was Ben andeutet, dass Sie den Speicherbedarf stark reduzieren (etwa 500 GB weniger) mit wenig bis keinem praktischen Verlust bei den getesteten Aufgaben.
Wie auswählen: Dass Q3 hier leicht höher als Q4 abschneidet, ist als normale Lauf-zu-Lauf-Varianz in diesem Maßstab völlig plausibel, behandeln Sie also Q3 und Q4 als qualitativ praktisch gleichwertig in diesem Benchmark:
Wählen Sie Q3 wenn Sie den kleinsten Speicherbedarf / die besten Speicherersparnisse
Wählen Sie Q4 wenn Sie eine etwas konservativere Option mit ähnlichen Ergebnissen
Alle aufgeführten Quants verwenden unsere dynamische Methodik. Sogar UD-IQ2_M verwendet dieselbe dynamische Methodik, jedoch unterscheidet sich der Konvertierungsprozess von UD-Q2-K-XL wobei K-XL normalerweise schneller ist als UD-IQ2_M obwohl es größer ist, deshalb UD-IQ2_M kann besser abschneiden als UD-Q2-K-XL.
Offizielle Qwen-Benchmarks
Benchmarks für Qwen3.5-35B-A3B, 27B und 122B-A10B

Benchmarks für Qwen3.5-4B und 9B

Qwen3.5-397B-A17B Benchmarks

Zuletzt aktualisiert
War das hilfreich?


