For the complete documentation index, see llms.txt. This page is also available as Markdown.

💜Qwen3.5 - Lokal ausführen

Führe die neuen Qwen3.5-LLMs lokal auf deinem lokalen Gerät aus, einschließlich Medium: Qwen3.5-35B-A3B, 27B, 122B-A10B und Small: Qwen3.5-0.8B, 2B, 4B, 9B und 397B-A17B!

Qwen3.5 ist Alibabas neue Modellfamilie, einschließlich Qwen3.5-35B-A3B, 27B, 122B-A10B und 397B-A17B und die neue Klein Serie: Qwen3.5-0.8B, 2B, 4B und 9B. Die multimodalen hybriden Reasoning-LLMs liefern für ihre Größe die stärksten Leistungen. Sie unterstützen 256K Kontext für 201 Sprachen und haben Thinking + Nicht-Denken und eignen sich hervorragend für agentisches Coding, Vision, Chat und Langkontext-Aufgaben. Die 35B- und 27B-Modelle laufen auf einem 22-GB-Mac-/RAM-Gerät. Siehe alle GGUFs hier.

Qwen3.5-Tutorials ausführenQwen3.5 feinabstimmen

Alle Uploads verwenden Unsloth Dynamic 2.0 für erstklassige Quantisierungsleistung – daher werden bei 4-Bit wichtige Layer auf 8 oder 16 Bit hochgestuft. Vielen Dank an Qwen für den Day-Zero-Zugriff für Unsloth. Sie können auch feinabstimmen Qwen3.5 mit Unsloth.

Um Thinking zu aktivieren oder zu deaktivieren, siehe Qwen3.5.Qwen3.5 Small-Modelle sind standardmäßig deaktiviert.

⚙️ Nutzungsanleitung

Tabelle: Hardwareanforderungen für Inferenz (Einheiten = Gesamtspeicher: RAM + VRAM oder Unified Memory)

Qwen3.5
3-Bit
4-Bit
6-Bit
8-Bit
BF16

3 GB

3.5 GB

5 GB

7.5 GB

9 GB

4.5 GB

5.5 GB

7 GB

10 GB

14 GB

5.5 GB

6.5 GB

9 GB

13 GB

19 GB

14 GB

17 GB

24 GB

30 GB

54 GB

17 GB

22 GB

30 GB

38 GB

70 GB

60 GB

70 GB

106 GB

132 GB

245 GB

180 GB

214 GB

340 GB

512 GB

810 GB

Zwischen 27B und 35B-A3B, verwenden Sie 27B, wenn Sie etwas genauere Ergebnisse möchten und es nicht auf Ihr Gerät passt. Entscheiden Sie sich für 35B-A3B, wenn Sie deutlich schnellere Inferenz möchten.

Empfohlene Einstellungen

  • Maximales Kontextfenster: 262,144 (kann via YaRN auf 1M erweitert werden)

  • presence_penalty = 0.0 bis 2.0 standardmäßig ist dies deaktiviert, aber um Wiederholungen zu reduzieren, können Sie dies verwenden; allerdings kann ein höherer Wert zu einem leichten Leistungsabfall führen

  • Angemessene Ausgabelänge: 32,768 Tokens für die meisten Anfragen

Wenn Sie Kauderwelsch erhalten, ist Ihre Kontextlänge möglicherweise zu niedrig eingestellt. Oder versuchen Sie --cache-type-k bf16 --cache-type-v bf16 was helfen könnte.

Da Qwen3.5 hybrides Reasoning ist, haben der Thinking- und der Non-Thinking-Modus unterschiedliche Einstellungen:

Thinking-Modus:

Allgemeine Aufgaben
Präzise Coding-Aufgaben (z. B. WebDev)

temperature = 1.0

temperature = 0.6

top_p = 0.95

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 1.5

presence_penalty = 0.0

repeat_penalty = deaktiviert oder 1.0

repeat_penalty = deaktiviert oder 1.0

Thinking-Modus für allgemeine Aufgaben:

Thinking-Modus für präzise Coding-Aufgaben:

Instruct-(Non-Thinking)-Moduseinstellungen:

Allgemeine Aufgaben
Reasoning-Aufgaben

temperature = 0.7

temperature = 1.0

top_p = 0.8

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 1.5

presence_penalty = 1.5

repeat_penalty = deaktiviert oder 1.0

repeat_penalty = deaktiviert oder 1.0

Instruct (Non-Thinking) für allgemeine Aufgaben:

Instruct (Non-Thinking) für Reasoning-Aufgaben:

Qwen3.5-Inferenz-Tutorials:

Da Qwen3.5 in vielen verschiedenen Größen erhältlich ist, verwenden wir Dynamic 4-Bit MXFP4_MOE GGUF-Varianten für alle Inferenz-Workloads. Klicken Sie unten, um zu den jeweiligen Modellanweisungen zu gelangen:

In Unsloth Studio ausführenQwen3.5-35B-A3B27B122B-A10B397B-A17BKlein (0.8B - 9B)

Unsloths dynamische GGUF-Uploads:

🦥 Unsloth Studio-Leitfaden

Qwen3.5 kann ausgeführt und feinabgestimmt werden in Unsloth Studio, unserer neuen Open-Source-Web-UI für lokale KI, ausgeführt werden. Mit Unsloth Studio kannst du Modelle lokal auf MacOS, Windows, Linux und:

1

Unsloth installieren

In deinem Terminal ausführen:

MacOS, Linux, WSL:

Windows PowerShell:

2

Unsloth starten

MacOS, Linux, WSL und Windows:

Dann öffne http://localhost:8888 in deinem Browser.

3

Qwen3.5 suchen und herunterladen

Beim ersten Start müssen Sie ein Passwort erstellen, um Ihr Konto zu sichern, und sich später erneut anmelden. Gehen Sie dann zum Studio Chat Tab und suchen Sie in der Suchleiste nach Qwen3.5 und laden Sie Ihr gewünschtes Modell und die gewünschte Quantisierung herunter.

4

Qwen3.5 ausführen

Die Inferenzparameter sollten bei Verwendung von Unsloth Studio automatisch gesetzt werden, du kannst sie jedoch weiterhin manuell ändern. Du kannst auch die Kontextlänge, die Chat-Vorlage und andere Einstellungen bearbeiten.

Weitere Informationen findest du in unserem Unsloth-Studio-Inferenzleitfaden.

🦙 Llama.cpp-Leitfäden

Qwen3.5-35B-A3B

Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 24-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. Da das Modell bei voller F16-Präzision nur etwa 72 GB groß ist, müssen wir uns nicht allzu sehr um die Leistung sorgen. GGUF: Qwen3.5-35B-A3B-GGUF

Für diese Tutorials verwenden wir llama.cpp für schnelle lokale Inferenz, insbesondere wenn Sie eine CPU haben.

1

Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort – Metal-Unterstützung ist standardmäßig aktiviert.

2

Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.

Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:

Thinking-Modus:

Präzise Coding-Aufgaben (z. B. WebDev):

Allgemeine Aufgaben:

Non-Thinking-Modus:

Allgemeine Aufgaben:

Reasoning-Aufgaben:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Gesprächsmodus aus:

Qwen3.5 Small (0.8B • 2B • 4B • 9B)

Für die Qwen3.5 Small-Serie müssen Sie, da sie so klein ist, in den Skripten lediglich den Modellnamen auf die gewünschte Variante ändern. Für diesen speziellen Leitfaden verwenden wir die 9B-Parameter-Variante. Um sie alle in nahezu voller Präzision auszuführen, benötigen Sie lediglich ein Gerät mit 12 GB RAM / VRAM / Unified Memory. GGUFs:

1

Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

2

Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_XL) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.

Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:

Thinking-Modus (standardmäßig deaktiviert)

Allgemeine Aufgaben:

Der Non-Thinking-Modus ist bereits standardmäßig aktiviert

Allgemeine Aufgaben:

Reasoning-Aufgaben:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können Q4_K_M oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Gesprächsmodus aus:

Qwen3.5-27B

Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 18-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. GGUF: Qwen3.5-27B-GGUF

1

Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

2

Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.

Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:

Thinking-Modus:

Präzise Coding-Aufgaben (z. B. WebDev):

Allgemeine Aufgaben:

Non-Thinking-Modus:

Allgemeine Aufgaben:

Reasoning-Aufgaben:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Gesprächsmodus aus:

Qwen3.5-122B-A10B

Für diesen Leitfaden verwenden wir Dynamic 4-Bit, das auf einem 70-GB-RAM-/Mac-Gerät für schnelle Inferenz hervorragend funktioniert. GGUF: Qwen3.5-122B-A10B-GGUF

1

Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

2

Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Das Modell hat eine maximale Kontextlänge von 256K.

Folgen Sie einem der folgenden spezifischen Befehle, je nach Anwendungsfall:

Thinking-Modus:

Präzise Coding-Aufgaben (z. B. WebDev):

Allgemeine Aufgaben:

Non-Thinking-Modus:

Allgemeine Aufgaben:

Reasoning-Aufgaben:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE (dynamische 4-Bit) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Dann führen Sie das Modell im Gesprächsmodus aus:

Qwen3.5-397B-A17B

Qwen3.5-397B-A17B befindet sich in derselben Leistungsklasse wie Gemini 3 Pro, Claude Opus 4.5 und GPT-5.2. Der vollständige 397B-Checkpoint belegt auf der Festplatte etwa 807 GB, aber mit Unsloths 397B-GGUFs können Sie ausführen:

  • 3-Bit: passt auf 192GB RAM Systeme (z. B. ein Mac mit 192 GB)

  • 4-Bit (MXFP4): passt auf 256GB RAM. Unsloth dynamische 4-Bit UD-Q4_K_XL ist ~214GB auf der Festplatte - lässt sich direkt auf einem 256GB M3 Ultra

  • Läuft auf einem einzelnen 24GB GPU + 256GB Systemspeicher via MoE-Offloading, erreicht 25+ Tokens/s

  • 8-Bit benötigt ~512GB RAM/VRAM

Siehe 397B-Quantisierungs-Benchmarks darüber, wie sich Unsloth-GGUFs schlagen.

1

Erhalte das neueste llama.cpp auf hier auf GitHub. Du kannst auch den untenstehenden Build-Anweisungen folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest.

2

Wenn du llama.cpp um Modelle direkt zu laden, können Sie Folgendes tun: (:Q4_K_M) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Das ist ähnlich wie ollama run . Verwende export LLAMA_CACHE="folder" um llama.cpp um an einem bestimmten Ort zu speichern. Denken Sie daran, dass das Modell nur eine maximale Kontextlänge von 256K hat.

Folge dem hier für Thinking Modus:

Folge dem hier für Non-Thinking Modus:

3

Lade das Modell herunter über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst auswählen MXFP4_MOE (dynamische 4-Bit) oder andere quantisierte Versionen wie UD-Q4_K_XL . Wir empfehlen, mindestens eine dynamische 2-Bit-Quantisierung zu verwenden UD-Q2_K_XL um Größe und Genauigkeit auszubalancieren. Wenn Downloads hängen bleiben, siehe: Hugging Face Hub, XET-Debugging

4

Du kannst --threads 32 für die Anzahl der CPU-Threads ändern, --n-gpu-layers 2 für GPU-Offloading, für wie viele Schichten. Versuche, dies anzupassen, wenn deinem GPU der Speicher ausgeht. Entferne es auch, wenn du nur CPU-Inferenz hast.

👾 LM Studio-Leitfaden

Für diesen Leitfaden verwenden wir LM Studio, eine einheitliche UI-Oberfläche zum Ausführen von LLMs. Der Umschalter '💡Thinking' und 'Non-Thinking' erscheint möglicherweise standardmäßig nicht, daher benötigen wir einige zusätzliche Schritte, um ihn zum Laufen zu bringen.

1

Herunterladen LM Studio für Ihr Gerät. Öffnen Sie dann Model Search, suchen Sie nach 'unsloth/qwen3.5', und laden Sie das gewünschte GGUF (Quant) herunter.

2

Anweisungen zum Thinking-Umschalter: Öffnen Sie nach dem Herunterladen Ihr Terminal / PowerShell und versuchen Sie: lms --help. Wenn LM Studio dann mit vielen Befehlen normal erscheint, führen Sie aus:

Dadurch erhalten Sie eine YAML-Datei, die es Ihrem GGUF ermöglicht, dass der Umschalter '💡Thinking' und 'Non-Thinking' angezeigt wird. Sie können 4b auf die gewünschte Quantisierung ändern, die Sie haben möchten.

Andernfalls können Sie zu unserer LM-Studio-Seite gehen und die spezifische YAML-Datei herunterladen.

3

Starten Sie LM Studio neu und laden Sie dann Ihr heruntergeladenes Modell (mit dem spezifischen Thinking-Umschalter, den Sie heruntergeladen haben). Sie sollten nun sehen, dass der Thinking-Umschalter aktiviert ist. Vergessen Sie nicht, die korrekten Parameter.

🦙 Llama-Server-Bereitstellung & OpenAIs Completion-Bibliothek

Um Qwen3.5-397B-A17B in der Produktion einzusetzen, verwenden wir llama-server Öffne in einem neuen Terminal, zum Beispiel via tmux, und stelle das Modell bereit mit:

Dann in einem neuen Terminal, nachdem du pip install openaiausgeführt hast:

🤔 Wie man Reasoning & Thinking aktiviert oder deaktiviert

Für die folgenden Befehle können Sie 'true' und 'false' austauschbar verwenden.

Unsloth Studio hat für Thinking-Modelle automatisch einen 'Think'-Umschalter.

Um den Think-Umschalter für LM Studio zu erhalten, lesen Sie unseren Leitfaden.

Unsloth Studio hat den Think-Umschalter standardmäßig

Um deaktivieren Thinking/Reasoning innerhalb von llama-server deaktivieren:

Wenn Sie unter Windows oder PowerShell, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":false}"

Um aktivieren Thinking/Reasoning innerhalb von llama-server deaktivieren:

Wenn Sie unter Windows oder PowerShell, verwenden Sie: --chat-template-kwargs "{\"enable_thinking\":true}"

Als Beispiel, um bei Qwen3.5-9B Thinking zu aktivieren (standardmäßig deaktiviert):

Und dann in Python:

👨‍💻 OpenAI Codex & Claude Code

Um das Modell über lokale agentische Coding-Workloads auszuführen, können Sie unserer Anleitung folgen. Verwenden Sie die llama-server wir gerade eben eingerichtet haben, und setzen Sie den Modellnamen auf die genaue ID, die es unter GET /v1/models (die --alias den obigen Wert, z. B. unsloth/Qwen3.5-9B-GGUF). Befolgen Sie die korrekten Qwen3.5-Parameter und Gebrauchsanweisungen.

Nachdem Sie beispielsweise die Anweisungen für Claude Code befolgt haben, sehen Sie:

Wir können dann zum Beispiel fragen Erstelle ein Python-Spiel für Schach :

🔨Tool-Calling mit Qwen3.5

Siehe Tool Calling Guide für weitere Details dazu, wie man Tool-Calling durchführt. In einem neuen Terminal (wenn du tmux verwendest, nutze STRG+B+D) erstellen wir einige Tools wie das Hinzufügen von 2 Zahlen, das Ausführen von Python-Code, das Ausführen von Linux-Funktionen und vieles mehr:

Wir verwenden dann die folgenden Funktionen (kopieren, einfügen und ausführen), die die Funktionsaufrufe automatisch parsen und den OpenAI-Endpunkt für jedes Modell aufrufen:

Nach dem Start von Qwen3.5 über llama-server wie in Qwen3.5 oder siehe Tool Calling Guide für weitere Details, können wir dann einige Tool-Aufrufe durchführen.

📊 Benchmarks

Unsloth GGUF Benchmarks

Wir haben die Qwen3.5-35B Unsloth Dynamic-Quants aktualisiert als SOTA gelten bei nahezu allen Bits. Wir haben über 150 KL-Divergenz-Benchmarks durchgeführt, insgesamt 9 TB an GGUFs. Wir haben alle Forschungsartefakte hochgeladen. Wir haben außerdem einen Tool-Calling Chat-Template Fehler (betrifft alle Quant-Uploader)

  • Alle GGUFs sind jetzt aktualisiert mit einem verbesserten Quantisierungs algorithmus.

  • Alle nutzen unsere neuen imatrix-Daten. Sehen Sie einige Verbesserungen in Chat-, Coding-, Langkontext- und Tool-Calling-Anwendungsfällen.

  • Die Qwen3.5-35B-A3B-GGUFs wurden aktualisiert, um die neuen Fixes zu verwenden (112B und 27B werden noch konvertiert; laden Sie sie erneut herunter, sobald sie aktualisiert sind)

  • 99,9 % KL-Divergenz zeigen SOTA auf der Pareto-Frontier für UD-Q4_K_XL, IQ3_XXS und mehr.

  • MXFP4 wird ausgemustert aus allen GGUF-Quants: Q2_K_XL, Q3_K_XL und Q4_K_XL, außer reinem MXFP4_MOE.

35B-A3B - KLD-Benchmarks (niedriger ist besser)
122B-A10B - KLD-Benchmarks (niedriger ist besser)

LESEN SIE HIER UNSERE DETAILLIERTE QWEN3.5-ANALYSE + BENCHMARKS:

Qwen3.5 GGUF-Benchmarks

Qwen3.5-397B-A17B Benchmarks

Benjamin Marie (Drittanbieter) benchmarkte Qwen3.5-397B-A17B unter Verwendung von Unsloth-GGUFs auf einer gemischten Suite mit 750 Prompts (LiveCodeBench v6, MMLU Pro, GPQA, Math500), wobei sowohl die Gesamtgenauigkeit und die relative Fehlerzunahme (wie viel häufiger das quantisierte Modell im Vergleich zum Original Fehler macht).

Wichtige Ergebnisse (Genauigkeit; Veränderung gegenüber dem Original; relative Fehlerzunahme):

  • Originalgewichte: 81.3%

  • UD-Q4_K_XL: 80.5% (−0,8 Punkte; +4,3 % relative Fehlerzunahme)

  • UD-Q3_K_XL: 80.7% (−0,6 Punkte; +3,5 % relative Fehlerzunahme)

UD-Q4_K_XL und UD-Q3_K_XL bleiben dem Original extrem nahe, deutlich unter einem Genauigkeitsverlust von 1 Punkt bei dieser Suite, was Ben andeutet, dass Sie den Speicherbedarf stark reduzieren (etwa 500 GB weniger) mit wenig bis keinem praktischen Verlust bei den getesteten Aufgaben.

Wie auswählen: Dass Q3 hier leicht höher als Q4 abschneidet, ist als normale Lauf-zu-Lauf-Varianz in diesem Maßstab völlig plausibel, behandeln Sie also Q3 und Q4 als qualitativ praktisch gleichwertig in diesem Benchmark:

  • Wählen Sie Q3 wenn Sie den kleinsten Speicherbedarf / die besten Speicherersparnisse

  • Wählen Sie Q4 wenn Sie eine etwas konservativere Option mit ähnlichen Ergebnissen

Alle aufgeführten Quants verwenden unsere dynamische Methodik. Sogar UD-IQ2_M verwendet dieselbe dynamische Methodik, jedoch unterscheidet sich der Konvertierungsprozess von UD-Q2-K-XL wobei K-XL normalerweise schneller ist als UD-IQ2_M obwohl es größer ist, deshalb UD-IQ2_M kann besser abschneiden als UD-Q2-K-XL.

Offizielle Qwen-Benchmarks

Benchmarks für Qwen3.5-35B-A3B, 27B und 122B-A10B

Benchmarks für Qwen3.5-4B und 9B

Qwen3.5-397B-A17B Benchmarks

Zuletzt aktualisiert

War das hilfreich?