> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/grundlagen/dynamic-3.0-ggufs.md).

# Unsloth Dynamic 3.0 GGUFs

[**Unsloth**](https://github.com/unslothai/unsloth) **Dynamic v3.0** ist die nächste Iteration unserer dynamischen Quantisierung und eine deutliche Verbesserung gegenüber Dynamic v2.0.

Heute veröffentlichen wir [**Qwen3.8-27B**](/docs/de/modelle/qwen3.8.md) Dynamic v3.0-Quants, die **>10 % genauere Top-1%-Genauigkeit bei gleicher Größe** im Vergleich zu **jedem anderen Anbieter**. Dies ist ein Update unserer ersten gemeinsamen **frühen Vorschau** Version von Dynamic v3.0. Die neuen 3.0 GGUFs funktionieren mit den meisten Inferenz-Engines, darunter **llama.cpp** und [**Unsloth Desktop**](/docs/de/desktop.md).

{% columns %}
{% column width="41.66666666666667%" %}
Dynamic v3.0 bewahrt insgesamt mehr Modellqualität bei gleicher Größe und erzielt stärkere Ergebnisse bei Kennzahlen wie **Divergence-300** @32 und **KL-Divergenz**.

Außerdem ein riesiges Dankeschön für eure ganze Unterstützung! Wir haben in nur 5 Tagen über 5,1 Millionen Unsloth-Qwen3.8-Downloads gesehen!
{% endcolumn %}

{% column width="58.33333333333333%" %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fl9piThTmmUsePst5w3F2%2Fimage.png?alt=media&amp;token=821e88e2-ad4e-40bf-adf2-e13837228e82" alt=""><figcaption><p>Siehe unten für weitere Diagramme/Benchmarks und Analysen</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

Unsere neue Methodik besteht aus vielen neuen Funktionen und Verbesserungen. Wir verwenden jetzt einen deutlich qualitativ hochwertigeren imatrix-Kalibrierungsdatensatz aus vielfältigen Quellen. Der Datensatz ist verfeinert für **agentisches Coding, Chat**und mehrsprachige Leistung. Wir haben außerdem **Layer-Auswahl** verbessert und viele weitere Quantisierungstechniken eingeführt, um so viel Modellqualität wie möglich zu bewahren.

Wir **trainieren nicht auf dem imatrix-Kalibrierungsdatensatz**, und wir verwenden KEIN **QAT** oder **QAD**. Alles geschieht durch **Post-Training-Quantisierung**. Unsere verwendete imatrix-Datei steht der Community zum Testen, Bewerten und Verwenden zur Verfügung. Wir ermutigen Forschende und Entwickler, Varianten und Feintunings von Qwen3.8 mit unseren Unsloth-Quants/imatrix zu erstellen. Sie können auch unsere [Überfitting-Analyse](#not-overfitting) lesen.

* Wir haben außerdem das MTP-Modul aus kleineren Quants unter `UD-Q2_K_XL` (8,37 GB und kleiner) entfernt, um rund 500 MB Festplattenspeicher einzusparen – falls nötig, können Sie das `Q4_0` MTP-Teilmodul verwenden
* Wir haben außerdem einige kleinere UD-1bit-Quants mit `UD-IQ1_S` erstellt, das 6,2 GB (ohne MTP) groß ist und rund 72 % Top-1%-Genauigkeit beibehält, dabei aber 89 % kleiner ist.
* `UD-Q2_K_XL` liegt bei etwa +8 % höherer Top-1%-Genauigkeit als der nächstbeste und ist 9,83 GB groß und konnte ein funktionierendes HTML-Programm mit einem kleinen JS-Fehler erzeugen – zuvor wäre es kaputtgegangen.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHkiEb4BgU9IZ4t0pbMKs%2FUD-Q2_K_XL-Qwen.gif?alt=media&amp;token=6b4cd6d5-0b70-4741-a72e-1f5e1974dbb0" alt="" width="360"><figcaption><p>Generiert mit einem 2-Bit-Qwen3.8-27B-GGUF</p></figcaption></figure>

### 🔀 Divergence-300 @32

Wir berichten im Allgemeinen über Top-1%-Genauigkeit, ähnlich wie bei Kimi-K3: „Dynamic 1-bit erreicht **\~78.9%** Top-1-Genauigkeit bei **62 % kleiner**“. Allerdings ist Top-1 % ein Argmax über 1 Vorhersage, also nicht wirklich effektiv, um die tatsächliche Inferenz zu bewerten.

Wir haben einen Datensatz mit 300 zurückgehaltenen Beispielen (NICHT im Kalibrierungsdatensatz) aus Terminal-Bench 2.1 + DeepSWE + Harbor + MathArena 2025–26 + nicht-lateinischen/längeren Dokument-Prompts erstellt und für 32 Tokens Greedy-Argmax-Decoding für BF16 im Vergleich zu allen Quants und Anbietern durchgeführt. Siehe [Überfitting-Analyse](#not-overfitting) für weitere Details zum Overfitting.

Dies ermöglicht uns zu beurteilen, ob Overfitting vorliegt und ob Quant-Ausgaben über mehrere Tokens hinweg ähnlich zu den Trajektorien von BF16 sind. Das ist eine bessere Kennzahl als Top-1%-Genauigkeit, da wir KLD-Top-1 % eher auf KLD-Top-1 % bei 32 Tokens erweitern.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FySCIjoinQuhNqfGz3C4Q%2Fimage.png?alt=media&amp;token=dcc5a2be-3445-4a67-b1e2-0ca5e89fbcf6" alt=""><figcaption></figcaption></figure>

### :question:1-bit sollte nicht für agentische Anwendungsfälle verwendet werden

Wie in [#divergence-300-32](#divergence-300-32 "mention")zu sehen ist, gibt es einen deutlichen Einbruch von UD-Q2\_K\_XL zu UD-IQ2\_S bei der Vorhersage über 32 Tokens von etwa 25 % Genauigkeit auf unter 8–10 %. Dieser starke Einbruch bedeutet, dass Tool-Calling und Nicht-Denk-Modi zusammenbrechen. Einige Probleme und Gegenmaßnahmen bei Verwendung von 1-bit:

1. **Übermäßige Schleifen**\
   Sie werden beim Einsatz von Quants unterhalb von UD-Q2\_K\_XL viele Schleifen sehen – verwenden Sie `presence_penalty = 1,5` in allen Fällen (oder höher)
2. **Leere Antworten**\
   Aktivieren Sie bei 1-bit-Quants immer mindestens Denken auf niedrigem Reasoning-Level – Nicht-Reasoning-Modi führen dazu, dass das Modell ohnehin nichts ausgibt
3. **Agentische Anwendungsfälle und Tool-Calling**\
   Verwenden Sie das Modell nicht für Tool-Calling – nur **Allgemeinwissen bleibt erhalten** wenn stark quantisiert wird, und das Modell wird entweder nicht in der Lage sein, Tools aufzurufen, immer weiter Tools aufrufen oder sie gar nicht erst aufrufen.
4. **Allgemeinwissen funktioniert**\
   Eine Top-1%-Erholung von 77 % ist kein Ersatz für Divergence-300 @32 mit 8 %, was ein besserer Indikator für tatsächliche Inferenz-Workloads ist – Sie können das Modell für sehr kurze allgemeine Wissensfragen verwenden, aber am besten ist es, UD-Q2\_K\_XL zu nutzen.

### 🔀 KL-Divergenz-Benchmarks

Wir haben auch KLD-Benchmarks für alle Anbieter durchgeführt und berichten Top-1 % und mittlere KLD. Auf allen Ebenen, besonders bei den kleineren Quantgrößen, erreichen Unsloth-UD-3-Quants bis zu +10 % zusätzliche Top-1%-Genauigkeit bei gleichem Festplattenspeicher!

Alle Diagramme entfernen den MTP-Head von der x-Achse bei der Berechnung des Festplattenspeichers, um einen fairen Vergleich für alle zu ermöglichen.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2F4ipZ74oiCRRLbB2FJa4J%2Fimage.png?alt=media&amp;token=09f263b9-4cd9-45dc-bd31-8c7ecff2ca41" alt=""><figcaption></figcaption></figure>

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FA6YPmwKLaJ7IZ4U4bQE3%2Fimage.png?alt=media&amp;token=e003bf7b-5c78-4eb4-bbae-5358410ef3fa" alt=""><figcaption></figcaption></figure>

### :dove:Kein Overfitting

Beim Vergleich mit unserem älteren UD-2 auf ungesehenem Wikitext und Code zeigen wir eine starke Verbesserung bei KLD – bei den größeren nicht so sehr, daher verwenden wir für die größeren Quants weiterhin unser altes UD-2 – wir planen, auch dort zu experimentieren und sie zu verbessern!

Wir kontrollieren außerdem für Overfitting, indem wir völlig unterschiedliche Datensätze für die Kalibrierung verwenden und alle Lecks so weit wie möglich entfernen. Wir testen KLD auf diesen ungesehenen Datensätzen und wir machen auch KEIN QAD / QAT, sondern nur reines PTQ, sodass Overfitting im Vergleich zu anderen QAD / QAT-Ansätzen weniger problematisch ist.

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FP6ro1GH2PqtO63Zdvale%2Fimage.png?alt=media&amp;token=109ca035-6fe1-4154-a33e-20d609f2bf57" alt=""><figcaption></figcaption></figure>

Ähnlich [#divergence-300-32](#divergence-300-32 "mention") verwendet einen ungesehenen Datensatz mit 300 Prompts aus DeepSWE, Terminal Bench und anderen und dient als weiterer Datensatz zur Bewertung von Overfitting – und zeigt, dass unsere neuen UD-3-Methoden nicht überfitten.

***

## Dynamic v2.0 (Alt)

Wir führen ein [Unsloth](https://github.com/unslothai/unsloth) Dynamic v2.0-Quantisierung ein – ein großes Upgrade gegenüber unseren vorherigen Quants. Diese neue Methode übertrifft führende Quantisierungsmethoden und setzt neue Benchmarks für [Aider Polyglot](/docs/de/grundlagen/dynamic-3.0-ggufs/unsloth-dynamic-ggufs-on-aider-polyglot.md)sowie 5-shot MMLU und KL-Divergenz.

Das bedeutet, dass Sie jetzt [quantisierte LLMs](/docs/de/modelle/tutorials.md) ausführen + feinabstimmen können, während so viel Genauigkeit wie möglich erhalten bleibt! Sie können die 2.0 GGUFs auf den meisten Inferenz-Engines wie llama.cpp, [Unsloth Studio](/docs/de/neu/studio.md) usw. ausführen.

{% columns %}
{% column %}
**Update vom 20. Apr. 2026:** Siehe unsere neuen GGUF-Benchmarks für [Qwen3.6](/docs/de/modelle/qwen3.6.md#unsloth-gguf-benchmarks) und [Gemma 4](/docs/de/modelle/gemma-4.md#unsloth-gguf-benchmarks).

[Update vom 27. Feb. 2026:](/docs/de/modelle/qwen3.5/gguf-benchmarks.md) **Qwen3.5** ist da, und wir haben einige Probleme mit Chat-Templates beim Tool-Calling behoben und jeden GGUF hinsichtlich Perplexität und KL-Divergenz bewertet. [Siehe Benchmarks!](/docs/de/modelle/qwen3.5/gguf-benchmarks.md)

Der **entscheidende Vorteil** bei der Verwendung des [Unsloth-Pakets](https://github.com/unslothai/unsloth) und der Quants ist unsere aktive Rolle beim Beheben von Bugs in großen Modellen. Wir haben direkt mit Teams hinter [Qwen3](https://www.reddit.com/r/LocalLLaMA/comments/1kaodxu/qwen3_unsloth_dynamic_ggufs_128k_context_bug_fixes/), [Meta (Llama 4)](https://github.com/ggml-org/llama.cpp/pull/12889), [Mistral (Devstral)](https://app.gitbook.com/o/HpyELzcNe0topgVLGCZY/s/xhOjnexMCB3dmuQFQ2Zq/~/changes/618/basics/tutorials-how-to-fine-tune-and-run-llms/devstral-how-to-run-and-fine-tune), [Google (Gemma 1–3)](https://news.ycombinator.com/item?id=39671146) und [Microsoft (Phi-3/4)](https://simonwillison.net/2025/Jan/11/phi-4-bug-fixes)zusammengearbeitet und Fixes beigetragen, die die Genauigkeit erhöhen.
{% endcolumn %}

{% column %}

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FtRVN97QDzO0Pq7SscC7x%2Fgemma%20426b%20bench.png?alt=media&amp;token=80b4da76-efe9-4554-8e31-cca6494d456c" alt=""><figcaption><p>Gemma 4 26B A4B Benchmarks (niedriger ist besser)</p></figcaption></figure>

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FHq98A18pHA2ePwlInrFG%2Fqwen36_mean_q6k_corrected_arrow_pareto_fixed.png?alt=media&amp;token=a5190c8a-4d04-4d4d-be94-dd15214e6687" alt=""><figcaption><p>Qwen3.6 Benchmarks (niedriger ist besser)</p></figcaption></figure>
{% endcolumn %}
{% endcolumns %}

{% hint style="success" %}
Unsloth Dynamic GGUFs können jetzt ausgeführt werden in [Unsloth Studio](/docs/de/neu/studio.md) ✨

<img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FsERzR65n4jc1UtuSHozZ%2Fwedefrwfwe.gif?alt=media&amp;token=e303ed9e-0d90-456d-8d57-874a06803903" alt="" data-size="original">
{% endhint %}

{% hint style="success" %}
[Update vom 10. Sept. 2025:](/docs/de/grundlagen/dynamic-3.0-ggufs/unsloth-dynamic-ggufs-on-aider-polyglot.md) Ihr habt nach schwierigeren Benchmarks gefragt, also hier sind die Aider-Polyglot-Ergebnisse! Unser Dynamic-3-bit-DeepSeek-V3.1-GGUF erzielt **75.6%**&#x75;nd übertrifft damit viele SOTA-LLMs in voller Präzision. [Mehr lesen.](/docs/de/grundlagen/dynamic-3.0-ggufs/unsloth-dynamic-ggufs-on-aider-polyglot.md)

<img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-a114143bdd47add988182aabf9313ab40be38d7d%2Faider%20thinking.png?alt=media" alt="DeepSeek-V3.2 Thinking Aider Benchmarks" data-size="original"><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-b085c16c7f8351308229f1341846cbf1a2617d0a%2Faider%20non.png?alt=media" alt="Llama 4 5-shot MMLU Benchmarks" data-size="original">
{% endhint %}

Sie können auch Benchmarks für reale Anwendungsfälle ansehen, die von Benjamin Marie für LiveCodeBench v6, MMLU Pro usw. durchgeführt wurden:

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2FhfO2gsbz2lWrZXg3ojyE%2FHCGBTzgboAASv_A.png?alt=media&amp;token=7d6334ca-4f3c-4946-aacd-d55527375fce" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Ftbfnqq8ppzwFbeqPhnw0%2FHAfMRrrXQAALkQb.png?alt=media&amp;token=9730d4e1-3d4a-4ae6-92bf-32aa6724ab86" alt="" width="450"><figcaption></figcaption></figure></div>

Sie können sehen, wie Unsloths GGUFs besser abschneiden als die Nicht-Unsloth-Quants, obwohl sie \~8 GB kleiner sind.

Eine detaillierte Analyse unserer Benchmarks und Bewertung finden Sie weiter unten.

### 💡 Was ist neu in Dynamic v2.0?

* **Überarbeitete Layer-Auswahl für GGUFs + safetensors:** Unsloth Dynamic 2.0 quantisiert jetzt selektiv Layer viel intelligenter und umfassender. Anstatt nur ausgewählte Layer zu ändern, passen wir jetzt dynamisch den Quantisierungstyp jedes möglichen Layers an, und die Kombinationen unterscheiden sich je Layer und Modell.
* Alle aktuell ausgewählten und alle zukünftigen GGUF-Uploads werden Dynamic 2.0 und unseren neuen Kalibrierungsdatensatz verwenden. Der Datensatz enthält mehr als >1,5 Mio. **Tokens** (je nach Modell) und besteht aus hochwertigen, handkuratierten und bereinigten Daten – um die Gesprächsleistung deutlich zu verbessern.
* Zuvor war unsere dynamische Quantisierung (DeepSeek-R1 1,58-Bit-GGUF) nur für MoE-Architekturen wirksam. <mark style="background-color:green;">**Dynamic 2.0-Quantisierung funktioniert jetzt bei allen Modellen (einschließlich MOEs und Nicht-MOEs)**</mark>.
* **Modellspezifische Quants:** Jedes Modell verwendet jetzt ein maßgeschneidertes Quantisierungsschema. Z. B. unterscheiden sich die in Gemma 3 quantisierten Layer erheblich von denen in Llama 4.
* Um die Effizienz zu maximieren, insbesondere auf Apple Silicon und ARM-Geräten, fügen wir jetzt auch die Formate Q4\_NL, Q5.1, Q5.0, Q4.1 und Q4.0 hinzu.

Um genaue Benchmarks zu gewährleisten, haben wir ein internes Bewertungsframework entwickelt, das die offiziell berichteten 5-shot-MMLU-Werte von Llama 4 und Gemma 3 nachbildet. Dies ermöglichte einen direkten Vergleich von Full-Precision vs. Dynamic v2.0, **QAT** und standardmäßigen **imatrix** GGUF-Quants.

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-fd0a92a2bea8efa37b71946ea934a22f00589f40%2Fkldivergence%20graph.png?alt=media" alt="" width="563"><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-76662317725a3b76fb1e5e33b586c86e712bee6f%2F5shotmmlu.png?alt=media" alt="" width="563"><figcaption></figcaption></figure></div>

Alle zukünftigen GGUF-Uploads werden Unsloth Dynamic 2.0 verwenden, und unsere Dynamic 4-bit-Safetensor-Quants werden davon in Zukunft ebenfalls profitieren.

## 📊 Warum KL-Divergenz?

[Genauigkeit ist nicht alles, was Sie brauchen](https://arxiv.org/pdf/2407.09141) zeigt, wie das Beschneiden von Layern, selbst durch die Auswahl unnötiger, dennoch enorme Unterschiede in Bezug auf „Flips“ erzeugt. Ein „Flip“ ist definiert als ein Wechsel der Antwort von falsch zu richtig oder umgekehrt. Das Paper zeigt, dass MMLU möglicherweise nicht sinkt, wenn wir Layer beschneiden oder quantisieren, aber das liegt daran, dass einige falsche Antworten möglicherweise „geflippt“ sind und korrekt wurden. Unser Ziel ist es, das ursprüngliche Modell zu replizieren, daher ist das Messen von „Flips“ eine gute Kennzahl.

<div><figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-5a97c101b0df31fb49df20ce4241930897098cf8%2Fimage.png?alt=media" alt=""><figcaption></figcaption></figure> <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-e4a60354ad8613b6f2361f63fa82c552e00fdda9%2Fimage.png?alt=media" alt=""><figcaption></figcaption></figure></div>

{% hint style="info" %}
**KL-Divergenz** sollte **einer der Goldstandards für die Berichterstattung über Quantisierungsfehler sein** gemäß dem Forschungspapier „Accuracy is Not All You Need“. **Die Verwendung von Perplexity ist falsch** da sich Ausgabewerte von Tokens aufheben können, daher müssen wir KLD oder härtere Benchmarks verwenden wie [Aider](/docs/de/grundlagen/dynamic-3.0-ggufs/unsloth-dynamic-ggufs-on-aider-polyglot.md).
{% endhint %}

Das Paper zeigt auch interessanterweise, dass KL-Divergenz stark mit Flips korreliert, und daher ist unser Ziel, die mittlere KL-Divergenz zu verringern und gleichzeitig die Zunahme des Festplattenspeichers durch die Quantisierung so gering wie möglich zu halten.

## ⚖️ Überfitting des Kalibrierungsdatensatzes

Die meisten Frameworks berichten Perplexity und KL-Divergenz anhand eines Testsets aus Wikipedia-Artikeln. Uns ist jedoch aufgefallen, dass die Verwendung des Kalibrierungsdatensatzes, der ebenfalls Wikipedia-bezogen ist, dazu führt, dass Quants überfitten und niedrigere Perplexity-Werte erreichen. Wir verwenden [Calibration\_v3](https://gist.github.com/bartowski1182/eb213dccb3571f863da82e99418f81e8) und [Calibration\_v5](https://gist.github.com/tristandruyen/9e207a95c7d75ddf37525d353e00659c/) Datensätze für faire Tests, die unter anderem einige Wikitext-Daten enthalten. <mark style="background-color:red;">**Auch Instruct-Modelle haben einzigartige Chat-Templates, und die Verwendung reiner Text-Kalibrierungsdatensätze ist für Instruct-Modelle nicht effektiv**</mark> (Base-Modelle ja). Tatsächlich werden die meisten imatrix-GGUFs typischerweise mit diesen Problemen kalibriert. Infolgedessen schneiden sie bei KL-Divergenz-Benchmarks, die ebenfalls Wikipedia-Daten verwenden, natürlicherweise besser ab, da das Modell im Wesentlichen für diese Domäne optimiert ist.

Um eine faire und kontrollierte Bewertung zu gewährleisten, verwenden wir beim Benchmarking der KL-Divergenz nicht unseren eigenen Kalibrierungsdatensatz (der für Chat-Leistung optimiert ist). Stattdessen führten wir Tests mit denselben Standard-Wikipedia-Datensätzen durch, sodass wir die Leistung unserer Dynamic-2.0-Methode direkt mit dem Baseline-imatrix-Ansatz vergleichen konnten.

## :1234: Das MMLU-Replikationsabenteuer

* Die Replikation von MMLU 5-shot war ein Albtraum. Wir <mark style="background-color:red;">**konnten**</mark> die MMLU-Ergebnisse für viele Modelle, einschließlich Llama 3.1 (8B) Instruct, Gemma 3 (12B) und andere, nicht reproduzieren, aufgrund von <mark style="background-color:yellow;">**subtilen Implementierungsproblemen**</mark>. Llama 3.1 (8B) sollte beispielsweise \~68,2 % erreichen, während falsche Implementierungen <mark style="background-color:red;">**35 % Genauigkeit.**</mark>

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-cc2b4b2bc512b3c9bc065250930259b9b9a9fce0%2FMMLU%20differences.png?alt=media" alt="" width="375"><figcaption><p>MMLU-Implementierungsprobleme</p></figcaption></figure>

* Llama 3.1 (8B) Instruct hat mit einer naiven MMLU-Implementierung eine 5-shot-MMLU-Genauigkeit von 67,8 %. Wir finden jedoch, dass Llama **tokenisiert "A" und "\_A" (A mit einem Leerzeichen davor) als unterschiedliche Token-IDs**. Wenn wir sowohl Tokens mit als auch ohne Leerzeichen berücksichtigen, erhalten wir 68,2 % <mark style="background-color:green;">(+0.4%)</mark>
* Interessanterweise hängt Llama 3 laut Eleuther AIs [LLM Harness](https://github.com/EleutherAI/lm-evaluation-harness/blob/main/lm_eval/tasks/llama3/instruct/mmlu/_continuation_template_yaml) fügt auch <mark style="background-color:purple;">**"Die beste Antwort ist"**</mark> zur Frage hinzu, gemäß Llama 3s ursprünglichen MMLU-Benchmarks.
* Es gibt viele weitere subtile Probleme, und um alles in einer kontrollierten Umgebung zu benchmarken, haben wir unsere eigene MMLU-Implementierung von Grund auf entwickelt, indem wir [github.com/hendrycks/test](https://github.com/hendrycks/test) direkt untersucht und unsere Ergebnisse über mehrere Modelle hinweg überprüft und mit veröffentlichten Zahlen verglichen haben.

## :sparkles: Gemma 3 QAT-Replikation, Benchmarks

Das Gemma-Team veröffentlichte zwei QAT-(Quantization-Aware-Training)-Versionen von Gemma 3:

1. Q4\_0 GGUF - quantisiert alle Layer auf Q4\_0 über die Formel `w = q * block_scale` wobei jeder Block 32 Gewichte hat. Siehe [llama.cpp-Wiki ](https://github.com/ggml-org/llama.cpp/wiki/Tensor-Encoding-Schemes)für weitere Details.
2. int4-Version – vermutlich [TorchAO-int4-Stil](https://github.com/pytorch/ao/blob/main/torchao/quantization/README.md)?

Wir haben alle Q4\_0-GGUF-Versionen benchmarked und umfangreiche Experimente am 12B-Modell durchgeführt. Wir sehen, dass das **12B Q4\_0 QAT-Modell 67,07 % erreicht** während die vollständige bfloat16-12B-Version bei 5-shot MMLU 67,15 % erreicht. Das ist sehr beeindruckend! Das 27B-Modell ist größtenteils schon fast dort!

<table><thead><tr><th>Metrik</th><th>1B</th><th valign="middle">4B</th><th>12B</th><th>27B</th></tr></thead><tbody><tr><td>MMLU 5-shot</td><td>26.12%</td><td valign="middle">55.13%</td><td><mark style="background-color:blue;"><strong>67,07 % (67,15 % BF16)</strong></mark></td><td><strong>70,64 % (71,5 % BF16)</strong></td></tr><tr><td>Festplattenspeicher</td><td>0,93 GB</td><td valign="middle">2,94 GB</td><td><strong>7,52 GB</strong></td><td>16,05 GB</td></tr><tr><td><mark style="background-color:green;"><strong>Effizienz*</strong></mark></td><td>1.20</td><td valign="middle">10.26</td><td><strong>5.59</strong></td><td>2.84</td></tr></tbody></table>

Wir haben eine neue **Effizienzmetrik** entworfen, die den Nutzen des Modells berechnet und dabei auch seine Festplattengröße und den MMLU-5-shot-Score berücksichtigt:

$$
\text{Efficiency} = \frac{\text{MMLU 5 shot score} - 25}{\text{Disk Space GB}}
$$

{% hint style="warning" %}
Wir müssen **25 abziehen** da MMLU 4 Antwortmöglichkeiten hat – A, B, C oder D. Nehmen wir an, wir bauen ein Modell, das einfach zufällig Antworten auswählt – es würde 25 % Genauigkeit erreichen und nur einige Bytes Festplattenspeicher belegen. Aber offensichtlich ist das kein nützliches Modell.
{% endhint %}

Zur KL-Divergenz im Vergleich zum Basismodell zeigt die folgende Tabelle die Verbesserungen. Erinnerung: Je näher die KL-Divergenz bei 0 liegt, desto besser (d. h. 0 bedeutet identisch zum Full-Precision-Modell)

| Quant     | Baseline-KLD | GB    | Neue KLD | GB    |
| --------- | ------------ | ----- | -------- | ----- |
| IQ1\_S    | 1.035688     | 5.83  | 0.972932 | 6.06  |
| IQ1\_M    | 0.832252     | 6.33  | 0.800049 | 6.51  |
| IQ2\_XXS  | 0.535764     | 7.16  | 0.521039 | 7.31  |
| IQ2\_M    | 0.26554      | 8.84  | 0.258192 | 8.96  |
| Q2\_K\_XL | 0.229671     | 9.78  | 0.220937 | 9.95  |
| Q3\_K\_XL | 0.087845     | 12.51 | 0.080617 | 12.76 |
| Q4\_K\_XL | 0.024916     | 15.41 | 0.023701 | 15.64 |

Wenn wir das Verhältnis von Anstieg des Festplattenspeichers und Änderung des KL-Divergenz-Verhältnisses plotten, sehen wir einen viel klareren Vorteil! Unser dynamisches 2-Bit-Q2\_K\_XL reduziert KLD ziemlich stark (etwa 7,5 %).

<figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-5b352d0449e723556e6e871396c2ee78ae8ec3dc%2Fchart(2).svg?alt=media" alt=""><figcaption></figcaption></figure>

Gekürzte Ergebnistabelle für MMLU für Gemma 3 (27B). Siehe unten.

1. **Unsere dynamische 4-Bit-Version ist 2 GB kleiner und hat dabei +1 % zusätzliche Genauigkeit gegenüber der QAT-Version!**
2. In Sachen Effizienz scheinen 2bit Q2\_K\_XL und andere sehr gut abzuschneiden!

| Quant          | Unsloth   | Unsloth + QAT | Festplattengröße | Effizienz |
| -------------- | --------- | ------------- | ---------------- | --------- |
| IQ1\_M         | 48.10     | 47.23         | 6.51             | 3.42      |
| IQ2\_XXS       | 59.20     | 56.57         | 7.31             | 4.32      |
| IQ2\_M         | 66.47     | 64.47         | 8.96             | 4.40      |
| Q2\_K\_XL      | 68.70     | 67.77         | 9.95             | 4.30      |
| Q3\_K\_XL      | 70.87     | 69.50         | 12.76            | 3.49      |
| **Q4\_K\_XL**  | **71.47** | **71.07**     | **15.64**        | **2.94**  |
| **Google QAT** |           | **70.64**     | **17.2**         | **2.65**  |

<details>

<summary><mark style="color:grün;">Hier klicken</mark> für vollständige Google-Gemma-3-(27B)-QAT-Benchmarks:</summary>

| Modell         | Unsloth   | Unsloth + QAT | Festplattengröße | Effizienz |
| -------------- | --------- | ------------- | ---------------- | --------- |
| IQ1\_S         | 41.87     | 43.37         | 6.06             | 3.03      |
| IQ1\_M         | 48.10     | 47.23         | 6.51             | 3.42      |
| IQ2\_XXS       | 59.20     | 56.57         | 7.31             | 4.32      |
| IQ2\_M         | 66.47     | 64.47         | 8.96             | 4.40      |
| Q2\_K          | 68.50     | 67.60         | 9.78             | 4.35      |
| Q2\_K\_XL      | 68.70     | 67.77         | 9.95             | 4.30      |
| IQ3\_XXS       | 68.27     | 67.07         | 10.07            | 4.18      |
| Q3\_K\_M       | 70.70     | 69.77         | 12.51            | 3.58      |
| Q3\_K\_XL      | 70.87     | 69.50         | 12.76            | 3.49      |
| Q4\_K\_M       | 71.23     | 71.00         | 15.41            | 2.98      |
| **Q4\_K\_XL**  | **71.47** | **71.07**     | **15.64**        | **2.94**  |
| Q5\_K\_M       | 71.77     | 71.23         | 17.95            | 2.58      |
| Q6\_K          | 71.87     | 71.60         | 20.64            | 2.26      |
| Q8\_0          | 71.60     | 71.53         | 26.74            | 1.74      |
| **Google QAT** |           | **70.64**     | **17.2**         | **2.65**  |

</details>

## :llama: Llama-4-Bugfixes + Ausführung

Wir haben außerdem bei einigen Llama-4-Bugs geholfen und diese behoben:

* Llama 4 Scout hat die RoPE-Scaling-Konfiguration in ihrem offiziellen Repo geändert. Wir haben bei der Behebung von Problemen in llama.cpp geholfen, um dies zu ermöglichen [Änderung hier](https://github.com/ggml-org/llama.cpp/pull/12889)

  <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-7ff8229dfa96425f50c2c87f9ca988ef9cc99eff%2Fimage.png?alt=media" alt=""><figcaption></figcaption></figure>
* Das Epsilon von Llama 4s QK Norm für sowohl Scout als auch Maverick sollte aus der Config-Datei stammen – das bedeutet 1e-05 und nicht 1e-06 zu verwenden. Wir haben bei der Behebung dieser Probleme in [llama.cpp](https://github.com/ggml-org/llama.cpp/pull/12889) und [transformers](https://github.com/huggingface/transformers/pull/37418)
* Das Llama-4-Team und vLLM haben außerdem unabhängig voneinander ein Problem behoben, bei dem QK Norm über alle Heads hinweg geteilt wurde (das sollte nicht so sein) [hier](https://github.com/vllm-project/vllm/pull/16311). MMLU Pro stieg von 68,58 % auf 71,53 % Genauigkeit.
* [Wolfram Ravenwolf](https://x.com/WolframRvnwlf/status/1909735579564331016) zeigte, wie unsere GGUFs über llama.cpp eine deutlich höhere Genauigkeit erreichen als Inferenzanbieter von Drittanbietern – dies war höchstwahrscheinlich eine Kombination der oben erläuterten Probleme und vermutlich auch auf Quantisierungsprobleme zurückzuführen.

  <figure><img src="https://797013937-files.gitbook.io/~/files/v0/b/gitbook-x-prod.appspot.com/o/spaces%2FxhOjnexMCB3dmuQFQ2Zq%2Fuploads%2Fgit-blob-76c49d8c8e3e42f7407f431a2cede369f87878e4%2FGoC79hYXwAAPTMs.jpg?alt=media" alt=""><figcaption></figcaption></figure>

Wie in unserem Diagramm gezeigt, liefern unsere 4-Bit-Dynamic-QAT-Quantisierung bessere Leistung bei 5-shot MMLU und sind gleichzeitig kleiner.

### Llama 4 Scout ausführen:

Um beispielsweise Llama 4 Scout auszuführen, klonen Sie zuerst llama.cpp:

```bash
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \\
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
```

Dann laden Sie unsere neue dynamische v 2.0-Quant für Scout herunter:

```python
# !pip install huggingface_hub hf_transfer
import os
os.environ["HF_HUB_ENABLE_HF_TRANSFER"] = "1"
from huggingface_hub import snapshot_download
snapshot_download(
    repo_id = "unsloth/Llama-4-Scout-17B-16E-Instruct-GGUF",
    local_dir = "unsloth/Llama-4-Scout-17B-16E-Instruct-GGUF",
    allow_patterns = ["*IQ2_XXS*"],
)
```

Und los geht's mit der Inferenz!

{% code overflow="wrap" %}

```bash
./llama.cpp/llama-cli \\
    --model unsloth/Llama-4-Scout-17B-16E-Instruct-GGUF/Llama-4-Scout-17B-16E-Instruct-UD-IQ2_XXS.gguf \\
    --threads 32 \\
    --ctx-size 16384 \\
    --n-gpu-layers 99 \\
    -ot ".ffn_.*_exps.=CPU" \\
    --seed 3407 \\
    --prio 3 \\
    --temp 0.6 \\
    --min-p 0.01 \\
    --top-p 0.9 \\
    -no-cnv \\
    --prompt "<|header_start|>user<|header_end|>\n\nErstelle ein Flappy-Bird-Spiel.<|eot|><|header_start|>assistant<|header_end|>\n\n"
```

{% endcode %}

{% hint style="success" %}
Mehr zum Ausführen von Llama 4 hier lesen: <https://docs.unsloth.ai/basics/tutorial-how-to-run-and-fine-tune-llama-4>
{% endhint %}


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/grundlagen/dynamic-3.0-ggufs.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
