For the complete documentation index, see llms.txt. This page is also available as Markdown.

📊Unsloth-Benchmarks

Unsloth hat Benchmarks auf NVIDIA-GPUs gemessen.

Getestet auf H100 und Blackwell GPUs. Wir testeten mit dem Alpaca-Datensatz, einer Batchgröße von 2, Gradient-Accumulation-Schritten von 4, rank = 32, und wendeten QLoRA auf alle linearen Schichten an (q, k, v, o, gate, up, down):

Modell
VRAM
🦥Unsloth-Geschwindigkeit
🦥VRAM-Reduktion
🦥Längerer Kontext
😊Hugging Face + FA2

Llama 3.3 (70B)

80 GB

2x

>75%

13x länger

1x

Llama 3.1 (8B)

80 GB

2x

>70%

12x länger

1x

Kontextlängen-Benchmarks

Je mehr Daten Sie haben, desto weniger VRAM verwendet Unsloth dank unseres Gradient Checkpointing Algorithmus + Apples CCE-Algorithmus!

max. Kontextlänge von Llama 3.1 (8B)

Wir testeten Llama 3.1 (8B) Instruct und führten 4-Bit-QLoRA auf allen linearen Schichten (Q, K, V, O, gate, up und down) mit rank = 32 und einer Batchgröße von 1 durch. Wir paddeten alle Sequenzen auf eine bestimmte maximale Sequenzlänge, um Long-Context-Fine-Tuning-Workloads zu simulieren.

GPU-VRAM
🦥Unsloth-Kontextlänge
Hugging Face + FA2

8 GB

2,972

OOM

12 GB

21,848

932

16 GB

40,724

2,551

24 GB

78,475

5,789

40 GB

153,977

12,264

48 GB

191,728

15,502

80 GB

342,733

28,454

max. Kontextlänge von Llama 3.3 (70B)

Wir testeten Llama 3.3 (70B) Instruct auf einer 80GB A100 und führten 4-Bit-QLoRA auf allen linearen Schichten (Q, K, V, O, gate, up und down) mit rank = 32 und einer Batchgröße von 1 durch. Wir paddeten alle Sequenzen auf eine bestimmte maximale Sequenzlänge, um Long-Context-Fine-Tuning-Workloads zu simulieren.

GPU-VRAM
🦥Unsloth-Kontextlänge
Hugging Face + FA2

48 GB

12,106

OOM

80 GB

89,389

6,916

Zuletzt aktualisiert

War das hilfreich?