📊Unsloth-Benchmarks
Unsloth hat Benchmarks auf NVIDIA-GPUs gemessen.
Zuletzt aktualisiert
War das hilfreich?
Unsloth hat Benchmarks auf NVIDIA-GPUs gemessen.
Für ausführlichere Benchmarks lesen Sie unseren Llama-3.3-Blog.
Das Benchmarking von Unsloth wurde auch durchgeführt von 🤗Hugging Face.
Wenn Ihre Geschwindigkeit anfangs langsamer erscheint, liegt das wahrscheinlich daran, dass torch.compile typischerweise etwa ~5 Minuten (oder länger) zum Aufwärmen und Abschließen der Kompilierung benötigt. Stellen Sie sicher, dass Sie den Durchsatz messen nachdem es vollständig geladen ist, da Unsloth über längere Läufe hinweg deutlich schneller sein sollte.
Getestet auf H100 und Blackwell GPUs. Wir testeten mit dem Alpaca-Datensatz, einer Batchgröße von 2, Gradient-Accumulation-Schritten von 4, rank = 32, und wendeten QLoRA auf alle linearen Schichten an (q, k, v, o, gate, up, down):
Llama 3.3 (70B)
80 GB
2x
>75%
13x länger
1x
Llama 3.1 (8B)
80 GB
2x
>70%
12x länger
1x
Je mehr Daten Sie haben, desto weniger VRAM verwendet Unsloth dank unseres Gradient Checkpointing Algorithmus + Apples CCE-Algorithmus!
Wir testeten Llama 3.1 (8B) Instruct und führten 4-Bit-QLoRA auf allen linearen Schichten (Q, K, V, O, gate, up und down) mit rank = 32 und einer Batchgröße von 1 durch. Wir paddeten alle Sequenzen auf eine bestimmte maximale Sequenzlänge, um Long-Context-Fine-Tuning-Workloads zu simulieren.
8 GB
2,972
OOM
12 GB
21,848
932
16 GB
40,724
2,551
24 GB
78,475
5,789
40 GB
153,977
12,264
48 GB
191,728
15,502
80 GB
342,733
28,454
Wir testeten Llama 3.3 (70B) Instruct auf einer 80GB A100 und führten 4-Bit-QLoRA auf allen linearen Schichten (Q, K, V, O, gate, up und down) mit rank = 32 und einer Batchgröße von 1 durch. Wir paddeten alle Sequenzen auf eine bestimmte maximale Sequenzlänge, um Long-Context-Fine-Tuning-Workloads zu simulieren.
48 GB
12,106
OOM
80 GB
89,389
6,916
Zuletzt aktualisiert
War das hilfreich?
War das hilfreich?

