For the complete documentation index, see llms.txt. This page is also available as Markdown.

📊Unsloth ベンチマーク

UnslothがNVIDIA GPUで記録したベンチマークです。

  • より詳細なベンチマークについては、こちらをご覧ください Llama 3.3 ブログ.

  • Unsloth のベンチマークも次によって実施されました 🤗Hugging Face.

H100 と Blackwell GPU でテストしました。Alpaca データセットを使用し、バッチサイズ 2、勾配累積ステップ 4、rank = 32 でテストし、すべての線形層(q, k, v, o, gate, up, down)に QLoRA を適用しました:

モデル
VRAM
🦥Unsloth の速度
🦥VRAM 削減
🦥より長いコンテキスト
😊Hugging Face + FA2

Llama 3.3 (70B)

80GB

2倍

>75%

13倍長い

1倍

Llama 3.1 (8B)

80GB

2倍

>70%

12倍長い

1倍

コンテキスト長のベンチマーク

データが多いほど、Unsloth が使用する VRAM は少なくなります。これは私たちの 勾配チェックポイント アルゴリズム + Apple の CCE アルゴリズムのおかげです!

Llama 3.1 (8B) の最大コンテキスト長

Llama 3.1 (8B) Instruct をテストし、バッチサイズ 1 で、すべての線形層(Q, K, V, O, gate, up, down)に対して rank = 32 の 4bit QLoRA を実施しました。長文コンテキストのファインチューニング作業を模擬するため、すべてのシーケンスを特定の最大シーケンス長までパディングしました。

GPU VRAM
🦥Unsloth のコンテキスト長
Hugging Face + FA2

8 GB

2,972

OOM

12 GB

21,848

932

16 GB

40,724

2,551

24 GB

78,475

5,789

40 GB

153,977

12,264

48 GB

191,728

15,502

80 GB

342,733

28,454

Llama 3.3 (70B) の最大コンテキスト長

Llama 3.3 (70B) Instruct を 80GB の A100 でテストし、バッチサイズ 1 で、すべての線形層(Q, K, V, O, gate, up, down)に対して rank = 32 の 4bit QLoRA を実施しました。長文コンテキストのファインチューニング作業を模擬するため、すべてのシーケンスを特定の最大シーケンス長までパディングしました。

GPU VRAM
🦥Unsloth のコンテキスト長
Hugging Face + FA2

48 GB

12,106

OOM

80 GB

89,389

6,916

最終更新

役に立ちましたか?