📊Unsloth ベンチマーク
UnslothがNVIDIA GPUで記録したベンチマークです。
最終更新
役に立ちましたか?
UnslothがNVIDIA GPUで記録したベンチマークです。
より詳細なベンチマークについては、こちらをご覧ください Llama 3.3 ブログ.
Unsloth のベンチマークも次によって実施されました 🤗Hugging Face.
最初は速度が遅く見える場合、それはおそらく torch.compile がウォームアップしてコンパイルを完了するのに通常約5分(またはそれ以上)かかるためです。スループットは必ず測定してください 後で 完全に読み込まれた後は、長時間の実行では Unsloth のほうがはるかに高速であるはずです。
H100 と Blackwell GPU でテストしました。Alpaca データセットを使用し、バッチサイズ 2、勾配累積ステップ 4、rank = 32 でテストし、すべての線形層(q, k, v, o, gate, up, down)に QLoRA を適用しました:
Llama 3.3 (70B)
80GB
2倍
>75%
13倍長い
1倍
Llama 3.1 (8B)
80GB
2倍
>70%
12倍長い
1倍
データが多いほど、Unsloth が使用する VRAM は少なくなります。これは私たちの 勾配チェックポイント アルゴリズム + Apple の CCE アルゴリズムのおかげです!
Llama 3.1 (8B) Instruct をテストし、バッチサイズ 1 で、すべての線形層(Q, K, V, O, gate, up, down)に対して rank = 32 の 4bit QLoRA を実施しました。長文コンテキストのファインチューニング作業を模擬するため、すべてのシーケンスを特定の最大シーケンス長までパディングしました。
8 GB
2,972
OOM
12 GB
21,848
932
16 GB
40,724
2,551
24 GB
78,475
5,789
40 GB
153,977
12,264
48 GB
191,728
15,502
80 GB
342,733
28,454
Llama 3.3 (70B) Instruct を 80GB の A100 でテストし、バッチサイズ 1 で、すべての線形層(Q, K, V, O, gate, up, down)に対して rank = 32 の 4bit QLoRA を実施しました。長文コンテキストのファインチューニング作業を模擬するため、すべてのシーケンスを特定の最大シーケンス長までパディングしました。
48 GB
12,106
OOM
80 GB
89,389
6,916
最終更新
役に立ちましたか?
役に立ちましたか?

