QLoRAとは
Quantized LoRA
ベースモデルを4bitに量子化して凍結し、その上にLoRAを載せて学習するメモリ効率の高いファインチューニング手法
ひとことで言うと
AIモデルを圧縮した状態のまま少しだけ追加学習する方法。大きなモデルの調整が1枚のGPUでもできるようになった。
概要
QLoRAとは、ベースモデルを4bitに量子化して凍結し、その上にLoRAアダプターを載せて学習するファインチューニング手法を指す。 4bit NormalFloat(NF4)量子化や量子化定数の再量子化などの工夫により、精度の低下を抑えながらメモリ使用量を削減する。 65Bパラメータ級のモデルのファインチューニングを単一の48GB GPUで可能にし、大規模モデルの個人や小規模チームによるカスタマイズを現実的にした。
歴史
2023年5月にワシントン大学のDettmersらが論文で発表した。
比較
- LoRA — LoRAがベースモデルを元の精度のまま凍結するのに対し、QLoRAはベースモデルを4bitへ量子化してメモリ使用量をさらに削減する
関連用語
参考文献
- Research PaperQLoRA: Efficient Finetuning of Quantized LLMs (arXiv)