Re Reference AI

技術

QLoRAとは

Quantized LoRA

ベースモデルを4bitに量子化して凍結し、その上にLoRAを載せて学習するメモリ効率の高いファインチューニング手法

ファインチューニング量子化

ひとことで言うと

AIモデルを圧縮した状態のまま少しだけ追加学習する方法。大きなモデルの調整が1枚のGPUでもできるようになった。

概要

QLoRAとは、ベースモデルを4bitに量子化して凍結し、その上にLoRAアダプターを載せて学習するファインチューニング手法を指す。 4bit NormalFloat(NF4)量子化量子化定数の再量子化などの工夫により、精度の低下を抑えながらメモリ使用量を削減する。 65Bパラメータ級のモデルのファインチューニングを単一の48GB GPUで可能にし、大規模モデルの個人や小規模チームによるカスタマイズを現実的にした。

歴史

2023年5月にワシントン大学のDettmersらが論文で発表した。

比較

  • LoRALoRAがベースモデルを元の精度のまま凍結するのに対し、QLoRAはベースモデルを4bitへ量子化してメモリ使用量をさらに削減する

関連用語

LoRA量子化PEFTINT4ファインチューニング

参考文献

関連Zenn記事