RLAIFとは
Reinforcement Learning from AI Feedback / AIフィードバックによる強化学習
人間の代わりにAIモデルが出力を評価し、そのフィードバックでモデルを強化学習する手法
ひとことで言うと
AIの回答の良し悪しを人間ではなく別のAIに採点させて、その採点結果で学習を進める方法。人手の採点コストを減らせる。
概要
RLAIF(Reinforcement Learning from AI Feedback)とは、人間の代わりにAIモデルが出力の良し悪しを評価し、そのフィードバックを使ってモデルを強化学習する手法を指す。 RLHFは人間による選好ラベルの収集がコストと速度のボトルネックになるため、評価役をAIへ置き換えることで、フィードバック収集を大規模化・高速化する。 AnthropicのConstitutional AIでは、原則(憲法)に基づいてAIが応答を比較評価し、その選好データで学習する方式として使われた。 評価役モデルの偏りがそのまま増幅されるリスクへの注意が必要になる。
歴史
2022年12月にAnthropicがConstitutional AIの論文内で提唱した。
比較
- RLHF — RLHFが人間の選好ラベルから報酬モデルを学習するのに対し、RLAIFは選好の評価自体をAIモデルに行わせる
関連用語
参考文献
- Research PaperConstitutional AI: Harmlessness from AI Feedback (arXiv)