選好学習(好み学習)とは
好み学習 / 人間の好み学習 / Preference Learning
人間による選好(どちらが好ましいか)の比較データからモデルの挙動を学習する手法
概要
選好学習は、2つ以上の出力候補に対して人間が「どちらが好ましいか」を示した比較データをもとに、モデルの出力を人間の好みに沿うよう学習する手法。 絶対的な正解ラベルではなく相対的な優劣の比較を教師信号とする点が特徴で、好ましさを直接数値化しにくいタスク(文章の自然さや有用性など)に適している。 RLHFでは人間の選好データから報酬モデルを学習し、それを用いて方策最適化を行う。 DPO(Direct Preference Optimization)のように、報酬モデルを介さず選好データから直接方策を最適化する手法も登場している。