報酬モデルとは
Reward Model / RM
LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル
ひとことで言うと
AIの回答に点数を付ける「採点係」のAI。人間の好みを学習しておき、本体のAIを鍛えるときの審判になる。
概要
報酬モデルとは、LLMの出力の良し悪しをスコアとして予測するモデルを指す。 RLHFでは、人間がどちらの応答を好むかを示した選好データで報酬モデルを学習し、その後の強化学習で方策モデルの出力を採点する審判として使う。 人間の選好の近似にすぎないため、方策モデルが報酬モデルの穴を突いてスコアだけを稼ぐ報酬ハッキングの対象になりやすく、報酬モデルの品質がアライメント全体の品質を左右する。 推論時に複数の候補から最良の出力を選ぶ検証器としても使われる。
歴史
人間の選好から報酬関数を学習するアプローチは、2017年のChristianoらによる研究が代表的な起点として知られる。