報酬モデルとは
Reward Model / RM
LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル
ひとことで言うと
AIの回答に点数を付ける「採点係」のAI。人間の好みを学習しておき、本体のAIを鍛えるときの審判になる。
概要
報酬モデルとは、LLMの出力の良し悪しをスコアとして予測するモデルを指す。 RLHFでは、人間がどちらの応答を好むかを示した選好データで報酬モデルを学習し、その後の強化学習で方策モデルの出力を採点する審判として使う。 人間の選好の近似にすぎないため、方策モデルが報酬モデルの穴を突いてスコアだけを稼ぐ報酬ハッキングの対象になりやすく、報酬モデルの品質がアライメント全体の品質を左右する。 推論時に複数の候補から最良の出力を選ぶ検証器としても使われる。
歴史
人間の選好から報酬関数を学習するアプローチは、2017年のChristianoらによる研究が代表的な起点として知られる。
アーキテクチャ
多くの場合、事前学習・指示チューニング済みのLLMをベースに、最終層の隠れ状態から単一のスカラー値を出力する線形層(報酬ヘッド)を追加した構成を取る。学習は、同じプロンプトに対する2つの応答のどちらを人間が好んだかという選好ペアを用い、好まれた応答のスコアが高くなるようBradley-Terryモデルに基づく損失関数で最適化される。
ワークフロー
同一プロンプトに対する複数の応答を用意する → 人間がどちらを好むか選好ラベルを付与する(または別のAIが評価するRLAIF) → 選好ペアから、好まれた応答のスコアが高くなるよう報酬モデルを学習する。学習済みの報酬モデルは、RLHFの強化学習フェーズでの出力採点や、推論時のBest-of-N選択の基準として利用される。
利点
欠点
比較
関連用語
よくある質問
報酬モデル自体はどう学習する?
同一プロンプトへの複数応答に対する人間(またはAI)の選好ペアを集め、好まれた応答により高いスコアを与えるよう、ランキング学習の枠組みで学習する。
報酬ハッキングとは?
方策モデルが、報酬モデルの評価基準の弱点や癖を突くような出力を生成し、実際の応答品質を伴わないまま報酬モデルからのスコアだけを不当に高めてしまう現象。