報酬関数(Reward Function)とは
Reward Function
強化学習でエージェントの行動の良し悪しを数値化して与える関数
概要
報酬関数は、強化学習においてエージェントが環境内で取った行動や到達した状態に対して、その望ましさを数値(スカラー値)として返す関数。 エージェントはこの報酬の期待値を最大化するように方策を学習するため、報酬関数の設計はエージェントの挙動を直接左右する。 ゲームのスコアのように明示的な形で定義できる場合もあれば、LLMのRLHFでは人間の好みや評価から報酬モデルとして学習・推定される場合もある。 報酬設計を誤ると、意図しない行動で報酬を稼ぐ「報酬ハッキング」に陥ることがある。