RLHF Evaluation(RLHF評価)とは
RLHF評価
RLHFで調整したモデルが実際に人間の好みや意図に沿っているかを検証する評価プロセス
概要
RLHF Evaluationは、人間のフィードバックによる強化学習(RLHF)で調整したモデルが、実際に人間の意図や好みに沿った出力を行えているかを検証する評価プロセスの総称。 報酬モデル単体の精度評価(人間の選好データに対する予測一致率)、調整前後のモデル出力を比較するWin Rate、有用性・安全性・誠実さなど複数観点での人間評価を組み合わせて行われることが多い。 報酬モデルのスコアを最大化しすぎることで、実際の人間の意図からずれた出力を高く評価してしまう報酬ハッキングが起きていないかの確認も、RLHF評価の重要な観点となる。 TruthfulQAのような安全性・真実性に関するベンチマークも、RLHF調整の副作用を検証する評価の一部として併用されることがある。