フィードバック最適化とは
Feedback Optimization
人間や別のAIからのフィードバック(評価・報酬信号)をもとにモデルの出力を望ましい方向へ調整する学習手法の総称
概要
フィードバック最適化は、モデルが生成した出力に対する評価やフィードバック(人間の選好判断、報酬モデルのスコア、AIによる評価など)を学習信号として用い、モデルのパラメータや出力傾向を望ましい方向へ調整していく学習手法全般を指す総称。 RLHF(人間のフィードバックを用いる強化学習)やRLAIF(AIのフィードバックを用いる手法)、DPO(選好データを直接最適化に用いる手法)など、フィードバックの取得元や最適化アルゴリズムの違いによって複数の具体的な手法に分かれる。