Re Reference AI

技術

フィードバック最適化とは

Feedback Optimization

人間や別のAIからのフィードバック(評価・報酬信号)をもとにモデルの出力を望ましい方向へ調整する学習手法の総称

強化学習学習

概要

フィードバック最適化は、モデルが生成した出力に対する評価やフィードバック(人間の選好判断、報酬モデルのスコア、AIによる評価など)を学習信号として用い、モデルのパラメータや出力傾向を望ましい方向へ調整していく学習手法全般を指す総称。 RLHF(人間のフィードバックを用いる強化学習)やRLAIF(AIのフィードバックを用いる手法)、DPO(選好データを直接最適化に用いる手法)など、フィードバックの取得元や最適化アルゴリズムの違いによって複数の具体的な手法に分かれる。

比較

  • RLHFRLHFは、人間のフィードバックを報酬モデル経由で用いるフィードバック最適化の代表的手法
  • DPODPOは、報酬モデルを介さず選好データを直接方策最適化に用いるフィードバック最適化の手法
  • RLAIFRLAIFは、人間の代わりにAIによる評価をフィードバックとして用いる手法

関連用語

RLHFDPORLAIF報酬モデル報酬ハッキングアライメント