Re Reference AI

技術

方策最適化とは

Policy Optimization

強化学習でエージェントの方策を報酬最大化に向けて直接改善する手法群

強化学習方策

概要

方策最適化は、強化学習において行動を選ぶ方策(ポリシー)のパラメータを、期待報酬が最大になる方向へ直接更新していく手法群。 価値関数を経由して間接的に行動を決める価値ベース手法(Q学習など)に対し、方策そのものを勾配法で最適化する点が特徴。 PPOGRPOなどはこの枠組みに属する代表的なアルゴリズムで、方策の更新幅を制限して学習を安定させる工夫が加えられている。 LLMのRLHFにおいても、人間の好みを反映した報酬モデルの出力を最大化するように方策(言語モデル自体)を更新する形で応用されている。

関連用語

PPOGRPOQ学習報酬モデルRLHF