方策最適化とは
Policy Optimization
強化学習でエージェントの方策を報酬最大化に向けて直接改善する手法群
概要
方策最適化は、強化学習において行動を選ぶ方策(ポリシー)のパラメータを、期待報酬が最大になる方向へ直接更新していく手法群。 価値関数を経由して間接的に行動を決める価値ベース手法(Q学習など)に対し、方策そのものを勾配法で最適化する点が特徴。 PPOやGRPOなどはこの枠組みに属する代表的なアルゴリズムで、方策の更新幅を制限して学習を安定させる工夫が加えられている。 LLMのRLHFにおいても、人間の好みを反映した報酬モデルの出力を最大化するように方策(言語モデル自体)を更新する形で応用されている。