模倣学習(Imitation Learning)とは
Imitation Learning
専門家(人間など)の行動デモンストレーションから直接方策を学習する手法
概要
模倣学習は、報酬関数を明示的に設計する代わりに、専門家(人間や既存の熟達した方策)が示した行動のデモンストレーションデータから、エージェントの方策を直接学習する手法。 最も単純な形態である行動クローニング(Behavioral Cloning)は、状態から行動への写像を教師あり学習として学習する。 ただし、デモンストレーションで扱われなかった状況に直面すると、誤りが積み重なりやすいという弱点を持つ。 逆強化学習(Inverse Reinforcement Learning)のように、デモンストレーションから背後にある報酬関数を推定し、それをもとに方策最適化を行うアプローチも用いられる。 報酬設計が難しいロボット制御や自動運転などのタスクで、人間の実演データを活用する手段として利用される。