強化学習
強化学習に関連する用語(12件)
強化学習は、行動の結果得られる報酬をもとに最適な行動方針を学習する機械学習手法です。RLHFとしてLLMのアライメントに使われるほか、推論能力の強化にも応用されています。
用語一覧
RLHF
Reinforcement Learning from Human Feedback / 人間のフィードバックに基づく強化学習
人間による応答の選好評価を報酬信号として、強化学習でLLMの応答を人間の意図に近づける手法
モンテカルロ木探索
Monte Carlo Tree Search / MCTS
ランダムなシミュレーションの結果を用いて有望な手を評価しながら探索木を成長させる探索アルゴリズム
Q学習
Q-Learning
状態と行動の組み合わせの価値(Q値)を試行錯誤を通じて学習する、強化学習の代表的な手法
強化学習
Reinforcement Learning / RL
エージェントが環境との試行錯誤を通じて、報酬を最大化する行動を学習する機械学習の枠組み
GRPO
Group Relative Policy Optimization / グループ相対方策最適化
価値関数モデルを使わず、同一プロンプトから生成した複数出力のグループ内比較で優位性を計算する、LLM向けの強化学習アルゴリズム
RLVR
Reinforcement Learning with Verifiable Rewards / 検証可能報酬による強化学習
学習済みの報酬モデルの代わりに、数学の正誤判定やテストの合否など機械的に検証できる報酬を使ってLLMを強化学習する手法
世界モデル
World Model / World Models
環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル
AlphaGo
アルファ碁
深層学習とモンテカルロ木探索を組み合わせ、囲碁で人間のトップ棋士に初めて勝利したGoogle DeepMindのAI
RLAIF
Reinforcement Learning from AI Feedback / AIフィードバックによる強化学習
人間の代わりにAIモデルが出力を評価し、そのフィードバックでモデルを強化学習する手法
報酬モデル
Reward Model / RM
LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル
報酬ハッキング
Reward Hacking / 報酬の過剰最適化
エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象
PPO
Proximal Policy Optimization / 近接方策最適化
方策の更新幅をクリッピングで制限し安定した学習を実現する強化学習アルゴリズムで、RLHFの方策最適化段階で広く使われる