強化学習
強化学習に関連する用語(22件)
強化学習は、行動の結果得られる報酬をもとに最適な行動方針を学習する機械学習手法です。RLHFとしてLLMのアライメントに使われるほか、推論能力の強化にも応用されています。
用語一覧
RLHF
Reinforcement Learning from Human Feedback / 人間のフィードバックに基づく強化学習
人間による応答の選好評価を報酬信号として、強化学習でLLMの応答を人間の意図に近づける手法
モンテカルロ木探索
Monte Carlo Tree Search / MCTS
ランダムなシミュレーションの結果を用いて有望な手を評価しながら探索木を成長させる探索アルゴリズム
Q学習
Q-Learning
状態と行動の組み合わせの価値(Q値)を試行錯誤を通じて学習する、強化学習の代表的な手法
強化学習
Reinforcement Learning / RL
エージェントが環境との試行錯誤を通じて、報酬を最大化する行動を学習する機械学習の枠組み
GRPO
Group Relative Policy Optimization / グループ相対方策最適化
価値関数モデルを使わず、同一プロンプトから生成した複数出力のグループ内比較で優位性を計算する、LLM向けの強化学習アルゴリズム
RLVR
Reinforcement Learning with Verifiable Rewards / 検証可能報酬による強化学習
学習済みの報酬モデルの代わりに、数学の正誤判定やテストの合否など機械的に検証できる報酬を使ってLLMを強化学習する手法
世界モデル
World Model / World Models
環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル
AlphaGo
アルファ碁
深層学習とモンテカルロ木探索を組み合わせ、囲碁で人間のトップ棋士に初めて勝利したGoogle DeepMindのAI
RLAIF
Reinforcement Learning from AI Feedback / AIフィードバックによる強化学習
人間の代わりにAIモデルが出力を評価し、そのフィードバックでモデルを強化学習する手法
報酬モデル
Reward Model / RM
LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル
報酬ハッキング
Reward Hacking / 報酬の過剰最適化
エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象
PPO
Proximal Policy Optimization / 近接方策最適化
方策の更新幅をクリッピングで制限し安定した学習を実現する強化学習アルゴリズムで、RLHFの方策最適化段階で広く使われる
LeRobot
Hugging Faceが開発する、模倣学習・強化学習によるロボット制御を実践的に扱うPyTorchベースのオープンソースライブラリ
逆強化学習
Inverse Reinforcement Learning / IRL
専門家の行動データから、その行動の背後にある報酬関数を推定する強化学習の枠組み
方策最適化
Policy Optimization
強化学習でエージェントの方策を報酬最大化に向けて直接改善する手法群
報酬関数
Reward Function
強化学習でエージェントの行動の良し悪しを数値化して与える関数
選好学習
好み学習 / 人間の好み学習 / Preference Learning
人間による選好(どちらが好ましいか)の比較データからモデルの挙動を学習する手法
経験リプレイ
Experience Replay
過去の行動履歴をバッファに蓄積し再利用することで強化学習の学習効率と安定性を高める手法
模倣学習
Imitation Learning
専門家(人間など)の行動デモンストレーションから直接方策を学習する手法
フィードバック最適化
Feedback Optimization
人間や別のAIからのフィードバック(評価・報酬信号)をもとにモデルの出力を望ましい方向へ調整する学習手法の総称
軌跡学習
Trajectory Learning
エージェントが環境内で観測した状態と取った行動の時系列(軌跡)データから、方策や環境のダイナミクスを学習する手法の総称
Jev
TypeSafe AIが2026年9月に発表した、文字列を生成せず型安全な構造化決定を並列出力する「System One Model」