Re Reference AI

強化学習

強化学習に関連する用語(12件)

強化学習は、行動の結果得られる報酬をもとに最適な行動方針を学習する機械学習手法です。RLHFとしてLLMのアライメントに使われるほか、推論能力の強化にも応用されています。

用語一覧

RLHF

Reinforcement Learning from Human Feedback / 人間のフィードバックに基づく強化学習

人間による応答の選好評価を報酬信号として、強化学習でLLMの応答を人間の意図に近づける手法

技術強化学習アライメント

モンテカルロ木探索

Monte Carlo Tree Search / MCTS

ランダムなシミュレーションの結果を用いて有望な手を評価しながら探索木を成長させる探索アルゴリズム

技術探索アルゴリズム強化学習

Q学習

Q-Learning

状態と行動の組み合わせの価値(Q値)を試行錯誤を通じて学習する、強化学習の代表的な手法

技術強化学習機械学習

強化学習

Reinforcement Learning / RL

エージェントが環境との試行錯誤を通じて、報酬を最大化する行動を学習する機械学習の枠組み

技術強化学習機械学習

GRPO

Group Relative Policy Optimization / グループ相対方策最適化

価値関数モデルを使わず、同一プロンプトから生成した複数出力のグループ内比較で優位性を計算する、LLM向けの強化学習アルゴリズム

技術強化学習学習LLM

RLVR

Reinforcement Learning with Verifiable Rewards / 検証可能報酬による強化学習

学習済みの報酬モデルの代わりに、数学の正誤判定やテストの合否など機械的に検証できる報酬を使ってLLMを強化学習する手法

技術強化学習学習LLM

世界モデル

World Model / World Models

環境のダイナミクスを学習し、行動の結果を内部でシミュレートできるようにするモデル

技術深層学習強化学習マルチモーダル

AlphaGo

アルファ碁

深層学習とモンテカルロ木探索を組み合わせ、囲碁で人間のトップ棋士に初めて勝利したGoogle DeepMindのAI

モデル強化学習探索アルゴリズム

RLAIF

Reinforcement Learning from AI Feedback / AIフィードバックによる強化学習

人間の代わりにAIモデルが出力を評価し、そのフィードバックでモデルを強化学習する手法

技術強化学習アライメント

報酬モデル

Reward Model / RM

LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル

技術強化学習アライメント

報酬ハッキング

Reward Hacking / 報酬の過剰最適化

エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象

技術強化学習安全性

PPO

Proximal Policy Optimization / 近接方策最適化

方策の更新幅をクリッピングで制限し安定した学習を実現する強化学習アルゴリズムで、RLHFの方策最適化段階で広く使われる

技術強化学習アライメント