アライメント
アライメントに関連する用語(7件)
アライメントは、AIの振る舞いを人間の意図や価値観に沿わせるための技術・研究分野です。RLHFやConstitutional AIなどの手法により、有害な出力の抑制や指示への忠実な応答を実現します。
用語一覧
RLHF
Reinforcement Learning from Human Feedback / 人間のフィードバックに基づく強化学習
人間による応答の選好評価を報酬信号として、強化学習でLLMの応答を人間の意図に近づける手法
技術強化学習アライメント
DPO
Direct Preference Optimization / 直接選好最適化
報酬モデルを別途学習せず、人間の選好データから直接LLMの方策を最適化するアライメント手法
技術アライメントファインチューニング
指示チューニング
Instruction Tuning
多様なタスクを指示文と模範応答のペアとして学習させ、LLMの指示追従能力を高めるファインチューニング手法
技術ファインチューニングアライメント
Constitutional AI
CAI / 憲法的AI
人間があらかじめ定めた原則(憲法)に基づき、AI自身に自分の応答を評価・修正させてアライメントするAnthropic発の手法
技術アライメント安全性
RLAIF
Reinforcement Learning from AI Feedback / AIフィードバックによる強化学習
人間の代わりにAIモデルが出力を評価し、そのフィードバックでモデルを強化学習する手法
技術強化学習アライメント
報酬モデル
Reward Model / RM
LLMの出力の良し悪しをスコアとして予測し、強化学習の審判役を担うモデル
技術強化学習アライメント
PPO
Proximal Policy Optimization / 近接方策最適化
方策の更新幅をクリッピングで制限し安定した学習を実現する強化学習アルゴリズムで、RLHFの方策最適化段階で広く使われる
技術強化学習アライメント