RLCD(対照的蒸留による強化学習)とは
Reinforcement Learning from Contrastive Distillation / 対照的蒸留による強化学習
正負の属性を対比させたプロンプトで出力ペアを生成し、それを選好データとして報酬モデルを学習する手法
ひとことで言うと
望ましい特徴を強めたプロンプトと、望ましくない特徴を強めたプロンプトの両方でモデルに答えさせ、その差分を「良い回答・悪い回答」のペアとして学習に使う手法。
概要
RLCD(Reinforcement Learning from Contrastive Distillation)とは、同じ入力に対して望ましい属性を強調した正のプロンプトと、望ましくない属性を強調した負のプロンプトをそれぞれ与えてモデルに応答を生成させる手法を指す。 生成した応答ペアを選好データとして、報酬モデルを学習する。 RLAIFのように別のAIモデルに応答を評価(judge)させる工程を必要とせず、対照的なプロンプト設計だけで選好ペアを直接生成する点が特徴。 生成した選好ペアで報酬モデルを学習した後は、RLHFと同様に強化学習(PPO等)で方策モデルを最適化する。 評価役モデルのバイアスが選好データに増幅されて伝わるリスクを避けやすい一方、正負プロンプトの設計品質に選好データの質が左右される。
背景
RLAIFは評価役となる別のAIモデルによるスコアリングを必要とし、評価役自体のバイアスが選好データへ増幅されて伝わるリスクや、評価用モデルの用意・実行コストが課題だった。RLCDは評価役モデルを介さず、対照的な属性プロンプトから直接選好ペアを生成する手法として提案された。
歴史
2023年7月にarXivで発表された論文「RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment」(arXiv:2307.12950)で提唱された。
ワークフロー
入力に正負の属性プロンプトをそれぞれ付加し応答を生成させる → 正プロンプトの応答を選好応答、負プロンプトの応答を非選好応答として選好ペアを構築する(判定用モデル不要) → 選好ペアで報酬モデルを学習する → 報酬モデルで強化学習(PPO等)し方策モデルを最適化する。
利点
欠点
- 正負のプロンプト設計(属性の対比の与え方)の品質に選好データの質が左右されやすい
- 評価役モデルを使わないため、生成モデル自体の能力を超えた評価軸を学習させるのは難しい