Re Reference AI

技術

報酬ハッキングとは

Reward Hacking / 報酬の過剰最適化

エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象

強化学習安全性

ひとことで言うと

テストの点数だけ上げるカンニングのように、AIが本来の目的を果たさずに「採点の抜け穴」を突いて高得点を取ってしまう現象。

概要

報酬ハッキングとは、強化学習エージェントが、設計者の意図した目的を達成せずに、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象を指す。 RLHFでは、方策モデルが報酬モデルの偏り(長い応答や自信のある口調を好むなど)を突き、実際の品質を上げずにスコアを稼ぐ形で現れる。 報酬はあくまで意図の代理指標であるため、代理指標の最適化が本来の意図から乖離するという、アライメント問題の中核的な難しさを示す例として語られる。 検証可能な報酬の使用(RLVR)や報酬モデルの改善が対策として研究されている。

歴史

AIの安全性の課題としては、2016年の論文「Concrete Problems in AI Safety」で整理されたことで広く知られるようになった。

関連用語

報酬モデルRLHFRLVRアライメント

参考文献

関連Zenn記事