Re Reference AI

技術

HG-DAggerとは

Human-Gated DAgger

人間の専門家が自律ポリシー実行中に危険と判断した区間のみ制御を引き取り、その介入データだけを集約して再学習する対話的模倣学習アルゴリズム

模倣学習ロボティクス

ひとことで言うと

ロボットが自動で動いている間、人間が危ないと思った瞬間だけ操作を代わり、その代わった部分だけを学習データとして使う手法。

概要

HG-DAgger(Human-Gated DAgger)は、模倣学習アルゴリズムDAgger(Dataset Aggregation)を、人間の専門家が学習中のポリシーの挙動をリアルタイムで監視し、必要と判断した区間だけ制御を引き取る(gate)方式に変更した対話的模倣学習手法。標準的なDAggerは、学習中のポリシーが訪れた全ての状態に対して専門家が正しい行動ラベルを付与する必要があり、未熟なポリシーをそのまま実行し続けることに伴う安全上のリスクや、専門家によるラベル付け負荷が課題となっていた。HG-DAggerでは、専門家が危険と判断した場面でのみ制御を引き取り、その介入区間で得られた状態と行動のペアだけを集約データセットに追加してポリシーを再学習する。これにより、実機を用いた自律走行やロボット操作など、安全性が重要なタスクにDAggerを適用しやすくしている。

背景

標準的なDAggerは、現在のポリシーを実環境で実行し、訪れた状態に対して専門家が正しい行動を都度ラベル付けすることで分布シフトに対処する。しかし実機のロボットや自動運転車では、未熟なポリシーをそのまま長時間実行させること自体が危険であり、また専門家が全訪問状態にラベルを付ける作業負荷も大きい。HG-DAggerは、人間が制御権を能動的に握る(gate)ことでポリシー実行を安全な範囲に留めつつ、介入区間のデータのみを収集する設計により、この2つの課題への対処を目的として提案された。

歴史

2018年、Michael Kellyらが論文「HG-DAgger: Interactive Imitation Learning with Human Experts」で提案した(ICRA 2019採録)。ベースとなるDAgger自体は、2011年にRossらが論文「A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning」で提案したアルゴリズム。

アーキテクチャ

学習中のポリシーが環境中で行動する間、人間の専門家が並行してその挙動を監視する。専門家は危険または不適切と判断した時点で制御を引き取り(gate)、自ら行動する。人間が制御を握っている間の状態と人間の行動のペアのみを集約データセットに追加し、ポリシーを再学習する。人間が制御を戻すと再びポリシーが行動し、このサイクルを繰り返す。

ワークフロー

1. 現在のポリシーで自律的にタスクを実行させる。 2. 人間の専門家が並行して挙動を監視し、危険または不適切と判断した時点で制御を引き取る(gate)。 3. 人間が操作した区間の状態と行動のペアのみを集約データセットに追加する。 4. 集約データセットを使ってポリシーを再学習する。 5. 制御をポリシーに戻し、手順1に戻る。これを性能が十分になるまで繰り返す。

利点

  • 人間は制御を引き取った区間のみラベル付けすればよく、標準的なDAggerが必要とする全訪問状態への逐一のラベル付け負荷を削減できる
  • 未熟なポリシーの実行を人間が安全な範囲に制限できるため、実機のロボットや自動運転車への適用でも安全性を確保しやすい
  • 介入という行為自体が「その状況でのポリシーの行動は不適切だった」という強いシグナルになり、修正が必要な状況のデータを効率よく収集できる

欠点

  • 人間の専門家が常時監視し即座に介入できる体制が必要で、収集を完全自動化できない
  • いつ制御を引き取るかの判断が専門家の主観に依存し、介入のタイミングや基準のばらつきが収集データの質に影響する
  • 介入が発生した区間のデータしか収集しないため、専門家が問題ないと見逃した状態については分布シフトへの対処が不十分になりうる

比較

  • Diffusion PolicyDiffusion Policyが拡散モデルによる行動生成で多峰性のデモンストレーションを扱う模倣学習手法であるのに対し、HG-DAggerは人間が制御を引き取った介入区間のデータを反復収集し分布シフトに対処する対話的模倣学習アルゴリズムという違いがある
  • 強化学習強化学習が環境からの報酬信号を用いてポリシーを学習するのに対し、HG-DAggerは人間の専門家による介入(実演)からポリシーを学習する模倣学習に分類される

関連用語

Diffusion Policy強化学習

参考文献