Re Reference AI

技術

敵対的テストとは

Adversarial Testing

モデルを意図的に誤動作させる入力を用いて頑健性・安全性を検証するテスト手法

安全性評価

ひとことで言うと

AIをわざと間違えさせるような入力を試して、弱点がないか確かめるテスト。

概要

敵対的テスト(Adversarial Testing)とは、モデルの判断を誤らせる、または望ましくない出力を引き起こすよう意図的に設計された入力を用いて、システムの頑健性や安全性を検証するテスト手法。 画像分類モデルに微小なノイズを加えて誤分類を誘発する古典的な敵対的サンプルの手法から、LLMに対しジェイルブレイクや有害な出力を誘発するプロンプトを試す手法まで、対象領域に応じた形式で行われる。 Red Teaming(レッドチーミング)が人間の攻撃者視点による探索的な検証を含む広い概念であるのに対し、敵対的テストはより体系的に設計されたテストケースの生成・実行に重点を置くことが多い。

歴史

2014年、GoodfellowらがCNN画像分類器に対する敵対的サンプル(adversarial examples)の存在とその生成手法を示す論文を発表し、敵対的テストという考え方が広く注目されるきっかけとなった。

ワークフロー

テスト対象のモデル・タスクを決定 → 誤動作や有害出力を誘発する入力(敵対的サンプル)を生成 → モデルへ入力し出力を記録 → 想定と異なる挙動を分析 → 発見された弱点をモデルの改善やガードレールの強化へ反映。

利点

  • モデルの弱点を体系的なテストケースとして再現・記録できる
  • 通常の評価データセットでは見逃されやすい頑健性の問題を発見できる

欠点

  • 想定していない種類の攻撃パターンは、テストケースに含まれず見逃されることがある
  • 敵対的サンプルの生成には専門知識と計算コストがかかる

比較

  • レッドチーミングレッドチーミングは人間主導の探索的な検証を含む広い概念、敵対的テストはより体系的なテストケースの実行を指すことが多い
  • 敵対的サンプル敵対的テストは、敵対的サンプルを用いてモデルを検証する手法
  • 敵対的学習敵対的テストで発見された弱点は、敵対的学習によるモデルの頑健化に活用されることがある

関連用語

レッドチーミング敵対的サンプル敵対的学習ガードレール

参考文献