Re Reference AI

技術

モデル抽出攻撃とは

Model Extraction Attack / Model Stealing

APIへの大量の問い合わせと応答の観察から、対象モデルの挙動を模倣する代替モデルを構築する攻撃

セキュリティLLM

ひとことで言うと

AIに大量の質問を送って答えを集め、そのやり取りだけから似た性能のコピーAIを作ってしまう攻撃。

概要

モデル抽出攻撃は、対象となるMLモデルの内部パラメータへ直接アクセスできない攻撃者が、公開APIへ大量の入力を送信しその応答を収集することで、元のモデルと似た挙動を再現する代替モデル(サロゲートモデル)を学習・構築する攻撃手法。 攻撃者は入力と応答のペアだけを教師データとして扱い、知識蒸留に似た手順で自分のモデルを学習させることで、元のモデルの内部構造や学習データを直接知らなくても、類似した性能の複製モデルを作り出せる場合がある。 API提供者にとっては、モデル自体の知的財産や競争優位性が損なわれるだけでなく、複製されたモデルを踏み台にして、さらに敵対的サンプルの生成や追加の攻撃手法の開発に悪用されるリスクもある。 対策として、応答に含める情報量を絞る、APIの呼び出し回数やパターンを監視して異常なアクセスを検知する、出力に電子透かしを埋め込むといった手法が研究・実践されている。

背景

商用のMLモデルの多くは、パラメータや学習データを非公開にしたままAPI経由でのみ機能を提供しているが、入力と出力の組み合わせを大量に観察できれば、モデルの内部構造がブラックボックスのままでもその挙動を模倣できてしまう。 モデル抽出攻撃は、この入出力の観察だけからモデルの機能的な複製を作れてしまうという、API提供型サービスに共通するリスクとして研究されてきた。

歴史

2016年: Tramèrらが論文「Stealing Machine Learning Models via Prediction APIs」で、複数の商用MLサービスに対するモデル抽出攻撃の実証を発表。 2020年代: LLMの普及に伴い、生成AIサービスに対する応答の模倣・複製リスクも議論の対象に。

欠点

  • モデル提供者の知的財産や競争優位性が、API経由の観察だけで損なわれるリスクがある
  • 複製されたモデルが、さらなる敵対的サンプルの生成など二次的な攻撃の踏み台に使われることがある
  • 検知や対策(応答情報の制限、監視の強化)を導入すると、正規ユーザーの利便性が下がりやすい

比較

  • 知識蒸留モデル抽出攻撃は、入出力ペアからモデルを学習させる点で知識蒸留と技術的に類似するが、正規の許諾なく行われる点が異なる
  • 電子透かし電子透かしは、モデル抽出攻撃で複製された出力の由来を後から追跡する対策の1つとして使われる
  • レッドチーミングモデル抽出攻撃への耐性は、レッドチーミングにおける検証項目の1つとして扱われることがある

関連用語

知識蒸留電子透かしレッドチーミングガードレール

よくある質問

モデル抽出攻撃はなぜ可能なのか?

モデルの内部パラメータを直接見なくても、大量の入力に対する出力の対応関係だけを教師データとして別のモデルを学習させれば、元のモデルに似た挙動を再現できてしまうため。

モデル抽出攻撃への対策は?

応答に含める確率値などの情報量を絞る、APIの呼び出しパターンを監視して異常なアクセスを検知する、出力に電子透かしを埋め込んで複製の追跡を可能にするといった対策が組み合わされる。

参考文献

関連Zenn記事