敵対的データ作成とは
敵対的データ作成とは、AIモデルが誤分類や検出漏れを起こすように、入力データを人間には分かりにくい形で加工する攻撃準備です。人間には同じ画像や文章に見えても、AIの判定だけを狙ってずらす場合があります。
英語表記: Craft Adversarial Data / AML.T0043
何が狙われるのか
対象は画像認識だけではありません。文章分類、音声認識、不正検知、マルウェア検知のように、AIが入力を見て判断する仕組み全般が対象です。たとえば、見た目は同じ請求書でも、AIのOCRや分類器だけが別の項目として読むように加工される可能性があります。
これはプロンプトインジェクションとは違い、自然文の命令でAIをだますというより、入力データそのものを調整してモデルの判断をずらす攻撃です。AI検査を入れるほど、検査をすり抜ける入力も設計されるという見方が必要になります。
Topic人間には同じでもAIには違うことがある
MITRE ATLASの説明では、人間が変更前と同じように知覚できる範囲で加工される場合があるとされています。人の目で見て大丈夫、だけではAI入力の安全確認にならない点が落とし穴です。
現場での対策視点
重要なのは、AIの判定を単独の最終判断にしないこと。入力の正規化、複数モデルでの照合、人間確認、異常値検知を組み合わせる運用が現実的でしょう。特に本人確認、決済、不正検知のような高リスク業務では、AIの自信度だけで通さない設計が欠かせません。
敵対的データ作成に関するよくある質問
- なぜ画像以外の業務でも問題になりますか?
- AIが入力を見て分類・検知する業務なら対象になり得るためです。請求書、音声、文章、不正検知ログなどでも、AIだけが誤って読む加工が問題になります。
- 人間が確認すれば防げますか?
- 人間確認は有効ですが、それだけでは足りません。人間には同じに見えてもAIには違って見える場合があるため、入力の正規化や複数検査も必要です。