AIを安全に使うために。
情報漏洩・なりすまし・誤情報など、知っておきたいリスクと対策の用語をまとめます。
収録199語情報漏洩・プライバシー 23語
AIで起こりうる情報漏洩やプライバシーの論点です。
- Data Privacy Risk
- DLP for Microsoft 365 Copilot
- GeminiアプリeDiscovery検索
- GeminiアプリVault保持ルール
- GeminiアプリVault訴訟ホールド
- Geminiアプリの一時チャット じぇみないあぷりのいちじちゃっと
- Geminiアプリ会話削除
- Sensitive Information Disclosure
- SharePoint制限検索 せいげんけんさく
- Weight Exfiltration
- 学習データ抽出 がくしゅうでーたちゅうしゅつ
- 機密プロンプトブロック きみつぷろんぷとぶろっく
- 個人情報検出AI こじんじょうほうけんしゅつえーあい
- 差分プライバシー さぶんぷらいばしー
- シャドーAI
- 信頼実行環境 しんらいじっこうかんきょう
- 準同型暗号 じゅんどうけいあんごう
- 秘密計算 ひみつけいさん
- プライベートAI
- マシンアンラーニング
- メンバーシップ推論攻撃
- モデル反転攻撃
- 連合学習 れんごうがくしゅう
攻撃・脆弱性 67語
AIを狙う攻撃や脆弱性にかかわる用語です。
- AdvBench
- Agentic Runtime Supply Chain
- AI Package Hallucination
- AIシステムに対する既知の攻撃と影響 えーあいしすてむにたいするきちのこうげきとえいきょう
- AIワーム
- AutoDAN
- AutoPrompt
- DAN
- Data Supply Chain Attack
- Direct Model Tampering
- Environment-Injected Memory Poisoning
- Excessive Agency
- FGSM
- HarmBench
- Improper Output Handling
- Information Security for GenAI
- Lethal Trifecta
- LLM Supply Chain
- LLMハルシネーションの発見 はつけん
- MCP Tool Poisoning
- Multi-Turn Jailbreak
- OWASP オワスプ
- PAIR
- PGD
- Prefilling Attack
- RAG索引対象の収集 らぐさくいんたいしょうのしゅうしゅう
- Reward Tampering
- Sandbagging サンドバッギング
- Semantic Norm Drift
- Situational Awareness
- SQLインジェクション エスキューエルインジェクション
- System Prompt Leakage
- TAP
- Tool Hijacking
- Tool Supply Chain Attack
- Trust Laundering Chain
- Vector and Embedding Weaknesses
- Vulnerable LoRA Adapter
- Vulnerable Pre-Trained Model
- Weak Model Provenance
- 回避攻撃 かいひこうげき
- 間接的プロンプトインジェクション かんせつてきプロンプトインジェクション
- クレッシェンド攻撃
- グリッチトークン
- ジェイルブレイク
- スケルトンキー
- スリーパーエージェント
- スロップスクワッティング
- 敵対的機械学習 てきたいてききかいがくしゅう
- 敵対的サフィックス攻撃 てきたいてきさふぃっくすこうげき
- 敵対的サンプル てきたいてきさんぷる
- 敵対的摂動 てきたいてきせつどう
- 敵対的データ作成 てきたいてきでーたさくせい
- 敵対的パッチ てきたいてきぱっち
- データポイズニング
- バックドア攻撃
- プロンプトインジェクション
- プロンプトウェア
- プロンプトウェアキルチェーン
- プロンプトリーク
- ベストオブN・ジェイルブレイク
- メニーショット・ジェイルブレイク
- メモリポイズニング
- モデルDoS
- モデル抽出攻撃
- ユニバーサルジェイルブレイク
- ロールコンフュージョン
誤情報・偏り 15語
誤情報・バイアス・なりすましなど、AIの出力の落とし穴です。
安全を守るしくみ 89語
AIを安全に保つための仕組み・取り組みです。
- Agent Activity Monitoring
- Agent Permissions
- AI Control
- AIエージェントセキュリティ
- AIサイコシス
- AIセキュリティ
- AIセーフティに関するレッドチーミング手法ガイド
- AIセーフティに関する評価観点ガイド
- AIセーフティ・アプローチブック えーあいせーふてぃあぷろーちぶっく
- AIセーフティ評価ツール えーあいせーふてぃひょうかつーる
- AIドゥーマー
- AIファイアウォール
- AIリスクアセスメント
- AI品質保証 えーあいひんしつほしょう
- AI安全性 えーあいあんぜんせい
- Chain-of-Thought Monitorability
- Codex Security コーデックスセキュリティ
- Constitutional Classifiers コンスティテューショナルクラシファイアーズ
- Control Agents コントロールエージェンツ
- Counterfactual Composition Testing
- d/acc
- Decel デセル
- Deliberative Alignment
- DSPM for AI
- Golden Gate Claude
- GPT-Red
- Incident Disclosure
- Inference-Time Intervention
- Inoculation Prompting
- International Network of AI Safety Institutes
- Latent Adversarial Training
- Llama Guard らまがーど
- OpenAI Daybreak オープンエーアイデイブレイク
- OpenAI workload identity federation
- OpenAIモデレーションスコア
- OWASP Top 10 for LLM
- P(doom)
- Patch the Planet パッチザプラネット
- Pre-deployment Testing
- Representation Engineering
- Scalable Oversight スケーラブルオーバーサイト
- TESCREAL
- Weak-to-Strong Generalization
- WMDPベンチマーク
- アインシュタイン・トラストレイヤー
- アクティベーションステアリング
- アラインメント
- アラインメントフェイキング
- エージェント型ミスアライメント
- 解釈可能性 かいしゃくかのうせい
- 外部アライメント がいぶあらいめんと
- 外部メールグラウンディング制御 がいぶめーるぐらうんでぃんぐせいぎょ
- ガーディアンエージェント
- ガードレール
- 機械論的解釈可能性 きかいろんてきかいしゃくかのうせい
- 危険能力評価 きけんのうりょくひょうか
- 矯正可能性 きょうせいかのうせい
- グッドハートの法則 ぐっどはーとのほうそく
- 憲法AI けんぽうえーあい
- コンテンツモデレーション
- サーキットブレイカー
- システムカード
- 手段的収束 しゅだんてきしゅうそく
- 仕様の悪用 しようのあくよう
- 自己複製 じこふくせい
- スキーミング
- スパースオートエンコーダー
- スポットライティング
- 説明可能なAI せつめいかのうなえーあい
- ゼロトラスト実行時アーキテクチャ ぜろとらすとじっこうじあーきてくちゃ
- 創発的ミスアライメント そうはつてきみすあらいめんと
- 多層防御 たそうぼうぎょ
- 直交性仮説 ちょっこうせいかせつ
- 敵対的学習 てきたいてきがくしゅう
- デセプティブアライメント
- 電子透かし でんしすかし
- 内部アライメント ないぶあらいめんと
- プロンプトシールド
- ヘルスケア領域におけるAIセーフティ評価観点ガイド へるすけありょういきにおけるえーあいせーふてぃひょうかかんてんがいど
- 報酬の過剰最適化 ほうしゅうのかじょうさいてきか
- 報酬ハッキング ほうしゅうハッキング
- 目標の誤汎化 もくひょうのごはんか
- モデルウェルフェア
- モデルスペック
- リスクの高いAI利用ポリシー りすくのたかいエーアイりようぽりしー
- リスクの高いエージェントポリシー りすくのたかいえーじぇんとぽりしー
- レッドチーミング
- ロックダウンモード
- ワルイージ効果