AIを安全に保つための仕組み・取り組みです。
収録89語- Agent Activity Monitoring
- Agent Permissions
- AI Control
- AIエージェントセキュリティ
- AIサイコシス
- AIセキュリティ
- AIセーフティに関するレッドチーミング手法ガイド
- AIセーフティに関する評価観点ガイド
- AIセーフティ・アプローチブック えーあいせーふてぃあぷろーちぶっく
- AIセーフティ評価ツール えーあいせーふてぃひょうかつーる
- AIドゥーマー
- AIファイアウォール
- AIリスクアセスメント
- AI品質保証 えーあいひんしつほしょう
- AI安全性 えーあいあんぜんせい
- Chain-of-Thought Monitorability
- Codex Security コーデックスセキュリティ
- Constitutional Classifiers コンスティテューショナルクラシファイアーズ
- Control Agents コントロールエージェンツ
- Counterfactual Composition Testing
- d/acc
- Decel デセル
- Deliberative Alignment
- DSPM for AI
- Golden Gate Claude
- GPT-Red
- Incident Disclosure
- Inference-Time Intervention
- Inoculation Prompting
- International Network of AI Safety Institutes
- Latent Adversarial Training
- Llama Guard らまがーど
- OpenAI Daybreak オープンエーアイデイブレイク
- OpenAI workload identity federation
- OpenAIモデレーションスコア
- OWASP Top 10 for LLM
- P(doom)
- Patch the Planet パッチザプラネット
- Pre-deployment Testing
- Representation Engineering
- Scalable Oversight スケーラブルオーバーサイト
- TESCREAL
- Weak-to-Strong Generalization
- WMDPベンチマーク
- アインシュタイン・トラストレイヤー
- アクティベーションステアリング
- アラインメント
- アラインメントフェイキング
- エージェント型ミスアライメント
- 解釈可能性 かいしゃくかのうせい
- 外部アライメント がいぶあらいめんと
- 外部メールグラウンディング制御 がいぶめーるぐらうんでぃんぐせいぎょ
- ガーディアンエージェント
- ガードレール
- 機械論的解釈可能性 きかいろんてきかいしゃくかのうせい
- 危険能力評価 きけんのうりょくひょうか
- 矯正可能性 きょうせいかのうせい
- グッドハートの法則 ぐっどはーとのほうそく
- 憲法AI けんぽうえーあい
- コンテンツモデレーション
- サーキットブレイカー
- システムカード
- 手段的収束 しゅだんてきしゅうそく
- 仕様の悪用 しようのあくよう
- 自己複製 じこふくせい
- スキーミング
- スパースオートエンコーダー
- スポットライティング
- 説明可能なAI せつめいかのうなえーあい
- ゼロトラスト実行時アーキテクチャ ぜろとらすとじっこうじあーきてくちゃ
- 創発的ミスアライメント そうはつてきみすあらいめんと
- 多層防御 たそうぼうぎょ
- 直交性仮説 ちょっこうせいかせつ
- 敵対的学習 てきたいてきがくしゅう
- デセプティブアライメント
- 電子透かし でんしすかし
- 内部アライメント ないぶあらいめんと
- プロンプトシールド
- ヘルスケア領域におけるAIセーフティ評価観点ガイド へるすけありょういきにおけるえーあいせーふてぃひょうかかんてんがいど
- 報酬の過剰最適化 ほうしゅうのかじょうさいてきか
- 報酬ハッキング ほうしゅうハッキング
- 目標の誤汎化 もくひょうのごはんか
- モデルウェルフェア
- モデルスペック
- リスクの高いAI利用ポリシー りすくのたかいエーアイりようぽりしー
- リスクの高いエージェントポリシー りすくのたかいえーじぇんとぽりしー
- レッドチーミング
- ロックダウンモード
- ワルイージ効果