安全性
安全性に関連する用語(18件)
安全性は、AIが有害な出力や意図しない振る舞いをしないようにするための技術・研究分野です。レッドチーミング、ガードレール、アライメント研究などにより、AIのリスクを低減します。
用語一覧
アライメント
Alignment
LLMの出力を人間の意図・価値観・安全基準に沿わせるための研究・技術分野
プロンプトインジェクション
Prompt Injection
悪意ある指示を入力に紛れ込ませ、LLMに開発者の意図しない挙動をさせる攻撃手法
ジェイルブレイク
Jailbreak
特殊なプロンプトによってLLMに組み込まれた安全性の制約を回避させる手法
データポイズニング
Data Poisoning
学習データに悪意あるデータを混入させ、モデルの挙動を意図的に歪ませる攻撃手法
ガードレール
Guardrails
LLMアプリケーションの入出力を監視・制御し、有害な出力や情報漏洩を防ぐための仕組み
PII
Personally Identifiable Information / 個人識別情報
氏名・住所・連絡先等、個人を特定できる情報の総称
レッドチーミング
Red Teaming
攻撃者の視点でモデルやシステムの脆弱性を能動的に発見する、AIの安全性検証手法
Constitutional AI
CAI / 憲法的AI
人間があらかじめ定めた原則(憲法)に基づき、AI自身に自分の応答を評価・修正させてアライメントするAnthropic発の手法
Human-in-the-Loop
HITL / 人間参加型
AIの判断や行動の過程に人間の確認・承認を組み込み、誤りや意図しない結果を防ぐ設計パターン
TruthfulQA
誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク
サンドボックス化
Sandboxing
AIエージェントのコード実行やツール利用を、隔離された安全な環境内に限定する仕組み
AGI
Artificial General Intelligence / 汎用人工知能
特定のタスクに限定されず、人間が行える幅広い知的タスクを人間と同等以上に遂行できるAIの概念
フロンティアモデル
Frontier Model / フロンティアAI
その時点で最も高い能力を持つ一群の基盤モデルを指す、主に安全性・政策の文脈で使われる言葉
報酬ハッキング
Reward Hacking / 報酬の過剰最適化
エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象
ディープフェイク
Deepfake
深層学習で人物の顔・声・動作を合成し、本物と見分けにくい偽の画像・動画・音声を作る技術とその生成物
説明可能AI
Explainable AI / XAI
AIの判断の根拠を人間が理解できる形で提示するための技術・研究分野
メカニスティック解釈可能性
Mechanistic Interpretability / 機械論的解釈可能性
ニューラルネットワーク内部の重みや活性を解析し、モデルの内部回路・アルゴリズムの解明を目指す研究分野
EU AI法
EU AI Act / AI Act / 欧州AI規制法
AIの用途をリスクで分類して禁止や義務を定める、EUによる包括的なAI規制法