安全性
安全性に関連する用語(43件)
安全性は、AIが有害な出力や意図しない振る舞いをしないようにするための技術・研究分野です。レッドチーミング、ガードレール、アライメント研究などにより、AIのリスクを低減します。
用語一覧
アライメント
Alignment
LLMの出力を人間の意図・価値観・安全基準に沿わせるための研究・技術分野
プロンプトインジェクション
Prompt Injection
悪意ある指示を入力に紛れ込ませ、LLMに開発者の意図しない挙動をさせる攻撃手法
ジェイルブレイク
Jailbreak
特殊なプロンプトによってLLMに組み込まれた安全性の制約を回避させる手法
データポイズニング
Data Poisoning
学習データに悪意あるデータを混入させ、モデルの挙動を意図的に歪ませる攻撃手法
ガードレール
Guardrails
LLMアプリケーションの入出力を監視・制御し、有害な出力や情報漏洩を防ぐための仕組み
PII
Personally Identifiable Information / 個人識別情報
氏名・住所・連絡先等、個人を特定できる情報の総称
レッドチーミング
Red Teaming
攻撃者の視点でモデルやシステムの脆弱性を能動的に発見する、AIの安全性検証手法
Constitutional AI
CAI / 憲法的AI
人間があらかじめ定めた原則(憲法)に基づき、AI自身に自分の応答を評価・修正させてアライメントするAnthropic発の手法
Human-in-the-Loop
HITL / 人間参加型
AIの判断や行動の過程に人間の確認・承認を組み込み、誤りや意図しない結果を防ぐ設計パターン
TruthfulQA
誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク
サンドボックス化
Sandboxing
AIエージェントのコード実行やツール利用を、隔離された安全な環境内に限定する仕組み
AGI
Artificial General Intelligence / 汎用人工知能
特定のタスクに限定されず、人間が行える幅広い知的タスクを人間と同等以上に遂行できるAIの概念
フロンティアモデル
Frontier Model / フロンティアAI
その時点で最も高い能力を持つ一群の基盤モデルを指す、主に安全性・政策の文脈で使われる言葉
報酬ハッキング
Reward Hacking / 報酬の過剰最適化
エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象
ディープフェイク
Deepfake
深層学習で人物の顔・声・動作を合成し、本物と見分けにくい偽の画像・動画・音声を作る技術とその生成物
説明可能AI
Explainable AI / XAI
AIの判断の根拠を人間が理解できる形で提示するための技術・研究分野
メカニスティック解釈可能性
Mechanistic Interpretability / 機械論的解釈可能性
ニューラルネットワーク内部の重みや活性を解析し、モデルの内部回路・アルゴリズムの解明を目指す研究分野
EU AI法
EU AI Act / AI Act / 欧州AI規制法
AIの用途をリスクで分類して禁止や義務を定める、EUによる包括的なAI規制法
出力フィルタリング
Output Filtering
LLMが生成したテキストをユーザーへ返す前に検査し、有害な内容や個人情報の漏洩を検知した場合にブロックまたは修正する仕組み
責任あるAI
Responsible AI
AIシステムの設計・開発・運用に公平性・透明性・説明責任などの倫理原則を組み込むための考え方・実践の総称
AI監査
AI Auditing / Algorithmic Audit
AIシステムのデータ・モデル・出力を体系的に検証し、バイアス・安全性・法令遵守などを評価するプロセス
敵対的テスト
Adversarial Testing
モデルを意図的に誤動作させる入力を用いて頑健性・安全性を検証するテスト手法
ペネトレーションテスト
Penetration Testing / ペンテスト
許可を得た上でシステムへの侵入・攻撃を模擬的に試み、セキュリティ上の脆弱性を発見する手法
価値学習
Value Learning
人間の価値観や選好を明示的なルールでなくデータから帰納的に学習させる、AIアライメント研究のアプローチ
AI倫理
AI Ethics
AIの開発・利用が個人や社会に与える影響を、公平性・プライバシー・説明責任などの倫理的観点から検討する学際分野
解釈可能性
Interpretability
モデルの内部構造や判断過程を人間がどの程度理解できるかを表す性質、およびそれを高めるための研究分野
AI透明性
Transparency / AI Transparency
AIシステムの仕組み・判断根拠・学習データ等を利害関係者へ開示し理解可能にする性質・取り組み
コンテンツモデレーション
Content Moderation
ユーザー生成コンテンツやAIの生成物から、暴力的表現やヘイトスピーチなどの有害なコンテンツを検出・排除する取り組み
アルゴリズム影響評価
Algorithmic Impact Assessment / AIA
AIシステムの導入前に、人権・公平性・社会への影響を体系的に評価する手続き
透明性レポート
Transparency Report
企業が自社サービスにおけるデータ開示要請・コンテンツ削除・AI利用状況等を定期的に公表する報告書
公平性
Fairness / AIフェアネス
AIモデルの予測や判断が、性別・人種等の属性によって不当に偏らないことを求める性質・研究領域
説明責任
Accountability / AIアカウンタビリティ
AIシステムの判断やその影響について、開発者・運用者が責任を負い説明できる状態を確保する原則
ステアリング
Steering / Activation Steering / Model Steering
モデル内部の活性化を直接操作し、出力のスタイルや性質を狙った方向へ誘導する技術
AI倫理委員会
AI Ethics Board / AI Ethics Committee
組織内でAIの開発・運用に伴う倫理的リスクを審査・監督するために設置される委員会
人間中心AIデザイン
Human-Centered AI Design / HCAI
AIシステムの設計において、性能だけでなく人間のニーズ・能力・信頼を中心に据える設計思想・手法
AIリテラシー
AI Literacy
AIの仕組み・能力・限界・リスクを理解し、適切に利用・評価するために必要な知識と能力
コンテンツポリシー
Content Policy / Usage Policy
AIサービスが許可・禁止する利用方法やコンテンツの種類を定めた運用方針
マルチステークホルダーガバナンス
Multi-stakeholder Governance
政府・企業・市民社会・学術機関等、多様な利害関係者が協働してAIガバナンスの意思決定に関わる統治モデル
参加型設計
Participatory Design
システムの設計プロセスに、実際の利用者や影響を受ける当事者を直接関与させる設計手法
インクルーシブデザイン
Inclusive Design
年齢・障害・文化的背景等の異なる幅広い利用者が使えることを前提に設計するデザイン手法
デジタルリテラシー
Digital Literacy
デジタル機器・サービスを適切に活用し、情報の真偽を判断・評価する能力
批判的思考
Critical Thinking
AIの出力を含む情報を鵜呑みにせず、根拠や妥当性を検証しながら評価・判断する思考態度
コミュニティ基準
Community Standards / Community Guidelines
プラットフォームの利用者コミュニティ内で許容される行動やコンテンツの範囲を定めた自主的な行動規範