Re Reference AI

安全性

安全性に関連する用語(43件)

安全性は、AIが有害な出力や意図しない振る舞いをしないようにするための技術・研究分野です。レッドチーミング、ガードレール、アライメント研究などにより、AIのリスクを低減します。

用語一覧

アライメント

Alignment

LLMの出力を人間の意図・価値観・安全基準に沿わせるための研究・技術分野

技術安全性LLM

プロンプトインジェクション

Prompt Injection

悪意ある指示を入力に紛れ込ませ、LLMに開発者の意図しない挙動をさせる攻撃手法

技術安全性LLM

ジェイルブレイク

Jailbreak

特殊なプロンプトによってLLMに組み込まれた安全性の制約を回避させる手法

技術安全性LLM

データポイズニング

Data Poisoning

学習データに悪意あるデータを混入させ、モデルの挙動を意図的に歪ませる攻撃手法

技術安全性学習

ガードレール

Guardrails

LLMアプリケーションの入出力を監視・制御し、有害な出力や情報漏洩を防ぐための仕組み

技術安全性LLM

PII

Personally Identifiable Information / 個人識別情報

氏名・住所・連絡先等、個人を特定できる情報の総称

技術安全性プライバシー

レッドチーミング

Red Teaming

攻撃者の視点でモデルやシステムの脆弱性を能動的に発見する、AIの安全性検証手法

技術安全性評価

Constitutional AI

CAI / 憲法的AI

人間があらかじめ定めた原則(憲法)に基づき、AI自身に自分の応答を評価・修正させてアライメントするAnthropic発の手法

技術アライメント安全性

Human-in-the-Loop

HITL / 人間参加型

AIの判断や行動の過程に人間の確認・承認を組み込み、誤りや意図しない結果を防ぐ設計パターン

エージェントエージェント安全性

TruthfulQA

誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク

評価ベンチマーク安全性

サンドボックス化

Sandboxing

AIエージェントのコード実行やツール利用を、隔離された安全な環境内に限定する仕組み

エージェントエージェント安全性

AGI

Artificial General Intelligence / 汎用人工知能

特定のタスクに限定されず、人間が行える幅広い知的タスクを人間と同等以上に遂行できるAIの概念

技術人工知能安全性

フロンティアモデル

Frontier Model / フロンティアAI

その時点で最も高い能力を持つ一群の基盤モデルを指す、主に安全性・政策の文脈で使われる言葉

モデルLLM安全性

報酬ハッキング

Reward Hacking / 報酬の過剰最適化

エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象

技術強化学習安全性

ディープフェイク

Deepfake

深層学習で人物の顔・声・動作を合成し、本物と見分けにくい偽の画像・動画・音声を作る技術とその生成物

技術安全性画像生成

説明可能AI

Explainable AI / XAI

AIの判断の根拠を人間が理解できる形で提示するための技術・研究分野

技術信頼性安全性

メカニスティック解釈可能性

Mechanistic Interpretability / 機械論的解釈可能性

ニューラルネットワーク内部の重みや活性を解析し、モデルの内部回路・アルゴリズムの解明を目指す研究分野

技術安全性ニューラルネットワーク

EU AI法

EU AI Act / AI Act / 欧州AI規制法

AIの用途をリスクで分類して禁止や義務を定める、EUによる包括的なAI規制法

技術規制安全性

出力フィルタリング

Output Filtering

LLMが生成したテキストをユーザーへ返す前に検査し、有害な内容や個人情報の漏洩を検知した場合にブロックまたは修正する仕組み

技術安全性LLM

責任あるAI

Responsible AI

AIシステムの設計・開発・運用に公平性・透明性・説明責任などの倫理原則を組み込むための考え方・実践の総称

技術安全性信頼性

AI監査

AI Auditing / Algorithmic Audit

AIシステムのデータ・モデル・出力を体系的に検証し、バイアス・安全性・法令遵守などを評価するプロセス

技術評価安全性

敵対的テスト

Adversarial Testing

モデルを意図的に誤動作させる入力を用いて頑健性・安全性を検証するテスト手法

技術安全性評価

ペネトレーションテスト

Penetration Testing / ペンテスト

許可を得た上でシステムへの侵入・攻撃を模擬的に試み、セキュリティ上の脆弱性を発見する手法

技術安全性評価

価値学習

Value Learning

人間の価値観や選好を明示的なルールでなくデータから帰納的に学習させる、AIアライメント研究のアプローチ

技術安全性アライメント

AI倫理

AI Ethics

AIの開発・利用が個人や社会に与える影響を、公平性・プライバシー・説明責任などの倫理的観点から検討する学際分野

技術安全性信頼性

解釈可能性

Interpretability

モデルの内部構造や判断過程を人間がどの程度理解できるかを表す性質、およびそれを高めるための研究分野

技術安全性信頼性

AI透明性

Transparency / AI Transparency

AIシステムの仕組み・判断根拠・学習データ等を利害関係者へ開示し理解可能にする性質・取り組み

技術安全性信頼性

コンテンツモデレーション

Content Moderation

ユーザー生成コンテンツやAIの生成物から、暴力的表現やヘイトスピーチなどの有害なコンテンツを検出・排除する取り組み

技術安全性LLM

アルゴリズム影響評価

Algorithmic Impact Assessment / AIA

AIシステムの導入前に、人権・公平性・社会への影響を体系的に評価する手続き

技術評価安全性

透明性レポート

Transparency Report

企業が自社サービスにおけるデータ開示要請・コンテンツ削除・AI利用状況等を定期的に公表する報告書

技術評価安全性

公平性

Fairness / AIフェアネス

AIモデルの予測や判断が、性別・人種等の属性によって不当に偏らないことを求める性質・研究領域

技術安全性信頼性

説明責任

Accountability / AIアカウンタビリティ

AIシステムの判断やその影響について、開発者・運用者が責任を負い説明できる状態を確保する原則

技術安全性信頼性

ステアリング

Steering / Activation Steering / Model Steering

モデル内部の活性化を直接操作し、出力のスタイルや性質を狙った方向へ誘導する技術

技術安全性LLM

AI倫理委員会

AI Ethics Board / AI Ethics Committee

組織内でAIの開発・運用に伴う倫理的リスクを審査・監督するために設置される委員会

技術安全性ガバナンス

人間中心AIデザイン

Human-Centered AI Design / HCAI

AIシステムの設計において、性能だけでなく人間のニーズ・能力・信頼を中心に据える設計思想・手法

技術安全性ユーザーインターフェース

AIリテラシー

AI Literacy

AIの仕組み・能力・限界・リスクを理解し、適切に利用・評価するために必要な知識と能力

技術安全性AI教育

コンテンツポリシー

Content Policy / Usage Policy

AIサービスが許可・禁止する利用方法やコンテンツの種類を定めた運用方針

技術安全性利用規約

マルチステークホルダーガバナンス

Multi-stakeholder Governance

政府・企業・市民社会・学術機関等、多様な利害関係者が協働してAIガバナンスの意思決定に関わる統治モデル

技術安全性ガバナンス

参加型設計

Participatory Design

システムの設計プロセスに、実際の利用者や影響を受ける当事者を直接関与させる設計手法

技術安全性ユーザーインターフェース

インクルーシブデザイン

Inclusive Design

年齢・障害・文化的背景等の異なる幅広い利用者が使えることを前提に設計するデザイン手法

技術安全性ユーザーインターフェース

デジタルリテラシー

Digital Literacy

デジタル機器・サービスを適切に活用し、情報の真偽を判断・評価する能力

技術安全性AI教育

批判的思考

Critical Thinking

AIの出力を含む情報を鵜呑みにせず、根拠や妥当性を検証しながら評価・判断する思考態度

技術安全性AI教育

コミュニティ基準

Community Standards / Community Guidelines

プラットフォームの利用者コミュニティ内で許容される行動やコンテンツの範囲を定めた自主的な行動規範

技術安全性利用規約