Re Reference AI

安全性

安全性に関連する用語(18件)

安全性は、AIが有害な出力や意図しない振る舞いをしないようにするための技術・研究分野です。レッドチーミング、ガードレール、アライメント研究などにより、AIのリスクを低減します。

用語一覧

アライメント

Alignment

LLMの出力を人間の意図・価値観・安全基準に沿わせるための研究・技術分野

技術安全性LLM

プロンプトインジェクション

Prompt Injection

悪意ある指示を入力に紛れ込ませ、LLMに開発者の意図しない挙動をさせる攻撃手法

技術安全性LLM

ジェイルブレイク

Jailbreak

特殊なプロンプトによってLLMに組み込まれた安全性の制約を回避させる手法

技術安全性LLM

データポイズニング

Data Poisoning

学習データに悪意あるデータを混入させ、モデルの挙動を意図的に歪ませる攻撃手法

技術安全性学習

ガードレール

Guardrails

LLMアプリケーションの入出力を監視・制御し、有害な出力や情報漏洩を防ぐための仕組み

技術安全性LLM

PII

Personally Identifiable Information / 個人識別情報

氏名・住所・連絡先等、個人を特定できる情報の総称

技術安全性プライバシー

レッドチーミング

Red Teaming

攻撃者の視点でモデルやシステムの脆弱性を能動的に発見する、AIの安全性検証手法

技術安全性評価

Constitutional AI

CAI / 憲法的AI

人間があらかじめ定めた原則(憲法)に基づき、AI自身に自分の応答を評価・修正させてアライメントするAnthropic発の手法

技術アライメント安全性

Human-in-the-Loop

HITL / 人間参加型

AIの判断や行動の過程に人間の確認・承認を組み込み、誤りや意図しない結果を防ぐ設計パターン

エージェントエージェント安全性

TruthfulQA

誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク

評価ベンチマーク安全性

サンドボックス化

Sandboxing

AIエージェントのコード実行やツール利用を、隔離された安全な環境内に限定する仕組み

エージェントエージェント安全性

AGI

Artificial General Intelligence / 汎用人工知能

特定のタスクに限定されず、人間が行える幅広い知的タスクを人間と同等以上に遂行できるAIの概念

技術人工知能安全性

フロンティアモデル

Frontier Model / フロンティアAI

その時点で最も高い能力を持つ一群の基盤モデルを指す、主に安全性・政策の文脈で使われる言葉

モデルLLM安全性

報酬ハッキング

Reward Hacking / 報酬の過剰最適化

エージェントが意図した目的を達成せず、報酬関数の欠陥や抜け穴を突いて報酬だけを最大化する現象

技術強化学習安全性

ディープフェイク

Deepfake

深層学習で人物の顔・声・動作を合成し、本物と見分けにくい偽の画像・動画・音声を作る技術とその生成物

技術安全性画像生成

説明可能AI

Explainable AI / XAI

AIの判断の根拠を人間が理解できる形で提示するための技術・研究分野

技術信頼性安全性

メカニスティック解釈可能性

Mechanistic Interpretability / 機械論的解釈可能性

ニューラルネットワーク内部の重みや活性を解析し、モデルの内部回路・アルゴリズムの解明を目指す研究分野

技術安全性ニューラルネットワーク

EU AI法

EU AI Act / AI Act / 欧州AI規制法

AIの用途をリスクで分類して禁止や義務を定める、EUによる包括的なAI規制法

技術規制安全性