Re Reference AI

評価

評価に関連する用語(27件)

評価は、AIモデルやシステムの性能・品質を測定する活動です。ベンチマーク、人間評価、LLM-as-a-Judgeなど多様な手法があり、モデル開発と改善の指針となります。

用語一覧

レッドチーミング

Red Teaming

攻撃者の視点でモデルやシステムの脆弱性を能動的に発見する、AIの安全性検証手法

技術安全性評価

LLMOps

LLM Operations

LLMを組み込んだアプリケーションの開発・評価・デプロイ・運用を継続的に行うための一連のプラクティスと基盤

インフラ再現性評価

LLM-as-a-Judge

LLMジャッジ

人間による評価の代わりに、別のLLMに応答の品質を採点・比較させる評価手法

評価評価ベンチマーク

Perplexity

パープレキシティ / 困惑度

言語モデルが次のトークンをどれだけ的確に予測できているかを示す、確率に基づく評価指標

評価評価言語モデル

Eloレーティング

Elo Rating

対戦結果の勝敗から、相対的な強さを1つの数値で表すレーティングシステム

評価評価ベンチマーク

モデルカード

Model Card

機械学習モデルの用途・性能・制限・倫理的考慮事項を整理して公開する標準的なドキュメント形式

技術信頼性評価

GPQA

GPQA Diamond / Graduate-Level Google-Proof Q&A

検索しても解けない大学院レベルの科学問題で構成される、高難度の質問応答ベンチマーク

評価ベンチマーク評価

AIME

American Invitational Mathematics Examination

米国の数学コンテストを転用した、LLMの数学的推論能力を測る高難度ベンチマーク

評価ベンチマーク評価

ARC-AGI

Abstraction and Reasoning Corpus / ARC

少数の例示から図形パターンの変換規則を見抜く、抽象化と推論の能力を測るベンチマーク

評価ベンチマーク評価

Humanity's Last Exam

HLE / 人類最後の試験

世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク

評価ベンチマーク評価

データ汚染

Data Contamination / ベンチマーク汚染 / データコンタミネーション

評価用ベンチマークの問題や解答が学習データへ混入し、評価スコアが実力以上に高く出てしまう問題

評価評価データ

正解データ

Ground Truth / 正解ラベル

モデルの予測や生成結果を評価・学習する際に基準とする、正しいとされるデータやラベル

技術データ評価

汎化性能

般化能力 / 汎化能力 / Generalization

学習に使っていない未知のデータに対してモデルが適切に予測できる能力

技術機械学習評価

人間評価

Human Evaluation

自動評価指標だけでは測れないモデル出力の質を人間の判断で評価する手法

評価評価アノテーション

主観評価

Subjective Evaluation

評価者個人の感覚や印象に基づいてモデル出力の質を判断する評価手法

評価評価人間評価

A/Bテスト

A/B Testing

2つ以上のバリエーションをユーザーに提示し実際の反応の差を統計的に比較する評価手法

評価評価実験

Evaluation Harmageddon

ベンチマークの汚染・飽和・再現性低下によりLLM評価の信頼性が揺らいでいる状況を指す語

評価評価ベンチマーク

RLHF Evaluation

RLHF評価

RLHFで調整したモデルが実際に人間の好みや意図に沿っているかを検証する評価プロセス

評価評価RLHF

スケーリング限界

Scaling Limits / スケーリングの壁

モデルサイズ・データ量・計算量を増やしても性能向上が鈍化・停滞する現象

技術スケーリング評価

推論能力の限界

Reasoning Limitations

推論モデルでも複雑な論理的・数学的推論において精度が低下し、頑健性を欠く現象

技術推論評価

訓練-評価乖離

Train-Eval Gap / Train-Test Mismatch

学習時の性能指標と、実運用・評価時の性能とが一致しない現象

技術評価機械学習

長文脈理解の限界

Long-Context Limitations / Lost in the Middle

コンテキストウィンドウが長くなるほど、入力中の情報を正確に参照・活用する精度が低下する現象

技術コンテキストウィンドウ評価

AI監査

AI Auditing / Algorithmic Audit

AIシステムのデータ・モデル・出力を体系的に検証し、バイアス・安全性・法令遵守などを評価するプロセス

技術評価安全性

敵対的テスト

Adversarial Testing

モデルを意図的に誤動作させる入力を用いて頑健性・安全性を検証するテスト手法

技術安全性評価

ペネトレーションテスト

Penetration Testing / ペンテスト

許可を得た上でシステムへの侵入・攻撃を模擬的に試み、セキュリティ上の脆弱性を発見する手法

技術安全性評価

アルゴリズム影響評価

Algorithmic Impact Assessment / AIA

AIシステムの導入前に、人権・公平性・社会への影響を体系的に評価する手続き

技術評価安全性

透明性レポート

Transparency Report

企業が自社サービスにおけるデータ開示要請・コンテンツ削除・AI利用状況等を定期的に公表する報告書

技術評価安全性