Re Reference AI

評価

評価に分類される用語(23件)

用語一覧

MMLU

Massive Multitask Language Understanding

57分野の多岐選択問題でLLMの幅広い知識と理解力を測定するベンチマーク

評価ベンチマーク知識

HumanEval

関数のdocstringからコードを生成させ、テストの合格率でLLMのコーディング能力を測るベンチマーク

評価ベンチマークコード生成

SWE-bench

実際のGitHubリポジトリのIssueを解決させ、コーディングエージェントの実務能力を測るベンチマーク

評価ベンチマークコーディングエージェント

Chatbot Arena

LMArena

人間の実際の投票による対戦形式で、LLM同士の相対的な性能を評価するベンチマークプラットフォーム

評価ベンチマーク人間評価

BLEU

Bilingual Evaluation Understudy

機械翻訳の出力と参照訳とのn-gramの一致度から翻訳品質を自動評価する指標

評価機械翻訳評価指標

ROUGE

Recall-Oriented Understudy for Gisting Evaluation

生成された要約と参照要約との単語の重なりから、要約品質を自動評価する指標群

評価要約評価指標

適合率

Precision

モデルが陽性と予測した事例のうち、実際に正しかった割合を示す評価指標

評価評価指標分類

再現率

Recall

実際に陽性である事例のうち、モデルが正しく検出できた割合を示す評価指標

評価評価指標分類

F1スコア

F1 Score / F値

適合率と再現率の調和平均により、両者をバランスよく評価する指標

評価評価指標分類

LLM-as-a-Judge

LLMジャッジ

人間による評価の代わりに、別のLLMに応答の品質を採点・比較させる評価手法

評価評価ベンチマーク

Perplexity

パープレキシティ / 困惑度

言語モデルが次のトークンをどれだけ的確に予測できているかを示す、確率に基づく評価指標

評価評価言語モデル

GSM8K

Grade School Math 8K

小学校レベルの算数文章題8,500問で、LLMの多段階推論能力を測定するベンチマーク

評価ベンチマーク推論

Needle in a Haystack

NIAH / 干し草の中の針

長いコンテキストの中に埋め込んだ短い一文をLLMが正確に検索・想起できるかを測るテスト

評価ベンチマークコンテキストウィンドウ

TruthfulQA

誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク

評価ベンチマーク安全性

HellaSwag

状況説明に続く最も自然な文の続きを4択から選ばせ、常識的な推論力を測るベンチマーク

評価ベンチマーク常識推論

MT-Bench

Multi-Turn Bench

複数ターンにわたる会話でのLLMの応答品質を、強力な別のLLMに採点させて評価するベンチマーク

評価ベンチマークLLM-as-a-Judge

Eloレーティング

Elo Rating

対戦結果の勝敗から、相対的な強さを1つの数値で表すレーティングシステム

評価評価ベンチマーク

GPQA

GPQA Diamond / Graduate-Level Google-Proof Q&A

検索しても解けない大学院レベルの科学問題で構成される、高難度の質問応答ベンチマーク

評価ベンチマーク評価

AIME

American Invitational Mathematics Examination

米国の数学コンテストを転用した、LLMの数学的推論能力を測る高難度ベンチマーク

評価ベンチマーク評価

ARC-AGI

Abstraction and Reasoning Corpus / ARC

少数の例示から図形パターンの変換規則を見抜く、抽象化と推論の能力を測るベンチマーク

評価ベンチマーク評価

Humanity's Last Exam

HLE / 人類最後の試験

世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク

評価ベンチマーク評価

データ汚染

Data Contamination / ベンチマーク汚染 / データコンタミネーション

評価用ベンチマークの問題や解答が学習データへ混入し、評価スコアが実力以上に高く出てしまう問題

評価評価データ

MTEB

Massive Text Embedding Benchmark

分類・クラスタリング・検索等の複数タスク・100以上の言語にわたり、テキスト埋め込みモデルの性能を横断的に評価するベンチマーク

評価ベンチマーク埋め込み