評価
評価に分類される用語(23件)
用語一覧
MMLU
Massive Multitask Language Understanding
57分野の多岐選択問題でLLMの幅広い知識と理解力を測定するベンチマーク
HumanEval
関数のdocstringからコードを生成させ、テストの合格率でLLMのコーディング能力を測るベンチマーク
SWE-bench
実際のGitHubリポジトリのIssueを解決させ、コーディングエージェントの実務能力を測るベンチマーク
Chatbot Arena
LMArena
人間の実際の投票による対戦形式で、LLM同士の相対的な性能を評価するベンチマークプラットフォーム
BLEU
Bilingual Evaluation Understudy
機械翻訳の出力と参照訳とのn-gramの一致度から翻訳品質を自動評価する指標
ROUGE
Recall-Oriented Understudy for Gisting Evaluation
生成された要約と参照要約との単語の重なりから、要約品質を自動評価する指標群
適合率
Precision
モデルが陽性と予測した事例のうち、実際に正しかった割合を示す評価指標
再現率
Recall
実際に陽性である事例のうち、モデルが正しく検出できた割合を示す評価指標
F1スコア
F1 Score / F値
適合率と再現率の調和平均により、両者をバランスよく評価する指標
LLM-as-a-Judge
LLMジャッジ
人間による評価の代わりに、別のLLMに応答の品質を採点・比較させる評価手法
Perplexity
パープレキシティ / 困惑度
言語モデルが次のトークンをどれだけ的確に予測できているかを示す、確率に基づく評価指標
GSM8K
Grade School Math 8K
小学校レベルの算数文章題8,500問で、LLMの多段階推論能力を測定するベンチマーク
Needle in a Haystack
NIAH / 干し草の中の針
長いコンテキストの中に埋め込んだ短い一文をLLMが正確に検索・想起できるかを測るテスト
TruthfulQA
誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク
HellaSwag
状況説明に続く最も自然な文の続きを4択から選ばせ、常識的な推論力を測るベンチマーク
MT-Bench
Multi-Turn Bench
複数ターンにわたる会話でのLLMの応答品質を、強力な別のLLMに採点させて評価するベンチマーク
Eloレーティング
Elo Rating
対戦結果の勝敗から、相対的な強さを1つの数値で表すレーティングシステム
GPQA
GPQA Diamond / Graduate-Level Google-Proof Q&A
検索しても解けない大学院レベルの科学問題で構成される、高難度の質問応答ベンチマーク
AIME
American Invitational Mathematics Examination
米国の数学コンテストを転用した、LLMの数学的推論能力を測る高難度ベンチマーク
ARC-AGI
Abstraction and Reasoning Corpus / ARC
少数の例示から図形パターンの変換規則を見抜く、抽象化と推論の能力を測るベンチマーク
Humanity's Last Exam
HLE / 人類最後の試験
世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク
データ汚染
Data Contamination / ベンチマーク汚染 / データコンタミネーション
評価用ベンチマークの問題や解答が学習データへ混入し、評価スコアが実力以上に高く出てしまう問題
MTEB
Massive Text Embedding Benchmark
分類・クラスタリング・検索等の複数タスク・100以上の言語にわたり、テキスト埋め込みモデルの性能を横断的に評価するベンチマーク