ベンチマーク
ベンチマークに関連する用語(16件)
ベンチマークは、AIモデルの性能を標準化されたタスクで測定・比較するための評価基準です。MMLUやSWE-benchなど、能力の異なる側面を測る多様なベンチマークが開発されています。
用語一覧
MMLU
Massive Multitask Language Understanding
57分野の多岐選択問題でLLMの幅広い知識と理解力を測定するベンチマーク
HumanEval
関数のdocstringからコードを生成させ、テストの合格率でLLMのコーディング能力を測るベンチマーク
SWE-bench
実際のGitHubリポジトリのIssueを解決させ、コーディングエージェントの実務能力を測るベンチマーク
Chatbot Arena
LMArena
人間の実際の投票による対戦形式で、LLM同士の相対的な性能を評価するベンチマークプラットフォーム
LLM-as-a-Judge
LLMジャッジ
人間による評価の代わりに、別のLLMに応答の品質を採点・比較させる評価手法
GSM8K
Grade School Math 8K
小学校レベルの算数文章題8,500問で、LLMの多段階推論能力を測定するベンチマーク
Needle in a Haystack
NIAH / 干し草の中の針
長いコンテキストの中に埋め込んだ短い一文をLLMが正確に検索・想起できるかを測るテスト
TruthfulQA
誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク
HellaSwag
状況説明に続く最も自然な文の続きを4択から選ばせ、常識的な推論力を測るベンチマーク
MT-Bench
Multi-Turn Bench
複数ターンにわたる会話でのLLMの応答品質を、強力な別のLLMに採点させて評価するベンチマーク
Eloレーティング
Elo Rating
対戦結果の勝敗から、相対的な強さを1つの数値で表すレーティングシステム
GPQA
GPQA Diamond / Graduate-Level Google-Proof Q&A
検索しても解けない大学院レベルの科学問題で構成される、高難度の質問応答ベンチマーク
AIME
American Invitational Mathematics Examination
米国の数学コンテストを転用した、LLMの数学的推論能力を測る高難度ベンチマーク
ARC-AGI
Abstraction and Reasoning Corpus / ARC
少数の例示から図形パターンの変換規則を見抜く、抽象化と推論の能力を測るベンチマーク
Humanity's Last Exam
HLE / 人類最後の試験
世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク
MTEB
Massive Text Embedding Benchmark
分類・クラスタリング・検索等の複数タスク・100以上の言語にわたり、テキスト埋め込みモデルの性能を横断的に評価するベンチマーク