Re Reference AI

ベンチマーク

ベンチマークに関連する用語(16件)

ベンチマークは、AIモデルの性能を標準化されたタスクで測定・比較するための評価基準です。MMLUやSWE-benchなど、能力の異なる側面を測る多様なベンチマークが開発されています。

用語一覧

MMLU

Massive Multitask Language Understanding

57分野の多岐選択問題でLLMの幅広い知識と理解力を測定するベンチマーク

評価ベンチマーク知識

HumanEval

関数のdocstringからコードを生成させ、テストの合格率でLLMのコーディング能力を測るベンチマーク

評価ベンチマークコード生成

SWE-bench

実際のGitHubリポジトリのIssueを解決させ、コーディングエージェントの実務能力を測るベンチマーク

評価ベンチマークコーディングエージェント

Chatbot Arena

LMArena

人間の実際の投票による対戦形式で、LLM同士の相対的な性能を評価するベンチマークプラットフォーム

評価ベンチマーク人間評価

LLM-as-a-Judge

LLMジャッジ

人間による評価の代わりに、別のLLMに応答の品質を採点・比較させる評価手法

評価評価ベンチマーク

GSM8K

Grade School Math 8K

小学校レベルの算数文章題8,500問で、LLMの多段階推論能力を測定するベンチマーク

評価ベンチマーク推論

Needle in a Haystack

NIAH / 干し草の中の針

長いコンテキストの中に埋め込んだ短い一文をLLMが正確に検索・想起できるかを測るテスト

評価ベンチマークコンテキストウィンドウ

TruthfulQA

誤った通説や俗説に迎合せず、真実に基づいた回答をLLMが返せるかを測るベンチマーク

評価ベンチマーク安全性

HellaSwag

状況説明に続く最も自然な文の続きを4択から選ばせ、常識的な推論力を測るベンチマーク

評価ベンチマーク常識推論

MT-Bench

Multi-Turn Bench

複数ターンにわたる会話でのLLMの応答品質を、強力な別のLLMに採点させて評価するベンチマーク

評価ベンチマークLLM-as-a-Judge

Eloレーティング

Elo Rating

対戦結果の勝敗から、相対的な強さを1つの数値で表すレーティングシステム

評価評価ベンチマーク

GPQA

GPQA Diamond / Graduate-Level Google-Proof Q&A

検索しても解けない大学院レベルの科学問題で構成される、高難度の質問応答ベンチマーク

評価ベンチマーク評価

AIME

American Invitational Mathematics Examination

米国の数学コンテストを転用した、LLMの数学的推論能力を測る高難度ベンチマーク

評価ベンチマーク評価

ARC-AGI

Abstraction and Reasoning Corpus / ARC

少数の例示から図形パターンの変換規則を見抜く、抽象化と推論の能力を測るベンチマーク

評価ベンチマーク評価

Humanity's Last Exam

HLE / 人類最後の試験

世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク

評価ベンチマーク評価

MTEB

Massive Text Embedding Benchmark

分類・クラスタリング・検索等の複数タスク・100以上の言語にわたり、テキスト埋め込みモデルの性能を横断的に評価するベンチマーク

評価ベンチマーク埋め込み