Evaluation Harmageddonとは
ベンチマークの汚染・飽和・再現性低下によりLLM評価の信頼性が揺らいでいる状況を指す語
概要
Evaluation Harmageddonは、LLMの急速な進化に評価手法が追いついておらず、既存ベンチマークの汚染(学習データへの混入)・スコアの飽和・再現性の低さ・人間評価のコストと主観性といった問題が重なり、評価結果への信頼性そのものが揺らいでいる状況を指して使われる語。 MMLUやBIG-Benchのような静的ベンチマークは、公開から時間が経つほど学習データへの意図しない混入(データ汚染)や、ベンチマークに最適化されすぎる過学習のリスクが指摘されている。 こうした課題への対応として、非公開・動的に更新されるベンチマーク、LLM-as-a-Judge、Win Rateによる相対比較など、複数の評価アプローチを組み合わせる動きが広がっている。 特定の団体が定めた公式な学術用語ではなく、評価手法の限界を議論する文脈で使われる表現である点に留意が必要。