BIG-Benchとは
Beyond the Imitation Game Benchmark
200を超える多様なタスクでLLMの能力と限界を測る大規模協働ベンチマーク
概要
BIG-Bench(Beyond the Imitation Game Benchmark)は、Googleを中心とする研究者コミュニティが協働で構築した、200を超える多様なタスクから成る大規模言語モデル評価用ベンチマーク。 論理推論・常識推論・算数・言語理解・倫理的判断など幅広い分野のタスクを含み、モデルの能力を単一の指標ではなく多面的に測ることを目的としている。 特に、モデルサイズの拡大に伴い性能が急激に向上する、あるいは逆に低下する創発的能力や逆スケーリング現象の観察に用いられたことで知られる。 後継として、より難易度の高いタスクを厳選したBIG-Bench Hard(BBH)も広く使われている。