Re Reference AI

評価

Humanity's Last Examとは

HLE / 人類最後の試験

世界中の専門家が作成した数千問の難問で構成される、フロンティアモデル向けの最高難度ベンチマーク

ベンチマーク評価

ひとことで言うと

「人類が作る最後の学術試験」を掲げて、世界中の専門家が持ち寄った超難問集。最先端AIでも正答率が低い、限界測定用のテスト。

概要

Humanity's Last Exam(HLE)とは、数学・自然科学・人文学など幅広い分野の専門家が作成した、数千問の難問で構成されるベンチマークを指す。 既存のベンチマークが最先端モデルにとって飽和しつつある状況を受け、「人類が作る最後の学術試験」を掲げ、世界中の専門家から公募した最高難度の問題を集めた。 公開時点で最先端モデルの正答率は1桁パーセント台にとどまり、フロンティアモデルの限界を測る高難度ベンチマークとして、モデル発表時のスコア報告で広く使われている。

歴史

2025年1月にCenter for AI SafetyとScale AIが公開した。

関連用語

MMLUGPQAフロンティアモデルデータ汚染

よくある質問

Humanity's Last Examという名前の由来は。

既存のベンチマークが最先端モデルにとって飽和し、簡単に解けるようになりつつある状況を受け、専門知識を問う学術的な試験として「人類が作成する最後の試験」を掲げて命名された。

どのような分野の問題が含まれるか。

数学・物理学・生物学などの自然科学に加え、人文学や社会科学など幅広い分野の専門家が作成した問題を含み、テキストだけでなく画像を伴う問題も含まれる。

参考文献

関連Zenn記事