人类的最后考试

人类的最后考试(,HLE)是针对语言模型的一个基准测试。它由2500个前沿学术难题组成,其所涉学科包罗万象,由和Scale AI联合创建。

创意
斯坦福大学人本人工智能研究院(HAI)的《 2025 年人工智能指数报告》指出,“人类的最后考试”是“更具挑战性的基准测试”之一,皆在应对此前流行的人工智能基准测试已达到“饱和”的情况。

“人类的最后考试”据称是机器学习研究者兼主任 的创意。他表示,自己在与埃隆·马斯克交谈后受到启发,从而创建了该基准测试。埃隆·马斯克认为现有语言模型的基准测试过于简单。

与 Scale AI 合作,编纂了此基准测试中的题目。 这些题目由世界各地不同学术机构的专家提供,以群众外包的形式编写。 专家提交的题目首先将由领先的人工智能模型进行筛选;如果模型无法回答问题,或者在选择题上的表现比随机猜测更差,则继续由人类专家进行两轮审核,最终批准纳入基准测试数据集。

所出题目评分最高的研究者,可瓜分 50 万美元的奖金——评分排名前 50 位的问题,每题可获得 5000 美元奖金,在此之后的 500 个问题,每题可获得 500 美元奖金。

在初始版本发布后,其“社区反馈漏洞赏金计划”开放,以识别并删除数据集中的重大错误。

组成
该基准测试由公开发布的 2500 道题组成。相关论文将所有题目分为以下几大类:数学(41%)、物理(9%)、生物/医学(11%)、人文/社会科学(9%)、计算机科学/人工智能(10%)、工程学(4%)、化学(7%)和其他(9%)。约 14% 的题目需要同时理解文本和图像的能力,即多模态学习。 有 24% 的题目是多项选择题;其余的是简答题、精确匹配题。此外还维护了一个不公开的测试集,防止基准测试过拟合。

例如这道题目:

测试报告
参考文献
外部链接

评论 (0)

  • 还没有评论,来抢沙发吧。