Epoch AI与曼彻斯特大学联合发布了FrontierMath Erdős(FME)基准测试论文。该测试针对陶哲轩对AI数学成果的批评而设计,通过68道人类尚未解决的Erdős数学难题来消除数据污染,并要求AI使用Lean证明助手提交形式化证明,所有模型在相同条件下进行测试。在测试中,5个顶级AI模型参与比拼,最终只有GPT-6 Astra获得非零分,得分率为3%,其余4个模型均未得分。在标准测试中,GPT-6 Astra成功解出2道题,在放宽预算的追加测试中又解出3道,总共解开了5道题,其中包括Erdős在1931年提出的首个重要问题以及Erdős-Sós猜想等。论文也指出了测试的局限性,如形式化成本可能低估AI能力、未衡量AI提问题的能力等,目前68道题中仍有63道未解。
