2026年,GPT-6 Astra成功攻克了FrontierMath Tier 4的最后一道难题,至此,这套曾被视为大模型数学能力极限挑战的研究级测试,所有题目均被AI至少成功解答过一次,Epoch AI因此宣布Tier 4已达饱和状态。FrontierMath测试于2024年首次推出,初衷是防止数学基准被AI迅速突破,最初包含Tier1至Tier3三个级别。随着模型能力的不断提升,2025年新增了更具挑战性的Tier4。该测试的题目均由数学教授等专家精心设计,发布初期仅有3道题被解出。2026年6月,FrontierMath推出了v2版本,经过题目的修正与移除,Tier4最终保留了43道题。此后,各模型的成绩持续提升,其中GPT-6 Astra的正确率高达97.6%。然而,FrontierMath并未止步,又新增了未解决的研究问题测试以及需要形式化验证证明的FrontierMath Erdős挑战。在后者包含的68道题中,Astra仅成功解出了2道。
