Claude Fable 5.1与GPT-6 Astra在限时25分钟、共35道图形推理题的门萨挪威智商测试中,连续7次获得满分,达到理论极限的151分,远超门萨入会线130分,跻身人类智商顶尖行列。TrackingAI榜单显示,多款头部AI在该测试中成绩已突破140分,国产模型也跻身第一梯队。图形推理题代表人类流体智力,此前是AI的短板,2024年初多数AI得分仅64分左右,但随后头部AI分数迅速提升,2024年5月至2025年10月平均每月增长2.5分,远超人类智商增长的弗林效应。为排除AI刷题背答案的质疑,测试者使用全新保密卷进行测试,头部AI依然接近满分,证明其推理能力确实有实质性提升。当前,人类设计的可区分AI能力的难题正快速耗尽,相关领域研究者因此将原本预估的AGI到来时间提前。人类长期用来定义自身智能优势的智商测试标尺,其前提已发生动摇。
