GPT-6 Astra在ARC-AGI-3半私有测试集上取得了99.9%的高分,使该测试集达到饱和状态,原定的ARC系列评测方案因此作废,需重新设计题目。ARC Prize的创始人François Chollet透露了下一代评测计划:ARC-AGI-4将于明年第一季度发布,重点考察AI在更长尺度上的持续学习与课程学习能力。被视为“人类终极考卷”的ARC-AGI-5也已进入筹备阶段,其核心将围绕“发明”能力展开。GPT-6 Astra等模型通过优化评测工程显著提升了得分,这引发了关于测试框架公平性的讨论。ARC-AGI-3通过游戏化关卡评估AI的探索、建模等能力,但由于测试环境有限且确定,其饱和并不意味着通用人工智能(AGI)的实现。ARC系列评测可能会在第6或第7代结束,当人类与AI的学习效率差距无法再被测量时,即标志着AGI的到来。随着AI技术的快速发展,评测考题需持续更新,若开放式发明任务也无法区分人机能力,那么“考无可考”将成为AGI讨论的核心议题。
