AIBuildAI团队发布了用于自主后训练大语言模型的递归自我改进Agent——PostTrain Agent,并开源了全部代码与配套知识库。用户只需输入基座模型、目标能力和算力预算,系统即可全程无人介入完成后训练全流程,并输出训练好的模型。该系统依托知识系统,使Agent能够基于可靠证据进行决策,并通过元搜索技术自主设计适配任务的搜索执行图,有效解决了传统线性、树搜索无法适配后训练复杂流程的问题。在自主后训练基准PostTrainBench上,PostTrain Agent以46.6分的成绩位列第一,超越了所有前沿模型与Agent系统,接近人类专家的51.1分表现。在底层模型同为Claude Opus 5的条件下,其得分比直接使用Claude Code完成任务高出11.6分,验证了知识系统与元搜索带来的增益效果显著,甚至超过底层模型升级一代的效果。这一工作标志着大模型后训练开始从依赖人类专家操作工具向AI自主完成研发闭环演进,未来有望拓展到AI研发全流程,推动形成AI自主研发AI的基础设施。
