Fable 5.1 超越人类却贵了 2.5 倍,NeoCognition 给 Agent 进公司算了笔账
2 小时前

NeoCognition 推出了 ApprenticeBench 评测,将智能体置于模拟建筑公司环境中,使其像新员工一样学习并处理应付账款工作。评测结果显示,Fable 5.1 和 GPT-6 Astra 的通过率分别达到 72% 和 68%,均超过了人类测试者的 51%。然而,Fable 5.1 处理单张账单的成本约为人类的 2.5 倍。评测还指出,在真实工作场景中,不同模型间的差距被进一步放大,开源与闭源模型的表现差异尤为显著。此外,评测引入了「CUA 税」概念,并发现顶尖模型的这一成本已接近于零。通过对照实验,评测明确了模型从入职学习中获得的能力提升。同时,也发现了智能体存在处理速度变慢、做无用功等问题。未来,若智能体能够更经济、更稳定且易于配合,将有望显著提升团队生产力。另外,王宇翔教授已全职加入 NeoCognition,担任机器学习总监一职。