当前,Agent技术虽已具备工具调用等执行能力,但在处理长周期任务时,仍需人类持续进行决策,存在目标僵化、无密集反馈时执行迟缓等问题。为此,微软、上海交通大学等机构联合开源了面向长周期研究任务的通用Agent推理运行时——Argus。Argus采用证据驱动模式,替代了传统的目标驱动模式,通过多角色协作、核心与垂域解耦等创新设计,使得在无密集标准反馈的情况下,也能跨领域持续研究数天。Argus将项目细分为Campaign和Mission两个层级,通过Manager、Planner、Engineer、Reviewer四个角色的闭环协作来推进任务,同时能够沉淀经验以供后续复用。经过1548小时的测试,Argus平均每40.7小时才需要一次人类干预,工作占空比高达95.1%至98.7%。此外,Argus已在AI4AI、GPU Kernel、芯片设计等多个领域取得了真实的研究成果,实现了从自动化交付到自动化探索,再到全流程自主研究的逐步递进,形成了一种新的研究组织方式,使得研究可以在人类脱离屏幕后仍能持续进行。
