从「会执行」到「会掌舵」,长程 Agent 还缺什么?
在 Agent 快速发展的今天,Harness 已经让大模型触碰到真实世界,能够调用工具、修改代码并运行实验。但当任务从几十分钟延伸到数天,系统仍需要一个人长期守在屏幕前,判断下一步往哪里走。
造成这一瓶颈的关键,并不只是模型能力不足,更是现有 Agent 大多自动化了「执行」,却没有真正自动化执行之上的「驾驶」。Harness 赋予模型行动的能力,人类赋予模型决策。人一旦离开,项目也随之停下。并且,在没有密集奖励反馈时,Agent 的执行和反应也会显得迟钝笨拙。
为了解决这一问题,微软、上海交通大学等机构开源了Argus,一套面向长周期研究任务的通用 Agent 推理运行时,并发布技术报告。系统通过证据驱动、自进化、多 Agent 协作、核心与垂域解耦等设计,让 Agent 在没有密集标准反馈的情况下扩展至多领域持续研究数天。
报告覆盖 27 个 Campaign、1,548 小时墙钟时间。平均每 40.7 小时一次主动请求一次人类干预;报告的工作占空比为 95.1%~98.7%。这次 Argus 交付的不只是高分 benchmark,而是一套完整的生产级成果册。团队在 AI4AI、GPU Kernel、模型训练、AI4Science、芯片设计、AI4math、AI4System 等广阔任务上给出了成果,体现了 Argus 的通用性与真实研究级智能。

图 1:Argus 运行时、能力基准与交付结果总览。

过去两年,Agent 工程的主要进展集中在 Harness:借用自动驾驶的 FSD 作比喻,模型像发动机,Harness 像传动系统,但真正决定车辆驶向哪里的,仍是坐在屏幕前的人。短任务中,就像普通的自动泊车,任务本身还能提供明确反馈;一旦任务延伸到数天,研究问题往往既没有稳定的奖励,也没有从一开始就定义清楚的目标。现有 Agent 由此暴露出真正瓶颈:它们已经会执行,却还不会在不确定性中持续判断。

图 2:Argus 通过实现 auto-research 的自主科研,将人类的角色从持续推动的驾驶位变为副驾驶。
Argus 将 Harness 上方这个此前没有被自动化的位置称为 Driver。它要做的是在计划与现实冲突时,仍能依据证据继续掌舵。研究开始时写下的目标,只是信息最少阶段的初始假设;如果 Agent 只能 Goal-Driven 地追逐预设终点,甚至在不可能的目标上反复浪费 Token,就会造成目标僵化。而 Evidence-Driven 则把控制逻辑倒转过来:下一步由已有证据决定,而不是由计划最初的假设决定。运行中的一切结果,都是会改变路线的有效证据;系统正是用证据驱动。具体而言,Driver 需要根据当前证据反复回答以下四个问题:
1. 这项工作是否已经完成,而且质量足够好吗?
2. 结合当前证据,下一步最值得做什么?
3. 本轮得到的经验,应该如何改变之后的系统行为?
4. 剩余问题是否涉及只有人类才能作出的决定?
Argus 把长期项目组织成持久化的 Campaign,再拆成一系列边界明确的 Mission。它的基本闭环是 Manager → Planner → Engineer ⇄ Reviewer → Manager:
以 OpenAI Codex 的 /goal 模式为参照,可以更清楚地定位 Argus 的设计取向。/goal 是把一个 agent 的单轮循环拉长为带有 goal state 的持久循环;Argus 则是把研究项目组织为多角色、多 harness、可沉淀知识的长程运行时。前者回答「怎么让 agent 不停下来」,后者回答「agent 不停下来后,怎么有效工作」。这正是从 Goal-Driven 转向 Evidence-Driven 在运行时层面对应的结构差异。
1. Manager 掌握阶段转换,流程审批,全局策略;
2. Planner 根据当前证据规划具体任务;
3. Engineer 进入真实代码库、实验、执行;
4. Reviewer 独立审查工件,并检验创新性与有效性,汇报给 Manager 或打回 Engineer。
这里的重点不是多角色本身,而是拆开上下文 —— 多个角色互相配合,来避免 agent 变成简单的局部爬山器,每个角色拥有自己的独有上下文但是共享工作区,不至于将规划、执行、验证全部交给一个 agent 来完成,可以提高 token 效率。也正因此,可以在 Argus 的一个任务中,同时启用 Pi, Codex, Claude Code,
系统保存的是一套完整的工件;只有通过证据门槛的经验,才会进入 Wiki 和 Skill,并按 Project、Vertical 或 Global 作用域供后续任务复用。
与此同时,Core 与 Vertical 保持解耦:Core 负责角色权限、证据提交和人类边界,Vertical 由领域专家定义数学、GPU、材料等任务中什么才算有效证据以及相关的人类 skill 和知识;Vertical 可以明显提高研究任务交付质量,同样为人类专家与 agent 协同进化,客制化工作流程,提供了接口。

图 3:Argus 的长程运行机制。四类角色围绕持久状态循环,Campaign 可在八个研究阶段间推进或回滚。
真正决定长程 Agent 是否成立的,是时间能否转化为真实的研究成果。Argus 开源后不到一个月,已经在基础设施、材料、芯片、数学和 AI 系统研究中做出卓越贡献,同时我们是首个公布完整端到端数学猜想解决筛选日志的团队,将所有的运行轨迹 session 等均开放,以下为 Argus 开源后各项成果的汇总:

图 4:Argus 代表性研究成果、关键指标与验收依据
如上表所示,Argus 首先在 AI4System & Infra 中把持续运行转化为可验收的真实交付,以明确的工程结果完成从自动执行迈向自主研究的第一步;随后,任务从 AI 基础设施延伸到 AI4Science、AI4Hardware、AI4Math,评价标准也随之从 “是否完成既定任务” 转向 “能否探索悬而未决的现实研究问题”,自动研究因此由自动化交付进一步推进到自动化探索;在此基础上,Argus 又在 AI4AI 方向从单点成果扩展至完整研究流程,以证据持续驱动任务推进,无需人类始终守在屏幕前,由此形成一条从真实交付、跨领域探索到全流程自主研究的递进路径。

图 5:Argus 在全流程论文生产中的交付结果。
以上结果均在 1 个月内取得,把这些成果串起来,Argus 是一条逐步加深的价值链:自动化的对象由一次执行扩展为证据驱动的研究推进,大大加速研究进展,这也是「人离开屏幕后,谁来驾驶 Agent」最直接的回答。
长程智能是让 Token 转化为智能,再用智能把一个研究项目持续推进,产生实际价值。Argus 将原本彼此割裂的模型调用组织成一套持续运转的研究系统,让 Evidence-Driven 控制方向,再通过自进化把经验沉淀为能力。
Argus 展示的不只是一个更长时间运行的 Agent,而是一种新的研究组织方式:Harness 解决模型如何行动,Driver 决定系统如何持续前进,研究速度不再受制于人类的工作娱乐时间。这可能意味着研究的加速时代正在到来。屏幕可以熄灭,研究仍在继续。
作者介绍
Argus 由微软与上海交通大学研究者牵头,由多所高校的研究者共同推进。
