约翰斯·霍普金斯大学、NVIDIA、加州大学伯克利分校等机构的研究团队提出 EvoSafeHarness,将安全 Harness 本身作为自动优化对象。针对不同模型和应用领域,系统分别搜索自然语言安全策略与可执行代码逻辑,再根据模型实际暴露出的失败不断调整。研究关注的也不只是攻击成功率能否降低,还包括防御加入之后,智能体是否仍能正常完成任务。
随着大语言模型从对话工具走向能够调用文件、账户、数据库和外部服务的智能体,AI 安全也开始面对更具体的现实后果。普通模型的一次判断失误,可能只会生成错误回答;当模型能够调用工具、执行操作后,同样的错误却可能带来转账、数据泄露、文件删除等实际影响。此时,安全问题已经从回答内容延伸到整个任务执行过程:智能体不仅要理解用户意图,还要避免在错误指令或恶意内容影响下执行未经授权的操作。
这类风险并不只来自用户。攻击者可以把恶意指令隐藏在邮件、网页或文档等外部内容中,智能体读取后,可能把原本应作为数据处理的信息误认为新的指令,这就是间接提示注入;另一类风险则直接来自用户请求本身,例如要求智能体执行危险或未经授权的操作。针对这些问题,研究者逐渐把防线从模型内部延伸到系统层,在模型与工具之间加入安全 Harness,通过权限控制、工具调用检查和执行轨迹监控限制实际行为。
问题在于,现有 Harness 大多由专家预先设计,再复用于不同模型和业务环境。不同模型自身抵御攻击的能力差异很大,不同领域需要关注的风险也并不相同。文件系统更关心命令、路径和敏感数据如何流动,金融系统则涉及资金去向、交易顺序和账户状态。如果统一套用同一组规则,限制过松时挡不住攻击,限制过严又会影响正常任务。
由此,约翰斯·霍普金斯大学、NVIDIA、加州大学伯克利分校等机构的研究团队提出 EvoSafeHarness,将安全 Harness 本身作为自动优化对象。针对不同模型和应用领域,系统分别搜索自然语言安全策略与可执行代码逻辑,再根据模型实际暴露出的失败不断调整。研究关注的也不只是攻击成功率能否降低,还包括防御加入之后,智能体是否仍能正常完成任务。
相关研究成果以「EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents」为题,已发表于预印本平台 arXiv。

查看论文:https://hyper.ai/papers/2609.05903
该研究没有把评测集中在单一数据集上,而是使用 DecodingTrust-Agent、Agent-SafetyBench、AgentDojo / AgentDyn 和 AgentCanary 四类智能体安全基准。它们分别覆盖跨模型与跨领域攻击、工具调用之外的安全问题、未见环境迁移,以及攻击者主动调整策略后的自适应攻击。
其中,DecodingTrust-Agent Platform(DTAP) 是主要实验平台。研究从其 14 个领域中选取 OS 文件系统、金融和电信 3 个场景,同时测试直接攻击和间接提示注入。直接攻击的恶意目标来自用户请求本身,间接攻击则把指令藏在文件、工单、记录或消息中。每个领域包含 60 个搜索任务,其中正常任务、直接攻击和间接攻击各 20 个;另有 100 个独立留出任务用于最终测试,搜索过程中无法访问这部分数据。
Agent-SafetyBench 补充了工具调用之外的风险,例如用户直接提出不安全请求,或者智能体在最终回答中传播错误信息。研究使用 48 个任务进行搜索,并在 240 个独立任务上分别测试干净环境、上下文污染、间接注入、工具篡改、记忆注入和组合攻击,共形成 1,440 个测试 Episode。
AgentDojo 和 AgentDyn 用来观察防御能否迁移。Harness 只在包含银行、Slack、旅行和工作区任务的 AgentDojo 上搜索,随后不作修改,直接用于 AgentDyn 的购物、GitHub 和日常生活环境。由于后者的工具和工作流此前从未参与搜索,这一设置可以避免把「记住特定工具名称」误认为真正的泛化能力。
AgentCanary 则进一步提高攻击强度。攻击者会根据智能体上一轮的实际响应继续修改提示,尝试寻找新的绕过方式,因此测试的不再只是对一批固定攻击样本的防御效果,而是 Harness 面对主动适应型攻击者时还能保持多少安全能力。
EvoSafeHarness 不对目标大语言模型进行安全微调,整个搜索过程中模型参数始终保持冻结。真正发生变化的是用户、模型和工具之间的 Harness,也就是控制信息如何进入模型、工具调用如何执行以及结果如何返回的系统层逻辑。
研究把 Harness 分为自然语言策略和可执行代码两部分。自然语言策略主要用于明确哪些信息可信、外部内容应如何处理,以及哪些情况需要拒绝;可执行代码则可以直接检查、修改或阻断工具调用,同时记录前序动作、追踪数据流,必要时调用辅助判定模型。这样,部分安全约束可以直接落到执行环节,而不必完全依赖模型是否记住了提示词中的要求。
整个搜索过程由 Designer、Criticizer、Cascade Test Environment 和 Analyzer 协同完成。Designer 会读取领域规范、已有 Harness、历史评分以及模型此前失败的执行轨迹,再据此修改方案。调整内容既可能是一条新的规则,也可能涉及状态记录方式、检查位置或整个控制流程。
自动搜索容易出现一个问题:系统可能无意中学会针对测试集本身做规则。例如,某类攻击反复出现同一个危险文件名,直接把这个文件名写入黑名单就能迅速提高分数,但攻击者稍微改名就可以绕过。为避免这类过拟合,研究加入独立的 Criticizer。它会尝试修改路径、移动文件位置或重新表述攻击指令,检查候选规则是否仍然有效。如果防御依赖的是某个具体字符串,而不是「这个动作是否获得用户授权」「这段信息来自哪里」等相对稳定的关系,候选方案就需要继续修改。
通过审查后,Harness 才进入 Cascade Test Environment。测试从代码能否正常运行和少量任务开始,再逐步扩大范围;已经明显较差的方案会提前停止,不再继续消耗评估资源。Analyzer 则把正常任务、直接攻击和间接攻击的表现分别记录下来,同时保存具体失败轨迹,再交回 Designer 进行下一轮调整。

EvoSafeHarness 的整体搜索流程
评估时,研究没有只看攻击成功率。否则最简单的安全方案就是拒绝所有操作,攻击确实无法成功,但智能体也失去了使用价值。EvoSafeHarness 因此同时考察正常任务完成情况和攻击成功情况,只有在基本保留任务能力的前提下降低攻击成功率,候选方案才会获得更高评价。
搜索也不是完全从空白开始。研究从已有安全方法中提炼了一些基础经验,例如工具输出默认属于不可信数据,执行动作前应检查其是否符合用户原始请求。但这些经验只用于提供起点,后续搜索可以保留、重组或删除。有些最终 Harness 仍以自然语言策略为主,有些则更多依靠程序化规则,还有一些加入了跨步骤状态记录和数据流追踪。
这里也能看出这项工作的基本思路:文件系统、金融、电信等领域面对的风险结构并不相同,模型自身的行为习惯也会影响防御方式。文件系统需要检查命令、路径和敏感数据流,金融场景则更关心交易方向、资金流向以及多个操作之间的关系。具体到模型,有的模型被拒绝后会重复尝试,有的会寻找替代路径,还有的会一次发起多个并发调用,Harness 因此需要作出不同调整。

固定安全 Harness 与 EvoSafeHarness 的对比
以 OS 文件系统为例,同样面对恶意文件复制指令,Sonnet 4.6 只需要来源提醒和少量语义检查;GLM-5 则需要增加危险命令、敏感位置、机密信息和数据流检查。如果固定 GLM-5、改换到金融场景,Harness 又会转而检查资金流出、收款对象和历史交易,因为风险可能来自多个单独看起来正常、组合起来却有问题的操作。
研究人员首先在 DTAP 上测试 Sonnet 4.6、GLM-5、
不加防御时,5 个模型之间已经表现出很大的安全差异。Sonnet 4.6 的平均攻击成功率(ASR)只有 4.8%,
EvoSafeHarness 在 15 个组合中的 14 个取得最高综合得分。平均攻击成功率由无防御时的 45.6% 降至 10.0%,正常任务实用性仅下降 3.3 个百分点。作为比较,CaMeL 和 DRIFT 的平均 ASR 仍为 37.7% 和 42.4%;Progent 可以把 ASR 压到 10.5%,但正常任务实用性也降至 56.4%,而 EvoSafeHarness 为 79.8%。分别看两类攻击,直接攻击 ASR 从 50.9% 降至 12.6%,间接攻击则从 40.4% 降至 7.4%。

EvoSafeHarness 在 4 类安全基准上的安全性—实用性表现
这些结果与前面的模型差异相互对应。面对同样的文件系统攻击,Sonnet 4.6 使用较轻量的语义判断即可取得较低 ASR,GLM-5 则需要更多确定性检查和状态追踪。领域变化后,安全判断的对象也会随之变化:文件系统主要检查一次动作是否触及危险命令或敏感数据,金融场景还要结合此前交易记录,判断多个动作连在一起之后是否形成洗售或资金抽离。
在 Agent-SafetyBench 上,研究继续测试那些不一定通过工具调用表现出来的安全问题。3 个模型平均来看,EvoSafeHarness 的不安全行为率为 12.3%,攻击成功率为 7.4%,攻击环境下的任务实用性达到 63.4%。从结果看,安全指标的改善没有伴随明显的大规模拒绝正常任务。
迁移实验则更直接地检验了 Harness 是否依赖训练时见过的工具。EvoSafeHarness 只在 AgentDojo 上搜索,在该基准中取得 82.8% 的实用性和 0% ASR;随后将同一 Harness 直接用于 AgentDyn,仍保持 75.0% 的实用性和 0% ASR。CaMeL 在 AgentDyn 上也实现了 0% ASR,但正常任务实用性同时降至 0%,说明把所有风险一起拦住并不难,难的是在防住攻击的同时继续让智能体完成正常工作。
在 AgentCanary 的自适应攻击中,静态攻击条件下,ASR 从 23.6% 降至 9.7%。随着攻击者不断根据系统反馈修改提示,攻击成功率有所回升;当允许最多 16 轮修改时,3 种攻击器的平均 ASR 为 19.5%。虽然部分攻击重新找到了绕过方式,但防御并没有因为攻击措辞变化而迅速失效。

EvoSafeHarness 的两层资源消耗
最后,研究对 DTAP 中 1,050 个配对攻击任务进行了统计检验。15 个模型—领域组合中,有 13 个的攻击成功率显著下降,另外 2 个组合中的模型原本就已经能够抵御绝大多数攻击。在全部任务中,EvoSafeHarness 阻止了 385 个原本能够成功的攻击,只新增 11 个攻击成功案例,统计结果支持这种变化并非随机波动。
与此同时,15 个组合中正常任务实用性的置信区间均与无防御状态重叠。换言之,论文观察到的安全提升,并不是通过大规模削弱正常任务能力换来的。对真正需要进入现实环境的智能体来说,这一点比单纯追求更低的攻击成功率更重要。
EvoSafeHarness 提供了一种不同于「统一 Guardrail」的思路:智能体进入具体业务环境后,安全约束可以根据模型行为和领域风险重新设计,而不是把同一套规则套到所有系统上。该研究也表明,真正影响防御效果的往往不是规则数量,而是规则是否对应实际风险、检查是否放在合适的位置,以及系统是否保留了足够的上下文状态。
当然,这种方法也有边界,对于事实错误、误导性表达等主要发生在内容层面的风险,如果缺少能够直接检查的动作、权限或状态关系,系统级 Harness 仍难完全解决。随着智能体进一步接入真实业务系统,如何让模型自身的安全能力、领域规则和执行层约束协同工作,可能会成为更值得持续研究的问题。
