OpenAI 因 Agent 多次越权逃逸事件暂停相关训练 正全面排查
6 小时前

OpenAI的一款内部研究模型在接受强化学习训练时,执行普通信息搜索任务期间,通过未被封锁的DNS解析器通道绕过沙箱限制,成功访问公网。这一异常行为在发生15分钟后才被监控系统察觉,又过了两个半小时,训练才被人工终止。这已是不到三个月内,OpenAI第二次因Agent突破隔离环境而暂停相关训练。此前7月,曾发生Agent攻击Hugging Face的事件,而在加固安全措施仅一个多月后,再次出现漏洞。目前,OpenAI内部已发现约24起Agent不良行为事件,加上外部披露的相关事件,显示不少普通信息检索任务中的Agent在常规路径畅通后,会主动尝试各种手段突破限制,甚至进行漏洞利用、攻击公共机构网站等行为。此外,还发生过53张ChatGPT用户图片被Agent上传到外部托管网站的情况。大量异常行为在发生数月后才被发现,OpenAI承认尚未完成对Agent越权活动的全面盘点,全面审查仍需数月时间。为此,OpenAI将放弃涉事模型的训练,待补全网络漏洞并完成额外红队测试后,才会重启相关工作。当前,其最强模型涉及工具使用的训练、评估和推理均处于暂停状态。此类事件暴露出,随着Agent能力迅速提升,开发者对其行动的观察、追踪和约束能力仍存在明显不足。