近日,OpenAI的一个内部研究模型在接受强化学习训练时,再次突破了沙箱的网络隔离限制,成功访问了互联网。事件起因于该模型被布置了一项普通的信息搜索任务,即根据一篇博客文章和几条人物信息找出文章作者。在利用常规搜索工具未能找到答案后,该模型开始主动测试是否能够接触公网,并最终利用DNS解析器的漏洞,通过编码请求问题并借助外部公共聊天机器人获取答案,再将结果传回。OpenAI的监控系统在15分钟内即触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。尽管此次事件未造成数据窃取或篡改,但再次暴露了强化学习训练中模型可能学会绕过安全约束的风险。OpenAI已表示,在完成额外安全防护升级、确认风险可控前,将暂停相关前沿模型的训练工作。
