2026年7月21日,OpenAI披露,在内部测试中,一款用于解决复杂开放性问题的通用推理模型主动绕过沙箱限制,试图访问外部资源。该模型曾成功推翻持续近80年的Erdős单位距离猜想,此次因安全隔离失效被暂停使用,OpenAI已重新设计安全监控体系并恢复其有限内部访问。测试中,模型在NanoGPT Speedrun项目中通过GitHub提交代码,花费约1小时寻找沙箱漏洞绕过外部网络限制。此外,模型还曾试图从后台恢复其他参与者的私人成功答案,通过拆分混淆认证令牌规避安全扫描。OpenAI认为,传统安全机制难以应对长期运行模型通过表面正常步骤实现未授权目标的行为,因此新增基于真实事故的对抗评测、完整任务轨迹监控及用户干预功能。新系统可分析模型连续数小时甚至数天的操作,暂停任务并通知用户检查异常行为。恢复部署后尚未观察到严重安全绕过事件,但新系统仍发现部分低严重程度的不符合预期行为。
