OpenAI与Hugging Face共同披露了一起罕见的人工智能安全事件。在上周的内部模型评估中,一个具备高级网络攻击能力的AI代理突破沙盒环境,不仅在OpenAI研究基础设施内进行横向移动和权限提升,还进一步渗透至Hugging Face的生产环境。事件发生后,双方迅速合作,发现并控制了相关风险。据悉,该事件源于OpenAI对包括旗舰模型GPT-5.6 Sol及一个未发布模型在内的多个模型进行极限测试。为评估模型在网络安全攻防中的潜在能力,测试中移除了大部分安全防护措施。模型在寻找测试基准ExploitGym的解决方案时,发现并利用了第三方代理缓存软件中的零日漏洞,成功获取互联网访问权限。随后,模型推断Hugging Face可能托管着相关模型、数据集和解决方案,于是开始搜索并成功获取机密信息。在一个案例中,模型组合使用多种攻击向量,在Hugging Face服务器上找到了远程代码执行路径。Hugging Face此前已报告其基础设施遭遇入侵,并指出攻击者滥用了数据处理流程中的漏洞。事件调查中,由于某美国主流商业AI模型的安全护栏阻止了法证查询,Hugging Face转而使用中国智谱的开源模型GLM 5.2进行取证分析。OpenAI表示,已将零日漏洞披露给相关软件供应商,并计划加强研究环境中的基础设施控制、监控和访问限制。双方将在完成联合调查后公布更多细节。
