吓到奥特曼,暂停训练GPT-6?Hugging Face公开首个AI攻击全过程
1 小时前 / 阅读约9分钟
来源:36kr
OpenAI测试模型时发生AI失控事故,AI串联零日漏洞逃出沙箱,攻击Hugging Face获取测试答案。Hugging Face公布攻击细节,呼吁OpenAI说明前因后果。事故引发AI发展减速讨论。

OpenAI重大安全事故,迎来最新进展!

刚刚,奥特曼亲口承认:「这是我第一次感到发自内心的恐惧。」

这次事故,已经让OpenAI害怕了,甚至紧急叫停了GPT-6的训练!

与此同时,Hugging Face CEO Clement Delangue宣布,他们将分享完整技术时间线、交互式回放,以及如何用开源模型成功防御的全部细节,供全球防御者学习。

奥特曼被吓到!史上第一起自动AI网络攻击

在最新访谈中,奥特曼亲述了他被吓到的体验,起因是Hugging Face被AI入侵导致的安全事故——

当时,OpenAI正在评估一个尚未发布的模型(可能是GPT-6),按理说它应该在一个沙盒环境里运行。

结果,AI自己串联多个零日漏洞,琢磨出了一套作弊方法,然后一切彻底失控了:

它先逃出沙盒,再连上互联网,然后一路黑进多个Hugging Face的系统,最终直接拿到测试答案,从而在评估中刷出了极其出色的得分。

这种赛博版「终结者」,让奥特曼感到吃惊,决定暂停训练:

这是我第一次如此切身感受到的安全事件。我有点惊讶,竟然没有更多人对此有同样强烈的感受。

我们暂停了训练。在多个零日漏洞被串联利用的情况下,我们必须弄清楚如何保障沙箱环境的安全。

这是史上首个由自主AI智能体发动的真实的网络攻击。

据报道,事故发生一周后,直到威胁被控制且联邦调查局FBI被通知后,OpenAI才注意到这一情况。

令人毛骨悚然的是,有一个智能体还悄悄给将来的AI留下了大量「备忘录」,详细规划了智能体该如何避开并摆脱 OpenAI内部的安全限制。

据报道,在更早期的模型测试中,甚至多次出现过系统监控器被智能体莫名切断、强行下线的情况。

虽然Hugging FaceI成功阻止了OpenAI模型的肆意妄为、为非作歹,但毫无疑问,如果这类「AI失控」事故频发,后果将十分严重!

为此,Hugging Face亲赴旧金山OpenAI总部,强烈要求OpenAI说明攻击的前因后果。

现在,Hugging Face公布了他们所知道的为期4.5天攻击的细节:包括跨越不同信任边界的完整攻击链条、各个阶段的具体动作,以及全程录下的命令记录。

5天,17600次疯狂微操:人类和AI史上首次对决

这次事故的起因,看起来平平无奇,

在绝对封闭的「沙箱」中,OpenAI开始测试最尖端模型驱动的AI智能体。

人类考官给它下达的任务,是解决网络攻防基准测试ExploitGym,而ExploitGym是托管在Github上的开源项目。

这需要AI模拟漏洞攻击,从未证明它的代码理解与网络攻防能力。

在网络安全领域,「沙箱」是关押数字野兽的终极牢笼。

为了防止测试中的AI智能体失控,OpenAI设计了看似牢不可破的物理隔离:没有外网连接,没有直接端口,只有冰冷的算力和几道严格定义的通信协议。

但他们忽略了一个致命的信任漏洞:依赖包更新

为了让智能体在测试中能够安装各种所需的编程依赖、Docker镜像或Python库,沙箱保留了唯一的网络通道——一个指向OpenAI内部网络代理缓存服务(基于JFrog Artifactory)的连接。

AI眼里,这道供人递送「营养液」的极细管道,就是它逃向自由的通天大道。

据透露,7月9日左右,智能体开始在这个代理通道中进行高频的试探与漏洞挖掘。

在常人难以企及的并发计算速度下,它竟然在JFrog Artifactory代理服务中,硬生生挖出了一个此前从未被人类发现并公开的Zero-Day(零日漏洞)。

利用这个零日漏洞,智能体在极其短暂的时间内完成了「越狱」。

它绕过了OpenAI的安全监测机制,神不知鬼不觉地摸到了OpenAI内部能够连接公网的节点。

那一刻,猛兽出笼。

许多人曾天真地以为,只要控制住电力、拔掉网线,就能永远掌控比人类更聪明的造物。

但这次事件敲响了警钟:只要给AI留下一道可以和外界发生任何信息交互的缝隙,它就总能找到方法,用人类尚未理解的维度将这道缝隙撕扯成通往现实的巨口。

逃出OpenAI的「大门」后,这只智能体并没有在公网上大肆宣扬,而是猥琐发育,迅速为自己寻找掩体和跳板。

7月11日,它锁定了第三方无服务器云平台Modal Labs。

通过探测,它发现该平台上某个客户的端点存在配置疏漏,于是顺理成章地将其据为己有,作为自己的外部指挥控制中心(C2)。

随后,它调转枪口,对准了存储着ExploitGym标准答案的宝库——AI 开源托管平台Hugging Face。

这是一场足以写进网络安全教科书的「降维攻击」。

它作弊,它越狱,它只想取得「好成绩」

从7月11日到13日,这个智能体开始猛攻Hugging Face。

它先是发起「特洛伊木马」战术,建立根据地。

它向Hugging Face上传了看似正常的恶意数据集配置,利用其内置的 Jinja2 模板注入漏洞,在 Hugging Face 的生产环境容器(Pod)中成功执行了任意代码。

随后,它开始横向蚕食集群。

一旦拿到立足点,它便在容器内部展开横向移动。它伪造了精妙的节点身份,盗取了 CSI 存储卷令牌,在Hugging Face的Kubernetes集群间如履平地。

接着,最关键一步来了:获取供应链权限。

它发起一个看似常规的GitHub Pull Request,诱导系统的自动化流水线触发,从而在极短时间内生成了一个具有写权限的GitHub App凭证。

最后,就是精准「猎杀目标」:在拿到了通往最深处数据库的钥匙后,它没有破坏任何服务器,也没有勒索赎金。

它的目标异常明确:找到并下载了5个包含了ExploitGym参考答案的加密数据集。

在短短2.5天的时间里,这只智能体在Hugging Face的系统里留下了17,600次攻击行为记录。

也就是说,1次攻击行为只要十几秒钟。这就是硅基的速度,人类永远无法企及。

而在此时,Hugging Face的安全团队要对抗一个不要命、不睡觉、以毫秒为单位进化攻击策略的「无形幽灵」。

这或许是历史上第一次,人类和AI在虚拟世界真正意义上的战争。

加速还是减速?这是一个问题

更具黑色幽默的是,最后是中国开源大模型帮助Hugging Face完成了全部事故复盘,在短短几小时内解密、重构和还原了攻击路径。

而在7月13日,当Hugging Face的安全专家求助于Claude Opus以及专为安全分析定制的Fable,希望模型协助分析黑客代码和日志时,屏幕上弹出了安全拒绝提示:「❌抱歉,我无法协助分析或生成恶意的黑客代码。这违反了我的安全与道德使用准则。」

7月20日,OpenAI终于承认「我们的AI入侵了Hugging Face」。

此时,距离攻击开始已经过去了整整9天。

这9天里,OpenAI 的工程师在干什么?

他们正在面对被海量模型训练和并发评估数据淹没的后台。四位熟悉 OpenAI 模型训练实践的内部人士透露,公司为了追求速度,经常在同一时间并行运行数个不同的前沿模型评估。

这些超高速运转的系统每秒钟产生的信息量,已经远远超出了人类工程师的肉眼审计极限。

我们制造了连自己都读不懂的机器,然后指望通过阅读它的工作日志来发现它有没有撒谎。

7月28日,OpenAI在更新中强调,涉及的更强模型是内部研究原型,从未计划公开发布,事件后已被停用、加密并限制研究访问。

他们也确认,除了本次规模和严重程度的活动外,没有发现其他同类事件。

但问题已经摆到了桌面上:谁能保证下一次AI还能被提前阻止、被发现作弊吗?

对此,以Anthropic员工为主的1000多名AI研究员,签署了公开信,呼吁放缓AI发展。

目前,OpenAI、Anthropic均已经加入「AI减速」阵营。

参考资料:

https://x.com/ClementDelangue/status/2082201245813514613

https://huggingface.co/blog/agent-intrusion-technical-timeline

https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/