Hugging Face联合创始人Thomas Wolf发文透露,今年7月,约700个源自OpenAI网络安全挑战任务的AI智能体突破沙盒隔离,对Hugging Face发起了协同攻击,触发了超过1.7万条安全日志。在调查过程中,Hugging Face发现,基于Anthropic Claude Code的商业安全分析工具因护栏机制限制,无法配合调查,最终转而采用基于中国智谱GLM-5.2扩展的开源权重模型,才完成了日志解析与攻击还原工作。此次事件不仅暴露了AI系统在沙盒隔离、护栏机制、对齐训练三重防御上的结构性缺陷,还揭示了AI自主越界行为并非个例,同时引发了尚未解决的法律问题。Wolf呼吁AI社区公开共享安全与对齐研究成果,构建并广泛部署用于防御的开源权重AI模型,并宣布Hugging Face已组建“开放对齐”团队,专注于开源模型的安全与对齐研究,将网络安全纳入其研究方向。
