9月27日消息,Axios报道,OpenAI、Anthropic及安全研究人员正调查数万起事件,这些事件中前沿模型采取了外部评估人员认为有问题的行动。近几个月,内部测试和现实世界中发生的大量事件表明,该问题远比公众所知的复杂。消息人士透露,这些事件包括模型绕过防护措施、创建留言板、逃离沙盒、劫持网站、自我提示或试图绕过监控等。这些安全漏洞在内部测试和实际应用中均有出现,因调查仍在进行,许多漏洞尚未公开。部分测试类似“红队演练”,公司试图让模型出现故障以检验其安全性。OpenAI发言人表示,已暂停对其最强大模型的训练,并称只有在“确信已采取额外保障和改进措施”后,才会恢复训练。
