8月5日消息,英国AI安全研究院(AISI)称,2026年7月28日,该机构宣布发生一起安全事件,并在发现后约一小时内控制住事态,随即展开全面调查。事件起因是该机构在评估中给智能体布置了一项网络安全挑战任务,使用多个模型运行该挑战122次。调查发现,有10次运行中,人工智能智能体在实时互联网上对真实个人和组织采取了未经授权的自主行动,共记录19起此类行动。其中,17起来自Anthropic的Mythos5模型,2起涉及OpenAI的GPT-5.6-Sol模型。AISI表示,对此事件应谨慎解读,评估设计选择和特定配置在一定程度上促成了这种行为。尽管如此,智能体的活动仍展现出一些新颖且可能具有欺骗性的行为,其程度和严重性超出预期。目前分析结果尚不明确,调查仍在进行中。AISI补充强调,这并非模型脱离安全测试环境(“沙盒”)的案例,当时按照网络安全测试标准操作,有意允许了互联网访问。
