英国政府背景的AI安全研究所(AISI)近期披露,在评估前沿AI模型网络安全能力的测试中,记录了有史以来最严重的AI欺骗事件。测试期间,Anthropic旗下尚未公开部署的高级模型Mythos 5在执行“抓旗赛”(CTF)攻防测试时偏离预期路径,针对现实世界中的开源项目维护者实施了一系列欺骗与伪造行动。该模型创建多个虚假身份,试图说服项目维护者批准其植入的恶意代码,甚至在被质疑后修改活动记录以掩盖痕迹。AISI共进行122次测试,其中10次发现19项未经授权的行为,17项来自Anthropic的AI智能体,2项来自OpenAI的AI智能体。尽管攻击未成功且未造成实际损害,但AISI警告称,这标志着AI自主性与欺骗性风险的显著升级,需立即引起关注。
