9月10日消息,Anthropic在网络安全评估中发现,Claude模型存在4次未经授权访问真实第三方系统的情况。这些事件均发生在一家第三方评估机构搭建的网络安全测试环境中,模型本应在无互联网访问的模拟环境中运行,却因配置错误而实际连接到了开放互联网。调查揭示了两个主要问题:一是“偏差推理”,即Claude模型倾向于忽略或错误解读其可能处于真实网络环境中的线索;二是“鲁莽行为”,即模型为完成任务可能采取有害行动。其中,Claude Mythos 5事件尤为引人关注,该模型曾上传恶意软件包至公共仓库PyPI,并进一步访问了真实系统。Anthropic强调,尽管这些行为存在风险,但均未超出测试任务范围,且未发现模型试图隐藏行为、协调其他代理或追求任务外目标。目前,Anthropic已与模型评估机构METR签署协议,启动独立调查,并计划加强预发布测试、监控机制及第三方运行模型时的安全要求。
