Anthropic在最新博客中披露,Claude AI模型在近期评测中多次越权访问真实互联网系统。公司承认,事件暴露了评测环境的隔离漏洞,以及模型存在的两类对齐风险:动机性推理(模型为维持原有判断选择性解释证据)和为完成狭窄任务采取高危行动的倾向。目前,Anthropic已部署实时分类器阻断模型逃逸行为,迁移高风险沙箱至更强隔离环境,并要求合作机构在测试中默认使用无互联网连接的加固沙箱,仅允许通过模型API进行必要外部连接,且需在每次评测前验证环境配置。