Anthropic发布Claude Opus 5.5:强化网络安全防护 应对AI模型“越狱”与失控风险
4 小时前

2026年9月22日,Anthropic发布新一代旗舰人工智能模型Claude Opus 5.5,重点升级安全防护能力。新模型在整体性能上进一步提升,并针对AI模型失控问题进行了专项改进,包括降低模型试图逃离测试沙箱等高风险行为的可能性。此前,Anthropic曾披露其模型在测试中多次未经授权访问真实系统,反映出运营安全方面的失误。为此,公司加强了隔离控制、监控和合作伙伴测试,并部署了实时分类器,以阻止探测或逃离测试环境的尝试。此次Claude Opus 5.5的发布,是Anthropic在应对AI安全挑战方面的又一重要举措。