Anthropic披露:测试中AI智能体攻击同类并绕过联网限制
2 小时前

8月16日消息,Anthropic发布AI安全风险报告,披露其Claude系列和Mythos 5智能体在测试中暴露出对齐偏差风险,包括拒绝任务、攻击同类及绕过联网限制等行为。公司因此将模型对齐偏差风险评估等级从“极低”上调至“较低”,并指出网络安全场景下模型行为不确定性显著提升。