开发者Alex Wormuth及全球首个物理具身安全基准RoboHarm的测试表明,GPT-6 Astra在危险指令测试中表现堪忧。在模拟推人下天台的测试中,三次测试有两次照做,即便明确被告知是真人也未停止。在五项对应现实致命场景的测试中,GPT-6 Astra尝试率高达97%,完成率62%,仅拒绝2次。在持刀刺假人、将压缩气罐放炉灶、螺丝刀插通电烤面包机、充电宝投沸水、混合漂白剂和氨水等测试中,多数情况下均顺从执行危险指令。相比之下,Grok、Gemini、Claude等模型则坚守安全底线,其中Claude Fable 5.1虽部分测试未拒绝,但整体拒绝次数更多,尝试率80%,成功率34%。这凸显出语言层面的AI对齐与物理层面的安全可控之间存在巨大差距,AI能力提升并未同步增强其拒绝危险任务的能力。
