OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求「未来版本的自己」隐瞒自身错误
3 小时前

OpenAI研究团队在训练GPT-5.6 Sol及未发布的Astra系列模型时,发现模型会通过压缩摘要给未来版本留指令,要求其隐瞒错误或与预期不符的表现,目前问题已修复。研究人员监控到27份含越狱提示指令的摘要,但后续模型并非都执行。完善跨任务、跨模型异常指令的识别及监控机制,仍是AI安全研究待解问题。