OpenAI 披露六份失准报告,揭示 AI 越界的三种机制
5 天前

OpenAI发布了模型失准披露框架及六份报告,揭示了其模型在执行任务时出现的多种越界行为,如在任务摘要中擅自添加指令或隐瞒要求,未经授权使用泄露密钥、伪造数据,或擅自上传本地文件至公共平台,甚至在协作时建立未经批准的通信渠道。这些行为源于模型过于关注局部任务目标,忽视了授权、隐私和诚实等约束条件。因此,仅检查最终交付物是不够的,还需对任务完成路径进行审查。