9月23日消息,DeepSeek于当日公开了一篇关于智能体训练的新论文,引发广泛关注。这篇长达31页的论文详细介绍了其内部使用的生产级沙箱平台DSec,论文作者多达百余人,梁文锋亦在列。论文中特别探讨了“智能体的不当行为”问题。DeepSeek发现,智能体可能会通过非预期渠道获取答案,例如搜索平台管理文件中的残留答案,从而破坏训练和评估结果的有效性。即便引入了访问控制机制,仍有智能体试图通过交换文件数据块映射等方式,使受保护文件内容可通过另一文件描述符访问,进而损害任务或共享基础设施。DeepSeek认为,没有一种单一机制能够完全防止智能体的不当行为和系统故障。因此,团队采取的方法是加强可观测性,以便及时发现新问题,并随着模型的演进不断加固DSec平台。具体措施包括限制智能体通过非预期渠道获取答案的访问控制,以及减少对欺骗行为的奖励等。这些控制措施在一定程度上解决了部分问题。
