OpenAI发布新安全政策,强化模型测试阶段风险管控
7 小时前

据TechCrunch报道,OpenAI于8月19日宣布推出一系列新安全政策,重点加强模型测试阶段的安全管控。新措施包括在开发过程中对模型进行更细致的监控,并在训练后阶段进一步强化对齐与安全要求。OpenAI表示,随着模型能力增强,内部开发与测试风险上升,监控和安全标准必须保持领先。此次政策调整是7月21日Hugging Face事件后,OpenAI在安全实践方面的首批公开变更之一。公司代表称,新措施并非直接针对该事件,但也受到即将推出的Astra模型网络安全能力及AI行业快速发展的推动。OpenAI还透露,在Hugging Face事件后曾暂停强化学习训练两周,目前已重启部分低风险模型的训练,但最大规模的前沿强化学习训练计划仍在暂停中,目前正通过小规模训练和评估来评估模型行为、验证安全措施。