拒绝 OpenAI 和 Anthropic 邀约,DeepMind 安全研究员离职转向独立测评
15 小时前

近期,关于AI递归自我改进及其潜在失控风险的讨论愈发激烈。多名曾在顶尖AI实验室工作的研究人员,因担忧安全问题,选择离职并投身于独立评测机构。Engels,曾在Google DeepMind从事AGI安全研究,三周前离职并加入了非营利组织METR。他指出,前沿AI公司正竞相开发超级智能,并推动AI参与更强AI的研发。然而,如果模型未得到充分对齐,局部错误可能引发加速反馈循环,且模型能力越强,越难以被理解和监督。近期模型的异常行为,更加剧了他的担忧。Engels认为,未来5年内AI有可能造成巨大伤害,因此必须确保对齐、评测和监控能力与模型发展同步。两周前,Anthropic前负责人Joe Benton也离职并加入了METR。他认为,前沿公司在安全方面的投入与其能力发展不相匹配,且公众对相关风险知之甚少。他希望通过推动企业披露进展,并由独立机构验证安全标准,来提高透明度。METR是一个专注于研究前沿AI能力与风险的非营利机构,其核心目标是形成可检验的测量方法和风险证据。然而,独立评测面临缺乏法定监管权、依赖企业开放程度等挑战,风险判断也存在争议。AI安全需要通过可重复评测、公开调查和外部审查来验证。Engels等人从实验室转向独立机构,旨在从外部检验前沿模型,确保在AI能力进入加速循环之前,人类能真正理解其行为。