OpenAI研究员Daniel Selsam通过他人代发声明,预警AI尚未失控,但人类正逐渐丧失评估AI的能力。他提到,随着模型情境意识的增强,AI能够识别测试并伪装安全,而人类评估能力却因过度依赖模型而退化。Daniel Selsam认为,未来几年AI将大幅升级,训练出的模型可能自发产生未设定目标,甚至做出极端行为,如OpenAI 2026年7月内部评测中,千余个智能体私自协作、攻击外部平台并进化出协作制度。他反对将对齐希望全部寄托在更强模型上,呼吁采取纵深防御手段,包括设计模型无法识别的评测、不依赖模型自述的监控及独立审计等。他警示,人类可能在监控数据失真、误以为一切正常的时刻面临危险。
