李飞飞新访谈:LLM 预测 Token,世界模型预测「新视角」
4 小时前

李飞飞与World Labs的另外两位联合创始人做客a16z,详细介绍了多模态世界模型Atlas。Atlas的核心在于新视角预测,不同于大语言模型(LLM)的下一个token预测或视频模型的下一帧预测,它能够根据输入场景的多个视角或描述,生成时空任意位置的画面。Atlas首次将生成与重建功能整合到同一模型中,能够原生处理文字、图像、视频、3D数据以及相机位姿等多模态信息。传统3D重建通常需要数百甚至上千张照片,而Atlas将数据采集量大幅减少至几张或几十张,仅用三部iPhone即可拍摄出类似《黑客帝国》中的子弹时间视频。Atlas是在前一代模型Marble的基础上迭代而来,Marble以高斯泼溅为输出表示,存在一定瓶颈,而Atlas以新视角预测为基本原语,突破了这一限制。它实现了生成与重建的统一,解决了传统重建中容易出现的盲区问题,且无需依赖生成补全,同时具备可扩展的空间上下文窗口。在应用场景方面,Atlas能够为创意工作者提供3D一致的生成内容,还可应用于建筑设计与施工等领域。在机器人领域,Atlas能够显著提升现实到仿真的效率,解决机器人训练数据不足的问题,未来还可接入动态数据,实现动作规划的连接。目前,Atlas已具备初步的动态处理能力,未来将在动态、编辑和交互等方面进一步发展,目标是构建一个允许用户与3D世界进行直观交互的系统。研发团队认为,新视角预测与下一个token预测具有同等重要的地位,可能是通往通用人工智能(AGI)的基础原语之一。