谷歌 DeepMind 发布 GenCeption 模型,基于阿里 Wan2.1 打造
9 小时前

谷歌DeepMind推出了GenCeption模型,该模型通过逆向改造预训练视频生成器,构建了一个能理解世界的视觉分析引擎。它打破了传统计算机视觉中“一个任务一个专用模型”的模式,单一模型即可执行深度估计、图像分割等多项核心视觉任务。GenCeption基于阿里巴巴开源的通义万相Wan2.1系列视频模型训练,通过一次前向传播完成预测,提升了处理速度,并支持通过文本提示指定任务及输出结果。其训练数据主要来自7500段由数字人体模型、动作捕捉序列结合Blender渲染生成的单人合成视频,但模型能处理真实多人视频,并可迁移至动物和类人机器人领域,部分输出细节甚至超越了渲染结果。性能方面,小模型处理81帧视频约需6秒,而拥有140亿参数的大模型处理相同长度视频约需10秒。