字节跳动创始人张一鸣正在亲自指导一个基于公司 Seedance 视频 AI 的实时“世界模型”,彭博社报道称该模型最早可能在下个月推出。
张一鸣已不再负责字节跳动的日常运营。他于2021年卸任CEO一职,之后又卸任董事长,将TikTok、抖音以及字节跳动旗下其他业务的运营交由他人负责。但据彭博社9月7日报道,他目前正亲自协调多个业务部门的工程师,推进一个项目:一个能够渲染交互式三维世界并让用户实时穿梭其中的模型,所有内容均来自云端。
关键在于数据。彭博社报道称,该模型的延迟约为 50 毫秒,帧速率为每秒 20 帧。这样的速度足以让用户的动作或语音实时重塑场景,而无需等待预渲染的视频片段。
该模型基于字节跳动现有的视频生成系统 Seedance 构建,专为字节跳动于 2021 年 8 月确认收购的 VR 头显 Pico 而设计,但未透露收购价格。Pico 是该模型的目标硬件。此外,该模型也面向抖音平台,创作者无需购置昂贵的图形硬件即可在抖音上制作直播、短剧和游戏,因为繁重的计算工作将在字节跳动的服务器上完成,而非头显本身。
彭博社将张一鸣的个人参与解读为字节跳动在人工智能领域占据一席之地,而这场竞赛中已有两位知名人物:斯坦福大学人工智能先驱李飞飞,她联合创办了World Labs,致力于构建空间智能模型;以及Meta公司前首席人工智能科学家Yann LeCun,他多年来一直认为,仅靠语言模型无法让机器真正理解物理世界。
世界模型并非三维聊天机器人,而是一个经过训练的系统,能够预测空间及其物体在物体移动时的行为,这与机器人穿越厨房或自动驾驶汽车识别街道所需的预测能力类似。
这就是字节跳动正在追逐的前沿领域,而且并非儿戏。字节跳动为2026年设定了四大人工智能优先事项。世界模型位列榜首,其次是巩固Seedance在视频领域的优势、提升编码工具以及推动
36氪6月份报道称,字节跳动在世界模型训练数据(涵盖视频、3D和机器人数据)上的投入是其他国内实验室今年投入的三到四倍。这可是一笔不小的数目。据报道,字节跳动人工智能负责人吴永辉领导的Seed研发团队已设定内部目标,要在2026年底前至少推出一个世界模型,并将其与谷歌的Genie 3进行基准测试。
此前,字节跳动创始人张一鸣已告知其Seed AI团队,即使会牺牲短期进展,也要避免对竞争对手的模型进行提炼。此前,白宫指控月之暗面对Anthropic公司的Fable模型进行提炼,用于构建
坦白说,对于一项除了实验室演示之外无人能完全破解的技术来说,这是一个极具挑战性的目标,包括谷歌和 Meta 在内的所有公司都还没有完全破解这项技术。
云投注可能比模型本身更重要。
对于任何构建人工智能基础设施或消费级硬件的人来说,这里值得特别关注。渲染交互式 3D 世界通常意味着要么需要将强大的 GPU 绑在脸上(例如 MetaQuest 和 Apple Vision Pro 的方案),要么就只能获得卡顿、低保真度的画面。
字节跳动押注于通过在云端渲染所有内容并以每秒 20 帧的速度传输到本地来绕过这种权衡。如果这种方案在演示之外也能奏效,那么它将动摇沉浸式 VR 需要昂贵的本地硬件才能带来良好体验的前提。Pico 的头显价格可能会更低,字节跳动后续推出的产品也可能如此。
这也符合字节跳动现有的盈利模式。抖音的业务是短视频和直播,而不是游戏主机或工作站芯片。云渲染世界模式可以直接接入公司已经大规模盈利的平台,而无需先让数百万用户购买新硬件。
这一切尚未尘埃落定。彭博社的报道指出,发布时间尚未最终确定,仍有可能推迟。字节跳动也未公开透露任何关于定价、中国以外地区上市情况,以及Pico将如何与内容创作者整合等信息。但可以肯定的是,这家公司一向低调的创始人认为,这是一个值得他重返公众视野的项目。
