近年来,视频生成模型虽推动了“可交互视频世界”向原型发展,但难以显式维护目标、规则等高层语义。为此,西湖大学AGI Lab与南洋理工大学团队提出了Code World Model。该模型以语言模型为核心,让coding agent通过编写、调用和修改代码来维护可执行的世界状态,再通过proxy将这些状态转换为视觉条件,指导视频模型生成画面。这种设计实现了“code决定世界发生什么,视频模型决定其外观”的职责划分。Code World Model将世界运行拆分为三部分:coding agent进行稀疏决策、代码执行密集状态更新、视频模型生成视觉观察。该模型通过游戏运行时记录获取对齐数据进行训练,原型实验表明,其能遵循proxy的时空约束,生成风格多样的丰富画面,为开放生成世界的构建提供了新思路。
