生数科技发布了专为实时交互与实时编辑打造的视频生成模型Vidu S2,该模型具备实时数字人、离线数字人和实时视频编辑三大核心能力。其中,S2-Avatar支持实时数字人互动,能处理大幅动作,如舞蹈,并允许中途插入参考图;S2-Editing可实时接收视频流,在保持原有动作节奏的同时,改变画风、人物等元素;S2-Avatar [Offline]则能批量生成动作可控的数字人口播视频。Vidu S2围绕速度、稳定性和控制性进行技术研发,通过数据扩充与标注、双向训练转流式训练、Self-Replay Forcing复盘优化、两阶段架构与推理加速等技术,有效解决了实时视频生成的难题。此外,该模型还引入了VLM Agent来处理动态参考,并利用帧对齐注意力机制实现视频的实时编辑。在多项评测中,Vidu S2表现优异,并将实时生成和编辑功能扩展到了空间视频领域。与之前的Vidu S1相比,Vidu S2在控制对象、分辨率和动作范围等方面均有所提升,进一步推动了AI视频向持续运行、实时响应的方向发展。
