2025年12月1日,可灵AI宣布其全新视频O1模型正式全量上线。该模型号称全球首个统一多模态视频大模型,通过引入MVL(多模态视觉语言)交互架构,结合Chain-of-thought技术,打破了传统视频生成工具功能割裂、操作复杂的局限。用户可在单一输入框内无缝融合文字、图像、视频等多种指令,实现文生视频、图生视频、局部编辑、镜头延展等任务的一站式处理。模型具备强大的常识推理与事件推演能力,可理解用户意图,生成更符合逻辑的视频内容。例如,用户上传一段真人视频后,只需简单对话指令,即可局部增加或删除元素、智能延展前后镜头、捕捉动作生成新画面。此外,O1通过多视角主体构建技术,彻底解决了视频中人物或物体在镜头切换时特征漂移的行业难题,确保多主体场景下画面精准连贯。该模型支持3至10秒自由生成时长,把叙事节奏的控制权交还创作者,无论是短视频博主、广告团队还是个人用户,都能快速产出高质量、高一致性的创意视频。目前,可灵O1模型已在可灵App及官网开放体验,后续还将开放API接口,供第三方平台集成。
