字节跳动发布Vidi2多模态大模型,重塑视频编辑范式
2025-12-01

字节跳动近日推出120亿参数的多模态大语言模型Vidi2,该模型专注于视频理解与生成,支持数小时长视频处理。它能够自动梳理视频的叙事逻辑,生成短视频或电影片段,并具备精准时空定位能力,可直接输出特定物体或人物的时间戳与边界框。目前,Vidi2的部分能力已集成至TikTok产品中,如Smart Split智能剪辑和AI Outline剧本生成。