关于视频生成的「应用会不会被模型吞掉」,答案可能比「不会」更危险
4 小时前 / 阅读约7分钟
来源:36kr
AI投资人Gavin Baker认为AI应用公司将迎来爆发。但视频生成应用面临挑战,难以摆脱对前沿模型依赖。视频生成应用试图通过升级工作流、打造爆款IP等方式增加价值,但效果存疑。未来应用公司是否自己做模型,需考虑成本效益。

模型与应用之间究竟会形成怎样的“演进关系”,一直是AI赛道反复讨论的问题。 

Gavin Baker是美国知名科技投资人,曾长期管理富达科技基金,也是英伟达、特斯拉和SpaceX等公司的早期投资者。 

最近他提出一个判断:随着模型路由、开源模型和专用后训练逐渐成熟,AI应用公司可能迎来一轮爆发——应用公司可以用自己的业务数据训练专用模型,把大量高频任务从昂贵的前沿模型迁移出去,只在真正困难的任务上调用最强模型,从而实现客户越多、数据越多、模型越强,单位成本反而越低。 

类似观点,近期也出现在演语科技Evoken创始人陈冕与晚点LatePost的对话里。 

在回答“应用会不会被模型吞掉”这一问题时,陈冕说道:“我觉得应用的时代还没有来。只有Token便宜、智能随手可得的时候,应用公司的时代才会来,可能是两年、三年或五年后的事,但要从现在开始准备。” 

他还拿铁路和火车举例,认为模型如同铁路这样的基础设施,应用公司则是一列列垂直领域的火车。基建修好之后,商品与社会资源开始大规模流通,自然也会带来新的繁荣,应用层由此获得更大的机会。 

这番话,对于演语科技旗下视频工具LibTV来说,显然是一套相当有利的叙事。

LibTV官网截图

但也许会让陈冕失望的是,视频生成很可能恰恰是这一逻辑中最大的例外。

按照Gavin Baker的判断,法律、代码、客服、咨询等应用可以在成熟的开源模型上进行后训练,因为它们需要解决的问题相对明确,训练和推理成本也足够低;但放到视频模型上,情况却完全不同。 

训练一个真正有竞争力的视频模型,需要巨大的数据、算力和工程投入,即便只是持续追赶前沿模型,其沉没成本也远非一般应用公司能够承担。 

与此同时,影视公司和广告等下游客户又恰恰是对模型质量最敏感的行业:画质差一点、人物一致性弱一点、镜头控制差一点,都可能意味着最终结果根本无法进入专业生产流程。 

AI生成视频截图

因此,“便宜但够用”的专用模型,在视频领域能够覆盖的空间显然要比文本应用小得多。 

这意味着,当其他垂直AI应用正在通过训练专用模型逐渐摆脱对OpenAI、Anthropic等前沿模型厂商的依赖时,视频生成应用可能长期走向相反的方向:它们可以通过LoRA、微调、工作流和小模型解决局部环节,却很难在最核心的生成环节真正脱离Seedance、可灵这类前沿模型。

这就是LibTV、OiiOii等这一批以视频生成工具为主的公司所要面对的现实危机。 

当前行业的底层逻辑其实已经相当赤裸:创作者对视频生成应用的忠诚度,很大程度上绑定于平台给出的Seedance API折扣、补贴、充值让利这一类短期红利。哪里Seedance的调用成本压得更低,流量与用户就更容易集体涌向哪里,这早已是AIGC创作圈不必明说的潜规则。 

当然,视频生成应用们也不是毫无防守。 

其中一招,就是这两年不断强调的“从单一视频生成工具升级为一体化AI影视工业化工作流”,试图用专业化和完整工作流来增加平台本身的价值。但对于疲于为流量奔波、每天都在为生成成本算账的创作者来说,这种所谓工作流优势究竟能够带来多少实际的感知差异,恐怕还要打个问号。 

还有一招,就是不断“拿爆款标的来做招牌”。

LibTV现在的金字招牌,显然是第一季抖音播放量破两亿的短剧《被裁掉的女孩》,其打造的AI艺人“方桃子”更是在涨粉40万之后,因为“60秒广告报价25.8万”登上了微博热搜第一位。 

《被裁掉的女孩》截图

显然,这是视频生成应用在产品思维之外,加码内容与娱乐营销的又一种“饱和式攻击”。这样的流量打法当然更加省时省力,可细想下来,一个IP的成功,真的能够直接挂钩到视频生成平台这一工具本身吗?大众对于这部短剧的直观感受,究竟来自故事、人物弧光以及最终的模型效果,还是所谓生成工具背后的工作流? 

即便强大的如IMAX这样顶级影视工具,恐怕也不敢说离开诺兰,它照样还能让观众为IMAX 70mm胶片加钱买单吧。 

更何况,《被裁掉的女孩》这一IP本身以及“方桃子”等AI艺人的所有权,也未必属于视频生成平台。其导演菲菲飞在抖音页面介绍中直接挂着“小云雀超创作者”“即梦AI超级创作者”等身份,也明确表示“方桃子”已经进行了版权登记,而不少媒体也扒出了其背后的MCN公司。 

诚如之前热度不俗的AI短片《纸飞机》,到了可灵AI这里,就是“制作生成”的成功案例;到了抖音这里,又成为“平台与创作者的双向奔赴”。一部作品真正出圈之后,很难说清究竟是哪一方发挥了更大的作用。 

这样来看,留给视频生成应用最清晰的空间,似乎还是“搭配Seedance更好用,也更省钱”。可这样的“绝招”,会不会有一天被Seedance的亲兄弟小云雀、剪映迅速练成,谁也不好说。

就在此时此刻,在《被裁掉的女孩》第二季的更新介绍里,菲菲飞已经直接挂出了“全片由小云雀Seedance 2.5制作”。

抖音截图

作为夹在模型与创作者之间的中间商,LibTV们的被动性也就可想而知。 

最后,这也自然引出了另一个问题:未来应用公司会不会干脆自己下场“做模型”。

市场上当然不乏“模型+应用”并行的公司,例如生数科技、爱诗科技等,它们也都是近期资本市场的宠儿。但有意思的是,它们如今所讲的故事,核心其实都已经出现了明显转向。 

像是生数科技,正在强调视频模型的“实时交互”,再搭配“世界模型”的叙事,试图讲出更多面向物理世界的落地可能;爱诗科技也早早占领了世界模型的概念,再叠加其不错的海外市场表现,为自己找到了另一套资本市场愿意下注的锚点…… 

生数科技旗下Vidu

再看这批仍然单一在视频应用层奔跑的公司,它们的资本叙事显然还主要停留在工具端。而工具端本身的局限,又让它们很难快速靠近不断变化的AI叙事,讲出资本市场更感兴趣的方向性故事。最后留给工具公司的验证标准,依然只能回到最传统的用户数据与盈利能力。 

更关键的是,对于习惯产品化打法的AI视频应用公司而言,“能不能训练自己的模型”其实不是问题,真正的问题在于,投入巨额成本训练一个模型之后,它是否真的会比直接调用下一代前沿模型更加划算。

只要前沿视频模型仍然处在高速迭代之中,这笔账恐怕就很难算得过来。 

Seedance 2.5单段视频时长从15s升级至30s,人物一致性显著优化

应用会不会被模型吞掉?对于视频生成应用而言,眼下这种进退两难的博弈,以及作为“第三方”不断收缩的叙事空间,或许都会让这场与时间赛跑的答案变得更加残酷。 

所以,只能趁着叙事与资本热情尚未消散之时,加速融资,甚至是加急上市,哪管事后洪水滔天。