估值冲到40亿美元,实时交互视频还没跑出「杀手级应用」
5 小时前 / 阅读约11分钟
来源:36kr
实时交互视频成AI领域商业化新方向,Decart、Vivix、SigmaZ AI等公司探索不同技术路线,资本押注年轻创业者,期待其在大厂未全力投入的前沿方向上取得突破。

「核心提示」资本疯狂押注,估值水涨船高。实时交互视频这场豪赌,赌的是技术路线,还是年轻创业者的运气?

世界模型,是近两年人工智能领域最烧钱、也最遥远的方向之一。

它的目标是让AI在内部构建一个能自主运转的虚拟世界,用来训练游戏、机器人和自动驾驶。人类靠直觉就能完成的判断,交给AI却要消耗巨大的算力和数据。对普通人来说,它似乎离日常生活很远。

不过,即便是看似如此遥远的世界模型,如今也有了具体的商业化方向。

今年5月,一家名叫Decart的世界模型公司与亚马逊旗下的云计算部门AWS达成合作,把自己的实时视频模型Lucy打包成API,通过AWS的分发网络,供企业客户直接调用、按token计费。

Lucy的能力也相当接地气,你只需要把摄像头对准自己、对准房间、对准手边随便一样东西,打一句话,画面就能立刻发生变化。根据lucy2.5的官方视频,你甚至可以随时对衣服进行虚拟试穿,一转身、一抬手,衣服也能跟着动。或许在不久的将来,网购时最困扰我们的问题真的会被AI解决掉。

这就是实时交互视频。未来,视频可能不再只是拍好的成片,而是为你当场生成、能随时打断、随手改写的画面。在世界模型这条又贵又远的赛道上,它是眼下少数几个真能见到营收的角度。也因为它离商业化足够近,涌进来的人和钱都不少,也有和世界模型并行的技术路线同时在推进。

但热度背后,在产品方面,谁能率先跑出“杀手级应用”还是未知数。

那么,在那个遥远的和AI有关的未来里,实时交互视频为什么是好的商业化落地方向?从全新的交互模式到落地的产品之间有多少技术路线在并行,又有多远的路要走?

三条路线,三种打法

传统视频的生成AI,如OpenAI的Sora、字节跳动的Seedance,都是喂一段话,输出一段几秒到几十秒的成片,用户只能看,不能修改和编辑。实时交互视频不一样,它能够根据已经生成的画面和用户的交互不断生成,产出能实时探索、随用户操作改变的界面。

用一列火车开进隧道、再开出来举例:

Decart选择的世界模型路线“心里”装着一个模拟出来的世界。车钻进洞,它也知道车还在,车还会开出来。这条路线能力很强,但也很贵,既吃算力又吃数据。

所以,对于实时交互视频这个呈现方式来说,目前更主流的做法是像素路线。把视频里的每一帧当作一幅画,一帧一帧来画,车开进隧道,画面上的车就消失了,模型只能去猜测要不要把车再画回来。所以这条路线更容易做出好看、沉浸的效果。但它并不在意物体是否始终存在、数字是否准确。多一根手指、标错价格这类问题,大多出在这里。

第三条路线是国内实时视频交互公司SigmaZ AI选择的代码路线。SigmaZ AI是一家由扩散语言模型驱动的实时交互视频生成模型公司。

它选择的这条路线不画画,而是后台维护着一张场景清单,车就是清单上的一条记录。车开进隧道,后台会给它标上一句“暂时被挡住”,所以它能稳稳从另一头开出来。事实上,它生成的不是一段视频,而是一张不断生长、带时间轴的网页——里面每样东西都是一段代码,你可以随手拖动、旋转,也可以随时喊停。在实时交互这个赛道,它比像素路线准确度更高,比世界模型的做法更便宜。但到目前为止,它在纯视觉观感这一维度上暂时不如像素路线擅长。

三条路线眼下各有短板,也都在补课。像素路线在提升准确性、代码路线在提升画面质感,一些世界模型公司如Decart则在尝试降低算力成本。等到它们在产品端相遇的那天,才知道谁跑得更快。

不过,不同路线对于生成速度快的追求是一致的。在怎么做到快这件事上,每家给出的答案也不同。SigmaZ AI给出的答案是一种和主流大模型不同的生成方式:扩散语言模型(DLM)。

这是一种和我们熟悉的大语言模型不同的技术路径。LLM是一个token一个token生成的,后一个词要等前一个定下来才能生成,所以句子越长越慢。DLM不一样,它会先铺出一版粗糙的整体草稿,再经过若干轮迭代,同时对所有位置反复修正,直到清晰。因为不必逐字排队,而是并行推进,所以理论上能够做到更快。

过去,DLM多为数十亿参数的小模型,蚂蚁集团的LlaDA 2.0首次将其提升至千亿参数级别,证明了该路线同样能够承载主流大模型的规模。2026年5月,字节跳动开源了连续隐空间扩散语言模型Cola DLM,同年6月,谷歌Deep Mind首次以开源权重发布了扩散文本模型Diffusion Gemma。和ChatGPT横空出世前的LLM一样,DLM正从实验室走向规模化。

资本在赌一群年轻人

如果说路线决定了打法,那么资本更直接的一个共性是,它把钱押在了一群二十多岁的年轻人身上。

Decart创始人兼CEO迪恩·莱特斯多夫今年27岁,公司已完成多轮融资,今年5月,其完成约3亿美元融资时估值约40亿美元,投资方包括英伟达等。今年8月,据媒体报道,Anthropic打算以约60亿美元的价格收购Decart。

把目光转向中国,钱同样在朝这个方向流动。

比如同样在做实时交互视频,但走“流式化改造 DiT”路线的国内公司Vivix,创始人刘宇是个95后,港中文多媒体实验室博士出身,26岁做到商汤最年轻的研究执行总监之一。据报道,Vivix目前团队共100多人,大多是95后和00后,押注互动叙事和娱乐沉浸的方向。公司成立一年,已经拿下5轮融资,估值超过13.2亿美元,投资人包括IDG、红杉等知名投资机构,也有投出过小米和理想的五源和蓝驰。

同样被蓝驰创投看中的还有和Vivix技术路线和应用落地方向都不同的SigmaZ AI,相比娱乐沉浸方向,他们更倾向于搭建通用平台。

据悉,SigmaZ AI的两位创始人William(杨博麟)和Derek分别出生于2003年和1995年。前者是连续创业者,创办过多家公司;后者毕业于帝国理工学院计算机科学专业,曾任 Amazon AGI Lab 视觉代码训练Tech Lead。除蓝驰创投外,SigmaZ AI还拿到了云启资本、德迅投资、XIAOXIAO FUND小小基金等投资。

资本押注这些年轻人,赌的其实是同一件事,在大厂不想allin的前沿方向上,年轻的创业者或许能先跑出来。

有AI从业者对《豹变》表示,对于前沿方向来说,在小创业公司的探索空间其实可能比大厂更大。大厂往往押注最赚钱的方向,先把商业模式已经验证的地方复制放大、榨干,对“sidebet”(赔率高胜率低)的方向,往往只会放一个很小的团队试一试。“如果不行,他们还有很多盈利点,这个方向就放弃了。”

但大厂没有allin的方向不一定是错的。

2026年5月,Decart的B轮领投方曾对外表示,尽管整个AI行业普遍认为,实时、生产级的生成式视频世界模型还需数年才能实现,Decart却已经把它变成了商业现实,亚马逊是其跨多条产品线的早期API核心客户。

这家二十多岁年轻人带领的公司,先于大厂交付了看似还很遥远的东西,而英伟达等大厂反倒成为了它的投资人。

下一个战场在哪里?

资本的热闹是一回事,用户买不买账是另一回事。

截至目前,在产品端走得最远的是Decart,其Lucy模型已通过与亚马逊AWS的合作对外交付。目前,它在b端的应用主要是亚马逊等电商、虚拟试穿、直播和广告等场景,通过API提供、按用量计费。Decart创始人曾在接受采访时隐约透露出对to C应用的向往:“我们本可以做一家卖给英伟达或别的巨头的好公司,但我们要做的是一个面向十亿消费者的应用。”

Vivix或许更偏向押注互动叙事和娱乐沉浸方向。据投资界等媒体报道,Vivix目前正在打磨两款模型。一款是Vivix-A1,被称为首个面向交互式AI角色的实时全双工模型;另一款是Vivix-W1,以互动叙事为核心的实时多模态大模型,会在上线模型的同时上线API。

SigmaZ AI则把“准确”摆在第一位。William和Derek表示,准确性会一直排在他们的benchmark(基准测试)第一位。这也让他们的产品最终会导向实用性。SigmaZ AI对《豹变》表示,从这个角度看,实时互动视频赛道的想象空间,或许远比“做出一个能交互的数字人”更大。

SigmaZ AI最初做的是一款C端消费产品,数据不错,但团队慢慢发现,用户不只在用它学习,还有人在尝试用它生成商用视频。

“上传商品详情页的小商家会在后台问我们,我的货能不能也这么转360度讲一遍?市面上那些生成视频的工具,一次只能出15秒,贵,还老把商品做错。你这个准确,单出个做视频的版本,我加三四倍的钱也行。”William说。

于是,基于已经存在的真实需求,他们决定做一个受众更为广泛的平台Tap8,定位为“产品实验室”,未来Tap8会同时向C端消费者和B端客户开放,服务营销、销售、导览、how-to等多种信息密集型场景。或许有一天,用户只要对着摄像头询问“电视怎么修”,屏幕上就会跳出可旋转的3D模型,带领用户一步步操作。

目前,我们已经能看到一点产品端的竞争苗头。就说“换背景”这件小事。Lucy的本事是你对着一段实时画面说句话,它能够当场把背景换掉。在Tap8的宣传视频里,用户可以对着实时生成的画面提问、让画面随指令即时改变,也可以直接点击画面里的元素;比如点击一个3D耳机模型的某个零件,Tap8会实时生成对应的原理讲解画面。

但这或许还只是竞争的一小部分。更大的挑战是,这些年轻的创业公司得让资本和用户同时相信,自己用AI做出来的东西,和市面上已有的产品不一样。

比如Lucy的宣传片中,用户可以用AI把自己的脸变得很肿,看着很酷,可是抖音的滤镜在很多年前就能做出差不多的效果。技术上再实时、再丝滑,落到用户眼里如果只是“又一个滤镜”,这条赛道就还没真正跑出自己的意义。

或许,这个赛道真正的分水岭不是谁跑得更快,而是谁先做出那个以前没有的产品。