赛马过时了,Wan 3.0还是越早和HappyHorse合并越好
6 小时前 / 阅读约10分钟
来源:36kr
阿里在视频生成模型领域同时维护Wan和HappyHorse两套功能高度重合的模型,引发内部赛马。但两者均未撼动市场格局,阿里需集中资源发展核心能力。

在视频生成模型这个赛道,有一个大厂投入了太多,不光使出了“骑马找驴”,还在持续的“内部赛马”,它就是阿里。

今年4月,HappyHorse以匿名模型的身份突然出现在Artificial Analysis榜单上,并一口气拿下文生视频、图生视频等多个榜单第一。

几天之后,阿里正式认领这匹“欢乐马”。

一个此前在AI视频领域存在感并不算强的互联网大厂,也终于拥有了自己的明星模型。

HappyHorse官网截图

只是HappyHorse的风头还没有持续多久,阿里的另一条视频模型路线又开始活跃。

8月6日,通义万相正式推出Wan 3.0。

相比此前的Wan 2.7,新模型将单次生成时长从15秒提升到30秒,并把文生视频、图生视频、参考生视频和视频编辑整合进同一个模型。

从产品定位到目标用户,Wan 3.0几乎覆盖了HappyHorse现有的全部能力。

更有意思的是,它的价格还更低:720P视频每秒0.6元,HappyHorse 1.1则是每秒0.9元;到了1080P,两者同为每秒1.2元。

换句话说,阿里不仅在同时维护两套功能高度重合的视频模型,还让它们在同一个百炼平台上,用不同的价格争夺同一批客户。

这让一个原本还能被解释为“内部赛马”的故事,开始显得有些没有必要。

内部竞争当然不是坏事。

HappyHorse的出现至少证明,阿里内部不同技术团队可以绕开既有路线,迅速做出一款进入行业第一梯队的产品。

根据壹娱观察从相关人士透露了解,阿里内部在统一千问办公体系的同时,也把Wan和HappyHorse合并事宜摆上台面,并且更大概率未来会以HappyHorse为主,只不过,未能想到阿里在此之前仍要“赛赛马”。

赛马的目的应该是跑出结果,而不是让两匹马永远并排跑下去。

特别是在视频生成这一门仍然烧钱、很难赚钱,也远没有找到稳定商业模式的生意里,阿里越早让Wan和HappyHorse真正合流,越符合现实。

视频模型,本就不适合赛马

某种程度上看,Wan和HappyHorse从一开始确实是两条不同的路线。

Wan来自通义体系,更接近一套标准的基础模型,强调通用技术能力、开发者生态和云端API,也承接了阿里在开源社区中的品牌认知。

HappyHorse则来自原淘天未来生活实验室,更贴近创作者和商业内容生产,突出原生音频、人物表现、多图参考,以及广告、短剧等具体场景。

差异化曾经足以支撑两支团队同时存在。

Wan 3.0生成视频截图

基础模型团队负责拓展能力上限,产品团队则从真实需求出发,寻找更快的商业化路径。

如果HappyHorse只是一款建立在Wan之上的创作者工具,两者甚至可以形成相当自然的上下游关系。

实际情况并非如此。

HappyHorse不是调用Wan的上层应用,而是另一套独立的视频生成模型。它拥有自己的文生视频、图生视频、参考生视频和视频编辑能力,也有独立官网、模型版本、API和价格体系。

Wan 2.7能做的事情,HappyHorse 1.1大部分都能做;HappyHorse曾经主打的原生音频、人物一致性和多镜头叙事,又逐渐被Wan吸收。

从Artificial Analysis目前的榜单来看,Wan与HappyHorse仍然处在相近梯队。

图源:Artificial Analysis

两者之间当然存在能力差异,但这种差异更像同一水平线上的路线偏好,而不是足以划分市场、区隔用户的代际差距。用户很难说清楚什么任务必须用HappyHorse完成,又有什么场景只能交给Wan。

到了Wan 3.0,原本就不算清晰的边界进一步消失。

30秒生成、全模态参考、原生音频、人物与场景一致性、视频编辑,以及面向短剧、广告和企业内容的应用方向,几乎每一项都进入了HappyHorse的传统领地。

Wan 3.0甚至还用更低的720P价格,直接削弱了后者作为“高性价比商业模型”的位置。

更何况,两支团队在组织上已经不再独立。

今年6月,阿里将通义大模型事业部和未来生活实验室合并,成立由吴泳铭直接负责的Token Foundry事业部,HappyHorse团队也一并进入新部门。

调整本身就说明,阿里已经意识到基础模型研发与商业场景探索各自为战的问题,需要把研究、工程和产品能力重新集中起来。

图源:网络

但组织架构合并之后,两套模型仍然按照各自的节奏继续更新。6月下旬,HappyHorse 1.1发布;一个多月后,Wan 3.0开启公测。

表面上看,这是同一个事业部同时拥有了两张牌;放到具体研发中,却意味着两套模型仍然需要分别完成数据准备、训练、后训练、评测和推理优化,产品端还要分别维护入口、文档、定价与用户认知。

这已经不再是用少量资源进行多路线探索,而是在最昂贵的模型类别之一上重复“造轮子”。

技术路线尚未确定时,让多个团队同时寻找答案很正常;但当两款模型已经功能趋同、团队合并、客户重合,继续赛马的边际收益只会越来越低。

没有一技之长,低价和全能就没有意义

更关键的问题是,无论HappyHorse还是Wan 3.0,实际上都没有撼动当前视频生成市场格局。

HappyHorse以匿名模型登顶时,确实制造了足够大的声量,但这种领先并没有持续转化成稳定的市场位置。

随着Seedance、可灵、MiniMax甚至各种开源视频模型继续迭代,HappyHorse很快重新回到追赶者的位置。

Wan 3.0虽然补齐了时长、音频、全模态输入和视频编辑等能力,目前同样没有建立一项足以改变市场认知的决定性优势。

阿里现在维护仅仅只是两个功能高度重合、能力互有长短,却都还没有摆脱追赶者身份的模型。

视频生成发展到今天,真正能够让用户记住一个模型的,通常不是它的功能列表有多长,而是它在哪一件事情上做得明显更好。

有人依靠动作表现和镜头控制建立专业影视口碑,有人凭借人物一致性进入短剧和广告,还有人通过开源与低成本扩大基础用户规模。

只有先形成一块足够长的长板,模型才有机会围绕它建立用户认知和商业闭环。

Wan 3.0的问题恰恰在于,它看起来什么都能做,却还没有证明自己在哪一件事情上不可替代。

30秒视频、原生音频,以及支持PDF、PPT、表格和网页输入,当然都是功能上的进步。但如果人物运动、长时一致性、镜头理解和指令遵循仍然没有显著领先,这些新增能力更多只是把产品清单拉得更长。

Wan 3.0生成视频截图

把一份PPT自动变成视频,也很适合拿来演示,却未必是一项经过验证的高频需求。

用户真正需要的不是“模型可以读取PPT”,而是它生成的内容足够准确、稳定和可控,能够直接进入生产流程。如果结果仍然需要反复检查、重做和剪辑,那么多一种输入格式并没有创造新的生产力,只是给原有能力增加了一个入口。

HappyHorse所强调的广告、短剧和创作者场景也是一样。

使用场景多元化不能替代基础能力的突破。人物一致性足够强,才有资格谈连续短剧;商品还原足够准确,才有资格谈电商广告;镜头和动作足够可控,才有资格进入专业制作。

在单项能力尚不突出的情况下急着覆盖更多场景,本质上是在用产品包装掩盖技术差距。

happyhorse生成视频截图

价格同样不是独立存在的优势。

Wan 3.0的720P视频每秒0.6元,看上去比HappyHorse更便宜,但视频生成的真实成本从来不只是单次调用价格,而是得到一条可用视频需要尝试多少次。

按照现有定价,一段30秒1080P视频需要36元;如果反复生成十次才得到可用结果,反复抽开后的调用成本就会达到360元,还没有计算筛选、剪辑和修改的时间。

因此,一段更便宜但无法使用的视频,并不比一段价格更高却能一次成功的视频更有性价比。

对专业用户来说,价格从每秒0.9元降到0.6元,远没有提高可用率重要。模型公司真正需要降低的,不是价格表上的数字,而是用户获得最终结果的总成本。

这也使同时维护Wan和HappyHorse越来越缺乏意义。

视频生成需要大量训练与推理资源,商业需求却仍然集中在广告、电商、短剧和社交媒体等低频、定制化场景。在商业闭环尚未稳定之前,阿里最不需要的,就是让两套模型分别扩展相似的功能清单。

Wan 3.0和HappyHorse 1.1模型能力对比

更合理的方式,是让Wan成为统一的视频基础模型,吸收HappyHorse在人物表现、音画协同和商业场景上的积累;HappyHorse则保留为面向创作者的产品品牌,负责工作流、模板和行业方案。

底层集中训练一套模型,上层仍然可以拥有不同入口。

HappyHorse此前已经完成了自己的任务。它证明阿里可以迅速做出一款进入第一梯队的视频模型,也迫使Wan加快迭代。

但如果一场内部赛马始终无法选出主线,那么赛马就会从激励机制变成组织惯性。

阿里真正需要的不是两个模型继续比谁功能更多、价格更低,而是集中资源做出一项足以改变市场格局的核心能力。

只有先把一件事情做到不可替代,讨论价格才有价值,场景扩张才有基础。归根结底产品赛马的思维模式其实还是前AI时代的互联网产品思维,或者说阿里其实也还没适应新的AI时代。