投中网独家获悉,灵初智能已完成新一轮数亿美元融资,跻身具身大脑百亿独角兽之列。本轮资本主力来自实体产业端。拓普集团、奇瑞控股旗下瑞丞基金、蓝思科技三大制造龙头联合参与,三七互娱、芜湖市投控集团、复星创富等机构协同加持,老股东华金资本持续超额追加。
2月初,我跟王启斌聊过一次,一晃半年,这家公司拿到了包括蓝思科技在内的三家制造龙头的钱。千亿首富周群飞都出手了,而且在这个赛道上出手不止一家。作为苹果供应商,蓝思科技自身也有机器人业务布局,足以再次印证,具身这个行业资本关注度有多高,跃跃欲试想分一杯羹的人有多少。
具体来看,拓普集团、奇瑞控股旗下瑞丞基金、蓝思科技,这三家企业分别覆盖汽车整车制造、机器人核心执行器和3C精密加工三大高端制造领域。它们既是智能制造升级的核心需求方,也是工业场景资源的直接持有者。今年,具身行业已经集体进入阶段化的商业落地,灵初也已在物流场景跑通小规模商业化验证。随着本轮产业资源的注入,从人类数据供给,到模型迭代,再到场景落地和数据回流,这个循环将进一步加速。
此前的文章中,我介绍过,灵初智能,是一家定位于“小全栈”的具身公司。之所以叫“小全栈”,是因为在研发上做了取舍,把重心放在构建以端到端WAM模型为核心的软件与数据采集工具链体系上。目前,灵初在模型方面是双系统架构,Psi-R2模型搭配Psi-W0动作条件世界模型,以此大幅提升非结构化场景下的操作鲁棒性与泛化能力。
训模型,关键一环是数据。高质量人类操作数据是具身智能的核心燃料,也是当前全球行业的共同瓶颈。正因为自己训模型,才知道需要的高质量的数据是什么样的,基于这套逻辑,灵初自研了一套数采体系,积累人类操作数据,并已完成十万小时量级数据沉淀。王启斌透露,年内将冲击百万小时人类数据采集目标,并将在下半年迭代两版新模型。
围绕这笔融资、公司的新进展以及行业水温的变化,我跟王启斌聊了聊。上半年近乎疯狂的融资之后,他认为具身行业已经进入深水区,大家都在从demo转向做好模型管线和场景落地。王启斌是个行业老兵,在机器人和消费电子行业拥有超过二十年的产品和商业化经验。经历过周期,对市场的起落敏感,人说话也敞亮,所以下面这个小对话值得一看。
以下是对话内容,略作编辑:
投中网:上一轮是国资领投,这一轮融资为什么核心参与方以产业方居多?拓普、奇瑞、蓝思这三家是怎么敲定的?
王启斌:灵初之前的股东其实就有产业方,中际旭创和长飞。这回我们mapping了整个产业方,看哪些是我最看重的。现在我们认为有三大行业——汽车、3C、光行业,会是中国的绝对优势行业。后来就跟几位投资人聊,让他们投进来。
投中网:是不是也说明,具身到现在这个阶段,一般的财务投资人已经投不动了?
王启斌:说实话,在今年这个时间点,我们感觉到一些财务投资人会有压力。但作为一个公司,要发展,当下确实要考虑为什么产投非常重要。蓝思和拓普,他们在整个车厂的标准、T1供应商对主机厂的服务,以及量产优势上,具有碾压性。我们现在分别有产品在两家能够做代工和深度的量产研发。反过来,蓝思今年会开放一些场景,拓普我们也在合作做一些场景,双方都有一个比较好的合作点。
投中网:上次咱们聊是2月,从今年2月到现在差不多半年,你觉得整个市场有哪些特别大的变化?
王启斌:我觉得从数据到模型的这部分,过去半年还是发生了很多更大的变化。第一个就是数据格式问题,从数据采集的终端,一直到数据管线的搭建,再到模型训练,分别都跑出了几轮循环。数据的主要格式,也慢慢在收敛到一些共识上。比如ego-centric的双目、单目数据,现在在快速放量;我们做手,硬件也在快速迭代。几家头部公司应该都搭起了比较能放量的数据管线,开始用这种数据逐步去训模型。国外的头部公司也在不停地发新模型,从模型的泛化性开始走向特定任务的成功率。所以总体发展还是挺快的。
投中网:你们现在的业务主线还是灵巧手算法和数据手套?
王启斌:对。ego-centric的视频数据一直在采,有单目,现在也在做双目。手上的数据方面,手套我们也在迭代,新的版本更轻、更贴手,数据收得更准。
投中网:所以按你的说法,现在整个数采的路线是在收敛的?
王启斌:数采路线在收敛,Ego数据本身已经成为了一个非常强的共识。那Ego之外的,手上面的,有的公司在做UMI,我们在做的是还是人手数据。这两条路线里,手的部分其实技术方案目前正在进行一个高速迭代。手套上面,我们有外骨骼,也在做电子定位相关的部分。
投中网:你们的数据金字塔大概是什么样?
王启斌:我们是一套设备全采的,既有头部的ego-centric 视频数据,也有手上面关节角这些东西,一套一个工位项目全部采出来。
投中网:模型方面有哪些升级?今年世界模型火了,你们在模型方面有哪些调整?现在做的模型是两个模型配合?
王启斌:我们新训练了模型,一个是World Action Model,策略模型,输入是整个视觉加上机器人的状态,加上一些文本来做生成。但更重要的其实是Simulator,它主要在评估和优化所有出来的这些Policy里,到底哪些是优质的。如果生成了Policy去做一些操作,放进去之后,它来看未来的帧是不是准确,能不能达到未来的效果。如果不行,就要在这个模型里再做强化学习的优化。两个模型串联起来做联合训练。
投中网:所以现在世界模型这一块很多技术路径,你们是怎么取舍的?
王启斌:目前这个阶段的重点,更多在训action模态。大家不管讲什么大的VLA和World Model,本质上要解决的问题还是action上的泛化性。在这个泛化性之上,再提升成功率。沿着这条路,我们训出来World Action Model,又放到Action-conditioned World Model里做优化。
李飞飞当时把模型分了三个核心板块:Rendering、Planner和Simulator,我们其实做了其中的2和3,将它串在一块。有的可能做的是视觉加action,或者是这几个可以随意组合。
投中网:话说回来,你觉得现在大家在模型技术能力上,真有拉开身位吗?
王启斌:我觉得现在还并没有本质上的拉开身位。全球有这么几家公司,在中国我认为有5家左右,是真正在花时间、花数据、花卡在做模型的。总体而言,还处于第一个阶段,都在拼命地憋大招,还没有真正拉开绝对的差异,只是侧重略有不同。像我们就是专心在做整个通用手的模型,不碰工业夹爪。
投中网:所以你们是那五家之一?
王启斌:那肯定的。
投中网:今年开始有一批新起势的世界模型公司,他们主张自己没有走技术上的弯路,做的东西听上去跟你们也差不多。所以你觉得灵初有先发优势吗?
王启斌:我个人认为是有先发优势的。先发的这几家都已经有自己比较好的数据管线团队了,数据飞轮至少开始小规模转了起来。后发的这些公司,算法非常厉害,但搭工程性的东西会搭得慢一些。最后要做数据飞轮,有很多工程性的团队还是要赶快搭起来。大家都要完成从学术到算法工程这一步。
投中网:你觉得具身这个行业进入深水区,是说现在到了要阶段性地交答卷的时刻了吗?
王启斌:我倒不觉得是到交答卷的时刻。我昨天还在YouTube上刷到一个Waymo的前CEO在聊,他说demo只是整条路上的1%。
今年非常典型的,大家都在从demo转向好好地做模型管线,要么也开始做场景落地。那不管怎么样,从上往下看,是不是有数据管线?数据怎么来?涉及到运营,从什么运营方来?数据效率衰减有多少?再往下,数采硬件的稳定性,比如双目头环,有的厂家两个小时之后双目数据就畸变,精度会有偏差;现在很多人用Pico来采双目数据,但一般工作4个小时之后就开始发热断掉,当然它本来也不是为连续工作10小时设计的;然后再到整机,考虑的问题会很多,需要花很多时间。
投中网:头部的那些具身大脑公司,要用数据训模型,除了自己积累,也会向你们买吗?
王启斌:肯定大家都在自己建这样的能力,做遥操作、做ego数据的能力,规模化的采集、稳定的硬件,自己建数据管线去训模型。
投中网:展望一下,你对今年有什么业务上的预期?
王启斌:今年最核心的还是希望把整个模型的效果跑到预期。我们后续还会不断发新模型,希望把从泛化性到一些典型的下游任务的成功率都给做起来。
投中网:你觉得这个行业到年底会有什么变化?
王启斌:这个很难说。我觉得可能明年上半年会出现有些公司掉队的情况,有些公司会比较危险。
投中网:说起来,今年上半年具身融资如此疯狂,在你看来深层原因是什么?
王启斌:我个人觉得有两点。第一点,从赛道层面上,去年大家完全是一级市场风投的逻辑,说这个赛道很有前途。今年定位成了未来的六大产业,所以相应的,资本结构有些变化。
第二点,今年有新的叙事逻辑:世界模型这样的逻辑出来,新的人才团队出来,两者交叉就会让新的技术主线、新的团队再叠加资本,以前传统的一些VC去年开过枪的,今年又会对世界模型再开一轮。两个逻辑的叠加,让今年上半年非常疯狂。
但我个人觉得,市场已经在逐渐走向更理性、更冷静的方向。我觉得真正的良性成长必然是像心跳一样有起有伏的。这个赛道也基本上超过两年半了,做一些理性的回调,我认为这才是正常的。所有长赛道里不可能说一直向上,都是螺旋向上,会有一个调整。包括产研的各公司,要回归来看自己的整个迭代,以及做出的不管是从模型侧或者应用侧的价值。
投中网:上市也是今年具身的主旋律,但二三十家上港股,大家都会得偿所愿吗?
王启斌:我觉得会出现K线分化。就跟当年智驾一样,A公司上和B公司上差了很多,已经不是一个大的赛道逻辑了。大家可能会看到,即使赛道波动,也会看到公司层面上的具体的差异。如果没有很强的技术面和商业模式支撑,上去之后也会有很大压力。
