今年,具身智能赛道融资规模已超百亿,但行业发展的核心瓶颈却卡在了数据清洗环节,这一环节类似于传统制造业的品控。以训练一个抓杯子的机器人策略为例,大约需要一个人花费六个月的时间进行数据清洗,而原始素材中仅有三成可用。通过真机遥操作采集有效数据的成本高昂,且数据清洗环节无法跳过。与大模型数据标注的高度成熟和自动化不同,具身智能的数据清洗处理的是机器人在物理世界中产生的多模态时序流数据,需要理解整条轨迹的因果链。因此,清洗一条数据耗时较长,且由于需要领域知识、错误后果严重,无法像大模型标注那样采用众包或外包方式,目前多由企业自身工程师和研究生完成。这导致数据产出效率低下,还面临劳动关系定义模糊等法律问题。目前,已有企业开始探索具身数据清洗的自动化,但落地难度较大,端到端的自动清洗流程尚未形成。此外,行业还存在人才错配问题,全栈数据基础设施工程师极度稀缺,他们需具备机器人学、信号处理、分布式数据工程等多方面的知识。不少企业开始将数据基础设施团队与算法团队置于同等地位,数据层公司的议价权正在提升。具身智能数据清洗目前仍处于类似大模型标注早期的手工作坊阶段,单数据小时售价更高,发展潜力也更大。若能将物理世界的复杂性编码进自动化系统,数据清洗有望成为具身智能时代的基础设施。
