机器人运动误差降低90.4%,英伟达/哈佛等提出Hydra-0,用Action Flow统一世界建模与控制
4 小时前 / 阅读约14分钟
来源:36kr
英伟达、哈佛大学等联合提出Hydra-0,一种以动作流为条件的通用世界模型,降低机器人和物体运动误差,支持零样本组合和数据高效适应,在RoboLab基准测试中表现优异。

来自英伟达、哈佛大学等的联合研究团队提出了 Hydra-0,一种以动作流(Action Flow)为条件的通用世界模型。在最佳配置下,与以动作作为条件的基线模型相比,Hydra-0 将机器人运动误差降低了 90.4%,将物体运动误差降低了 60.2%,同时支持零样本组合以及数据高效的适应。

如果说大模型正在让机器「理解语言」,那么世界模型(World Model)试图解决的,则是让机器真正理解一个更复杂的问题:做出一个动作之后,现实世界会发生什么?

这个问题远比「看懂一张图片」复杂——机器人不仅需要识别桌面上的杯子、衣服、箱子等物体,还需要理解自身运动与环境变化之间的因果关系。例如,当机械臂向前移动时,夹爪会出现在什么位置;当夹爪抓住一块布料并向右拉动时,布料会如何变形;当机器人执行一段动作序列时,几秒之后整个场景又会变成什么样。

一个基于多样化交互数据训练的基础世界模型,可以通过捕捉不同机器人和交互场景之间共享的物理规律,成为适用于多种机器人及交互环境的通用预测模拟器。然而,尽管目前已经拥有大量丰富的交互数据,业界仍然缺乏能够跨越不同机器人本体、任务和环境进行泛化的可迁移基础世界模型(transferable foundation world models)。

为了填补这一空白,来自英伟达、哈佛大学等的联合研究团队提出了 Hydra-0,一种以动作流(Action Flow)为条件的通用世界模型。该模型将机器人的动作表示为像素运动(pixel motion)。这种统一的视觉接口使通用世界建模与控制成为可能:模型能够跨越不同的机器人本体、任务、环境以及视频生成骨干网络,学习机器人动作所产生的后果。

在最佳配置下,与以动作作为条件的基线模型相比,Hydra-0 将机器人运动误差降低了 90.4%,将物体运动误差降低了 60.2%,同时支持零样本组合以及数据高效的适应。在 RoboLab 基准测试中,Hydra-0 对重放实验与参考实验的成功率进行了预测,两者之间的 Pearson 相关系数达到 r = 0.96。

相关研究成果以「Hydra-0: Action Flow for Generalist World Modeling and Control」为题,已发布预印本于 arXiv 。

研究亮点:

* 将机器人动作条件建模为具有运动学约束的图像平面动作

* 证明动作流可以成为跨机器人本体和视频生成骨干网络的通用世界建模接口

* 将同一接口反向用于世界动作模型,实现从任务意图到机器人动作的推断

论文地址:https://hyper.ai/en/papers/2608.18077

从 7 个数据源汇聚多机器人本体训练语料库

为了构建这样的通用世界模型,研究人员从 7 个数据源汇集了一个涵盖机器人与人类交互的多机器人本体训练语料库(multi-embodiment training corpus)。下表对该语料库进行了汇总,包括各数据源在筛选前后的数据规模以及相应的数据许可协议:

多机器人本体训练语料库

* DROID 提供了大规模、场景多样的单臂 Franka 机器人操作数据,是本研究的主要机器人数据来源

* ABC-130k 和 MolmoAct2 提供了双臂遥操作数据

* EgoDex 提供了使用 Apple Vision Pro 采集的第一视角人手操作数据

* Deform360 提供了使用 UMI 夹爪进行可变形物体操作的手持式夹爪示范数据

* XVLA-Soft-Fold 和 H1-Fold-Clothes 分别贡献了规模较小的双臂以及人形机器人折叠衣物数据集。

* Interactive World Simulator(IWS)任务仅用于数据效率评估,并不纳入训练语料库

由于本文重点关注可变形物体交互,因此主要保留与可变形物体相关的数据,包括布料、电缆、绳索、袋子和纸张等。研究人员将主要数据源统一转换为共享的、以单个 episode 和单个摄像机视角为单位的数据布局:视频帧被重新采样至 480p、16 fps,并切分为互不重叠的 81 帧窗口。每个窗口包含密集点轨迹(dense point tracks)、语言描述(language caption)、预先计算的 VAE 潜在表示(VAE latents),以及在数据源允许的情况下提供的本体与物体标注。

除上述针对任务层面的可变形物体数据筛选外,研究人员还针对不同数据源组合使用了三种窗口级筛选条件,其阈值根据运动评分直方图进行调整。

第一种是静态窗口筛选(static-window filter):如果一个窗口中可见轨迹的路径长度第 90 百分位数在 480p 分辨率下低于 50 像素,则删除该窗口。

第二种是夹爪冻结筛选(frozen-gripper filter):如果机器人本体轨迹的运动幅度低于同样的 50 像素阈值,则删除该窗口。

第三种是无内容语言描述筛选(contentless-caption filter):如果 DROID 数据集中的 episode 语言标注没有描述任何可执行的操作内容,则删除该 episode。

Hydra-0 框架:兼顾正向模式和逆向模式

Hydra-0 的模型框架可以理解为两个相互对应的方向:正向模式和逆向模式。正向模式解决的是世界模型最基本的问题:如果机器人这样运动,接下来世界会发生什么?在逆向模式下,模型可以反过来回答另一个问题:如果希望物体按照某种方式运动,那么机器人应该怎么动?

研究人员考虑一个部分可观测的环境,在该环境中,机器人在时间 (t) 接收一个 RGB 观测,并执行一个动作;编码器将初始观测映射为空间潜在状态,使用动作流(action flow)表示动作序列,并令动力学模型根据初始潜在状态和动作流预测未来的潜在状态序列;随后,解码器生成与之对应的 RGB 视频序列。下图展示了由此形成的世界模型整体架构:

Hydra-0 概览

① 动作流的构建与采样(Constructing and Sampling Action Flow)

研究人员并不直接让模型以依赖特定机器人本体的控制指令作为条件,而是首先将控制指令映射为动作流。动作流由一组位于相机平面上的轨迹构成,用于描述机器人本体可见部分按照给定指令产生的运动。

在每一个训练步骤中,从经过语义约束的轨迹集合中采样以下四种条件策略之一:

* Embodiment:选择作用主体上的轨迹,是主要采用的动作条件策略,它包括可见的机器人连杆、夹爪以及人手等轨迹。

* Object:选择训练过程中被操作物体的未来运动轨迹。当在推理阶段显式提供物体轨迹时,同一种模式还可以进一步提供目标运动条件,使世界模型根据目标物体运动推断与之匹配的机器人运动。

* All:从所有已经完成语义约束和未完成语义分配的轨迹中进行采样,当数据中的语义标注不完整时,这种策略仍能够让训练过程保留大致的运动对应关系。

* None:移除轨迹条件,相当于进行条件随机丢弃,使模型仅依赖文本和图像条件进行预测。

② 基于动作流条件的视频预测(Action-Flow-Conditioned Video Prediction)

在长度为 (H) 的预测时间范围内,运动学约束视频预测器以动作流作为条件,生成未来的观测结果。

③ 高效因果式滚动生成(Efficient Causal Rollout)

为了满足机器人实际部署对效率的要求,研究人员将因果式生成的自回归转换(autoregressive conversion)与改进的分布匹配蒸馏(Distribution Matching Distillation)相结合,从而实现长时间范围的因果生成以及少步采样。

④ 开放环策略评估与逆向控制(Open-Loop Policy Evaluation and Inverse Control)

* 正向模式-策略评估:在正向模式下,模型接收根据机器人控制指令或机器人实际完成的运动轨迹计算得到的夹爪运动流,并预测由此产生的视频结果。

* 逆向模式-世界动作模型:针对逆向模式,构建了一个世界动作模型,该模型以目标物体运动流作为条件,同时不提供夹爪运动流。

有效提升动作条件视频预测性能和数据高效迁移能力

Hydra-0 的实验重点围绕以下问题展开:动作流是否真的能够提升世界模型的预测能力?多机器人本体训练能否提高数据效率?模型是否能够用于机器人策略的开放环评估?以及动作流能否反向驱动真实机器人执行?

可执行动作流条件的有效性(Effectiveness of Actionable Flow Conditioning)

研究人员通过训练采用相同动作流构建方式、数据集组合和预测时间范围的可执行动作流条件 Cosmos 2.5 和 Wan2.2 模型,检验可执行动作流能否在不同视频生成架构之间实现迁移。在下表所展示的大多数指标单元格中,研究提出的方法均取得了最佳的点估计结果:

多机器人本体数据集上的评估结果

在采用相同 Cosmos 2.5 骨干网络的情况下,将 Cosmos 2.5 原生的相对 6D 动作表示替换为我们提出的可执行动作流后,Ours(Cosmos 2.5 2B)在全部五个数据集上的 PSNR、SSIM、夹爪流 EPE、FID 和 FVD,以及报告物体 EPE 的四个数据集上的物体流 EPE,均取得了更优的点估计结果。

多机器人本体中期训练带来的数据效率提升

在动作流能够支持高效的多机器人本体中期训练(multi-embodiment mid-training)的基础上,研究人员希望验证的问题是:多机器人本体中期训练能否减少后续后训练阶段所需的任务特定机器人数据量。如下图所示,本研究的多机器人本体中期训练在尚未接触任何任务特定数据之前,就能够实现最强的迁移性能。

IWS 任务上的数据效率

在 0% 数据条件下,在全部六项任务中,Ours (MT) 的 LPIPS、物体流 EPE 和 FVD 点估计结果均优于 Ours (PT),这一结果与多机器人本体中期训练所带来的知识迁移相一致。这种优势在经过任务适应后依然存在,在 100% 数据条件下,Ours (MT) 在全部六项任务上均取得最低的 LPIPS 和 FVD,并在其中四项任务上取得最低的流 EPE;在 Bimanual box 任务上,Ours (MT) 与 Ours (PT) 的差距仅为 0.014 像素;在 Bimanual rope 任务上,与 IWS 的差距仅为 0.15 像素。

从视觉外观、运动以及时间一致性这三个互补维度的指标来看,模型较早出现的性能平台期表明:多机器人本体中期训练有望显著降低动作流后训练所需的目标任务数据量。

推理速度

机器人实际部署对生成延迟和吞吐量提出了要求,因此,研究人员也对模型的生成速度进行测量,以评估其滚动生成过程是否能够满足机器人交互的时间预算。

与完整序列的双向采样相比,采用 KV Cache 的因果式自回归转换(cached causal autoregressive conversion)速度提高了 1.68 倍。尽管网络评估次数从 50 次增加到了 153 次,但每次评估仅处理一个包含 7 个潜在帧的时间块,并且每个时间块只需要进行一次重新缓存,因此整体速度反而更快(如下表)。

不同优化阶段的推理速度

进一步采用蒸馏后,网络评估次数减少至 15 次,速度在此基础上进一步提升约 9.5 倍,最终达到 62.0 帧/秒,相对于原始方法实现了 16.0 倍的纯生成速度提升。

开放环策略评估

如下图所示,RoboLab 策略在生成环境中的成功率与参考成功率高度一致,Pearson 相关系数 r = 0.96,Spearman 相关系数 ρ = 0.93,平均绝对误差为 5.7 个百分点。在跨任务进行平均后,生成结果的成功率同样能够复现 5 个策略在参考环境中的排名。

使用 Hydra-0 进行开放环策略评估

真实世界概念验证(Real-World Proof of Concept)

此外,研究人员还在真实世界机器人环境中,对成功和失败的折叠衣物轨迹进行了重放。如下图所示,生成的运行过程在定性上保留了原始任务中不同的结果,初步表明,这种策略评估方法有望进一步拓展到 RoboLab 基准测试之外的真实机器人环境。

真实世界开放环策略评估

结语

总体而言,Hydra-0 提出的运动学约束动作流,为跨机器人本体、跨视频生成骨干网络的神经世界模拟提供了一种统一的视觉控制接口。实验表明,该方法不仅能够提升动作条件视频预测和数据高效迁移能力,还可用于开放环策略评估,在 RoboLab 中生成结果与真实重放结果的成功率达到 Pearson r = 0.96。进一步通过世界动作模型,Hydra-0 能够从人类示范中的目标物体运动流反推出匹配的机器人运动,并转化为可执行动作。

不过,目前模型仍存在厘米级抓取误差,对深度及接触状态的理解也存在局限,腕部摄像机和移动操作等场景尚缺乏系统验证。未来,随着深度、触觉、力觉等多模态信息以及闭环评估的引入,动作流能否真正成为连接任务意图、世界预测与机器人执行的通用接口,值得持续关注。

参考文献:https://arxiv.org/abs/2608.18077