来自莱斯大学和英伟达的研究团队提出了一种面向互联网规模数据的人类示范非参数检索数据引擎 RoboTok,能够为下游机器人操作策略提供与任务相关的、基于轨迹的训练数据。研究人员在检索基准测试以及下游机器人策略性能两方面,将 RoboTok 与现有的机器人数据检索方法进行了对比评估。结果表明,RoboTok 能够检索到相关性更高的操作示范数据,并进一步提升下游机器人任务的成功率。
过去几年,具身智能快速升温。从机械臂到人形机器人,从工业装配到家庭服务,越来越多机器人开始尝试从感知走向决策,再进一步完成真实世界中的复杂操作。
广泛且多样化的示范数据对于机器人学习至关重要,然而,采集这类示范数据的成本依然高昂,并且难以扩展到现实世界中数量庞大的长尾任务、物体和环境。从现有数据中进行检索,为这一问题提供了一种颇具潜力的替代方案,使学习系统能够识别与特定任务相关的示范数据,而无需反复采集新的机器人数据。其中,互联网视频尤其具有吸引力,因为其中包含了海量且持续增长的人类操作行为,覆盖多样化的场景、物体和视角。
互联网中的人类示范视频尤其适用于人形机器人和仿生灵巧手,然而挑战在于,网络视频本质上是非结构化的,其拍摄视角、场景以及遮挡情况都具有高度不确定性。更为根本的是,视觉或语义上的相似性并不一定意味着底层操作行为具有相似性。因此,一个能够在互联网规模上运行的数据引擎,必须能够自动地从异构视频中识别并筛选与操作相关的行为,而不能依赖任务标签、视觉外观或特定的摄像机配置。
在此背景下,来自莱斯大学和英伟达的研究团队提出了一种面向互联网规模数据的人类示范非参数检索数据引擎 RoboTok,能够为下游机器人操作策略提供与任务相关的、基于轨迹的训练数据。与构建一个固定的数据集不同,RoboTok 能够持续对网络视频进行索引,将其作为一种可不断扩展的示范数据来源;给定一段示范视频作为查询,RoboTok 能够检索出具有相似操作行为的视频示例。
研究人员在检索基准测试以及下游机器人策略性能两方面,将 RoboTok 与现有的机器人数据检索方法进行了对比评估,结果表明,RoboTok 能够检索到相关性更高的操作示范数据,并进一步提升下游机器人任务的成功率。
相关研究成果以「RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning」为题,已发布预印本于 arXiv。
研究亮点:
* RoboTok 是首个专门设计用于从互联网人类视频中挖掘数据、服务于灵巧操作学习的检索框架
* 即使行为主体本身并未直接出现在视频画面中,本研究提出的方法依然能够有效工作,并使系统能够跨越不同拍摄视角以及示范过程中的各种遮挡情况
* RoboTok 能够从持续扩张的互联网人类视频数据中,发现并筛选出与操作行为高度相关的示范数据,为灵巧机器人学习提供了一种可持续扩展的数据来源

论文地址:https://hyper.ai/papers/2609.03199
近年来,机器人学习的发展越来越依赖于大规模、多样化的示范数据集。Octo、OpenVLA、SpatialVLA 和 CLIP-RT 等视觉-语言-动作模型(Vision-Language-Action, VLA)以及机器人基础模型,通过在包含不同任务、环境和机器人本体的数据集合上进行训练,学习通用的机器人操作技能。
与上述路线不同,RoboTok 探索了一种互补的数据来源——互联网人类示范视频中海量且持续增长的操作行为数据。互联网视频能够提供所需的数据多样性,但不同视频在摄像机视角、场景外观以及行为主体可见程度等方面存在显著差异。因此,研究人员首先对候选视频片段进行筛选,然后重建具有真实尺度的三维手部姿态,最后将不同视频中的轨迹规范化到一个统一的、以行为主体为中心的参考坐标系中,以便进行基于运动的比较和监督。
完整的数据处理流程如下图所示:

对互联网视频进行筛选,保留其中手部清晰可见且摄像机基本保持静止的视频片段。随后,从每个视频片段中提取手部运动轨迹,并将其重建为具有真实尺度的三维轨迹
数据来源与视频片段筛选
为收集用于训练 RoboTok 检索编码器的数据,研究人员从大规模互联网视频语料库 Action100M 中处理视频片段。这些视频此前已经经过预筛选,确保其中包含人类行为。随后,进一步通过自动化方式筛选候选片段,仅保留时长为 4–8 秒、摄像机基本保持静止,且能够保持一定程度手部可见性的视频。每个视频片段最多包含一只左手和一只右手。对于剩余的相互重叠的视频片段,采用贪心策略进行去重,优先保留时长更长的视频片段。
手部姿态提取与真实尺度构建:
对于每一个保留下来的视频片段,使用 WiLoR 以 5 fps 的频率估计三维手部关键点,并通过在不同视频帧之间关联手部检测结果,对左右手的身份进行稳定追踪;对于缺失的手部姿态,则使用 HaWoR 进行补全。
经过上述处理后,将得到一个由长度不一的三维手部姿态序列构成的视频语料库。
在数据基础之上,RoboTok 真正的创新集中在其检索模型。研究人员的目标是学习一个嵌入空间(embedding space),使其能够近似由 DTW 定义的操作行为相似度,同时支持在大规模数据集上进行高效的最近邻检索(见下图)。

每条自我中心轨迹都会被编码一次,并映射到 RoboTok 学习得到的运动嵌入空间中
RoboTok 检索模型采用一种轻量级轨迹编码器,直接处理以自我中心坐标表示的三维手部轨迹。对于轨迹中的每一帧,模型首先进行位置编码(positional encoding),随后通过一个轻量级的交叉注意力网络(cross-attention network)对序列信息进行聚合,最终生成一个经过归一化的嵌入向量。由于输入数据本身已经编码了手部运动的时空姿态信息,因此编码器被有意设计得较为轻量,其主要作用是根据操作行为相似度对不同轨迹进行组织和排列。
在 RoboTok 的训练语料规模 (N=100,000) 下,如果随机采样一个大小为 (b=196) 的训练批次,那么其中包含与某条轨迹在 DTW 判据下高度相似轨迹的概率非常低,因此研究人员采用以锚点为中心的分组方式(anchor-centered groups)来构建训练批次。对于每个锚点,随机采样两条轨迹作为正样本(positives),同时从相关集合之外紧邻的位置选择一条轨迹作为边界负样本(boundary negative),由此形成一个分组,每个训练批次包含 49 个这样的分组,总计得到 196 条轨迹。
训练目标由两部分组成:
集合损失(set loss):鼓励 DTW 判据下排名前 (K) 的邻居,其得分高于边界轨迹和负样本轨迹;
排序损失(rank loss):鼓励采样得到的正样本之间的相对排序,与 DTW 所确定的相似度排序保持一致。
其中,集合损失决定哪些轨迹能够进入检索得到的邻域,而排序损失则决定这些轨迹在邻域内部的相对排序。二者结合,使模型学习到能够复现局部 DTW 邻域结构的嵌入空间,同时重点优化实际检索过程中最为重要的那部分相似度排序。
RoboTok 的检索过程分为离线和在线两个阶段:在离线阶段,每一条自我中心轨迹只需要通过编码器进行一次编码,并将生成的嵌入向量存储到内积索引(inner-product index)中。当用户输入一段查询视频后,在线阶段可以直接在该索引中进行余弦相似度最近邻搜索,从而获得最相近的示范轨迹,而无需针对整个数据集逐一计算 DTW。这种设计将计算成本较高的轨迹比较过程转移到了训练阶段,同时使实际检索过程能够随着数据集规模的增长保持较高的效率。
此外,新采集的视频片段也可以直接通过编码器生成嵌入向量,并加入现有索引,无需重新训练模型。因此,RoboTok 能够作为一种具有持续扩展能力的互联网规模机器人示范数据引擎,不断吸收新增的人类操作视频,并为机器人学习提供可持续增长的示范数据。
为了评估 RoboTok 轨迹编码器的检索质量,并将其与基线示范检索方法进行比较,研究人员采用两个数据语料库开展实验。参与对比的基线方法包括 Random(随机检索视频片段)、FlowRetrieval(Flow)、HAND 和 STRAP,此外还报告了 DTW 判据的排序结果,将其作为理论上的性能上限。
研究首先在 RoboTok 自身的评估语料库上测试检索能力——在以 DTW 伪真实标签为标准的评估中,Flow、HAND 和 STRAP 的检索性能都非常有限(见下表)。其中表现最好的基线方法 STRAP,其 mAP@20 仅为 0.007,Recall@20 为 0.12;FlowRetrieval 和 HAND 的表现则基本接近随机水平。

RoboTok 评估语料库上的未见数据检索质量
相比之下,RoboTok 达到了 mAP@20 = 0.353、Recall@20 = 0.996。这意味着,对于几乎所有查询视频,RoboTok 都能够在排名前 20 的结果中找到一个真正的 DTW 邻居。与此同时,其 Kendall’s (tau) 达到 0.487,表明 RoboTok 不仅能够将相关示范检索出来,而且能够对这些示范进行相对正确的排序,而不是仅仅将相关样本混入检索结果。
为了进一步测试 RoboTok 能否迁移到其训练语料库之外的数据,研究人员在 AssemblyHands 数据集上重复进行了检索实验。如下表所示,各方法的最终排名与前述实验基本保持一致,RoboTok 在所有评估指标上均取得最佳表现。其 mAP@5 达到 0.261,明显高于 STRAP 的 0.133。

在 AssemblyHands 双手装配视频语料库上测量的检索质量
在平均 DTW 代价方面,RoboTok 检索结果为 1.095 m;真实邻居的平均 DTW 代价为 0.966 m,即 RoboTok 的结果仅比最优结果高 13%。相比之下,随机检索视频的平均 DTW 代价达到 1.911 m。
与在 RoboTok 自有评估语料库上的结果相比,AssemblyHands 上的性能差距有所缩小,这也是跨数据集迁移条件下较为自然的现象。不过,实验仍然表明,RoboTok 在不同数据域中都能够持续检索出与目标操作运动更加匹配的人类示范,整体表现稳定优于现有基线方法。
只有当检索得到的示范视频能够真正改善下游机器人策略时,这些示范数据才具有实际价值。为验证这一点,研究人员在 VTDexManip 这一灵巧操作仿真基准上,评估由检索示范数据引导训练得到的机器人策略。在原始任务设置下,使用 RoboTok 检索结果进行引导的策略,在 6 个任务中的 5 个任务上超过了基准测试中表现最佳的预训练方法(见下表)。

原始 VTDexManip 任务设定下所有任务的成功率(%)
综合全部 6 个任务来看,与已公布结果中的最佳基线相比,RoboTok 在已见物体上的平均成功率提高了 7.45%,在未见物体上的平均成功率提高了 5.83%。
在难度更高的任务设置中——即不再限制手部保持静态位置,同时移除大量人工设计的稠密奖励——由 RoboTok 检索示范进行引导的策略,则大幅领先于由其他基线方法检索结果引导的模型(见下表)。

在修改后的高难度 VTDexManip 任务设定(Liu 等,2025)下,不同检索方法所检索示范数据引导的 PPO 策略在各项任务中的成功率(%)
在 BottleCap Turning 任务中,RoboTok 在已见物体上的成功率达到 77.3%,比排名第二的 HAND 提高 17.8 个百分点。
在 Faucet Screwing 任务中,RoboTok 达到 44.8%,比下一最佳方法 HAND 提高 38.0 个百分点。
在 Lever Sliding 任务中,RoboTok 在已见物体上的成功率达到 79.3%,比 HAND 提高 59.8 个百分点。
更广泛而言,本研究证明了一个重要方向:互联网视频可以成为机器人获取操作数据的一种可规模化、持续增长的数据来源。与完全依赖固定、专门构建的机器人数据集不同,随着网络视频内容不断增长,RoboTok能够持续从中挖掘新的人类操作示范,从而使机器人能够接触到范围更加广泛的任务、物体和环境。
未来,研究团队计划进一步将 RoboTok 扩展至由运动摄像机拍摄的视频,包括第三人称视角和自我中心视角的示范视频。研究团队认为,这一方向有望进一步缓解机器人学习长期面临的数据采集瓶颈,并使机器人能够充分利用互联网中已经存在的、规模庞大且高度多样化的人类操作示范数据。
