Action Map Policy:从高维动作回归到像素分类,一种新的机器人操作学习范式
8 小时前

美国东北大学博士生黄浩杰提出了名为Action Map Policy(AMP)的机器人操作学习新范式。该范式将高维3D动作转化为图像空间的像素轨迹,将动作预测转化为像素级分类问题,利用交叉熵目标函数对复杂多模态动作分布进行建模,通过一次前向推理即可输出完整的动作概率分布,实现了输入输出空间的统一,提升了推理速度。AMP采用X-Net形状的编码器-解码器架构,通过多视角Transformer融合不同视角信息,在图像空间中端到端完成训练,无需显式3D轨迹监督,推理时通过三角测量恢复3D轨迹。实验结果表明,在细粒度视觉感知与多峰分布表达实验中,AMP的成功率达到了100%。在制作咖啡、烤面包、蒸鸡蛋三个真机任务中,AMP的成功率比Diffusion Policy和ACT高出50%至70%,单次推理时间约为13.80毫秒,远快于DiffPo的93.53毫秒,同时实现了约1毫米的位置重建误差和1.3度的旋转误差,比World Action Model更轻量高效。