具身智能领域,最近两年大家关注的都是能力提升,VLA、世界模型、强化学习这些技术都在让具身智能模型越来越“聪明”,但具身智能要落地,还要解决另一个问题:易用性。
此前,我们介绍过的Enigma,探索的是具身智能的人机交互界面;这一次,我们发现了一家DeepMind机器人团队高管创立的新公司,他们正在打造,部署在工厂中的,任何人都能训练和使用的智能机器人。
当任务或生产流程发生变化时,无需专业程序员介入,工人只需向机器人演示操作方法,观察其尝试执行任务,并在现场予以纠正。
这是一种强调直观交互的机器人后训练方式,人们可以通过示范和纠错,像教人一样去教机器人。
这家公司叫Reimagine Robotics(以下简称:Reimagine)的公司还非常早期,此前获得Fly Ventures和Firstminute Capital共同领投的Pre-Seed融资,金额和估值未公布,目前正在筹备新一轮融资。
Reimagine由Jonathan Scholz创立,联合创始人Oleg Sushkov、Akhil Raju和Misha Denil都是他在DeepMind的前同事。
Jonathan Scholz(CEO)在伦敦创建DeepMind的Applied Robotics团队并领导约七年,长期研究机器人操作、强化学习、示范学习和新任务快速适配。

Jonathan Scholz,图片来源:Reimagine Robotics
Oleg Sushkov(CTO)长期研究机器人控制、强化学习和机器人工业任务适配;Misha Denil(首席科学家)重点关注离线学习、人类反馈和数据驱动机器人;Akhil Raju(CPO)毕业于MIT,参与RoboCat等项目,现主要负责将机器人学习能力转化为普通用户能够直接示教和使用的产品。
机器人领域目前存在两大难题:能力与易用性。
Jonathan Scholz在DeepMind时期,主要致力于攻克“能力”难题,让机器人能够完成复杂且有用的任务。但随着行业阶段的变化,他希望解决易用性问题。
事实上,他关注的“如何让机器人快速学会新任务”问题,也是在DeepMind时期逐渐形成的。
回看Reimagine团队成员在DeepMind时期的论文,可以看出这个发展脉络。
2017年的《Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards》,先用少量人类示范帮助强化学习摆脱低效的随机探索;
2018年的《A Practical Approach to Insertion with Variable Socket Position Using Deep Reinforcement Learning》进一步将这套方法带到真实工业插装任务中,让机器人在不到10分钟的真机交互后适应新的插孔位置和方向;
2019年的《Scaling Data-Driven Robotics with Reward Sketching and Batch Reinforcement Learning》,团队开始让人类反馈重新利用机器人过去积累的大量经验,而不再只为每个新任务单独采集数据。
此后的RoboCat则把不同任务、不同机器人本体的数据汇入同一个通用模型,新任务只需少量样本即可完成适配,并让机器人自己继续产生数据、反哺下一轮训练。
Reimagine延续的正是这条路线,只是进一步把“谁来示范、谁来纠错、如何持续训练”的问题搬到了工厂现场。
一方面这个场景比较成熟,另一方面工厂绝非部署一次就能撒手不管的静态环境。它的需求在不断演进,如果工人每次让机器人去做新任务,都需要求助机器人专家,那机器人在这里创造的价值就有限。同理,消费机器人,尤其是家庭机器人,面临的是同一个问题,并且更严重。
Jonathan Scholz他们思考的是,如果机器人不仅能与物体交互,还能与人交互,会引发怎样的变革?
如果任何人都能自主教导、纠正和使用机器人,行业会往前走一大步。所以他们打造了一套平台,希望让现场人员无需专业机器人编程,也能快速教机器人学习和调整新的任务。
那么,他们具体是怎么做的?与行业之前的做法有什么不同?
传统工业机器人遇到新零件或工艺变化,往往需要工程师重新调整程序。
Reimagine的做法不是把传统示教界面换成一套更简单的软件,它是在搭一套机器人部署后的训练系统:机器人先进入真实现场工作,工人负责示范、接管和纠错,这些新数据再进入训练,生成新的策略模型,经过评测后重新部署到机器人上。

图片来源:Reimagine Robotics
具体的操作,可以想象一下这个场景:工人走到机器人面前,向它演示一个动作并让它执行。如果机器人做对了,当然OK,如果做错了,工人直接介入当场纠正。他们可以直接拖动机械臂进行示教,也可以通过遥操作设备完成任务,机器人再根据这些数据学习相应的动作策略。
这其实就是一种“后训练”,Reimagine比较相信“现场后训练”的价值,也在将机器人在现场进行后训练的能力实现产品化。
对比传统方法,Reimagine将机器人新行为的原型制作和测试时间从大约一天缩短至十分钟左右。
Jonathan Scholz表示:“对我们而言,这不是要将人从流程中剔除。在岗学习的机器人依赖于人。工人负责找出瓶颈,向机器人演示如何提供帮助,并不断纠正它直到其发挥作用。
机器人将工人的知识转化为杠杆。人们无需重复数千次枯燥的体力劳动,而是可以教导机器人,并将这种能力应用到任何需要的地方。”
他们将自己的产品定义成一种放大人类劳动的工具。
从Reimagine的Github页面,我们梳理出它在技术实现上更详细的方法。
Reimagine的后训练从现场示教开始。工人可以直接拖动机械臂或通过遥操作完成任务,系统同步记录关节状态、动作轨迹和摄像头画面;部分轨迹还可以绑定视觉标记(AprilTag、AR Marker)或具体工件,让机器人学习相对于物体完成动作,而不是死记一组固定坐标。
这些数据随后用于训练机器人技能模型。Reimagine目前公开了示范条件模型(demo-conditioned)和流匹配模型(Flow Matching)两类方案,输入可以包括视觉信息、机器人自身状态和关节力矩,其中Flow Matching还使用DINOv3处理视觉信息。相比简单记录和重放工人的动作,这套方法会从多次示范中学习动作策略,让机器人根据当前环境决定下一步如何行动。
更关键的是,Reimagine在2026年7月加入了在线行为克隆(online behaviour cloning)。机器人每完成一次任务,都可以形成一组完整的操作记录,新产生的数据能够持续加入训练集,由一直运行的Flow Matching训练器继续更新模型,并生成新的模型版本,再加载到机器人上。机器人出现问题后,工人可以重新示教或接管,新的正确操作也能继续进入训练。这样,工厂既是机器人执行任务的场所,也持续为模型训练产生新数据。
最终,Reimagine在场景现场对具身智能模型进行“后训练”的循环是:工人示教或纠错 → 产生真实数据 → 继续训练模型 → 现场评测 → 重新部署 → 再从真实运行中积累新数据。
目前,Reimagine的这套后训练方法已经用在了先进制造和电子产品拆解设施中。
在一家定制化塑料制品企业中,Reimagine训练其机器人在夜间照看3D打印机,执行移除打印床、操作锁扣和按下控制键等动作。客户团队利用该平台实现了清洗、固化和烘干等后续环节的自动化。
在另一项从废旧硬盘中回收贵重关键材料的项目中,Reimagine与工艺工程师合作,开发了一个包含三台机器人的拆解工作站。由此产生的工作流将人机结合,实时演进和优化工作流程。
大语言模型的智能,已经进入一个阶段性高位的平台,对于大多数任务,它已经足够聪明,预训练的边际红利在减退。
在哪里用模型,怎么用模型,怎么用好模型,是现阶段的重点,因为这更关乎模型在具体场景中产生价值,也更关乎商业化。这是近两年Agent和后训练这两个范式崛起背后的动力。
具身基础模型的智能,现在还在增长,而且还在早期,它的技术范式都还没有收敛,但各个范式的目的,本质都是提升模型的学习能力和机器人具体干事情的能力。并且,因为要直接与物理世界交互,机器人对执行精度、稳定性、安全性和异常恢复的要求更高,一次错误动作的代价往往也高于一次错误的文本输出。
Reimagine Robotics做的,是提升机器人进入具体场景后的学习和任务适配能力,这种学习能力可以直接提升机器人的生产力。而且,如果不同场景积累的经验能够被具身基础模型有效吸收,还可能反过来提高模型的通用性和新任务适配能力。
尽管技术路线不完全相同,但是有不少具身智能模型和具身数据公司(包括海外和中国市场)开始在后训练范式上投入。
具身智能接下来的竞争,不只是把基础模型做得更强,也要看机器人进入真实场景后,能不能更快学会新任务、适应新变化。后训练很可能会成为机器人真正走向生产和规模化部署的一道关键环节。
