新加坡国立大学Showlab团队提出了Show-Harness方案,该方案设计了一套介于视觉语言模型(VLM)与机器人控制之间的语义动作接口。此接口不要求模型直接输出底层连续控制量,而是将动作转化为模型可理解和推理的语义单元。随后,这些语义单元由不同机器人的专属解释器转换为符合安全约束的本地控制命令,从而形成一个感知-推理-执行的持续闭环。团队还开发了GUMI图形化操控界面,统一了人类遥操作、网页端Agent控制、VLM直接控制的动作语义,便于跨平台演示数据的采集。Show-Harness方案无需微调即可使闭源前沿VLM零样本适配真实机器人闭环,小型开源VLM仅需微调少量参数即可完成适配。此外,同一接口可跨不同机器人本体、任务与环境使用,在真机实验的跨任务、跨环境、跨本体三类泛化测试中,成功率远高于传统基线。同时,该方案在仿真到真实迁移、物理与语义适应性测试中也表现出色。研究表明,清晰稳定的语义-物理效果约定是接口实现动作落地的关键,这一思路为基座智能从数字世界延伸到物理具身系统提供了新的接口范式。
