看懂不等于做对:VA-Bench 测出大模型空间智能的执行断层
6 小时前

针对多模态大模型在空间智能方面存在的「看懂却做不对」问题,相关研究提出了VA-Bench评测基准。该基准构建了覆盖14类机器人操作任务的280个基础场景,并设置了观察-推理-行动-修正的完整交互闭环。模型需自主判断信息缺口、调整视角并输出精确动作参数。测试结果显示,头部多模态模型在目标识别与定位、操作语义理解方面表现优异,接近满分,但完整任务成功率仅约五成。其能力短板主要集中在精细空间执行、错误在线修正和双臂协同三个环节。对照实验表明,主动感知补全信息的能力比单纯提供多视角画面更为关键。此外,模型在空间布局迁移和长时序组合任务中的表现也明显下滑。VA-Bench评测基准清晰测出了当前多模态大模型从空间理解到可靠物理行动之间的具体能力边界。