凤凰网科技讯 9月7日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。据官方介绍,该模型基于其原生全模态技术路线,面向机器人在真实环境中的物理感知、动态预判和任务执行,并进一步将图像、视频、3D及动作等模态纳入统一技术体系。
与模型发布同期,HiDream-O1-Embodied首次参加具身智能模型评测平台RoboColiseum测试,在Robustness(扰动适应)子榜单中取得0.692的平均分,位列榜首。该项评测主要通过改变背景、光照、材质、机器人初始状态、相机位置、图像质量以及指令表达方式等条件,测试模型面对环境变化时的稳定性和泛化能力。
据介绍,RoboColiseum基于高保真仿真环境搭建,目前设置指令跟随、空间理解、扰动适应和通用操作四类能力子榜,共包含78个高保真仿真评测任务,面向高校、科研机构、模型企业及研究者开放。
针对机器人进入真实环境后容易遇到的视觉干扰和指令变化,HiDream-O1-Embodied主要从语言理解、多视角视觉感知和容错机制三个方向进行强化。在语言理解方面,模型覆盖不同动词、句式及表达方式的等价指令,以降低对固定关键词和句式的依赖;视觉感知方面,则综合多个视角的信息,当部分视觉输入受到遮挡、相机位置变化或出现偏差时,可利用其他视角继续判断场景和任务。
在训练环节,智象未来表示,HiDream-O1-Embodied主动引入光照变化、画面污损、视野遮挡等非理想条件,使模型学习在信息不完整或不稳定的情况下完成判断和执行。这也是此次Robustness评测重点考察的能力之一。
数据方面,智象未来采用“真实基座+生成增强”的方式扩充具身训练数据。以其与诺亦腾的合作为例,公司以高精度真人动作捕捉数据作为基础,再利用模型进行百倍级数据扩增。根据素材披露,在保持动作物理约束的基础上,模型可以改变背景、光照和物体形态等变量,由单段真实动作样本生成更多训练样本。
智象未来CTO姚霆表示,公司希望围绕真实世界的表达、理解和生成,建立具备全模态表达、因果推演与物理世界构建能力的世界模型基座。HiDream-O1-Embodied的推出意味着其原生全模态技术路线进一步延伸至机器人动作和物理世界执行环节。
不到一个月前,智象未来还发布了交互式世界模型HiDream-O1-World。据公司披露,该模型在交互式视频世界模型评测基准WBench的Navi分榜中取得80.9平均分并位列榜首。与侧重数字环境理解和推演的HiDream-O1-World相比,此次发布的HiDream-O1-Embodied进一步面向物理世界中的操作与执行。
目前,智象未来已经形成包括HiDream-O1-Image、HiDream-O1-World和HiDream-O1-Embodied在内的模型序列,技术覆盖从视觉生成、交互式世界模型到具身世界模型。按照其技术规划,公司试图进一步打通图像、视频、3D和动作等不同模态,建立统一的原生全模态世界模型体系。
