智象未来发布HiDream-O1-World:具备漫游、编辑、交互三项核心能力
11 小时前 / 阅读约2分钟
来源:凤凰网
智象未来发布交互式世界模型HiDream-O1-World,支持多模态输入,具备漫游、编辑、交互能力,在评测基准中登顶,支持多种角色构建和场景生成,可服务于AI互动影游、具身智能等领域。

凤凰网科技讯 8月17日,智象未来正式发布交互式世界模型HiDream-O1-World,该模型基于原生全模态架构,支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力。

HiDream-O1-World搭载智象自研的原生全模态架构,在时空一致性与物理一致性上实现突破。模型在美团LongCat团队与复旦大学联合推出的交互式视频世界模型评测基准WBench的Navi分榜中,以平均分80.9登顶榜首,其中物理维度得分73.3,一致性维度得分88.0。论文“DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling”已入选2026年欧洲计算机视觉国际会议。

在交互体验上,模型支持第一人称和第三人称视角漫游,用户可自由驱动角色行走并调整视角方向;支持实时编辑,用户可驱动角色完成抓取、奔跑、跳跃等动作,或触发降雨、物体坠落等动态事件。模型支持人类、动物、虚构角色等多种角色构建,可还原真实城市街景、自然地貌等实景,也可生成二次元卡通、3A游戏渲染等风格化场景。

在技术架构上,模型通过“3D先验注入Memory上下文”与“Test-Time Training在线维护”协同设计实现长时程时空一致性,在推理阶段通过轻量级在线自适应维持物理合理性。相比行业平均水平,模型在视觉合理性评测中提升13.6%,在因果保真度评测中提升12.7%。在产业应用方面,HiDream-O1-World可服务于AI互动影游的内容生成、具身智能的高精度仿真训练,以及3D场景生产等领域。