“2026多模态与世界模型论坛”在香港中文大学举行
8 小时前 / 阅读约3分钟
来源:凤凰网
“2026多模态与世界模型论坛”在香港举行,学者围绕多模态大模型、世界模型等AI前沿方向讨论。AI研究正从大语言模型转向多模态,旨在理解真实世界并部署到物理环境,相关研究可应用于多领域。

凤凰网科技讯 8月17日,由香港中文大学(CUHK)计算机科学与工程学系语言和视觉实验室(LaVi Lab)主办的“2026多模态与世界模型论坛(Multi-Modal and World Model Symposium 2026)”于8月15日至16日在香港举行。来自中国内地、香港及海外多所高校和研究机构的学者围绕多模态大模型、世界模型、计算机视觉及具身智能等AI前沿方向展开讨论。

随着大语言模型推动生成式AI快速发展,人工智能研究的关注点正在进一步延伸至多模态智能和世界模型,即如何让AI从处理和理解语言,进一步具备对现实世界的理解、预测和规划能力。论坛期间,多位与会专家围绕AI如何从数字空间走向物理环境等议题进行了主题演讲。

论坛组织者、香港中文大学计算机科学与工程学系助理教授王历伟表示,AI研究重点正从大语言模型进一步转向多模态人工智能,让AI不仅能够处理文字,还能够理解真实世界,并最终部署到实际物理环境中。

王历伟认为,多模态技术和世界模型正成为学术界和产业界关注的研究方向。其中,世界模型的一个重要目标是帮助AI理解物理规律、预测环境变化并进行决策和规划,与Physical AI(物理人工智能)及具身智能的发展密切相关。

在与会专家看来,与几年前AI领域主要围绕ChatGPT和大语言模型展开讨论相比,目前一个重要研究问题已经转向如何让AI理解和推理现实世界。相关技术路径包括从语言理解向世界理解拓展、从数字空间向物理空间延伸,以及从内容生成进一步走向实际物理系统。

多模态模型和世界模型的相关研究可应用于自动驾驶、机器人、智能制造、智慧医疗和科学发现等领域。通过融合视觉、语言等不同信息,并建立对现实环境的预测和规划能力,AI系统有望进一步提升对复杂环境的理解和行动能力。

谈及后续研究方向,王历伟表示,其带领的香港中文大学LaVi实验室希望推动AI从理解多模态信息,进一步发展到横跨数字世界与物理世界进行学习、预测和规划。在他看来,智能系统需要同时具备在数字空间和物理空间进行理解、预测、推理及规划的能力。

除模型能力外,AI评测体系也是论坛涉及的研究议题。自2025年以来,香港中文大学研究团队与凤凰智媒合作建设面向粤语AI系统的动态评测平台,目前双方正进一步推进多模态视频评测研究。王历伟表示,在多模态视频评测中,持续更新的高质量数据对于防范数据污染、提高评测可靠性具有重要意义。

随着多模态、世界模型和具身智能等方向持续发展,AI研究正在从以语言和内容生成为主,进一步探索对现实世界的理解、预测和行动能力。