AI的下半场竞争,不是谁更会聊天
3 小时前 / 阅读约9分钟
来源:36kr
AI缺乏对真实世界的理解能力,高德空间智能通过三维空间表达、实时动态感知与时空推演,将这种能力落到具体出行场景中,如扫街榜、飞行街景、避雷指南、导航Live等。

文|王熠

过去两年,AI极大降低了信息生成成本,但答案的可信度也在快速下降。旅游攻略会推荐已经停业的景区,当地必吃餐厅也未必名副其实。许多看似完整的出行规划,用户往往只能把它当作参考,而不敢直接照着执行。

当答案越来越廉价,是否真实成了新的问题。

问题的本质,不在于大模型不够聪明,而是大多数AI缺少对真实世界的理解能力。信息可以被检索、生成,但现实世界并不只由文本组成。AI很难判断一家餐厅真实的排队情况、一个街区在不同时间段的体验差异,也难以理解信任感、空间氛围、个体偏好这些影响决策的重要变量。

而这类能力,恰好建立在高德长期积累的时空数据与地图基础设施之上。传统地图解决的是地点之间如何连接,导航解决的是怎样抵达。空间智能开始进一步描述真实世界本身:三维空间结构、实时变化的人流车流,以及人与环境之间的动态关系。

所以现在的高德,不仅能回答“世界长什么样”,还能理解“它此刻是什么状态、接下来会怎样变化、应该怎么行动”。对高德而言,空间智能不只是给地图和导航增加一项新技术,更是一次能力范式的变化,并由此拓展高德服务现实世界的边界。

01. 真实世界理解力,AI应用的新壁垒

相比其他AI依赖文本推理,高德试图把空间智能落到具体出行场景中。

对用户而言,一份具备实际参考价值的出行规划,需要信息足够可信,推荐能契合个体审美偏好,能提前还原实地体验,同时还要兼顾时间、天气、同行人、交通条件等复杂现实变量。

所以一份贴合真实世界的榜单,不是简单的地点排序,而是要完成对真实世界的模拟。在空间智能的驱动下,高德扫街榜2026也围绕世界模拟实现了全面升级。

此前,互联网点评生态长期受营销流量等噪声干扰,高德扫街榜用无法被伪造的真实导航到店行为,构成了用户对一家店最直接的判断,让榜单的信任有了依据。在此基础上,高德扫街的算法进一步细分,开始识别每一次到店是专程前往还是顺路经过,回头客还是新客,本地人还是游客。

逻辑显而易见:流量不是目的,流量的含金量才是。一家值得顾客跨越几公里专程前去的店,与一家恰好被路过的店,在“值得推荐”这件事上当然不等价。

此外,行为数据能证明真实到店,但到店的人也存在差异。如果所有人的评分权重都一样,将很容易让一些专业判断被平均数淹没。

扫街榜的解法是引入专业评分,针对咖啡馆等专业性较强的榜单,行家用脚投票将获得更高的评分权重。在AI推荐普遍同质化的今天,让品味这种主观变量拥有更高的权重,才能在迎合大众平均口味的推荐中打捞出那些独具质感的场所。

榜单能告诉用户去哪,却回答不了一家店到底长什么样。过去,用户只能靠图文评价脑补现场,线上与线下的信息差成了用户实际到店后的心理落差。

飞行街景2.0试图抹平这种信息差。依托高德ABot-Earth 0.7世界模型,它把目的地变成可自由探索的三维空间,让用户可以在出发前进入真实空间,自由调整观看角度和位置,在屏幕上获得身临其境的现场感。

这种先看现场、再出发的体验,把决策从抽象的分数还原成具象的场景,回应的是用户对未知的焦虑。

除了飞行街景2.0,高德扫街榜新推出的避雷指南,也是用确定性的时空计算,去对抗出行中不可控的不确定性。避雷指南将结合实时动态感知与时空推演验证整段行程,从营业时间、行程节奏、停车提示、拥挤预测等15个维度,提前识别时间冲突、拥堵、闭店等风险,提前告知会踩的坑和可执行建议。

在真正出发及抵达后,导航Live不仅能理解用户的语言,还能实时感知用户的位置、方向与周边环境,并通过摄像头理解街景画面,给出与当前处境高度相关的建议。

导航Live的本质,是一个具备“时空上下文 + 现场感知 + 端到端行动力”的具身智能体。比如你在一个陌生城市的复杂老街区驾车或步行,前方同时出现三个极其接近的逼仄小巷口。传统导航只会提示“前方50米右转”,你极大概率会走错;而导航Live能够直接看懂现场:“请在挂着红色灯笼的便利店右侧巷子开进去,避开左侧正在卸货的面包车”。

02. 空间智能,读懂真实世界的底座

从扫街榜提供真实的消费决策,到飞行街景让用户提前看清目的地,再到避雷指南提前推演行程、导航Live陪伴用户进入真实世界,高德把对真实世界的理解能力,从一张榜单延伸到一整天的完整出行链路。

这背后,依赖的是高德空间智能三维空间表达、实时动态感知与时空推演的能力。

首先,一切认知的起点,是构建可被机器读懂的三维空间。传统导航应用习惯用点位、标签、图文信息去标记一个个地点。但真实世界,如街道的宽窄、门店的朝向、步行通达性等,建立在空间关系中。高德通过3D原生城市世界模型ABot-Earth 0.7把这些物理属性完整数字化,告诉用户身处其中的空间感受,为后续的模拟、预判打下基础。

拥有静态的三维世界之后,真实世界的各类突发变化,如临时道路施工、门店临时歇业等,不会提前写进数据库,动态感知就相当于这套世界模型的感官系统,不断接收并反馈现实世界的最新信号。

此外,现实世界永远处在流动之中,人流、车流等构成的是一个巨大的动态流体系统。时空推演可以让AI看到这个世界正在如何运行。

导航Live是理解上述三种能力协同工作的典型产品。

想象一个日常驾车穿行城市的场景:车辆行驶过程中,端侧以毫秒级的动态感知持续扫描周遭环境,完成对现实世界的即时读取,既可以识别前方急刹闪烁的车灯、路面设置的路障,也能捕捉街边刚刚开业的咖啡馆,把“眼前正在发生什么”完整传递给系统。

云端的时空推演承接实时采集到的信号,做出超视距全局预判。比如预判弯道盲区是否会驶出对向车辆,评估一处占道施工会对后续几公里车流带来多大的阻滞等,提前把尚未进入视野的潜在风险揭示出来。

而三维空间表达,则承担起数字信息和物理实景之间的锚定融合。在现实场景中,车辆持续颠簸,设备视角也不停移动,依托沉淀下来的三维空间底座,导航Live能够让各类提示信息牢牢锚定在真实街景之上,做到画面不漂移、信息不抖动,把路线提示、风险预警、周边点位介绍无缝叠加到现实视野中。

03. AI时代,被低估的高德

今年以来,行业论坛与研究机构纷纷指出,AI行业已经走过了比拼参数、比拼文本生成效果的阶段。当大模型的对话能力日趋成熟,行业的新命题转变为:AI不能只活在对话框里,想要真正释放价值,就必须走进物理世界。

“AI教母”李飞飞早期曾提出,大模型拥有渊博的语言知识,却缺少对物理世界的亲身感知。在最新访谈中,她再次提到:在我看来,没有空间智能,通用人工智能就不完整。

产业端真金白银的资本投入也印证着上述判断。李飞飞创立的World Labs,获得2.3亿美元投资,专注开发具备“空间智能”的AI;Meta前首席AI科学家杨立昆去年离开Meta,创立AMI Labs,筹集超过10亿美元用于构建世界模型系统;宇树科技创始人王兴兴也在今年世界机器人大会上表示,目前具身智能最大的瓶颈是泛化能力不够,为此,公司正着力推进物理AI机器人模型研发,加速补齐具身“大脑”短板。

汽车厂商开始谈论物理AI,智能驾驶不再只追求座舱对话流畅度,而是重点攻坚世界模型,让车辆能够理解道路空间;具身智能从业者也意识到,机器人的瓶颈并不全在对话交互,看懂三维环境、理解空间关系、预判物体运动,才是落地过程中绕不开的关卡。

这显示,无论是自动驾驶、人形机器人,还是城市数字化治理、本地生活服务,所有需要对接真实物理世界的AI应用,都绕不开空间智能的支撑。

大模型可以批量生成无数漂亮的答案,但真实世界才是检验AI价值的终极考卷。过去评判AI,是看它能不能流畅输出精彩的内容;未来区分AI能力高下的关键,要看它究竟能在多大程度上读懂时刻变化的现实世界。

正是在这样的行业背景下,高德的价值又一次凸显。理解真实世界,不是知道更多地点信息,而是能够在具体的人、时间、位置、同行者、天气和偏好之下,判断他可能看到什么、是否拥挤、会停留多久,以及下一步最自然去哪里。它最终要回答的不只是“在哪里、怎么去”,还包括“会发生什么”“是什么感受”“对谁合适”以及“为什么”。

若没有对二维网络、三维空间、时间变化、人流、车流、导航行为等时空数据的积累,AI很难理解真实世界,而这些,恰好是高德过去一直在走的路。高德用时间沉淀出的对时空的“语感”,是无法用金钱或流量速成的,也是高德真正的护城河所在。