从模型上手机到让智能体落地,高通的AI时代新故事|焦点分析
3 小时前 / 阅读约9分钟
来源:36kr
高通在骁龙峰会展示端侧30B-MoE模型,实现完整工作流程。强调智能体AI创造新终端工作流程,芯片能力边界扩大。高通拓展多终端支持,面临迭代快、挑战多元的市场环境。

过去一年,AI 编程和办公工具在 PC 端快速普及,但手机上的AI体验仍以单次问答和图片处理为主。高通今年想证明的是——端侧AI也能进入到更多生活和工作场景了。

2026年,骁龙峰会上,高通与阶跃星辰、无量火科技、江波就演示了一个典型案例——端侧30B-MoE模型完成的工作链条:仅仅用本地的模型,AI读懂一封邮件,提取行程信息,同步日历,推荐航班和酒店,再草拟一封回复。

特别之处在于,这是一段需要理解、规划和连续执行的任务,并且完全在端侧完成。

高通公司总裁兼首席执行官安蒙(Cristiano Amon)

如果说两年前高通主要在证明大模型能装进手机,今年它更想证明,装进去的模型能够承担更完整的工作。

2024年,高通自研Oryon CPU开始搭载在手机上,展示了端侧大模型的可能性;而在2025年,第五代骁龙8至尊版引Personal Scribe和个人知识图谱,将直接智能体写进产品方向。

到了今年,AI界的新故事进入到以Claude Code为主的代码和办公大战。现在,高通开始让旗舰芯片进入2nm双旗舰、30B-MoE部署和更完整的任务流程,这都意味着能够共同和模型、infra厂商拓展新的应用场景。

“智能体 AI 并不仅仅是为终端新增一个功能。它实际上创造了一种全新的终端工作流程。”高通公司总裁兼首席执行官安蒙(Cristiano Amon)在主题演讲中表示。

但当AI从一个功能变成一段工作流程,高通要解决的也不仅仅是是让下一代芯片更快。智能体需要更强的本地能力,也依赖快速更新的模型、应用接口与终端协作。

进入2026年,芯片厂商们的一个共同趋势是:能力边界在扩大,竞争边界同样在扩大。对高通而言,这种扩展不只是从手机走向 PC、眼镜、汽车和数据中心,还包括围绕模型适配、软件工具和跨终端协作补齐能力。

从让手机部署模型,到让智能体持续工作

如果为今年的骁龙峰会总结唯一的关键词,“智能体”绝对排在第一位。高通的一切更新——都是在为更复杂的AI任务,重新分配手机里的计算资源。

比如,第六代骁龙8至尊版与超级至尊版双旗舰,均采用2nm工艺。搭载了超级至尊版的设备,高通不只是把频率拉到5GHz,其中CPU负责工具调用和任务调度,NPU承担模型推理,低功耗感知单元处理后台信息,为不同类型的AI工作分配专属计算通道。

这背后的变化是,AI不再只在用户提问时工作,还要在后台保留信息、等待时机并接续任务。在以往,一次问答或修图是单次调用;智能体则要反复读取上下文、调用工具、在任务间切换。

缓存、内存带宽和低功耗感知,因此变得重要了——最起码,手机不能因多了一个常驻智能体就持续发烫、迅速耗电。

这并不是今年才出现的方向。2025年发布的第五代骁龙8至尊版,就已经已强调Personal Scribe、个人知识图谱和低功耗感知中枢。

而在今年,高通在缓存、NPU共享内存和感知能力上的升级,更像是对既有方向的持续补强——让更多信息得以保留,让任务切换与持续运行更可靠。

不过,这并不是把所有AI计算留在本地,而是让终端承担更有价值的一部分。手机掌握日历、邮件等个人信息,高通的新双Micro NPU架构性能提升85%,同时功耗降低20%,直观提升了个人记录(Personal Scribe)能力——提升本地处理低时延、离线可用和减少数据上传的潜力;复杂任务仍可调用云端。

如今,更大体量的模型开始与完整的本地办公流程结合。对比2024年,最多7B的模型能够部署在端侧,在这次峰会上,高通就已经和阶跃达成合作。如今,30B的MoE模型在参考设计上完成的邮件理解、行程规划和日历同步,是一次可感知的跨越。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick

而更复杂的 AI 应用,如今也可以由多个模型的分工完成,而不只是一个模型变得更大。这为应用生态创业者提供了空间。

比如,在AI公司Deepgram展示的AI播客应用中,NPU上的语音模型负责转写并区分发言者,GPU上的Gemma模型理解话题、生成追问建议——一边听清谁说了什么,一边判断接下来该问什么。这让“异构计算”变成了读者可理解的场景。不过工作人员也提到需联网检索核查,整个应用并非完全离线。

AI智能眼镜也是一个典型品类。过去一年的变化,也能说明高通这样的芯片厂商,如何让新AI硬件逐步突破能力上限。2025年6月 AWE 上,高通AR1芯片的升级款骁龙AR1+ Gen 1已用原型眼镜演示Llama 3.2-1B本地运行,高通强调芯片更小、功耗更低以适应镜腿和电池约束;今年,高通则进一步为AR1、AR1+对提供多模态1比特模型的支持。

高通也在逐步拓展对开发者生态的支持。今年推出的高通START计划中,就提供AR1+模组、软件平台和参考设计——非科技厂商的集成门槛也在降低,判断是研发支持越来越贴近品类需求,而非只把手机芯片缩小。

除此之外,高通也推出了全新的Adreno Neural Fusion,带来增强的移动游戏,借助AI实现智能的图形渲染,从而带来更沉浸的游戏体验、更丰富的视觉效果,和更持续的游戏时长。

高通新一代Adreno

但芯片能支持什么,与智能体最终能替用户完成什么,仍然不是一回事。高通公司中国区董事长孟樸对36氪表示,跨终端持续服务的个人智能体,可能到2027-2028年,才会比较稳定地开始逐步落地。

AI 时代的芯片厂商:迭代更快,挑战更多元

高通在 AI 时代,如今的状态可以说是四面开战,压力并不小。这一部分来自新市场的吸引力,另一部分来自也要守住旧市场的压力。

移动时代,成就高通的基础是通信专利与芯片平台两条业务。而进入大模型时代,以数据中心为主的庞大需求,已让英伟达获得庞大收入——2027财年,英伟达第二季度数据中心收入达890亿美元。

高通也没有放过这个市场。此前,高通提出2029财年非手机收入400亿美元的目标,并推进数据中心业务。动机不难理解:守住手机之外,还得找到新的增长引擎。

但在争取新增长之前,高通可能首先得适应一个比手机换代更快的模型市场。“过去,智能手机完成适配后,可能9个月甚至12个月都无需再调整;而现在,大模型每3个月,甚至更短时间内就会迭代一次。”高通公司中国区董事长孟樸对36氪在内的媒体表示。

模型版本和能力更新快,不代表底层计算结构以同样速度完全变化。更准确的挑战在于:在相对稳定的计算基础上,用软件调度、可配置能力和持续验证承接快速迭代。

更深的一层变化是,合作正从模型发布后的适配,前移到模型设计环节。2026年展示的四方合作的分工说明了这一点——高通提供计算平台,阶跃提供模型,无量火优化推理与调度,江波龙处理存储协同;AI Hub则试图复用优化成果、降低部署门槛。

竞争新的竞争指标是:新模型出来后,谁能更快、以更可控的成本交付可用体验。

端侧智能体是整个市场都在追逐的机会,9月,几乎所有主流厂商的新品都覆盖了端侧和智能体。比如,9月15日,联发科发布天玑9600系列,9600 Pro同样采用2nm,强调低功耗常驻感知,宣称支持30B-MoE端侧运行。

更复杂的竞争也会来自客户一侧:一边采购高通芯片,一边也在把关键能力试图掌握在自己手中。比如小米玄戒 O1进入量产,苹果在iPhone 16e上推出自研C1基带等等。而进入数据中心,也绕不开客户与竞争对手身份重叠的局面。英伟达之外,谷歌自研TPU也在争取训练和推理负载——而谷歌在终端上又是高通的重要合作伙伴。

当竞争同时发生在多个市场,高通还必须回答一个实际问题:这些新能力,客户负担得起是前提,但如何真正高效地应用起来?

孟樸提到:“随着技术的进步,芯片中需要叠加的技术越来越多,成本也会因此越来越高。”在他看来,一款产品展示当前技术能够达到的上限,另一款则更注重效率,以应对高成本、支持终端厂商。技术能力向前推进,能否被客户采用仍要过成本这一关。

至少,让智能体稳定地在移动设备上运行,还有多重挑战。“不能做错任务,不能过度占用内存,还不能增加续航负担,起码不能比手动操作还慢。”一位半导体行业人士总结。

现在,芯片行业正在进入多线混战。高通需要守土开疆,还必须成为耦合大模型厂商、AI应用之间的长期协作者。对高通来说,下一轮胜负不只取决于它能把多大的模型装进终端,更取决于能否让不断变化的模型,及时变成用户愿意反复使用的产品。