你相信光吗?
以前听到这句灵魂发问,小编想到的大多是奥特曼打小怪兽的热血梗;但谁能想到,2026 年,真有人把“光”玩成了颠覆算力江湖的终极武器。
而这个“人”,就是华为。
9 月 17 日至 19 日,华为全联接大会 2026 在上海世博展览馆及世博中心举行。
要问今年大会最受关注的,无疑是 9 月 17 日主议程上,华为副董事长、轮值董事长汪涛发表的题为“智启新未来,打造智能世界的硅基黑土地”的主题演讲。
以及在演讲中,华为正式发布全球首个采用 NPO 技术的超节点 —— 昇腾 960 超节点,加速十万亿规模大模型的训练和推理。
华为副董事长、轮值董事长汪涛发表主题演讲
5500 个光引擎替代 4.8 万颗光模块,功耗直降 550 千瓦,系统可用度做到 99.8%…… 种种高光技术和亮眼数据,让现场惊呼声不断。
所以,这究竟是一项怎样硬核的创新成果?为什么它又能被视作下一代 AI 基础设施的“终极武器”?
前方高能,建议坐稳。
01.
Agentic AI 倒逼算力重构,超节点成了必答题
先引用汪涛在演讲中说的一句话:
“人工智能也许是人类社会最后一次技术革命,它带来的变革之深、之广、之快,远超想象”。
数据显示,当前大模型参数已快速迈向 10 万亿,到 2030 年预计突破 100 万亿;智能体已经能按小时级连续工作,未来将以“月”为单位执行任务;中国每日推理 Token 已增长到 500 万亿左右,还将迈向百万万亿级。
翻译一下:AI 已经从“聊天搭子”进化成 24 小时待命的“卷王员工”。
更直观的变化是,AI 正从尝鲜式的对话工具,变成能深入千行百业真正干活的 Agentic AI,人工智能从量变走向质变。
但是,质变的另一面却是压力:Agentic AI 时代的算力基础设施,恰好卡在一组核心矛盾上,即一边要支持更大规模的 MoE 模型、更长的上下文序列、更低的推理时延,一边又必须显著降低推理成本。
这是既要马儿跑,又要马儿不吃草啊,还得跑出高铁的速度。
单芯片性能的提升远远跟不上需求,靠简单堆规模的扩展路径,也撞上了边际收益递减的南墙。
瓶颈具体卡在通信上:主流 MoE 模型的训练过程中,数万颗芯片需要对齐每一层、每一个环节的中间结果,华为的仿真显示,10 万卡服务器集群里,芯片间的通信代价超过了全部训练时间的 40%。
10 万张卡,四成时间在“对齐颗粒度”,这开会浓度,职场人看了都沉默。
华为马尔科夫实验室的数据更直观,4K 超节点组成的 10 万卡集群,MFU 比 8 卡服务器组成的同规模集群高出 2.75 倍。
因此,解决之路也更显清晰:让多芯片紧密协同组成“超节点”,对算力基础设施做系统级的架构重构。
这已经成为产业和学界的共识。比如今年 WAIC 期间,鹏城实验室和全球计算联盟牵头发布《超节点定义与实践白皮书》,就把内存统一编址、超低时延、超大带宽写进了行业共识。
一句话:单打独斗没有未来,组团解题才是版本答案。
这条赛道上,华为昇腾超节点是目前国内唯一规模商用的超节点,已规模商用超过 1000 套。
落地互联网、运营商、金融、教育、医疗、交通、制造等行业,也是国内唯一训练出 SOTA 模型的超节点。
之前 WAIC 期间,昇腾 950 超节点(Atlas 950 SuperPoD)的首次真机亮相,就已经引起过广泛关注。
02.
从 950 到 960,超节点把光“请”进了系统
本次全联接大会上,首先是昇腾 950 超节点官宣迈入规模商用的新阶段。不过这只是一道开胃菜。
当汪涛宣布昇腾 960 超节点正式发布时,全场的注意力立刻被重新聚焦:
业界首个采用 NPO 光引擎的超节点,它来了。
Hi-ONE,把光引擎“贴”到芯片边上
要看懂昇腾 960 超节点,得先认识 Hi-ONE 光引擎。
这是业界首个具备量产能力的 NPO 产品,昇腾 960 超节点“全球首个采用 NPO 技术”的头衔,正是由 Hi-ONE 撑起来的。
两者是一体两面,Hi-ONE 负责打通超节点内部的高速互联,昇腾 960 超节点则是这套技术长成的那台“超级计算机”。
NPO 全称 Near-Packaged Optics,近封装光学,这个读起来有点拗口的技术是用来做什么的呢?
我们知道,今天的大规模 AI 集群内部,主要靠铜缆做电互联,当 Serdes 速率达到 224G 甚至更高,铜缆的各类损耗会让信号传输质量急剧下降。
更麻烦的是,数千根铜缆捆在一起,工程安装困难,维护效率低下。
打个比方,这就像在一条越来越拥挤的老路上跑车,路的名义宽度一直在加,车却越跑越慢,堵在路上的时间越来越长。
业界的解法,是把光引到计算芯片的“最边上”。
NPO 作为与计算芯片近封装的光引擎,可以在距离芯片边缘几厘米的地方完成电信号到光信号的转换,突破铜缆传输距离与带宽的物理极限。
互联功耗与时延显著降低,布线和散热的难题也顺带打包解决。相当于把磁悬浮修到了每个工位门口,通勤效率直接拉满。汪涛说得很直接,“从传统的可插拔模块走向 NPO 是必经之路”。
Hi-ONE 的底气来自三个“第一”:
它是业界首个量产的 NPO 产品;
是行业目前传输能力最大的 NPO 产品,单引擎容量 7.2T,相当于把 36 个 200G 的 Lane 集成进一个模块,一小块 Hi-ONE 就能顶替 9 颗 800G 光模块;
还是唯一实现内置光源的 NPO 产品,把高带宽、高可靠与低时延、低功耗揉在了一起。
均衡设计的背后,是华为 30 多年光技术的积累。
汪涛在圆桌专访中引用了任正非经常说的一句话,华为的研发投资是“范弗利特弹药量,打破一个城墙口”。
几十年攒下的光通信家底,集中砸向超节点互联这个城墙口,Hi-ONE 就是砸出来的结果。它与灵衢协议一起,构成了可规模扩展的超节点互联系统,华为还在全球光互联标准组织 OIF 提出了 NPO 标准立项建议,得到众多行业伙伴的积极响应。
而这套互联系统服务的“心脏”,是昇腾 960 芯片。
华为在会上宣布,昇腾 960 芯片研发进度超出预期,性能实现倍增。960DT 比原计划提前三个季度,2027 年第一季度就绪;960PR 比原计划提前一个季度,2027 年第三季度就绪。
往后看,昇腾系列芯片将保持一年一代的演进节奏,2028 年、2029 年陆续推出昇腾 970、980,算力规格继续翻倍。
4096 卡“一台计算机”,可靠性和规模一样值钱
芯片与互联打底,昇腾 960 超节点的整体规格便水到渠成。
它采用领先的正交架构和全液冷设计,基于灵衢实现内存统一编址,可扩展至 4096 卡规模,提供 8EFLOPS FP8、16EFLOPS FP4 的算力,HBM 容量高达 1PB。
按照超节点白皮书定义,内存统一编址意味着:超节点内部任意一块芯片,都可以访问公共内存池。四千多张加速卡,逻辑上合并成为一台巨型计算机。刚好匹配十万亿参数大模型训练推理需求。
最让人吃惊的是硬件成本与功耗优化。
5500 个 Hi‑ONE 光引擎,直接替代原本需要的 48000 颗 800G 光模块。整机功耗直接减少 550 千瓦,无故障运行时间翻倍,系统可用度高达 99.8%。
很多人看 AI 集群,只盯着算力纸面参数,却忽略可靠性这个隐藏“吞金兽”。
汪涛在大会的圆桌专访中也透露,业界 10 万卡集群的 MFU 往往连 30% 都不到,意味着大量时间耗在故障和故障修复上;MFU 每提升 1 个百分点,10T 大模型的训练就能缩短三天。对动辄数月的大模型训练来说,可靠性就是实打实的时间和成本。
汪涛对此看得很清醒,“要提供有竞争力的训练和推理系统,只做好一个芯片不够,只做一个整机和服务器也是不够的”,最终考验的是多学科的系统工程能力。
此外值得一提的是,除了昇腾 960 超节点,在会上华为还展现了超节点架构的更大版图。
包括鲲鹏超节点全新升级,基于灵衢全光组网最大支持 4096 节点,形成 256TB 统一内存池,十万级沙箱启动速度比传统服务器方案提升 30 倍,沙箱密度还能再提升 25%,Agent 向量检索效率实现倍增。
同时,面向 Agent 推理系统,华为推出基于灵衢 UnifiedBus、支持“一跳直连”的 L3.5 层 PB 级 KV 缓存方案 OceanStor M900 集群,用混合介质加优化 Retention 算法,把 SSD 读写寿命提升 16 倍。
多个昇腾 960 超节点通过灵衢网络或 RoCE 连接,二层 CLOS 四平面组网下最大集群规模可达 51.2 万卡,再结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。
算力的规模天花板,又被抬高了一截。
03.
别把昇腾 960 的价值想简单了
看完硬件参数,相信大家已经感受到昇腾 960 超节点的冲击力。但它的意义,远不止一台性能强悍的机器。
第一,走出不靠堆工艺的算力升级路径。
当下芯片工艺的前进脚步越来越难。昇腾给出一条新思路:靠超节点 + 集群架构创新,拔高算力上限。
从昇腾 901C 到 950,再到本次发布的 960;规模从 384 卡、 1024 卡迈向 4096 卡,同步持续拉高 MFU 利用率。
算力升级不必死磕芯片制程,架构、互联、散热、可靠性,整套系统工程同样大有可为。
这套完整方法论,整个行业都可以借鉴复用。
其次,它把 NPO 从技术构想推向了产业现实。
此前 NPO 更多停留在实验室和论文里,Hi-ONE 作为业界首个量产的 NPO 产品落地,加上华为在 OIF 推动标准立项,意味着光电融合的互联技术开始进入产业化阶段。
对光模块厂商、设备商和数据中心建设者来说,这是一个明确的风向标 —— 下一代 AI 基础设施的互联形态,正在被重新定义。
最后,强悍硬件,还需要开放生态放大价值。
汪涛反复强调,华为专注筑牢 AI 基础设施底座,坚持开源开放算力生态,拥抱国内百模千态的发展浪潮。
CANN 已经全面开源常态化运营。社区外部开发者占比达到 61%,首次超过内部研发人员。月活跃开发者突破 5200 人,成长为国内活跃度顶尖的 AI 开源社区。
昇腾已经适配 90 多个主流第三方开源社区,并且在 Linux 基金会支持下,正式登上 PyTorch 官网可直接安装的算力平台。这也是第一个登上 PyTorch 官网的中国算力平台。
再加上鲲鹏生态 416 万全球开发者,7200 余家合作伙伴,昇腾联合伙伴孵化 7000 多套行业解决方案。
开放,让算力底座从单一企业产品,变成全产业可以共享使用的公共基础资源。
04.
结语:把 AI 变成触手可及的生产力
回到汪涛演讲的题目,“打造智能世界的硅基黑土地”。黑土地自己不直接长出庄稼,它的价值在于让每一位耕种者都能有所收获。
华为选择磨好自己的“豆腐”,做好算力底座,把根技术做深,把生态做开。
“没有任何一家公司能独自支撑整个智能世界。”
AI 时代的大幕才刚刚拉开。接下来,华为将和合作伙伴一起,助力客户把 AI 转化为每个行业、每个企业触手可及的生产力。对千行万业来说,这或许才是“硅基黑土地”最实实在在的许诺。
毕竟,选择相信光的人,运气不会太差 ~
