算网协同:计算与网络深度耦合,重塑智算系统能效新边界
5 小时前 / 阅读约9分钟
来源:C114
AI算力竞争已跳出单卡性能比拼,算网协同成核心。传统方案存在拥塞、调控滞后等问题,新架构面临换路-降速、乱序-丢包等挑战。新一代技术推动算网协同迈向深度耦合新阶段。

从大模型参数突破万亿,到十万卡级超大规模训练集群落地,AI算力的竞争早已跳出单卡性能、芯片工艺的单点比拼。在超大规模分布式训练场景中,一次次梯度同步、一轮轮参数聚合,本质都是海量算力节点间的高频数据对话。

此时的网络,早已不是算力的“被动管道”,而是决定有效算力释放上限的核心命脉。一旦发生传输拥塞、时延抖动、流量震荡,或故障切换迟缓,昂贵的GPU便会陷入空转等待,顶尖的硬件峰值性能,最终被低效的通信传输白白消耗。

算力要高效释放,核心在于算网协同。行业正在告别“计算为主、网络为辅”的传统思维,走向计算与网络深度耦合、全局协同的全新范式,从系统底层重构智算集群的吞吐能力与能效水平。

一、传统算网协同:撑起初代智算,却困于规模化瓶颈

大规模AI训练的通信底座,始于RDMA技术。相较于传统TCP协议,RDMA绕过CPU与操作系统内核,通过网卡硬件直接完成GPU显存、主机内存的数据搬运,彻底解决了高吞吐场景下的CPU处理瓶颈,成为万卡集群时代不可或缺的通信基石。

但RDMA天生依赖无损网络环境。一旦出现丢包,其Go-Back-N回退重传机制会引发吞吐断崖式下跌,直接导致训练任务卡顿、停滞。为了在传统有损以太网上搭建无损传输能力,业界形成了PFC+DCQCN的经典协同方案,成为初代智算集群的标准解法。PFC流控作为无损兜底能力,通过队列级反压机制,避免交换机缓存溢出丢包;DCQCN拥塞控制则依据 ECN 标记反馈,在拥塞初现时主动降速,缓解 PFC 带来的头阻塞问题。

这套方案的底层逻辑,本质是“计算为主、网络为辅”:计算定义通信需求,网络仅被动适配。PFC 只需网络提供简单的暂停信号,DCQCN 只需 “是否拥塞” 的单比特标识,端侧凭此自行调速。拥塞信息被极度压缩,端侧无法获知拥塞程度与位置,只能滞后、试探式调整。正因如此,这套方案从根本上无法完美解决网络拥塞问题。

在中小规模、流量相对可控的场景下,这一缺陷尚可容忍。但当 AI 集群规模迈向万卡、十万卡级别后,结构性短板全面暴露。

首先是粗粒度流控引发全网拥塞扩散。PFC基于端口队列生效,一旦个别流量触发拥塞暂停,整队列流量同步停滞,局部拥堵会快速蔓延至全网,造成大面积任务卡顿、吞吐跳水。

其次是拥塞调控跟不上AI突发流量。DCQCN端到端调控需要完整的ECN标记、CNP反馈、速率调整链路,存在至少一个RTT的固有时延。而AI梯度同步是典型的瞬时超高突发流量,全网GPU同步爆发式发包,往往调控信号尚未生效,网络已被打满,拥塞控制彻底失效。

最后是收敛慢、调优难、稳定性差。DCQCN 基于粗粒度信号启发式迭代调速,收敛需要多个 RTT;十余项可调参数无法适配多变的AI业务场景,参数失配极易引发集群吞吐震荡,严重影响训练稳定性。

二、AI模型演进:重塑智算网络设计逻辑

智算网络的每一次范式跃迁,都源于模型架构的底层变化。随着AI模型从稠密走向稀疏、参数规模从十亿迈向万亿,这一演进正在三个层面重塑网络设计逻辑:组网拓扑从单平面走向多平面,负载均衡从逐流走向逐包,拥塞控制从粗放慢反馈走向微秒级协同。

组网拓扑:从单平面三层 CLOS 到多平面两层组网。 随着模型参数量持续增大,训练集群规模不断攀升,传统单平面三层CLOS组网的成本与复杂度问题日益突出:大量核心层交换机与光模块推高了建网成本,三层拓扑下的负载均衡、故障处理与运维管理复杂度随规模急剧上升。业界由此向多平面两层组网演进 —— 将一张物理网络划分为多张相互独立、并行运转的网络平面,计算节点通过多张网卡分别接入各平面,以两层架构实现三层规模,在降低成本、简化组网的同时,把故障域从“全网”收缩到 “单平面”。

负载均衡:从 ECMP 哈希、算路方案到逐包喷洒。 流量工程经历了两次关键演进。早期网络采用 ECMP 逐流哈希,简单易部署,但哈希冲突导致负载不均与长尾时延;随后,针对 Allreduce 等集合通信流量模式相对固定的特征,业界演进到 LBN 方案,或基于通信关系预先算路的方案,在可预测流量下实现了较好的负载均衡。然而,MoE 稀疏模型带来了亚毫秒级随机变化的流量:层间通信仅数十至数百微秒,被激活的专家存在随机性,GPU 间 Alltoall 通信在极短时间内剧烈波动,流量模式从“可预测” 变为“不可预测”,依赖先验流量关系的 LBN 与算路方案迅速失效。业界由此转向逐包喷洒,将单条流的报文逐包分发到全部可用路径,不再依赖对流量模式的预判,而是在包粒度实时响应网络状态。

拥塞控制:从粗放慢反馈走向微秒级协同。相较传统稠密模型,MoE 模型层间通信时间仅数十至数百微秒,专家激活逻辑具备极强的随机性,让 GPU 间的 Alltoall 通信呈现出“瞬时爆发、剧烈波动、无规律高并发”的特点,要求网络具备微秒级感知、微秒级收敛的能力。而传统 DCQCN 的粗粒度、慢反馈调控机制,在原理上就与这种动态多变的稀疏流量不兼容。为此,业界以 UEC、veRoCE 等新一代传输协议为代表,正在探索基于更丰富拥塞信号、更快反馈路径、更精细速率控制的下一代拥塞控制方案。

三、算网协同主战场:四大共性技术挑战

多平面组网与包级负载均衡已成为智算网络的确定性落地方向,但这些新架构也带来了传统架构从未面临的全新挑战:换路-降速二义性、乱序-丢包二义性、平面故障快速切换。此外,业界长期悬而未决的拥塞控制精准控速难题,也构成了另一大挑战。这四大核心挑战,共同构成了行业突破系统能效上限的关键壁垒,也让传统“计算为主、网络为辅”的范式难以为继,算网深度协同正成为关键破局方向。

3.1 换路-降速二义性

网络拥塞发生时,端侧无法快速判别拥塞根源:是网络路径负载不均,还是incast(多打一)导致。前者最优解是流量换路、迁移至轻载链路,后者只能通过降速缓解。传统机制一刀切的降速策略,常常误判场景、浪费可用带宽,造成不必要的算力损耗。实现路径级量化拥塞感知、精准决策换路或降速,是新一代算网协同必须突破的核心能力。

3.2 乱序-丢包二义性

逐包喷洒带来的多路径时延差异,让报文乱序成为常态。接收端无法区分乱序是“路径时延差异导致的正常滞后”,还是“报文真实丢失”。传统依赖超时判定丢包的机制,会带来数百毫秒至数秒的无效等待,严重拖垮集群吞吐。Packet Trimming 技术精准破解这一难题,通过裁剪标记区分乱序与丢包,实现毫秒级精准重传,大幅提升传输容错效率。

3.3 平面故障快速切换

多平面组网将集群划分为多个独立故障域,但平面故障无法根除。当某平面接入端口故障时,本地直连网卡可实时感知端口down 并快速切换至其他平面;交换机虽能通过 BGP 传递故障信息,但该信息仅传导至 Leaf 交换机,无法进一步通告至远端网卡,导致远端流量仍无法切换。

业界有两种解决思路:一是三层逃生,通过第三层互联打通各平面,故障时经路由绕行逃生路径,可解决远端切换,但带来硬件成本增加、规模受限及流量绕行等代价;二是通过算网协同,由交换机直接将故障通告至远端网卡,使其主动感知并切换流量,无需额外互联,更优雅地解决该问题。

3.4 拥塞控制精准控速

在AI瞬时随机突发流量下,仅依赖简单拥塞信号的传统DCQCN启发式调速已难堪重任。当前行业形成两大主流突破方向:一是网络量化反馈、端侧精准计算,依托高精度拥塞数据,仅需少量迭代甚至单次调速即可收敛至最优带宽;二是网络主动带宽授予,交换机前置评估链路余量、动态分配带宽配额,从被动事后调控,升级为主动事前管控,彻底解决拥塞滞后问题。

四、结语:算网协同,定义智算新能效

智算时代的算力竞争,早已不是硬件参数的单点比拼,而是系统级协同能力的终极较量。

传统PFC+DCQCN架构的局限,本质是“计算为主、网络为辅”这一旧有范式的必然结果。而MoE稀疏模型、十万卡超大规模集群,彻底颠覆了传统流量逻辑与运行规则。UEC、veRoCE等新一代技术的持续迭代,标志着算网协同正式迈入深度耦合、全局感知、精准调控、智能收敛的全新阶段。

未来,智算系统的能效上限,不再由单卡芯片的峰值性能定义,而是由计算、网络、调度三位一体的系统协同能力决定。以算网深度耦合为核心,打破边界、消解瓶颈、释放全域算力,正是超大规模AI集群高效进化的核心答案。