C114讯 7月23日消息(水易)随着AI大模型训练规模从万卡迈向十万卡,数据中心网络数据中心网络在带宽、功耗、端口密度和成本等方面面临持续压力。在此背景下,光电路交换(OCS)凭借低时延、协议透明、超低功耗和可重构等特性,成为业界关注的焦点。为更好推动OCS技术在中国的产业化落地,CIOE中国国际光电博览会与C114通信网联合主办“2026中国光通信高质量发展论坛-光交换系统技术专场”。

中国电信研究院高级工程师刘宇旸博士发表《OCS for AI:从数据中心光交换到城域算力光互联》的主题演讲。系统阐述AI发展为何推动光网络和OCS技术进一步演进、OCS应用为何不应局限于数据中心内部,以及如何利用运营商城域网中的CO节点、OTN、ROADM和OCS能力,构建面向AI推理的城域级算力光互联架构。
推理驱动算力下沉,城域网价值升级
当前,全球AI算力容量持续攀升,大模型能力不断增强,推动AI算力基础设施从以单点集群为主的建设模式,向更大规模集群化部署以及更高能效和更强网络互联能力的方向演进。同时,AI业务逐渐从训练驱动走向训推并重,推理增长明显提速,而推理强调实时响应、高并发和用户体验,网络互联的重要性进一步凸显。
刘宇旸表示,推理需求快速增长并未削弱AIDC的重要性,训练、基础模型迭代和大规模集中推理仍主要依赖超大规模智算中心。无论是超大规模单体智算中心,还是通过DCI实现的跨区域分布式智算中心,都面临网络互联压力持续上升的挑战。
具体而言,AllReduce、All-to-All等AI通信强度高;多级电交换和大量光模块带来能耗挑战;大规模集群需要更高交换端口密度;链路/交换节点故障影响训练和推理连续性。可以说,随着集群规模持续扩大,网络互联正成为影响算力效率、能耗和可靠性的关键瓶颈。
刘宇旸介绍,传统数据中心网络主要依赖电交换,但随着集群规模的提升,电交换面临带宽、功耗、端口密度、故障隔离等方面的压力。OCS可通过卸载/替代部分Spine层电交换压力、提供冗余保护和故障隔离、支持分布式交换和可重构拓扑,被用于构建大带宽、低功耗、可重构的光互联能力。
从业界实践来看,谷歌通过总线式光交换技术重构网络连接,英伟达利用OCS实现高效保护与物理隔离,曦智科技探索了分布式光交换实现可重构拓扑。“这些案例说明,OCS不再是概念层面的技术,而是已经在数据中心内AI光互联中体现价值。”
随着AI推理需求的增长,推理业务从离线调用走向实时在线服务,端到端时延成为影响用户体验的关键因素,算力部署位置需要从远端中心云向城域侧、边缘侧下沉。为满足这些需求,OCS是否也可以从数据中心内进一步走向城域网CO节点之间的算力互联?
运营商的CO节点靠近用户,同时具备机房、电力、光纤、OTN、ROADM和运维体系,是承载边缘AI推理的天然位置。但是,单边缘DC/CO受空间、功耗、散热和卡数限制,难以独立承载大模型推理需求,可将多个CO节点通过光网络互联,组织成城域级AI推理集群,支撑低时延、可扩展的分布式推理。
刘宇旸表示,多CO协同后,城域网不再只是承载普通业务流量,而需要支撑AI任务中的聚合通信(AllReduce)与多对多(All-to-All)通信。在AIDC内部,GPU/服务器通过Leaf-Spine或Rail结构互联,支撑AllReduce聚合通信和All-to-All多对多通信;在城域侧,多CO节点通信模式可从AIDC内部集群映射到城域CO光环,通过OTN/ROADM光环互联,利用环形波长和光直通能力承载类似AI通信模式。
OCS助力构建城域级AI推理算力池
刘宇旸介绍,面向城域多CO协同推理,可设计两类城域光网络架构:一类是面向AllReduce的Type I环形并行波长模式,另一类是面向All-to-All的Type II直达光路Mesh模式。
Type I利用城域网天然环形光纤结构,将多个并行波长映射为AI聚合通信通道,适合AllReduce、P2P聚合与结果同步、prefill阶段大流量输入处理、批量数据交换和状态汇聚等业务。其优势在于波长节省、带宽聚合、部署简单,适合长时间、稳定、大流量业务。其边界性在于多跳O/E/O带来时延累积,对于All-to-All、MoE专家路由、Decode等低时延的多对多通信,需要引入Type II直达光路模式。
Type II利用ROADM光直通能力,在物理城域光环上构建逻辑直达光路Mesh,面向All-to-All、MoE专家路由和decode阶段等低时延多对多通信。其优势在于减少中间CO电处理,降低多跳O/E/O时延,但其需要消耗更多的波长和收发器的并发能力,资源不足时可采用部分Mesh或时间切片调度,因此Type I和Type II不是替代关系,而是互补关系。
Type I和Type II主要解决单个城域光环内的通信,但单个城域光环仍受CO数量、波长资源和本地算力规模限制,因此需要通过OCS实现多环扩展。在不改变Type I和Type II基本机制的前提下,OCS通过光纤级/光路级重构,将多个城域环按需合并为更大的逻辑拓扑,实现多CO算力资源池化和弹性扩展。
刘宇旸表示,单环内ROADM和OTN负责Type I和Type II通信模式,多环之间OCS负责Scale-out、资源池化和拓扑重构。OCS未来会将多个CO节点和多个城域光环之间组织起来,形成更大的城域级AI推理算力池。
据介绍,基于DeepSeek-V3风格MoE推理负载的仿真结果表明,Type II通过ROADM直达光路减少多跳O/E/O处理,更适合Decode-heavy、智能体交互等低时延推理阶段,在相关场景下可实现约2.2倍会话级加速;在边缘推理场景下,多CO协同引入的城域通信开销占比较低,Type I/Type II多环扩展均可保持超过96%的有效计算时间占比;OCS通过合并多个城域光环突破单环CO数量和算力规模限制,实现Type I约7.9倍吞吐扩展,并在Type II波长约束下实现约3倍吞吐扩展。目前,上述相关成果已在光通信期刊JLT上发表(https://ieeexplore.ieee.org/document/11569890)。
