C114讯 9月22日消息(九九)正在举行的2026云栖大会上,阿里巴巴首次集中展示了“芯片—模型—云”的协同优化成果。作为全球少数同时具备自研芯片、大模型和AI云全栈能力的科技公司,阿里已率先在模型自进化、芯片设计和云上算力服务等环节实现协同优化,推动全栈技术能力转化为实际的性能提升、成本下降和规模化应用。

此次展示的核心,是三个技术体系之间的双向反馈:模型和Agent的真实需求牵引芯片与系统设计,云平台将硬件能力组织成可规模化交付的服务,模型再反向优化推理软件和芯片设计。芯片、模型与云由此围绕任务效果、响应速度、吞吐和成本共同迭代,形成协同飞轮。
芯模协同:芯片支撑模型,模型反哺软硬件优化
这一协同已经体现在前沿模型的运行与交付中。据阿里披露,基于真武M890打造的阿里云灵骏超节点实例,已稳定运行Qwen3.8-Max、Kimi K3等超2万亿参数模型,并实现规模化供给。其背后,是芯片、服务器、高速互联、模型软件和云上资源调度的联合优化。截至2026年6月,真武系列已服务超过650家企业客户。
模型也开始探索自主设计芯片,为基础设施提效。仅基于一份真实的芯片模块规范,Qwen3.8-Max就能自主运行超过60小时、调用EDA工具超过万次,完成从功能架构设计、验证到物理实现的完整流程,实现物理面积下降 42%的优化指标。模型能力的增强,让芯片设计成为可迭代、可积累的自主过程,而更好的芯片硬件又将加速模型智能的持续突破,在芯片和模型间形成一个自主迭代的循环。
这些案例呈现出协同飞轮的另一面:芯片支撑模型能力提升,进一步释放硬件性能、改善芯片实现效率。模型能力的进步,开始反馈到支撑其运行的技术基础设施中。
模云协同:贯通训练与推理,提升算力利用率
云平台负责将各环节的优化转化为整体运行效率。训练侧,阿里云通过高速集群互联减少通信等待,通过高性能并行文件存储CPFS提高数据供给能力,再以PAI异步Agentic RL框架串联轨迹采样、回报累计、模型训练和参数更新,支持模型持续迭代。网络、存储和训练框架共同改善,让大规模算力能够更持续地投入有效计算。
基于强大的AI云基础设施,Qwen正逐步迈向训练自我进化。云栖大会上,阿里介绍称,Qwen3.8-Max通过自主搭建训练流程、构造训练数据,并自主设计实验、定位缺陷,在人类完全“零参与”的情况下持续迭代超1个月,完成33轮有效迭代。基于RSI、后训练等系列技术联合优化,Qwen3.8-Max新版本在Artificial Analysis上的得分上涨12.5%,与Claude、GPT最强模型同处第一阵营,领先于GLM5.3、Kimi-K3等所有国产模型。
推理侧,联合优化重点延伸至长上下文和复杂Agent任务的状态管理。随着KV Cache不断增长,模型响应速度和服务成本越来越受到缓存调度与数据搬运的影响。据阿里云披露,在相关场景中,Tair KVCM通过统一编排内存池、KVCacheStore和远端共享存储,实现每Token成本下降50%;KVCacheStore则使首Token响应时间下降54%。
由模型发起的推理自主优化也在加速。在平头哥自研的真武 M890 上,Qwen3.8-Max“从零适配”全新的Qwen3.8-Flash-Next模型,交付了一套可运行的推理栈;相较于首个可用版本,模型优化后实现长文本首 token 延迟和每输出 token 延迟分别下降 47% 和 60%,日常对话场景的单实例吞吐提升 96%。
云芯协同:以真实业务负载牵引芯片设计
来自云上业务的需求,也在反向影响下一代芯片的产品路线。Agent运行既需要AI芯片完成模型推理,也需要CPU承担工具调用、代码沙箱、检索和多Agent编排。对应这些负载,规划中的倚天730面向AI Head Node强化单核性能,倚天720则以192核支持Agentic Rack的大规模并发执行;后续倚天750还将通过ICN总线与真武AI芯片直接互联,提高协作效率。
下一代训推一体AI芯片真武V900,则进一步面向更大模型和更长上下文升级。据介绍,V900搭载216GB显存,片间互联带宽达到1200GB/s,原生支持FP8、FP4低精度计算,计划于2027年第一季度量产,并在阿里云数据中心规模化部署。配合超节点架构与云平台优化,这些硬件能力将为后续模型训练、推理和Agent服务提供支撑。
扩大算力供给,推动协同成果规模化应用
性能与成本优化之外,扩大供给是这一协同体系继续发展的另一项重点。阿里云计划于2026年第四季度新增服务节点,进一步增加云上超节点供给,让芯片、模型和系统优化的成果进入更多实际业务场景。
吴泳铭表示,客户AI需求强劲,全球AI数据中心相关供应链紧缺仍限制算力增长。阿里巴巴将与合作伙伴共同投入AI基础设施建设,目标是到2032年,阿里云运营的全球数据中心规模超过20GW。
