AMD联合IBM与Zyphra,耗时一年多,利用AMD硬件成功训练出首个大型混合专家(MoE)基础模型ZAYA1。该模型依托AMD硬件生态系统构建,训练过程在IBM云上完成,采用了AMD Instinct MI300X GPU等硬件。三方共同搭建了一个包含128个节点、总计1024块GPU的训练集群,实际训练性能超过750 PFLOPs,Zyphra则负责开发了优化的训练框架。ZAYA1在预训练阶段使用了14万亿tokens的数据,并采用了分阶段课程学习策略。基准测试结果表明,其综合性能与Qwen3系列相当,且优于SmolLM3、Phi4等模型。ZAYA1的优异性能主要得益于两项关键创新:CCA注意力机制和改进线性路由。目前公布的是基础模型的预览版本,未来将发布完整的后训练版本,并分享评测结果和开发经验。
