2026年8月24日,摩尔线程发布《MTT S5000 Prefill-as-a-Service技术白皮书》,提出基于旗舰级AI训推一体智算卡MTT S5000的“Prefill As a Service”新范式。该方案针对AI Agent、代码生成、超长文档分析等长上下文推理场景,通过解耦预填充(Prefill)与解码(Decode)阶段,使二者运行在契合自身计算特性的硬件资源池上,从而兼顾推理效率、成本控制与算力变现,降低单位Token基础设施成本。