vLLM-Omni 系统级优化结合 FastH3 实现 MiniMax H3 实时服务
1 天前

本文聚焦MiniMax H3的服务优化,指出服务优化是系统级问题,涉及多个环节的时延。为此,vLLM-Omni从完整常驻流水线出发,通过长序列注意力与通信优化、融合DiT算子、并行VAE解码、紧凑输出传输及并行MP4构建等系统级手段,在八卡B300配置下,将完整响应时延较Diffusers降低了30.8%。同时,文章介绍了通用H3服务架构的扩展方法,包括分布式逐层卸载、编码器分离、可选量化与注意力加速等。此外,FastVideo的FastH3将DiT前向次数从49次减少到4次,在八卡B300上,生成10.125秒完整MP4耗时8.678至8.710秒,5秒、10秒、15秒档均实现完整响应就绪时间快于播放时长的实时效果,其VSA变体可进一步提升速度。最后,文章给出了生产部署建议及后续工作方向。