淘宝 TaoMate-H3 开源:三步生成「分钟级」音视频连续创作
9 小时前

TaoMate-H3是阿里巴巴TaoLive AIGC团队基于MiniMax H3模型研发的音视频联合流式生成模型。该模型结合了三步LoRA推理与自回归生成技术,以小片段为单位逐步生成内容,无需等待整段视频完成。它支持根据文本描述生成包含对白、歌声或环境音的视频,并实现分钟级续写,提供多档横竖屏分辨率输出,显著缩短了首段内容的产出时间,为直播、虚拟角色表演等场景提供了技术支撑。目前,TaoMate-H3的推理代码和LoRA权重已在GitHub和Hugging Face上开放,供开发者下载体验、开发与研究。该模型具备三大核心能力:三步流式生成、音视频联合生成、分钟级连续续写,可应用于电商讲解、角色演唱表演、动漫对白创作、环境特效生成等多种场景。其推理流程包括分段组织内容、准备音频引导、联合流式生成、解码输出四个环节,依托三步LoRA、Self Forcing自回归训练、音视频KV缓存、连续时间编码、音频轨迹引导等关键技术,实现了高效稳定的生成。经测试,在指定硬件下,TaoMate-H3相比原版MiniMax H3生成效率大幅提升,首段内容就绪时间显著缩短。项目遵循相关开源协议,团队后续将持续优化速度,并陆续开源更多流式音视频生成模型。