据AI base报道,巨人网络AI Lab近日联合清华大学SATLab与西北工业大学,共同推出三项音视频多模态生成技术成果,包括音乐驱动视频生成模型YingVideo-MV、零样本歌声转换模型YingMusic-SVC及歌声合成模型YingMusic-Singer。这些模型的相关代码将陆续在GitHub与HuggingFace平台开源。其中,YingVideo-MV仅需一段音乐和一张人物图像,即可生成节奏同步、镜头语言丰富的音乐视频,并有效缓解人物畸变问题;YingMusic-SVC优化了真实音乐场景下的歌声转换,显著降低失真;YingMusic-Singer则支持任意歌词输入与零样本音色克隆,提升AI演唱的实用性与创作灵活性。
