针对当前音视频交互多局限于音视频问答,缺乏无需文本或ASR转写的原生音视频对话能力的问题,相关研究推出了OmniVChat原生音视频对话框架。该框架利用多智能体数据引擎OmniVChat-Studio,合成了包含参考回复与评分标准的单轮及多轮原生音视频对话数据,并构建了涵盖5大能力类别的2800条评测基准OmniVChat-Bench。同时,将分层评分标准转化为强化学习奖励设计OmniVChat-RL,并基于这些合成数据训练模型。实验结果表明,仅使用合成对话数据进行强化学习,模型在未经训练的真人真实交互数据集上的表现显著提升,证明了精心设计的合成数据能有效训练面向现实场景的原生音视频对话模型。
