多会话语音记忆基准 VoxMem,专治音频大模型记不住「谁说的、怎么说」
2 小时前

针对长期语音对话场景下的评测痛点,墨尔本大学与新南威尔士大学联合团队推出了多会话语音记忆基准VoxMem。该基准采用“声学证据×记忆操作”的二维分类法,覆盖15种考察组合,且所有题目在不同历史长度(8K至64K)下保持不变。VoxMem共包含3196个评测实例、34743个语音会话,总计约177小时音频。对15个音频大模型的评测结果表明,在32K上下文长度下,所有模型的整体准确率均未超过40%。模型对语音语义的记忆表现明显优于对说话人身份、副语言线索及环境声等音频原生信息的记忆。同时,模型在追踪语气、背景声变化方面的准确率极低。随着历史长度的增加,各类信息的记忆准确率均有所下降。当前,音频大模型的语音记忆瓶颈主要集中在信息的识别、定位与关联绑定环节,而非推理操作层面。