复旦发布以人为中心的复杂场景音视频追踪基准
14 小时前

复旦大学CVL实验室提出了面向复杂人类中心场景的音视频追踪基准AVTrack,其相关论文已被ICML 2026接收,项目主页、论文、代码及数据集也已对外公开。AVTrack主要解决复杂动态场景下音视频对应与长期身份关联的基础问题。该基准包含871段视频,平均时长54.0秒,提供了3120条带跨帧身份的像素级实例轨迹,覆盖剧集、vlog等六类来源。作为纯测试基准,AVTrack划分了视觉遮挡、音视频不一致等8类挑战场景,复杂度远超现有同类数据集。研究团队对代表性VIS、AVIS方法及Gemini 2.5 Pro进行了测试,结果显示现有方法在复杂场景中表现欠佳,通用大模型的音视理解能力也难以直接转化为稳定的像素级说话人跟踪能力。团队提出的模块化模型AVTracker,通过局部到整体的三阶段设计,在HOTA指标上取得了最优表现。然而,音视频不一致、视觉遮挡等场景仍是所有方法的难点,团队后续将针对这些困难场景及相关机制展开深入研究。AVTrack旨在分析模型在复杂音视融合场景下的性能与短板,推动探索模型对动态场景中说话者的持续理解能力。