![]()
新智元报道
![]()
想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。
这些功能背后依赖的是同一项技术——音视频说话人追踪(Audio-Visual Speaker Tracking)。它让机器同时利用听到的声音和看到的画面,定位并持续追踪正在发声的人。
过去几年,音视频分割(Audio-Visual Segmentation, AVS)音视频实例分割(Audio-Visual Instance Segmentation, AVIS)任务受到广泛关注,并取得了显著进展。尽管如此,一个基础问题仍未被充分回答:当场景真正变得动态、拥挤且不连续时,现有模型的音频—视觉对应与长期身份关联能力究竟如何?
为此,复旦大学CVL实验室提出了一个面向复杂人类中心场景的音视频追踪基准AVTrack,论文已被ICML 2026接收,项目主页、论文、代码与数据集现已公开。
![]()
项目主页:https://fudancvl.github.io/AVTrack/
论文:https://arxiv.org/abs/2606.02724
代码:https://github.com/FudanCVL/AVTrack
数据集:https://huggingface.co/datasets/FudanCVL/AVTrack
![]()
不只是「找到说话的人」
音视频追踪的目标很直观:给定一段带声音的视频,不仅要判断谁正在说话,还要在视频持续变化以及多个发声片段之间保持稳定的实例身份。
这听起来似乎并不困难——毕竟日常使用的视频会议软件已经能够完成基本的说话人检测。但一旦进入真实、复杂的视频场景,问题就会迅速变得棘手:人物可能相互遮挡、频繁移动和交替发声,镜头也可能不断切换,甚至还会出现画外音等音视频不一致的情况。
AVTrack 正是面向这类复杂场景提出的音视频实例分割基准。它要求模型联合理解声音和画面,为每个正在发声的人生成像素级掩码,同时在视频持续变化的过程中保持稳定的实例身份。模型不仅要知道「声音来自谁」,还要始终知道「这个人是谁、在哪里」。
在这个任务中,模型需要同时回答三个问题:
谁在发声? 即从音频中判断当前活跃的说话者;
人在哪里? 即在每一帧中以像素级精度分割对应人物;
前后还是同一个人吗? 即使人物被遮挡、镜头切换或位置互换,也要维持跨帧身份一致性。
第三个问题尤其关键。只依靠某一帧中的外观或嘴部运动,模型可能暂时找到说话者;但要在长视频中持续保持正确身份,还必须处理视觉遮挡、多人轮流发声和音画不一致等情况。
现有评测基准漏掉了什么?
早期音视频说话人跟踪数据集大多来自受控实验室,人物较少,摄像机和麦克风位置也相对固定。在这些简单场景中,模型甚至不需要真正理解时序动态和跨模态推理,只靠声音和画面同时出现这种静态关联就能取得不错的成绩。但这并不能说明模型在复杂动态场景中也能工作。后续音视频分割基准虽然引入了像素级标注和更自然的视频来源,但许多样本仍是5–10秒的短片,难以充分检验长期时序建模。
AVISeg数据集将视频长度扩展到平均约60秒,并提供实例级分割与跟踪标注。但镜头运动、遮挡、背景切换和相对位置变化仍覆盖有限。
这会带来一个评测盲点:模型可能在相对静态的视频中取得不错的结果,却仍然依赖短时的音视频共现关系。一旦人物消失后重现、镜头发生切换,或声音与画面中最显眼的人并不一致,模型是否真正维持了跨模态对应关系,已有评测基准很难完整回答。
用8类挑战构造系统性压力测试
AVTrack包含871段视频,平均时长54.0秒,共提供3,120条带跨帧身份的像素级实例轨迹。数据覆盖剧集、vlog、动画、真人秀、访谈和舞台表演六类来源。与常规训练集不同,AVTrack被设计为 纯测试基准:作为独立测试集,AVTrack观察模型能否迁移到复杂的人类中心场景。
![]()
为系统分析复杂场景中的关键困难,AVTrack进一步将其划分为8类可诊断挑战:视觉遮挡、相对位置变化、背景切换、相机运动变化、多实例、多轮发声、音视频不一致和实例尺度动态变化。
① 视觉遮挡(Visual Occlusion):发声者被其他人物或物体部分遮挡,造成实例重叠和视觉边界模糊,增加持续定位与身份保持的难度。该属性覆盖 AVTrack 80.9% 的样本,而 AVISeg 中仅为 8.6%。
② 相对位置变化(Relative Position Change):多个实例之间的相对空间关系随时间发生变化,例如发声者从另一人物左侧移动至右侧。此类场景要求模型持续追踪实例身份,而非依赖静态空间位置。AVTrack中该属性占70.7%,AVISeg中仅为9.7%。
③ 背景切换(Background Switch):视频中出现显著场景或背景变化,例如由室内切换至室外,从而削弱基于背景和视觉上下文的时序连续性。该属性在AVTrack和AVISeg中分别占60.5%和5.9%。
④ 相机运动变化(Camera Motion Change):相机视角发生显著变化,包括推拉、摇移、视角变化或镜头切换,使目标的尺度、视角和可见区域持续改变。这是AVTrack中最常见的挑战,覆盖90.5%的样本,而AVISeg中仅为7.1%。
⑤ 多实例(Multiple Instances):画面中同时存在多个候选人物,但仅部分实例正在发声,使模型需要在多个视觉实例之间建立正确的音视频对应关系。AVTrack中该属性占64.9%,AVISeg中仅为13.6%。
⑥ 多轮发声(Multi-turn Sounding):不同人物随时间交替发声,使活跃发声者及其音视频对应关系不断切换,要求模型动态更新目标身份。该属性覆盖AVTrack 56.8%的样本,而AVISeg中为16.0%。
⑦ 音视频不一致(Audio-Visual Inconsistency):音频与当前可见人物之间不存在直接的一一对应关系,例如旁白、画外音或发声者暂时位于画面之外。AVTrack中约 9.2% 的样本包含此类情况。
⑧ 实例尺度动态变化(Instance Scale Dynamics):目标实例在视频中呈现显著的尺度差异或随时间发生大幅尺度变化,对小目标感知和跨尺度持续追踪提出更高要求。该属性在AVTrack中占56.9%,AVISeg中为35.3%。
这些属性不仅刻画了数据集的场景复杂度,也能够进一步用于分析模型的具体失效模式。AVTrack在动态视觉变化方面显著更具挑战性:90.5%的视频包含相机运动变化,80.9%的视频包含视觉遮挡,70.7%包含相对位置变化,远高于AVISeg对应的7.1%、8.6%和9.7%。与此同时,AVTrack还显式覆盖音视频不一致等传统音视频分割数据较少涉及的场景,使评测能够进一步检验模型在复杂时序变化和非理想音视频对应条件下的鲁棒性。
![]()
为了获得可靠的像素级与跨帧标注,标注人员先从约1,300段公开视频中筛选候选样本,利用Grounded-SAM进行自动预标注,再由标注人员逐帧修正并检查时序身份。整个数据收集、标注和验证过程持续近三个月,共有15名专业标注人员参与。
![]()
现有方法在复杂场景中的表现?
研究团队在统一设置下评估了代表性的视频实例分割(Video Instance Segmentation,VIS)和音视频实例分割方法。VIS方法先在YouTube-VIS上预训练,再在AVISeg上微调;AVIS方法则在AVISeg上训练,最终都直接在AVTrack上测试。
结果显示,只使用视觉信息的VITA、LBVQ 和 CAVIS 在 AVTrack 上的 HOTA测试指标均低于12。
加入音频信息辅助后,AVISM和ACVIS分别达到20.84和20.60,说明音频确实带来了明显帮助,但长期身份关联仍然困难。
研究团队还提供了两个互补的基线方法:一个是端到端的AVTrackFormer,在HOTA测试指标上取得21.47;另一个是无需训练的模块化模型AVTracker,在HOTA测试指标上取得29.08。与已有AVIS 方法中表现最好的 AVISM 相比,AVTracker 提升了8.24 (29.08 vs. 20.84);与更强的端到端基线模型AVTrackFormer相比,AVTracker提升了 7.61(29.08 vs. 21.47)。
研究团队也测试了Gemini 2.5 Pro的零样本表现:直接输入1 FPS的视频帧和原始音频后,其HOTA指标为14.4。这一结果表明,通用Omni-LLM的广泛音视理解能力尚不能直接转化为复杂场景下稳定的像素级说话人跟踪能力。
![]()
AVTracker先做局部对应
再恢复全局身份
AVTracker的核心思路是将长视频中的复杂关联问题拆成三个阶段。
首先,系统使用Whisper获取带时间戳的语音片段,并基于ECAPA-TDNN speaker embedding合并相邻且属于同一说话者的片段,形成更紧凑的 说话人片段。
随后,在每个局部时间窗口内,SAM3提供人物候选掩码,Local Reasoner联合语音转写和视觉观测,将当前语音片段对应到可见人物并形成局部短轨迹。
最后,Global Reasoner汇总各个局部轨迹的关键帧,在整段视频上完成身份分组,恢复连续的说话人轨迹。
![]()
消融实验进一步验证了这种局部到整体设计的有效性。在相同的模型设置下,移除局部片段压缩后,HOTA从24.01降至16.88;在完整模型上关闭动态窗口机制后,HOTA也从28.85降至27.45。语音分离并非总能带来性能提升:
采用MossFormer2时,HOTA从28.85提升至 29.08,而采用SepFormer时反而下降至28.41,说明语音分离产生的误差可能会进一步传播至后续的音视频对齐过程。
![]()
更高精度并不等于问题已经解决
从各细分类别来看,音视频不一致仍是所有方法面临的最困难场景,AVTracker的HOTA也仅为18.5。
此外,在视觉遮挡和多实例场景中,当距离较近的说话人受到遮挡并频繁交替发声时,全局推理器仍可能错误地合并不同身份,或将同一身份拆分为多个轨迹。这些失效模式表明,长期记忆、跨窗口证据累积以及可修正的身份推理机制仍值得进一步研究。
![]()
后续工作将进一步研究音视频不一致、实例尺度动态变化等困难场景,同时探索记忆增强跟踪、基于反思的错误修正机制,以及更加高效的数据与模型设计。
展望
AVTrack 作为音视频追踪基准正式发布,致力于深入剖析模型在复杂音视融合场景下的性能表现与能力短板。也期待未来它能帮助社区更准确地回答一个基础问题:模型究竟是在静态画面中找到了「看起来像说话者的人」,还是已经学会在动态世界里持续理解「谁在何时、何处发声」。
参考资料:
https://fudancvl.github.io/AVTrack/
编辑:LRST
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.