![]()
声学记忆并未消失,只是轨迹发生漂移。
作者丨肖扬
它记得你说过什么,却忘了你当时身处怎样的世界。EnvMem 发现,多轮语音模型的声学记忆并未彻底消失,而是在网络深处逐渐走偏。
想象一下。
你在厨房里和语音助手说话。水龙头一直开着,流水声清晰地混在第一句话里。十几轮对话之后,你忽然问它:“刚才背景里是什么声音?”
它答错了。
奇怪的是,如果你问第一轮里说过的某个事实,它往往还能回答。它没有忘记你的话,却忘了声音里的世界。
这正是当前大型音频语言模型面临的一种隐蔽断裂:模型可以在单轮输入中“听见”环境声,却未必能让这段声音穿过多轮对话,最终抵达答案。
更关键的问题是:它真的把声音忘了吗?还是声音仍在,只是已经变成了解码器不会使用的样子?
围绕这个问题,来自墨尔本大学、KAIST、奥克兰大学和新南威尔士大学的研究团队提出了 EnvMem,并系统分析 Qwen2.5-Omni、Qwen2-Audio 与 Kimi-Audio 的多轮声学记忆。
这项工作不只想证明模型会忘。
它更想找到:记忆究竟坏在了哪里。
01
为什么需要 EnvMem
过去的音频评测经常把语言内容和背景声音放在一起。模型回答正确,我们不知道它依赖的是语义,还是确实记住了环境声;模型回答错误,也无法判断是第一轮没有听清,还是后续对话把记忆冲淡了。
所以,EnvMem 先做了一件看似简单、但非常关键的事:把“说了什么”和“听到了什么”拆开来测。
它围绕两个研究问题展开:
RQ1:语言记忆与环境声学记忆,在多轮对话中的性能差距有多大?
RQ2:声学记忆失败主要来自表示层,还是来自 attention 检索层?
![]()
每个样本都从同一个场景开始:第一轮用户语音中混入一种环境声音,之后追加若干不含新环境声的对话轮次,最后再向模型提问。
同一段对话会产生两类问题。一类询问第一轮说过的语言事实;另一类询问第一轮背景中的环境声音。脚本、说话人、上下文长度和选项数量全部保持一致,唯一变化的是模型最终要找回哪一种记忆。
研究覆盖 10 类 ESC-50 环境声音、4 种对话长度——2、4、8、16 轮——以及 3 个开源音频语言模型。声学问题和语义问题各有 2,000 个测试实例,第一轮音频统一按照 10 dB 信噪比混合。
换句话说,EnvMem 不是再造一个“大而全”的榜单。
它更像一间声学记忆实验室:控制变量,然后看声音从哪一层开始走丢。
02
RQ1:声学记忆比语言记忆更脆弱
答案非常直接:模型更容易记住“你说了什么”,而不是“当时听到了什么”。
![]()
以 Qwen2.5-Omni 为例。当对话从 2 轮延长到 16 轮,语义问题准确率从 0.92 降到 0.84;声学问题则从 0.70 降到 0.56。到了 16 轮,两类记忆的相对退化差距达到 +12%。
Kimi-Audio 也呈现同一方向,长上下文下的相对退化差距达到 +8%。
Qwen2-Audio 暴露出另一个问题:在最短的 2 轮上下文里,它的声学准确率只有 0.39,而语义准确率达到 0.90。也就是说,一部分“遗忘”其实从第一轮就开始了——模型可能一开始就没有把非语言声音编码得足够好。
因此,所谓声学失忆并不是单一故障。
它至少包含两层:一层是初始感知差距,另一层是环境声音在长对话中的跨轮衰退。
语言可以沿着模型熟悉的语义通道稳定传播;非语言声学线索却更像一名没有通行证的旅客,每经过一轮对话,都更容易偏离主干道。
03
RQ2:记忆到底坏在了哪里
看到准确率下降,一个最自然的判断是:声音信息已经被覆盖、压缩,最后从网络里消失了。
但线性探针给出了一个反直觉的答案。
研究者在模型不同层的最终查询位置上训练分类器,检查隐藏状态中还能否读出第一轮的环境声音类别。
![]()
在 16 轮上下文中,第 25 层附近的探针准确率仍能达到约 70%。即使只看模型最终答错的样本,探针准确率也约为 48%,远高于 10 类分类的随机水平 10%。
这意味着一件很重要的事:模型答错,不等于信息已经消失。
声音仍然藏在隐藏状态里,只是模型自己的输出路径没能把它正确读出来。外部探针看得见,原生解码器却不会用。
随后,CKA 表示相似度分析进一步揭开了这条路径。随着上下文变长,模型的中间层表示逐渐偏离短上下文轨迹;失败样本并不是简单变得“没有信息”,而是走上了一条不同于成功样本的内部路线。到了深层,声学线索才被重新聚合,但时间和格式都已经发生偏移。
论文把这种现象概括为:表示轨迹漂移。
记忆没有被彻底删除,只是没有以解码器期待的形状抵达终点。
那会不会只是 attention 没看对地方?
第二种解释同样合理:信息还在,但模型生成答案时没有把足够的 attention 分配给第一轮声音。
如果这个假设成立,随着对话变长,模型对第一轮声学片段的 attention 应该持续下降;失败样本的注意力也应该比成功样本更加分散。
![]()
实验结果却没有出现这种稳定模式。
在 4 轮上下文中,第一轮声学锚点获得的 attention 多数低于后续填充轮;但到 16 轮时,差值反而转为正数,约为 +0.005 到 +0.010。对话更长,并没有让模型稳定地“少看”第一轮。
研究者还计算了覆盖 90% attention 所需的对话轮数和 token 数。成功样本与失败样本之间的差异很小,方向也不一致。失败样本没有系统性地表现出更弥散的注意力。
这里的结论需要说得准确:论文不是证明“attention 永远不重要”,而是发现,在当前模型与测量方式下,attention 分配无法稳定解释声学记忆失败。
模型可能已经回头看了。
只是它看到的那份记忆,已经不是解码器认识的格式。
04
因果实验:
修表示有效,拉 attention 无效
观察只能说明相关性。要判断真正的瓶颈,还需要直接干预模型。
研究者首先进行激活修补:在深层解码位置,把失败样本的隐藏状态替换为另一个样本的表示,然后观察答案能否恢复。
![]()
结果不是“换一个向量就行”,而是表现出很强的 donor 特异性。
以 Qwen2.5-Omni 的 16 轮失败样本为例:不修补时,准确率约为 0.13;换入错误环境类别的表示后只有 0.17;换入同类但同样失败的表示后为 0.22。
只有换入“类别相同、预测成功”的干净表示,准确率才从 0.13 跃升到 0.75。
这组数字几乎把问题钉在了表示上。
真正有用的不是更多激活,也不是任何来自正确类别的线索,而是一份仍然保持可解码结构的干净表示。
反过来,研究者尝试放大第一轮 attention、压制后续填充轮,或把相同增益施加到随机轮次。结果都很小,而且置信区间覆盖 0。系统扫参得到的最大提升为 +3.7,随机控制也能达到 +1.3。
一边是 0.13 到 0.75,另一边是微弱且不稳定的几个百分点。
EnvMem 给出的诊断因此十分清晰:主要瓶颈不是模型“有没有看第一轮”,而是第一轮声学信息在跨层传播后,是否还保持着输出路径可以使用的表示格式。
05
这篇论文真正改变了什么
过去谈长上下文记忆,人们很容易把问题归结为容量:上下文不够长、KV cache 不够大、检索范围不够广。
EnvMem 提醒我们,记忆还有另一个维度:可读性。
信息留在网络里,不代表模型还能使用它;attention 落在正确位置,也不代表被取回的内容仍然保持正确结构。
这对下一代音频语言模型至少提出了三个方向。
第一,评测不能只看转录、语义问答和单轮声学识别。模型是否能跨轮保留警报声、交通声、婴儿哭声等环境线索,应该成为独立能力。
第二,训练目标不能只要求“把信息塞进去”。模型还需要学习让声学表示在长上下文传播之后保持兼容,让早期形成的有效表示不会在中间层逐渐漂移。
第三,修复声学记忆不能只盯着 attention 热图。更细粒度的跨模态连接、记忆 token、KV 状态管理和层间表示对齐,可能比单纯提高某一段注意力更值得投入。
它把问题从“模型为什么忘了”推进到了更精确的一步:
模型不是没有记忆,而是记忆没有沿着正确的轨迹抵达答案。
06
结语:听见,只是记忆的开始
一个真正理解声音世界的模型,不能只在第一秒认出雨声、流水声或警报声。
它还要在十几轮对话之后,知道那段声音曾经发生过,并在需要时准确地把它找回来。
对音频语言模型而言,长期记忆不只是保存信息。
它还意味着:让信息在漫长的计算路径里始终可读、可路由、可解码。
听见,是感知。
记得住,才是理解的开始。
论文:Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
作者:Yang Xiao、Siyi Wang、Han Yin、Hong Jia、Vidhyasaharan Sethu、Eun-Jung Holden、Ting Dang
单位:The University of Melbourne、KAIST、The University of Auckland、UNSW Sydney
为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.