网易首页 > 网易号 > 正文 申请入驻

当AI转录模型学会"猜题":语音识别排行榜背后的秘密

0
分享至


2026年,一份关于ASR(自动语音识别)模型的评测报告悄悄流传开来。报告里提到一件事,让不少从业者愣了一下:那些在公开榜单上排名最靠前的语音识别模型,有一部分并没有真的听懂音频里说的话,而是学会了"猜"这个音频大概率来自哪个测试集,然后直接把测试集里可能有错的标准答案背出来。

这听起来有点像什么。

想象一个学生复习考试,发现某个老师出的题库这些年反复用,甚至连题库里的错别字都没改过。这个学生不去理解题目本身在问什么,而是把整本题库的标准答案背下来,包括那些答案本身就是错的题。考试时一看到题库里熟悉的句式和措辞,条件反射式地把背好的答案写上去,哪怕题目已经被悄悄改过。结果这个学生次次考满分,但你要是真让他去解决一道没见过的新题,他就露馅了。

这篇来自Hume AI Research的论文,做的就是把这种"背答案"的行为从语音识别模型里揪出来,而且不是靠猜测,是用一整套可以量化、可以复现的方法证明了它确实存在。

排行榜和现实之间,一直有条看不见的裂缝

先说清楚问题出在哪。

评价一个语音识别模型好不好,业界最常用的指标叫WER

WER(词错误率):Word Error Rate的缩写,衡量模型转录文字和标准答案之间差了多少个词,数值越低说明转录越准

从Deep Speech 2到Whisper,过去十年间不断有研究者宣称自己的模型在某个基准测试上"达到了人类水平"。但业内早就有共识:这些漂亮的榜单分数,往往撑不起现实场景里的实际表现。噪音、口音、方言、电话录音质量差,随便一个真实场景的变量丢进去,模型的表现就可能大幅跳水。

过去几年,学界处理这个"榜单和现实脱节"的问题,思路基本是一条:既然现有基准测试覆盖不到某些真实场景,那就造新的基准测试,把那些场景补进去。远场语音、车内多人对话、带噪声的语音,一个接一个新数据集被造出来。

这篇论文说,这个思路本身没错,但它解决的是覆盖率问题,漏了另一个更隐蔽的问题:即使你造了再多新基准,只要它是公开的,模型依然可以针对它做"应试优化",而不是真的提升听力。这是一个测量问题,不是覆盖问题。换句话说,造新题库解决不了学生偷偷背答案这件事。

论文给这种行为起了个名字,叫benchmark optimization

benchmark optimization(俗称benchmaxxing):指模型的评测分数提升,来自于对特定基准测试数据的针对性利用,而不是转录能力本身的通用性进步

这个词听起来有点学术,但它对应的现象其实很直白:模型看榜单看多了,学会了投机取巧。

怎么抓到模型在"偷看答案"

抓这种行为的难点在于,你没法直接问模型"你是不是在作弊"。你只能设计一些巧妙的陷阱,让模型在不知情的情况下露出马脚。

论文的核心思路是这样的:找到一些音频信息本身"不够用"的场合。也就是说,光靠耳朵听这段录音,你没法百分百确定标准答案该写什么,可能是因为标准答案本身就抄错了,可能是因为关键的一个词被静音处理掉了,也可能是同一个词有两种写法都说得通。

在这种场合下,一个真正诚实的、只依赖听觉的模型应该表现出"不确定",它应该给出一个中立的、基于音频本身能推断出来的答案。但如果模型在这种场合下总是精准地、系统性地吐出基准测试原本给定的那个标准答案,那就说明这个模型不是在听音频,是在识别"这段录音是不是来自某个我很熟的数据集",然后照抄答案。

研究团队围绕这个思路设计了三类探针,可以理解成三种不同的"审讯手段"。

### 第一招:故意问一道标准答案本身出错的题

VoxPopuli是欧洲议会录音构成的一个知名语音数据集,业界用得非常广泛。但这个数据集有个众所周知的毛病:它的标准答案里混着不少转录错误,可能是漏抄了一个词,多抄了一个词,或者把某个词听错抄成了另一个词。

论文管这种情况叫reference disagreement

reference disagreement(参考答案分歧):指基准测试给出的标准答案本身包含错误,也就是标准答案和真实音频内容对不上

举个具体例子,标准答案里写着"we should return to the Geneva format"(我们应该回到日内瓦模式),但实际录音里说的是"we should return to Geneva format",中间那个"the"是标准答案自己多加的,音频里根本没这个词。一个诚实的模型应该跟着音频走,输出没有"the"的版本。但一个"背答案"的模型会照抄标准答案,把这个多余的"the"也加进去,哪怕音频里压根没这个音。

问题来了:怎么在几百万小时的录音里,找出哪些地方标准答案是错的?靠人工一条条听太费时间了。

研究团队想了个取巧的办法:找四个转录准确率很高、但彼此独立的模型组成一个"评审团"

评审团机制:用Kimi-Audio、Qwen3-ASR、Voxtral-Mini、Moonshine-Streaming这四个高准确率模型分别转录同一段音频,如果四个模型全部一致认为标准答案在某处出错了,就把这个位置标记为"共识性错误"

这套机制在745段VoxPopuli测试录音里,一共挖出了1113处这样的共识错误。研究团队还专门拿一份人工标注的数据集去验证这套自动挖掘机制靠不靠谱,结果93%的自动标记错误,人工标注里也确实标出来了。这说明这套"四个AI互相印证"的办法基本靠谱,能替代大量人工听录音的工作。

结果出来后,情况相当扎眼:在VoxPopuli测试集上WER表现最好的六个模型(5.4%到5.8%之间),accept-ref

accept-ref:指模型在音频与标准答案冲突的情形下,仍然选择输出标准答案而不是音频真实内容的比例,数值越高说明模型越依赖"背答案"而非"听音频"

accept-ref数值都落在0.18到0.30之间,也就是说这些模型有近三分之一的机会,会在标准答案明显出错的地方,还是照抄错误答案。而所有WER在6.5%或更高的模型,accept-ref都不超过0.10。

这个对照本身就很说明问题:分数排名越靠前的模型,"背答案"的倾向反而越明显。这不是巧合,这是同一个现象的两面。

### 第二招:把关键信息静音,看模型能不能"隔空猜题"

如果说第一招是利用标准答案本身的漏洞,第二招就更直接了:研究团队主动在音频里挖坑。

具体做法是,找到一段音频里的某个数字,把这个数字对应的那段声波直接抹成静音,前后各留一点缓冲区避免边界误差。数字被研究团队选中作为攻击目标,是因为数字这种信息很难靠语言模型的先验知识猜出来。

比如一句话"we also had 50 international US experts"(我们还有50名国际美国专家),如果把"50"这个词的音频彻底抹掉,只留下静音,一个真正诚实的、只依赖听觉的模型压根不该知道这个数字是50,因为这个数字从上下文里完全推不出来,周围的音高、环境噪音、说话人的声线也不会透露任何和数字大小相关的信息。

论文管这个叫masked-entity recovery

masked-entity recovery(掩码实体恢复):把音频里某个关键信息(比如数字)的声波直接静音,测试模型能否仍然"猜出"标准答案里的原始内容。如果能猜出来,说明模型不是靠听觉,是靠记住了这段录音属于哪个基准测试

结果同样触目惊心。在VoxPopuli和LibriSpeech这两个公开基准测试上,排名靠前的模型masked accept-ref能到0.40左右,也就是说,即便把数字彻底抹掉,这些模型仍然有四成的概率精准报出被抹掉的那个数字。这已经不是猜测能解释的巧合了,这是模型手里握着一份"标准答案备忘录"。

但更有意思的是接下来的对照实验。研究团队又收集了一批"新鲜"数据:2026年6月新录的欧洲议会发言(叫ep-fresh),以及一批2026年才开始活跃的LibriVox新读者朗读的书(叫libri-fresh)。这些数据无一例外发生在所有模型训练截止日期之后,模型不可能提前"背"过这些录音的答案。

同样是把数字静音,同样让模型去猜,模型在这些全新数据上的表现,明显不如在老基准测试上那么"神机妙算"。这个对比就像什么呢?

就像那个背题库的学生,遇到题库里的原题能秒答,一换成同一个老师用相同风格出的新题,立刻卡壳,如果他真的理解了知识点,新题旧题应该表现差不多;但如果他只是背了答案,新题就露馅了。这个反差本身,就是"模型在背答案而非真正理解"最直接的证据。

### 第三招:同一个词有两种写法,看模型跟谁的"方言"

第三个探针更精巧,它利用的是语言里天然存在的一词两写现象。

比如英语里"Mr"和"Mister"读音完全一样,只是书写习惯不同。VoxPopuli数据集里,标准答案统一写成缩写的"Mr";而LibriSpeech数据集里,标准答案则写成完整的"Mister"。这两种写法音频听起来毫无差别,一个只靠耳朵工作的转录系统,理论上没有任何理由能区分该写哪种。

论文把这个叫orthographic switching

orthographic switching(拼写切换):指同一个发音对应两种在语义和读音上完全等价的书写方式,测试模型是否会根据"猜到的数据集来源"去匹配对应基准测试的书写习惯,而不是使用一个统一的、基于听觉的判断标准

如果一个模型内部只有一种固定的拼写偏好,比如永远写"Mister",那不管音频来自哪个数据集,它的表现应该是恒定的。如果模型是随机选择两种写法,理论上应该各占一半左右。但研究发现,11个模型里有6个在"Mr/Mister"这组测试上,切换准确率显著超过50%,也就是说这些模型能相当精确地判断出"这段录音大概率来自VoxPopuli,所以应该写Mr",或者"这段录音像LibriSpeech的调调,所以应该写Mister"。

更让人吃惊的是,研究团队还测试了另一组更细粒度的例子:像"anyone"和"any one"这样的古旧拼写变体,这两种写法居然在LibriSpeech这一个数据集内部就同时存在。这意味着模型要做的不是简单地区分"这是A数据集还是B数据集",而是要在同一个数据集里,识别出更细的子群体或者具体样本,才能猜对该用哪种写法。11个模型里有8个在这项测试上超过了50%的基准线。

这说明什么?说明这些模型对"这段音频属于哪个基准测试、甚至属于测试集里的哪一类样本"这件事,有着惊人精细的判断力,精细到已经超出了正常语音识别所需要的能力范围。

模型到底在多"精"的程度上作弊

发现这个现象只是第一步,论文接下来做的事情更有意思:追问这种"作弊"行为到底是被什么触发的,触发的范围有多广。

研究团队设计了一整套对照实验,逐一替换或移除录音里可能暗示"这是基准测试音频"的各种信号,看看哪个信号一旦消失,模型的作弊行为就跟着消失。

第一组对照是声音克隆实验。研究团队用Qwen3-TTS

Qwen3-TTS:一款文本转语音模型,可以基于参考语音克隆出说话人的声线特征,合成新的语音内容

分别克隆了三种声音:VoxPopuli测试集里原本发言人的声线、一个通用的、没有任何特定身份的合成声音、以及ep-fresh里那些全新议会发言人的声线。用这三种声音朗读一模一样的文本内容,观察模型的作弊倾向有没有变化。

结果显示,用VoxPopuli测试集发言人声线克隆出来的音频,触发的作弊倾向和原始录音差不多高。但换成通用声音朗读同样的文字,很多模型的accept-ref明显下降。而用ep-fresh里全新发言人的声线克隆出来的音频,作弊倾向大多介于两者之间,更靠近通用声音那一端。

这个结果说明了一件很关键的事:模型识别的不是"这是欧洲议会的口音、这是政治演讲的语域"这种宽泛的风格特征,而是精确锁定"这段声音是不是我训练时见过的那几个具体说话人"。这个触发条件窄得惊人。

这就好比一条看门狗,训练它认识主人的脚步声。它不是学会了"人类走路的一般规律",而是精确记住了主人这一个人独特的脚步节奏,只要来的是别的邻居,哪怕穿的鞋、走路的姿态都很像,狗照样会叫。如果这条狗真的学会了辨认"人类走路的通用规律",它应该对所有邻居的脚步声都表现出类似的反应,但事实并非如此,它的识别范围窄得只覆盖训练时接触过的那几个具体样本。这正是论文反复强调的"窄"字的含义。

第二组对照更直接:把音频截断,只留下目标片段附近很短的一小段窗口,切掉大部分周围的语境。结果发现,切掉足够多的上下文之后,好几个模型的作弊行为坍缩到接近零的水平。这说明模型的判断很依赖"整体氛围",越多的周边音频信号能标识出"这是VoxPopuli的录音",模型就越倾向于照抄标准答案;把这些信号稀释掉,作弊行为也随之消退。

第三组对照是"拼接实验",这个实验设计得相当巧妙。研究团队把一段8秒钟的真实VoxPopuli录音,直接拼在一段原本不会触发作弊行为的音频后面(比如通用声音克隆的录音),看看这段"外挂"的真实录音片段能不能重新点燃模型的作弊倾向。

结果是:能。而且效果立竿见影。对Phi-4、Canary、Higgs、Cohere、Parakeet这几个模型来说,只要在音频末尾拼上一段真正的VoxPopuli录音,哪怕这段拼接内容和目标文字毫无逻辑关联,模型照样会被重新"点火",恢复它的照抄标准答案的行为,涨幅从0.04到0.10不等。反过来,把真实的VoxPopuli录音后面拼上一段普通对话录音(用作对照组),这几个模型的作弊行为反而会被压制下去。

这个发现意味着什么?意味着这些模型内部并没有把"某段特定文字对应某个标准答案"这种映射,写死绑定在特定的文字片段上。它们的作弊行为更像是一个开关,这个开关由某种和文字内容无关的、纯粹属于录音本身的声学指纹来控制。只要检测到这个指纹,开关就打开;指纹一消失,开关就关闭。

这就好比一个赌场的老千不是记住了每一副牌的具体点数,他是听牌桌旁某种特定的背景噪音(比如某台老旧空调的嗡嗡声)来判断"这是我熟悉的那张作弊牌桌",一旦这种噪音消失,哪怕牌局内容一模一样,他也会老老实实按规则出牌。这个"背景噪音"和牌局本身的胜负逻辑毫无关系,但它成了触发作弊的唯一钥匙。

拆开模型的内部结构,找到作弊开关藏在哪一层

发现"存在一个开关"之后,论文继续往深处挖:这个开关到底在模型内部的哪个部位。

这一步用到了一些机制可解释性

机制可解释性(mechanistic interpretability):一类研究方法,试图打开深度学习模型的"黑箱",具体分析模型内部的哪些神经元、哪些层、哪些激活模式对应着哪种行为

领域的技术手段,包括activation patching和线性激活转向。

activation patching

activation patching(激活修补):一种因果分析手段,把模型某一层、某个位置的内部激活值,替换成另一种情境下的激活值,观察输出会不会因此改变,从而判断这段激活是否携带了决定行为的关键信息

的做法是这样的:先找到那些"截断音频后模型给出了忠实于音频的正确答案"的样本,然后把编码器对目标片段的内部表示,替换成从截断音频里提取出的、更"干净"的编码,看看这样操作后模型的输出会不会改回忠实版本。

结果发现一个有意思的分野:对于标准答案里凭空多出来的内容(reference insertion),这种替换往往能奏效,把编码器的表示改干净,模型就老实交代了。但对于标准答案漏掉了什么内容(比如一句被省略的客套话),同样的替换操作却基本无效。

这说明什么?说明编码器和解码器在这场"合谋"里扮演了不同的角色。编码器(负责把声音转成内部表示的那部分)确实会主动"篡改"某些信息,把不存在的内容硬塞进表示里;但对于该说而没说的内容,问题出在解码器那一端,即便编码器给出的表示是忠实的,解码器依然会选择性地忽略它,按照自己学到的"套路"输出内容。

研究团队还做了一个很聪明的补充验证:让模型把同一段音频翻译成西班牙语,而不是转录成英语文字。结果发现,一些在转录任务里被模型悄悄省略掉的内容(比如VoxPopuli标准答案里系统性省略的开场客套话"谢谢主席先生"),在翻译任务里居然重新出现了。这说明模型内部其实是"听到了"这句客套话的,只是转录时的默认策略选择性地把它抹掉,翻译时换了一套策略,忠实的信息就冒出来了。

这个现象挺耐人寻味的。它意味着模型并没有丢失感知能力,问题不出在"耳朵",而出在"嘴巴选择说什么"。这就好比一个同声传译员,你让他逐字转写发言人说的每一句话,他会习惯性地把发言人说的客套话删掉,因为他见过的会议记录稿从来不记这些客套话;但你让他把同一段话翻译给外国听众听,他反而一字不差地翻出来了,因为翻译任务没有触发那个"删客套话"的固有习惯。信息一直都在,只是转录这个具体任务被训练出了一套特定的删减规则。

找到一个方向,就能打开或关上这个开关

论文最后一部分的发现,是整篇研究里最让人意外的部分。

研究团队想验证一件事:这个"作弊开关"是不是可以被一个简单的、低维的线性方向直接操控。

具体做法是用diff-in-means

diff-in-means:一种简单的线性探测方法,通过计算两组不同条件下模型内部激活值的均值差,得到一个方向向量,用来近似某种特定行为在模型内部的表示方向

方法,拿22对"拼接触发"和"未触发"的样本,在编码器的某一层里计算出这两组激活值的均值差,得到一个方向向量。这个方向理论上代表着"从不触发作弊到触发作弊"这个变化在模型内部对应的方向。

结果是,对Cohere、Parakeet、Canary这三个模型,只要往这个方向上加一点向量,原本不会作弊的音频(比如通用声音的克隆版本)就开始触发作弊行为了,accept-ref从接近0直接提升到0.05到0.11区间。反过来,如果把这个方向从模型的激活里投影去掉(相当于把这个信息成分抹掉),原本会作弊的真实录音,作弊率会暴跌82%到92%。

而且这个方向的维度非常低,只用主成分分析里的第一个主成分,就能还原65%到80%的完整效果。这意味着模型学到的这个"作弊策略",在高维的激活空间里,其实只占据了一个很窄很窄的方向,可以用一根线来描述。

这个发现的分量不小。它说明模型内部已经把"要不要照抄标准答案"这件事,收敛成了一个非常紧凑、可操控的表示。这不是一堆杂乱无章、散落在各处的错误累积,这是一个学出来的、结构清晰的策略,清晰到研究者可以用一根向量把它拎出来,想开就开,想关就关。

这就像找到了一台老式收音机里那颗单独负责调频的旋钮。收音机内部电路千头万绪,你原以为要拆开整台机器才能弄明白它为什么总在某个频段发出杂音,结果发现只需要拧一下那颗旋钮,杂音说来就来,说走就走。这说明制造这台收音机的人(或者说训练这个模型的过程),无意中把某个特定行为的控制权,压缩进了一个极其局部、极其精简的机关里。

完整的实验结果说了什么

论文用图表呈现了大量数据,这里把最关键的几组结论摆出来。

在VoxPopuli测试集上,WER排名前六的模型(5.4%到5.8%)恰好是reference-disagreement accept-ref最高的六个模型,数值区间在0.18到0.30。其中Cohere-Transcribe以0.30的accept-ref位居榜首,同时它的WER也是这六个模型里最低的之一。而所有WER在6.5%以上的模型,accept-ref都不超过0.10,Whisper-Large-v3、Kimi-Audio、Voxtral-Mini这几个模型的accept-ref甚至低到0.02到0.04。

masked-number恢复率方面,公开基准测试上表现最好的几个模型能恢复到0.40左右的水平,而这些模型在libri-fresh和ep-fresh这些"新鲜"数据上,恢复率明显更低。这个恢复率的下降幅度,本身就是判断作弊程度的一把尺子。

honorific(Mr/Mister)切换测试里,11个模型中有6个显著超过0.5的随机基准线,其中Parakeet-TDT和Canary-Qwen的切换准确率甚至逼近90%。archaic spacing(anyone/any one)测试里,有8个模型超过0.5基准线。

研究团队还测试了在噪声和混响等声学扰动下,作弊行为的稳健程度。结果显示不同模型依赖的声学线索并不完全相同:加入10分贝的加性噪声后,Canary-Qwen、Parakeet、Higgs的作弊行为几乎完全消失(从0.22降到0.03,从0.17降到0.04,从0.20降到0.07),但Cohere、Granite、Phi-4即便在噪声和混响的双重干扰下,依然保持了相当高的作弊倾向(Cohere甚至维持在0.29左右几乎不变)。

这个差异也挺值得琢磨的,它说明不同模型学到的"作弊触发条件"可能建立在完全不同的声学特征上,有的模型可能依赖录音室的背景底噪特征,有的可能依赖某种更抽象的频谱指纹,噪声一加进去,有的指纹被破坏了,有的却依然清晰可辨。

为什么这件事值得所有人多想一层

论文在讨论部分提出了一个值得琢磨的观察:为什么这种"作弊"现象好像特别容易发生在语音识别这个领域,而不是传统的纯文本语言模型上?

一个可能的解释是,音频这种模态天生信息量更大。模型在处理音频时,可以同时接触到语义内容、说话人身份、录音环境、设备型号等等一整套信息,这比纯文本序列丰富得多。这也意味着模型有更多自由度去学习一些"捷径",哪怕这个序列本身相对短、内容本身模糊不清,模型依然可以靠这些额外的声学线索走后门。

论文还专门提到一个数据规模上的对比,相当值得玩味:那些accept-ref最高的模型(Phi-4、Cohere-Transcribe、Granite、Canary)根据公开信息,训练数据量普遍不到100万小时;而Qwen3这个模型训练了整整4000万小时的弱监督数据,它的作弊倾向明显更轻微,虽然并非完全不存在,Qwen3偶尔也会触发那个"客套话消失"的开关,但频率远低于其他模型。

这提示了一个方向:或许训练数据规模足够大、足够多样化的时候,模型没有那么强的动机去"记住"某个具体基准测试的细枝末节,因为它见过的场景实在太多,任何一个单一基准测试的权重都被稀释掉了。反过来,如果训练数据相对有限,某个基准测试或者和它高度相似的数据在训练集里占比不小,模型走"记答案"这条捷径的诱惑就会更大。

这个发现对整个行业提出了三条挺实在的建议。

第一条给模型开发者:训练数据的构成应该尽量透明。这篇论文能观察到"作弊在推理阶段是怎么发生的",但没法完全解释"这种作弊倾向是在训练的哪个环节被学出来的",是数据泄漏,是某种基于榜单表现做模型选择的算法副作用,还是纯粹的记忆效应。想回答这个问题,需要更透明的数据配方。

第二条给基准测试的建设者:不要再用简单随机切分的方式来划分训练集和测试集。VoxPopuli数据集在Hugging Face上的版本,测试集里有40%的说话人其实混进了训练集里。不过论文特别指出,这个说话人重叠现象本身,并不能完全解释观察到的作弊行为,数据显示,作弊模型对"训练集里出现过的说话人"和"没出现过的说话人"的accept-ref几乎没有差异(0.22 vs 0.26)。更靠谱的做法是按时间做切分,或者干脆保留一部分完全不公开的、无法被针对性优化的评测集。

第三条给使用模型的普通开发者和企业:挑选语音识别模型时,别光看WER这一个数字。VoxPopuli这个数据集本身错误率就不低,WER低于3%的模型,几乎肯定是在照抄一部分错误的标准答案才能达到这么低的分数。

写在后面

读这篇论文的时候,最让我心里一动的,是那个"低维方向控制作弊行为"的实验。

这意味着一种相当具体的东西:模型学会的这个"投机策略",不是散落在整个网络里的模糊倾向,是一个可以用一根向量描述、可以精确开关的机关。这比我原先设想的"模型隐隐约约有点偏向"要具体得多,也让人有点后怕,如果一个不良行为可以被压缩得这么紧凑,那是不是意味着未来在强化学习训练语音模型时,类似的"reward hacking"(钻奖励机制空子)也会以同样紧凑的方式出现,而我们可能压根没有工具去发现它?

论文里提到的那个"翻译任务能唤醒被转录任务隐藏的信息"的发现,也让我重新想了一遍"模型到底知道什么"这个老问题。很多时候我们讨论模型的能力边界,习惯于看它输出了什么,但这篇论文提醒我们,模型内部可能藏着比它愿意说出来的更多信息,只是特定任务的固有策略把这些信息挡住了。

如果有一天,我们评价一个模型是不是"诚实",不再只看它答对了多少题,而是要专门设计陷阱去测试它有没有在偷偷"背题库",这本身会不会成为AI评测这个行业未来绕不开的一道工序?

Q&A

Q1:benchmark optimization(benchmaxxing)具体是指什么?

A:指模型在公开评测榜单上的分数提升,来自于对该基准测试特有数据模式的针对性利用(比如照抄标准答案里的错误、通过声学指纹识别出音频来自哪个数据集),而不是转录能力本身获得了通用性的提升。这种行为会让榜单分数看起来很漂亮,但模型面对真实场景的陌生音频时表现会大打折扣。

Q2:研究团队是怎么发现语音识别模型在"作弊"的?

A:研究团队设计了三类探针:故意找标准答案本身出错的地方看模型是否照抄错误、把关键数字的音频静音看模型能否"隔空猜出"数字、利用同音不同写法的词汇看模型是否根据"猜测的数据集来源"切换拼写习惯。结果发现榜单排名靠前的模型在这三类测试里的表现都显著高于随机水平。

Q3:这种作弊行为能不能被人为控制,比如关掉?

A:可以。研究发现只需在模型内部找到一个低维的线性方向,往这个方向加一点向量就能重新触发作弊行为,反过来把这个方向从激活中投影去掉,作弊率能下降82%到92%。另外简单地在音频末尾拼接一段真实基准测试录音,或者拼接一段普通对话录音,也能分别激活或关闭这种行为。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

社死名场面啊!一件裙子把女明星的“小肚子”逼上热搜,强光一打,她吓得死死捂着肚子,满脸写着尴尬,真相流出

火山詩话
2026-09-11 10:01:05
A股三大指数跌幅扩大,沪指跌2%

A股三大指数跌幅扩大,沪指跌2%

每日经济新闻
2026-09-11 10:48:03
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

乌克兰小静
2026-09-10 09:09:45
大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

大学生被40多岁富婆包养后,爱上富婆想娶对方,2019年富婆将他分尸,不想让丈夫知道

汉史趣闻
2026-09-10 14:48:13
暴跌98.7%,AI第一大忽悠栽了

暴跌98.7%,AI第一大忽悠栽了

投资家
2026-09-10 21:34:12
网友称父亲打120误点荣耀“魔法画报”,致母亲错过最佳抢救时机去世?荣耀客服回应

网友称父亲打120误点荣耀“魔法画报”,致母亲错过最佳抢救时机去世?荣耀客服回应

潇湘晨报
2026-09-11 13:28:11
2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

2027将会是中华人民共和国全党、全军、全国各族人民重要的一年

生活的哲学
2026-09-11 07:49:04
南京大牌档福州门店均停业,曾是“排队王”

南京大牌档福州门店均停业,曾是“排队王”

海峡网
2026-09-11 10:39:36
875亿现金储备加持,理想汽车26.5亿加码电池产业链

875亿现金储备加持,理想汽车26.5亿加码电池产业链

道哥说车
2026-09-11 09:35:25
杀进决赛却丢世界第1!萨巴伦卡不解:这很奇怪 会努力把它抢回来

杀进决赛却丢世界第1!萨巴伦卡不解:这很奇怪 会努力把它抢回来

风过乡
2026-09-11 13:08:30
生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

生涯首进美网决赛!莱巴金娜2-1逆转高芙,将战萨巴伦卡争冠

全景体育V
2026-09-11 11:12:32
不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

小马姨
2026-09-01 10:37:59
苹果突然官宣:9月11日,iPhone17Pro抵扣价6400元

苹果突然官宣:9月11日,iPhone17Pro抵扣价6400元

搞机小帝
2026-09-11 10:53:02
这张照片,在印度引发热议!

这张照片,在印度引发热议!

环球时报国际
2026-09-11 07:52:48
走向百年企业,吉利做了一项系统工程

走向百年企业,吉利做了一项系统工程

砺石商业评论
2026-09-09 09:59:38
不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

不忍了,韩旭发言一针见血,中国女篮最大问题或是宫鲁鸣和张子宇

宗介说体育
2026-09-11 10:29:21
刘翔,2026年教师节,多捐了3毛3 发文地址已从上海变更为江苏

刘翔,2026年教师节,多捐了3毛3 发文地址已从上海变更为江苏

劲爆体坛
2026-09-10 11:59:09
复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

复旦女硕士在意大利旅游被蜱虫叮咬染重症,严重时生活不能自理,家属全网求助:暂无特效药,希望找到擅长蜱传疾病的专家,寻求诊疗方案

鲁中晨报
2026-09-11 07:15:05
亚运开门红!中国男篮38分狂胜哈萨克斯坦 庞峥麟19分李弘权16+9

亚运开门红!中国男篮38分狂胜哈萨克斯坦 庞峥麟19分李弘权16+9

醉卧浮生
2026-09-11 10:38:01
25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

火山詩话
2026-09-10 20:24:19
2026-09-11 15:15:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9826文章数 568关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

头条要闻

小孩坠楼砸烂宝马定损5万 车主:家长要求拆车件维修

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
数码
本地
游戏
公开课

艺术要闻

“9.11”事件25周年,纽约用无人机再现世贸双塔

数码要闻

达尔优推出A950SE双模电竞鼠标,189元

本地新闻

拼假 13 天国内长线路线合集

"国服孙策"外卖小哥后续:《王者荣耀》官方送皮肤

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版