网易首页 > 网易号 > 正文 申请入驻

EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?

0
分享至



当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论:它不会做这道题

但这个结论真的可靠吗?

想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。

北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题:

当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来?

这项研究提出了一个专用于大模型的诊断视角:模型很可能已经在隐藏状态(Hidden States)中编码了正确答案,却在将其转换为最终候选分数的过程中,被输出层的系统性偏差给 “掩盖” 了。作者将这一现象命名为“读出瓶颈”(Readout Bottleneck),并设计了一套分阶段的诊断方法来验证 “答错” 究竟是能力缺失,还是表达失真。

该工作已被自然语言处理顶级会议EMNLP 2026 主会接收(录取率 15.4%)



  • 论文题目: Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
  • 作者: Qiyao Yan、Chenpeng Wang、Liangming Pan
  • 合作单位: 北京大学、易鑫(YIXIN)YiXin-AILab
  • Arxiv 链接:https://arxiv.org/abs/2608.31068

1. 一个常被忽视的混淆:答错,真的等于不会吗?

在目前的逻辑推理评测(多选题或固定选项)中,标准流程非常统一:1)输入题干 ,2)计算每个候选答案的 Logit 分数,3)取最高分项 ,4)统计准确率。大家习惯性地将最终得分低,等同于 “模型缺乏该项推理能力”。

但作者团队指出,这里存在一个被长期混淆的因果断裂:模型最终输出错误,究竟是因为内部根本没推导出来,还是推导出来了,却在最后一步的输出映射中被 “读坏了”?



图 1:论文的三步诊断链。关键问题不是 “模型最后选了什么”,而是 “正确答案的信息在哪一步丢失了”。

为了把这两者彻底拆开,作者在不同难度梯度的测试集上(包括基础同分布的id、考查更长推理链的depth、以及替换了词汇表达的困难切片lexical-OOD),对模型推理过程中的不同 “读出” 节点进行了对比:

  • 隐藏状态早已 “知道” 答案:不管是在提示词刚结束时(Prompt-end probe),还是在紧接着 Answer: 标记之后的节点(Answer-slot probe),线性探针都能以极高的准确率解码出正确答案。以 Qwen3.5-9B 在最难的 lexical 切分为例,此时探针准确率高达 0.830。
  • 两段式的 “表达坍塌”:然而,当这股正确的逻辑信息流经模型固有的词表矩阵(Same-position label logits)时,信号开始大幅衰减至 0.574。更致命的是,哪怕模型在预测第一个词元时(First-label-token score)还勉强保留了一丝优势,一旦将整个候选短语的对数概率进行累加(Full string score),误差就会被无限放大,准确率瞬间跌至 0.333—— 彻底沦为三分类的完全盲猜。

在 Qwen3.5 系列模型 的受控逻辑测试(Lexical-OOD)上,对比结果如下:



表1:Qwen3.5 模型不同“读出”方式的准确率对比。

当在模型输出答案标签前接入线性探针(Linear Probe)时,探针能以极高的准确率(如 Qwen3.5-9B 在 lexical-OOD 切分上达 0.830)解码出正确答案。然而,当这股信息流经词表投影,聚合成最终候选序列分数时,准确率却断崖式下跌至 0.333(等同于三分类的随机盲猜)。模型并非逻辑推导失败,而是被输出层的系统性结构偏置(如偏好 “unknown” 等安全标签)掩盖了真实判断。

更夸张的是,在原生序列打分下,Qwen3.5-9B 在 1,000 道测试题中竟有999 道被判为了同一个标签(unknown)。这显然不是每道题都在逻辑上遭遇了独立失败,而是输出层存在一个极强的全局偏好,把样本之间的实例级逻辑差异硬生生碾平了。

甚至在未经任何指令微调的原始底座模型(Base Model)上,这一现象依然稳固存在(Qwen3.5-9B-Base 探针 87.3%,序列打分仅 36.1%)。

核心结论:模型的推理信号并未在深层消失,但从内部隐变量走向原生词表与序列累加的过程中,存在一个严重的读出瓶颈(Readout Bottleneck)。

2. 极简修正:只动 2 个参数,唤醒被 “封印” 的推理能力

如果原生序列分数真的只是一层被 “全局偏置” 扭曲的信号,那它内部是否还残留着针对具体题目的相对排序?

论文提出了一个判定逻辑:将候选分数的生成过程解构为两部分:









在三分类任务中,固定一个基准项后,自由参数仅仅剩下 2 个。这两个参数完全在无标签的上下文分数上,通过网格搜索使其预测分布贴合类别先验(如均匀分布)完成拟合,随后直接在独立的 Held-out 测试集上冻结评测。

这种干预的能力上限被死死限制住:

  • 它只有 2 个参数,绝不可能学会复杂的 “输入 - 推理 - 输出” 任务映射;
  • 它是全局常数平移,不可能改变同一个类别内部不同样本的相对好坏。

如果这区区两个参数能在测试集上救回大量错题,唯一的解释就是:模型给出的原始分数差值里,本来就保留着正确的相对排序证据。



图 2:灰条为原生序列准确率(虚线为 1/3 随机线),蓝条为两参数无标签先验修正后成绩;下方绿条展示逐样本净拯救数(校准单独答对数减去原生单独答对数)。

实验在四大推理任务上展现出惊人的一致性:

  • Synthetic 逻辑任务:Qwen3.5-4B 与 9B 的准确率从 33.3% 盲猜直接拉升至 57.0% 和 60.2%,净挽救错题超过 230 道;
  • ProofWriter 自然语言演绎:模型从完全坍塌的 33.3% 暴涨至 65.3% 和 67.8%,单任务挽救了超过 320 道原本判错的题;
  • FOLIO 与 ANLI 进阶推理:即使面对高度复杂的一阶逻辑与对抗性 NLI,修正依然带来了 9 到 29 个百分点的稳健恢复。



更关键的是样本效率(Sample Efficiency):因为拟合的只是极低维的偏置,在 30 次随机子采样中,仅需 25 个无标签样本,Qwen3.5 就能找回绝大部分丢失的准确率,继续追加数据至 1,000 个时表现基本饱和。这彻底排除了 “修正是在暗中重新学习任务” 的假说。

3. 严格因果对照:排除 “作弊” 与 “幻觉”

面对 30 多个百分点的回弹,审慎的研究者必然会追问:这会不会只是投机取巧?比如利用了词汇重叠的浅层捷径,或者仅仅是把预测直方图强行拉平带来的运气?

作者在论文中通过两道最严苛的对照控制,封死了所有的替代解释:



图 3:A 组针对词袋分类器(TF-IDF)失效样本的恢复情况,红点标出高出置换零假设的净差距;B 组展示 ProofWriter 随推理深度增加的切片测试。

控制一:专打浅层捷径的 TF-IDF-missed 难例切片

大模型常被质疑是 “聪明汉斯(Clever Hans)”,通过前提与假设之间的表面词汇重叠来投机猜题。 作者用词袋模型(TF-IDF)作为过滤器,将所有仅凭浅层词汇重叠就能做对的样本全部剔除,只留下纯靠词汇线索做不对的硬核难题。 在这些难例切片上,Qwen3.5-4B/9B 的修正后准确率依然稳定维持在62.2%65.1%。这证明找回来的决定是扎扎实实的语义演绎,与表面字面重叠无关。

控制二:保持标签总数的随机置换检验(Count-preserving Permutation Null)



不过该方法仍然存在一些局限,论文明确列出了三类失效的边界场景:



4. 结论:别让最后一个结果 Token,轻易否定模型的全部推理

这项研究为社区审视 Benchmark 评测方式提供了一个新的视角:大模型的 “内部推理能力” 与 “外部表达通路” 从来都不是同一件事。当评测强行将多步逻辑压缩成单个分类词(Token)的生成打分时,静态线性层(Unembedding)的几何错位与序列打分的累加偏差,极易成为掩盖模型真实智能的 “读出瓶颈”。

这也为思维链(Chain-of-Thought)为什么在长逻辑上更有效提供了一个新的机理注解:让模型通过多步 Token 逐步吐出思考,本质上是将单步输出层沉重的读出负担分散到了序列的演化路径中,从而有效绕开了瓶颈扼杀。

在大模型评测榜单日益泛滥、大家对分数分毫必争的今天,这项工作给出了一个更严谨的视角: 当看到模型在一个任务上给出接近盲猜的分数时,不要急着判定它 “不会做”—— 先看一眼它的隐藏状态。也许模型早就在 “草稿纸” 上算对了全部逻辑,只是最后在 “涂答题卡” 时,被输出层的一点偏置带偏了而已。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国移动董事长陈忠岳最新消息!

中国移动董事长陈忠岳最新消息!

最通信
2026-09-17 20:23:45
美国侥幸逃过一劫,日本成对抗炮灰,外界严重低估中国的博弈手段

美国侥幸逃过一劫,日本成对抗炮灰,外界严重低估中国的博弈手段

无悔的灿烂人生
2026-09-17 16:46:58
周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

周涛与前夫姚科未离婚之前的一张合影照,儒雅的姚科,终究留不住周涛

南万说娱26
2026-08-22 08:56:48
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
颜志煌任福建省交通运输厅党组书记

颜志煌任福建省交通运输厅党组书记

中国经济网
2026-09-18 10:52:07
男博主曝出雷人言论:再过100年油车也不会消失,丰田本田大众销量依然是遥遥领先

男博主曝出雷人言论:再过100年油车也不会消失,丰田本田大众销量依然是遥遥领先

小徐讲八卦
2026-09-16 10:50:23
纪委倒查持续加码!在职、退休一视同仁,这五类红线切莫心存侥幸

纪委倒查持续加码!在职、退休一视同仁,这五类红线切莫心存侥幸

细说职场
2026-09-18 16:56:36
住建部最新定调:房地产市场,彻底转向了!

住建部最新定调:房地产市场,彻底转向了!

广州PLUS
2026-09-18 11:41:59
贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

贫穷能让一个人有多卑微?网友:给05年小富婆妹当过狗,还给130斤小富婆做了俩月男朋友

带你感受人间冷暖
2026-09-15 00:05:19
李弘权赵嘉义火线复出!中日大战三位裁判也确定 中国男篮冲决赛胜算增加

李弘权赵嘉义火线复出!中日大战三位裁判也确定 中国男篮冲决赛胜算增加

颜小白的篮球梦
2026-09-18 12:57:52
伊朗:在霍尔木兹海峡区域击中一艘油轮

伊朗:在霍尔木兹海峡区域击中一艘油轮

参考消息
2026-09-18 16:21:11
李在明道歉

李在明道歉

政知新媒体
2026-09-18 15:54:13
9000mAh+16GB+1TB!新机官宣:9月29日,正式首发!

9000mAh+16GB+1TB!新机官宣:9月29日,正式首发!

科技堡垒
2026-09-18 11:39:31
CCTV5直播,中国男篮VS日本男篮,郭士强立军令状,抗日能否成功

CCTV5直播,中国男篮VS日本男篮,郭士强立军令状,抗日能否成功

体坛小快灵
2026-09-18 08:33:58
顶级医院主任医生被泼粪、一流医学院研究生跳楼:学医还值不值得?

顶级医院主任医生被泼粪、一流医学院研究生跳楼:学医还值不值得?

温柔医刀
2026-09-17 17:37:29
坐高铁遇到一位特别爱干净的阿姨,旁边人本来没在意,看到她这一举动,大家都没忍住多了看两眼

坐高铁遇到一位特别爱干净的阿姨,旁边人本来没在意,看到她这一举动,大家都没忍住多了看两眼

背包旅行
2026-08-30 16:57:10
2年1.1亿!双核正式碰面!塔图姆等来最强小弟

2年1.1亿!双核正式碰面!塔图姆等来最强小弟

篮球实战宝典
2026-09-17 20:43:07
单向前任安徽省委副书记

单向前任安徽省委副书记

上观新闻
2026-09-18 17:46:43
医院老护士含泪揭秘:人临终前的10个残酷真相,很多子女不懂

医院老护士含泪揭秘:人临终前的10个残酷真相,很多子女不懂

蝉吟槐蕊
2026-09-13 18:15:04
苹果新品官宣,9月18日,正式发售

苹果新品官宣,9月18日,正式发售

科技堡垒
2026-09-17 11:07:17
2026-09-18 18:32:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14021文章数 142733关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
本地
艺术
数码
公开课

GameNative让两款R星游戏在安卓设备本地运行!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

15位写实画家,23幅静物作品!

数码要闻

硬核游戏玩家的高性价比解决方案!瀚铠RX 9070 16GB OC超合金显卡测评

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版