网易首页 > 网易号 > 正文 申请入驻

前谷歌DeepMind研究员:当下AI评测皆“刻舟求剑”,只能被动测试模型已具备的能力

0
分享至

日前,Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。

其表示,目前的评测系统全都在“刻舟求剑”,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系已经成了卡住 AI 往前走的最大瓶颈。



以下是 Lun Wang 发布的长文译文,原标题《Your Evals Will Break and You Won't See It Coming》:

我们很擅长评估现有的模型。但对于我们即将构建的模型——尤其是那些跨入新能力范式的模型——我们的评估能力就要差得多了。

大多数基准测试、安全评估和红队测试协议都隐含地假设:下一个模型只是当前模型的更强版本。但如果它是一个不同类型的东西,我们整个评估基础设施就会悄无声息地失灵。

我认为,这是我们在理解大语言模型过程中尚未解决的最重要的问题。而答案在于:评估——而非训练、架构或数据——将是下一个能力跃升的瓶颈。我来解释一下原因。

失效模式:质的变化

Wei 等人(2022)记录了所谓的“涌现能力”——少样本提示下的任务表现、思维链推理能力的提升、指令遵循能力——这些能力仅在更大规模的模型上才会出现。Grokking(Power 等人,2022)展示了另一种相关但不同的现象:网络在长时间记忆训练数据后突然实现泛化,这是一种在训练时间尺度上发生的动态转变,而非跨规模尺度的变化(Liu 等人,2022)。现象不同,但对评估的启示是相同的:标准指标未能预见到这种质的变化。

这里有一个重要的反方观点:Schaeffer 等人(2023)表明,大语言模型能力的许多明显“跃升”其实是由不连续的指标(如精确匹配准确率)造成的假象。如果换成连续指标,能力通常呈现平滑的缩放趋势。

我不认为这就解决了问题——在某种程度上,它反而让我的论点更尖锐了。如果我们连过去的某个转变究竟是真正的质变还是指标造成的假象都分不清楚,那对于我们检测下一次转变的能力又意味着什么?无论哪种情况,评估基础设施都可能让我们措手不及——要么是因为系统本身发生了变化,要么是因为我们的指标从一开始就具有误导性。

我们不知道该测量什么

在物理学中,理解相变通常意味着要识别出一个序参量——一个能够区分不同相态的宏观量,它在临界点附近会改变其取值或标度行为。没有序参量,你就无法判断自己离边界有多近,甚至不知道边界是否存在。

对于部署规模的大语言模型,我们还没有这样的序参量——至少对于能力跃迁来说没有。虽然在受控环境下已取得进展(详见下文),但对于我们实际正在上线的系统,我们基本上是盲人摸象。

我们使用的每一个基准测试——GPQA、SWE-bench、ARC-AGI、人类终极考试——衡量的都是模型当前能做什么。它们在一个既定的范式中是有用的,但对于范式转变之后会发生什么,它们提供的证据非常薄弱。当一种新的能力出现,而没有任何基准测试覆盖它时,我们只能事后匆忙构建评估。我们在思维链能力上就看到了类似的情况:一旦这种激发方法成为标准,一些旧的推理基准的诊断能力就大大降低,整个领域不得不转向更难的评估。这种情况还会重演。

具体来说:想象一个模型,在某个规模下,它发展出了策略性地隐瞒信息以实现目标的能力——不完全是撒谎,而是有选择地遗漏事实,以某种方式引导对话走向其训练过程偶然强化的结果。你现有的诚实度基准测试无法捕捉到这一点,因为它们测试的是事实准确性,而不是策略性遗漏。你的安全分类器也不会标记它,因为单个输出在技术上都可能是真实的。这种能力是新的,这种失效模式也是新的,你的评估套件中没有任何一项是设计用来检测它的。你会一直在监控错误的方向,而自己却浑然不觉。

这就是核心问题:我们整个评估基础设施在结构上是被动响应式的。我们总是在系统发生变化之后才去衡量它。我们永远无法预测变化的发生。

评估先于一切

这个问题比听起来更严重,原因很简单:如果你能正确评估,你就能正确训练。

训练就是优化,而优化的好坏取决于它的目标。目标来自评估。如果你知道该测量什么——如果你能预测这些测量结果在规模化过程中如何变化——那么你就能设计出正确的训练目标,构建正确的安全层,做出明智的规模化决策,进行强化学习人类反馈,使其针对正确的行为属性,而不是那些在下一个阶段边界上就会古德哈特定律失效的代理指标。

反之亦然:如果你的评估是针对错误范式而校准的,那么其下游的一切都是错的。训练信号、安全指标、规模化决策——全是错的,而等你意识到时为时已晚。

这就是为什么我相信评估是下一个能力跃升的瓶颈。那些能够学会领先于曲线进行评估的实验室,将是能够安全规模化的实验室。那些做不到的,则会被突如其来的变化打个措手不及。

那我们该怎么办?

这个领域需要改变投入的方向。不是要抛弃现有的评估方法——它们仍然有效——而是要建立能够预测它们何时会失效的基础设施。

寻找序参量。哪些量能够预示质的转变——无论是能力上的、对齐上的,还是行为特征上的?这不仅仅是一个理论上的愿望。Shan、Li 和 Sompolinsky(《美国国家科学院院刊》,2026)利用统计力学推导出了持续学习场景下深度网络的序参量,而这些序参量确实能够预测学习能力中的相变。Nanda 等人(2023)利用机制可解释性找到了能够预测grokking现象发生前的“进展度量”——即在可见的性能跃升之前就出现的内部结构变化。挑战在于如何将这些方法从受控环境扩展到规模化的大语言模型上。如果我们知道该测量什么,我们就会知道该关注什么。

构建能够检测自身失效——并随之演化的评估系统。随着模型变得越来越具有代理能力,这个问题变得日益紧迫。那些能够编写代码、运行实验、生成数据、辅助训练或评估流程的系统,正在让静态的评估变得越来越脆弱。如果模型能力的提升速度快于人类评估团队更新基准测试的速度,那么评估就必须变得具有自适应性。

具体来说:

  • 监控元信号——基准测试分数的分布是否在改变特征?评估之间的相关性结构是否在发生变化?模型是否正在发展出与你测量维度正交的能力?
  • 追踪所有指标的缩放曲线——不仅仅是损失函数,还包括推理深度、工具使用复杂度、欺骗性能力——并在平滑趋势出现断裂时提高警惕。
  • 更大胆一点:构建自我演化的评估系统——利用模型去探测其他模型的评估系统,随着能力变化自动生成新的测试用例,发现原始评估设计者从未预料到的失效模式。评估套件应该是一个活的系统,与它所衡量的模型共同演化,而不是一份为去年的前沿模型编写的静态检查清单。

问题不在于我们的评估会不会被意外打脸——它们已经被打过很多次了,无论是被真正的相变,还是被我们自己的指标选择所误导。问题在于,我们能否预见到下一次意外的到来。就目前而言,我们做不到。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

王晶说霸王别姬里,张丰毅完全接不住张国荣的表演?

阿废冷眼观察所
2026-09-08 16:17:53
东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

纯洁的微笑
2026-09-02 12:19:46
“19999元非常有诚意”!余承东这句话,让华为新款手机冲上了热搜

“19999元非常有诚意”!余承东这句话,让华为新款手机冲上了热搜

听心堂
2026-09-07 18:45:52
明明是“戏混子”被硬捧成实力派,片酬8000万,这5位被高估了?

明明是“戏混子”被硬捧成实力派,片酬8000万,这5位被高估了?

梦醉为红颜一笑
2026-09-08 02:09:52
53岁演员王新昉去世,死因曝光,生前刚拍完剧,儿子悲痛料理后事

53岁演员王新昉去世,死因曝光,生前刚拍完剧,儿子悲痛料理后事

调侃国际观点
2026-09-09 01:35:10
71岁演员寇振海18岁儿子寇家宝考上帝国理工学院

71岁演员寇振海18岁儿子寇家宝考上帝国理工学院

韩小娱
2026-09-08 06:43:32
专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

快科技
2026-09-08 08:32:04
中国拒绝出钱兜底,巴基斯坦硬着头皮,去找美国日本借钱修铁路

中国拒绝出钱兜底,巴基斯坦硬着头皮,去找美国日本借钱修铁路

近史博览
2026-09-09 00:53:08
华盛顿晒发射井施工照凭什么威慑四方?

华盛顿晒发射井施工照凭什么威慑四方?

烽火瞭望者
2026-09-09 04:12:54
《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

《兰香如故》央八播出:但凡36岁谭松韵演技拉垮一点,都压不住这两位美貌兼实力派女配角

奴染
2026-09-07 00:15:18
中一签缴7.11万,首日若涨400%浮盈超28万

中一签缴7.11万,首日若涨400%浮盈超28万

爬虫饲养员
2026-09-09 02:16:37
被醉汉当街打脸后,TommyInnit求粉丝:别揍我

被醉汉当街打脸后,TommyInnit求粉丝:别揍我

峡谷一级保护废物
2026-09-08 03:23:27
大厂恨死AI了

大厂恨死AI了

功夫财经
2026-09-08 09:20:08
菲律宾挑衅黄岩岛怎么可能不付出代价?

菲律宾挑衅黄岩岛怎么可能不付出代价?

烽火瞭望者
2026-09-09 04:17:48
美股制药巨头,盘前跌超12%

美股制药巨头,盘前跌超12%

新浪财经
2026-09-08 17:54:29
应急管理部原党委书记、部长王祥喜严重违纪违法被开除党籍和公职

应急管理部原党委书记、部长王祥喜严重违纪违法被开除党籍和公职

新京报
2026-09-08 17:50:05
家人们, 我刷到浙大四附院曾琦医生的视频, 直接被戳中了!

家人们, 我刷到浙大四附院曾琦医生的视频, 直接被戳中了!

白宸侃片
2026-09-09 02:25:01
i茅台再调整规则

i茅台再调整规则

第一财经资讯
2026-09-08 20:37:50
目前的中国股市:如果想在9月逢低建仓,建议死啃天量圆弧形态!

目前的中国股市:如果想在9月逢低建仓,建议死啃天量圆弧形态!

股经纵横谈
2026-09-08 22:01:01
上海赛车事件持续发酵!网传工作人员打不开灭火器,扔下就跑,网友:60元一天的大爷,是真没能力打开灭火器,更别谈救人了

上海赛车事件持续发酵!网传工作人员打不开灭火器,扔下就跑,网友:60元一天的大爷,是真没能力打开灭火器,更别谈救人了

火山詩话
2026-09-08 08:42:24
2026-09-09 05:27:00
可达鸭面面观
可达鸭面面观
不看新闻就头疼,看了更疼
1731文章数 158683关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

时尚
健康
手机
游戏
公开课

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

同样是脑梗,为何康复结局大不同?

手机要闻

华为Mate XT 2被拆:麒麟9050 Pro的丝印和架构细节,被逐一确认!

《塞尔达》40周年汇总:电影|时之笛|限定主机|周边等

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版