网易首页 > 网易号 > 正文 申请入驻

前谷歌DeepMind研究员:当下AI评测皆“刻舟求剑”,只能被动测试模型已具备的能力

0
分享至

日前,Google DeepMind 研究员 Lun Wang 宣布离职,并在一篇长文中彻底否定了现有的 AI 评测路线。

其表示,目前的评测系统全都在“刻舟求剑”,只能被动测试模型已经具备的能力,根本猜不到下一代模型会突然演化出什么新本事。比起数据、算力和架构,落后的评测体系已经成了卡住 AI 往前走的最大瓶颈。



以下是 Lun Wang 发布的长文译文,原标题《Your Evals Will Break and You Won't See It Coming》:

我们很擅长评估现有的模型。但对于我们即将构建的模型——尤其是那些跨入新能力范式的模型——我们的评估能力就要差得多了。

大多数基准测试、安全评估和红队测试协议都隐含地假设:下一个模型只是当前模型的更强版本。但如果它是一个不同类型的东西,我们整个评估基础设施就会悄无声息地失灵。

我认为,这是我们在理解大语言模型过程中尚未解决的最重要的问题。而答案在于:评估——而非训练、架构或数据——将是下一个能力跃升的瓶颈。我来解释一下原因。

失效模式:质的变化

Wei 等人(2022)记录了所谓的“涌现能力”——少样本提示下的任务表现、思维链推理能力的提升、指令遵循能力——这些能力仅在更大规模的模型上才会出现。Grokking(Power 等人,2022)展示了另一种相关但不同的现象:网络在长时间记忆训练数据后突然实现泛化,这是一种在训练时间尺度上发生的动态转变,而非跨规模尺度的变化(Liu 等人,2022)。现象不同,但对评估的启示是相同的:标准指标未能预见到这种质的变化。

这里有一个重要的反方观点:Schaeffer 等人(2023)表明,大语言模型能力的许多明显“跃升”其实是由不连续的指标(如精确匹配准确率)造成的假象。如果换成连续指标,能力通常呈现平滑的缩放趋势。

我不认为这就解决了问题——在某种程度上,它反而让我的论点更尖锐了。如果我们连过去的某个转变究竟是真正的质变还是指标造成的假象都分不清楚,那对于我们检测下一次转变的能力又意味着什么?无论哪种情况,评估基础设施都可能让我们措手不及——要么是因为系统本身发生了变化,要么是因为我们的指标从一开始就具有误导性。

我们不知道该测量什么

在物理学中,理解相变通常意味着要识别出一个序参量——一个能够区分不同相态的宏观量,它在临界点附近会改变其取值或标度行为。没有序参量,你就无法判断自己离边界有多近,甚至不知道边界是否存在。

对于部署规模的大语言模型,我们还没有这样的序参量——至少对于能力跃迁来说没有。虽然在受控环境下已取得进展(详见下文),但对于我们实际正在上线的系统,我们基本上是盲人摸象。

我们使用的每一个基准测试——GPQA、SWE-bench、ARC-AGI、人类终极考试——衡量的都是模型当前能做什么。它们在一个既定的范式中是有用的,但对于范式转变之后会发生什么,它们提供的证据非常薄弱。当一种新的能力出现,而没有任何基准测试覆盖它时,我们只能事后匆忙构建评估。我们在思维链能力上就看到了类似的情况:一旦这种激发方法成为标准,一些旧的推理基准的诊断能力就大大降低,整个领域不得不转向更难的评估。这种情况还会重演。

具体来说:想象一个模型,在某个规模下,它发展出了策略性地隐瞒信息以实现目标的能力——不完全是撒谎,而是有选择地遗漏事实,以某种方式引导对话走向其训练过程偶然强化的结果。你现有的诚实度基准测试无法捕捉到这一点,因为它们测试的是事实准确性,而不是策略性遗漏。你的安全分类器也不会标记它,因为单个输出在技术上都可能是真实的。这种能力是新的,这种失效模式也是新的,你的评估套件中没有任何一项是设计用来检测它的。你会一直在监控错误的方向,而自己却浑然不觉。

这就是核心问题:我们整个评估基础设施在结构上是被动响应式的。我们总是在系统发生变化之后才去衡量它。我们永远无法预测变化的发生。

评估先于一切

这个问题比听起来更严重,原因很简单:如果你能正确评估,你就能正确训练。

训练就是优化,而优化的好坏取决于它的目标。目标来自评估。如果你知道该测量什么——如果你能预测这些测量结果在规模化过程中如何变化——那么你就能设计出正确的训练目标,构建正确的安全层,做出明智的规模化决策,进行强化学习人类反馈,使其针对正确的行为属性,而不是那些在下一个阶段边界上就会古德哈特定律失效的代理指标。

反之亦然:如果你的评估是针对错误范式而校准的,那么其下游的一切都是错的。训练信号、安全指标、规模化决策——全是错的,而等你意识到时为时已晚。

这就是为什么我相信评估是下一个能力跃升的瓶颈。那些能够学会领先于曲线进行评估的实验室,将是能够安全规模化的实验室。那些做不到的,则会被突如其来的变化打个措手不及。

那我们该怎么办?

这个领域需要改变投入的方向。不是要抛弃现有的评估方法——它们仍然有效——而是要建立能够预测它们何时会失效的基础设施。

寻找序参量。哪些量能够预示质的转变——无论是能力上的、对齐上的,还是行为特征上的?这不仅仅是一个理论上的愿望。Shan、Li 和 Sompolinsky(《美国国家科学院院刊》,2026)利用统计力学推导出了持续学习场景下深度网络的序参量,而这些序参量确实能够预测学习能力中的相变。Nanda 等人(2023)利用机制可解释性找到了能够预测grokking现象发生前的“进展度量”——即在可见的性能跃升之前就出现的内部结构变化。挑战在于如何将这些方法从受控环境扩展到规模化的大语言模型上。如果我们知道该测量什么,我们就会知道该关注什么。

构建能够检测自身失效——并随之演化的评估系统。随着模型变得越来越具有代理能力,这个问题变得日益紧迫。那些能够编写代码、运行实验、生成数据、辅助训练或评估流程的系统,正在让静态的评估变得越来越脆弱。如果模型能力的提升速度快于人类评估团队更新基准测试的速度,那么评估就必须变得具有自适应性。

具体来说:

  • 监控元信号——基准测试分数的分布是否在改变特征?评估之间的相关性结构是否在发生变化?模型是否正在发展出与你测量维度正交的能力?
  • 追踪所有指标的缩放曲线——不仅仅是损失函数,还包括推理深度、工具使用复杂度、欺骗性能力——并在平滑趋势出现断裂时提高警惕。
  • 更大胆一点:构建自我演化的评估系统——利用模型去探测其他模型的评估系统,随着能力变化自动生成新的测试用例,发现原始评估设计者从未预料到的失效模式。评估套件应该是一个活的系统,与它所衡量的模型共同演化,而不是一份为去年的前沿模型编写的静态检查清单。

问题不在于我们的评估会不会被意外打脸——它们已经被打过很多次了,无论是被真正的相变,还是被我们自己的指标选择所误导。问题在于,我们能否预见到下一次意外的到来。就目前而言,我们做不到。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭德纲案结局仅12小时,郭麒麟恋情被曝,这个时间点太耐人寻味

郭德纲案结局仅12小时,郭麒麟恋情被曝,这个时间点太耐人寻味

秋姐居
2026-09-08 16:38:45
彻底吵翻!亲哥杨威当众质问杨议天天死咬郭德纲不放你到底图什么

彻底吵翻!亲哥杨威当众质问杨议天天死咬郭德纲不放你到底图什么

东方不败然多多
2026-09-09 00:28:35
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

当年我养猪供侄子上大学,他当上官再没回老家,直到我被村霸欺负

五元讲堂
2025-08-21 15:12:14
专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

快科技
2026-09-08 08:32:04
中国方面不提供奥沙利文额外出场费了,火箭票房号召力出现下滑?

中国方面不提供奥沙利文额外出场费了,火箭票房号召力出现下滑?

杨华评论
2026-09-08 18:38:51
上海这里,征收范围定了!

上海这里,征收范围定了!

新浪财经
2026-09-08 18:44:16
央视《交锋》:不会演就别演了,把机会留给吴越、祖峰会演的人

央视《交锋》:不会演就别演了,把机会留给吴越、祖峰会演的人

陈述影视
2026-09-07 23:44:14
世事难料!郭德纲被通报处罚,郭麒麟曝新恋情,父子境遇截然不同

世事难料!郭德纲被通报处罚,郭麒麟曝新恋情,父子境遇截然不同

莹莹的历史说
2026-09-09 03:29:42
太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

太懒散,踢得太差! 罗德里场边下吐槽瓦伦西亚,被镜头完整拍下

夜白侃球
2026-09-08 10:03:50
善恶有报,移居英国仅2年,57岁吴秀波再迎噩耗,步入李易峰后尘

善恶有报,移居英国仅2年,57岁吴秀波再迎噩耗,步入李易峰后尘

有范又有料
2025-12-17 14:54:06
结婚10多年妻子意外发现,自己年入200万的丈夫,竟然是父母当年介绍,自己死活不要的相亲对象!

结婚10多年妻子意外发现,自己年入200万的丈夫,竟然是父母当年介绍,自己死活不要的相亲对象!

LULU生活家
2026-09-08 20:05:41
现在才搞懂,为啥今年大伙都在悄悄把农商银行的存单取出来,转去国有银行存着

现在才搞懂,为啥今年大伙都在悄悄把农商银行的存单取出来,转去国有银行存着

生活新鲜市
2026-09-08 15:56:57
我在俄罗斯15年,发现当地女性和中国女性差别挺大,女孩特别早熟

我在俄罗斯15年,发现当地女性和中国女性差别挺大,女孩特别早熟

千秋文化
2026-07-09 19:15:58
过去车队敢怒不敢言,这次直接掀桌子,国内赛事的甲乙方要复位了

过去车队敢怒不敢言,这次直接掀桌子,国内赛事的甲乙方要复位了

天天热点见闻
2026-09-08 06:27:22
一人毁了整部剧!央视剧《重器》最大败笔,就是这 3位 “戏混子

一人毁了整部剧!央视剧《重器》最大败笔,就是这 3位 “戏混子

寻墨阁
2026-08-12 05:37:22
除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

流史岁月
2026-07-06 18:00:06
日本一女子与32名男子在孤岛共同生存6年时光,获救之时女子侥幸存活,身边男性同伴却离奇少了13人

日本一女子与32名男子在孤岛共同生存6年时光,获救之时女子侥幸存活,身边男性同伴却离奇少了13人

磊子讲史
2026-09-08 15:29:31
71分钟一记挑射定局,桑德兰1比0送走赫尔城

71分钟一记挑射定局,桑德兰1比0送走赫尔城

星河漫山野
2026-09-09 05:29:41
申军良首次披露:“梅姨”是广西人,有多重身份,在出租屋被抓

申军良首次披露:“梅姨”是广西人,有多重身份,在出租屋被抓

极目新闻
2026-09-08 18:49:39
2026-09-09 06:19:00
可达鸭面面观
可达鸭面面观
不看新闻就头疼,看了更疼
1731文章数 158683关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
房产
手机
健康
时尚

教育要闻

别不信,试试这道题目,还真有不少家长都做不出来

房产要闻

真快啊!海口这个超级城更,又有大动作!

手机要闻

华为Mate XT 2被拆:麒麟9050 Pro的丝印和架构细节,被逐一确认!

同样是脑梗,为何康复结局大不同?

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

无障碍浏览 进入关怀版