网易首页 > 网易号 > 正文 申请入驻

分数竞赛:关于Benchmark基准测试的争论和未来

0
分享至


本文来自微信公众号: 显影笔记 ,作者:MengZhi

在生成式人工智能时代,Benchmark基准测试正在被越来越广泛的群体拆解、讨论。围绕Benchamrk分数的公开与对比,和伴随的争论,在技术历史中不是偶然,无论是数据库、Web技术,还是芯片硬件。

在这篇文章,我想讨论这个长期以来的现象,以及争议将走向何方?

01

Benchmark测量了什么,分数被怎么用?

公布Benchmark分数、与竞品进行分数对比,已经成为每一次模型新版发布时的「标准动作」。回归本源,Benchmark基准测试本身并不是为了发版而存在,它首先是技术产品研发中必要的工程手段。

以AI领域为例,Benchmark旨在评估模型在特定任务的泛化能力,承载了复杂评估范式要求,在预训练阶段、后训练阶段、生产发布前的验证阶段都是重要的评估来源之一。

而到了模型发布的技术传播环节,对外公开的Benchmark测评和分数,某种程度上起到了能力的“翻译”和“背书”,也为新闻报道、公开讨论提供了“事实”。特别是在激烈的竞争环境中,成为了进入讨论场的“入场券”、模型公司留在牌桌的证明。

但是当模型实力在拉近,分数以月为单位被刷新,围绕Benchmark和分数的质疑也随之而来。

02

每一次分数讨论背后,必然会指向的问题

AI竞赛的加速,使Benchmark逐渐成为一种“消耗品”。斯坦福2026年《AI Index报告》卷首语称,当模型之间能力趋同,用于评估他们的工具却难以保证有效,基准测试正趋于饱和,前沿模型披露的信息越来越少,独立测试结果也并不总能印证开发者所报告的情况。

因此催生出一个常被议论问题——新版分数提升、甚至超过竞品,为什么体验不到预期中的大幅度变化?

此外,围绕公开的Benchmark所做的针对性优化等诸多问题,也让分数的信任效力下降。OpenAI在其建立的软件工程能力基准测试SWE-bench Verified上观察到,模型性能提升放缓,过去6个月内准确率仅从74.9%提升到80.9%,宣布将停止报告该基准测试的分数。

这一幕在技术历史中并不陌生,让人不免联想到JavaScript引擎的测试历史——2017年,Chrome浏览器宣布了其一手打造的基准测试套件Octane的退休。相对于Octane出道5年即退休的历史,Open AI对于SWE-bench Verified的使用甚至只有2年。

市场对于Benchmark分数的另一重质疑,则来自于现实场景的复杂性。

尽管Bencharmk数量在激增,从语言理解、数学推理、代码生成,到多模态识别、安全对齐,乃至垂直行业的专项能力。但是每项Benchmark都有自己的局限,无论是数据、测试方式、还是评估与反馈方式层面等,测试结果不等同于现实环境中的能力表现,不一定完美匹配用例。于是引来了使用者群体另一个叠加问题——分数好、排名高,与自己有什么关联?

在我看来,这些讨论本质来自对技术能力的预期,对于应用场景适配的探索,对于分数公信力的思考。在多项技术的历史中,重复上演,也是技术走向成熟、竞争进入白热化的必然。

03

围绕Benchmark分数的自我解构与重塑

Benchmark的分数、特别是排名高低,天生就是“记忆符号”、适合引用的“新闻事实”。分数提供事实、吸引注意力,但「注意力」能留存多久、沉淀成什么样的认知,往往来自于现实。

Anthropic对于今年Sonnet 5发布,在新闻宣传材料中,不再将Sonnet与其它模型进行对比,只是与自家模型和历史版本进行对比,我将其理解为一种有意识的叙事管理——合理,但是讨论并不会因此终止。

Open AI的科学家则从“技术正在如何被应用”的角度,提出倡议。

今年6月,Open AI专注于推理研究的Noam Brown公开表示,现在的Benchmark缺乏对于预算维度的考虑,“当比较GPT-5.5和GPT-5.4在最大算力下的表现时,你得到的是近乎持平的结果。但当把两者对Token消耗量作图时,GPT-5.5在每一个固定预算下都明显更强”。他提出的主张是——Benchmark(基准测试)应当增加一条明确的X轴-Token、金钱、延迟,把模型性能绘制为算力预算的函数。

与之呼应的一个现象,来自Benchmark方法研究一端。在今年机器学习顶会ICML的Position-立场类型论文中,围绕评估和基准的论文达到了20篇,超过1/4占比,成为仅次于安全与对齐的第三大主题。论文主题主要聚焦于基准的可信度、评估的实用价值、验证困境。

在围绕分数竞赛的争议之外,Benchmark还有另一条价值轨道——在模型厂商的研发、企业客户的部署验证环节,它有不可替代的价值。当一系列Benchamark分数从内部指标变成一场公开竞赛,呈现的仅仅是看似"受控"的能力对比,而非真实实力和技术探索的完整表达。

无论是软件、芯片硬件,每一次技术历史上围绕Benchmark讨论和争议,都不会因为开发者和使用群体对表达的放弃而终结,往往需要评测标准迭代、行业规则重建,甚至底层技术范式的迁移。争议的消散,也不是因为市场完整看懂了每一个Benchmark分数,是因为开发者、普通用户、手握重金的技术买家,最终认可了那些原本依赖分数才能“代理表达”的产品能力。

经历过多项技术周期,在构思这篇文章的时候,我回忆起了那些关于“指标与分数”的激烈讨论。我关注那些自我解构的主张、被沉淀下来的声音、被技术衔接住应用事实。

在公众号「显影笔记」,分享现象和叙事之下,那些尚待「显影」的逻辑。

引用观点与事实信源:

Artificial Intelligence Index Report,Message from the Co-chairs

Open AI,Why SWE-bench Verified no longer measures frontier coding capabilities

Noam Brown,Benchmarks are lying to your procurement team

Claude Sonnet 5,www.anthropic.com/news/claude-sonnet-5

Retiring Octane,v8.dev/blog/retiring-octane

封面图:The Horse in Motion,Eadweard Muybridge

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。如对本稿件有异议或投诉,请联系 tougao@huxiu.com。

本文来自虎嗅,原文链接:https://www.huxiu.com/article/4886084.html?f=wyxwapp

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
店员私自给顾客订单加可乐 711门店:因考核压力员工自掏腰包换购

店员私自给顾客订单加可乐 711门店:因考核压力员工自掏腰包换购

快科技
2026-09-07 17:40:06
炖肉20年的老师傅:猪肉只配这3种香料,别再瞎放了

炖肉20年的老师傅:猪肉只配这3种香料,别再瞎放了

阿莱美食汇
2026-09-04 13:34:16
地产首富,落幕!

地产首富,落幕!

新浪财经
2026-09-06 11:30:29
压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

狼叔评论
2026-09-07 16:20:13
人可以后知后觉到什么程度?网友:十年后才听懂了舍友的暗示

人可以后知后觉到什么程度?网友:十年后才听懂了舍友的暗示

夜深爱杂谈
2026-09-06 18:58:02
难以置信!网友扒出来曹小姐初中没完成,14岁就生了一个儿子,如今都18岁了

难以置信!网友扒出来曹小姐初中没完成,14岁就生了一个儿子,如今都18岁了

火山詩话
2026-08-09 06:37:39
奔驰那封回执,把星宇的国内公关干沉默了

奔驰那封回执,把星宇的国内公关干沉默了

娱乐圈的笔娱君
2026-08-31 01:19:35
提级调查!苏州成立专项调查组

提级调查!苏州成立专项调查组

澎湃新闻
2026-09-07 15:57:06
林肯号近800名女兵下船放松,硬扛280天高压部署,她们早绷到极限

林肯号近800名女兵下船放松,硬扛280天高压部署,她们早绷到极限

秋枫凋零
2026-09-07 23:25:46
一手烂牌,却打出王炸

一手烂牌,却打出王炸

最爱历史
2026-09-07 18:58:31
美国的阴谋藏不住了!台海南海只是幌子,真正目标是中国最大王牌

美国的阴谋藏不住了!台海南海只是幌子,真正目标是中国最大王牌

米老鼠的世界
2026-08-25 16:52:11
菲律宾公开宣告,仁爱礁破船改为“永久军事据点”,中方三招破解

菲律宾公开宣告,仁爱礁破船改为“永久军事据点”,中方三招破解

月下守候
2026-09-05 15:01:46
比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

我是一个粉刷匠2
2026-09-07 01:06:52
周星驰为23亿票房大戏宴请旧搭档,饭桌之上,竟无一人举起手机

周星驰为23亿票房大戏宴请旧搭档,饭桌之上,竟无一人举起手机

东方不败然多多
2026-09-07 03:29:04
赢球却输人!巴萨 5 球狂胜巨大争议!诺坎普核心看低对手

赢球却输人!巴萨 5 球狂胜巨大争议!诺坎普核心看低对手

澜归序
2026-09-08 08:47:31
1979年中越战争结束后,黎笋妻儿最终结局如何?小女儿安妮为何遭暗杀

1979年中越战争结束后,黎笋妻儿最终结局如何?小女儿安妮为何遭暗杀

大运河时空
2026-09-07 08:50:03
世界第3输了!中国女篮八强路一夜变天,凌晨2:45定生死

世界第3输了!中国女篮八强路一夜变天,凌晨2:45定生死

砚底沉香
2026-09-08 07:30:08
一场64-76 让C组前2确定!中国女篮8强附加赛2选1!中国队压力巨

一场64-76 让C组前2确定!中国女篮8强附加赛2选1!中国队压力巨

越岭寻踪
2026-09-07 06:59:01
给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

LULU生活家
2026-09-07 20:11:19
苹果开启降价狂潮,不断涨价的国产手机还撑得住吗?

苹果开启降价狂潮,不断涨价的国产手机还撑得住吗?

叮当当科技
2026-09-07 14:51:51
2026-09-08 09:55:00
虎嗅APP incentive-icons
虎嗅APP
个性化商业资讯与观点交流平台
27672文章数 688051关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

亲子
教育
艺术
游戏
公开课

亲子要闻

儿子满月了,从月子中心回家了

教育要闻

2026雅思托福日语备考,哪些语言学习app能根据水平和目标帮你精准提分?

艺术要闻

一幅分裂的古画:一边祝你升官,一边劝你放下欲望

索尼赛车即将王者归来?《GT赛车8》或要加速开发

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版