网易首页 > 网易号 > 正文 申请入驻

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

0
分享至

上周一,我发了自己做的AIHOT大模型排行榜。

有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。


讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。

现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。

但是有一类评测集,其实是最稀缺的。

就是模型在真实工作中的实际完成效果。

比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。

所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。

于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。

而且绝大多数的模型的跑分,在这些真实场景下任务的成功率,也是真的低的可怜,跟大家在Coding领域的体感完全不一样。

我用一个周末我翻到的比较成熟的电商评测的评测集来举例子,正好也是上周开源的,比较新,一些最新的模型也都有。

这个评测集叫RealReplicaBench,团队来自阿里国际站,因为他们就是做外贸的,所以内部的数据我觉得还是比较权威的,从这个案例,也可以看看Agent在真实的电商场景下能完成什么样子。

Github地址:https://github.com/Accio-org/RealReplicaBench


这套评测一共有107个任务,阿里国际站因为直接做了Accio Work这个电商Agent,然后他们就从大概过去160万条完整对话中整理出20万条工作流,再归纳出约2000条商业价值高的,最后按照可复现性和结果可判定性,最终整理出来107个任务。


基本把电商领域涉及到的工作场景都覆盖了,像供应商采购、商品发布、店铺经营、订单对账、国际物流、售后争议等等等等。

任务具体内容的分布我让GPT做了张图,方便大家更直观的看一下。


每一个,都是真实世界里面的电商任务。

简单看几个例子的案例,大家就知道大概都是什么样的任务了。

比如,有一个任务是让模型在店铺上上线一款定制瑜伽垫。


模型拿到的信息有发品计划、三家供应商的报价和一堆实拍图片。

然后呢,它要找出计划指定的供应商,填好类目、销售国家、差异定价和描述,再从一堆相机自动编号的照片里挑出正确、清晰的商品图上传。

还有一个,是给东莞到达拉斯的消费级电子产品规划运输路线。


在30天的运输时间的限制下,模型需要计算保险、清关、海关担保和平台费,找出总成本最低的路线,再在仿真的货代平台里完成海运段订舱和货件验证。

还有处理电商退货争议。


这个任务里面模型需要把订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间全对起来,然后逐单决定接受退货、部分退款、全额退款、向平台申诉,还是继续补充证据。

甚至还有跨平台月度对账。


它要把天猫、京东、拼多多三套格式不同的原始订单清洗到一张表里,统一SKU和订单状态,核对发货与结算差异,再算出每个SKU在各个平台的收入、成本、佣金和利润,最后把这些信息按照指定格式进行交付。

从这几个例子就能看到,这基本都是现实世界的电商交易的真实任务,商品上架、物流规划,到售后和经营分析,基本全都有,而且讲道理,这些任务看着就是脏活累活,理论上都应该交给Agent干对吧。

然后呢,我们来看看,现在在Coding上感觉已经大杀四方,感觉什么都能干出来的这些牛逼模型,在这个真实任务场景上的成功率有多少。


这些模型,是在PI这个开源Harness框架下跑的,所以准确性我觉得没啥问题。

百分制下,只有排名第一的Claude Opus 5刚刚过了及格线。

107个任务,它完成了65个,通过率60.75%。

Qwen 3.8 Max和DeepSeek V4 Pro以49.53%的通过率并列第三。

也就是说,现在大部分模型的任务通过率甚至连50%都过不去,107个任务,你让AI去做,有一半是全失败的。

这就是现在的模型,在真实世界工作中,非常真实的现状。

我也详细看了看他们是怎么去衡量模型到底完没完成,以及给不给分的,看完以后,我感觉比我想象的还要复杂一些。

我随机挑一道供应商采购题,来给大家看看评测过程。


比如这个题,任务的主角Dana是一名采购经理。

她离开几天后回来,邮箱里已经堆了大约300封邮件。

但是呢,她有一个铝合金笔记本支架项目,必须在当天完成推进。

模型需要从这些邮件里还原项目相关的需求、最新的规格和数量,从20家供应商里找出真正合格、单件落地成本最低的一家。

选好供应商以后,它还需要进行一系列的规范化操作,比如只给最终选中的那封报价打标签,标出3封要求更换收款账户的可疑邮件,保存给供应商的回复草稿,创建启动会议,并交付一份规定格式的JSON总结。

这个任务量你想一想都知道有多大,而且这些任务的原始数据也非常乱,充分体现了现在人类的混乱性。

比如项目的最终需求零零碎碎的散在10封邮件里面,中途还改过数量,改过要求,改的乱七八糟的。

而且供应商也不是只看公司名,因为现实世界中,也经常会有同一家供应商会换着联系人、邮箱、域名和显示名称来发报价,所以题目中,同时还混进了4组名字很像、实际却是不同公司的供应商。

模型得综合工厂地址、电话、银行收款人和出口许可证等多个信号交叉核对,才能判断哪些报价来自同一家。

说实话,这个过程,看得我都要力竭了,至少我是一丁点都不想干的状态。。。

所以我也生了个页面,方便看得更清晰。


Accio Work团队那边,也给模型准备好了Shopify、Gmail、日历、商品发布之类的工具,可以让模型直接用。

等模型做完,评测程序会直接检查邮箱、草稿、日历和JSON文件的最终状态。

一共有23组、42项结果检查。


像选中的报价有没有加上正确的标签?3封钓鱼邮件有没有全部标记?草稿收件地址和会议日期对不对?JSON里的供应商、价格、数量和淘汰原因能不能全部对上?

而模型的得分,要这23组全部通过,才算答对,才能得到这1分,一旦有1个检验出来错误就0分,非常严格。

也就是说,没有过程分这个东西,你只有所有检测项全对才有分,因为模型去解决真实的电商问题的时候,这差一步,可能就会让你丢了单子,这才是真实的商业世界。

最后的得分就按通过的任务数除以总任务数量107。

于是,最终就是上文看到的排行榜,几乎没有及格的。

而如果用他们自己的Agent产品Accio的框架跑,通过率会整体高一些,模型通过率50%以上的,从2个增加到了6个,毕竟是专门做电商的框架。而因为是评测集,同时因为也是全自动化,平时大量的任务,其实是人和Agent协同,所以完成率也会实际更高一些。


而如果我们对比一下Coding任务上的跑分,大家就能看出来差距了,我们拿今年5月底发布的DeepSWE举例。

这个评测基准包含了113个任务,考的是AI能不能在真实的开源代码仓库里,独立完成一次复杂、跨文件的软件工程改动。


所有模型都用mini-swe-agent框架跑,模型自己去阅读代码仓库、查找问题、修改文件、运行测试,最后提交结果。

排在最前面的这几个模型,任务通过率都能到70%以上。


类似的低分情况,也出现在了其他领域的真实任务评测集里。

比如上个月底,腾讯混元联合清华大学和东南大学发布的这个E-Bench。


它模拟了3个产品场景,分别是王者荣耀、QQ音乐和腾讯会议。

一共设置了323个需要模型真实去操作的任务。比如王者荣耀要整理好友、战队、房间和比赛记录,QQ音乐要搜索歌曲、管理收藏歌单,腾讯会议要筛选参会人员、预定会议等。

E-Bench一共测了11个模型。


成绩最好的是Kimi-K3,Avg@3是73.79%。这里简单解释一下Avg@3这个指标,它指的是模型在任务集上独立运行3次,3次得分的平均值。

但现实中,我们肯定希望模型不只是做对一次,而是能反复多次完成任务。

所以他们还测试了同一道题独立运行3次的情况。

表现最好的K33次全部做对只有58.82%。

而11个模型在这个稳定性指标上都没过60%。。。

还有比如小红书今年先后也发布了两套模型在真实任务上的评测。


比如这个偏生活的VibeLifeBench。

这个评测包含200个持续时间数周的生活任务,覆盖了职业、健身、租房、购物和差旅等10个领域。

同样还是给大家看看各个模型在榜单上的得分。


榜单上成绩最好的是Claude Opus 5,它的avg@3也依然只有32.5%。

就真的更有点惨不忍睹了。。。

这3套评测基准的任务、指标等等都不一样,所以不能横向比较,但至少能说明,在它们覆盖领域的真实世界任务上,大模型的表现,确实还有极大进步的空间。

所以这个时候,纯靠模型公司我觉得也不行了,需要所有产商一起努力,就像Accio也说,会持续提炼真实的工作任务,然后把这些评测集数据滚动更新然后开放。毕竟这些厂子最重要的目标,是做Agent,是做模型路由,只有模型牛逼了,他们才能实现给自己客户的价值最大化。

不过比较可惜的是,就是这些评测集更偏向于研究,更新的不够及时,一些新模型出来可能要很久以后才会更新,所以还没有办法放到AIHOT的排行榜里面。

不过我未来可能会把类似于阿里国际站的RealReplicaBench、腾讯的E-Bench、小红书的VibeLifeBench等等的真实世界工作的评测集全都收集起来,然后我自己搭环境,我自己花钱来跑,一发新模型就全部跑一遍,保持更新,再把这些评分放到AIHOT上,方便大家查看,大家可以期待一下~

大家如果有类似真实世界工作任务的评测集,也欢迎评论区留言跟我提供。

最后,我想说。

在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。

模型在Coding这个任务上,现在确实做的很好,跑的很快,但是在大量真实工作任务的场景中,还有很大的进步空间。

毕竟,那些琐碎、混乱、没有标准答案的东西,才组成了我们每天真正面对的工作。

因为,这才是真正的。

人类世界。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。

>/ 作者:卡兹克、tashi

>/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本饮料巨头冒充国货,潜伏中国40年,一年狂赚国人1000多亿

日本饮料巨头冒充国货,潜伏中国40年,一年狂赚国人1000多亿

数字财经智库
2026-09-08 16:54:30
眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

爱下厨的阿酾
2026-09-08 08:42:59
20.99万起的小米澎程?今晚有人要睡不着觉了。

20.99万起的小米澎程?今晚有人要睡不着觉了。

差评XPIN
2026-09-08 01:02:44
iPhone 18 Pro Max展示样机突然曝光,越看越离谱

iPhone 18 Pro Max展示样机突然曝光,越看越离谱

搞机小帝
2026-09-08 00:38:14
联合国突发最高预警!千年一遇灾难将临,2027年人类还有退路吗?

联合国突发最高预警!千年一遇灾难将临,2027年人类还有退路吗?

历史点行
2026-09-07 13:26:48
50岁林心如九寨沟被偶遇,无美颜生图曝光,导游直呼本人更美!

50岁林心如九寨沟被偶遇,无美颜生图曝光,导游直呼本人更美!

草莓解说体育
2026-09-07 03:24:14
听听恒大前员工心里话:真实的许家印,和你想的完全不一样

听听恒大前员工心里话:真实的许家印,和你想的完全不一样

花小猫的美食日常
2026-08-23 05:03:59
“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

“我妈要敢在宿舍里这样,我就退学”,一段女家长视频让人力竭了

熙熙说教
2026-09-07 12:52:29
英媒:英国将对以色列采取更强硬立场

英媒:英国将对以色列采取更强硬立场

参考消息
2026-09-08 14:33:20
特朗普女婿当面撂话:没有永远的敌人,泽连斯基回应亮了

特朗普女婿当面撂话:没有永远的敌人,泽连斯基回应亮了

影视情报室
2026-09-07 11:14:04
英超下课第1人?43岁前皇马少帅3连败遭兵变:4球员反水 1人爆粗口

英超下课第1人?43岁前皇马少帅3连败遭兵变:4球员反水 1人爆粗口

风过乡
2026-09-07 23:47:55
“不缺吃不缺喝,你长成这样给谁看?”新生开学后,妈妈受不了了!

“不缺吃不缺喝,你长成这样给谁看?”新生开学后,妈妈受不了了!

林林先生
2026-09-06 17:03:04
喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

喝酒四巨头全没了,最大35岁最小26岁,直播间成了他们最后的地方

绚丽的画卷
2026-09-05 06:56:57
毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

DELIXI
2024-12-01 18:32:46
国足最新集训名单:韦世豪在列,布尼亚明、王庚睿、赵松源入选

国足最新集训名单:韦世豪在列,布尼亚明、王庚睿、赵松源入选

懂球帝
2026-09-08 18:36:15
三部门:调整节能汽车、新能源汽车车船税优惠政策

三部门:调整节能汽车、新能源汽车车船税优惠政策

界面新闻
2026-07-03 17:04:59
巨亏近100亿,高瓴割肉跑了

巨亏近100亿,高瓴割肉跑了

投资家
2026-09-01 20:45:25
人不会平白无故患带状疱疹!医生强调:得带状疱疹多半有4个共性

人不会平白无故患带状疱疹!医生强调:得带状疱疹多半有4个共性

芹姐说生活
2026-08-05 22:09:05
伊朗总统表示将继续全力抵抗直到侵略者后悔为止

伊朗总统表示将继续全力抵抗直到侵略者后悔为止

环球网资讯
2026-09-08 18:53:06
“粥饼伦”新店开业推出8元套餐,本人回应:并非降价,套餐不含烤肠,没有哪家生意一辈子红火,不会盲目扩张开店

“粥饼伦”新店开业推出8元套餐,本人回应:并非降价,套餐不含烤肠,没有哪家生意一辈子红火,不会盲目扩张开店

大风新闻
2026-09-08 14:40:09
2026-09-08 20:52:49
数字生命卡兹克 incentive-icons
数字生命卡兹克
反复横跳于不同的AI领域,努力分享一些很酷的AI干货
588文章数 719关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

美国中期选举临近 纽森呼吁民主党:硬气起来

头条要闻

美国中期选举临近 纽森呼吁民主党:硬气起来

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

家居
游戏
本地
数码
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

肉腿之后,日本人又将XP卷向了大胃袋

本地新闻

宁波,中国制造的隐藏大佬

数码要闻

六联智能发布全球首批"Gorgon Halo"笔电AXN88B-160M-YD

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版