网易首页 > 网易号 > 正文 申请入驻

拒绝「差不多」,电商模型测评迎来「最严厉的父亲」

0
分享至

测评 AI 这件事,如今越来越难做了。

几年前,AI 还是聊天机器人时,测评主要就是做题:写作的、数学的、编程的……最后形成一套跑分,用分数代表模型能力。

但当 AI 从聊天框里走出来,变成能够调用工具、操作网页、处理文件、跨系统执行任务的 Agent,情况就变得复杂起来。

平时我们看到的,是 AI 出现在手机上,能够刷淘宝、加购物车,最后下单。实际上在商家的那一端,也有 AI 的参与,承担着比选购和下单更复杂的工作。


在专门考察电商环境中模型表现的 RealReplicaBench 测试中,经过 107 个真实商业任务的考核,所有参评模型都没有达到 60 分——都没有及格。

选手一共 13 位,但连同 GPT、Claude、GLM、Qwen 、Deepseek 和(毫无意外排名最末的)Gemini ,它们当中最高分只有 56.1 分。

以最高分的 Claude Opus 5 为例,在 Accio Work 执行框架中的通过率(66/107) ,要比 OpenClaw 上(60/107)和 PI (65/107)上的通过率更都要高,整体来看 Accio 框架对多数模型的性能增益都更明显。


执行框架来自阿里旗下Accio Work ,是全球首个聚焦于电商领域的 AI Agent,目标是帮商家在一个 AI 工作台上统一管理、自动操作、快速分析多个平台的店铺,降低门槛、提升效率,实现生意的增长。

RealReplicaBench 正是脱胎于 Accio Work 的技术团队,他们观察到,靠做题是看不出模型解决问题的真实能力的,尤其是在电商中,工作繁琐而具体:采购要从邮件和报价里确认信息,发品要处理图片、价格、物流和后台状态,经营分析要跨多个平台比对数据……

为了把货品准确无误地交到你手上,AI 已经卯足了劲,却未必做得够好,因为真实世界里的工作,很少是一连串彼此孤立的问题。

看似考做题,实则考「上岗」

如果只看分数,RealReplicaBench 的结果很容易引发误读:「怎么 AI 都不太行」。但摸着良心说,还真不能怪模型们不够强,这个结果很难简单归咎于模型能力——这套「题」,确实难。


传统 Benchmark 关注答对多少题、完成多少步骤,就获得对应的分数。类似于考高考,数学最后一道大题不会做,写个「解」字或把条件抄一下,也能拿点儿分。

可是当 AI 真正进入商业工作流以后,用户需要的不是一份过程尽力的答卷,而是一项项真正完成、且能够继续向下流转的工作。

对于「完成」的坚持,构成了 Accio Work 团队技术哲学的核心,这源于他们长期沉浸在电商场景里形成的判断,电商工作需要把判断转成行动,再让新的业务状态成为下一步行动的依据。


供应商有没有选对,决定后面的采购动作;价格有没有算对,决定商品能不能正常发布;物流路线是否满足时限,决定订舱有没有实际意义……前面的一次错误,可能沿着整个工作流一路传递到最后。

因此,重要的不只是某一步「做对了」,更在于每一步的判断和行动,能不能被完整串起来。

RealReplicaBench 对「完成」的定义也由此变得接近真实交付:一项工作只有在结果能够被下一环节直接接手时,才算真正完成。


技术负责人解释道,「哪怕一个任务已经完成了 80%,如果最后还留下 20% 需要用户手动处理,而这 20% 恰恰可能是最关键的部分,那么对用户来说,它依然没有形成可以直接使用的交付。」

基于这一点,在 RealReplicaBench 的测评中,不存在「将就」;没有完成,就是 0 分

如果一定要找一个更直观的比喻,传统 Benchmark 更像考交规,科目一,而 RealReplicaBench 更像路考。脑袋里知道什么时候该打转向灯是一回事,真正把车从起点安全开到终点又是另一回事。就算每一次转向灯都打对了,最后撞车了,也不能称作是合格的司机。


那么问题也随之而来,这种高完成度的表现,究竟要怎么被做成一套可重复、可验证的评测 benchmark?

为了测试「真实工作」,先造一个接近真实的世界

任何 Benchmark 都绕不开一个最基础的问题:它测到的,究竟是不是它想要测的东西。

如果目标是判断 Agent 能不能完成真实商业任务,那么只把一个真实需求改写成几段文字,再让模型输出答案,显然还不够。难点往往藏在那些被文字省略掉的地方:页面状态会变化,历史信息和新信息会冲突,系统之间的字段并不统一……

RealReplicaBench 的做法,是尽可能把这些复杂性搬到测试环境中,它不只提供题面,还复刻了前端 UI、浏览器操作、CLI、API/MCP、文件系统以及后台状态,让 Agent 面对的不是一张纸上的问题,而是一套能够被真正操作的业务环境。


供应商采购任务就是一个典型例子。Agent 需要从约 300 封高噪声邮件中还原真实采购需求,还要完成供应商选择、邮件标签、回复草稿和 Kickoff 日历。它测试的显然不再是「能否总结邮件」,而是能不能从一堆真实形态的噪声中还原业务事实,并把这个事实继续变成行动。


另一个更复杂的任务,则要求 Agent 把 5383 条海关记录变成一套跨系统采购控制塔。模型要先按品类和供应商聚合数据,再根据采购政策筛选 Top 3 供应商,随后分别在 Google Workspace、Box 和 Jira 中建立 Dashboard、证据文件夹和项目任务。


这类任务之所以可以作为考题,都在于它们保留了真实工作里一个很关键的特征:状态会不断变化,而 Agent 必须在变化中仍然准确理解上下文,并随之校准。

前面筛出来的供应商、后面创建的文件夹和 Jira Task,必须属于同一套业务关系。否则,一个动态 ID 写错,后面的交接和审计就可能全部失效。

因此,RealReplicaBench 所测试的,并不是模型在某一个单独的问题上能达到多高的正确率,这不符合他们的技术哲学,关键要看它能不能在复杂环境中持续维持正确状态,并把一个业务目标真正推进到结束。

用高仿真环境,证明高完成度

把真实环境复刻出来,还只是第一步,真实工作评测还有另一个容易被忽略的问题:模型可以说「任务已经完成」,而用户却无法确认,或者确认成本很高。

在聊天机器人中这问题不大,Chatbot 要交付的本来就是文本。可 Agent 不一样,它的文本输出只是行动过程中的一部分,因此 RealReplicaBench 的另一个核心设计,是让 Verifier 直接读取最终环境状态,而不是相信 Agent 的自我报告。

例如在物流履约中,Agent 需要为一票从中国到美国的运单枚举可行路线,把海运、拖车、尾程、保险、清关、Bond 和平台费全部计入,排除超过 30 天或港口衔接不成立的方案,再完成海运段 Booking 和 Shipment Verification。最终的验证对象不是一段看起来合理的路线建议,而是实际生成的 Shipment ID。


这套逻辑把「完成」的定义从模型的思维链中拿出来,交还给环境本身。Listing、Booking、日历、文件关系、动态 ID,这些真实状态共同构成了 Agent 是否完成工作的证据。

既然测评不该对一个只有「长得像答案」的答案给分,那么,每个动作都需要在环境里留下可以被独立验证的后果,这也是为什么 RealReplicaBench 判分格外严格的另一个原因。

Benchmark 背后,是技术实力

为什么Accio Work 团队能设计这样一套 Benchmark?

答案首先来自任务本身。RealReplicaBench 的 107 个任务并不是来自研究者想象中的「电商场景」,而是来自真实商业需求,来自约 160 万完整对话、20 万商业执行轨迹和 2000 条高价值工作流,最后通过可复现性与可判定性,收敛成 107 个任务。


供应商采购最后应该留下什么结果,商品发布什么时候才算真正完成,物流任务究竟停在路线建议还是必须产生 Booking,跨系统协作里哪些对象关系一旦断掉就无法继续交接——这些看似属于评分标准的问题,本身就建立在对真实业务流程的理解之上。


也因此,设计出什么样的 Benchmark,往往也会折射出背后的团队如何理解 Agent。

如果认为 Agent 只是一个更聪明的问答系统,测试自然会围绕答案质量展开;如果认为 Agent 的价值在于把工作真正推进到结束,那么测试就必须包含环境、工具、状态、验证以及失败后的归因。

从这个角度看,RealReplicaBench 表面上是在测试模型,背后实际上也展示了 Accio Work 团队设计 Agent 的一套方法论:从真实需求定义任务,再复刻工作环境;组织模型与工具完成任务,用环境状态验证结果,再根据失败位置持续优化模型与 Harness。


这也是为什么这套 Benchmark 对 Accio Work 的意义并不只是一次对外开源。团队计划持续加入新的真实任务,让评测环境滚动更新,并进一步用于模型评测、训练优化和模型路由。根据不同任务的特点,调度更适合的模型,在效果与成本之间寻找更好的组合。


这样一套 Benchmark 惠及的不只是电商商家,让他们能更准确地判断该选择什么模型、什么 AI 产品;也同样对整个技术社区有意义。


当 AI 真正开始进入商业工作流,建设 Harness 的能力会逐渐和底层模型本身一样重要。毕竟,对用户来说,真正值得付费的从来不是一个「差不多会做」的 Agent,而是一套能够把工作接过去,并把结果直接交回来的系统。

过去衡量大模型,人们最常问的是它知道多少;后来问题变成了它能不能推理。到了 Agent 时代,评价标准正在继续向前移动,逐步靠近它到底能不能把事情真正完成。

RealReplicaBench 正在把这个看起来很朴素的问题,变成一套可以重复运行、可以验证、也可以用于研发迭代的技术标准。Benchmark 测的是模型,最终被检验的,其实也是一个技术团队对「工作如何被 AI 完成」这件事理解得有多深。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
遭解约不到1天!29岁外援官宣新东家 社媒感谢申花+离谱写错队名

遭解约不到1天!29岁外援官宣新东家 社媒感谢申花+离谱写错队名

我爱英超
2026-09-08 07:17:03
2026年“进口轿车”第一名:在逆风之下,今年仍销售出5万多台

2026年“进口轿车”第一名:在逆风之下,今年仍销售出5万多台

柳先说
2026-09-07 18:41:40
坐了这么多次飞机,竟不知机场T1、T2、T3的“T”啥含义!

坐了这么多次飞机,竟不知机场T1、T2、T3的“T”啥含义!

小虎新车推荐员
2026-08-17 13:11:31
哈里返英两周未与查尔斯通话,王室消息称对搬家决定“措手不及”

哈里返英两周未与查尔斯通话,王室消息称对搬家决定“措手不及”

赴一场山海啊
2026-09-08 21:56:22
辽宁电视台两个频道悄然停播!

辽宁电视台两个频道悄然停播!

沈阳公交网小林
2026-09-08 00:55:44
突发!国际油价直线拉升 沙特多处能源设施遭袭 也门胡塞武装: 即将对沙特纵深打击

突发!国际油价直线拉升 沙特多处能源设施遭袭 也门胡塞武装: 即将对沙特纵深打击

每日经济新闻
2026-09-08 17:21:40
亚马尔金球奖周期数据:25球21助攻赢得西甲+世界杯,获西甲MVP

亚马尔金球奖周期数据:25球21助攻赢得西甲+世界杯,获西甲MVP

懂球帝
2026-09-08 23:02:12
她冲进女儿房间,发现陌生男人藏在床底。美国一母亲开枪后,检方问了一句话:人已经出去了,为什么还要扣扳机?

她冲进女儿房间,发现陌生男人藏在床底。美国一母亲开枪后,检方问了一句话:人已经出去了,为什么还要扣扳机?

阿尺量世界
2026-09-08 21:17:41
火化工作人员说出大实话:人死后,骨灰根本不需要保存!

火化工作人员说出大实话:人死后,骨灰根本不需要保存!

阿甘天天传
2026-09-04 11:54:49
拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

人间无味啊
2026-09-06 16:45:34
百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

百亿资金灰飞烟灭!把公司108个美女当作后宫,丁宁到底有多狠?

潋滟晴方DAY
2026-09-02 15:24:52
国米主帅齐沃向恩师皇马主帅穆里尼奥表达敬意:遇到穆里尼奥是我的幸运!

国米主帅齐沃向恩师皇马主帅穆里尼奥表达敬意:遇到穆里尼奥是我的幸运!

福酱的小时光
2026-09-08 15:18:09
李干杰会见蒙古民主党代表团

李干杰会见蒙古民主党代表团

新华社
2026-09-08 13:00:05
9月4日,中国国防部正式宣布:中国人民解放军陆军受邀如约赴俄,准备参与东盟防长扩大会人道主义扫雷专家组主持的实兵演练

9月4日,中国国防部正式宣布:中国人民解放军陆军受邀如约赴俄,准备参与东盟防长扩大会人道主义扫雷专家组主持的实兵演练

扶苏聊历史
2026-09-07 17:42:55
世界上“倒退”最快的国家:从发达国家到一贫如洗,只用5年时间

世界上“倒退”最快的国家:从发达国家到一贫如洗,只用5年时间

历史人文2
2026-08-11 06:30:03
坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还,越方人员全部撤出!否则后果自负!

坚决支持中国政府的严正声明,越南占领的中国岛礁全部归还,越方人员全部撤出!否则后果自负!

月光婉儿f
2026-09-08 09:54:22
汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汉史趣闻
2026-09-06 10:13:22
最新:乌克兰清除大叛徒舒托夫!曾任顿涅茨克安全部要员

最新:乌克兰清除大叛徒舒托夫!曾任顿涅茨克安全部要员

项鹏飞
2026-09-07 20:57:14
美网女单八强全部就位!夺冠概率更新,郑钦文成最大黑马

美网女单八强全部就位!夺冠概率更新,郑钦文成最大黑马

体育见习官
2026-09-08 13:57:40
小米汽车无忧服务包上新:增程版2399元/年,增程系统免费保养

小米汽车无忧服务包上新:增程版2399元/年,增程系统免费保养

IT之家
2026-09-07 21:55:02
2026-09-09 01:03:00
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39391文章数 2602485关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

伊朗:成功捕获一艘美军潜艇 将发布相关图片

头条要闻

伊朗:成功捕获一艘美军潜艇 将发布相关图片

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

数码
健康
教育
公开课
军事航空

数码要闻

AI音频硬件成IFA大热门:AI录音卡已OUT,形态各异攻占声音入口

同样是脑梗,为何康复结局大不同?

教育要闻

“每一个都死气沉沉”,一张军训照片,让家长怒了:我们的孩子为何变成这样?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版