网易首页 > 网易号 > 正文 申请入驻

GUI Agent奖励模型总判错,浙大联合小米用一套自适应评分表解决了!

0
分享至

智猩猩AI整理

编辑:金水

这两年 GUI Agent 很火,训好它们或筛优质轨迹都离不开结果奖励模型(ORM),给执行轨迹打 0/1,判断是否成功。

但现有 GUI 奖励验证器经常判错,问题出在构建成功标准的两种方式,其一静态模板稳定但太通用,只问“任务完成没”,不关心具体对象、数值、范围和格式;其二隐式推理灵活但无清晰边界,常漏关键细节或自己加戏、过度严苛。

核心矛盾是验证器打分前根本没拿到一条贴合当前任务的判断标准。

针对这个"标准不够任务自适应(task-adaptive)"的缺陷,浙江大学联合小米(MiLM Plus)提出 ADAPT RUBRIC——一个粗到细(Coarse-to-Fine)的 Rubric 框架,专门解决"怎么从一条用户指令里,生成贴合它的判断标准"。

在离线奖励判别基准上拿到 86.7% 准确率、86.6 F1,比基线均值 F1 高 3.6 个点;在在线强化学习里当奖励信号,让智能体任务成功率净增 4.23 个点,且推理成本反而更低。


  • 论文题目:

    Task-Adaptive Rubrics for GUI Reward Modeling

01

先粗后细的评分表

ADAPT RUBRIC 的核心思路可以概括成一条清晰的流水线:先检索粗准则来锚定任务边界,再生成细准则补充具体约束,最后把两者融合、精选轨迹上下文,交给验证器打分。


1、类别级粗准则检索

粗准则检索解决的是“这一类任务该查什么”。

论文先用一次离线的 LLM 辅助归纳,把类别级准则库建好,之后就固定下来,方便复现和对比。

具体做法是从已有 GUI Agent 基准的开发轨迹池里采样成功和失败样本,让 LLM 总结出能区分成功与失败的验证维度,再把这些维度归并成如下图所示的八个大类。

每个类别对应一个条目,里面包含验证步骤、常见坑点、特殊规则和输出格式。


推理时,新指令先经过任务路由器预测所属类别,再从库里取出对应粗准则;如果认不出专门类别,就退回到通用兜底。

这一步的价值在于给验证器立下清晰的任务族边界,比如通信类要重点看收件人、内容和发送确认,创建/修改类则关注对象是否真正落地。

它解决的是跨任务时“统一查什么”的框架问题。

2、实例级细准则生成

细准则生成则补上粗准则看不到的细节。

粗准则只知道“这一类任务查什么”,但当前指令里的具体数值、范围、约束它仍然不清楚。

同样是通信任务,“把 Mike 的安全公告同步到 Mastodon、保持原文、仅粉丝可见、并打上 @openCompany 标签”,这些都是只属于这条指令的细粒度要求。

于是第二级让一个 Rubric 生成器根据指令、类别和粗准则,产出最多两条实例级细准则。它不会去重写粗准则 ,只补“当前指令独有且必须检查”的额外项。

论文给生成器加了三条硬约束:

  • Instruction Grounding(指令扎根)

每一条细准则都必须能在用户指令里找到明确的短语、数值或约束作支撑,杜绝模型自己加戏。

  • Compactness(紧凑)

最多2条,只高亮最有用的实例级要求,避免又退化成一份冗长 checklist。

  • Abstention(可弃权)

当当前指令确实不需要额外细项时,直接返回 ,不强行补。

这样粗准则管边界,细准则管这回的确切要求,职责分明,互不干扰。

3、准则融合与奖励验证

最后一步是准则融合与验证。

拿到粗准则和细准则后,把粗准则作为主体,把细准则作为独立的任务专属块追加在后面;如果细准则弃权,就只保留粗准则。

验证前还会做一次上下文精选,完整轨迹可能有几十帧,全部喂进去既贵又容易让模型看花眼,所以只保留不超过设定数量的高信号帧:初始帧、终止帧,以及文本输入、提交、状态切换等关键动作附近的帧。

最后把精选上下文、用户指令和融合后的准则一起交给 VLM 验证器,输出 0 或 1 的成功判断。

这个设计对工程特别友好,它只改了喂给验证器的“判分标准”和“轨迹上下文”,验证器本身的架构完全不动。

也就是说,换任何 VLM 当 judge 都能直接套用,这一点在后续跨 backbone 的实验里得到了反复验证。

02

性能评估

论文在离线判别和在线训练两个场景里做了验证。

1、离线判别

在 OGRBench 上(1409 条跨 Ubuntu / 安卓 / Windows / macOS / Web 的轨迹),ADAPT RUBRIC 的准确率和 F1 分别是 86.7% 和 86.6;

在同等「最多看 10 张截图」的条件下,比两个对照方法的平均 F1 高 3.6 个点。提升主要来自召回,能认出更多「其实成功了」的轨迹,同时没有把误判率拉高。


2、在线训练

用这套判分器给强化学习(GRPO)当奖励信号,训练 MAI-UI-8B,任务成功率从 19.70% 提到 23.93%(+4.23 个点),是几个对照奖励方案里最高的。

说明它打的分不只是离线判别更准,拿来训模型也更有用。


3、测试时筛选

同一道题采样多条候选轨迹、用判分器挑最好的那条,ADAPT RUBRIC 比随机挑选在 EarlyStop 和 Best-of-N 两种策略下分别多 11.88 和 13.28 个点,而且把失败轨迹误判为成功的比例仍压得很低(11.17%)。


消融实验也印证了「粗」和「细」是互补的,去掉细评分表,F1 掉 2.0;去掉粗评分表,同样掉 2.0;两个都不要、只靠截图硬看,直接掉 5.9。


另外在成本上,它用的模型调用和 token 比几个对照方法更省,质量还更好。

03

总结

这套方法也有没覆盖到的地方。论文自己提到两点:

评测虽覆盖了手机、桌面和网页,但没穷尽所有应用、界面和指令风格;

评分银行是离线建好、评测期间固定的,胜在可复现、好对比,但可能跟不上新冒出来的应用或领域特定的流程。

把判分标准从一套通用模板或模型自由发挥,变成类别边界 + 指令要点的组合,是这篇工作最主要的想法。

它没换判分模型,而是在出题这一步下功夫,把题出对,往往比把分打细更影响结果。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
20岁美女和39岁大叔同居,每天吃喝玩乐开心快活,坦言她不想奋斗

20岁美女和39岁大叔同居,每天吃喝玩乐开心快活,坦言她不想奋斗

小米拉
2026-09-07 08:07:15
国际时装周,张柏芝嫩了,宋佳干瘪消瘦,被膀大腰圆的朱珠抢了镜

国际时装周,张柏芝嫩了,宋佳干瘪消瘦,被膀大腰圆的朱珠抢了镜

洲洲影视娱评
2026-09-07 13:55:02
阿那亚偶遇梅婷,直播带货陷入争议中的她,貌似心情不佳一脸烦躁

阿那亚偶遇梅婷,直播带货陷入争议中的她,貌似心情不佳一脸烦躁

柒佰娱
2026-09-07 12:19:29
河南一女子外出喝酒,3岁儿子睡着被反锁屋内后从窗户坠亡,女子取得孩子父亲谅解,犯过失致人死亡罪获刑3年缓刑4年

河南一女子外出喝酒,3岁儿子睡着被反锁屋内后从窗户坠亡,女子取得孩子父亲谅解,犯过失致人死亡罪获刑3年缓刑4年

扬子晚报
2026-09-07 07:30:28
星宇股份董事长回应“批量解约应届生”:公司深刻反省并真诚道歉,对部分不实报道已投诉和举报

星宇股份董事长回应“批量解约应届生”:公司深刻反省并真诚道歉,对部分不实报道已投诉和举报

每日经济新闻
2026-09-07 14:43:11
巨亏近100亿,高瓴割肉跑了

巨亏近100亿,高瓴割肉跑了

投资家
2026-09-01 20:45:25
iPhone Ultra定档9月10日:1.5万起,却没Face ID和长焦

iPhone Ultra定档9月10日:1.5万起,却没Face ID和长焦

小柱解说游戏
2026-09-08 09:54:38
相比于历史,英语确实更应该退出主科

相比于历史,英语确实更应该退出主科

Marx乖巧
2026-09-06 15:52:12
撒贝宁:本以为生了龙凤胎已经够幸福,没想到,如今幸福又升级了

撒贝宁:本以为生了龙凤胎已经够幸福,没想到,如今幸福又升级了

比利
2026-09-08 10:36:56
OPPO Find X10 Pro Max全球首发三颗2亿镜头群!2026年所有Pro Max最强影像

OPPO Find X10 Pro Max全球首发三颗2亿镜头群!2026年所有Pro Max最强影像

快科技
2026-09-08 11:35:10
总统转战总理:武契奇为何主动降级参选

总统转战总理:武契奇为何主动降级参选

我是一个粉刷匠2
2026-09-07 11:46:46
年薪暴涨66%!恩里克续约PSG,跃居世界第三高薪主帅

年薪暴涨66%!恩里克续约PSG,跃居世界第三高薪主帅

硅屿手记
2026-09-07 13:13:19
贾玲复胖了,本人回应:根本维持不住,体重弹一弹,观众也好适应

贾玲复胖了,本人回应:根本维持不住,体重弹一弹,观众也好适应

她时尚丫
2026-07-25 20:45:34
李亚鹏自曝,李嫣除了英语全不及格,一年百万学费换来什么

李亚鹏自曝,李嫣除了英语全不及格,一年百万学费换来什么

历史点行
2026-09-03 16:00:37
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
看演唱会女生家庭低保并未取消,但发布不实内容有可能被处罚

看演唱会女生家庭低保并未取消,但发布不实内容有可能被处罚

映射生活的身影
2026-09-07 21:32:59
德国乒协早已看透!国乒真正王牌并不是王楚钦,这张底牌藏得太深

德国乒协早已看透!国乒真正王牌并不是王楚钦,这张底牌藏得太深

甜菊汽水
2026-09-06 16:53:51
伊朗发出致命警告!敢动用核武器,全球美军基地都将被摧毁!

伊朗发出致命警告!敢动用核武器,全球美军基地都将被摧毁!

原梦叁生
2026-09-05 21:53:24
小米史上最贵手机来了!10999元起步,顶配15999元,雷军“哭诉”:内存实在太贵

小米史上最贵手机来了!10999元起步,顶配15999元,雷军“哭诉”:内存实在太贵

极目新闻
2026-09-07 21:26:06
哈里梅根刚回国就搞事!联系BBC准备爆料

哈里梅根刚回国就搞事!联系BBC准备爆料

红袖说事
2026-09-07 19:48:30
2026-09-08 14:03:00
智猩猩
智猩猩
AI 技术内容与服务平台
75文章数 3关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

头条要闻

德国极右翼赢得历史性大胜感谢马斯克 欧洲或连番变天

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

时尚
游戏
房产
旅游
军事航空

白露食白——露从今夜白,味从此时鲜

GTA6露西娅演员晒美照:酒红紧身裙下都是肌肉 不好惹

房产要闻

真快啊!海口这个超级城更,又有大动作!

旅游要闻

从流量到流量沉淀 暑期文旅成绩单中的重庆“质”感

军事要闻

伊朗锡里克婚礼遭袭现场发现美武器残骸

无障碍浏览 进入关怀版