智猩猩AI整理
编辑:金水
这两年 GUI Agent 很火,训好它们或筛优质轨迹都离不开结果奖励模型(ORM),给执行轨迹打 0/1,判断是否成功。
但现有 GUI 奖励验证器经常判错,问题出在构建成功标准的两种方式,其一静态模板稳定但太通用,只问“任务完成没”,不关心具体对象、数值、范围和格式;其二隐式推理灵活但无清晰边界,常漏关键细节或自己加戏、过度严苛。
核心矛盾是验证器打分前根本没拿到一条贴合当前任务的判断标准。
针对这个"标准不够任务自适应(task-adaptive)"的缺陷,浙江大学联合小米(MiLM Plus)提出 ADAPT RUBRIC——一个粗到细(Coarse-to-Fine)的 Rubric 框架,专门解决"怎么从一条用户指令里,生成贴合它的判断标准"。
在离线奖励判别基准上拿到 86.7% 准确率、86.6 F1,比基线均值 F1 高 3.6 个点;在在线强化学习里当奖励信号,让智能体任务成功率净增 4.23 个点,且推理成本反而更低。
![]()
论文题目:
Task-Adaptive Rubrics for GUI Reward Modeling
01
先粗后细的评分表
ADAPT RUBRIC 的核心思路可以概括成一条清晰的流水线:先检索粗准则来锚定任务边界,再生成细准则补充具体约束,最后把两者融合、精选轨迹上下文,交给验证器打分。
![]()
1、类别级粗准则检索
粗准则检索解决的是“这一类任务该查什么”。
论文先用一次离线的 LLM 辅助归纳,把类别级准则库建好,之后就固定下来,方便复现和对比。
具体做法是从已有 GUI Agent 基准的开发轨迹池里采样成功和失败样本,让 LLM 总结出能区分成功与失败的验证维度,再把这些维度归并成如下图所示的八个大类。
每个类别对应一个条目,里面包含验证步骤、常见坑点、特殊规则和输出格式。
![]()
推理时,新指令先经过任务路由器预测所属类别,再从库里取出对应粗准则;如果认不出专门类别,就退回到通用兜底。
这一步的价值在于给验证器立下清晰的任务族边界,比如通信类要重点看收件人、内容和发送确认,创建/修改类则关注对象是否真正落地。
它解决的是跨任务时“统一查什么”的框架问题。
2、实例级细准则生成
细准则生成则补上粗准则看不到的细节。
粗准则只知道“这一类任务查什么”,但当前指令里的具体数值、范围、约束它仍然不清楚。
同样是通信任务,“把 Mike 的安全公告同步到 Mastodon、保持原文、仅粉丝可见、并打上 @openCompany 标签”,这些都是只属于这条指令的细粒度要求。
于是第二级让一个 Rubric 生成器根据指令、类别和粗准则,产出最多两条实例级细准则。它不会去重写粗准则 ,只补“当前指令独有且必须检查”的额外项。
论文给生成器加了三条硬约束:
Instruction Grounding(指令扎根)
每一条细准则都必须能在用户指令里找到明确的短语、数值或约束作支撑,杜绝模型自己加戏。
Compactness(紧凑)
最多2条,只高亮最有用的实例级要求,避免又退化成一份冗长 checklist。
Abstention(可弃权)
当当前指令确实不需要额外细项时,直接返回 ,不强行补。
这样粗准则管边界,细准则管这回的确切要求,职责分明,互不干扰。
3、准则融合与奖励验证
最后一步是准则融合与验证。
拿到粗准则和细准则后,把粗准则作为主体,把细准则作为独立的任务专属块追加在后面;如果细准则弃权,就只保留粗准则。
验证前还会做一次上下文精选,完整轨迹可能有几十帧,全部喂进去既贵又容易让模型看花眼,所以只保留不超过设定数量的高信号帧:初始帧、终止帧,以及文本输入、提交、状态切换等关键动作附近的帧。
最后把精选上下文、用户指令和融合后的准则一起交给 VLM 验证器,输出 0 或 1 的成功判断。
这个设计对工程特别友好,它只改了喂给验证器的“判分标准”和“轨迹上下文”,验证器本身的架构完全不动。
也就是说,换任何 VLM 当 judge 都能直接套用,这一点在后续跨 backbone 的实验里得到了反复验证。
02
性能评估
论文在离线判别和在线训练两个场景里做了验证。
1、离线判别
在 OGRBench 上(1409 条跨 Ubuntu / 安卓 / Windows / macOS / Web 的轨迹),ADAPT RUBRIC 的准确率和 F1 分别是 86.7% 和 86.6;
在同等「最多看 10 张截图」的条件下,比两个对照方法的平均 F1 高 3.6 个点。提升主要来自召回,能认出更多「其实成功了」的轨迹,同时没有把误判率拉高。
![]()
2、在线训练
用这套判分器给强化学习(GRPO)当奖励信号,训练 MAI-UI-8B,任务成功率从 19.70% 提到 23.93%(+4.23 个点),是几个对照奖励方案里最高的。
说明它打的分不只是离线判别更准,拿来训模型也更有用。
![]()
3、测试时筛选
同一道题采样多条候选轨迹、用判分器挑最好的那条,ADAPT RUBRIC 比随机挑选在 EarlyStop 和 Best-of-N 两种策略下分别多 11.88 和 13.28 个点,而且把失败轨迹误判为成功的比例仍压得很低(11.17%)。
![]()
消融实验也印证了「粗」和「细」是互补的,去掉细评分表,F1 掉 2.0;去掉粗评分表,同样掉 2.0;两个都不要、只靠截图硬看,直接掉 5.9。
![]()
另外在成本上,它用的模型调用和 token 比几个对照方法更省,质量还更好。
03
总结
这套方法也有没覆盖到的地方。论文自己提到两点:
评测虽覆盖了手机、桌面和网页,但没穷尽所有应用、界面和指令风格;
评分银行是离线建好、评测期间固定的,胜在可复现、好对比,但可能跟不上新冒出来的应用或领域特定的流程。
把判分标准从一套通用模板或模型自由发挥,变成类别边界 + 指令要点的组合,是这篇工作最主要的想法。
它没换判分模型,而是在出题这一步下功夫,把题出对,往往比把分打细更影响结果。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.