网易首页 > 网易号 > 正文 申请入驻

V-Rubrics:当AI看图说话时,如何知道它哪句话在瞎编?

0
分享至


你有没有遇到过这样的情况:一个人给你讲一张图表,讲得头头是道,语气笃定,逻辑也通顺,可你越听越觉得不对劲,因为他提到的某个数字,图上根本没有。

这不是危言耸听,这恰恰是当下多模态大模型(也就是能看图又能说话的AI)最让人头疼的毛病。它们生成的答案通常读起来很顺,甚至逻辑链条完整,但里面可能藏着一两句根本没有图像证据支撑的话。一个不存在的物体,一个编造的图表数值,一步没有依据的推理,都可能让整个回答从"看起来很对"变成"其实是错的"。

这篇来自新加坡南洋理工大学S-Lab、A*STAR等机构联合团队的论文,就是想解决这个问题。他们给这套方法起名叫V-Rubrics,中文可以理解成"视觉评分细则"。这篇论文不是要造一个更聪明的模型,而是想换一种方式,教模型怎么"对症下药"地改正自己的毛病。

问题出在哪:一个笼统的分数,救不了具体的错误

先说说现在训练这类AI模型的常规做法。

多模态大模型在完成基础训练之后,通常还要经历一个叫强化学习的过程,让模型根据反馈不断调整自己的行为,越来越靠近"正确答案"。这个反馈信号,最常见的形式就是一个标量分数,说白了就是给整段回答打一个总分:对,或者不对;好,或者不好。

这套逻辑在数学题、代码题这类有明确对错标准的任务上效果不错,因为答案本身就是可验证的。但视觉推理不一样。

一个回答完全可能是"部分对,部分错"的混合体:模型可能正确识别出了图里的太阳、地球和月亮的位置,却在下一步推理时错误地把"三点一线"解释成了"月食"而不是"大潮"。

这时候如果你只给这个回答打一个总分,比如说"错了,0分",那这个反馈其实是很粗糙的。它没有告诉模型:你看图的能力是过关的,出问题的是后面那步逻辑判断。模型收到的信号就是"这条路走错了",但具体错在哪个岔路口,它并不知道。

论文管这个叫"信用分配"问题,英文是credit assignment,说的就是当一个复杂任务里有多个环节时,怎么把奖励或惩罚精确地分配到真正出问题的那个环节上,而不是笼统地奖惩整体。

这就好比一个团队项目交上去被打了低分,但团队里明明有人认真调研了资料,只是最后写报告的人把结论写反了。如果老板只说"这份报告不及格",那认真调研的人下次可能会以为自己调研的方向也有问题,反而开始瞎调整。**如果不做这种精细的责任拆分,团队里做对的部分也会被连坐否定,最后整个团队的进步方向反而变得模糊。**这正是标量奖励在视觉推理任务里的困境。

核心思路:把一个答案拆成一堆"能不能验证"的小陈述

V-Rubrics的解法说起来不复杂:既然一个完整回答里混杂着"看图看对了""推理对了""格式对了"这几种不同性质的判断,那就别把它们捆在一起打分,拆开单独评。

具体来说,论文把每个参考答案拆解成一堆最小单位的"原子命题",每条命题只对应一件能被验证的事,然后把这些命题归到三个维度里:

视觉忠实性(Visual Faithfulness,简称VF):检查回答里提到的内容是不是真的能在图里找到依据。比如"图中有三个人"这句话对不对,直接看图就能验证。

推理一致性(Reasoning Consistency,简称RC):检查从看到的视觉信息推出的结论是不是站得住脚。比如"这三个人是一家人"这个结论有没有逻辑漏洞。

指令遵循度(Instruction Following,简称IF):检查回答有没有满足题目本身提出的格式或内容要求,比如题目要求选择题只输出选项字母,模型有没有照做。

论文里那张图1的例子挺直观的,讲的是一道关于"大潮小潮"的天文题。整个参考答案被拆成六条评分细则:先是识别出太阳、地球、月亮的位置(VF),再确认三者在一条直线上(VF),接着观察到潮汐隆起的位置(VF),然后解释引力叠加导致高潮更高(RC),选出正确答案是"大潮"(IF),最后还要能区分"小潮"需要日月呈90度角这个易错点(RC)。

每一条细则还带着一个重要性标签:essential(必要)、important(重要)、optional(可选)、pitfall(陷阱)。前三种标签奖励模型答对或答好的内容,pitfall则专门用来标记那些常见的胡编乱造或推理陷阱,模型只要没踩这个坑就算得分。

这套设计原则论文里总结了四条:细则必须是能对照图像验证的,必须是自包含的(意思是不需要看完整参考答案就能单独判断这句话对不对),必须有覆盖面(不能只盯着最终答案,要覆盖中间的推理步骤),最后要有明确的重要性权重区分主次。

生活里最贴切的对应场景大概是老师批改一篇作文。**如果只在作文最后打一个总分,学生根本不知道自己是审题跑偏了,还是论证逻辑有漏洞,还是就是格式没写对。**但如果老师用一份评分细则逐条打勾,比如"审题准确+2分""论据充分+3分""格式规范+1分""偏题扣2分",学生一眼就能看出自己哪里该改。这就是V-Rubrics想在AI训练里实现的效果,只不过这里"批改作业"的老师是另一个AI模型。

数据从哪来:V-Rubrics 50K的炼成过程

光有这套评分思路还不够,得有大规模、高质量的数据来支撑训练。于是团队搞了一套叫V-Rubrics 50K的训练集,一共50248个样本,来自17个视觉相关的公开数据集,覆盖了图表理解、文档问答、数学视觉推理、计数、教育问答等各种任务类型。

数据的加工流程分了几步。第一步是粗筛,用一系列规则过滤掉媒体损坏、字段缺失、内容过于简单、重复度过高的样本,确保剩下的都是"能验证、有难度、语言质量过关"的干净数据。

第二步比较有意思,叫拒绝采样(rejection sampling),做法是先训练出一个基础版本的模型(论文里叫πSFT),让它对每道题独立生成8次回答,然后统计这8次里有多少次是答对的。

这个成功率k/8,就成了衡量这道题对当前模型来说有多难的一个信号。成功率是0/8的归为"困难",1/8到5/8归为"中等",6/8到7/8归为"简单",如果8次全对就直接扔掉不要了,因为这种题模型已经掌握得太好,训练价值不大。最终这50248个样本里,困难题占36.1%,中等题占50.4%,简单题占13.6%。

这一步的逻辑其实挺聪明:与其凭空猜测哪些题目对模型有价值,不如直接让模型自己"考"一遍,用它的表现反过来定义题目的难度。

第三步才是给每道题打上评分细则标签,这一步交给了Gemini-3-Pro来做。给定图片、问题和参考答案,它按照统一的结构化提示词,把参考答案拆解成一系列带权重、带维度标签的原子命题。整个数据集最终生成了352938条评分细则,其中VF类占59.3%,RC类占28.7%,IF类占11.9%。VF占比最高不是巧合,因为团队在设计提示词时明确要求视觉问答任务里VF应该是数量最多的维度,这也符合"视觉忠实性是根基"的逻辑。

怎么把评分细则变成训练信号:奖励设计与前缀定位

拆出了这些细则,接下来的问题是怎么把它们变成能指导模型训练的数字信号。

论文的做法是让另一个验证模型,也就是判官模型(论文用的是Qwen3-VL-235B-A22B),去逐条判断模型生成的回答有没有满足每一条评分细则,给出0或1的二值判断。

对所有权重为正的细则,按照各自权重占比进行加权求和,得到一个rubric奖励分数。同时保留一个传统的"最终答案对不对"的奖励,两者按照一定比例混合,构成最终的奖励信号。

但这里团队做了一个更细致的设计,叫做前缀定位(prefix-localized credit)。

判官模型在判断某条细则时,如果能找到回答里支撑这个判断的那句话,就会把这句话标出来。团队再把这句话对齐回模型生成的原始文本序列里,找到对应的位置。这样一来,某条评分细则的奖惩信号,就不再是笼统地作用于整段回答,而是精确地作用于回答里真正与这条细则相关的那部分文字。

打个比方,如果你写了一篇很长的观后感,老师批注"第三段逻辑混乱",那这条批注就应该贴在第三段旁边,而不是笼统地写在文章末尾让你自己去猜是哪一段的问题。**如果所有批注都堆在文末,你下次修改时很可能改错地方,把本来写得挺好的第一段也改坏了。**前缀定位做的正是这件事:把每条评分意见,尽量精确地挂到它所对应的那句话上,而不是让整篇回答的所有token都背同一个锅。

技术细节上,这套系统用的强化学习算法叫GRPO(Group Relative Policy Optimization,分组相对策略优化),简单理解就是对同一道题采样多个不同的回答,比较它们之间的相对好坏,再据此更新模型参数。论文在这个框架基础上,把原本作用于整段回答的奖励信号,拆分成了"答案部分"和"每条评分细则各自的前缀部分"分别计算优势值,再叠加到一起指导训练。

训练流程:先打基础,再上强化学习

整个训练管线其实是层层递进的。

起点是Qwen3-VL-8B-Instruct这个开源模型,团队先用OpenMMReasoner-SFT-874K这个87.4万条样本的数据集对它做监督微调(SFT,Supervised Fine-Tuning,指用人工标注或已知正确的数据直接教模型模仿标准答案的训练方式),得到一个基础版本的模型,记作πSFT。

这个基础模型有两个作用:一是用来生成前面提到的拒绝采样结果,帮助划分数据难度;二是作为后续所有强化学习实验的共同起点。

之后团队做了两组对照实验。一组是只用最终答案对错来做强化学习的常规GRPO,另一组就是加入了V-Rubrics评分细则的rubric-based GRPO。两组实验共享同样的初始模型、同样的训练数据、同样的采样预算,唯一的区别就是奖励信号的构成方式。这种对照设计能让人清楚看到,到底是"多了评分细则"这一项改变带来了效果差异,而不是别的什么因素在起作用。

结果说话:哪里涨了,哪里没涨

论文在10个基准测试上做了评估,覆盖通用视觉能力、知识推理、视觉数学、图表理解和逻辑推理这几大类。

先看知识和通用能力这块的结果。

|模型|MMBench-Dev|MMMU Val|MMMU-Pro|综合平均|

|SFT基础模型|84.79|66.78|54.34|64.93|

|+ 普通GRPO|86.94|68.00|55.72|66.25|

|+ 带评分细则的GRPO(本文方法)|86.51|**70.56**|**58.15**|**68.04**|

可以看到,普通GRPO相比SFT有小幅提升,但加入评分细则之后,综合平均分又往上多走了1.79分,相当于2.7%的相对提升。有意思的是,这个提升主要集中在MMMU和MMMU-Pro这两个偏学术知识推理的测试上,而在MMBench-Dev这个更偏通用能力的测试上,普通GRPO反而略微领先。这说明评分细则的价值主要体现在需要多步骤学术推理的场景,而不是泛泛的通用视觉理解能力上。

再看视觉数学、图表和逻辑推理这一块。

|模型|MathVision|DynaMath|WeMath|LogicVista|综合平均|

|SFT基础模型|55.46|41.32|77.43|60.63|58.45|

|+ 普通GRPO|56.71|41.12|84.86|60.63|61.94|

|+ 带评分细则的GRPO(本文方法)|**58.88**|**42.32**|**86.29**|**62.42**|**62.45**|

这里带评分细则的方法相比SFT基础模型提升了4.00分,相对提升约6.8%,而且在几乎每一项细分指标上都领先或持平普通GRPO。特别是在MathVision、DynaMath、WeMath、LogicVista这些依赖"看清图、推对理"的任务上,提升最明显。

不过论文也很坦诚地指出,这个方法不是万能药。在MathVerse V/O和CharXiv这两个测试上,普通GRPO反而表现更好一些,说明评分细则设计和某些基准测试的评判标准之间存在一定的错位,比如某些任务更依赖精确的符号计算或者特定的格式规范,而这些恰恰不是评分细则重点覆盖的方向。

再来看一个专门针对"奖励怎么用"的对照实验,也就是消融实验。

|奖励信号|信用分配方式|综合平均分|

|只用最终答案|整段回答统一打分|66.25|

|答案+评分细则|整段回答统一打分|67.74|

|答案+评分细则|按细则拆分+按前缀定位|**68.04**|

这个表格说明了两件事。第一,光是引入评分细则这件事本身,就已经比只看最终答案要好(从66.25涨到67.74)。第二,在此基础上再做前缀定位这种更精细的信用分配,还能再往上涨(从67.74涨到68.04)。虽然0.3分看起来不算多,但考虑到这两个变量是同时改变的(既有按细则分开算,又有按位置定位),这个数字反映的是两者结合带来的综合收益。

具体案例:模型到底改进了什么

论文里还给了两个挺生动的对比案例。

第一个案例是道计数题,问图里有多少人是在二战结束后出生的。只用答案训练的模型数出了对的人数(4人),但接着推理时犯了错,把中间那位看起来年长的男性直接归类为"1945年前出生",没有做更细致的年龄区间判断,最终答案错了。而经过评分细则训练的模型,会真的去仔细核算年龄区间,反复权衡"如果他75岁,那出生年份大概是1948年,晚于1945年"这样的具体推理,最终得出正确答案。

第二个案例是道读图题,要求从函数图像里判断函数值何时达到2。只答案训练的模型看错了图像的对应区间,直接给出了错误答案4。评分细则训练的模型则会先老老实实地把每一段折线对应的取值范围列出来,"x属于0到2时,y等于1;x属于2到4时,y等于2",一步步梳理清楚之后再得出正确答案2。

这两个例子传递的信息挺一致的:评分细则训练出来的模型,更倾向于把中间推理步骤老老实实地展开写出来,而不是抄近道直接蹦答案。因为在训练过程中,中间那些推理步骤本身也是被单独打分的,模型自然而然学会了不能偷懒跳步骤。

这个方法的边界在哪

论文的作者们没有回避这套方法的局限性。

首先,整套评分细则和后续的判断都依赖自动化生成,Gemini-3-Pro生成的细则质量、判官模型验证的准确性,都可能带来偏差。如果细则本身有问题,比如带有对参考答案的过度依赖、或者对图像有歧义的判断,这种偏差会直接传导进训练信号里。

其次,前缀定位靠的是模糊字符串匹配,把判官给出的那句话去和模型生成的文本做近似对齐,这不是精确到token级别的严格标注,只能算是一种实用层面的粗略近似。

还有一点是判官模型的家族偏见问题。因为无论是生成评分细则的Gemini,还是负责验证打分的Qwen系列判官,本质上都是用AI去评判AI,这种"自己人评自己人"的机制难免带来某种系统性的倾向,未来还需要更多不同家族模型的交叉验证来检验这套方法是否具有普适性。

写在后面

读完这篇论文,让我印象最深的其实不是那些提升的百分点,而是"拆解"这个动作本身背后的洞察。

我们通常习惯用一个总分去评价一件复杂的事,面试、考试、绩效考核概莫能外。但这篇论文提醒我一个挺朴素的道理:**当一件事本身就是由多个独立环节组成的时候,用一个数字去描述它,损失的信息量可能远比我们想象得多。**

有个细节我反复琢磨了一下,论文里提到当所有采样出来的回答在某条细则上判断一致时,这条细则反而不会产生任何训练梯度。这乍一听有点反直觉,但仔细想想很合理:如果模型在某个环节上已经稳定地做对(或者稳定地做错),那这个环节眼下就不是"学习的边界",真正值得关注的永远是那些判断摇摆不定的地方。这其实和人学东西的逻辑很像,你不会花时间反复练习自己已经掌握或完全放弃的技能,精力总是投向那些"有时候行有时候不行"的临界地带。

论文没有解决的问题是,当这套评分细则本身就有偏差的时候,怎么用另一套机制去检验评分细则的质量。这大概是个套娃问题:谁来监督裁判,谁又来监督监督裁判的人。

Q&A

Q1:V-Rubrics是什么?

A:V-Rubrics是一种视觉语言模型的强化学习训练方法,它把参考答案拆解成视觉忠实性、推理一致性、指令遵循度三类原子评分细则,用这些细则代替单一的对错分数来指导模型训练,从而让模型学会区分自己在哪个具体环节出了错。

Q2:V-Rubrics相比普通的强化学习方法效果好在哪?

A:在视觉数学、图表理解、逻辑推理等基准测试上,V-Rubrics比只用最终答案打分的普通GRPO方法平均提升了约2到4个百分点,尤其在需要多步骤推理的任务上提升更明显,但在部分特定基准如MathVerse上表现略逊于普通方法。

Q3:V-Rubrics 50K数据集是怎么构建出来的?

A:团队从17个视觉相关的公开数据集里筛选出50248个样本,先用规则过滤低质量数据,再让模型自己做8次采样来判断题目难度,最后用Gemini-3-Pro把每道题的参考答案拆解成带权重的评分细则,最终生成了35万多条细则。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郑钦文将与莱巴金娜争夺美网四强,此前交手郑钦文1胜4负,对手若获胜将登顶世界第一

郑钦文将与莱巴金娜争夺美网四强,此前交手郑钦文1胜4负,对手若获胜将登顶世界第一

极目新闻
2026-09-08 08:36:15
最不起眼的饮料配角,成为便利店C位

最不起眼的饮料配角,成为便利店C位

DT商业观察
2026-09-07 12:05:39
坚持丁克不生娃?52岁炫耀“老来得子”的他没给前妻留一丝体面

坚持丁克不生娃?52岁炫耀“老来得子”的他没给前妻留一丝体面

静若梨花
2026-09-08 15:33:08
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
一旦出现“红皇后效应”,说明公司就要凉了

一旦出现“红皇后效应”,说明公司就要凉了

互联网早读课
2026-08-28 08:11:31
青春华章丨一起感受这份徽风皖韵

青春华章丨一起感受这份徽风皖韵

人民资讯
2026-09-07 15:19:48
医生发现:脑梗不怕久坐,真正“怕”的是频繁去做这6件事!

医生发现:脑梗不怕久坐,真正“怕”的是频繁去做这6件事!

健康科普365
2026-09-08 14:25:16
白露后要补肺气!常吃这3样,咳嗽少了,肺气不虚了,结节也散了

白露后要补肺气!常吃这3样,咳嗽少了,肺气不虚了,结节也散了

江江食研社
2026-09-08 11:05:06
玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

玄学提醒:如果一个人还在穿着10年前的衣服,只说明几个问题

木言观
2026-08-01 13:58:35
澳洲超市常见生活用品竟致癌? 专家警告: 很多华人都有的日常习惯, 其实有巨大风险! 已有多人确诊

澳洲超市常见生活用品竟致癌? 专家警告: 很多华人都有的日常习惯, 其实有巨大风险! 已有多人确诊

澳微Daily
2026-09-08 16:06:12
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
韩国这回意识到问题严重性了!

韩国这回意识到问题严重性了!

果妈聊娱乐
2026-09-08 15:19:16
翟欣欣逼死前夫,和其他男人不雅聊天曝光,当着自己父亲在家约炮

翟欣欣逼死前夫,和其他男人不雅聊天曝光,当着自己父亲在家约炮

小人物看尽人间百态
2025-01-23 14:28:52
“19999元非常有诚意”!余承东这句话,让华为新款手机冲上了热搜

“19999元非常有诚意”!余承东这句话,让华为新款手机冲上了热搜

听心堂
2026-09-07 18:45:52
产量砍掉74%、库存压了900天:白酒的雷,五粮液只是第一个引爆的

产量砍掉74%、库存压了900天:白酒的雷,五粮液只是第一个引爆的

小蜜情感说
2026-09-08 03:34:24
孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

江启
2026-08-31 04:00:08
9月8日,人社部和财政部正式公布关于2026年调整退休人员基本养老金的通知之前,高龄津贴有新动态

9月8日,人社部和财政部正式公布关于2026年调整退休人员基本养老金的通知之前,高龄津贴有新动态

白昼说故事
2026-09-08 09:56:20
惹不起中国,也不敢惹美国,高市教训在前,竟还有人敢打台海主意

惹不起中国,也不敢惹美国,高市教训在前,竟还有人敢打台海主意

生活魔术专家
2026-09-08 14:17:49
一针见血!杨毅点破女篮困境:缺李梦是损失 但不是宫导的错?

一针见血!杨毅点破女篮困境:缺李梦是损失 但不是宫导的错?

你看球呢
2026-09-08 11:09:05
央视痛批、多地严查:电动四轮车!可“老年人出行难题”如何破解

央视痛批、多地严查:电动四轮车!可“老年人出行难题”如何破解

周哥一影视
2026-09-08 09:25:23
2026-09-08 16:44:50
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

外媒炒作中国"人形机器人参战" 称机器人部队即将成军

头条要闻

外媒炒作中国"人形机器人参战" 称机器人部队即将成军

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

手机
游戏
亲子
公开课
军事航空

手机要闻

韩国iPhone转三星折叠手机用户中,Z8系列约为Z7系列2倍

外媒:别期待《湮灭之潮》是什么硬核魂类游戏

亲子要闻

久备不孕都怀不上怎么办?卵巢功能减退还能调理好?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版