网易首页 > 网易号 > 正文 申请入驻

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

0
分享至



导读:视觉问答模型的准确率不断提高,但高分未必来自视觉理解—— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。

一次人工标注之后,系统可在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案 —— 不重新生成整张图,也不重建整套基准。



  • 论文:REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation
  • 论文链接:https://arxiv.org/abs/2606.20736
  • 项目主页:https://xxxxxsun.github.io/rekey-vstar/
  • 作者:Tengjie Lin、Yutao Sun、Jingwei Ni、Shuhan Ge、Hao-Xuan Ma、Yanting Miao、Wangyue Lu、Mingshuai Chen、Tiancheng Zhao、Jianwei Yin

不换图,只换问题:高分有多少来自记忆?

V*Bench 是评估细粒度视觉搜索能力的常用基准,包含 191 张高分辨率真实场景图像。它的难点在于,问题往往不指向画面主体,而指向远离图像中心、面积极小、容易被忽略的局部细节 —— 论文把这类真正决定答案的内容称为visual key(视觉关键线索)。正因为答案只取决于这一小块内容,一旦它长期固定不变,模型就有机会靠记忆而非观察答对。

为了检验这一点,研究者设计了诊断实验 Relabel V*:保留原始图像,只重写问题,让新问题指向图中另一个同样小、同样偏离中心的视觉线索。在全部 191 张图像上,8 个受测 VLM 准确率均下降,降幅 9.5–18.8 个百分点。



图像未改动,仅更换问题后,8 个模型的准确率全部落在原始成绩之下,降幅 9.5–18.8 个百分点。

既然图像未变,这一下降只能来自问题与答案组合的更新。它不足以单独证明训练数据污染,但与模型从静态基准中获得记忆收益的假设一致。不过这种做法有个明显的局限:每一轮都要人工重写全部问题,成本无法长期承担。ReKey 要回答的正是这个问题 —— 能否只做一次人工准备,之后让视觉线索自动持续更新?

怎么做到每轮评测都不一样?

ReKey 的思路是把人工投入压缩到一次性的准备工作上,之后交给自动流程反复产出新题。整个流程分四步:先由标注者在图上圈出可以被改动的小块区域(论文称为 edit slot),随后系统随机采样一组新的视觉内容,用图像编辑模型写入该区域,最后依据这次采样的记录直接生成对应的问题和答案。



人工标注只发生在最左侧一次,右侧的采样、编辑与问答构造在每轮评测中自动重复。

标注者需要圈出的区域有两类:Replace slot指向图中已有的目标,用于改变它的颜色;Add slot指向一处合理的空白位置,用于插入原图中不存在的小物体。两类区域都要求紧凑、位置合理,并且在图中具有唯一指代。每轮评测开始时,随机种子决定启用哪个 slot,并采样出新的颜色、物体或位置组合。采样记录既指导图像编辑,也直接确定新问题和标准答案。

这样一来,答案在图像生成之前就由采样过程确定,无需再让另一个模型检查生成结果并重新标注,每道题都能追溯到具体的 slot、随机种子和采样内容。图像编辑由 GPT-Image-2 完成,编辑后的局部区域合成回原图。改动区域只占整张图约 0.1%,且标注者选定的区域与 V*Bench 原始问题所问目标的尺度相当,从而锚定了与原基准接近的视觉搜索难度。



同一场景中只有决定答案的帽子颜色被替换,背景杂乱度与小目标尺度保持不变。

更新 visual key,记忆优势是否消失?

如果此前的差距确实源于记忆,那么更新 visual key 之后,成绩应当回落到人工重写问题的水平。研究者用 3 个随机种子各生成一套 ReKey 实例,在 8 个 VLM 上重复评测:原始 V*Bench 平均准确率 82.1%,ReKey 上降至 72.2%,平均下降 9.9 个百分点,所有模型均出现下降。降幅最大的集中在原始高分模型(Qwen3.6-Plus 下降 14.9 个百分点、Gemini 下降 13.0 个百分点),而原始成绩较低的 MiMo 和 Llama 各只下降 4.4 个百分点,与记忆收益越多、更新后失去也越多的预期一致。



ReKey 上 8 个模型成绩均低于原始 V*Bench,平均下降 9.9 个百分点,整体贴近 Relabel V* 的水平。

Relabel V*(66.9%)提供了另一个参照。Qwen 和 GPT-5.5 几乎正好落在这条基线上(分别高 1.4 和 1.2 个百分点),说明 ReKey 恢复出了与人工重写问题相当的难度;其余模型平均高出 5.3 个百分点,研究者归因于 Relabel 只有一套固定题目,而 ReKey 具备采样多样性。那么会不会只是再生的题目更难?研究者用 LLaVA-1.5-13B 做了校准 —— 它是 V*Bench 原始论文中最强的开源基线,锚定了该基准公布的难度,且污染风险较低,若成绩大幅下滑就意味着任务本身变了。结果它只下降 6.1 个百分点,低于多数前沿模型,位置类问题几乎未变,而空间关系恰是对编辑痕迹最敏感的维度。这些证据指向同一结论:准确率的下降来自记忆优势的消除,而非题目难度的变化。

为什么最关键的一步仍由人完成?

既然除标注之外的环节都已自动化,那能否把最后这步人工也交给模型?研究者试着让 GPT-5.5 自动选择 edit slot,结果并不理想:它给出的 Replace 区域只有 33.6% 能准确覆盖目标;Add 区域虽然多数可用,但面积普遍偏大,约为人工标注的 3 倍 —— 模型明显偏好宽敞、显眼、容易下笔的位置。用这些区域生成的题目系统性偏简单,8 个 VLM 的准确率比人工标注版本高出 8.4–18.5 个百分点。



VLM 选定的区域明显更宽敞显眼,面积约为人工标注的 3 倍,使自动标注版本的准确率高出 8.4–18.5 个百分点。

如果模型已能稳定定位最隐蔽的视觉线索,它可能已具备评测所要测量的感知能力;而让能力不足的模型选题,则容易将自身盲点带入基准。因此 ReKey 只将 slot 选择保留为一次性人工步骤,其余环节均可自动完成。

全部 191 张图像的 slot 标注约需 16 人时,而同一组标注可跨随机种子反复使用。ReKey 的意义不在于发布一次更大的静态数据集,而在于将高质量真实场景转化为可持续更新的评测协议:保留原有视觉搜索环境,只更新真正决定答案的那一小块 —— 只要 visual key 可以持续刷新,靠记忆答对就不再是稳定的策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
曝西贝拖欠离职补偿金!贾国龙:要到2028年才能给

曝西贝拖欠离职补偿金!贾国龙:要到2028年才能给

鞭牛士
2026-09-04 10:12:08
女子低血糖点外卖承诺打赏5元,求优先配送,外卖小哥嫌“这家店可乐难喝”,自费给网友换大瓶,女子默默将5元打赏改成20元

女子低血糖点外卖承诺打赏5元,求优先配送,外卖小哥嫌“这家店可乐难喝”,自费给网友换大瓶,女子默默将5元打赏改成20元

蓬勃新闻
2026-09-04 13:06:44
紫牛头条|中国夫妻印尼凯洛尔岛海域遇难,家属寻找同船7名游客,盼还原事发经过

紫牛头条|中国夫妻印尼凯洛尔岛海域遇难,家属寻找同船7名游客,盼还原事发经过

扬子晚报
2026-09-03 22:46:18
梦碎的王子,回家了

梦碎的王子,回家了

中国新闻周刊
2026-09-04 07:31:06
整容失败?33岁周冬雨近照脸垮僵硬像40岁大妈,撞脸郑秀文认不出

整容失败?33岁周冬雨近照脸垮僵硬像40岁大妈,撞脸郑秀文认不出

瞎说娱乐
2026-09-03 14:23:06
9月4日,人社部传来重要消息,关系到养老金待遇,挺重要的,看看

9月4日,人社部传来重要消息,关系到养老金待遇,挺重要的,看看

社保小达人
2026-09-04 11:32:13
景甜被除名,震惊全网!

景甜被除名,震惊全网!

财经三分钟pro
2026-09-03 16:39:54
胡锡进,一败涂地

胡锡进,一败涂地

求实处
2026-09-03 23:38:40
快讯!李在明政府回应了!

快讯!李在明政府回应了!

故事终将光明磊落
2026-09-04 12:48:09
武大女教授被实名举报,男方系安徽大学副校长?安徽大学回应

武大女教授被实名举报,男方系安徽大学副校长?安徽大学回应

大风新闻
2026-09-04 13:22:03
孙宇晨手撕胡锡进,去你的体面

孙宇晨手撕胡锡进,去你的体面

大嘴説
2026-09-04 10:57:52
玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

环球网资讯
2026-09-03 23:06:06
律师公开力挺星宇股份,提议把“告洋状”纳入扫黑除恶!遭全网怒斥:无良律师

律师公开力挺星宇股份,提议把“告洋状”纳入扫黑除恶!遭全网怒斥:无良律师

谭谈社会
2026-09-04 13:01:49
开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

听心堂
2026-09-04 08:54:37
女高音歌唱家龚爽因病离世,年仅37岁

女高音歌唱家龚爽因病离世,年仅37岁

扬子晚报
2026-09-04 12:23:24
陈春江当选洛阳市委书记,他曾任陕西省副省长

陈春江当选洛阳市委书记,他曾任陕西省副省长

大风新闻
2026-09-04 10:22:13
“魔岩三杰”之一、摇滚歌手何勇去世,享年57岁

“魔岩三杰”之一、摇滚歌手何勇去世,享年57岁

澎湃新闻
2026-09-04 13:10:04
突发讣告:李英宾逝世,年仅46岁

突发讣告:李英宾逝世,年仅46岁

南方都市报
2026-09-04 08:22:56
武大女教授被举报事件,男方系安徽大学副校长,安徽大学回应

武大女教授被举报事件,男方系安徽大学副校长,安徽大学回应

中国新闻周刊
2026-09-04 11:11:51
唏嘘!夏窗虽已关闭却仍有20位世界级球星无人问津,找不到新东家

唏嘘!夏窗虽已关闭却仍有20位世界级球星无人问津,找不到新东家

零度眼看球
2026-09-04 07:13:28
2026-09-04 16:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13919文章数 142729关注度
往期回顾 全部

教育要闻

怎样让家校之间的沟通更加有效

头条要闻

疑美炸弹击中伊婚礼现场 证据指向美制500磅空投弹药

头条要闻

疑美炸弹击中伊婚礼现场 证据指向美制500磅空投弹药

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

数码
本地
旅游
时尚
军事航空

数码要闻

全新联想LOQ 15 AI全能本官宣 搭载RTX 3050显卡

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

旅游要闻

陈保平:撒哈拉以南的两个城堡——非洲之行(三)

万万没想到,今年最火的鞋,竟然是这几双“经典款”

军事要闻

美国最年轻的陆军部长越级告了防长的状

无障碍浏览 进入关怀版