网易首页 > 网易号 > 正文 申请入驻

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

0
分享至





图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。

近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经常同时处理人物、服装、场景等多张参考图,建立参考图和视频的对应关系。而我们通过实验发现一个几乎所有多模态大模型都存在的问题:模型虽然可以将简单的视频主体和参考图主体对应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。

这正是现有视频描述范式的盲区。普通 Caption 只要求文本忠实于视频;多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。问题因此从 “生成一段好的描述”,变成 “在生成描述的同时建立可用的视频对象 - 参考图对应关系”。

这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?

对于这个问题,我们将多参考图场景下的视频 caption 问题进行梳理。首先。多参考图里可能有真正出现的主体和场景,也可能混入外观相似的干扰项,现有的 VLM 要么过于自信全部引用,要么过度保守又会漏掉有效信息。其次,很多 VLM 在识别参考图片时,对于同一个人或物体可能由多张不同视角图片,模型也会识别成不同的人或者物体,然而这种情况,模型需要把这些图片归到同一实体,而不是拆成多个对象。

对于这个问题,我们提出了RefCaptioner,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的 caption 进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化 caption 格式,并通过 SFT 强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。同时我们建立了双层自适应奖励函数 HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。

团队核心成员包括北京大学博士生刘腾飞、史阳以及可灵团队多模态理解负责人张远行。



  • 论文链接:https://arxiv.org/abs/2607.28509
  • 代码链接:https://github.com/pkucs-Ltf/RefCaptioner
  • 模型开源链接:https://huggingface.co/TengfeiLiuCoder/RefCaptioner
  • 开源数据集链接:https://huggingface.co/datasets/TengfeiLiuCoder/MRVBench

RefCaptioner:

让视频 caption 与参考图完成端到端绑定



图 2:RefCaptioner 方法概览。左侧为保持通用描述能力的混合数据监督微调;右侧为 HCD-GRPO,通过两个奖励分支分别约束事实描述与多参考图 grounding。

RefCaptioner 以 Qwen3-VL-8B-Instruct 为基座,为了在训练参考图识别能力的同时不丢失视觉模型对视频的感知和描述能力。在 SFT 阶段,我们将多参考图数据与通用的视频 caption 训练数据按 1∶1 均衡采样。前者包含人工核验的图像标签描述,用来教授参考图选择和局部绑定;后者用于保留事实性、覆盖度与细节表达能力。这样的混合方式避免模型为了学习标签格式,退化成一个只会「贴参考图」的系统。

同时,仅靠 SFT,模型可以学会输出格式,却未必能在复杂样本中兼顾事实描述、参考图召回和错误抑制。HCD-GRPO 因此把奖励拆成两个互补分支:一边检查描述是否忠实、完整,另一边检查参考图是否选对、绑定正确,并对可观测错误进行折扣。

  • 事实描述奖励:先去掉回答中的图像标签,再从主体、外观、动作、背景、镜头和风格六个维度检查关键事实是否覆盖,并借助视频问答库识别事实错误。



  • 正确绑定覆盖奖励:只有被正确选择、且放在正确局部短语后的参考图,才能贡献正向覆盖信号。单纯增加标签数量不会获得额外收益。
  • Distractor-Aware Evidence Suppression(DAES):训练样本会在正常参考图中随机插入无关图片,但模型不知道哪些是干扰项;一旦引用视频中没有对应内容的图片,就会受到额外惩罚。
  • Cross-Reference Semantic Coherence(CRSC):对于同一实体的多张不同视角图片,评估器从回答中抽取 “事件 — 实体 — 参考图组” 关系,检查这些图片是否被聚合到同一局部描述,而不是被错误拆分。



通过上面的奖励函数设计,从而使得模型无法依靠 “多贴图像标签” 提高覆盖率,也不能靠 “少贴图像标签” 规避错误,而是使得模型在有效绑定的基础上,提高对干扰图的识别能力。

MRVBench:

把 “描述正确” 与 “图文对应” 分开评测

现有视频描述基准通常只判断文本是否覆盖视频内容,却无法回答模型有没有选对参考图、标签是否落在正确短语后,以及是否误用了干扰项。为此,研究团队构建了 MRVBench,用统一协议同时评估视频事实性与多参考图 grounding。



图 3:MRVBench 数据构建流程。从真实视频和 AIGC 视频出发,依次完成关键帧提取、六维 Caption 标注、参考图池整理与干扰项注入、局部标签绑定和人工专家核验。

MRVBench 与训练语料覆盖了从简单对应到复杂多图映射的多种情况:

  • 训练语料包含 20,000 个视频和 171,354 张参考图。
  • 公开的 MRVBench 测试集包含 462 个与训练语料完全隔离的视频,其中 185 个为 AIGC 视频、277 个为真实视频,共配有 3,831 张候选参考图。
  • 单个样本最多包含 22 张参考图;约 60% 的样本具有多图对应同一主体或视觉单元的复杂映射,约 40% 的样本包含人为注入的干扰图。
  • 冻结评测库包含 5,846 个视频关键事实和 2,172 个短答案问题,覆盖主体、外观、动作、背景、镜头和风格。

不只看 Caption 是否流畅,MRVBench 如何评测?

MRVBench 将评测拆成五个方面:视频事实覆盖与正确性、参考图选择、局部短语绑定、干扰图鲁棒性,以及同一主体多参考图的一致性。所有模型接收相同的视频、任务指令和有序参考图,评分依赖冻结的关键事实、问答库与结构化标注,尽量把 “写得像” 与 “对应得准” 区分开。

实验结果:

参考图越多,优势越明显

论文将 RefCaptioner 与多种 7B–38B 开源模型进行比较,并加入 Gemini-3.1-Pro 和 GPT-5.4 作为闭源参考。8B 参数的 RefCaptioner 在所有多参考图 grounding 指标上取得了开源模型最佳表现,综合结果接近 Gemini-3.1-Pro,并高于 GPT-5.4。



图 4:MRVBench 上不同模型的视频事实理解与多参考图 grounding 结果。

在最核心的 reference grounding 上,RefCaptioner 同时保持较高的选图精度、召回和局部绑定质量,并在干扰图排除与多视角主体归组上明显优于其他开源模型。这一点很重要:高召回并不是靠 “多贴标签” 换来的,模型确实学会了在覆盖有效参考图的同时抑制错误引用。





图 5:VDC Benchmark 与 VCapsBench 上不同 VLM 的视频描述评测结果。

值得注意的是,多参考图训练并没有牺牲普通视频描述能力。在 细粒度 Video caption 评测基准 VDC Bench 上,短描述、背景、主体和细节等多个维度,RefCaptioner 均取得最高准确率;在 评测基准 VCapsBench 上,其描述覆盖和一致性也超过 Qwen3-VL-8B 基座。换言之,模型没有退化成一个只会插入图像标签的 VLM。



图 6:HCD-GRPO 消融结果。Base 为 Qwen3-VL-8B-Instruct;完整模型同时使用事实描述奖励、DAES 和 CRSC。

消融实验显示,SFT 能显著提高主体参考图召回,却会暂时影响视频问答表现;加入完整 HCD-GRPO 后,事实描述能力得到恢复,干扰图排除和主体一致性也进一步改善。三个奖励组件分别对应事实性、错误引用抑制和跨参考图一致性,作用相互补充。

参考图越多

模型还能稳定绑定吗?

为了观察模型面对复杂参考图池时的稳定性,论文按参考图数量将样本划分为 2–4、5–8、9–12 和 13+ 四组,并将参考图召回、局部绑定准确率和干扰图排除率相乘,得到一个对任何短板都敏感的鲁棒性分数。



图 7:参考图数量增加时不同模型的 grounding 鲁棒性。

根据图 7,我们发现,通过比较不同模型的结果,RefCaptioner 在四个区间均保持领先;在最困难的 13+ 参考图时仍高于 GPT-5.4。

人工评测与视频重建:

Grounding 真的有用吗?

从 Caption 回到视频:一次端到端检验

为了检验 grounded caption 的下游价值,论文使用 “模型生成的描述 + 该描述实际引用的参考图” 重建原视频。我们基于开源视频生成模型,Wan2.1-VACE-14B ,生成视频,生成视频时,参数保持不变,唯一变化的是输入 prompt,即不同 VLM 提供的原视频 Caption 还有参考图集合。 为了评价生成视频对原视频的还原程度。我们找了三位多模态专家对生成视频和原视频的还原程度进行比较并绘制 GSB 图。

三名专家采用成对 Good/Same/Bad(GSB)协议,对 RefCaptioner 与各基线生成的重建视频进行匿名比较。Good 表示 RefCaptioner 条件下的结果更符合源视频,Bad 表示基线更好,Same 表示两者相当。



图 8:描述条件视频重建的成对 GSB 人工评测。与每个基线相比,RefCaptioner 获得的 Good 比例均高于 Bad,面对开源模型时优势尤其明显。

这项评测衡量的不是孤立的文本质量,而是 “描述生成 + 参考图选择” 的端到端效用。RefCaptioner 在所有成对比较中都获得更多 Good 而非 Bad,说明其输出的描述和参考图组合保留了更多源视频中的主体、外观、动作与场景信息。



图 9:AIGC 样本 000070 的视频重建对比。不同方法采用同一 Wan2.1-VACE 后端和相同生成设置,仅替换 captioner 产生的描述与参考图子集。

总结:

多参考图 Caption 需要的不只是文本质量

RefCaptioner 处理的不是在普通 Caption 后追加图片引用,而是让模型在生成描述的同时回答三个问题:哪些图真的与视频相关、每张图对应哪个局部视觉事实,以及相似但无关的图片是否应该被拒绝。

随着多参考图视频生成、编辑的发展,Multi-reference grounding 将成为连接参考图与视频语义的一个关键接口。RefCaptioner 提供了一个多参考图视频理解的有效算法,而 MRVBench 提供了一套评测多参考图视频 caption 准确性的基准,二者共同为更准确、更可控的多参考图视频理解奠定了基础。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

汉史趣闻
2026-09-02 18:57:28
7尺3中国新星遭前球员泼冷水:她还没准备好打WNBA

7尺3中国新星遭前球员泼冷水:她还没准备好打WNBA

星河漫山野
2026-09-05 13:36:55
事情闹大了!中方宣布撤展,展馆一夜搬空,首尔紧急喊话求原谅

事情闹大了!中方宣布撤展,展馆一夜搬空,首尔紧急喊话求原谅

爱下厨的阿酾
2026-09-06 05:01:25
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
广东625分放弃华南理工,报考广州中医药大学中医学,从业四年的真实感受

广东625分放弃华南理工,报考广州中医药大学中医学,从业四年的真实感受

音乐时光的娱乐
2026-09-06 12:56:57
57岁摇滚歌手何勇死因曝光!一直饱受精神疾病折磨,自己选择结束痛苦

57岁摇滚歌手何勇死因曝光!一直饱受精神疾病折磨,自己选择结束痛苦

小徐讲八卦
2026-09-05 12:12:40
北京姥姥街头崩溃:带俩外孙15年,姑爷碗都不洗穿10元上衣不敢换

北京姥姥街头崩溃:带俩外孙15年,姑爷碗都不洗穿10元上衣不敢换

娱乐圈见解说
2026-09-06 10:47:51
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
韩国女篮送法国提前晋级!韩媒:输欧洲最强不丢人,下一场赢球锁第二

韩国女篮送法国提前晋级!韩媒:输欧洲最强不丢人,下一场赢球锁第二

颜小白的篮球梦
2026-09-06 12:29:25
说不尽的魔幻与荒诞,终于还是瞒不住了

说不尽的魔幻与荒诞,终于还是瞒不住了

胖胖说他不胖
2026-09-05 20:23:19
今日热意不减,明天午后起北京将有小到中雨

今日热意不减,明天午后起北京将有小到中雨

新京报
2026-09-06 11:46:03
10万亿转移支付的真相!一旦沿海税源萎缩,体制内会面临什么?

10万亿转移支付的真相!一旦沿海税源萎缩,体制内会面临什么?

说故事的阿袭
2026-09-05 06:47:30
重返美网第2周!兹维列夫3-0过关,本赛季大满贯全16强唯一一人

重返美网第2周!兹维列夫3-0过关,本赛季大满贯全16强唯一一人

全景体育V
2026-09-06 13:22:06
徐杰要被挤走了!广东宏远更衣室大震荡,这次新赛季能进总决赛了

徐杰要被挤走了!广东宏远更衣室大震荡,这次新赛季能进总决赛了

国足未赢够
2026-09-06 11:04:05
杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

东方不败然多多
2026-09-06 15:04:36
因苹果对质量要求极其严格,消息称折叠屏iPhone初期日产仅数百部

因苹果对质量要求极其严格,消息称折叠屏iPhone初期日产仅数百部

IT之家
2026-09-04 21:29:03
要打,奉陪到底,中方准时断供,不给稀土,美国还敢脱钩不?

要打,奉陪到底,中方准时断供,不给稀土,美国还敢脱钩不?

江启
2026-09-06 03:40:03
比米饭还升糖的6种蔬菜,晚上尽量少吃!很多人天天当减肥菜吃

比米饭还升糖的6种蔬菜,晚上尽量少吃!很多人天天当减肥菜吃

刘哥谈体育
2026-09-06 11:21:35
高速通行费10月1日改革落地!车主出行费用迎来新变化

高速通行费10月1日改革落地!车主出行费用迎来新变化

娱乐圈的笔娱君
2026-09-05 06:06:20
再就业!威少官宣!加盟新联赛!50亿啊!!!

再就业!威少官宣!加盟新联赛!50亿啊!!!

柚子说球
2026-09-05 13:44:58
2026-09-06 15:35:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13924文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
教育
手机
家居
亲子

国产新游全新10h试玩来了!性感女主美乳白腿香肩

教育要闻

日常英语:进错厕所了,很尴尬

手机要闻

飞傲预热全球首款便携安卓数字转盘DT11,零售价预计2000元左右

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

平时忙碌,亏欠了孩子很多陪伴。趁着闲暇,带两个小朋友出门撒欢,看着他们开心奔跑的样子,瞬间觉得一切都值得,简单的幸福莫过于此。

无障碍浏览 进入关怀版