网易首页 > 网易号 > 正文 申请入驻

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

0
分享至





图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。

近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经常同时处理人物、服装、场景等多张参考图,建立参考图和视频的对应关系。而我们通过实验发现一个几乎所有多模态大模型都存在的问题:模型虽然可以将简单的视频主体和参考图主体对应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。

这正是现有视频描述范式的盲区。普通 Caption 只要求文本忠实于视频;多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。问题因此从 “生成一段好的描述”,变成 “在生成描述的同时建立可用的视频对象 - 参考图对应关系”。

这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?

对于这个问题,我们将多参考图场景下的视频 caption 问题进行梳理。首先。多参考图里可能有真正出现的主体和场景,也可能混入外观相似的干扰项,现有的 VLM 要么过于自信全部引用,要么过度保守又会漏掉有效信息。其次,很多 VLM 在识别参考图片时,对于同一个人或物体可能由多张不同视角图片,模型也会识别成不同的人或者物体,然而这种情况,模型需要把这些图片归到同一实体,而不是拆成多个对象。

对于这个问题,我们提出了RefCaptioner,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的 caption 进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化 caption 格式,并通过 SFT 强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。同时我们建立了双层自适应奖励函数 HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。

团队核心成员包括北京大学博士生刘腾飞、史阳以及可灵团队多模态理解负责人张远行。



  • 论文链接:https://arxiv.org/abs/2607.28509
  • 代码链接:https://github.com/pkucs-Ltf/RefCaptioner
  • 模型开源链接:https://huggingface.co/TengfeiLiuCoder/RefCaptioner
  • 开源数据集链接:https://huggingface.co/datasets/TengfeiLiuCoder/MRVBench

RefCaptioner:

让视频 caption 与参考图完成端到端绑定



图 2:RefCaptioner 方法概览。左侧为保持通用描述能力的混合数据监督微调;右侧为 HCD-GRPO,通过两个奖励分支分别约束事实描述与多参考图 grounding。

RefCaptioner 以 Qwen3-VL-8B-Instruct 为基座,为了在训练参考图识别能力的同时不丢失视觉模型对视频的感知和描述能力。在 SFT 阶段,我们将多参考图数据与通用的视频 caption 训练数据按 1∶1 均衡采样。前者包含人工核验的图像标签描述,用来教授参考图选择和局部绑定;后者用于保留事实性、覆盖度与细节表达能力。这样的混合方式避免模型为了学习标签格式,退化成一个只会「贴参考图」的系统。

同时,仅靠 SFT,模型可以学会输出格式,却未必能在复杂样本中兼顾事实描述、参考图召回和错误抑制。HCD-GRPO 因此把奖励拆成两个互补分支:一边检查描述是否忠实、完整,另一边检查参考图是否选对、绑定正确,并对可观测错误进行折扣。

  • 事实描述奖励:先去掉回答中的图像标签,再从主体、外观、动作、背景、镜头和风格六个维度检查关键事实是否覆盖,并借助视频问答库识别事实错误。



  • 正确绑定覆盖奖励:只有被正确选择、且放在正确局部短语后的参考图,才能贡献正向覆盖信号。单纯增加标签数量不会获得额外收益。
  • Distractor-Aware Evidence Suppression(DAES):训练样本会在正常参考图中随机插入无关图片,但模型不知道哪些是干扰项;一旦引用视频中没有对应内容的图片,就会受到额外惩罚。
  • Cross-Reference Semantic Coherence(CRSC):对于同一实体的多张不同视角图片,评估器从回答中抽取 “事件 — 实体 — 参考图组” 关系,检查这些图片是否被聚合到同一局部描述,而不是被错误拆分。



通过上面的奖励函数设计,从而使得模型无法依靠 “多贴图像标签” 提高覆盖率,也不能靠 “少贴图像标签” 规避错误,而是使得模型在有效绑定的基础上,提高对干扰图的识别能力。

MRVBench:

把 “描述正确” 与 “图文对应” 分开评测

现有视频描述基准通常只判断文本是否覆盖视频内容,却无法回答模型有没有选对参考图、标签是否落在正确短语后,以及是否误用了干扰项。为此,研究团队构建了 MRVBench,用统一协议同时评估视频事实性与多参考图 grounding。



图 3:MRVBench 数据构建流程。从真实视频和 AIGC 视频出发,依次完成关键帧提取、六维 Caption 标注、参考图池整理与干扰项注入、局部标签绑定和人工专家核验。

MRVBench 与训练语料覆盖了从简单对应到复杂多图映射的多种情况:

  • 训练语料包含 20,000 个视频和 171,354 张参考图。
  • 公开的 MRVBench 测试集包含 462 个与训练语料完全隔离的视频,其中 185 个为 AIGC 视频、277 个为真实视频,共配有 3,831 张候选参考图。
  • 单个样本最多包含 22 张参考图;约 60% 的样本具有多图对应同一主体或视觉单元的复杂映射,约 40% 的样本包含人为注入的干扰图。
  • 冻结评测库包含 5,846 个视频关键事实和 2,172 个短答案问题,覆盖主体、外观、动作、背景、镜头和风格。

不只看 Caption 是否流畅,MRVBench 如何评测?

MRVBench 将评测拆成五个方面:视频事实覆盖与正确性、参考图选择、局部短语绑定、干扰图鲁棒性,以及同一主体多参考图的一致性。所有模型接收相同的视频、任务指令和有序参考图,评分依赖冻结的关键事实、问答库与结构化标注,尽量把 “写得像” 与 “对应得准” 区分开。

实验结果:

参考图越多,优势越明显

论文将 RefCaptioner 与多种 7B–38B 开源模型进行比较,并加入 Gemini-3.1-Pro 和 GPT-5.4 作为闭源参考。8B 参数的 RefCaptioner 在所有多参考图 grounding 指标上取得了开源模型最佳表现,综合结果接近 Gemini-3.1-Pro,并高于 GPT-5.4。



图 4:MRVBench 上不同模型的视频事实理解与多参考图 grounding 结果。

在最核心的 reference grounding 上,RefCaptioner 同时保持较高的选图精度、召回和局部绑定质量,并在干扰图排除与多视角主体归组上明显优于其他开源模型。这一点很重要:高召回并不是靠 “多贴标签” 换来的,模型确实学会了在覆盖有效参考图的同时抑制错误引用。





图 5:VDC Benchmark 与 VCapsBench 上不同 VLM 的视频描述评测结果。

值得注意的是,多参考图训练并没有牺牲普通视频描述能力。在 细粒度 Video caption 评测基准 VDC Bench 上,短描述、背景、主体和细节等多个维度,RefCaptioner 均取得最高准确率;在 评测基准 VCapsBench 上,其描述覆盖和一致性也超过 Qwen3-VL-8B 基座。换言之,模型没有退化成一个只会插入图像标签的 VLM。



图 6:HCD-GRPO 消融结果。Base 为 Qwen3-VL-8B-Instruct;完整模型同时使用事实描述奖励、DAES 和 CRSC。

消融实验显示,SFT 能显著提高主体参考图召回,却会暂时影响视频问答表现;加入完整 HCD-GRPO 后,事实描述能力得到恢复,干扰图排除和主体一致性也进一步改善。三个奖励组件分别对应事实性、错误引用抑制和跨参考图一致性,作用相互补充。

参考图越多

模型还能稳定绑定吗?

为了观察模型面对复杂参考图池时的稳定性,论文按参考图数量将样本划分为 2–4、5–8、9–12 和 13+ 四组,并将参考图召回、局部绑定准确率和干扰图排除率相乘,得到一个对任何短板都敏感的鲁棒性分数。



图 7:参考图数量增加时不同模型的 grounding 鲁棒性。

根据图 7,我们发现,通过比较不同模型的结果,RefCaptioner 在四个区间均保持领先;在最困难的 13+ 参考图时仍高于 GPT-5.4。

人工评测与视频重建:

Grounding 真的有用吗?

从 Caption 回到视频:一次端到端检验

为了检验 grounded caption 的下游价值,论文使用 “模型生成的描述 + 该描述实际引用的参考图” 重建原视频。我们基于开源视频生成模型,Wan2.1-VACE-14B ,生成视频,生成视频时,参数保持不变,唯一变化的是输入 prompt,即不同 VLM 提供的原视频 Caption 还有参考图集合。 为了评价生成视频对原视频的还原程度。我们找了三位多模态专家对生成视频和原视频的还原程度进行比较并绘制 GSB 图。

三名专家采用成对 Good/Same/Bad(GSB)协议,对 RefCaptioner 与各基线生成的重建视频进行匿名比较。Good 表示 RefCaptioner 条件下的结果更符合源视频,Bad 表示基线更好,Same 表示两者相当。



图 8:描述条件视频重建的成对 GSB 人工评测。与每个基线相比,RefCaptioner 获得的 Good 比例均高于 Bad,面对开源模型时优势尤其明显。

这项评测衡量的不是孤立的文本质量,而是 “描述生成 + 参考图选择” 的端到端效用。RefCaptioner 在所有成对比较中都获得更多 Good 而非 Bad,说明其输出的描述和参考图组合保留了更多源视频中的主体、外观、动作与场景信息。



图 9:AIGC 样本 000070 的视频重建对比。不同方法采用同一 Wan2.1-VACE 后端和相同生成设置,仅替换 captioner 产生的描述与参考图子集。

总结:

多参考图 Caption 需要的不只是文本质量

RefCaptioner 处理的不是在普通 Caption 后追加图片引用,而是让模型在生成描述的同时回答三个问题:哪些图真的与视频相关、每张图对应哪个局部视觉事实,以及相似但无关的图片是否应该被拒绝。

随着多参考图视频生成、编辑的发展,Multi-reference grounding 将成为连接参考图与视频语义的一个关键接口。RefCaptioner 提供了一个多参考图视频理解的有效算法,而 MRVBench 提供了一套评测多参考图视频 caption 准确性的基准,二者共同为更准确、更可控的多参考图视频理解奠定了基础。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王艺迪和张本美和同区,陈熠和削球手同区,蒯曼对战早田希娜

王艺迪和张本美和同区,陈熠和削球手同区,蒯曼对战早田希娜

子水体娱
2026-09-06 15:38:17
英国遭到拒绝后发出警告,中国若不合作,中企海外资产将被没收!

英国遭到拒绝后发出警告,中国若不合作,中企海外资产将被没收!

冷眼看尽世间繁华
2026-04-05 03:49:18
未来7天迎来好运吉利的三大生肖,有横财喜事,赚得盆满钵满

未来7天迎来好运吉利的三大生肖,有横财喜事,赚得盆满钵满

毅谈生肖
2026-09-06 09:40:51
如果一个人混到了60岁,能拥有这3样东西,那绝对是人生赢家

如果一个人混到了60岁,能拥有这3样东西,那绝对是人生赢家

小影的娱乐
2026-08-07 00:08:30
气温猛降!江苏入秋最新预测!

气温猛降!江苏入秋最新预测!

最江阴
2026-09-06 08:58:20
太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

太恶心了!一女乘客发帖吐槽,足足4小时啊,快被旁边大哥的屁股,熏得想“跳飞机”

火山詩话
2026-09-03 08:55:21
沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

墨子翟的日记y
2026-09-06 13:08:09
皇马自己先炸了!前4轮首发3次,皇马21岁新星成了更衣室火药桶?

皇马自己先炸了!前4轮首发3次,皇马21岁新星成了更衣室火药桶?

阿陆
2026-09-06 15:43:49
第一个被姑姑退回来的孩子!一段视频,戳破亲戚间体面的遮羞布!

第一个被姑姑退回来的孩子!一段视频,戳破亲戚间体面的遮羞布!

世界圈
2026-08-27 21:36:51
李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

娱乐团长
2026-06-02 15:09:12
锦旗藏刀刺向医生,贵中医二附院发生伤医事件,警方通报!医生身中多刀,目前仍在ICU抢救

锦旗藏刀刺向医生,贵中医二附院发生伤医事件,警方通报!医生身中多刀,目前仍在ICU抢救

梅斯医学
2026-09-06 09:13:30
建议把大学生维权纳入扫黑除恶范围,这得心肠歹毒到啥程度才能想得出?

建议把大学生维权纳入扫黑除恶范围,这得心肠歹毒到啥程度才能想得出?

壹家言
2026-09-05 14:59:26
还没出4S店,刚交付的新车被销售撞了!店长称不能退换:发票已开,交付确认书已签……

还没出4S店,刚交付的新车被销售撞了!店长称不能退换:发票已开,交付确认书已签……

19楼
2026-09-03 15:53:56
蓝白合破局,赖清德再次躺着选?郑丽文、卢秀燕、韩国瑜齐聚彰化

蓝白合破局,赖清德再次躺着选?郑丽文、卢秀燕、韩国瑜齐聚彰化

可爱大王呼
2026-09-06 13:22:00
快讯!乌克兰传来新消息!

快讯!乌克兰传来新消息!

故事终将光明磊落
2026-09-06 09:41:48
普京政权恐被推翻?西方情报头子发出警告,俄政权可能产生巨变!

普京政权恐被推翻?西方情报头子发出警告,俄政权可能产生巨变!

观锐器
2026-09-03 18:13:53
周杰伦晒郑钦文赛后采访照,配文:这个逆转

周杰伦晒郑钦文赛后采访照,配文:这个逆转

懂球帝
2026-09-06 02:42:09
“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

“好像被割一样痛”!母子俩草地休憩后,全身莫名刺痛,医生从皮肤里挑出近30处“细针”

环球网资讯
2026-09-04 19:23:18
中国女游客新加坡街头遭抢!刚用4.4万人民币换的8000新币,连古驰包一起没了...

中国女游客新加坡街头遭抢!刚用4.4万人民币换的8000新币,连古驰包一起没了...

新加坡眼
2026-09-05 19:12:22
上汽新车官宣:9月10日 ,正式预售

上汽新车官宣:9月10日 ,正式预售

科技堡垒
2026-09-05 10:32:59
2026-09-06 16:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13930文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

头条要闻

辽宁一处长单位门口遭枪击连中两枪 唯一目击证人发声

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
数码
教育
本地
公开课

PS实体光盘大砍90%?索尼出面澄清:官方整出大乌龙

数码要闻

消息称苹果正在研发两款游戏手柄

教育要闻

创意微视频|新学期,“新”在哪里?

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版