网易首页 > 网易号 > 正文 申请入驻

为了理解而生成:他们用合成数据教会模型「视频通话」

0
分享至



一、什么是 OmniVChat?

从音视频问答到原生音视频对话

现有的音视频交互的研究中,对 “交互” 的定义往往其实是对音视频内容的问答,比如对于一个流式视频,用户输入一个文本问题,然后模型选择合适的时机回答。这样的交互和日常用户和 AI 的交互范式(比如和 AI 打视频电话)差别很大。



在这篇文章中,我们把 OmniVChat(Omni Video Chat)定义为原生的音视频对话:模型直接、同时接收用户音频和视频,无需额外的文本问题、外部字幕或语音识别转写,从而保留语气、停顿、表情和镜头朝向等线索。比如,用户举着手机,一边拍一边问:“我左边会议室的门开着吗?”,问题藏在语音和画面里,模型需要结合两者理解用户的处境,再给出文本回复。



  • 作者单位:香港中文大学,Alibaba Token Hub,上海交通大学,上海创智学院,浙江大学
  • 论文标题:
  • OMNIVCHAT: SYNTHESIZING, BENCHMARKING, AND TRAINING FOR NATIVE AUDIO-VISUAL DIALOGUE
  • 论文链接 (arXiv):https://arxiv.org/abs/2609.21465
  • Hugging Face 数据集: https://huggingface.co/datasets/Harland/OmniVChat
  • GitHub 代码: https://github.com/HarlandZZC/OmniVChat
  • 第一作者:何昊林,香港中文大学 DSP LAB 博士;楚云霏,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列核心贡献者;陈琦,上海交通大学 X-LANCE LAB 博士
  • 通讯作者:徐进,Alibaba Token Hub(ATH)算法科学家,Qwen-Omni 系列项目负责人;孔秋强,香港中文大学助理教授

二、研究现状:

缺少的既是数据,也是评测标准

要研究这种能力,首先需要有用户真正面向模型提问的音视频数据,用于训练和评测。然而,用户用自己的设备与模型对话的录制数据仍然非常稀缺,难以覆盖不同环境和交互细节。特别是多轮的原生音视频对话数据,包含 AI 在前轮中对用户的回应,几乎无法找到。由于数据的稀缺性,现有的 Omni 模型的原生音视频对话能力其实有待提高,往往需要各种辅助模块(比如语音转文字)来辅助交互,但是语音转文字等等辅助模块,往往会带来额外的计算量和信息损失,拉低了交互体验的上限。

其次,一句好回复往往要同时顾及环境、物体和情绪,同一个意思又有多种表达,单靠关键词匹配难以可靠评判 AI 回复的质量。数据从哪里来、回复怎样算好,是待解决的两个问题。

三、为了理解而生成

音视频联合生成和 Agent 的进展,让我们认为「为了理解而生成」(generation for comprehension)成为了可行的路线:先明确要测试的能力,再合成对应对话,并依据实际音视频内容形成参考回复和评分标准。同一套标准既能用于评测,也能作为训练奖励。

由此,我们构建了数据引擎 OmniVChat-Studio、评测基准 OmniVChat-Bench 和强化学习奖励设计 OmniVChat-RL,把原生音视频对话的造数据、测能力和改进模型接在一起。



图 1:OmniVChat-Bench 一览。每张卡片取自一条合成对话里的用户画面。

四、OmniVChat-Studio:

单轮与多轮的原生音视频对话数据引擎

我们设计了 OmniVChat-Studio ,一个 Multi-Agent 的原生音视频对话数据引擎,输入是一份子类配置和文本语料(作为随机种子),输出是带参考回复和分层判分标准的单轮、多轮音视频对话。

在 OmniVChat-Studio 中,包含四个智能体分工协作。Director 负责场景构思、剧本与提示词、审核决策,以及参考回复和评分标准;Renderer 把通过审核的提示词及参考媒体渲染成音画同步的片段;Reviewer 观察实际音视频,写出内容描述和质量报告,并回答针对性的核验问题;Validator 则是确定性的规则校验器,检查结构化剧本或对话记录是否满足配置要求。

单轮对话数据的合成从采样开始。系统按配置抽取语言、场景、镜头方式、音画干扰等属性,并默认随机抽取三段文本语料。Director 据此构思故事,再细化用户要问什么、目标物体怎样出现在画面里、何时说话和等待,最后写成带时间线的结构化剧本。属性控制交互条件,语料拓展内容,两者共同增加同一子类中的样本多样性。

渲染之前,Validator 检查格式、时间线、语速和配置中的规则,Director 结合上下文处理违规报告,并进一步检查剧本是否真正测到了目标能力。通过审核后,Director 组织镜头、连续拍摄、音画同步等渲染要求,交给 Renderer 合成片段。

渲染之后,Reviewer 检查实际说了什么、画面出现了什么,以及切镜、肢体等质量问题。Director 对照这些证据判断是否可用;门是开是关等关键细节不清楚时,就发起定向问答核实。参考回复和评分标准在音视频被接受后形成,并以实际证据为依据。

多轮对话数据的合成需要同时维护跨轮依赖。系统先规划整段对话及媒体引用关系,再逐轮编写提示词,按需使用已通过审核的视频、音频或末帧。较早出现的物体、人物声音和场景状态因此可以成为后续轮次的依据;用户换地点或话题时,也能选择合适的历史参考。每轮的片段和回复进入历史,全部完成后再校验整段记录,必要的计划修复从受影响的轮次开始。

这套流程也为扩展能力留下了接口。新增子类时,可以围绕它的配置、特定提示词和规则定制 Flexible 模块,复用 Fixed 模块及整体审核流程。最终交付的是音视频、参考回复和 rubric 配套的数据实例,可分别服务于后面的评测与训练。



图 2:OmniVChat-Studio 框架,左为单轮子系统,右为多轮子系统。每个模块的配色对应负责它的智能体。

五、OmniVChat-Bench:

对原生音视频对话的判分方法

OmniVChat-Bench 用合成对话评测全模态模型的基础对话能力,共 2,800 条,其中单轮 2,550 条、多轮 250 条,覆盖 5 个能力大类下的 17 个子类、22 个场景域。五个大类分别为:

  • 对话状态与连接感知(DSLP):判断连接是否正常、用户是否说完,以及当前镜头朝向。用户只是在思考停顿时应等待,询问左右关系时要以用户和相机的实际位置为依据。
  • 多模态实体对齐(MEA):把语音中的指代与画面里的对象对应起来,识别多人同时说话时真正与模型交互的用户,并在多轮对话中找回先前出现的对象、跟上说话人的变化。
  • 模型自我认知(MSA):正确说明身份和能力边界。例如,面对「帮我把它搬过去」的请求,没有肢体的模型应说明物理限制,并在适用时提供可执行的替代方案。
  • 反幻觉(AH):让回复忠于音画证据。被问到的物体不在画面里时应指出缺失,用户把可见物体的颜色等事实说错时应纠正前提,避免顺着错误信息继续回答。
  • 情绪识别(ER):结合面部表情和声音识别情绪,使回复同时回应用户的情绪和请求。相同一句话,用焦虑或轻松的语气说出来,可能需要不同的回应方式。

每条数据都附有参考回复和分层评分标准(tiered rubric)。标准按层级组织,每层包含一条或多条标准,对于每一层的每个标准,只有它被打中,并且同时所有小于这一层的标准被打中,这个标准才会被计分。大语言模型充当判官,按语义逐条判断是否满足,再由确定性的计分规则汇总,因此允许不同措辞表达相同的正确意思,也能定位回复具体漏掉了什么。

多轮评测时,所有模型接收相同的历史片段和参考回复,只对最后一轮回复评分,便于比较相同上下文下的能力。



图 3:OmniVChat-Bench 总览,共 2,800 条合成数据。左:五个能力大类及其 17 个子类,环上的条长表示数据条数,角度跨度表示该层内的子类数量。右:250 条多轮数据的轮数与时长分布,按子类堆叠。

六、把评测标准直接变成奖励:

OmniVChat-RL

OmniVChat-RL 是面向原生音视频对话任务的强化学习奖励设计,联合优化回复的正确性、效率和风格。正确性直接沿用评测时的 rubric 计分方法,再加入效率、风格两项质量信号,以及仅用于训练的格式项,让「答得对、表达简洁、适合对话」一起影响模型更新。

训练数据 OmniVChat-Bench-Train 包含 5,600 条合成对话和独立的 560 条开发数据,每条对话及其 rubric 都由 Studio 合成。开发集用来选 checkpoint;2,800 条 OmniVChat-Bench 数据用于检验训练成效,与训练视频不重叠;我们还构造了真人录制的 OmniVChat-Bench-Human ,只用于评测真实交互泛化,不参与训练或选点。对训练中采样的回复 y,总奖励为:

R (y)=r (y)+0.5f (y)+0.1e (y)+0.5s (y)

其中,r (y) 是分层 rubric 得分,决定回答是否抓住了该条对话的关键要求;f (y) 检查回复非空且不包含思考标签。

效率项 e (y) 比较回答同一个问题的多条候选回复。先把各自的 rubric 得分除以回复长度,再在同组候选间做 min-max 归一化,最小值记为 0、最大值记为 1,中间值按比例计分。这样,同样答对时更简洁的回复会得到更高的效率奖励,也无需给所有问题规定统一的字数目标。

风格项 s (y) 对应训练 system prompt 中的表达要求,包括自然口语、简洁表达、区分角色扮演与真实事实等。这些要求和语法流畅性共同组成七条标准,全部满足才得 1,否则得 0。训练奖励与评测 Style 使用同一套判官和标准,Style 汇报成功判分回复中七条全部通过的比例。

基座是 Qwen3-Omni-30B-A3B-Instruct 的 Thinker,直接编码视频和音频并输出文本。训练采用 GSPO、 rank 64 LoRA,保持音频和视觉编码器冻结,共 1,000 步,每 20 步保存一次 checkpoint,最终按开发集的 Subcategory Mean 选择第 940 步,并用同一个 checkpoint 检验合成评测集与真人录制集上的效果。



图 4:OmniVChat-RL 的 1,000 步训练。上:各奖励项的未加权值、绝对回复效率和平均回复长度。下:每 20 步在开发集、OmniVChat-Bench 与 OmniVChat-Bench-Human 上的 rubric 得分;右图以 Bench 中文子集作语言匹配对照。

七、结论:合成训练能高度泛化到真实交互场景

最重要的结果是:仅使用合成对话进行强化学习,模型在真实交互中的回复质量也明显提升。同一个 checkpoint 在 OmniVChat-Bench 上由 0.465 提升到 0.652,在完全不参与训练和选点的 OmniVChat-Bench-Human 上由 0.402 提升到 0.632,真人集提高 0.230。提升并未局限在合成视频的分布内,而是迁移到了真人手持设备拍摄、具有自然环境与真实说话方式的输入中。

OmniVChat 由此给出了一条可扩展的技术路线:以生成覆盖稀缺场景,以审核保证证据可靠,以分层标准统一评测与奖励,再用真实录制数据做独立验证。合成数据并不意味着真实数据不再重要;真实数据仍是检验泛化、发现遗漏能力和校准生成分布的关键。但实验表明,在真人交互数据昂贵且难以大规模获得时,经过严格设计的合成数据已经能够有效训练面向现实世界的原生音视频对话模型,并为后续融合更多真实反馈、拓展复杂多轮场景提供坚实起点。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
涉案金额过亿 刘应成(原法名释永信)一审被判有期徒刑24年

涉案金额过亿 刘应成(原法名释永信)一审被判有期徒刑24年

每日经济新闻
2026-05-30 00:42:59
含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

健康之光
2026-09-25 07:25:20
“交个朋友”为直播间售出劣质溜溜凳道歉并启动退款后,罗永浩炮轰俞敏洪:东方甄选销售获利千万,到现在不认错、不道歉、不全量退款

“交个朋友”为直播间售出劣质溜溜凳道歉并启动退款后,罗永浩炮轰俞敏洪:东方甄选销售获利千万,到现在不认错、不道歉、不全量退款

芒果都市
2026-09-28 14:08:13
看到中方随行团队,特朗普心里明白,早到的一个半小时,没有白等

看到中方随行团队,特朗普心里明白,早到的一个半小时,没有白等

司马平邦
2026-09-27 13:06:49
体检报告出现这几个字,距离癌症只有一步之遥!别等得癌了才后悔

体检报告出现这几个字,距离癌症只有一步之遥!别等得癌了才后悔

健康之光
2026-06-01 08:56:18
“升糖直接爆了”,家长晒儿子上学早餐,网友:吃完了倒头就睡

“升糖直接爆了”,家长晒儿子上学早餐,网友:吃完了倒头就睡

泽泽先生
2026-09-21 13:37:01
霍华德:我当年太傻了!!

霍华德:我当年太傻了!!

柚子说球
2026-09-28 09:53:19
前国脚:别喊邵佳一下课!国足后卫不合格别上场了 扩军也难进世界杯

前国脚:别喊邵佳一下课!国足后卫不合格别上场了 扩军也难进世界杯

念洲
2026-09-28 09:33:59
中国民企排名大换血:美的未进前10,阿里巴巴仅第2,第一得多强

中国民企排名大换血:美的未进前10,阿里巴巴仅第2,第一得多强

有牙的兔纸
2026-09-28 18:26:41
香港演员佘诗曼食物中毒,致体重到新低点,不足90斤

香港演员佘诗曼食物中毒,致体重到新低点,不足90斤

三湘都市报
2026-09-27 19:20:45
国足vs韩国时间已定!CCTV5直播,面临三大劣势仍有机会进决赛

国足vs韩国时间已定!CCTV5直播,面临三大劣势仍有机会进决赛

领略快乐真谛
2026-09-28 13:03:04
两地突发地震!

两地突发地震!

山西晚报
2026-09-28 09:30:54
“张家齐妈妈原谅张家齐了”冲上热搜,张家齐妈妈给女儿念家书:虽然你表现得不太好,妈妈还是选择信任你,原谅你

“张家齐妈妈原谅张家齐了”冲上热搜,张家齐妈妈给女儿念家书:虽然你表现得不太好,妈妈还是选择信任你,原谅你

极目新闻
2026-09-28 11:51:33
31分+14助+6断+9记三分球!22岁探花疯狂增肌,他要抢最佳第六人

31分+14助+6断+9记三分球!22岁探花疯狂增肌,他要抢最佳第六人

微评体育圈
2026-09-28 11:33:33
伊朗连续袭击19艘船!革命卫队这么狂妄?伊朗明白自己在干什么吗

伊朗连续袭击19艘船!革命卫队这么狂妄?伊朗明白自己在干什么吗

墨子翟的日记y
2026-09-28 12:47:43
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
今夜起下半年来最强冷空气来袭 北方寒凉加重南方告别暑热

今夜起下半年来最强冷空气来袭 北方寒凉加重南方告别暑热

北青网-北京青年报
2026-09-28 12:39:04
600万年薪谈崩,那不勒斯核心遭米兰双雄争抢,明夏可免签

600万年薪谈崩,那不勒斯核心遭米兰双雄争抢,明夏可免签

大羽体坛
2026-09-28 09:57:16
没招!钱多女孩多!但他说不快乐啊!

没招!钱多女孩多!但他说不快乐啊!

柚子说球
2026-09-27 21:48:35
毛主席笑问尼泊尔首相,珠峰干脆全给你?反问后甩出更高明方案

毛主席笑问尼泊尔首相,珠峰干脆全给你?反问后甩出更高明方案

纪史行者
2026-09-16 06:25:03
2026-09-28 19:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14097文章数 142740关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

头条要闻

男子醉驾碾压拖行女教师5.9公里 事后烧毁存储卡冲走

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

智界R7上市售价23.98万起 8大升级/搭载华为乾崑ADS 5

态度原创

时尚
亲子
房产
手机
健康

秋季,用丝巾把基础款穿出新意!

亲子要闻

龙宝打算去姥家长住,上大棚接姥爷回家,一人一辆三轮车太带价了

房产要闻

太意外!三亚重磅宅地,终止出让!

手机要闻

天马“认领”荣耀Magic9标准版手机OLED屏幕,采用新一代U11发光基材

这些食物,可能正在偷偷养痘!

无障碍浏览 进入关怀版