网易首页 > 网易号 > 正文 申请入驻

微信搜一搜 AI 问答,为什么越来越好用了?

0
分享至

清华与微信的研究团队分享了微信 AI 问答线上模型的训练范式,聚焦后训练中如何让大模型持续进化。该模型已在生产环境全量上线,欢迎大家体验~

论文链接:

https://arxiv.org/abs/2607.20083


在微信顶部搜索框输入问题,AI 问答即刻给出答案

前言|大模型如何持续进化?

当大模型已经能给出不错的回答,怎样让它继续进步?在后训练中,每一次优化都需要评价体系判断哪些回答更好,并据此为模型提供下一步的训练指导。然而,随着模型能力不断提升,生成的回答普遍达到较高质量。此时,回答之间的优劣越来越难区分,原有评价体系逐渐失去区分能力,也就成为模型持续进化的阻碍。

已有方法往往“绕着走”,借助能力更强的闭源评价模型,或追加人工标注。这些方法能够补充训练指导,却也意味着持续投入:随着模型的更新,评价体系需要随之升级,成本会在一轮轮迭代中不断累积。如何让评价体系摆脱成本高昂的“外援”,与模型一起进步——这是强模型持续进化必须解决的问题。

面对这一难题,清华大学与腾讯微信的研究团队公开了论文 Co-Evolving LLM Evaluators and Policies via DynamicRubric,分享了当前微信 AI 问答线上模型采用的持续自进化训练范式。大模型在其中同时扮演两个角色:一边是努力变聪明的“学生”模型,一边是越来越严格的“老师”评价体系。“学生”不断给出更好的回答,“老师”也相应地不断提高评价要求,大模型由此在一轮轮自我较量中持续进化。


理论分析|为什么评价体系也需要进化


论文首先从理论层面分析了评价体系为什么必须跟着模型一起进化。

在后训练中,模型根据评价体系的反馈进行优化。论文证明,驱动这一优化的信号,正是评价体系对好坏回答给出的分差。评价体系一旦无法区分回答,模型也就失去继续进步的有效指导。


传统的评价体系不会随当前模型的能力水平动态变化,因此很难捕捉同一组回答之间最细微的差异。论文进一步指出,让评价体系同时读取问题和当前模型生成出的回答,可以围绕关键区分之处动态生成评价标准。理论下界表明,相比传统的逐一评分,这种方式更有利于维持排序能力。


让评价体系看到模型生成的回答,解决的是当前优化中如何分辨优劣。模型完成一轮优化后,生成的回答随之变化,上一轮有效的评价标准又可能失去区分能力。因此,评价体系还要跟着新回答更新,再用更新后的评价结果指导模型继续优化。


论文据此将二者写成联合优化的形式,让评价体系与模型交替更新。模型推动评价体系变强,评价体系再推动模型进步,形成共同进化。


方法实现|让大模型分饰不同角色

DynamicRubric 不引入其他模型,而是直接将同一大模型复制三份,分别初始化策略模型 DR-Policy(P)、评价标准生成器 DR-Generator(G)和评价标准验证器 DR-Verifier(V)。后两者组成评价体系,为 DR-Policy 提供训练反馈。


在训练中,DR-Policy 接收用户问题并生成多个回答。DR-Generator 同时读取问题和这些回答,生成一组评价标准(rubric)。每条评价标准都是可用“是/否”核验的明确检查项。DR-Verifier 逐项判断每个回答是否满足要求,再将结果汇总为回答得分。每个得分都能追溯到具体检查项,评价过程也因此可解释。

“学生”与“老师”共同进化

把 DR-Policy 看作“学生”,把 DR-Generator 看作“老师”。“学生”的目标很直观:提高生成回答的评价得分。

“老师”的目标是区分“学生”当前生成的回答。但如果只追求“分得开”,就可能只抓住表面差异,继而引发奖励投机(reward hacking)。因此在优化目标中引入带排序的用户偏好数据作为锚点。“老师”写的评价标准由此既要区分当前回答,又要在锚点数据上给出正确排序,也就是既“分得开”,也“分得对”。

标题中的 Dynamic 由此体现在两个层面:在单轮比较中,“老师”根据多份回答动态生成评价条目;而在多轮训练中,“老师”也根据“学生”能力的提高动态提升评价标准。

三个角色都由同一模型权重初始化,因此这里的共同进化同时也是自进化:模型通过分饰不同角色在交替更新中相互推动,持续提升生成与评价能力。

开源实验|公开基准上的模型表现

开源实验以 Qwen3-8B 为统一基座,分别验证策略模型与评价体系的性能收益。先看策略模型,DR-Policy 在四项开放域生成评测中,均优于使用最高达 70B 的奖励模型或 235B 静态评价标准生成器的监督方案。


再看评价体系,训练后的 DR-Generator 在六项准确率指标上全部超过参数量为其四倍的 Qwen3-32B 动态评价标准生成器,整体表现也可与更大规模的标量奖励模型竞争。



持续优化的实验显示,随着训练推进,DR-Generator 的评价能力和 DR-Policy的回答能力都继续提升,评价体系与策略模型都能在持续迭代中自进化”。

鲁棒性、计算开销等更多实验和分析请参考论文~

全量上线|服务微信搜一搜场景 AI 问答

微信 AI 问答场景的线上模型以微信自研大模型 WeLM-V4-80B-A3B为基座,并采用 DynamicRubric 框架进行后训练。与同基座的上一代线上模型相比,新模型在总搜索量、用户时长和正向用户行为等多项指标上均取得统计显著提升。验证效果后,新模型替代上一代生产模型,在微信 AI 问答生产环境全量上线。

上线之后,训练不停:锚点数据会根据新的优化目标和用户偏好持续更新。DR-Generator 据此调整评价方向,更新后的评价体系再为 DR-Policy 提供反馈,推动模型继续优化。微信 AI 问答由此能够随着用户真实需求持续进步,变得“越来越好用”。

结语

回到微信搜索框中的真实提问:当模型已经能给出不错的回答时,持续进化的关键,是让评价体系始终提供有效的训练指导。如今,这套训练范式已服务微信搜一搜 AI 问答线上模型的持续优化。

论文:Co-Evolving LLM Evaluators and Policies via DynamicRubric

作者:Beining Wang、Weihang Su、Hongtao Tian、Hao Kong、Tao Yang、Ting Yao、Qingyi Pan、Yueyue Wu、Qingyao Ai、Min Zhang、Yiqun Liu

单位:清华大学、腾讯微信

微信AI

不描摹技术的酷炫,不依赖拟人的形态,微信AI是什么?是悄无声息却无处不在,是用技术创造更高效率,是更懂你。

微信AI关注语音识别与合成、自然语言处理、计算机视觉、工业级推荐系统等领域,成果对内应用于微信翻译、微信视频号、微信看一看、微信读书、微信输入法、微信搜一搜等业务,对外服务王者荣耀、腾讯视频、QQ音乐等产品。

来源 | 微信AI (ID:WeChatAI)

作者 | 微信AI; 编辑 | 虾饺

内容仅代表作者独立观点,不代表早读课立场


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

放开他让wo来
2026-09-10 10:43:36
尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

米修体育
2026-09-10 23:51:55
别让刘翔带着“问号”离开

别让刘翔带着“问号”离开

齐鲁壹点
2026-09-10 18:09:09
15999元起!苹果折叠屏iPhone Duo仅支持eSIM 中国移动回应

15999元起!苹果折叠屏iPhone Duo仅支持eSIM 中国移动回应

快科技
2026-09-10 10:15:18
从刘翔的工资买断到上海GT赛事的火灾,良家子和责任心是不是会离我们越来越远?

从刘翔的工资买断到上海GT赛事的火灾,良家子和责任心是不是会离我们越来越远?

贵重物品爱美食
2026-09-10 14:28:52
美网逆转+救赛点!半决赛诞生,奥运冠军出局,萨巴伦卡丢世一

美网逆转+救赛点!半决赛诞生,奥运冠军出局,萨巴伦卡丢世一

肋骨雕刻成玫瑰d
2026-09-11 00:18:33
小S大女儿Elly许曦文晒出海滩比基尼照,小S留言:“美是美,但1、2张不用先问妈妈吗?”

小S大女儿Elly许曦文晒出海滩比基尼照,小S留言:“美是美,但1、2张不用先问妈妈吗?”

韩小娱
2026-09-09 15:57:06
45年,全国小学从91.7万所降到12.83万所

45年,全国小学从91.7万所降到12.83万所

老郭在学习
2026-09-10 16:32:25
马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

马来亚大学回应“长沙摸臀事件”:已收到对当事女生的举报,将采取必要措施

可达鸭面面观
2026-09-10 17:23:31
罗永浩连用7个“抄的”吐槽苹果折叠屏iPhoneDuo:我们究竟错过了多少科技创新带给我们的真正喜悦和幸福感

罗永浩连用7个“抄的”吐槽苹果折叠屏iPhoneDuo:我们究竟错过了多少科技创新带给我们的真正喜悦和幸福感

大风新闻
2026-09-10 16:02:05
姚明当年选择那叫一个干脆,2011年退役之后,上海体育局给了两条路,他直接选了自主择业,放弃编制,人事关系切断

姚明当年选择那叫一个干脆,2011年退役之后,上海体育局给了两条路,他直接选了自主择业,放弃编制,人事关系切断

背包旅行
2026-09-10 15:21:03
扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

鲁中晨报
2026-09-10 13:43:05
“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

中国新闻周刊
2026-09-10 20:35:09
从北京中转!朝鲜运动员特殊途径入境日本 亚运会期间受严格限制

从北京中转!朝鲜运动员特殊途径入境日本 亚运会期间受严格限制

念洲
2026-09-10 19:33:03
反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

反转来了!助学事件迎来大反转!被资助女生发声称“说曝光资助人是情急失言”,资助人删帖并送去1500元资助费,但帮扶方式已彻底改变

行者聊官
2026-09-10 09:14:31
女篮世界杯太疯狂了!世界第3第4第5全被淘汰:第11却逆袭杀进四强

女篮世界杯太疯狂了!世界第3第4第5全被淘汰:第11却逆袭杀进四强

篮球快餐车
2026-09-11 06:17:49
蓉城外援索罗金:我会几句骂人的中文,是我们队长韦世豪教我的

蓉城外援索罗金:我会几句骂人的中文,是我们队长韦世豪教我的

懂球帝
2026-09-10 16:35:07
“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

熙熙说教
2026-09-10 13:21:21
“高考数学132分,入学考试12分”,大学回应

“高考数学132分,入学考试12分”,大学回应

第一财经资讯
2026-09-10 11:04:09
上任仅3个月!65岁欧冠队主帅愤怒辞职 逼平罗马后遭球迷瓶子砸头

上任仅3个月!65岁欧冠队主帅愤怒辞职 逼平罗马后遭球迷瓶子砸头

我爱英超
2026-09-11 06:29:42
2026-09-11 07:51:00
互联网早读课 incentive-icons
互联网早读课
专注互联网产品、运营、交互
9866文章数 55228关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

涉伊朗核问题 中国和俄罗斯投下反对票

头条要闻

涉伊朗核问题 中国和俄罗斯投下反对票

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

艺术
教育
时尚
本地
健康

艺术要闻

他偷走70箱清宫文物:却在逃亡路上将国宝赠人、丢弃...

教育要闻

2026年内蒙古自治区“最美教师”发布,他们分别是苏永红、冉巍、员利光、于伟平、刘巧秀、戴秀萍、雷彪、李红、傅锁根、常泽辉

“蛇精”围攻,葫芦爷爷求饶

本地新闻

拼假 13 天国内长线路线合集

牙疼,也可能跟心梗有关?!

无障碍浏览 进入关怀版