清华与微信的研究团队分享了微信 AI 问答线上模型的训练范式,聚焦后训练中如何让大模型持续进化。该模型已在生产环境全量上线,欢迎大家体验~
论文链接:
https://arxiv.org/abs/2607.20083
![]()
在微信顶部搜索框输入问题,AI 问答即刻给出答案
前言|大模型如何持续进化?
当大模型已经能给出不错的回答,怎样让它继续进步?在后训练中,每一次优化都需要评价体系判断哪些回答更好,并据此为模型提供下一步的训练指导。然而,随着模型能力不断提升,生成的回答普遍达到较高质量。此时,回答之间的优劣越来越难区分,原有评价体系逐渐失去区分能力,也就成为模型持续进化的阻碍。
已有方法往往“绕着走”,借助能力更强的闭源评价模型,或追加人工标注。这些方法能够补充训练指导,却也意味着持续投入:随着模型的更新,评价体系需要随之升级,成本会在一轮轮迭代中不断累积。如何让评价体系摆脱成本高昂的“外援”,与模型一起进步——这是强模型持续进化必须解决的问题。
面对这一难题,清华大学与腾讯微信的研究团队公开了论文 Co-Evolving LLM Evaluators and Policies via DynamicRubric,分享了当前微信 AI 问答线上模型采用的持续自进化训练范式。大模型在其中同时扮演两个角色:一边是努力变聪明的“学生”模型,一边是越来越严格的“老师”评价体系。“学生”不断给出更好的回答,“老师”也相应地不断提高评价要求,大模型由此在一轮轮自我较量中持续进化。
![]()
理论分析|为什么评价体系也需要进化
![]()
论文首先从理论层面分析了评价体系为什么必须跟着模型一起进化。
在后训练中,模型根据评价体系的反馈进行优化。论文证明,驱动这一优化的信号,正是评价体系对好坏回答给出的分差。评价体系一旦无法区分回答,模型也就失去继续进步的有效指导。
![]()
传统的评价体系不会随当前模型的能力水平动态变化,因此很难捕捉同一组回答之间最细微的差异。论文进一步指出,让评价体系同时读取问题和当前模型生成出的回答,可以围绕关键区分之处动态生成评价标准。理论下界表明,相比传统的逐一评分,这种方式更有利于维持排序能力。
![]()
让评价体系看到模型生成的回答,解决的是当前优化中如何分辨优劣。模型完成一轮优化后,生成的回答随之变化,上一轮有效的评价标准又可能失去区分能力。因此,评价体系还要跟着新回答更新,再用更新后的评价结果指导模型继续优化。
![]()
论文据此将二者写成联合优化的形式,让评价体系与模型交替更新。模型推动评价体系变强,评价体系再推动模型进步,形成共同进化。
![]()
方法实现|让大模型分饰不同角色
DynamicRubric 不引入其他模型,而是直接将同一大模型复制三份,分别初始化策略模型 DR-Policy(P)、评价标准生成器 DR-Generator(G)和评价标准验证器 DR-Verifier(V)。后两者组成评价体系,为 DR-Policy 提供训练反馈。
![]()
在训练中,DR-Policy 接收用户问题并生成多个回答。DR-Generator 同时读取问题和这些回答,生成一组评价标准(rubric)。每条评价标准都是可用“是/否”核验的明确检查项。DR-Verifier 逐项判断每个回答是否满足要求,再将结果汇总为回答得分。每个得分都能追溯到具体检查项,评价过程也因此可解释。
“学生”与“老师”共同进化
把 DR-Policy 看作“学生”,把 DR-Generator 看作“老师”。“学生”的目标很直观:提高生成回答的评价得分。
“老师”的目标是区分“学生”当前生成的回答。但如果只追求“分得开”,就可能只抓住表面差异,继而引发奖励投机(reward hacking)。因此在优化目标中引入带排序的用户偏好数据作为锚点。“老师”写的评价标准由此既要区分当前回答,又要在锚点数据上给出正确排序,也就是既“分得开”,也“分得对”。
标题中的 Dynamic 由此体现在两个层面:在单轮比较中,“老师”根据多份回答动态生成评价条目;而在多轮训练中,“老师”也根据“学生”能力的提高动态提升评价标准。
三个角色都由同一模型权重初始化,因此这里的共同进化同时也是自进化:模型通过分饰不同角色在交替更新中相互推动,持续提升生成与评价能力。
开源实验|公开基准上的模型表现
开源实验以 Qwen3-8B 为统一基座,分别验证策略模型与评价体系的性能收益。先看策略模型,DR-Policy 在四项开放域生成评测中,均优于使用最高达 70B 的奖励模型或 235B 静态评价标准生成器的监督方案。
![]()
再看评价体系,训练后的 DR-Generator 在六项准确率指标上全部超过参数量为其四倍的 Qwen3-32B 动态评价标准生成器,整体表现也可与更大规模的标量奖励模型竞争。
![]()
![]()
持续优化的实验显示,随着训练推进,DR-Generator 的评价能力和 DR-Policy的回答能力都继续提升,“评价体系与策略模型都能在持续迭代中自进化”。
鲁棒性、计算开销等更多实验和分析请参考论文~
全量上线|服务微信搜一搜场景 AI 问答
微信 AI 问答场景的线上模型以微信自研大模型 WeLM-V4-80B-A3B为基座,并采用 DynamicRubric 框架进行后训练。与同基座的上一代线上模型相比,新模型在总搜索量、用户时长和正向用户行为等多项指标上均取得统计显著提升。验证效果后,新模型替代上一代生产模型,在微信 AI 问答生产环境全量上线。
上线之后,训练不停:锚点数据会根据新的优化目标和用户偏好持续更新。DR-Generator 据此调整评价方向,更新后的评价体系再为 DR-Policy 提供反馈,推动模型继续优化。微信 AI 问答由此能够随着用户真实需求持续进步,变得“越来越好用”。
结语
回到微信搜索框中的真实提问:当模型已经能给出不错的回答时,持续进化的关键,是让评价体系始终提供有效的训练指导。如今,这套训练范式已服务微信搜一搜 AI 问答线上模型的持续优化。
论文:Co-Evolving LLM Evaluators and Policies via DynamicRubric
作者:Beining Wang、Weihang Su、Hongtao Tian、Hao Kong、Tao Yang、Ting Yao、Qingyi Pan、Yueyue Wu、Qingyao Ai、Min Zhang、Yiqun Liu
单位:清华大学、腾讯微信
微信AI
不描摹技术的酷炫,不依赖拟人的形态,微信AI是什么?是悄无声息却无处不在,是用技术创造更高效率,是更懂你。
微信AI关注语音识别与合成、自然语言处理、计算机视觉、工业级推荐系统等领域,成果对内应用于微信翻译、微信视频号、微信看一看、微信读书、微信输入法、微信搜一搜等业务,对外服务王者荣耀、腾讯视频、QQ音乐等产品。
来源 | 微信AI (ID:WeChatAI)
作者 | 微信AI; 编辑 | 虾饺
内容仅代表作者独立观点,不代表早读课立场
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.