网易首页 > 网易号 > 正文 申请入驻

走出数学与代码,大模型还能自我进化吗?

0
分享至



可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。

然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。

受到自监督学习的启发,作者提出了RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。



  • 论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement
  • 代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL
  • 论文链接:https://arxiv.org/abs/2607.23802



基于这一思路,作者进一步提出自博弈训练方法实例SpyRL(Self-PlaY Reinforcement Learning)。其核心是构造一个信息不对称的多智能体博弈环境:不同智能体在掌握信息量存在差异的条件下完成同一目标任务,并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态,因此博弈结果可以被自动、精确地验证;与此同时,智能体能否在竞争中取得优势,又取决于其完成原始任务的质量。由此,开放式任务中难以直接衡量的能力,被映射为可用于强化学习的规则化奖励信号。

从 RLVR 到 RLSVR:

为开放式任务构造可验证奖励

RLVR 能够有效提升数学推理和代码生成能力,关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。

开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案,任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中,很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价,但训练效果会受到评估器能力、偏差和推理成本的影响。

针对这一问题,RLSVR 引入了任务变换(Task Transformation)。其基本思想是将原始开放式任务转化为一个可验证的代理环境,并在环境中主动构造监督信号。环境首先从原始数据中采样任务,再注入并记录一个隐藏变量,例如哪个输入受到扰动、哪部分信息被删除,或某个输出在什么条件下生成。模型仍然需要完成原始目标任务,从而保证训练过程中使用的能力与真实应用场景保持一致;随后,模型通过输出之间的比较和交互,对环境中的隐藏状态作出判断。

由于隐藏变量由环境预先生成并保存,模型的判断结果可以通过确定性规则直接核验。这样一来,原本难以直接衡量的输出质量,就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为自可验证奖励(Self-Verifiable Rewards):它不依赖人工标注或外部裁判,其验证依据来自环境自身的状态和规则,标准答案在任务生成时就已经确定。

从这个角度看,RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签,RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务,环境隐藏变量对应自动构造的标签,最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径:开放式任务的可验证性可以通过环境设计获得,并进一步支持大规模、低成本的模型自我进化。

SpyRL:基于自博弈的 RLSVR 的实例



为了验证 RLSVR 能否真正应用于开放式任务,作者设计了一个基于信息不对称自博弈的具体实例——SpyRL(Self-PlaY Reinforcement Learning)。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中,通过环境预先分配的隐藏身份,为原本缺乏标准答案的任务构造可验证奖励。

如论文图 2 所示,SpyRL 的每轮训练包含Performing和Detection两个阶段。首先,环境从任务数据中采样一个输入,并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入,spy 则只能看到经过信息降质处理的版本,例如被连续遮盖部分内容的报告、写作提示或数学材料。随后,所有玩家根据各自掌握的信息完成同一个目标任务,生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容,同时尽量保持输入的主题、风格和表面形式一致,以避免模型通过长度、格式等简单特征识别身份。

在 Detection 阶段,所有输出会被公开,玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定,投票是否正确能够直接与环境记录进行比较,Detection 阶段也因此获得了确定性的奖励。与此同时,一个玩家生成的内容越不完整、逻辑越薄弱,越容易暴露其信息缺失并收到更多怀疑票。因此,投票结果也可以反向用于评价 Performing 阶段:收到的怀疑票越多,任务执行奖励越低;能够生成更完整、更连贯、更具说服力输出的玩家,则更有可能避免被识别。

这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后,模型能够发现输出中更细微的缺陷,给执行者带来更严格的训练信号;执行能力提升后,不同玩家的输出会变得更难区分,又会推动检测模型继续进化。作者对两个阶段进行交替优化:当检测任务已经较为容易时,训练重点转向执行模型;当执行模型的提升导致身份识别准确率下降时,再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力,降低固定评估器逐渐失效带来的训练停滞。

在奖励设计上,Detection 阶段根据身份判断是否正确获得可验证奖励,并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励,将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。

通过这样的设计,SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」,再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge,并且执行阶段始终围绕原始目标任务展开,从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。

实验结果

作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL,实验覆盖文本摘要、创意写作和数学推理三类任务,并与 R-Zero、Absolute Zero 等自进化方法进行比较。评估同时采用任务专用自动指标、GPT-4o 成对 A/B 测试和人工盲测,以考察模型在客观指标和人类偏好下的表现。

在文本摘要任务中,SpyRL 在 GovReport、Multi-News、QMSum、VCSum 和 SAMSum 五个数据集上均取得最高的 ROUGE-L。以 GovReport 为例,Qwen3-4B 的 ROUGE-L 从 30.2 提升至 36.7,Qwen3-8B 则从 29.0 提升至 34.1。在与未经训练的基础模型进行 A/B 测试时,SpyRL 在五个数据集上的平均胜率分别达到 73.9% 和 75.4%,并且在与 R-Zero、Absolute Zero 的对比中赢得了绝大多数测试。这表明,基于身份识别产生的训练信号能够有效改善摘要的完整性、信息覆盖和组织质量。



创意写作上的提升更加明显。作者从新颖性、情感表达、连贯性、一致性和总体质量五个维度进行评估。在 WritingPrompts 和 WritingBench 上,SpyRL 相比基础模型及两种自进化基线,在所有细分维度上的胜率均超过 50%。其中,Qwen3-4B 相比基础模型的总体胜率分别达到 81.3% 和 75.1%,Qwen3-8B 则达到 76.5% 和 78.1%。优势在新颖性和情感表达上尤其突出,说明 SpyRL 带来的改善并不局限于语言流畅度和表面结构,也覆盖了更具主观性的创作能力。



虽然 SpyRL 主要面向缺少确定性奖励的开放式任务,它在数学和通用推理任务上同样取得了稳定增益。在 GSM8K、Math500、AIME 2024、AIME 2025、Minerva、MMLU-Pro 和 GPQA-Diamond 七个基准上,SpyRL 均取得了最佳结果。Qwen3-4B 的七项平均成绩相比基础模型提升 8.97 个百分点,Qwen3-8B 提升 6.16 个百分点。例如,Qwen3-4B 在 AIME 2025 上从 6.7 提升至 20.0,在 GPQA-Diamond 上从 26.3 提升至 41.3;Qwen3-8B 在 Math500 上从 74.2 提升至 81.2。这说明,多玩家竞争和集体判断也能够为已有标准答案的任务提供更细粒度的学习信号。



人工评估也支持这一结论。10 名博士生对 400 个创意写作样本进行了盲测,SpyRL 在 WritingPrompts 上相对基础模型、R-Zero 和 Absolute Zero 的总体胜率分别达到 80.0%、78.5% 和 74.0%,在 WritingBench 上则分别达到 85.0%、80.5% 和 72.0%。



此外,SpyRL 的效果并未局限于主实验所使用的数据分布。将训练语料从政府报告换成 PubMed 科学论文后,模型在 arXiv、PubMed 和 BillSum 三个数据集上的平均 ROUGE-L 从 33.2 提升至 38.1,平均 A/B 胜率达到 70.2%。跨任务实验还显示,摘要和创意写作之间存在双向正迁移,说明 SpyRL 学到的内容组织、完整性和长程一致性等能力能够跨开放式任务复用。



启示

本篇工作为自监督学习与强化学习建立了一条连接。自监督学习的核心经验是:当真实标签难以获得时,可以通过掩码预测、对比学习等代理任务,从数据本身构造监督信号。RLSVR 将同样的思想推进到强化学习阶段:面对缺少确定性奖励的开放式任务,通过任务变换构造代理环境,并由环境预设的隐藏变量和交互规则自动生成奖励。自监督学习通过构造任务获得标签,RLSVR 通过构造环境获得奖励;前者解决「没有标注如何学习」,后者进一步探索「没有验证器如何做强化学习」。

这也意味着,RLVR 的适用范围不必完全受限于任务天然具备的标准答案。过去,数学和代码之所以适合 RLVR,是因为答案检查器和单元测试已经存在;对于写作、摘要和研究分析,RLSVR 将问题转化为如何设计一个与目标能力高度相关、同时具有确定性答案的代理任务。由此,可验证性从任务的一项固定属性,逐渐转变为一种可以通过环境设计获得的训练资源。SpyRL 所采用的信息不对称博弈正是这一思想的实例:环境主动制造一个可记录的隐藏状态,模型对该状态的判断可以被精确核验,而完成判断所依赖的能力又与原始开放式任务紧密相关。

这一视角也为大模型自我进化提供了新的研究方向。现有工作常将重点放在更强的奖励模型、更复杂的评价标准或更大规模的 LLM Judge 上,而 RLSVR 提示我们,还可以系统性地研究代理任务和训练环境本身。未来,不同开放式能力可能对应不同的任务变换方式。随着这些变换逐渐丰富,任务设计本身可能成为继数据、模型和优化算法之后,推动模型自我提升的另一项关键变量。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
女子低血糖点外卖承诺打赏5元,求优先配送,外卖小哥嫌“这家店可乐难喝”,自费给网友换大瓶,女子默默将5元打赏改成20元

女子低血糖点外卖承诺打赏5元,求优先配送,外卖小哥嫌“这家店可乐难喝”,自费给网友换大瓶,女子默默将5元打赏改成20元

蓬勃新闻
2026-09-04 13:06:44
建企老板一个比一个惨

建企老板一个比一个惨

新浪财经
2026-09-05 10:10:22
孙宇晨胡锡进隔空互撕,被指最不真诚嘴仗

孙宇晨胡锡进隔空互撕,被指最不真诚嘴仗

追星雷达站
2026-09-04 09:21:53
电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

民间胡扯老哥
2026-09-03 06:36:08
天津大学讣告:苏万华院士逝世

天津大学讣告:苏万华院士逝世

极目新闻
2026-09-04 15:10:37
真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

一盅情怀
2026-09-03 11:22:44
票房仅600多万,脱离王宝强,这位昔日巨星彻底不行了

票房仅600多万,脱离王宝强,这位昔日巨星彻底不行了

影视高原说
2026-09-05 07:02:32
中考剔除历史,开了个坏头

中考剔除历史,开了个坏头

超想说事
2026-09-04 00:26:54
卷不动了?中国并非消费降级,是14亿人的好日子把市场“喂饱”了

卷不动了?中国并非消费降级,是14亿人的好日子把市场“喂饱”了

笑熬浆糊111
2026-09-05 08:17:24
彩票出现断崖式暴跌,暴跌1700亿!“2元中500万”为什么没人信了?

彩票出现断崖式暴跌,暴跌1700亿!“2元中500万”为什么没人信了?

青眼财经
2026-09-03 19:32:22
卡迪遇袭身亡

卡迪遇袭身亡

上观新闻
2026-09-05 06:09:40
女子需求大偷情10年,28岁的情夫吃不消想分手,2017年她雇来杀手弄残情夫

女子需求大偷情10年,28岁的情夫吃不消想分手,2017年她雇来杀手弄残情夫

汉史趣闻
2026-09-03 11:39:41
伊朗现在的下场证明:若中美开战,75年前毛主席底牌是最佳方案!

伊朗现在的下场证明:若中美开战,75年前毛主席底牌是最佳方案!

探索新高度
2026-09-05 01:55:18
25岁宝妈网贷38万,硬扛5年不还:不接电话、不回短信,出人意料

25岁宝妈网贷38万,硬扛5年不还:不接电话、不回短信,出人意料

小虎新车推荐员
2026-09-05 04:14:45
果断调整!中国男篮亚运会12人名单,郭士强连续更换3人详情

果断调整!中国男篮亚运会12人名单,郭士强连续更换3人详情

洒脱一点p
2026-09-04 14:08:04
中国斩获天价大单,20架大飞机成功出口,美国不给适航证也不怕!

中国斩获天价大单,20架大飞机成功出口,美国不给适航证也不怕!

孤城落叶
2026-09-04 07:46:00
乌终于收到首辆豹1底盘天巡者35,专打无人机,终于有省钱打法了

乌终于收到首辆豹1底盘天巡者35,专打无人机,终于有省钱打法了

止戈军是我
2026-09-03 22:51:05
台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

台湾问题即将突破临界点,2大迹象表明,大陆或要准备出手了

探索新高度
2026-09-04 07:38:25
拍屁股走人!NBA最大赢家!狂赚6530万美元

拍屁股走人!NBA最大赢家!狂赚6530万美元

篮球教学论坛
2026-09-05 10:59:12
陆毅一家逛南京吃红楼宴,四人都戴金项链很贵气,一顿饭花2000多

陆毅一家逛南京吃红楼宴,四人都戴金项链很贵气,一顿饭花2000多

小疯子耶
2026-09-04 05:04:21
2026-09-05 11:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

新世界地图要来了 联合国:停止"小看"非洲

头条要闻

新世界地图要来了 联合国:停止"小看"非洲

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

家居
时尚
手机
房产
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

杨紫:自渡成舟

手机要闻

消息称三星逆势扩产中低端手机,以实现“薄利多销”

房产要闻

TOP10房企卖了350亿!海南楼市,最新榜单出炉!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版