网易首页 > 网易号 > 正文 申请入驻

AI会做题,却未必能自进化:字节Seed等提出三项新基准

0
分享至



从模糊目标中找到正确的方向,并在这种场景下自我进化。Self-Developing Agents 用三项基准研究这个过程。

人学习一项新工作时,往往没有现成的题库和评分标准。比如,想成为更好的物理学家,需要根据个人当前水平,决定该补哪些数学知识、学习什么新的物理理论,或掌握哪种实验方法。让 AI 像这样学习,是字节跳动 Seed、TokenWave 等机构研究者在 Self-Developing Agents 项目 Blog 中提出的研究方向。团队希望 Agent 能在工作中逐步胜任一个角色,并将反复处理实际问题的经验积累成可复用能力。

这也是递归式自我改进(Recursive Self-Improvement,RSI)需要真正补上的一部分。当前常见的一些设定,其实并不是真正的 RSI——「半环 RSI」:假设有一个可靠的 Golden Verifier,持续判断结果、指引改进方向。Agent 可以沿着反馈优化,但学习目标和判断依据已经由外部准备好了。而更完整的闭环还要处理前面的判断和后面的积累。迭代过程中,宽泛目标需要变成具体行动(train or harness 修改),不完整的反馈需要变成可用经验,经过验证的改动需要进入模型、记忆或执行系统,以继续迭代后续工作。ASPIRE、S³Gym 和 HarnessDev 分别研究其中的三个问题:Agent 应该如何从模糊目标中学习,能否从经验中学习,以及 Harness 改进能否保留下来。

ASPIRE:从模糊目标中找到该学的东西

  • 论文:https://arxiv.org/abs/2608.31111
  • 项目与 Blog:https://self-developing-agents.github.io/

「提高某套数学测试的分数」已经给出了明确的优化对象。相比之下,「提高数学推理能力」则留下了更多的决策点和空间:先补哪一类短板,找什么数据,用什么方法训练,又怎样检查训练有没有用。

ASPIRE 从后一种目标出发。Agent 只能看到自然语言描述的能力方向,学习材料、更新方法和验证方式都要自己选择。研究者用覆盖多类能力的专家原创题检查这些选择的效果,题目、答案和逐题反馈不向 Agent 开放。它包含 6 个能力目标、520 道专家编写的隐藏评测题,以及一个支持权重和 Harness 更新的最小交互环境。它还提供 48 对「模糊目标/明确任务」匹配运行及可审计轨迹。



图 1:明确任务中,优化对象由人给定;模糊目标中,Agent 还要决定学什么、如何验证。外部评测检查它选择的方向是否改善了目标能力。来源:ASPIRE,原论文图 1。

Goal 越模糊,Agent 越容易「忙于想,而不是有效训练」:实验中,Agent 通常能够完成数据收集、训练和评测,但最终保留下来的能力收益很少。困难出在学习任务与原始需求之间:预算固定时,Agent 把更多时间用于解释目标和选择代理指标,留给训练与评测的时间更少。这说明目标拆解活动增加,不能说明目标选对了。完成更新,也不代表目标能力提高。ASPIRE 的 30 个单元中,21 个产出了进入后续筛选的检查点,最终只有 1 个增益被保留。面对模糊目标,决策时间增加,主动训练与评测时间减少,LoRA 使用率从 24.1% 升至 89.8%。搜索过程变了,但目标仍未得到验证。

S³Gym:判断自己的行为,再从中学习


  • 论文:https://arxiv.org/abs/2608.31100
  • 项目与 Blog:https://self-developing-agents.github.io/

没有老师逐步打分时,Agent 要从自己的尝试中判断哪些行动有效。S³Gym 将自我测试、自我判断和自我改进放在七个文字游戏中研究。探索时,Agent 能观察环境变化,但看不到程序验证器给出的真实步骤奖励和最终分;之后再用更严格的条件和另一组随机种子检验它的表现。测试记录不会回流为学习材料。



图 2:S³Gym 用人类学习的过程说明三个研究环节:主动尝试、判断与总结,再通过上下文、记忆或训练改善后续行为。左侧为概念类比,不是人类对照实验。来源:S³Gym,原论文图 1。

Agent 「知道自己做得好不好」的能力很弱:一个重要发现是,自我判断的准确程度没有稳定对应到后续收益。Agent 能判断当前行动做得怎么样,却未必能据此调整下一次行动。论文将判断质量与后续表现分别测量,发现两者的关联很弱;这不说明自我判断没有用,而是说明它还没有被可靠地转化为学习收益。

经验也没有一种通用的保存方式。在所测模型和游戏中,原始历史与摘要记忆各有优势,同一种方法换个环境就可能失效。轨迹分析给出的解释是:有些经验可以概括成可重复使用的策略,有些则依赖精确的状态和操作细节。摘要保留了前一类信息,却可能遗漏后一类信息。更新模型参数能让部分经验进入模型,但也可能损害原有能力。同一条训练轨迹中,模型在信任博弈上取得了收益,在植物大战僵尸中却持续退步,其他一些游戏没有改善。研究观察到了这种差异,尚未确定退步的唯一原因。

因此,S³Gym 把经验的价值放到后续行动中检验。复盘是否准确、经验以什么形式保存、下一次是否做得更好,需要分别检查,不能用一份看起来合理的总结代替学习效果。

HarnessDev:把改进留在系统中


  • 论文:https://arxiv.org/abs/2609.01437
  • 项目与 Blog:https://self-developing-agents.github.io/

HarnessDev 让模型创建并持续修改自己的执行系统,观察这些改动能否在后续任务中继续发挥作用。创建阶段覆盖代码、机器学习实验、写作和搜索研究,演化实验则追踪系统修改后的表现。这里需要区分模型本身的能力与执行系统带来的效果。研究将开发系统的模型和执行任务的模型分开,并在执行模型固定、权重不变的条件下观察改动。除了任务表现,研究还追踪新机制是否实际参与运行,例如写入代码的记忆和状态保存是否真的被调用。



图 3:HarnessDev 的两个阶段。Creation 从基础程序创建可用系统,Evolution 根据运行反馈继续修改系统;各正式版本冻结后再评测。图中的需求变化为设计示意,本文所述演化实验使用固定反馈任务集。

让 Agent「持续自我修改」,往往会 overfit 自己的反馈。开发时得到的正向反馈,并不总能延续到未见任务:在固定 Gemini 执行的 Qwen、DeepSeek 两条轨迹中,选定版本在可见反馈上都有改善,隐藏任务表现却都下降了。这些隐藏分数在开发结束后才计算,未返回给创建者,因此揭示了开发反馈没有反映出来的问题。系统修改还可能破坏原有功能。论文中的消息清理、上下文压缩改动曾打乱合法的工具消息序列,部分修改随后被回滚。对当前任务有帮助的调整,是否适合长期留在系统里,需要额外检查。

HarnessDev 由此强调对持久改动的验证:新机制要在运行中生效,改进要能迁移到未参与开发的任务,必要时还能恢复到先前版本。目前这些演化观察主要来自代码任务,隐藏评测覆盖 SWE-Pro,各配置为单条轨迹,尚不足以判断长期收益是否稳定。

哪些改动值得留下来

Self-Developing Agents 从目标形成、经验吸收和系统演化三个层面,系统讨论了 Agent 如何从「被动执行任务」进一步走向「持续自我改进」。ASPIRE、S³Gym 和 HarnessDev 的实验共同表明,当前 Agent 已经具备一定的自我训练、自我总结和自我修改能力,但真正的瓶颈并不在于「能不能改」,而在于能否准确判断「该改什么、什么经验值得吸收,以及改完之后是否真的变得更好」。

现阶段最突出的问题是代理目标与真实目标之间的错配,以及对局部反馈和可见指标的过拟合。未来,Self-Developing Agent 的核心可能不再只是更强的模型或更复杂的 Harness,而是建立更可靠的目标形成、验证和保留机制,使 Agent 能够在长期运行中持续筛选有效经验,并将真正可泛化的改进沉淀为稳定能力。

作者介绍

本文的第一作者为新加坡科学与设计大学大学博士生吴宇皓,师从张雯轩教授,研究方向为Long-context LLM,曾在 ICLR、NeurIPS、ACL、EMNLP 等国际会议上发表多篇论文。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
4999元,小米把咖啡机做成了2200W的智能终端

4999元,小米把咖啡机做成了2200W的智能终端

算力游侠
2026-09-15 11:03:19
大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

大陆还没发话,岛内先开价!热议两岸和平统一,张口甩出六大条件

寻墨阁
2026-09-16 13:51:42
Claude独立破译370年前密文!仅44分钟,密码学家破防了

Claude独立破译370年前密文!仅44分钟,密码学家破防了

新智元
2026-09-15 13:11:38
阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

阿根廷之所以大老远把牛肉便宜卖到中国,是因为中国什么部位都要

流苏晚晴
2026-09-15 12:17:39
“4岁男童被指摸臀”事件背后,一场被放大的公共冲突

“4岁男童被指摸臀”事件背后,一场被放大的公共冲突

新京报
2026-09-16 08:43:23
最后一舞!梅西入选阿根廷国家队大名单,10月6日迎盛大告别赛

最后一舞!梅西入选阿根廷国家队大名单,10月6日迎盛大告别赛

全景体育V
2026-09-16 06:41:19
正面硬刚!野人先生惨遭罗永浩“炮轰”,店员神回复笑翻网友

正面硬刚!野人先生惨遭罗永浩“炮轰”,店员神回复笑翻网友

雷科技
2026-09-16 18:04:53
9月14日,赵本山引发关注!不是因为他本人,而是他的徒弟小沈龙,被曝骗了榜一大姐200万

9月14日,赵本山引发关注!不是因为他本人,而是他的徒弟小沈龙,被曝骗了榜一大姐200万

火山詩话
2026-09-15 05:08:28
亚运男篮四强定3席!中国男篮“死里逃生”,廖三宁30分本场之星

亚运男篮四强定3席!中国男篮“死里逃生”,廖三宁30分本场之星

乒烧泳球
2026-09-16 16:56:19
最扎心的不是失业,是社保年限从15年涨到20年

最扎心的不是失业,是社保年限从15年涨到20年

细说职场
2026-09-16 16:15:54
打脸特朗普!乌克兰摧毁锡兹兰炼油厂,导弹袭击别里耶夫飞机厂

打脸特朗普!乌克兰摧毁锡兹兰炼油厂,导弹袭击别里耶夫飞机厂

项鹏飞
2026-09-15 21:17:26
武大杨景媛被爆在西班牙读研,有网友向学校反映情况,当地学生回应会跟进确认

武大杨景媛被爆在西班牙读研,有网友向学校反映情况,当地学生回应会跟进确认

Mr王的饭后茶
2026-09-15 22:28:40
重磅!拉塞尔,CBA!

重磅!拉塞尔,CBA!

技巧君侃球
2026-09-16 14:18:43
穆帅:2-0换人时已经觉得比赛要失控;最后换人是孤注一掷

穆帅:2-0换人时已经觉得比赛要失控;最后换人是孤注一掷

懂球帝
2026-09-16 07:20:07
东风导弹打响全球首战!沙特突然动用东风-15,证明战机不够用了

东风导弹打响全球首战!沙特突然动用东风-15,证明战机不够用了

爱吃醋的猫咪
2026-09-15 21:48:15
DeepSeek工程师长文爆火出圈,本人回应:并非表达失业焦虑

DeepSeek工程师长文爆火出圈,本人回应:并非表达失业焦虑

界面新闻
2026-09-16 10:32:14
CCTV5直播中朝大战!官方442阵型?纯属烟雾弹!毛伟杰又被安排到中场了

CCTV5直播中朝大战!官方442阵型?纯属烟雾弹!毛伟杰又被安排到中场了

刀锋体育
2026-09-16 17:49:54
有人说,新中国“谋事在毛,成事在周”,从历史事实看果真如此吗?

有人说,新中国“谋事在毛,成事在周”,从历史事实看果真如此吗?

大运河时空
2026-09-15 17:55:03
胡塞武装:击落一架F-15

胡塞武装:击落一架F-15

鲁中晨报
2026-09-16 16:03:03
京沪高速天津段发生车祸,一辆厢式货车与小轿车相撞,货车侧翻后燃起大火,小轿车右侧车门被撞掉,“明火已扑灭,事故具体原因还在调查”

京沪高速天津段发生车祸,一辆厢式货车与小轿车相撞,货车侧翻后燃起大火,小轿车右侧车门被撞掉,“明火已扑灭,事故具体原因还在调查”

台州交通广播
2026-09-16 14:20:47
2026-09-16 18:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14007文章数 142733关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

钱货两清2年后已到账的58万元突然成赌资 被法院划扣

头条要闻

钱货两清2年后已到账的58万元突然成赌资 被法院划扣

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

数码
亲子
旅游
公开课
军事航空

数码要闻

小米智能摄像机5 Pro全彩夜视发布,众筹价429元

亲子要闻

秋天别追着孩子戴帽子了,真正该捂的是另外3个地方

旅游要闻

陕西公布新一批魅力休闲乡村和特色魅力田园

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中东美军基地遭伊朗袭击后照片被披露

无障碍浏览 进入关怀版