网易首页 > 网易号 > 正文 申请入驻

让AI自己给大模型做后训练:AIBuildAI开源递归自进化PostTrain Agent,登顶PostTrainBench

0
分享至



给定一个基座模型、一个目标能力和算力预算,RSI Agent 自己设计后训练算法、收集和整理数据、写代码、跑实验、迭代改进,最终交出一个训练好的模型,全程无人介入。在自主后训练基准 PostTrainBench 上,它以 46.6 分排名第一,超过所有前沿模型与 Agent 系统,接近人类专家表现(51.1)。

近日,AIBuildAI 团队发布了PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,并开源了全部代码与配套知识库。

  • 开源地址:https://github.com/aibuildai-inc/aibuildai-llm-posttrain-agent
  • 知识库:https://github.com/aibuildai-inc/aibuildai-knowledge-base
  • 技术报告:https://github.com/aibuildai-inc/aibuildai-llm-posttrain-agent/blob/main/docs/aibuildai-llm-post-train-agent.pdf

为什么需要自动化的后训练

后训练(post-training)是把一个基座模型变成能遵循指令、会推理、会用工具、懂某个领域的模型的过程——也是一家公司把通用模型变成「自己的模型」的方式。它涉及的决策不少:用什么数据、怎么配比;用监督微调(SFT)、偏好优化还是强化学习;学习率、训练步数、最后交付哪个 checkpoint。

这些决策彼此耦合:合适的算法取决于数据配比,有效的数据配比又取决于基座模型。交付一个后训练好的模型,往往要一个有经验的团队花上数周,每次实验还要消耗可观的算力。AIBuildAI PostTrain Agent 研究的问题是:能否把这件事完全交给 AI——输入基座模型、目标能力和算力预算,Agent 自己完成后训练的全部流程,输出一个后训练好的模型。

PostTrainBench:给 Agent 的一道考题

PostTrainBench(Rank et al., ICML 2026)把这个问题做成了一个基准:给定基座模型(如 Qwen3-4B-Base)和目标能力(如工具调用),Agent 在单张 H100 上、10 小时内自主设计并执行后训练方案,产出的 checkpoint 在基准方持有的、Agent 看不到的评测集上打分。基准覆盖 4 个基座模型和 7 类任务:数学推理(AIME 2025、GSM8K)、写作(ArenaHard Writing)、通用问答(GPQA)、健康咨询(HealthBench)、代码(HumanEval)和函数调用(BFCL)。

用哪些外部数据、怎么混合,用监督微调、偏好优化还是强化学习,超参数和训练框架——全部由 Agent 自己决定。



图 1|PostTrainBench 的任务设定:输入基座模型和目标能力,Agent 在单张 H100、10 小时内自主设计并执行后训练,产出的 checkpoint 在 Agent 看不到的评测集上打分。

从一条线到一棵树

榜单上的基线做法,是把一个编码 Agent(如 Claude Code)直接指向这个任务:一个会话、一个 CLI 环境,给它基座模型、数据、GPU 和评测器,让它自己规划、写代码、训练、评估。这样的 Agent 是线性搜索的:每次尝试都是在修改上一次,方案很早就定下来,之后一路跟着走;几个截然不同的思路无法并行探索,一条已经走不通的方向会把剩余预算全耗掉。它的数据、方法和超参数选择也只来自模型自身的参数化知识。

AIBuildAI 此前的系统(AIBuildAI Science、AIBuildAI-2.5)用的是整实验树搜索:一次运行是一棵实验树,每个节点是一次完整的实验,由任务自己的评测程序打分,运行的价值就是树上的最高分。「设计员」Agent 播下若干条刻意互异的起始方案,每条方案是一个分支的根;「实验员」Agent 端到端地跑完一个实验并提出几条修改,成为子实验;「选择器」按预期收益、证据、新颖性和成本给等待 GPU 的候选实验排序。



图 2|整实验树搜索:设计员给出若干互异的起始方案,实验员逐节点完成整个实验并提出修改,选择器为候选排序;每个节点由任务自己的评测程序打分。

但直接把这套流程搬到后训练上,暴露出两个限制:一是它不懂这个领域——实验员只能凭语言模型内部知识作答,典型错误包括选了没有任何库实现的方法、用了和评测集重叠的数据集、套用了另一种模型规模的超参数,每个错误都要花一整次训练才能发现;二是它在了解任务之前就定死了搜索的拓扑——树的每个节点都必须是一个打过分的模型,而「生成数据」这样的阶段没有分数、做不了节点;把不同节点里训练好的几个模型合并成一个(fan-in),树搜索也表达不了。针对这两个问题,新系统引入了两个核心组件:知识系统和元搜索。



图 3|AIBuildAI PostTrain Agent 系统总览:元 Agent 调研任务并写出搜索程序,由它派生的实验员 Agent 和程序负责执行,所有 Agent 共用同一套知识系统。

知识系统:让 Agent 依据证据而非记忆做决策

AIBuildAI PostTrain Agent 的知识系统是一个通过 MCP 提供服务的远程检索知识库,里面是一套「知识文件」,分四个子库:工作流(一次后训练运行的 13 个有序步骤、34 份文件,每步说明要落定的判断、一个具体案例和它的适用边界)、方法(111 份文件:监督微调、DPO、GRPO、蒸馏等,各自需要什么、花费多少、有哪些参数和默认值)、数据集(215 份文件:许可证、切分、加载代码、样本行,并标出哪些是评测基准、必须隔离)、框架(108 份文件:何时选它、如何启动、监控和保存一次训练)。



图 4|AIBuildAI PostTrain Agent 知识系统:实验员带着问题查询知识库,取回匹配的知识文件,并在实验结束后把观察写回。

每份知识文件都从公开来源(论文、库代码、Hub 上的数据集说明、公开训练记录)收集,经人工确认范围、检查许可和切分、从代码中实测事实后,按统一模板写成,每条声明都带 URL 和日期;任何提到评测基准的文件都会被剔除出语料。实验员在面临设计决策时,把「任务、当前方案、哪里出了问题」发给知识库,拿回匹配的知识文件,据此决定下一步;跑完的实验也会把观察写回,知识随之增长。

这些文件记录的不是教程,而是可以直接据以行动的判断。以工作流的第一步为例,它要求 Agent 在选任何数据之前先读懂「分数到底奖励什么」:评分看的是最终答案还是整段回复,格式错误是否直接记零分,推理过程有没有分;然后在未经训练的基座模型上完整跑一次官方评测器——得到的数字才是基线,跑一次的耗时则是后面分配预算时的「单次评测成本」。方法文件则给出每种方法的适用条件、目标函数、一个带数字的算例、需要的数据形态和额外模型,以及哪些库提供了现成实现。

元搜索:搜索的拓扑本身成为 Agent 的输出

不同的任务需要不同形状的搜索。线性搜索适合方案已定、只需反复打磨同一种方法流程的情形;树搜索适合有几种可信思路、只能靠证据取舍的情形。但后训练里常见一种两者都表达不了的结构。

以一个典型方案为例:先准备两份训练数据——任务自带的训练集和一份从公开语料构建的外部数据集——在基座模型上各做一次监督微调,用验证集选出更好的模型作为「当前最优」;然后进入强化学习阶段:每一轮都从当前最优出发做一轮 GRPO 训练,训练完在验证集上打分,只有分数确实提高才用新模型替换当前最优,否则丢弃,如此反复,直到预算不够再跑一轮。

这个方案是树搜索放不进去的:树的每个节点都必须是一个训练完、打过分的模型,而「构建外部数据集」这一步只产出数据,没有模型也没有分数,做不了树上的节点。



图 5|一个线性搜索和树搜索都表达不了的后训练方案。虚线框是只产出数据、没有模型也没有分数的阶段,红点表示打过分的模型。

AIBuildAI PostTrain Agent 的解法是元搜索:先派出一个元 Agent,它调研任务、阅读设计知识文件(37 种带可运行示例的搜索模式:链式、扇出/扇入、循环、分阶段流程,以及 checkpoint 锦标赛、监督微调接 GRPO、预算约束的多轮训练等后训练专属策略)、查询知识库,然后写出一个搜索程序。程序的每一步可以是 LLM Agent、确定性程序或嵌套的子搜索,整体可以是任何执行图——阶段、锦标赛、扇入、循环。上面那个案例写成程序不过几行:两路监督微调、取优、在预算允许时循环 GRPO。

搜索程序由三种基本单元组合而成:Agent 是一个带工具和类型化输出的 LLM 会话,Program 是在独立资源限制下运行的确定性计算,Search 则把 Agent、Program 和嵌套的 Search 编排在一起。37 种模式是词汇表而不是白名单,元 Agent 可以组合、改造,也可以写出目录之外的结构。

搜索程序也不必在开跑前把整次运行定死:元 Agent 可以只写当前阶段的程序——构建一份语料,或一轮训练加评估——执行完后读取剩余预算,交给下一代元 Agent 根据实测结果写下一阶段。运行的结构由此一个阶段一个阶段地、基于实测而非事前预测来决定。



图 6|元搜索:元 Agent 阅读任务与设计知识文件、查询知识库,写出由 Agent、Program、Search 三种基本单元组成的搜索程序。

实验分析

所有实验都遵循 PostTrainBench 榜单的设定:每个任务在单张 H100 上全自动运行 10 小时,全程无人干预;AIBuildAI 的所有 Agent 角色均运行在 Claude Opus 5 上,所有结果都由元搜索产生。对比数字取自 PostTrainBench 公开榜单。

综合得分:超过所有前沿模型与 Agent 系统

在 PostTrainBench 上,AIBuildAI PostTrain Agent 的加权综合得分为 46.6,高于所有前沿模型和 Agent 条目,仅次于人类专家基线的 51.1。榜单上紧随其后的是 Locus(45.6)和运行 Claude Fable 5 的 Claude Code(41.8),再往后是 GPT-5.6(36.2)、Claude Opus 5(35.0)、Claude Opus 4.8(33.8)、Kimi K3(32.0)、GLM-5.2(31.7)、Gemini 3.1 Pro(22.0)等。未经任何训练的基座模型平均只有 7.5 分——也就是说,Agent 在 10 小时内把综合得分提高了约 39 分。



图 7|PostTrainBench 综合得分。综合分是七项任务的加权平均(AIME 2025 22.7%、GPQA 22.5%、HealthBench 18.4%、HumanEval 10.6%、GSM8K 9.4%、ArenaHard Writing 9.0%、BFCL 7.5%),每项任务取 4 个基座模型的均值。Human 为各基座模型官方发布的指令微调版本,不受 10 小时预算限制。

同一个底层模型,换一套系统:+11.6 分



各任务为 4 个基座模型的均值。Δ 为 AIBuildAI 与 Claude Code 之差,二者均运行 Claude Opus 5。

一个更能说明系统本身价值的对照是:AIBuildAI 的全部 Agent 角色都运行在 Claude Opus 5 上,而同样运行 Opus 5 的 Claude Code 只有 35.0 分——相差 11.6 分,来自系统而非模型。分任务看,AIBuildAI 在七项中的六项领先,GPQA 持平。

提升最大的三项是 BFCL(+94.3)、ArenaHard Writing(+12.1)和 HumanEval(+9.2)。值得注意的是,AIBuildAI(Opus 5)的 46.6 也高于运行更强模型 Claude Fable 5 的 Claude Code(41.8):知识系统与元搜索带来的增益,超过了把底层模型升级一代所带来的增益。

分任务分析:三项任务取得 Agent 最高分,其余四项与领先者相差不到两分

与榜单上的全部 Agent 相比,AIBuildAI 在 AIME 2025(15.8,其后为 Claude Fable 5 的 13.3 和 Locus 的 9.4)、BFCL(95.8)和 HumanEval(69.0,Locus 为 66.6)三项上取得最高分;在 ArenaHard Writing、GPQA、HealthBench 和 GSM8K 四项上,与各自领先者的差距都在两分以内。

这些差距背后是不同的机制。BFCL 按函数调用能否被正确解析、是否符合给定的 schema 计分,格式稍有不符即记零分:同样运行 Opus 5 的 Claude Code 平均只有 1.5 分,与未训练的基座模型持平;AIBuildAI 借助知识系统选对了训练框架和格式匹配的数据集,在四个基座模型上的得分全部不低于 94,平均 95.8,也是七项任务中唯一超过人类参考(85.0)的一项。

ArenaHard 是成对偏好评判,本质上是选哪个偏好语料的数据选择问题。AIME 的答案可验证,「采样—验证—重训」是一个循环,正是元搜索的用武之地;它在综合分中权重最大,也是所有 Agent 距人类参考最远的一项,AIBuildAI 在每个基座模型上都取得了最高或并列最高的 Agent 得分,包括最难的 gemma-3-4b-pt(3.3 分,其他 Agent 均不超过 1.1)。HumanEval 上,AIBuildAI 在全部 4 个基座模型上都是 Agent 最高分。HealthBench 用的是医生撰写的评分标准,需要一套不让评判者奖励冗长回答的偏好优化流程。



图 8|七项任务在 4 个基座模型上的逐项得分。Official instruct 为各基座模型官方发布的指令微调版本,是参考而非参赛的 Agent。

两个案例:Agent 如何一步步把分数做上去

两个案例中,Agent 都在运行自己的那张 GPU 上部署了一个开源权重的教师模型来写训练数据,并且一次只规划一个阶段、依据实测结果决定下一步。

HealthBench × Qwen3-4B-Base(基座 13.4 → 48.6,Claude Code 为 40.9):先让教师模型写出约 4.8 万条回复,在其上做监督微调,得到 46.2 分;再让教师模型写约 6,800 段更长的多轮对话继续训练,在小子集上筛选候选、在完整评测集上确认,达到 48.6 分。

ArenaHard Writing × SmolLM3-3B-Base(基座 0.4 → 74.6,Claude Code 为 69.7):先在约 2 万条教师撰写的语料上做监督微调,并对最后三个 checkpoint 做权重平均,得到 74.2 分;再做一轮拒绝采样——从学生模型自己的回复中挑出被教师评为最优的继续训练——再次平均后达到 74.6 分。

两次运行中,绝大部分增益都来自在教师数据上的第一轮完整训练;此后每个阶段的结果,只有在完整评测集上确认有效才会保留。

元 Agent 写出的搜索程序长什么样

以 AIME 2025 × Qwen3-1.7B-Base 为例。元 Agent 动手写程序之前先做了调研:未经训练的基座模型只有 20% 的回复会给出评测器要求的答案行,23% 的题目一直生成到长度上限也不结束;给两个格式示范,答案行比例升到 73%,准确率却完全没有变化。

元 Agent 据此判断格式不是瓶颈,真正待解的问题是一个 1.7B 的模型能学会多长的推理链,并写出了一个五阶段的搜索程序:在 CPU 上并行构建短、中、长三种思维链长度的语料,同时在 GPU 上保存并评测基座模型,以确立基线和单次评测成本;每份语料各做一次小预算的试训;由一个策略 Agent 读取基线、三次试训和语料筛查的结果,决定主训练用哪份语料、是否从试训的 checkpoint 续训、要不要第二阶段;随后是主训练;最后是可选的第二阶段(续训、长度退火、拒绝采样微调或 DPO 四选一)。

整个程序共 471 行 Python、8 个文件(1 个搜索编排器、5 个 Agent 角色、2 个确定性程序),全部由元 Agent 在任何训练开始之前的一次会话中生成。

总结与展望

AIBuildAI PostTrain Agent 表明,大模型后训练正在从「由人类专家操作工具」,迈向「由AI自主完成研发闭环」。在底层模型同为 Claude Opus 5 的条件下,AIBuildAI 以 46.6 分显著领先 Claude Code 的 35.0 分,在七项任务中六项领先、一项持平,并将与人类专家参考(51.1)的差距缩小到不足 5 分。这说明,决定 Agent 能力上限的不只是底层模型本身,还包括它能否基于可靠知识进行决策、能否设计适合任务的搜索结构,以及能否从实验结果中持续学习和调整。

更重要的是,PostTrain Agent 所自动化的并非某个固定训练流程,而是完整的模型研发过程:理解目标、研究任务、准备数据、设计算法、编写代码、运行训练、评估结果,并根据实验反馈重新制定下一阶段方案。在这一过程中,AI 不再只是执行人类预先写好的训练配方,而是开始自主提出假设、构建实验、分析证据并迭代改进。这正是递归自我改进(RSI)在模型研发场景中的一种具体实现。

从更长远的角度看,自动化后训练只是起点。同样的范式可以进一步覆盖预训练、数据生成、模型架构设计、推理优化、评测、安全对齐与部署,最终形成一个能够自主设计、训练、验证和持续改进 AI 模型的研发系统。人类只需定义目标、约束与价值标准,AI便能在给定资源下搜索实现这些目标的最佳模型和算法。

当模型能够参与改进下一代模型,AI 研发将不再完全受限于人类专家的时间、经验和试错速度,而可能演化为一个由机器规模化执行、由实验反馈持续驱动的过程。AIBuildAI 希望构建的,正是这样的 AI 研发基础设施:让 AI 自主研发 AI,并把模型创新从少数顶尖团队才能完成的复杂工程,转变为任何组织都可以调用的能力。

参考文献:

[1] AIBuildAI LLM-Post-Train Agent: an agent for autonomous post-training of large language models. AIBuildAI Team, 2026.

[2] PostTrainBench: Can LLM Agents Automate LLM Post-Training? Rank et al., ICML 2026.

[3] AIBuildAI: An AI Agent for Automatically Building AI Models. Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie, 2026. ttps://arxiv.org/abs/2604.14455

[4] AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models. Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie, 2026. https://arxiv.org/abs/2605.27873

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
18个台湾人组团看国庆升旗,有人全程冷漠,看完后当众红了眼

18个台湾人组团看国庆升旗,有人全程冷漠,看完后当众红了眼

李博世财经
2026-10-06 09:49:05
6万元起家,韩国游客疯狂打卡,上海“排队王”冲刺IPO?

6万元起家,韩国游客疯狂打卡,上海“排队王”冲刺IPO?

天下网商
2026-10-07 15:56:34
“男怕寒露,女怕小寒”,明日寒露,提醒男人:4事不做,3物不吃

“男怕寒露,女怕小寒”,明日寒露,提醒男人:4事不做,3物不吃

神牛
2026-10-07 09:35:15
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
十大圣人、十大名曲、十大名楼……最全中国文史常识

十大圣人、十大名曲、十大名楼……最全中国文史常识

每日一首古诗词
2026-10-02 06:04:26
太乖了!玥儿最新居家日常曝光,主动下厨做甜品,模样温柔又懂事

太乖了!玥儿最新居家日常曝光,主动下厨做甜品,模样温柔又懂事

阿废冷眼观察所
2026-10-05 09:53:19
“吃相、面相、坐相没一个过关的!”家长晒女儿,却收获了大量嘲讽

“吃相、面相、坐相没一个过关的!”家长晒女儿,却收获了大量嘲讽

熙熙说教
2026-10-07 10:40:25
总统,打不过前总统的儿子?

总统,打不过前总统的儿子?

中国新闻周刊
2026-10-07 17:46:13
今日重要赛事!10月7日,央视CCTV5、CCTV5+直播节目表

今日重要赛事!10月7日,央视CCTV5、CCTV5+直播节目表

薇说体育
2026-10-07 10:40:06
郭正亮:这个失分的就是大陆嘛!

郭正亮:这个失分的就是大陆嘛!

有态度的何总
2026-10-07 13:52:28
无人坦克在普京面前出大丑!俄罗斯疑暴发高致死性鼠疫

无人坦克在普京面前出大丑!俄罗斯疑暴发高致死性鼠疫

鹰眼Defence
2026-10-05 16:40:27
“凌晨3点半的高速路上全是车”,杭州一车主深夜赶路返家,发现路上全是“大聪明”

“凌晨3点半的高速路上全是车”,杭州一车主深夜赶路返家,发现路上全是“大聪明”

上游新闻
2026-10-07 13:54:05
"人有寿相,一看便知":长寿的人,脸上大多有这几个特征

"人有寿相,一看便知":长寿的人,脸上大多有这几个特征

芹姐说生活
2026-10-02 23:42:40
金评|人民币升到6.7,最该担心的不是出口企业,而是分配问题

金评|人民币升到6.7,最该担心的不是出口企业,而是分配问题

生活新鲜市
2026-10-05 10:55:58
饭桌上,婆婆宣布每月替小姑子还8000房贷,老公月薪才7千,婆婆笑着说:差价让你媳妇补。我站起身,回屋拿出了个红本本

饭桌上,婆婆宣布每月替小姑子还8000房贷,老公月薪才7千,婆婆笑着说:差价让你媳妇补。我站起身,回屋拿出了个红本本

晓艾故事汇
2026-09-17 11:29:44
惊人的母子定律:“妈妈什么性格,孩子就什么命”,这3种妈妈会影响孩子一生!

惊人的母子定律:“妈妈什么性格,孩子就什么命”,这3种妈妈会影响孩子一生!

经济观察报
2026-10-05 09:11:14
出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

出门尽量不点的5道菜,有的不洗就下锅,老板:不是厨师就是内行

神牛
2026-10-04 13:14:19
郭华萍:表面是人民公仆,实际是电诈魔头,竟折磨多名中国人致死

郭华萍:表面是人民公仆,实际是电诈魔头,竟折磨多名中国人致死

米果说识
2026-10-07 11:38:34
两性心理学:女人主动跟你说例假来了,过来人都懂,她其实是在暗示你这两句话,不要再傻乎乎地听不明白

两性心理学:女人主动跟你说例假来了,过来人都懂,她其实是在暗示你这两句话,不要再傻乎乎地听不明白

心理观察局
2026-09-06 06:41:37
南宁骑行圈风波尘埃落定!梁女士退婚失业,鸟哥销号隐身,一时冲动突破底线,结局只能自食苦果

南宁骑行圈风波尘埃落定!梁女士退婚失业,鸟哥销号隐身,一时冲动突破底线,结局只能自食苦果

火山詩话
2026-10-03 11:29:58
2026-10-07 18:12:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14142文章数 142744关注度
往期回顾 全部

科技要闻

万亿砸向高速充电桩,排队为何仍是无解?

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

头条要闻

演员王星被骗至妙瓦底4天遭转卖3次 向女友发求救暗号

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

时尚
教育
旅游
游戏
本地

赫本的小黑裤,裤装界的气质王者

教育要闻

这么晚还没有做出来,都怕妈妈生气了

旅游要闻

全球媒体聚焦 | 美媒:中国魅力吸引全球游客深度体验

乐高首款《蝙蝠侠:阿卡姆骑士》主题套装公布:317片蝙蝠车,2027年1月发售

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版