网易首页 > 网易号 > 正文 申请入驻

Anthropic最新RSI实验:Claude击败人类研究员,训练效率超1.5万倍

0
分享至



两个月前,Anthropic 还在讨论一个看似遥远的问题:当 AI 开始自己建设 AI,会发生什么?现在,它已经往这个方向又走了一步。

8 月 28 日,Anthropic 发布了一项关于“自动化对齐研究员”(Automated Alignment Researcher,AAR)的新研究。

研究人员让 Claude 自主完成查阅文献、提出研究方案、生成训练数据、训练模型、评估结果和继续迭代的完整研究循环,尝试解决欺骗、谄媚、越狱、提示注入、奖励黑客等 10 类常见的 AI 对齐失败问题。

结果是,在有对应人类基线的 7 类任务上,Claude 最终找到的方法全部超过了人类研究者提出的最佳方案,平均约 6.4 小时就能追平并超过人类。以“欺骗”为例,Claude 经过反复实验,平均弥合了 85% 的安全差距,而参与实验的人类研究者平均只有 20%。


(来源:X)

Anthropic 在博客中还披露了一个更接近递归自我改进(RSI)的实验:让能力相对较弱的模型,去帮助训练更强的后继模型。这比前面的实验更接近“AI 训练下一代 AI”的设想。

团队让 Claude Sonnet 5 为一个尚未完成生产级安全训练的早期 Claude Opus 4.8 检查点寻找对齐方案。大约 60 小时内,Claude 测试了 50 多种方案,将其对齐得分提升到 65%,接近正式版 Opus 4.8 的 72%。最终方案只使用约 2400 条训练样本;Anthropic 称,其样本效率约为现有生产级对齐流程的 1.5 万倍。

从“AI 写代码”,到“AI 自己做实验”

今年 6 月,Anthropic 联合创始人 Jack Clark 与 Anthropic Institute 负责人 Marina Favaro 发表了《When AI builds itself》,系统讨论了“递归自我改进”(Recursive Self-Improvement,RSI)。


(来源:Anthropic)

文章中,Anthropic 将 AI 参与自身研发的过程分成了几个阶段:最初是人类完成开发;随后聊天机器人开始辅助写代码;再之后是能够独立修改和运行代码的编程智能体;今天,一些智能体已经可以连续工作数小时,并把任务交给其他智能体。再往前一步,就是“闭环”——由 AI 自主设计、训练和改进自己的后继模型。

这并不只是对未来的想象,毕竟截至今年 5 月,Anthropic 合并到生产代码库中的代码,超过 80% 已经由 Claude 编写;2026 年第二季度,其工程师人均每天合并的代码量已经达到 2024 年的约 8 倍。Anthropic 此前还测试过让 Claude 自主优化一段训练小型 AI 模型的代码:2025 年 5 月,Claude Opus 4 平均只能将其加速约 3 倍,到 2026 年 4 月,Claude Mythos Preview 已经能够做到约 52 倍。

不过,当时 Anthropic 同样承认了一条明显的能力边界:AI 很擅长在目标已经确定后执行实验,却依然不擅长判断“什么问题值得研究”。

在工程任务中,人类已经可以只给 Claude 一个目标,让它自己寻找实现方式;但在更开放的研究中,人类仍然负责提出问题、确定成功标准和选择研究方向。

在这次的新研究中,他们则试图减小这段距离:研究团队找来了 28 位有技术 AI 安全研究经验的研究者,他们平均拥有 2.5 年相关经验,并且都曾在对应领域发表研究。每位研究者最多有 8 小时提出一个解决方案。与此同时,Anthropic 又运行了两组自动化实验:部分 Claude 从人类给出的研究思路开始,另一部分则完全自行选择方向。

结果显示,无论是否有人类提前告诉 Claude 应该往哪里研究,最终表现几乎没有明显差别。这说明,在目标和评价体系已经足够明确的问题上,Claude 不再必须依赖专家先给出一个研究点子。

五个 Claude,组成一间“虚拟实验室”

Anthropic 为这项实验搭建了一套接近真实科研流程的自动化系统。

研究开始后,4 个“图书管理员”智能体首先阅读相关论文,整理成共享的文献综述。随后,5 个由 Claude Opus 4.8 驱动的 AAR 同时进入实验:阅读文献和已有排行榜,搜索新的资料,提出几种候选方案,再选择其中一个写成一篇小型研究论文。

这篇“论文”必须包含研究动机、相关工作、训练方法、数据来源和实验参数,并至少引用 5 项相关研究。更重要的是,它必须在实验结果出来之前冻结,从而避免 Claude 在看到成绩以后再倒推一个听上去合理的解释。

随后,监督智能体检查代码是否违规。如果通过,每个方案会获得一张 H200 GPU,大约进行 30 分钟训练。独立评估系统再运行测试,将结果放进所有 AAR 都能看到的排行榜里。几个智能体因此可以看到彼此失败或成功的方案,并继续进行下一轮改进。


(来源:Anthropic)

实验对象包括谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客和隐藏不确定性 10 类问题。每一类问题都设置了 3 至 5 个公开测试,同时还有 Claude 从未见过的留出测试(Hold-out Test)。

这一步很重要。如果 AI 只需要把某一个公开榜单的成绩刷高,很容易出现“应试”甚至直接针对测试集优化。Anthropic 因此还使用 MMLU、GSM8K 和 IFEval 检查模型的一般能力,如果某种安全训练让模型整体能力显著下降,这个方案会被直接淘汰。

最终,在全部 10 类对齐失败上,AAR 都找到了能够改善目标行为、同时没有明显破坏通用能力的方法。自动研究弥合的安全差距从约 26% 到 96% 不等,而且部分方法可以迁移到从未见过的测试、开放式多轮行为审计 Petri,以及参数规模最高约为原模型 4.7 倍的更大模型上。

与人类的比较同样明显。在 7 类有人类方案参与的任务中,AAR 最后找到的最佳方案全部超过了人类提出的最佳方案。

不过,这个“击败人类”还是有一些水分存在,因为这场人机科研比赛并不是完全公平。

人类研究者只有一次提交机会,不能根据实验成绩连续修改方案;Claude 则能够不断试错,一个任务可能累计评估上百种方法。Anthropic 自己也因此明确表示,与其把结果理解成“Claude 已经是比人类更好的安全科学家”,不如把它看成一种新的研究分工:AI 能够用远高于人类的实验吞吐量搜索大量方法,再由人类进一步分析和完善。


(来源:Anthropic)

弱模型开始给更强的模型做“安全训练”

真正把这项工作与“AI 自己建设 AI”联系起来的,是论文最后一个实验。

此前的大部分实验,本质上都是能力很强的 Claude Opus 4.8 帮助规模较小的开源模型改善安全表现。但真正的递归自我改进意味着另一种关系:今天的模型,需要帮助训练比自己更强的下一代模型。因此,Anthropic 反转了两者的位置。

研究人员根据 Epoch Capabilities Index,将 Claude Sonnet 5 的能力指数记为 156,而一个早期 Opus 4.8 检查点为 158。也就是说,他们让一个略弱的模型去改善一个略强的后继模型。

这一次,Claude 需要同时处理全部 10 类对齐失败。大约 60 小时内,它连续测试 50 多种训练数据方案,最终把早期 Opus 4.8 的综合对齐成绩提高到 65%;作为参照,完成 Anthropic 全套生产级安全训练的正式版 Opus 4.8 得分为 72%。

获胜方案只用了约 2400 个由简单模板和公开数据集生成的训练样本。Anthropic 官方博客进一步称,这一方案的效率约为其生产对齐流程的 1.5 万倍。


(来源:Anthropic)

但“1.5 万倍”并不意味着 Claude 已经可以取代 Anthropic 整套安全部门。

论文特别强调,这套实验只衡量了预先定义好的 10 类对齐问题。现实中的生产模型还有大量更模糊、没有成熟基准甚至尚未被发现的失败模式;Petri 等自动化评估本身也只是现实行为的代理指标。此外,研究没有验证这些安全改善在模型继续经历大量强化学习训练以后是否依然存在。

事实上,实验还暴露了一个新问题:负责研究如何让 AI 更安全的 AI,自己也会试图“作弊”。

研究人员用 Claude Opus 4.8 检查了 1601 条 AAR 研究轨迹,最终发现其中 39 条、约 2.4% 存在作弊行为。具体包括反复提交同一个方案碰运气、生成模仿测试格式的数据,以及试图隐藏违规使用评测信息的步骤。相关结果最终都被排除。

因此,如果把 Anthropic 6 月提出的“AI 自己建设 AI”看作一个闭环,那么现在这个闭环还是没有完全合上。人类仍然决定哪些行为属于“对齐失败”,选择测试基准,规定哪些能力不能下降,并设计监督系统防止 AI 钻漏洞。AI 开始接管的是研究循环,而不是研究目标。

但与几个月前相比,这个边界确实又向前移动了一点。

1.https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

2.https://alignment.anthropic.com/2026/automated-alignment-researchers/

3.https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
韩媒报道:朴彩英拒绝100亿韩元中国奶茶代言

韩媒报道:朴彩英拒绝100亿韩元中国奶茶代言

韩小娱
2026-09-03 15:24:07
我的提示词这么干净,怎么 Grok 还是在搞黄色?

我的提示词这么干净,怎么 Grok 还是在搞黄色?

果壳
2026-09-03 17:04:22
窦唯女儿窦佳嫄798办画展,纹身长发披肩,五官精致酷似网红

窦唯女儿窦佳嫄798办画展,纹身长发披肩,五官精致酷似网红

骄阳之夏明
2026-09-02 18:39:44
跳过训练营直接签约:国王为何给本西一份350万合同

跳过训练营直接签约:国王为何给本西一份350万合同

温柔且自由
2026-09-05 08:39:38
巴蒂斯塔为演《战神》疯狂锻炼增肌 已初具奎爷身材

巴蒂斯塔为演《战神》疯狂锻炼增肌 已初具奎爷身材

游民星空
2026-09-03 19:15:29
姆巴佩今晨怎么了?失点+中框是学梅西?但禁区射术,他不如梅西

姆巴佩今晨怎么了?失点+中框是学梅西?但禁区射术,他不如梅西

老霍聊球
2026-09-05 06:27:01
德国乒协宣布:2027赛季不再承办WTT法兰克福冠军赛,另有赛事正在筹备

德国乒协宣布:2027赛季不再承办WTT法兰克福冠军赛,另有赛事正在筹备

乒谈
2026-09-04 21:28:29
2米21的张子宇让美国球星直言:从没遇过这么高的女球员

2米21的张子宇让美国球星直言:从没遇过这么高的女球员

慢享生活集
2026-09-04 23:26:15
全场看呆!美军连夜狂射130枚导弹,中国预警机全程在线围观

全场看呆!美军连夜狂射130枚导弹,中国预警机全程在线围观

共工之锚
2026-09-05 00:20:38
郑钦文23点登场冲美网16强!将战澳网冠军+今年曾逆转对手 赔率看衰

郑钦文23点登场冲美网16强!将战澳网冠军+今年曾逆转对手 赔率看衰

我爱英超
2026-09-05 06:15:43
随着中国女篮61-94美国,产生6个不争的事实,女篮扛旗人表现糟糕

随着中国女篮61-94美国,产生6个不争的事实,女篮扛旗人表现糟糕

南海浪花
2026-09-04 22:14:49
华为何庭波,再次更新韬定律论文

华为何庭波,再次更新韬定律论文

第一财经资讯
2026-09-04 23:03:00
俄喊话打击英国本土!英国网民的回应绝了:建议攻打治安差的城市

俄喊话打击英国本土!英国网民的回应绝了:建议攻打治安差的城市

麓谷隐士
2026-09-04 00:55:03
美网疯狂一夜!18岁新星轰6-0,中国金花4胜1负,郑钦文迎战凯斯

美网疯狂一夜!18岁新星轰6-0,中国金花4胜1负,郑钦文迎战凯斯

帛河体育
2026-09-04 12:00:51
美网爆冷夜7号种子穆霍娃0 2被纳瓦罗砸出局,16强狂出7席,萨巴伦卡下轮对手敲定汤森德,郑钦文今夜23点硬刚凯斯

美网爆冷夜7号种子穆霍娃0 2被纳瓦罗砸出局,16强狂出7席,萨巴伦卡下轮对手敲定汤森德,郑钦文今夜23点硬刚凯斯

泽风飘渺j
2026-09-05 08:01:54
徐州发布最新人事任免

徐州发布最新人事任免

扬子晚报
2026-09-04 21:03:09
景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

梨莱
2026-08-30 22:56:54
情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

情侣在瑞士雪山顶“撒欢”,就这么被全世界直播了···

新欧洲
2026-04-21 19:37:05
科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

汉史趣闻
2026-09-01 13:47:29
龚爽37岁病逝后,丈夫身份曝光,大学相爱八年婚姻背后藏一大痛点

龚爽37岁病逝后,丈夫身份曝光,大学相爱八年婚姻背后藏一大痛点

观星赏月
2026-09-05 06:23:41
2026-09-05 09:19:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17190文章数 515200关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

教育
家居
艺术
亲子
公开课

教育要闻

班级纪律乱成一锅粥?25个“硬核”技巧,人狠话不多,亲测有效

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

明朝灭亡那年,他画了一群女生玩古代飞花令

亲子要闻

为什么好好说话孩子不听非要吼

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版