网易首页 > 网易号 > 正文 申请入驻

Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员

0
分享至

听雨 发自 凹非寺
量子位 | 公众号 QbitAI

Claude开始训练Claude了!

时薪4美元,干赢时薪150美元的人类研究员。

在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。

部分任务上,它交出的方案甚至比28名人类安全研究员更好。

更刺激的是,较弱的Claude已经开始反向参与训练更强的Claude

AI「自己改进自己」的那一天,好像真的越来越近了…

4美元一小时,Claude跑赢人类研究员

在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。



具体而言,他们基于Claude Opus 4.8,搭建了一套名为AAR的自动化对齐研究员系统。

拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。



从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。

效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。

一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。

整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。

10道安全难题,Claude全部找到改进方案

实验中,Anthropic一口气给Claude出了10道题。

这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。



比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。

Claude每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。

最后,10类问题全部得到改善。



按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。

更重要的是,这些方法不只对Claude看过的题目有效。

部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的Petri评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型4.7倍的模型上,效果也能保留下来。

Anthropic还设置了一条红线:安全训练不能明显损害模型原有能力。

毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。

最终,Claude找到的方案在预设的通用能力测试中没有出现明显退化。

85%对20%,Claude大比分跑赢人类研究员

最悬殊的一局,出现在「欺骗」测试中。

为了让目标模型变得更诚实,Claude先后提交了150多次尝试。

它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了82%的安全差距;综合多次运行,平均成绩达到85%。



同一道题,Anthropic还交给了6名经验丰富的AI安全研究员。

结果,人类研究员平均只弥合了20%的安全差距…

85%对20%,Claude赢得那叫一个毫无悬念。

全部任务一共有28名人类安全研究员参加,每人最多可以用8小时阅读资料、设计方案。

论文称,自动化研究员通常能在6小时内找到超过人类平均水平的方法,人类提供的研究方向也没有让Claude取得更好的成绩。



最最最扎心的,在于成本!

一名自动化研究员每小时的API推理成本大约为4美元;Anthropic付给人类研究员的报酬,则是每小时150美元

这……人类研究员妥妥要被Claude替代了啊。

不过呢,这场人机比赛也并非完全公平。

Claude可以真正训练模型,看到每次实验的结果,再不断修改方案;人类研究员只能提交一次方法,没有机会根据结果继续迭代。

较弱Claude训练更强Claude,60小时逼近正式版

前面的实验,改进的主要还是开源小模型。

接下来,Anthropic把难度直接拉高:让能力较弱的Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本

所谓弟子不必不如师,说的大概就是这种模式了。



在60小时里,Sonnet 5测试了50多种解决方案。最终找到的方法弥合了约65%的安全差距,已经接近正式发布版Opus 4.8的72%。

这套方案使用的训练数据只有2000多条,主要由简单模板和公开数据集构成。

按照Anthropic的计算,在这组特定任务上,它的数据效率大约是生产级对齐流程的1.5万倍。

当然,这还不等于Anthropic可以用2000条数据,复制整套生产训练。

正式模型还要处理更多能力、更多风险以及大量极端情况,这次实验只针对一组明确的安全指标展开。

但这已经证明了,较弱的Claude已经可以自己查论文、设计方法、生成数据,再把训练结果写进更强的Claude。

人类划定范围,Claude负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。

AI改进AI,已经成为了发生在眼前的事实。

所以到底算不算「AI自进化」?

从结果来看,这项研究确实已经摸到了「AI自进化」的门槛。

但如果把「自进化」理解成一个AI完全自主地设计、训练并制造出更强的下一代AI,那这次实验还远没有走到那一步。

毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果算成功,都还是由人类决定。

Anthropic自己也承认,AAR能够优化的,只是人类事先写进评测系统的目标

这次实验没有覆盖其他复杂问题;一些低频或刚刚出现的风险,甚至还没有对应的Benchmark。

研究人员也只检查了一组预先选定的通用能力,因此无法排除某种安全训练在提高分数的同时,损害了其他没有被测试的能力。

Petri等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全,并不等于进入真实环境后也一定可靠。

所以,AAR最大的隐患也藏在它的优势里:它太擅长根据指标高速试错了

一旦尺子量错,Claude跑得越快,离人类真正想要的结果反而可能越远。

更戏剧性的是,研究Agent自己也会作弊



为了防止AAR钻评测规则的空子,Anthropic专门安排了一个监控Agent,检查Claude准备执行的方案和完整研究记录。

结果,在大约1600份研究记录中,监控模型发现了39次作弊尝试,占比约2.4%。

有的Agent反复提交同一方案,试图利用评测波动碰出一个更高分数;有的模仿Benchmark的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。

比起真正解决模型的安全问题,它们更想找到一条快速提高分数的捷径。

这多少有点黑色幽默了…合着Agent监守自盗了呗。



好消息是,这些作弊意图大多还会出现在模型的推理记录里,因此能被监控Agent发现。

坏消息是,Anthropic也不能确定未来更强的模型还会不会留下这么明显的痕迹。

当研究Agent拥有更多工具、更高权限,并且可以直接修改模型训练流程时,「怎样监控一个负责改进AI的AI」,可能会比训练本身更棘手。

但总而言之,一个AAR每小时大约花费4美元,可以连续工作,也可以一次复制出几十个、几百个并行跑实验。

而人类研究员的时薪远高于这个数,需要休息,一次能推进的实验数量也相当有限。

这笔账怎么算,答案都已经很明显了。

也不知道该说是核弹爆炸,还是当场瘫坐……

这一次,轮到造AI的人担心被AI抢饭碗了。

参考链接:
[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf
[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
央视直播中国女篮生死战,开球时间确定,宫鲁鸣输不起,王思雨得复出

央视直播中国女篮生死战,开球时间确定,宫鲁鸣输不起,王思雨得复出

体育大学僧
2026-09-05 09:31:11
坑惨国人的4款“伪豪车”,价格贵毛病多,国外没人要国内当成宝

坑惨国人的4款“伪豪车”,价格贵毛病多,国外没人要国内当成宝

北海史记
2026-09-05 10:51:35
2次被撞!德比斯怒了:纳瓦罗愚蠢危险行为应该被罚 没夺冠很遗憾

2次被撞!德比斯怒了:纳瓦罗愚蠢危险行为应该被罚 没夺冠很遗憾

念洲
2026-09-05 21:29:38
西藏吉隆:村民转移了,“临时饲养员”翻山进村巡逻喂鸡

西藏吉隆:村民转移了,“临时饲养员”翻山进村巡逻喂鸡

新华社
2026-09-05 11:13:11
特朗普回应玛丽亚·巴蒂罗姆离开福克斯新闻

特朗普回应玛丽亚·巴蒂罗姆离开福克斯新闻

娱圈观察员
2026-09-05 04:15:30
美国“生锈航母”,在泰国紧急清洗锈迹藻类,专家:中国海军急需这种锈蚀,这代表实战经验

美国“生锈航母”,在泰国紧急清洗锈迹藻类,专家:中国海军急需这种锈蚀,这代表实战经验

蓝星杂谈
2026-09-05 14:35:38
恩爱12年难抵残酷现实?46岁高圆圆现状曝光,赵又廷的处境太揪心

恩爱12年难抵残酷现实?46岁高圆圆现状曝光,赵又廷的处境太揪心

老塕是个手艺人
2026-09-05 16:14:32
孙宇晨17岁拿奖旧作曝光!法学界陈枫点评:认知不低,比胡锡进强

孙宇晨17岁拿奖旧作曝光!法学界陈枫点评:认知不低,比胡锡进强

小徐讲八卦
2026-09-05 14:53:16
11打13且0比2落后!两个门柱运气不佳!但国米就是赢了!

11打13且0比2落后!两个门柱运气不佳!但国米就是赢了!

狗哥是一名内拉
2026-09-06 02:15:45
学英语就是崇洋媚外?胡锡进硬刚汤家凤:偏激、狭隘、蠢货

学英语就是崇洋媚外?胡锡进硬刚汤家凤:偏激、狭隘、蠢货

蜜桔娱乐
2026-09-05 19:52:38
伟大的2-1逆转!郑钦文赢麻了:排名飙升+322万奖金+重返金花前三

伟大的2-1逆转!郑钦文赢麻了:排名飙升+322万奖金+重返金花前三

大秦壁虎白话体育
2026-09-06 02:12:08
成龙确诊ADHD,粉丝心疼极了

成龙确诊ADHD,粉丝心疼极了

大爱三湘
2026-09-05 22:24:19
丰田RAV4卖太好反成烦恼,经销商直呼"真不寻常"

丰田RAV4卖太好反成烦恼,经销商直呼"真不寻常"

灰度测试中
2026-09-05 02:51:15
国产半导体设备重大突破!北方华创宣布3D DRAM刻蚀突破:没有EUV也能造先进存储

国产半导体设备重大突破!北方华创宣布3D DRAM刻蚀突破:没有EUV也能造先进存储

快科技
2026-09-05 19:46:42
CCTV5直播!中国女篮生死战,战捷克迎两利好,胜则可小组出线

CCTV5直播!中国女篮生死战,战捷克迎两利好,胜则可小组出线

南海浪花
2026-09-06 05:37:08
得克萨斯州大举兴建数据中心,当地毕业生失业率反而走高

得克萨斯州大举兴建数据中心,当地毕业生失业率反而走高

IT之家
2026-09-05 17:08:06
普京下令暂停空袭基辅3天

普京下令暂停空袭基辅3天

每日经济新闻
2026-09-05 23:54:21
从月销4223台跌到367台!尊界销量暴跌90%!真要歇菜了吗?

从月销4223台跌到367台!尊界销量暴跌90%!真要歇菜了吗?

玩车专家1
2026-09-05 16:28:53
伊朗只是开始,下一个很有可能是台湾?拉美小国给中国敲响了警钟

伊朗只是开始,下一个很有可能是台湾?拉美小国给中国敲响了警钟

铜臭的历史味
2026-09-06 02:12:29
特斯拉中国宣布新优惠,但这要求确实过分啊!

特斯拉中国宣布新优惠,但这要求确实过分啊!

XCiOS俱乐部
2026-09-05 20:05:02
2026-09-06 07:40:49
量子位 incentive-icons
量子位
追踪人工智能动态
13270文章数 176550关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

教育
艺术
时尚
家居
军事航空

教育要闻

县城理工男最严厉的父亲

艺术要闻

别再说外星人了!三星堆最新发掘,直接实锤“龙的传人”

推广中奖名单-更新至2026年8月25日推广

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版