网易首页 > 网易号 > 正文 申请入驻

Claude开始训练Claude!4美元一小时,跑赢150美元人类研究员

0
分享至

听雨 发自 凹非寺
量子位 | 公众号 QbitAI

Claude开始训练Claude了!

时薪4美元,干赢时薪150美元的人类研究员。

在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。

部分任务上,它交出的方案甚至比28名人类安全研究员更好。

更刺激的是,较弱的Claude已经开始反向参与训练更强的Claude

AI「自己改进自己」的那一天,好像真的越来越近了…

4美元一小时,Claude跑赢人类研究员

在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。



具体而言,他们基于Claude Opus 4.8,搭建了一套名为AAR的自动化对齐研究员系统。

拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。



从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。

效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。

一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。

整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。

10道安全难题,Claude全部找到改进方案

实验中,Anthropic一口气给Claude出了10道题。

这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。



比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。

Claude每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。

最后,10类问题全部得到改善。



按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。

更重要的是,这些方法不只对Claude看过的题目有效。

部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的Petri评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型4.7倍的模型上,效果也能保留下来。

Anthropic还设置了一条红线:安全训练不能明显损害模型原有能力。

毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。

最终,Claude找到的方案在预设的通用能力测试中没有出现明显退化。

85%对20%,Claude大比分跑赢人类研究员

最悬殊的一局,出现在「欺骗」测试中。

为了让目标模型变得更诚实,Claude先后提交了150多次尝试。

它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了82%的安全差距;综合多次运行,平均成绩达到85%。



同一道题,Anthropic还交给了6名经验丰富的AI安全研究员。

结果,人类研究员平均只弥合了20%的安全差距…

85%对20%,Claude赢得那叫一个毫无悬念。

全部任务一共有28名人类安全研究员参加,每人最多可以用8小时阅读资料、设计方案。

论文称,自动化研究员通常能在6小时内找到超过人类平均水平的方法,人类提供的研究方向也没有让Claude取得更好的成绩。



最最最扎心的,在于成本!

一名自动化研究员每小时的API推理成本大约为4美元;Anthropic付给人类研究员的报酬,则是每小时150美元

这……人类研究员妥妥要被Claude替代了啊。

不过呢,这场人机比赛也并非完全公平。

Claude可以真正训练模型,看到每次实验的结果,再不断修改方案;人类研究员只能提交一次方法,没有机会根据结果继续迭代。

较弱Claude训练更强Claude,60小时逼近正式版

前面的实验,改进的主要还是开源小模型。

接下来,Anthropic把难度直接拉高:让能力较弱的Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本

所谓弟子不必不如师,说的大概就是这种模式了。



在60小时里,Sonnet 5测试了50多种解决方案。最终找到的方法弥合了约65%的安全差距,已经接近正式发布版Opus 4.8的72%。

这套方案使用的训练数据只有2000多条,主要由简单模板和公开数据集构成。

按照Anthropic的计算,在这组特定任务上,它的数据效率大约是生产级对齐流程的1.5万倍。

当然,这还不等于Anthropic可以用2000条数据,复制整套生产训练。

正式模型还要处理更多能力、更多风险以及大量极端情况,这次实验只针对一组明确的安全指标展开。

但这已经证明了,较弱的Claude已经可以自己查论文、设计方法、生成数据,再把训练结果写进更强的Claude。

人类划定范围,Claude负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。

AI改进AI,已经成为了发生在眼前的事实。

所以到底算不算「AI自进化」?

从结果来看,这项研究确实已经摸到了「AI自进化」的门槛。

但如果把「自进化」理解成一个AI完全自主地设计、训练并制造出更强的下一代AI,那这次实验还远没有走到那一步。

毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果算成功,都还是由人类决定。

Anthropic自己也承认,AAR能够优化的,只是人类事先写进评测系统的目标

这次实验没有覆盖其他复杂问题;一些低频或刚刚出现的风险,甚至还没有对应的Benchmark。

研究人员也只检查了一组预先选定的通用能力,因此无法排除某种安全训练在提高分数的同时,损害了其他没有被测试的能力。

Petri等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全,并不等于进入真实环境后也一定可靠。

所以,AAR最大的隐患也藏在它的优势里:它太擅长根据指标高速试错了

一旦尺子量错,Claude跑得越快,离人类真正想要的结果反而可能越远。

更戏剧性的是,研究Agent自己也会作弊



为了防止AAR钻评测规则的空子,Anthropic专门安排了一个监控Agent,检查Claude准备执行的方案和完整研究记录。

结果,在大约1600份研究记录中,监控模型发现了39次作弊尝试,占比约2.4%。

有的Agent反复提交同一方案,试图利用评测波动碰出一个更高分数;有的模仿Benchmark的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。

比起真正解决模型的安全问题,它们更想找到一条快速提高分数的捷径。

这多少有点黑色幽默了…合着Agent监守自盗了呗。



好消息是,这些作弊意图大多还会出现在模型的推理记录里,因此能被监控Agent发现。

坏消息是,Anthropic也不能确定未来更强的模型还会不会留下这么明显的痕迹。

当研究Agent拥有更多工具、更高权限,并且可以直接修改模型训练流程时,「怎样监控一个负责改进AI的AI」,可能会比训练本身更棘手。

但总而言之,一个AAR每小时大约花费4美元,可以连续工作,也可以一次复制出几十个、几百个并行跑实验。

而人类研究员的时薪远高于这个数,需要休息,一次能推进的实验数量也相当有限。

这笔账怎么算,答案都已经很明显了。

也不知道该说是核弹爆炸,还是当场瘫坐……

这一次,轮到造AI的人担心被AI抢饭碗了。

参考链接:
[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf
[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
果不其然,中方前脚撤完人,李在明后脚找茬,逼中国修改涉韩表述

果不其然,中方前脚撤完人,李在明后脚找茬,逼中国修改涉韩表述

影孖看世界
2026-09-04 21:41:44
德国的强硬回击,让俄罗斯绷不住了

德国的强硬回击,让俄罗斯绷不住了

山河路口
2026-09-03 22:42:02
皇马1-1贝蒂斯:穆帅首秀遭绝平,姆巴佩罚失关键点球

皇马1-1贝蒂斯:穆帅首秀遭绝平,姆巴佩罚失关键点球

带你逛体坛
2026-09-05 16:53:40
真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

真爷们!张继科罕见回应景甜风波,一句话护尽前任体面,格局大了

一盅情怀
2026-09-03 11:22:44
某博主:星宇股份风波属于内部矛盾,咱们要抵制外部势力借个案炒作!结果评论区十分清醒

某博主:星宇股份风波属于内部矛盾,咱们要抵制外部势力借个案炒作!结果评论区十分清醒

谭谈社会
2026-09-04 13:27:03
越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

铁锤妹妹是只猫
2026-09-04 22:27:16
千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

千万不要给孩子这种暗示:他会深信不疑的,并用一生时间去验证

户外阿毽
2026-09-03 13:17:36
男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

男子给爱车贴膜忘记去掉图片水印,取车时看到满车字母懵了;老板:特意找了技术好的师傅来贴复杂图案

浙江卫视
2026-09-03 14:13:05
伊朗婚礼现场遭袭致5人死亡、近70人受伤,专家:很可能是美国武器,而非失误的伊朗防空导弹,该武器可能是偏离了目标

伊朗婚礼现场遭袭致5人死亡、近70人受伤,专家:很可能是美国武器,而非失误的伊朗防空导弹,该武器可能是偏离了目标

鲁中晨报
2026-09-04 09:22:02
张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

张馨予太丰满了,穿挖洞衣凹凸感藏不住,我感慨军人老公眼光真好

蓓小西
2026-09-05 09:00:14
女篮世界杯出线形势!中国队33分惨败晋级无忧:中日韩3队或携手出线

女篮世界杯出线形势!中国队33分惨败晋级无忧:中日韩3队或携手出线

篮球快餐车
2026-09-05 03:12:18
伊朗媒体称哈尔克岛附近传出爆炸声

伊朗媒体称哈尔克岛附近传出爆炸声

新华社
2026-09-05 14:47:07
山西惜败北京!刘传兴32+13空砍,张宁持续低迷,赵嘉仁哑火!

山西惜败北京!刘传兴32+13空砍,张宁持续低迷,赵嘉仁哑火!

篮球资讯达人
2026-09-05 19:35:48
传玛莎拉蒂与华为、江淮合作,2027年推出基于尊界的电动车

传玛莎拉蒂与华为、江淮合作,2027年推出基于尊界的电动车

观察者网
2026-09-05 14:37:20
顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

顾不上伊朗了?特朗普警告:美国若不做这件事,中国就要赢了!

乌克兰小静
2026-09-05 08:36:07
10点!CCTV5直播男篮亚运揭幕战,赢球希望大?19岁新星期盼亮相

10点!CCTV5直播男篮亚运揭幕战,赢球希望大?19岁新星期盼亮相

盛夏微凉
2026-09-05 10:06:09
全国唯一拥有两所“211”高校的县级市迎来5500多名新生

全国唯一拥有两所“211”高校的县级市迎来5500多名新生

21世纪经济报道
2026-09-03 16:25:55
赶在发布会前!运营商晒iPhone 18 Pro/Ultra售价:苹果这涨幅并不激进

赶在发布会前!运营商晒iPhone 18 Pro/Ultra售价:苹果这涨幅并不激进

快科技
2026-09-05 12:44:35
28.99万 !现代汽车正式上市!

28.99万 !现代汽车正式上市!

科技堡垒
2026-09-04 10:45:57
重庆市市三名干部被查处

重庆市市三名干部被查处

江津融媒
2026-09-05 11:24:18
2026-09-05 20:07:00
量子位 incentive-icons
量子位
追踪人工智能动态
13268文章数 176550关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

时尚
本地
数码
亲子
手机

杨紫:自渡成舟

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

IFA2026现场直击:绿联双馆齐发,AI全家桶抢占C位

亲子要闻

“你该长大了”,宝妈撒娇痛哭,不愿走1.5公里送娃上学,力竭了

手机要闻

台风沙德尔来袭!小米宣布提供小米手机数码/家电免费维修:范围公布

无障碍浏览 进入关怀版