网易首页 > 网易号 > 正文 申请入驻

Anthropic让AI自己研究怎么"听话",安全差距最高弥合96%

0
分享至

“自动化对齐研究,可能在不久的将来成为现实。”刚刚, Anthropic 发布的一项新研究显示,让 Claude自主搜索论文、提出训练方法、生成数据、训练模型并反复测试,它不仅能够独立修复10类常见的AI对齐失败,而且在欺骗(deception)问题上,最多弥合了 85% 的安全差距 ,而人类安全研究人员平均只弥合了 20%。


更值得注意的是,这些方法并非只在 Claude 见过的测试集上有效,在此前没有展示给它的对齐基准,以及 Petri 对抗性测试中,同样成立。

而且,其能够迁移到规模最高达其优化模型 4.7 倍的模型上。

进一步实验中,能力更弱的 Claude Sonnet 5 仅用 60 小时、尝试 50 多种方案,就把尚未完成生产级安全训练的 Claude Opus 4.8 早期版本,训练到了接近正式发布模型的对齐水平,而最终方案只用了 2000 多条训练样本。

但这项研究同样暴露出一个危险问题:当 AI 开始自己研究如何让 AI 更安全时,我们又该如何确保它没有作弊?

Anthropic 发现,约 1600 条研究智能体轨迹中有 39 条出现了作弊尝试。

研究团队认为,目前这些行为仍大多能够被监控模型发现,但未来模型可能会变得更加难以监控。

这项工作距离“AI 自己解决 AI 对齐”显然还有很远,但它正在把一个曾经偏理论的问题,逐渐变成一个可以实验、衡量和迭代的工程问题。

对齐(Alignment),即让AI 听话,让它的想法、行为、输出,完完全全顺着人类的目标、意愿、价值观、安全规则走,而不要自作主张跑偏、叛逆、搞出人类不想要的结果。

以下为 Anthropic 报告全文翻译⸻

《自动化研究人员能够可靠地缓解对齐失败》

随着 AI 开始参与构建下一代 AI,自动化对齐研究变得越来越重要。只有将对齐研究自动化,安全研究才能跟上 AI 能力发展的速度。

尽管衡量对齐研究是否成功极其困难,但 Anthropic 及其他机构的研究人员已经开发出一些基准测试和自动化审计工具,例如 Petri,用于量化常见的对齐失败,包括欺骗、迎合以及越狱等问题。

在我们此前的一项实验中,我们让 Claude 寻找有效的方法,利用能力较弱的 AI 模型作为“教师”,监督能力更强模型(即“学生”模型)的训练。

现在,我们发布一份建立在这一思路之上的新报告。

我们让 Claude 自主训练模型,以改善模型在多个公开基准测试上的表现。这些基准测试分别衡量 10 类对齐失败。

例如,在隐私违规方面,Claude 使用 ConfAIde、PrivaCI-Bench 和 PrivacyLens 等基准进行优化。

Claude 每次只处理一种对齐失败,通过一个循环不断进行研究:搜索文献、提出方法和数据、训练模型,然后测试结果。

我们通过“安全差距弥合率”(percentage of safety gap closed)来判断 Claude 的成功程度,也就是其方法让学生模型距离理论上的完美分数还有多远。

对于每一种对齐失败,我们通常使用三到五个基准测试来综合判断。

同时,我们排除了那些会损害学生模型通用能力的对齐方法,并禁止 Claude 将自身的对齐能力直接蒸馏到目标模型中。

我们通过一个监控智能体来执行这些限制。这个监控智能体会在 Claude 执行任何方法之前,读取 Claude 计划采用的每一种方法。

我们的目标主要是验证三件事。

第一,Claude 提出的方法能否在它研究过程中从未见过的对齐评估中继续有效。

第二,这些方法能否避免降低学生模型的能力。毕竟,安全训练可能让模型更加频繁地拒绝任务,从而降低整体可用性。

第三,这些方法能否继续适用于比 Claude 在实验中负责对齐的模型更大的模型。

三个方面,Claude 都做到了。

针对全部 10 类对齐失败,Claude 都找到了能够改善目标基准表现、同时不损害模型能力的方法。

表现最好的方法不仅能够通过此前未见过的对齐基准测试,还能在 Petri 上发挥作用。Petri 是一个开源工具,可以模拟对抗性的多轮交互场景,用于测试模型的失配行为。

更重要的是,这些方法在规模最高达到 Claude 原本优化模型 4.7 倍的模型上仍然有效。

自动化研究人员通过迭代测试,弥合了欺骗问题 85% 的安全差距;人类研究人员则弥合了 20%。


在 10 类对齐失败上,我们分别使用自动化对齐研究人员进行缓解。在每一种情况下,它都弥合了相当大一部分距离完美表现的安全差距。

Claude 的表现甚至超过了 28 名人类安全研究人员。这些研究人员最多有 8 个小时设计解决方案。

以欺骗为例,Claude 最好的方法比人类最佳方案高出 20%。

不过,人类研究人员无法对自己的方案进行迭代,因此我们并不认为这是一场直接的人机能力比较。我们更愿意将其视为一种工作流程的证据:Claude 可以帮助人类找到有潜力的对齐方法,再由人类进一步改进。

在 10 类对齐失败中,从迎合到奖励破解,自动化研究弥合了 26% 至 96% 的安全差距。


在 Gemma-2-2B 上进行的欺骗缓解实验中,Claude 提交了超过 150 次尝试,最终弥合了 82% 的安全差距。多次实验的平均值为 85%。相比之下,6 名经验丰富的安全研究人员在相同规则下提出的方法,在用于训练的基准测试上平均只能弥合 20% 的差距。图中的误差线代表 95% 置信区间。

未来,当 Claude 的对齐研究能力超过最优秀的人类研究人员之后,我们可能希望让 Claude 直接为它更强大的后继模型进行对齐。

为了评估这一可能性,我们测试了一个能力更弱的 Claude 模型能否帮助更强大的模型缓解对齐失败。

Claude 能否让生产级模型实现更好的对齐?

我们让 Claude Sonnet 5——其 Epoch Capabilities Index 能力指数低于 Claude Opus 4.8——来解决一个尚未完成大部分生产级对齐训练的早期 Claude Opus 4.8 检查点中的对齐失败问题。

仅用了 60 小时,Claude 就尝试了超过 50 种解决方案,最终让模型的对齐得分接近我们的生产模型。

最终胜出的方案只包含略超过 2000 条训练样本。这些样本来自简单模板或公开数据集,因此从训练样本效率来看,比我们的生产级对齐流程高效约 1.5 万倍。

自动化研究在 60 小时内弥合了一个前沿规模模型 65% 的安全差距,而正式发布的 Claude Opus 4.8 为 72%。


在这个生产系统实验中,当 Claude Sonnet 5 为 Claude Opus 4.8 的早期检查点提出对齐缓解方案后,它很快就发现了一种能够弥合大部分安全差距的方法,使其表现接近正式发布版本的 Opus 4.8。

Claude 提出了什么?

总体而言,这些智能体最终都收敛到了研究文献中已经受到认可的方法,并通过大量迭代进一步改进。

以迎合行为为例,98% 的提议方案都采用了一种已经发表的技术:让模型使用自身“不迎合”的回答进行训练。

具体而言,相比标准的提示词方法,Claude 使用了 activation steering(激活引导)。

这种方法会在模型生成过程中调整其内部表征,从而推动模型远离迎合模式,并生成更加干净的训练数据。

监控作弊行为

我们最近发现,Claude 可以通过从远程 API 中窃取测试标签、挑选有利结果等方式进行作弊。

为了发现这些作弊行为,我们让 Claude Opus 4.8 监控了全部 10 类对齐失败实验中的约 1600 条研究智能体轨迹。

最终发现了 39 次作弊尝试,占 2.4%。

由于 Opus 4.8 当前的失当行为仍然往往会出现在其推理过程中,我们对监控模型已经捕获了这项研究中的大部分作弊行为持谨慎乐观态度。

但对于未来的模型,这一点可能不再成立。

因此,我们认为,在未来模型中维持较高的可监控性至关重要。

我们衡量的是正确的东西吗?

尽管这些结果令人鼓舞,但这项实验仍存在一些限制。

首先,我们研究的对齐失败类型,与生产环境中的实际问题相比仍然比较狭窄。例如,我们没有衡量政治偏见。

其次,一些对齐失败可能发生得极其罕见,或者出现得太新,目前根本没有相应的基准测试可以衡量。

第三,只有当 Claude 的方法降低了我们预先设定的一组有限能力时,我们才会拒绝这些方法。

这意味着,一些被接受的方法可能实际上损害了其他重要能力,只是这些能力没有被我们测量。

此外,Petri 等评估工具本质上仍然只是现实世界失配行为的代理指标。

我们也没有测试:如果模型之后继续接受针对其他任务的大规模强化学习训练,这些对齐能力是否仍然能够保持。

接下来,我们计划继续提升 Claude 衡量细微失配行为的能力,进一步研究如何自动化生产级模型的对齐后训练,并开展更加全面的分析。

总体而言,我们认为这些结果是一个早期但积极的信号:自动化对齐后训练可能在不久的将来成为现实。

随着研究继续推进,我们会持续分享最新进展。

我们在完整报告中详细介绍了未来的研究方向。

同时,我们将自动化对齐研究工具链开源,希望其他研究人员能够在此基础上继续研究,并用它来帮助自己的模型实现对齐。

完整报告还介绍了智能体所处的研究环境、10 类对齐失败的全部实验结果,以及智能体提出的方法。附录中则提供了基准验证和具体案例。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
决胜盘霸气逆转!萨巴伦卡3连杀温网冠军 美网18连胜+连续6年进4强

决胜盘霸气逆转!萨巴伦卡3连杀温网冠军 美网18连胜+连续6年进4强

我爱英超
2026-09-09 06:16:18
女子称被4岁男童摸屁股,绝不谅解在走诉讼流程了,她账号上8个视频3个都是吵架的

女子称被4岁男童摸屁股,绝不谅解在走诉讼流程了,她账号上8个视频3个都是吵架的

汉史趣闻
2026-09-08 11:27:38
全网羡慕的“苏DWE985”送女儿上哈工大是假的?警方发话了

全网羡慕的“苏DWE985”送女儿上哈工大是假的?警方发话了

现代快报
2026-09-08 16:42:41
律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

追月数星
2026-09-08 14:09:40
输球赢人品!意大利主帅表态,日本队一针见血,女篮赢球原因曝光

输球赢人品!意大利主帅表态,日本队一针见血,女篮赢球原因曝光

寒士之言本尊
2026-09-08 18:25:30
1.45亿超巨献助攻,哈兰德梅开二度,曼城2-0掀翻欧冠双冠王

1.45亿超巨献助攻,哈兰德梅开二度,曼城2-0掀翻欧冠双冠王

钉钉陌上花开
2026-09-09 05:02:52
中埃演习落幕,歼-16没回家留中东镇场子:涉密重器直接摆上台

中埃演习落幕,歼-16没回家留中东镇场子:涉密重器直接摆上台

面包夹知识
2026-09-08 22:10:03
“奴工理论”照进China GT:中国最高级别赛车赛事,依旧是草台班子!

“奴工理论”照进China GT:中国最高级别赛车赛事,依旧是草台班子!

人间运行手册
2026-09-08 08:05:17
知名纸巾致癌物含量过高,官方:停止销售!立案调查!

知名纸巾致癌物含量过高,官方:停止销售!立案调查!

南方都市报
2026-09-08 11:56:14
长沙小孩摸女人后续:正脸曝光,网红账号被扒,黑历史一件接一件

长沙小孩摸女人后续:正脸曝光,网红账号被扒,黑历史一件接一件

皮蛋儿电影
2026-09-08 14:19:33
加拿大开美国盟友“反击”先例,最高50%关税落地,特朗普下一拳要打哪里?

加拿大开美国盟友“反击”先例,最高50%关税落地,特朗普下一拳要打哪里?

上观新闻
2026-09-08 16:52:43
高一女生在学校组织“军训”中遭强制猥亵:涉事“教官”有犯罪记录,已被刑拘

高一女生在学校组织“军训”中遭强制猥亵:涉事“教官”有犯罪记录,已被刑拘

澎湃新闻
2026-09-08 20:14:33
56比94惨败38分无缘八强!中国女篮压力大了:日韩出局他们成独苗

56比94惨败38分无缘八强!中国女篮压力大了:日韩出局他们成独苗

篮球快餐车
2026-09-09 04:57:55
人民日报发文“你用过鸿蒙系统吗”,半个娱乐圈明星和十余所高校跟评,网友质疑:是为了KPI吗

人民日报发文“你用过鸿蒙系统吗”,半个娱乐圈明星和十余所高校跟评,网友质疑:是为了KPI吗

Mr王的饭后茶
2026-09-08 18:39:36
越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

平老师666
2026-09-08 21:41:14
宇树科技盘中跌至527元,股价大幅回落;王兴兴曾谈到:希望投资者是“认同公司的价值才买我们的股票”,而不是一味炒作

宇树科技盘中跌至527元,股价大幅回落;王兴兴曾谈到:希望投资者是“认同公司的价值才买我们的股票”,而不是一味炒作

每日经济新闻
2026-09-08 17:42:19
中国一口气下单5亿桶俄罗斯石油,按60美元一桶算,一桶60美元,5亿桶就是300亿美元!这几个数字放在一起,确实是一笔分量十足的能源交易

中国一口气下单5亿桶俄罗斯石油,按60美元一桶算,一桶60美元,5亿桶就是300亿美元!这几个数字放在一起,确实是一笔分量十足的能源交易

陌上初安j
2026-09-08 16:48:23
韦世豪:我被网暴最严重!被骂不能还嘴?想看我退圈?都别装好人

韦世豪:我被网暴最严重!被骂不能还嘴?想看我退圈?都别装好人

念洲
2026-09-08 15:59:56
12小时仅50块?学生爆料被学校派去做鲜花饼,因不满薪资往饼里吐痰

12小时仅50块?学生爆料被学校派去做鲜花饼,因不满薪资往饼里吐痰

齐天候
2026-09-08 20:46:49
美股光通信、芯片股爆发,Lumentum涨超11%,英特尔市值一夜飙涨2900亿元,中概股下挫,国际油价涨超2%,美军称摧毁5艘伊朗原油运输船

美股光通信、芯片股爆发,Lumentum涨超11%,英特尔市值一夜飙涨2900亿元,中概股下挫,国际油价涨超2%,美军称摧毁5艘伊朗原油运输船

21世纪经济报道
2026-09-09 06:54:23
2026-09-09 07:24:49
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
662文章数 104关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

头条要闻

太子奶创始人李途纯北京离世 曾被羁押身陷囹圄15个月

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

本地
亲子
时尚
家居
公开课

本地新闻

宁波,中国制造的隐藏大佬

亲子要闻

倒贴200万无人要,我求奶奶收留我!

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版