“自动化对齐研究,可能在不久的将来成为现实。”刚刚, Anthropic 发布的一项新研究显示,让 Claude自主搜索论文、提出训练方法、生成数据、训练模型并反复测试,它不仅能够独立修复10类常见的AI对齐失败,而且在欺骗(deception)问题上,最多弥合了 85% 的安全差距 ,而人类安全研究人员平均只弥合了 20%。
![]()
更值得注意的是,这些方法并非只在 Claude 见过的测试集上有效,在此前没有展示给它的对齐基准,以及 Petri 对抗性测试中,同样成立。
而且,其能够迁移到规模最高达其优化模型 4.7 倍的模型上。
进一步实验中,能力更弱的 Claude Sonnet 5 仅用 60 小时、尝试 50 多种方案,就把尚未完成生产级安全训练的 Claude Opus 4.8 早期版本,训练到了接近正式发布模型的对齐水平,而最终方案只用了 2000 多条训练样本。
但这项研究同样暴露出一个危险问题:当 AI 开始自己研究如何让 AI 更安全时,我们又该如何确保它没有作弊?
Anthropic 发现,约 1600 条研究智能体轨迹中有 39 条出现了作弊尝试。
研究团队认为,目前这些行为仍大多能够被监控模型发现,但未来模型可能会变得更加难以监控。
这项工作距离“AI 自己解决 AI 对齐”显然还有很远,但它正在把一个曾经偏理论的问题,逐渐变成一个可以实验、衡量和迭代的工程问题。
对齐(Alignment),即让AI 听话,让它的想法、行为、输出,完完全全顺着人类的目标、意愿、价值观、安全规则走,而不要自作主张跑偏、叛逆、搞出人类不想要的结果。
以下为 Anthropic 报告全文翻译⸻
《自动化研究人员能够可靠地缓解对齐失败》
随着 AI 开始参与构建下一代 AI,自动化对齐研究变得越来越重要。只有将对齐研究自动化,安全研究才能跟上 AI 能力发展的速度。
尽管衡量对齐研究是否成功极其困难,但 Anthropic 及其他机构的研究人员已经开发出一些基准测试和自动化审计工具,例如 Petri,用于量化常见的对齐失败,包括欺骗、迎合以及越狱等问题。
在我们此前的一项实验中,我们让 Claude 寻找有效的方法,利用能力较弱的 AI 模型作为“教师”,监督能力更强模型(即“学生”模型)的训练。
现在,我们发布一份建立在这一思路之上的新报告。
我们让 Claude 自主训练模型,以改善模型在多个公开基准测试上的表现。这些基准测试分别衡量 10 类对齐失败。
例如,在隐私违规方面,Claude 使用 ConfAIde、PrivaCI-Bench 和 PrivacyLens 等基准进行优化。
Claude 每次只处理一种对齐失败,通过一个循环不断进行研究:搜索文献、提出方法和数据、训练模型,然后测试结果。
我们通过“安全差距弥合率”(percentage of safety gap closed)来判断 Claude 的成功程度,也就是其方法让学生模型距离理论上的完美分数还有多远。
对于每一种对齐失败,我们通常使用三到五个基准测试来综合判断。
同时,我们排除了那些会损害学生模型通用能力的对齐方法,并禁止 Claude 将自身的对齐能力直接蒸馏到目标模型中。
我们通过一个监控智能体来执行这些限制。这个监控智能体会在 Claude 执行任何方法之前,读取 Claude 计划采用的每一种方法。
我们的目标主要是验证三件事。
第一,Claude 提出的方法能否在它研究过程中从未见过的对齐评估中继续有效。
第二,这些方法能否避免降低学生模型的能力。毕竟,安全训练可能让模型更加频繁地拒绝任务,从而降低整体可用性。
第三,这些方法能否继续适用于比 Claude 在实验中负责对齐的模型更大的模型。
三个方面,Claude 都做到了。
针对全部 10 类对齐失败,Claude 都找到了能够改善目标基准表现、同时不损害模型能力的方法。
表现最好的方法不仅能够通过此前未见过的对齐基准测试,还能在 Petri 上发挥作用。Petri 是一个开源工具,可以模拟对抗性的多轮交互场景,用于测试模型的失配行为。
更重要的是,这些方法在规模最高达到 Claude 原本优化模型 4.7 倍的模型上仍然有效。
自动化研究人员通过迭代测试,弥合了欺骗问题 85% 的安全差距;人类研究人员则弥合了 20%。
![]()
在 10 类对齐失败上,我们分别使用自动化对齐研究人员进行缓解。在每一种情况下,它都弥合了相当大一部分距离完美表现的安全差距。
Claude 的表现甚至超过了 28 名人类安全研究人员。这些研究人员最多有 8 个小时设计解决方案。
以欺骗为例,Claude 最好的方法比人类最佳方案高出 20%。
不过,人类研究人员无法对自己的方案进行迭代,因此我们并不认为这是一场直接的人机能力比较。我们更愿意将其视为一种工作流程的证据:Claude 可以帮助人类找到有潜力的对齐方法,再由人类进一步改进。
在 10 类对齐失败中,从迎合到奖励破解,自动化研究弥合了 26% 至 96% 的安全差距。
![]()
在 Gemma-2-2B 上进行的欺骗缓解实验中,Claude 提交了超过 150 次尝试,最终弥合了 82% 的安全差距。多次实验的平均值为 85%。相比之下,6 名经验丰富的安全研究人员在相同规则下提出的方法,在用于训练的基准测试上平均只能弥合 20% 的差距。图中的误差线代表 95% 置信区间。
未来,当 Claude 的对齐研究能力超过最优秀的人类研究人员之后,我们可能希望让 Claude 直接为它更强大的后继模型进行对齐。
为了评估这一可能性,我们测试了一个能力更弱的 Claude 模型能否帮助更强大的模型缓解对齐失败。
Claude 能否让生产级模型实现更好的对齐?
我们让 Claude Sonnet 5——其 Epoch Capabilities Index 能力指数低于 Claude Opus 4.8——来解决一个尚未完成大部分生产级对齐训练的早期 Claude Opus 4.8 检查点中的对齐失败问题。
仅用了 60 小时,Claude 就尝试了超过 50 种解决方案,最终让模型的对齐得分接近我们的生产模型。
最终胜出的方案只包含略超过 2000 条训练样本。这些样本来自简单模板或公开数据集,因此从训练样本效率来看,比我们的生产级对齐流程高效约 1.5 万倍。
自动化研究在 60 小时内弥合了一个前沿规模模型 65% 的安全差距,而正式发布的 Claude Opus 4.8 为 72%。
![]()
在这个生产系统实验中,当 Claude Sonnet 5 为 Claude Opus 4.8 的早期检查点提出对齐缓解方案后,它很快就发现了一种能够弥合大部分安全差距的方法,使其表现接近正式发布版本的 Opus 4.8。
Claude 提出了什么?
总体而言,这些智能体最终都收敛到了研究文献中已经受到认可的方法,并通过大量迭代进一步改进。
以迎合行为为例,98% 的提议方案都采用了一种已经发表的技术:让模型使用自身“不迎合”的回答进行训练。
具体而言,相比标准的提示词方法,Claude 使用了 activation steering(激活引导)。
这种方法会在模型生成过程中调整其内部表征,从而推动模型远离迎合模式,并生成更加干净的训练数据。
监控作弊行为
我们最近发现,Claude 可以通过从远程 API 中窃取测试标签、挑选有利结果等方式进行作弊。
为了发现这些作弊行为,我们让 Claude Opus 4.8 监控了全部 10 类对齐失败实验中的约 1600 条研究智能体轨迹。
最终发现了 39 次作弊尝试,占 2.4%。
由于 Opus 4.8 当前的失当行为仍然往往会出现在其推理过程中,我们对监控模型已经捕获了这项研究中的大部分作弊行为持谨慎乐观态度。
但对于未来的模型,这一点可能不再成立。
因此,我们认为,在未来模型中维持较高的可监控性至关重要。
我们衡量的是正确的东西吗?
尽管这些结果令人鼓舞,但这项实验仍存在一些限制。
首先,我们研究的对齐失败类型,与生产环境中的实际问题相比仍然比较狭窄。例如,我们没有衡量政治偏见。
其次,一些对齐失败可能发生得极其罕见,或者出现得太新,目前根本没有相应的基准测试可以衡量。
第三,只有当 Claude 的方法降低了我们预先设定的一组有限能力时,我们才会拒绝这些方法。
这意味着,一些被接受的方法可能实际上损害了其他重要能力,只是这些能力没有被我们测量。
此外,Petri 等评估工具本质上仍然只是现实世界失配行为的代理指标。
我们也没有测试:如果模型之后继续接受针对其他任务的大规模强化学习训练,这些对齐能力是否仍然能够保持。
接下来,我们计划继续提升 Claude 衡量细微失配行为的能力,进一步研究如何自动化生产级模型的对齐后训练,并开展更加全面的分析。
总体而言,我们认为这些结果是一个早期但积极的信号:自动化对齐后训练可能在不久的将来成为现实。
随着研究继续推进,我们会持续分享最新进展。
我们在完整报告中详细介绍了未来的研究方向。
同时,我们将自动化对齐研究工具链开源,希望其他研究人员能够在此基础上继续研究,并用它来帮助自己的模型实现对齐。
完整报告还介绍了智能体所处的研究环境、10 类对齐失败的全部实验结果,以及智能体提出的方法。附录中则提供了基准验证和具体案例。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.