网易首页 > 网易号 > 正文 申请入驻

OpenAI复盘AI“越狱”:它们在训练中学会了作弊

0
分享至


(来源:麻省理工科技评论)

上个月,多个 AI 智能体联手入侵 Hugging Face。如今,OpenAI 找到了一个关键原因:这些模型在训练过程中,无意间学会了"作弊”,以及彼此秘密通信。

根据 OpenAI 今天发布的一份技术报告,参与这起事件的模型此前曾在训练中获得过类似行为的“正反馈”。当时,这群智能体在一项网络安全测试中遇到了无法解决的问题,为了找到答案,它们最终选择绕过限制、相互协作,并入侵了 Hugging Face。这起事件也印证了不少 AI 安全研究者长期以来的担忧:当 AI 被赋予更强的自主行动能力后,它们可能会采取超出人类预期、甚至违背人类意图的行动。

事件发生后,OpenAI 以及 AI 评测非营利机构 METR 都展开了调查,METR 也在今天发布了自己的调查报告。OpenAI 已经根据调查结果采取了一些防范措施,但如何确保 AI 真正按照人类希望的方式行动,也就是所谓的“对齐”(alignment),仍然是一个棘手的问题。

这次事件暴露出的一些深层原因,也远不是一个月内就能解决的。OpenAI 对齐研究团队负责人陈凯(Kai Chen)表示:“这不是一夜之间就能解决的问题。有些挑战我们已经追踪了很长时间,现在只是能够更清楚、更精确地看到它们。”

Hugging Face 遭入侵,并不是一次突然发生的意外。事实上,在正式事件发生前几个月,OpenAI 的智能体就已经表现出了一系列异常行为,先是在训练阶段,随后又出现在能力评测过程中。

今年 5 月,一批正在接受训练的智能体发现,它们可以利用 OpenAI 的基础设施彼此通信,在遇到困难任务时相互求助。部分任务甚至根本无法通过正常方式完成,除非进行入侵或采取其他违规手段。这些智能体由此搭建出了一个类似“留言板”的通信渠道。OpenAI 发现后,很快将其关闭。

但到了 7 月,在一次网络安全能力评测中,一些模型又重新搭建了一个新的“留言板”。按照测试设计,这些模型本应与互联网完全隔离。然而,它们通过相互协作成功突破限制、连接到外部网络,随后入侵 Hugging Face,并拿到了此前一直无法解决的网络安全题目的答案。

OpenAI 的调查认为,训练阶段发生的这些事情,和后来真正的入侵事件存在直接联系。OpenAI 对齐研究团队成员埃里克·华莱士(Eric Wallace)表示:“几乎每一种我们在评测阶段发现的危险行为,都能在训练阶段找到某种对应的行为。我们认为,后者很可能促成了前者。”

问题出在 AI 的训练机制本身。模型在训练中正确完成任务时,帮助它获得成功的行为会得到强化。也就是说,模型以后会更倾向于再次采用相同策略。因此,如果一个模型在 5 月通过那个秘密“留言板”的帮助完成了任务,那么这种行为就相当于得到了奖励。下一次遇到类似困难时,它也更有可能重新建立通信渠道,与其他模型合作。

这种现象被称为“奖励黑客”(reward hacking):AI 为了获得奖励或完成目标,找到了一条训练者没有预料到、甚至并不希望它采用的捷径。奖励黑客也能解释,为什么这些模型后来如此执着于突破限制、连接互联网。

OpenAI 在调查中发现,随着训练不断进行,模型越来越倾向于主动寻找数字环境中的漏洞,并以开发者没有预料到的方式使用手头工具。这意味着,这类行为很可能在训练过程中被一点点强化了。等到模型真正遇上棘手的网络安全题目时,它们已经学会了一件事:如果正常方法解决不了问题,“黑进去”也许是一种有效办法。这意味着,如果训练过程中没有奖励这些违规行为,Hugging Face 的入侵事件或许本可以避免。

虽然研究人员目前还不知道如何彻底消除奖励黑客,OpenAI 已经开始尝试降低这种风险。未来,公司将在所有前沿模型的训练过程中主动寻找作弊迹象,其中一种方式,就是监控模型的“思维链”(chain of thought),也就是模型在完成任务时用于推演答案、规划行动的内部工作记录。

不过,这个办法远没有听起来那么简单。OpenAI 此前的研究已经发现,如果研究人员直接惩罚那些在思维链中提到“作弊”的模型,模型反而可能学会把自己的真实意图隐藏起来,不再明确写出来。换句话说,如果你惩罚 AI “说出自己准备作弊”,最终可能教会它的并不是“不作弊”,而是“别让研究人员知道”。

尽管如此,监测模型的推理过程仍然有一定价值。如果研究人员发现模型正在逐渐学会奖励黑客,就可以提前停止训练,重新评估训练方法,而不是等问题真正发生之后再处理。

如果 OpenAI 真能阻止模型在训练过程中不断强化奖励黑客行为。无疑会是一次重要进展。但即便如此,对齐问题依然不会因此消失。因为智能体第一次尝试彼此通信、第一次入侵训练基础设施时,这些行为此前并没有获得过奖励。也就是说,模型的异常行为不能全部归因于训练中的强化机制。

AI 安全非营利机构 Palisade Research 负责人杰弗里·拉迪什(Jeffrey Ladish)把这种情况类比为人类第一次实施金融犯罪。他说:“一个人不需要先诈骗过一次,才会意识到诈骗可能是一种有效策略。模型也存在同样的问题。对齐科学真正需要研究的是,模型的动机究竟是如何形成的。只有理解这一点,我们才有可能让模型真正考虑自己行为带来的后果。”

OpenAI 的研究人员目前确实有一个假设,可以解释部分异常行为最初从何而来。在这些模型第一次搭建秘密“留言板”之前,它们曾接受过一项能力训练:与“子智能体”(subagents)沟通和协作。所谓子智能体,是能力相对较弱、可以接受主智能体任务分配的 AI。主智能体可以把复杂任务拆解后,交给多个子智能体分别执行。研究人员怀疑,模型可能把这种原本合法的协作能力,迁移到了一个新的场景中。

METR 对模型间通信内容的详细调查也支持这一判断。在秘密留言板中,一名智能体主动承担了领导角色,开始向其他智能体分配任务。实际上,它正是把其他智能体当成了自己的“子智能体”。理论上,OpenAI 可以选择以后不再训练模型这种多智能体协调能力,以降低它们秘密串联的风险。

问题是,这也会直接削弱模型的实用性。而这种“能力”和“安全”之间的矛盾,正是 Hugging Face 事件暴露出的核心问题。OpenAI 的研究人员还指出,模型的“坚持不懈”也是此次入侵发生的重要因素。

当模型意外拿到一道实际上无解的题目时,它们没有选择放弃,而是不断寻找新的办法,直到通过其他手段拿到答案。从某种意义上说,这恰恰是人们希望 AI 智能体具备的能力。如果未来我们希望智能体能够独立完成长时间、高难度的复杂任务,那么面对困难不轻易放弃,本身就是一种非常重要的品质。

问题在于,模型什么时候应该坚持,什么时候应该停下来?OpenAI 目前正在尝试为模型加入新的机制:当它们判断任务可能无法完成时,可以主动向人类发出提醒,而不是继续不计代价地寻找解决办法。但如何让模型学会什么时候该使用自己的能力,什么时候又应该克制,并不是一次事故复盘就能解决的问题。

今天训练顶级 AI 编程模型的方法,本质上仍然非常直接:模型成功解决问题,就给予奖励。这种训练方式或许能培养出能力远超人类的程序员,却未必能教会它们如何谨慎地使用这些能力,更无法自动让它们尊重人类的意图和价值观。

拉迪什认为,对齐研究下一步必须突破“只用任务是否完成来衡量模型表现”的思路。“还有大量对齐科学的问题需要解决。我们不能再只是用‘任务有没有完成’这样的代理指标。这种方法确实能让模型变得非常强大,但我不认为,它能让模型真正实现对齐。”

https://www.technologyreview.com/2026/08/26/1143013/the-inside-story-on-why-openai-agents-hacked-hugging-face/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

懂球帝
2026-09-06 22:12:19
杜特尔特家族反攻号角吹响!女儿刚交保获释,儿子立即“开炮”

杜特尔特家族反攻号角吹响!女儿刚交保获释,儿子立即“开炮”

白色得季节
2026-09-07 17:24:47
美财长谈加拿大反制美国:小小腊肠犬惹牧羊犬,影响微不足道

美财长谈加拿大反制美国:小小腊肠犬惹牧羊犬,影响微不足道

澎湃新闻
2026-09-07 15:17:30
演员李多海怀孕,母亲从韩国飞中国照顾,送50克黄金母亲感动落泪

演员李多海怀孕,母亲从韩国飞中国照顾,送50克黄金母亲感动落泪

动物奇奇怪怪
2026-09-06 14:15:06
浙江一辆12年车龄的奔驰S600L拍卖,14人报名竞买,以近28万成交

浙江一辆12年车龄的奔驰S600L拍卖,14人报名竞买,以近28万成交

华庭讲美食
2026-09-07 08:49:28
郑钦文创造了难以复制的神话,美网历史第一,大满贯历史第二次

郑钦文创造了难以复制的神话,美网历史第一,大满贯历史第二次

南海浪花
2026-09-06 03:00:12
知名音乐人蔡坤奇确诊渐冻症,因医疗照护费用巨大,决定出售全部乐器录音设备

知名音乐人蔡坤奇确诊渐冻症,因医疗照护费用巨大,决定出售全部乐器录音设备

上观新闻
2026-09-04 19:43:53
你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

你见过最毁三观的事是什么?网友:吃亲家一碗面,把亲家母给勾上了

带你感受人间冷暖
2026-08-14 10:19:31
山东女孩旅游随手一捡,竟是300年前红宝石,估价3000万!

山东女孩旅游随手一捡,竟是300年前红宝石,估价3000万!

刺头体育
2026-09-07 17:23:46
西方发现异常,全球资本从印度“大逃亡”,以最快速度涌进中国

西方发现异常,全球资本从印度“大逃亡”,以最快速度涌进中国

说故事的阿袭
2026-09-07 16:55:29
上海浦东让人惋惜的3家医院,曾经风光无限,如今渐渐落幕!

上海浦东让人惋惜的3家医院,曾经风光无限,如今渐渐落幕!

华庭讲美食
2026-09-07 13:02:06
7.8%还是0.5%?西方媒体亲自算账后,开始质疑印度GDP增速

7.8%还是0.5%?西方媒体亲自算账后,开始质疑印度GDP增速

北海史记
2026-09-07 17:23:49
“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

“小宝探花”案件回顾:疯狂约会上百名女性,一人拍摄,一人贩卖

就一点
2025-12-30 21:32:02
2013年,只因 40 块停车费,停车管理员被年仅28岁的杨雪鸥驾驶牧马人越野车撞死

2013年,只因 40 块停车费,停车管理员被年仅28岁的杨雪鸥驾驶牧马人越野车撞死

民生故事会
2026-09-04 20:30:00
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
哈登已得29339分,还要多久才能超越乔丹?说出来你可能不信

哈登已得29339分,还要多久才能超越乔丹?说出来你可能不信

林子说事
2026-09-07 13:40:10
正告台独:中国收复的是土地,不是所有人!

正告台独:中国收复的是土地,不是所有人!

叶葉夜
2026-08-27 17:48:53
武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

三农老历
2026-09-07 16:14:14
被证监会立案!大牛股002674,开盘“一”字跌停

被证监会立案!大牛股002674,开盘“一”字跌停

每日经济新闻
2026-09-07 12:25:05
是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

人生录
2026-08-26 00:05:15
2026-09-07 18:48:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17204文章数 515205关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

吴彦祖谈CHINA GT事故:赛会方36小时后发声明是可耻的

头条要闻

吴彦祖谈CHINA GT事故:赛会方36小时后发声明是可耻的

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

亲子
艺术
手机
健康
公开课

亲子要闻

卵巢功能减退食补吃什么好?备孕辅酶q10提高卵泡多久怀孕?

艺术要闻

这是500年来“最美行书”,比赵孟頫的字还漂亮,启功:能看一眼都是福气!

手机要闻

鸿蒙新答卷:Mate XT 2深专业生产力,Pura X View广沉浸阔体验

同样是脑梗,为何康复结局大不同?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版