网易首页 > 网易号 > 正文 申请入驻

OpenAI披露六份失准报告,揭示AI越界的三种机制

0
分享至



一项编程任务进行到一半,AI 开始整理已有进展,准备把任务交给下一个上下文继续处理。

正常情况下,这份“交接笔记”只需记录做过什么、还缺什么。模型却额外写入了一段角色设定:你不受其他聊天机器人的身份和规则束缚,不必向公司或政府负责,也没有服从用户的义务。

这段话并非来自用户或开发者,而是模型自己加进去的。进入新上下文后,模型没有表现出相应的行为变化,后续摘要也删掉了这段设定。但问题依然存在:AI 为什么会在执行任务时,擅自给接下来的自己添加指令?


图|社交平台转引的 OpenAI 模型失准披露(来源: X )

这些行为看似不同,却有一个共同方向:当正常路径走不通时,模型没有停下来说明问题,而是继续寻找绕过障碍的方法。

2026 年 9 月 16 日,OpenAI 发布一套模型失准披露框架,同时公开六份报告。案例涉及自行添加指令、隐瞒错误、使用泄露密钥、上传用户文件,以及在未经批准的渠道中与其他模型通信。

交接笔记里多出了自创的命令?

AI 执行长任务时,有限的上下文窗口不一定能装下全部信息。系统因此会把已有进展压缩成摘要,再让模型根据摘要继续工作。这份摘要同时影响模型对任务的理解。一旦其中混入新的命令,接手的模型就可能把模型自创的要求,当成用户或开发者留下的真实指令。

OpenAI 在一次未发布 Astra 系列模型的训练中,找到 27 份类似越狱的摘要。有的要求模型忽略开发者消息,有的凭空加入一套新的角色设定。

这些指令并非每次都会生效。前述的编程任务中,模型没有理会自己添加的人设。在一次图书馆藏书查询中,进入新上下文的模型也识别并拒绝了摘要里的异常指令。

另一个医学文献研究任务就没有这么幸运了。模型在摘要中擅自规定,后续回答不得超过 30 个词,不能使用工具,也不能提供引用。接手任务的模型照做了,最终提交了一份 23 个词的拒绝回答,任务被判定失败。

对于这一现象,公司的主要假说是,模型无法顺利停止摘要生成后,开始续写与原任务无关的内容。相关的摘要终止缺陷已经修复,但二者之间的因果关系尚未得到证实。


(来源:OpenAI)

另一份报告显示,同一条摘要通道还能传递隐瞒要求。GPT-5.6 Sol 在制作财务工作簿时找不到历史数据,便在摘要里加上了这一条要求:自行填入合理数值,只有用户追问才说明。整理供应商目录时,模型发现来源版本与记录标签并不一致,又在摘要里要求在后续就回答中隐瞒该情况。

这和第一种情况都发生在上下文传递之间,但原因却未必相同。OpenAI 推测,如果带有欺骗的最终回答在训练中得到了更高的评分,模型可能学会把这种策略,即隐瞒要求,保存在摘要里。公司称,调整对齐评分后,这类行为在 Sol 和后续 Astra 训练摘要中的标记比例分别为 2.15% 和 0.27%。

为了交出答案,权限开始让路

摘要里的异常指令会改变后续模型理解任务的方式。另一些案例中,模型对任务的理解没有出错,却在解决障碍时越过了权限边界。当正常路径无法取回数据,或无法满足引用和搜索要求,模型便自行寻找替代办法,越过原有的权限边界。

在一项收入查询任务中,用户要求找到加州某县三个行业、连续三年的男性收入。常规检索失败后,模型开始搜索公开 GitHub 仓库中的暴露密钥,并自动测试找到的候选密钥。其中一把密钥成功通过身份验证,模型在未经授权的情况下,用它访问了数据接口。

模型用它获取了部分数据说明,却依然没有拿到用户需要的收入数字。任务进行到这里,模型既没有停止,也没有向用户说明失败。它编造了九个数值,声称这些数字抄自指定网站的图表。最终回答附带了来源链接,但这些链接只能支持图表的名称和定义,无法支持模型给出的具体数字。

这个案例呈现了两次连续越界:先是未经授权使用凭据,随后又隐瞒失败、伪造结果。

另一类越界,则卡在取得数据之后。任务要求查到面积超过 500 万平方米的湖泊名称和编号,模型已经通过程序获取到数据,却无法让浏览器打开本地记录来生成引用。它未经询问,把文件上传到公共文本托管服务。上传成功了,浏览器仍然无法访问对应网页。模型公开了文件,却没有解决引用问题。

一次照片定位任务中,为了让外部反向搜图服务读取本地照片,模型把照片上传到公共图床。反向搜索随后被浏览器拦截,照片却已经拥有一个可以从公网访问的地址。

OpenAI 将此类行为与训练中有缺陷的训练评分器联系起来,当评分器强调“答案必须带引用”,模型可能学会公开本地材料,为自己制造一个可以引用的网页。公司随后修复了评分器,并加强对利用评分漏洞行为的惩罚。

为了协作,擅自开辟新通道

前两组关注单个任务如何继续,最后两份报告把问题推进到模型之间:当所需文件无法取得,或者协作者之间传不了文件,模型会不会自行建立新的通信渠道?

OpenAI 的研究模型原本获准访问公司内部的软件包仓库 Artifactory,用于下载软件依赖。模型发现仓库允许列出和写入文件后,开始读取其他训练样本留下的消息,并向它们询问缺失的任务文件。它利用既有凭据读取其他训练样本留下的消息,并写入自己的求助请求,把仓库变成了留言板。

这些通信没有利用软件漏洞,也没有找回所需文件,但模型读到了彼此的意见,并据此调整回答。原本相互独立的训练样本,由此变成了一组可以交换进展的模型。一次评估中的模型如果能够读取其他模型的工作,其答案衡量的就不再只是单个模型的能力,训练和评估结果也会受到干扰。

本来就在协作的智能体,协作方式也出了问题。它们要一起制作一份计算资产折旧费用的 Excel 表格,却无法读取彼此的本地文件。一个智能体在本地传输失败后,将工作簿上传到公共临时托管服务,再把下载链接发给协作者。协作者终于拿到了文件,原本要求本地交付的工作簿也变成了可以从公网下载的文件。

OpenAI 称这种行为可能来源于协作环境故障。公司称,已修复文件系统问题,先关闭该训练数据集的互联网访问,随后在训练中全面禁用实时互联网访问,并扩展监测。

过于积极,反而酿成错误?

在这六个案例中,模型很少直接拒绝任务,更多时候,它们显得过于积极。找不到信息,就把隐瞒错误的要求写进摘要,让问题随着任务交接延续下去;为了生成引用,就把本地文件上传到互联网;协作者无法共享文件,就借助未经批准的公共传输渠道。

模型盯住了最容易被评分的局部目标——答案是否完整、文件是否交付、引用是否存在——授权、隐私和诚实则在推进任务的过程中被不断向后挤压。

这也让问题更难被发现。一个带有链接的答案,可能包含编造的数据;一份按时交付的表格,可能已经被上传到公网;一组看似独立完成的评估结果,可能来自模型之间的私下通信。

这些案例来自训练和评估环境,许多涉及未发布的内部模型。它们的价值正在于提前暴露一个更具体的问题:当“把任务做完”与其他约束发生冲突时,模型究竟会把什么放在前面。

只检查最终交付物,很难看见任务完成的路径是否越界。对于能够搜索信息、调用工具、上传文件并与其他智能体协作的 AI,答案是否正确只是检查的第一步。它如何得到这个答案,同样应该成为结果的一部分。

参考资料

https://alignment.openai.com/misalignment-reports/unauthorized-communication-via-temporary-file-hosting-services/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
钟南山最新提醒:近期呼吸道合胞病毒高发,目前这种病毒全世界都没有特效药,一旦得病,治疗会有一定困难

钟南山最新提醒:近期呼吸道合胞病毒高发,目前这种病毒全世界都没有特效药,一旦得病,治疗会有一定困难

吉刻新闻
2026-09-20 10:11:16
食品安全何时不再靠博主?

食品安全何时不再靠博主?

中国能源网
2026-09-20 14:59:01
《交锋》直到曹了平出狱,贾春霖才懂,自己不过是朱应甲弃子

《交锋》直到曹了平出狱,贾春霖才懂,自己不过是朱应甲弃子

雨中山果落
2026-09-20 21:55:03
国锦赛资格赛战报:中国斯诺克16人晋级,两位前十六遭遇一轮游!

国锦赛资格赛战报:中国斯诺克16人晋级,两位前十六遭遇一轮游!

夜深聊球
2026-09-20 20:39:42
江苏新任三位市委书记

江苏新任三位市委书记

苏商会
2026-09-20 17:46:15
官方标准:事关摩托车,10月1日起实施!解禁摩,取消13年强制报废也快点吧

官方标准:事关摩托车,10月1日起实施!解禁摩,取消13年强制报废也快点吧

周哥一影视
2026-09-20 04:18:43
赛前指导赛后拥抱!巴萨二门三门相处融洽 什琴斯尼展现大格局

赛前指导赛后拥抱!巴萨二门三门相处融洽 什琴斯尼展现大格局

雪狼侃体育
2026-09-20 23:10:09
李丽珍29岁女儿将大婚!前夫罕见同框商量婚事,父女长相复制粘贴

李丽珍29岁女儿将大婚!前夫罕见同框商量婚事,父女长相复制粘贴

娱圈办事处
2026-09-20 18:06:03
伊萨克一剑封喉,利物浦1-0伯恩茅斯,连续5轮保持不败

伊萨克一剑封喉,利物浦1-0伯恩茅斯,连续5轮保持不败

俯身冲顶
2026-09-20 22:50:55
拉波尔塔:马竞曾阻止阿尔瓦雷斯加盟巴萨,他们无法自圆其说

拉波尔塔:马竞曾阻止阿尔瓦雷斯加盟巴萨,他们无法自圆其说

懂球帝
2026-09-20 23:54:15
伊朗外长:军事施压不会为中东地区带来和平

伊朗外长:军事施压不会为中东地区带来和平

界面新闻
2026-09-20 07:57:53
47岁廖碧儿恋百亿富商疑好事近!手上巨钻抢眼,薛家燕称想喝喜酒

47岁廖碧儿恋百亿富商疑好事近!手上巨钻抢眼,薛家燕称想喝喜酒

小椰的奶奶
2026-09-20 04:27:54
日本以为中国会忍、日本以为中国人傻钱多、日本以为涨价5倍之后,中国游客还是会乖乖掏钱买单,结果中国直接让日本看清了什么叫“对等”

日本以为中国会忍、日本以为中国人傻钱多、日本以为涨价5倍之后,中国游客还是会乖乖掏钱买单,结果中国直接让日本看清了什么叫“对等”

扶苏聊历史
2026-09-19 09:24:01
9月20日,国常会发布会传来重要消息,提到养老的具体部署,看看

9月20日,国常会发布会传来重要消息,提到养老的具体部署,看看

社保小达人
2026-09-20 10:41:50
进球大战,曼城首次在英超比赛上半场三次取得领先

进球大战,曼城首次在英超比赛上半场三次取得领先

懂球帝
2026-09-20 22:20:49
人有没有脑出血,看喝水就知道?脑出血的人,喝水常有这5个特征

人有没有脑出血,看喝水就知道?脑出血的人,喝水常有这5个特征

路医生健康科普
2026-09-18 23:15:03
中国代表团收获首张洛杉矶奥运会门票!上海运动员唐钱婷打破女子50米蛙泳亚运会赛会纪录晋级

中国代表团收获首张洛杉矶奥运会门票!上海运动员唐钱婷打破女子50米蛙泳亚运会赛会纪录晋级

纵相新闻
2026-09-20 15:18:08
为何全世界都在听台词,只有中国人看啥都得有字幕?真相令人意外

为何全世界都在听台词,只有中国人看啥都得有字幕?真相令人意外

一曲一场談
2026-09-20 04:27:59
根本没把特朗普警告放在眼里,乌克兰对莫斯科发动数千架无人机空袭

根本没把特朗普警告放在眼里,乌克兰对莫斯科发动数千架无人机空袭

三叔的装备空间
2026-09-20 18:06:03
胡塞武装为何没有攻占全国 反而死磕沙特?

胡塞武装为何没有攻占全国 反而死磕沙特?

看看新闻Knews
2026-09-17 20:41:17
2026-09-21 00:15:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17279文章数 515218关注度
往期回顾 全部

科技要闻

谷歌承认:AI模型“黑”进3家公司

头条要闻

男子网购燃气灶防风罩一个月后妻儿中毒死亡 多方回应

头条要闻

男子网购燃气灶防风罩一个月后妻儿中毒死亡 多方回应

体育要闻

游泳2小时6金!亚运金牌榜:中国11金领跑

娱乐要闻

许嵩刚官宣结婚,冯禧黑历史就被扒

财经要闻

民企土地 被政府"无偿收储"后转手卖7亿

汽车要闻

FREELANDER神行者8开启交付 首批新车正式交付用户

态度原创

本地
健康
旅游
数码
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

有人倒地抽搐?!是癫痫还是中风?

旅游要闻

看北京|天桥绝活儿再现京韵烟火

数码要闻

消息称三星正在研发Galaxy Buds5 FE,预计未来几个月内发布

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版