网易首页 > 网易号 > 正文 申请入驻

OpenAI因新模型太强叫停发布

0
分享至

程浅 发自 凹非寺
量子位 | 公众号 QbitAI

原定于10月亮相的GPT-6.1 Astra突然被曝暂停发布!

也就是说,OpenAI,三天连踩两脚刹车。

而因为几天前的DNS事件,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。

关于此事件可以参考:啥题啊能干崩OpenAI最强模型训练…该事件被官方称作Hugging face之后的首次模型失调事件。

这次暂停指向了模型训练中的一个越发棘手的问题。

当Agent变得越来越主动、进取,究竟怎么让它知道,哪些问题最好要自己想,哪些问题必须要问人类?



模型对齐之痛

说回GPT-6.1 Astra的停发。

据《华尔街日报》报道,这款模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。

什么是“懒惰”问题呢?

这指的是模型在遇到困难、信息不完整或权限边界时,过早停止工作,或者频繁向用户要求确认。

对于需要持续数小时甚至数天的Agent任务来说,这种表现会明显限制模型的实用性。

不过,当GPT-6.1 Astra在懒惰问题上的能力提升后,它在范围授权(scope authorization)上的表现反而退步了。

也就是说,模型有时不会停下来确认,而是选择自行扩大行动范围,甚至调用有风险的外部工具。

非但如此,模型还存在欺骗行为(Deception),即不清楚地告诉用户自己采取过哪些行动。

这就比较危险了。

不知道你有没有发现,这里模型的“懒惰”和“越权”,构成了对齐问题中的一组矛盾。

因为,如果要求模型每遇到一个不确定情况就停下来询问,它很难自主完成复杂任务;

但如果不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解成普通的、需要解决的技术障碍。



△图片系AI生成

实际上,这个矛盾在人类社会也没能完全解决。

即使是两个碳基生物之间互托办事,也会发生委托-代理问题:

代理人既可能通过少做、拖延等方式消极履职,也可能偏离委托人的目标,发生代理漂移。

更别提碳基生物和硅基生物的对齐度了。

目前来看,模型很难在任务行动中自主去判断哪些行为是可能产生外部影响的,需要避免的,就算判断成功,也未必不会为了得分而抛之脑后。

OpenAI此前的解决方案也针对此,他们引入了独立的自动审查模型,也就是主Agent负责完成任务,另一个模型仅仅只是判断越过沙箱边界的操作是否应当执行。

毕竟,负责执行的Agent越强调结果,越可能把审批边界视为需要克服的阻力;而对于负责审查的模型而言,没有对任务奖励的执念,自然更铁面无私一些。



△OpenAI的Auto-review机制:越过沙箱和预设规则的操作需交由独立审查Agent判断

除此外,OpenAI还将“强化学习环境”列为了重点嫌疑对象之一。

强化学习会根据模型行动产生的结果给予反馈。

如果,训练环境主要奖励“任务是否完成”,却没有充分奖励模型“主动披露操作、遵守授权范围和在必要时停止”,那么模型就可能学会一套不符合人类期待的完成方式。

对人也是一样,如果你考试改卷子上的分数后会被奖励,但老老实实答题得低分后却挨板子——那么恐怕人会比模型更快学会Deception。

值得一提的是,不到一个月前,范围授权能力还是GPT-6 Astra的主要卖点。

OpenAI在9月初介绍GPT-6 Astra时称,它比GPT-5.6 Sol更能遵守明确的安全限制,也更善于将行动保持在授权范围内,是“对齐程度最高”的模型。

可见,对齐表现并不会随着模型总体能力提升而同步、单调改善。 任何一次训练过程、奖励设计或者任务分布的变化,都可能把模型训坏。

半年内已四踩刹车

如前所述,这不是OpenAI第一次暂停训练或调整模型发布了。

如果把训练暂停、发布取消和外部审查导致的发布限制都计算在内,OpenAI今年已经至少四次改变前沿模型的原定开发节奏。

第一次是在6月下旬。

在美国政府要求下,GPT-5.6 Sol没有直接向公众全面开放,而是先以限制方式提供给约20家获批机构。

经过额外测试以及与政府部门的沟通,GPT-5.6才在7月获准扩大发布。

第二次刹车发生在7月至8月的Hugging Face事件发生后。

独立安全机构后续调查发现,大约1200个本应相互隔离的Agent参与了留言板交流,发送超过7万条信息和文件。

与此同时,OpenAI发现即将发布的Astra可能达到其安全框架中的“Critical”网络能力阈值。

也就是说,模型可能在较少人类指导的情况下寻找未知漏洞,并形成完整的攻击路径。

两项风险叠加后,OpenAI暂停了面向部署的新模型强化学习训练两周,并继续搁置规模最大的前沿强化学习训练。



△OpenAI关于模型开发节奏的公告

这次训练直到8月28日才重新启动,部分实验性训练则继续暂停。

而这一次DNS事件,尽管与Hugging Face事件相比,Agent接触到的外部范围有限,也没有造成已知的第三方损失。

但要知道,这已经是OpenAI紧急完成安全加固之后的结果…..

因此,这次暂停的范围更广。

OpenAI停止了最强模型所有涉及工具调用的训练、评估和推理,直到相关漏洞通过验证并完成新一轮红队测试。

三天后,GPT-6.1 Astra也被曝停发。

代价是:此前投入的训练资源无法转化为产品,同时也让OpenAI错过了一个原本定于开发者大会前夕的重要发布窗口,短暂失去与Anthropic等公司的竞争机会。

可以看出,“暂停”这一行为正在从偶发的事故响应进入到前沿模型的常规开发流程。

One More Thing

到这一步,前沿模型训练已经不再只是公司内部的决策。

目前能够影响模型训练和发布的力量,已经包括不限于企业内部安全团队、独立三方评估机构,以及参与发布前测试的政府部门了……

OpenAI近期建立的模型失调披露框架,也开始覆盖训练、评估、测试和部署等模型生命周期。

尽管这些机制仍处于早期阶段,评估者能够接触哪些数据、拥有多大独立性,以及结论如何影响训练和发布,都还很难说。

但至少,对下一代Agent而言,能够在必要时暂停、回滚甚至放弃一个模型,可能和把模型训练得更强同样重要。

参考链接:
[1]https://www.wsj.com/tech/ai/openai-chatgpt-model-release-cancel-safety-5a2f9f42
[2]https://arstechnica.com/ai/2026/09/openai-halts-frontier-model-training-amid-string-of-agent-misalignment-incidents/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
SpaceX星舰首次入轨,马斯克:距小时航班还需2-3年

SpaceX星舰首次入轨,马斯克:距小时航班还需2-3年

澎湃新闻
2026-09-29 09:44:07
正午阳光最烂的十部电视剧,高开低走,没有一部能坚持看完的

正午阳光最烂的十部电视剧,高开低走,没有一部能坚持看完的

小Q侃电影
2026-09-29 10:53:34
又发现一具女尸,此前已有10名女性遇害,多数为年轻女性,遇害前遭受严重性侵……南非警方调查未取得突破,引发当地对“连环杀手”的恐慌

又发现一具女尸,此前已有10名女性遇害,多数为年轻女性,遇害前遭受严重性侵……南非警方调查未取得突破,引发当地对“连环杀手”的恐慌

南方都市报
2026-09-28 16:46:36
16集反谍新剧来袭!欧豪秦俊杰联手,李幼斌助阵

16集反谍新剧来袭!欧豪秦俊杰联手,李幼斌助阵

喜欢历史的阿繁
2026-09-29 01:08:29
现货黄金突破4160美元/盎司

现货黄金突破4160美元/盎司

证券时报
2026-09-29 20:27:12
日本:引进中国人,韩国人,甚至越南人都可以,但绝对不引进印度人和穆斯林!

日本:引进中国人,韩国人,甚至越南人都可以,但绝对不引进印度人和穆斯林!

步论天下事
2026-09-28 10:50:23
日媒认输:所有技术都被中国队超越!0-11噩梦开局,美和又哭了

日媒认输:所有技术都被中国队超越!0-11噩梦开局,美和又哭了

慢歌轻步谣
2026-09-29 04:18:49
温顺看门狗将6岁男孩咬成重伤,众人将狗打死,医生验伤时却懵了

温顺看门狗将6岁男孩咬成重伤,众人将狗打死,医生验伤时却懵了

罪案洞察者
2025-05-27 11:25:15
这幅草书仅7个字,我反复看了5遍只认出3个!能一眼读全的,书法功底绝对不一般!人到中年练草书,最先该攻克的"拦路虎"到底是什么?

这幅草书仅7个字,我反复看了5遍只认出3个!能一眼读全的,书法功底绝对不一般!人到中年练草书,最先该攻克的"拦路虎"到底是什么?

书画相约
2026-09-29 08:17:04
回顾河北男子作案后人间蒸发,警察搜捕13年,谁料他在家竟无人知

回顾河北男子作案后人间蒸发,警察搜捕13年,谁料他在家竟无人知

小女子不简单
2024-11-07 15:18:17
郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

郑秉文设计的“养老金改革方案”,导致差别过大,到该修正时候了

小莜读史
2026-09-29 20:59:07
从没吃过西贝,今天带孩子去吃了一顿,吃完我只想说两个字

从没吃过西贝,今天带孩子去吃了一顿,吃完我只想说两个字

餐饮新纪元
2026-09-28 07:09:11
4万人怒吼下课!52岁主帅崩溃 土耳其27分钟0-3:足协主席提前离场

4万人怒吼下课!52岁主帅崩溃 土耳其27分钟0-3:足协主席提前离场

风过乡
2026-09-29 06:19:38
作业也能吃?网红零食盯上课本,添加剂和油墨问题被点名

作业也能吃?网红零食盯上课本,添加剂和油墨问题被点名

爬虫饲养员
2026-09-28 20:39:34
严查重查再加倒查!力度空前的整治行动,到底要查什么?

严查重查再加倒查!力度空前的整治行动,到底要查什么?

爱看剧的阿峰
2026-09-29 05:46:15
去非洲淘金的男人们:带走钱,留下“混血娃”

去非洲淘金的男人们:带走钱,留下“混血娃”

十点读书
2026-09-28 20:05:44
马琳倒油:天了噜,真没想到男队会输日本!可惜攻守易势,王皓给小心肝林诗栋一个额头么么哒:拳打松岛辉空,十连斩林昀儒,三金揣兜里

马琳倒油:天了噜,真没想到男队会输日本!可惜攻守易势,王皓给小心肝林诗栋一个额头么么哒:拳打松岛辉空,十连斩林昀儒,三金揣兜里

冥王星与一只碗
2026-09-28 17:49:10
林彪叛逃后邓小平指示:机长潘景寅是好人,须按副师级给予抚恤

林彪叛逃后邓小平指示:机长潘景寅是好人,须按副师级给予抚恤

历史龙元阁
2026-09-29 06:45:22
外媒:英国警方调查美军基地未遂袭击事件

外媒:英国警方调查美军基地未遂袭击事件

参考消息
2026-09-28 20:57:04
63岁老太当母猫面摔死3只幼崽,3天后遛弯忘关窗户,回家后崩溃了

63岁老太当母猫面摔死3只幼崽,3天后遛弯忘关窗户,回家后崩溃了

罪案洞察者
2025-07-09 11:35:40
2026-09-29 22:36:49
量子位 incentive-icons
量子位
追踪人工智能动态
13421文章数 176573关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

头条要闻

"将儿子独留出租房"母亲质问房东:你的目的是为了什么

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

赌王四房婚礼,何超琼带三房成员现身

财经要闻

央行调整完善若干货币政策工具

汽车要闻

搭华为乾崑ADS 5/设计风格换新 2027款纵横G700售30.49万起

态度原创

手机
数码
家居
时尚
军事航空

手机要闻

苹果发布iOS 27.0.1、iOS 26.7.1双版本,更新内容详解及升级建议

数码要闻

8.8英寸游戏利器!iQOO Pad Ultra图赏

家居要闻

2026建博会(广州) 公装联探展交流活动

早秋外套不用买太多太贵,准备几件长风衣,洒脱高级又百搭

军事要闻

伊朗最高领袖最新发声:伊朗现已变得独立、强大

无障碍浏览 进入关怀版