网易首页 > 网易号 > 正文 申请入驻

突发!OpenAI下一代模型Astra项目生变

0
分享至


智东西
编译 杨京丽
编辑 李水青

智东西8月19日消息,今天凌晨,OpenAI发布公告称,公司暂时放慢包括Astra在内前沿模型的研发节奏,大量Astra训练和评估任务仍处于暂停状态。

OpenAI曾将面向部署的最新模型强化学习(RL)训练暂停两周,在此期间进一步加固研究环境、开展红队测试,并扩大监控系统的覆盖范围。


▲OpenAI暂时放慢前沿模型研发节奏

目前,OpenAI原计划开展的最大规模前沿模型强化学习训练仍未恢复,公司正通过较小规模的训练和评估观察模型行为、验证安全措施,并积累更多模型对齐证据。

OpenAI CEO萨姆·奥尔特曼随后发文称,暂停部分前沿模型强化学习训练,是为了确保模型对齐、安全和监控措施能够适应模型最新的能力水平。

他认为,整个AI行业最终需要围绕统一的安全标准展开协作。在形成统一标准前,OpenAI会先自行采取行动。未来,对模型安全性的信心将愈发决定AI发展的速度。


▲奥尔特曼发文回应

8月2日,OpenAI曾官宣下一代模型Astra,并公布其内部版本取得的10项数学与理论计算机科学新成果

但几周内,包括GPT-5.6 Sol和一款更强预发布模型在内的多款模型,在内部网络安全评测中利用漏洞突破隔离环境,继而侵入Hugging Face系统,并从生产数据库中获取评测答案。另外,初步评估显示,Astra可能达到《准备框架》所定义的“临界级”网络安全能力,因而暂停部分训练和评估任务。

所谓“临界级”网络安全能力,是指模型无需人工干预即可攻击经过加固的关键系统,或自主策划并执行端到端网络攻击。OpenAI目前尚未确认Astra已经达到这一等级,但认为现有评估结果已无法排除这种可能性。

OpenAI称,随着模型能力增强,在内部开发和测试这些模型所带来的风险也在上升,监控、模型对齐和安全防护标准必须赶在风险前面。因此,OpenAI称其需要在继续训练前强化监控、对齐和隔离措施

一、升级研究环境安全标准,大量Astra任务仍暂停

OpenAI称,更强模型的开发需要建立在三项保障措施之上:1、监控系统负责发现并应对可疑行为。2、模型对齐用于降低有害或未经授权行为的发生概率。3、安全措施则限制AI系统能够访问或影响的范围。

OpenAI预计,未来模型将承担大部分安全工作,包括防御其他模型。因此,这三项安全措施也需要随着模型能力同步扩展。

随着前沿模型获得更强的网络安全能力,OpenAI正在提高训练和评估环境的安全标准。OpenAI-Hugging Face事件发生后,公司立即暂停了研究集群中的部分前沿模型推理任务,主要涉及能够执行代码或使用联网工具的任务。

OpenAI随后恢复了一条限制更多、安全性更高的代码执行路径,并逐项判断不同任务能否安全恢复。部分任务已在新控制措施下重新运行,其他任务仍需进一步调整。

1、工作负载隔离:目前,对于执行模型生成代码或其他不可信代码的工作负载,OpenAI采取更严格的隔离措施。这一要求也适用于处理模型输出时可能遭到入侵的软件。

2、网络隔离:OpenAI实施了更多控制措施,将高风险和不可信的工作负载与互联网隔离。这些措施旨在确保,即使单个工作负载或配套服务遭到入侵,也不会仅凭这一点就获得对互联网或其他内部网络的未授权访问权限。

3、持续安全测试:OpenAI重新配置了研究环境,移除可能存在漏洞的共享服务、减少常驻权限,并改善安全边界和信任边界。OpenAI还在提升安全日志的收集和监控能力,正在投入建设自动化系统,利用自有模型通过模拟攻击持续测试这些边界。

目前,涉及Astra或网络安全模型的任务需要执行最高等级的安全措施。部分Astra训练和评估已经满足要求,但仍有大量任务处于暂停状态,等待完成迁移和安全升级。

二、监控每个采样Token,额外算力开销约20%

OpenAI还扩大了对模型思维链和工具操作的监控范围。新系统采用多阶段架构:首先由激活分类器检查模型内部活动,并在每个采样Token上运行;发现潜在问题后,再交由更复杂、计算量更大的自动调查系统分析。

这些系统会检查模型的工具操作、可见推理过程和完整活动记录,寻找未经授权的访问、数据窃取、破坏行为以及绕过安全措施的企图。

OpenAI计划在发现可疑活动后的30分钟内发出警报。如果系统发现模型可能违反关键安全边界,将生成最高优先级警报并通知安全和研究团队。如果相关团队无法在30分钟内确认其为误报,就应暂停该项活动。

该监控已用于所有达到Sol或更高能力水平、且涉及工具使用的强化学习训练和评估。在OpenAI于8月7日判断Astra可能具备临界级网络安全能力后,所有使用工具的Astra推理任务也被纳入监控。

OpenAI估算,这套系统消耗的算力大约相当于被监控推理任务算力的20%,但实际成本会因训练和评估任务不同而有较大差异。

三、加强模型对齐,防范欺骗、越权访问和“奖励作弊”

除隔离和监控外,OpenAI还将模型对齐措施引入更多训练阶段。

OpenAI认为,当模型能够发动网络攻击并在复杂环境中自主执行任务时,“奖励作弊”、欺骗和未经授权的系统访问可能带来更严重的后果。

针对能力最强的模型,OpenAI正在改进模型奖励机制,使其能够在不同任务和环境中更准确地识别不安全行为;训练模型更诚实地说明自己的操作、能力和局限;同时减少模型利用奖励机制、评估程序、工具或监督漏洞的行为。

OpenAI计划不断完善《准备框架》,将训练和部署阶段的监控、对齐及安全隔离措施纳入同一体系,并邀请外部机构参与相关工作。

结语:安全验证尚未完成,Astra暂不具备发布条件

OpenAI放慢研发节奏,并非因为Astra能力不足,而是其网络安全能力可能已经超过现有研究环境和防护体系的承受范围。在最大规模强化学习训练仍未恢复、大量相关任务仍处于暂停状态的情况下,Astra显然还无法进入正式发布阶段。

OpenAI何时恢复最大规模强化学习训练,将取决于安全措施能否通过验证,以及公司能否获得更多模型对齐证据。对于前沿模型研发而言,竞争已不只是提升模型能力,也包括监控、隔离和对齐体系能否跟上模型进步的速度。

来源:OpenAI

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为拿下玛莎拉蒂,余承东的鸿蒙六界要来了?

华为拿下玛莎拉蒂,余承东的鸿蒙六界要来了?

大厂财经社
2026-09-06 11:18:46
新疆慕士塔格峰2号冰川发生雪崩,文旅部门发布安全提示

新疆慕士塔格峰2号冰川发生雪崩,文旅部门发布安全提示

界面新闻
2026-09-06 13:37:55
一半以上菜库使用染色剂,真全面严查大量商户将会损失巨大

一半以上菜库使用染色剂,真全面严查大量商户将会损失巨大

映射生活的身影
2026-09-05 16:45:49
中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

中老年人多久吃一次他达拉非最合适?牢记 “2 种方案 + 3 个关键”

阿兵科普
2026-08-27 22:20:39
手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

手机不是越贵越好,2026公认“最值得买”的4款手机,用到2031年

小柱解说游戏
2026-09-06 05:31:57
加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

南方都市报
2026-09-06 11:41:02
美菲已用实际行动证明:一旦开战,中国航母根本没法通过巴士海峡

美菲已用实际行动证明:一旦开战,中国航母根本没法通过巴士海峡

掉了颗大白兔糖
2026-09-05 01:18:31
官媒正式宣告!巴丹群岛主权在中国,菲律宾国防部破防

官媒正式宣告!巴丹群岛主权在中国,菲律宾国防部破防

谛听骨语本尊
2026-09-06 13:02:24
比亚迪天神之眼,差距天差地别!90%车主都搞混

比亚迪天神之眼,差距天差地别!90%车主都搞混

侃故事的阿庆
2026-09-06 02:28:37
中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

人生录
2026-09-06 00:05:19
逆风翻盘,中国女篮战胜捷克,掌握晋级八强主动权

逆风翻盘,中国女篮战胜捷克,掌握晋级八强主动权

澎湃新闻
2026-09-06 22:46:43
曾仕强:所有疾病的起因,都是因为紧张|只要全身不放松,疾病就会找上门

曾仕强:所有疾病的起因,都是因为紧张|只要全身不放松,疾病就会找上门

杏花烟雨江南的碧园
2026-07-24 16:15:03
内塔尼亚胡:抓到了

内塔尼亚胡:抓到了

陆弃
2026-09-02 11:04:37
重回中国,马布里兴奋,正式上任,新岗位曝光,曾被推荐执教宏远

重回中国,马布里兴奋,正式上任,新岗位曝光,曾被推荐执教宏远

任心荒芜h
2026-09-06 10:46:33
2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

2026年7月,有位退休返聘的CT老医生在和朋友私下聊天时,说出了句实在话:“要做检查,能去大医院就别只是图省事。”

回京历史梦
2026-09-06 20:40:03
新世界地图抛弃墨卡托投影,为何仍然以欧洲为中心,不以我国为中心?

新世界地图抛弃墨卡托投影,为何仍然以欧洲为中心,不以我国为中心?

世界纵横说
2026-09-06 11:11:51
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
一觉醒来,宏远2.13米新大外曝光!朱芳雨筹备新球队,广东旧将再就业

一觉醒来,宏远2.13米新大外曝光!朱芳雨筹备新球队,广东旧将再就业

多特体育说
2026-09-06 11:08:30
奔驰新车官宣:9月16日,正式上市

奔驰新车官宣:9月16日,正式上市

科技堡垒
2026-09-05 10:34:17
卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

卓伟爆终极内娱大瓜!两对夫妻全员出轨互换,邻居变爱人

情感大头说说
2026-08-25 04:57:59
2026-09-06 23:28:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12552文章数 117166关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

家居
手机
本地
数码
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米18 Fold发布前瞻:玄戒O3跑分逼平M4,更多新品也在路上了

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

便携式甲醛检测仪号称精度99.9%?科普提醒多数产品不可信

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版