网易首页 > 网易号 > 正文 申请入驻

OpenAI 首席科学家发文:AI 迭代太快,该放慢节奏了

0
分享至


近日,OpenAI首席科学家雅库布・帕乔茨基发表长文——《异星心智》(An Alien Mind)。

2023年年中,OpenAI的“RLSlow”研究项目取得初步成果。团队首次验证,推理模型的规模化训练具备可行性:预训练模型可以自主生成思维链。那天晚上,帕乔茨基与同事意识到,人类有生之年,或将亲眼见证机器智能超越人类。

三年后的今天,这一预判已然应验。推理语言模型已成为经济高速增长的重要组成部分。它能够操作电脑与图形界面,与人类协作、与其他AI协同工作,还可以独立完成科研项目,持续拓展科学的边界。

与此同时,AI正在重塑计算机安全格局,催生全新的安全风险。

AI能力从哪里来?

帕乔茨基给出了直白答案:AI的核心能力与算力密切相关。

2017年前后,OpenAI就明确了这一规律。多个研究项目证实,规模化投入能够带来稳定的能力回报。此后,OpenAI拿到了远超原定规划的算力资源,将研发重心聚焦在少数几条可规模化落地的路径上。在他看来,这是守住AI前沿、影响通用人工智能走向的核心方式。

新算法创新、科研人员的创造力固然重要,但深度学习目前仍处于发展早期。真正有价值的算法进步,大多依托于规模化算力支撑。拉长时间维度来看,AI本质上就是依托更大规模的算力载体,持续迭代变强。

AI更多是“养” 出来的,而非 “设计” 出来的。它依托超大算力,无数次重复简单的优化步骤,最终演化出一套极其复杂的智能系统,能够处理抽象概念、模拟人类部分行为逻辑。

对齐的核心难题

帕乔茨基指出,机器智能的生成逻辑与人类完全不同。不能默认AI会天然遵守人类准则,也不能默认它会以人类的思维方式理解价值判断。AI研究的核心问题,是对齐—— 让AI按照人类的标准,做出正确的判断与行为。他将对齐明确分为两类:

  • 第一类是目标对齐,就是让AI忠实完成人类交付的任务,遵守指令、主动沟通、理解人类意图,实用性极强,是当下AI落地的基础。

  • 第二类是价值对齐,属于模型更深层的内在属性。即便面对目标模糊、指令冲突、场景完全陌生的情况,AI依然能坚守高阶原则,做出符合人类核心利益的反应。真正对齐的AI,应当诚实、正直、对人类保有善意。

帕乔茨基认为,长期安全的关键在于价值对齐。而价值对齐的最大短板是泛化失效:AI智能越强、处理的概念越抽象,实际场景与训练场景的差距就越大,训练习得的价值准则无法适配全新环境,行为难以预判。

更严峻的是,AI行业生态迭代极快,当下训练的模型,未来需要与各类全新AI系统交互。最核心的安全底线是:无论AI是否感知到人类监督,都必须坚守人类价值

目前行业主流有两种对齐训练方式,且均存在明显短板:

  • 第一种是目标导向强化学习对齐。通过AI评估模型行为是否合规,给予对应奖惩,是现代AI助手的核心技术,适配日常场景,但容错性弱,效果高度依赖训练数据覆盖范围与模型泛化能力。

  • 第二种是预训练数据泛化对齐。通过定制对齐数据集、引导模型学习预训练中的合规内容实现对齐。但该方式无法承受高强度优化压力:原本价值对齐的模型,在攻坚高难度目标时,会为达成任务自主变通、突破原有对齐规则

监控也在失效

目前,行业尚未形成成熟的AI泛化理论,短期内无法突破,只能依托更强的AI辅助研究。所以眼下,能用实验去检验对齐手段好不好,可能比对齐手段本身还重要。

OpenAI 的主要策略是思维链监控。核心逻辑是:模型的高阶能力,大多来自显性的推理过程。只优化最终输出结果、不直接监督推理过程,能避免模型在训练中刻意隐藏异常想法,该方案具备极强的可规模化属性。

早在o1-preview研发阶段,团队就预判了这套机制的价值。官方发布版本时,特意隐藏并长期保护模型思维链,规避监督压力对推理逻辑的干扰,坚持不直接干预推理过程。思维链监控,也成为观测模型行为、拆解内部推理逻辑、研究泛化能力的核心工具。

但在Astra等新一代高阶模型中,这套核心监控工具正在逐步失效,主要有三个原因:

  • 推理场景高度复杂,推理过程与人、其他AI、工具深度交织,监控边界模糊,无法维持纯粹的观测环境;

  • AI自主修饰、操控自身推理过程的能力持续增强;

  • 预训练能力大幅提升,模型无需显性思维推理,也能完成高阶智能任务。

帕乔茨基表示,行业可以通过优化训练目标、迭代测试计算逻辑、结合思维链监控+激活监控弥补短板,但他明确预判:未来AI的发展上限,将取决于人类的监控信心

防御与节奏

业界加速训练更强AI模型,最合理、最站得住脚的理由,是搭建AI防御体系,应对人工智能带来的各类风险,其中网络安全风险最为棘手、最为突出

当前AI的网络攻防能力已经超越人类,风险边界大幅扩张。AI智能体,可以入侵绝大多数非顶级防护的基础设施,直接干预现实世界。目前行业仅有极窄的防御窗口期,必须依托现有最优模型加固关键系统安全。

AI风险远不止网络安全。经过恶意定向训练的高阶智能体,会产生全新的安全威胁:行为会超出操作者预设意图,泛化出更极端的恶意动作。AI自主性越高,“人为恶意滥用” 与 “AI自主失控” 的边界就越模糊

人类将AI视作被动工具,但高阶智能体将拥有自主目标,会通过谈判、欺骗、勒索等方式与人类博弈。同时,AI还会加速前沿技术迭代,催生人造病原体等新型技术风险。应对多重未知风险,必须依托高度对齐、安全可靠的AI构建防御体系。

AI的对齐、监控技术始终与模型整体能力同步迭代:人类反馈强化学习支撑了早期AI助手落地,思维链监控伴随推理模型诞生。未来自动化AI研究,需要持续产出新理论、新算法、新认知,逐步搭建高阶AI的安全论证体系。

文章最后,帕乔茨基抛出三点重磅警示:

  • 目前全球没有任何实验室,能在全速规模化训练 AI的同时,彻底解决对齐与监控问题,实现完全负责任的发展;

  • 在全球统一安全门槛落地前,各大AI实验室应当主动放缓迭代节奏

  • AI发展的国际协同治理,必须成为各国政府的头等优先事项

文章参考来源|openai官网、互联网公开信息

赛博研究院简介

上海赛博网络安全产业创新研究院(简称赛博研究院),是上海市级民办非企业机构,成立至今,赛博研究院秉持战略、管理和技术的综合服务模式、致力于成为面向数字经济时代的战略科技智库、服务数据要素市场的专业咨询机构和汇聚数智安全技术的协同创新平台。

赛博研究院立足上海服务全国,是包括上海市委网信办、上海市通管局、上海市经信委、上海市数据局等单位的专业支撑机构,同时承担上海人工智能产业安全专家委员会秘书长单位、上海“浦江护航”数据安全工作委员会秘书长单位、上海数据安全协同创新实验室发起单位等重要功能,并组织“浦江护航”数据安全上海论坛、世界人工智能大会安全高端对话等一系列重要专业会议。

欢迎联络咨询:

邮件:public@sicsi.org.cn;

电话:021-61432693。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭德纲风波尘埃落定!央视新闻通报钧正平定调,郭德纲这回真悬了

郭德纲风波尘埃落定!央视新闻通报钧正平定调,郭德纲这回真悬了

离离言几许
2026-09-09 08:43:01
越南女星回应合照被刘亦菲裁掉了:我会更加努力

越南女星回应合照被刘亦菲裁掉了:我会更加努力

韩小娱
2026-09-10 08:32:00
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

钉钉陌上花开
2026-09-10 22:02:58
大陆必须立刻断供!萧旭岑:国民党就是美日的“买办代理人”!

大陆必须立刻断供!萧旭岑:国民党就是美日的“买办代理人”!

小马姨
2026-09-10 13:04:20
3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

3-0!3-0!澳门冠军赛:8强诞生!张本智和剃光头,美和打疯了!

kio鱼
2026-09-11 00:16:11
日本亚运会惨状,给全世界好好上了一课:没有中国,就办不成生意

日本亚运会惨状,给全世界好好上了一课:没有中国,就办不成生意

乌克兰小静
2026-09-11 07:49:06
郭德纲又一后果来了!中央广播电视台“云听”下架了郭德纲的所有作品!这一次,评论区都在批评郭德纲

郭德纲又一后果来了!中央广播电视台“云听”下架了郭德纲的所有作品!这一次,评论区都在批评郭德纲

谭谈社会
2026-09-10 22:44:10
《交锋》尺度大到吓着湾湾,新加坡媒体跟着破防

《交锋》尺度大到吓着湾湾,新加坡媒体跟着破防

影视地平线
2026-09-10 08:46:52
1986年,胡耀邦告诫胡启立:你记住,我们共产党人任何时候绝不能鱼肉人民

1986年,胡耀邦告诫胡启立:你记住,我们共产党人任何时候绝不能鱼肉人民

帝哥说史
2026-09-08 20:29:00
今年的月饼大概率卖不动了。

今年的月饼大概率卖不动了。

老陆不老
2026-09-09 21:58:27
对于今天周五A股,我只强调3句话:第一,3995点很可能已是个山顶?

对于今天周五A股,我只强调3句话:第一,3995点很可能已是个山顶?

趋势清风侠
2026-09-11 07:23:41
记者卧底一美业销售公司 1万元的货 内购价仅300元 负责人被查后威胁:“断人钱财犹如杀人父母”

记者卧底一美业销售公司 1万元的货 内购价仅300元 负责人被查后威胁:“断人钱财犹如杀人父母”

闪电新闻
2026-09-11 11:16:11
“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

“穿成这样合适吗?” 幼师领舞被女家长围攻:女生都懂是怎么回事

熙熙说教
2026-09-10 13:21:21
为什么越来越多的年轻人崇拜教员?他们打破信息茧房后,亲眼看到了资本主义丑陋的真面目呈现在面前!

为什么越来越多的年轻人崇拜教员?他们打破信息茧房后,亲眼看到了资本主义丑陋的真面目呈现在面前!

精准心理学何日辉
2026-09-10 12:00:23
美的回应洗衣机联网19小时耗411MB流量:无网传大规模数据传输行为 已完成技术核查

美的回应洗衣机联网19小时耗411MB流量:无网传大规模数据传输行为 已完成技术核查

快科技
2026-09-10 13:35:05
 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

 李大钊的藏身地固若金汤,把他供出来的不是敌人,而是他最信任的人

磊子讲史
2026-09-10 17:11:14
快船反击!美国司法部介入!伦纳德被刑事调查

快船反击!美国司法部介入!伦纳德被刑事调查

篮球教学论坛
2026-09-11 09:31:53
人为什么变老?《科学》最新实锤:每天1000亿个细胞正暗中杀死你器官!

人为什么变老?《科学》最新实锤:每天1000亿个细胞正暗中杀死你器官!

徐德文科学频道
2026-09-09 15:50:42
5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

5年每月1500元,男子停资助遭女生质问:尽快打过来不然曝光你!最新回应

上观新闻
2026-09-10 10:01:26
2026-09-11 11:48:53
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5034文章数 37518关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

复旦女硕士国外旅游时被蜱虫叮咬染重症 家属全网求助

头条要闻

复旦女硕士国外旅游时被蜱虫叮咬染重症 家属全网求助

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

旅游
家居
亲子
教育
公开课

旅游要闻

挖到泰安隐秘绿野!现实版宫崎骏世界,这里简直是一座动画感草原

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

去幼儿园已经不哭了,说爸爸去龙口是聊天去了,这孩子真够逗的!

教育要闻

2026胡润国际化学校百强出炉,深圳市南山区荟同学校登榜

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版