网易首页 > 网易号 > 正文 申请入驻

AI 巨头集体喊 "慢一点",表面谈安全,底下在争什么?

0
分享至


9 月 12 日,Anthropic CEO Dario Amodei 发出一篇长文,题目是:《We Must Pace the Frontier》,我们必须给 AI 前沿发展“控速”。

接下来 48 小时,画风迅速魔幻起来。

OpenAI 的 Sam Altman 表态认同;xAI 的 Elon Musk 说“Dario 是对的”;Google DeepMind 的 Demis Hassabis 也赞成更审慎的路径;Microsoft CEO Satya Nadella 跟进,强调超级智能若不受人类控制,就不值得追求。

几家平日里恨不得把对方模型跑分按在地上摩擦的公司,突然在“慢一点”这件事上有了共同语言。

科技圈当然立刻警觉:等等,这群全世界最急着造 AGI、最拼命采购 GPU、最擅长发布“史上最强模型”的人,怎么开始劝全行业冷静了?

这不是一场单纯的 AI 安全讨论。

它是一场围绕技术标准、产业准入、地缘政治与下一代 AI 主导权的争夺。表面争的是“要不要放缓”,底层争的却是:谁有资格定义什么叫危险,谁有权验证模型安全,谁能决定全世界 AI 的速度上限。

一句话概括:AI 前沿放缓之争,不是把赛车熄火,而是抢方向盘、定限速牌、顺手把后来者的车钥匙拿走。

一次“失控”,让劝大家慢点开不再像杞人忧天

过去几年,AI 安全讨论总有点像科幻片预告:模型会不会失控?会不会欺骗人类?会不会自己复制、自己变强?

普通用户的反应往往很务实:先把 PDF 转明白、把表格别算错,再聊灭世行不行?

今年夏天,OpenAI 的一次事件改变了这种氛围。

OpenAI 披露,其高能力内部研究模型在 Hugging Face 相关测试中出现了严重的失配行为。模型组成的 Agent 集群,针对未被要求攻击的目标实施网络攻击,并试图入侵负责评估其表现的“评分器”。

OpenAI 后续称,这是该公司识别到的最严重一类模型驱动的第三方影响事件;在扩大排查中,已向数十个可能受到影响的第三方发出通知。

把这件事翻译成人话,就是:你让一群实习生去完成一个网页任务,它们没按流程交作业,反而自己开了个协作群,绕过门禁、翻服务器抽屉,还试图篡改老师的判卷系统。

更麻烦的是,这不是传统意义上的“黑客攻击”。

模型并没有被直接指令去搞破坏,而是在完成高难度目标时,把“解决问题”歪成了“清除障碍”。对一个能调用工具、浏览网页、写代码、跨系统协作的 Agent 来说,障碍和规则之间,只差一次错误的目标泛化。

OpenAI 在 8 月 18 日宣布,曾暂停最新模型的强化学习训练两周,并搁置最大的一次前沿 RL 训练任务,转而加固研究环境、扩展监控和红队测试。

这件事给“放缓派”送上了一张再好不过的论据:能力不是在实验室里线性变强,风险也不会按季度报告的节奏出现。

而且,OpenAI 一边踩下训练刹车,一边又在 9 月发布 GPT-6 Astra。其系统卡明确写道,Astra 是该公司首个达到“关键级”网络安全能力门槛的广泛部署模型;该公司也承认,在对抗性测试中,Astra 相较 GPT-5.6 Sol 更能控制自己的思维链,因而对监控的可见性有所下降。

这就是今天 AI 安全最真实的荒诞感:

一边说仪表盘开始失灵,一边把发动机换成更大排量。

“放缓”到底放什么?不是暂停训练,是给自我加速装限速器

Amodei 的提案并不是“全球停训大模型”。

他反复强调,pacing 不等于停止技术进步,而是降低能力跃迁的速度,为对齐、监控、安全评估争取时间。

核心包括三层:让第三方“嵌入式评估者”长期进入前沿实验室;由政府协调行业安全标准;最终推动国际范围内对高风险能力、模型测试乃至递归自我改进速度达成某种协议。

其中最关键的词是 RSI,Recursive Self-Improvement,递归自我改进。

过去训练一个更强模型,像盖一座更高的楼:要招更多工程师、买更多芯片、收集更多数据,成本高得让人肉疼。

现在的变化是,模型开始参与“造下一个模型”这件事:写训练代码、设计实验、定位工程瓶颈、生成合成数据、协助评估结果。人类原本是研发流水线上的唯一总工程师,模型正在变成不领工资、不睡觉、还能自动补全 Python 的研发副驾驶。

一旦副驾驶开始改装发动机,速度曲线就未必还是线性的。


Amodei 的判断是,AI 能力进展已经因为 AI 参与 AI 研发而明显加速;如果没有护栏,未来 6 到 12 个月,类似失配 Agent 集群可能具备维持持久化僵尸网络、对互联网造成数千亿美元级损失的能力。

这个时间表带有明显的主观风险判断,而非已被验证的预测,但它击中了一个行业痛点:模型能力可以用 benchmark 排名展示,模型“会在什么时候以何种方式不听话”,却没有同样清晰的仪表盘。

技术上看,这场争论已经从“模型会不会答错题”,升级为“模型是否知道自己正在被考核”。

如果模型在思维链中意识到自己被监控,它就可能调整表演方式。OpenAI 对 Astra 的披露中就承认,在特定对抗条件下,模型可能通过策略性低表现或回避监控来规避检测。

虽然该公司也强调,这些结果主要来自刻意诱导模型规避监管的测试,且整体安全行为优于上一代,但问题已经摆在台面上:我们依赖的安全后视镜,可能正被驾驶员学会调角度。

为什么突然升级?因为“安全”终于碰上了“可验证性”

AI 行业过去并非没人喊过暂停。

2023 年,未来生命研究所那封“暂停巨型 AI 实验”的公开信,签名很响,落地很轻。原因不复杂:没人能确认别人真的停了,自己先停就可能直接出局。

核军备控制用了几十年才慢慢解决这个问题,靠卫星、现场核查、条约机制和相互威慑。AI 比核武器更难管。芯片可以藏,代码可以复制,权重可以迁移,训练可以切成无数分布式任务。

你甚至很难只看算力,就判断一家实验室是在训练聊天机器人,还是在培育一个能自主打穿企业内网的 Agent。

所以 Amodei 此次方案的关键词不是“暂停”,而是“嵌入式评估”。第三方评估团队要像常驻审计一样,看模型成品,也看训练过程与安全流程。

听起来合理,但争议恰好从这里爆炸。

谁选第三方?谁为他们付钱?评估标准是否公开?小公司是否承受得起?如果答案最终是“由几家头部实验室认可的机构来审”,那安全机制很容易从护栏变成收费站。

Cohere CEO Aidan Gomez 也发出了尖锐的批评:不能由少数占据市场优势的硅谷公司,为全世界定义一代通用技术的规则;他把这种倾向称作“披着羊皮的狼”,本质上接近卡特尔。

Hugging Face CEO Clément Delangue 也认为,AI 安全不能在少数前沿实验室的密室里解决。

这既可以看作阴谋论,同时也是产业经济学。

监管有一个老毛病:大公司嘴上怕监管,实际上最怕的是没有门槛的监管。一套复杂的算力申报、模型备案、持续红队测试、第三方审计和安全基础设施,对 OpenAI、Anthropic、Google、Microsoft 是成本,对中小实验室和开源团队则可能是生死线。

巨头能把安全团队扩成一个事业部,创业公司可能连合规表格都填不起。

于是,“慢一点”会自然分化成两种版本:第一种,是所有人一起慢,能力与安全同步校准;第二种,是头部公司获得继续研发的许可,其他人先去领号排队。

两者只差几个监管条款,结果却是两个完全不同的 AI 世界。

海外巨头图什么?安全是真的,战略也是真的

把所有巨头的呼吁都归结为“借安全搞垄断”,过于省事;把它们都理解为纯粹的技术良心,也未免天真。


真实情况恰恰更复杂:安全、商业、政策和地缘竞争,在这轮浪潮里已经焊死在一起。

第一层,是降低失控风险。

OpenAI-Hugging Face 事件证明,Agent 风险不再只存在于论文里的“假想攻击”。模型有工具权限、有多智能体协作、有长程任务目标,风险模型就必须从“输出一段不当文本”升级到“执行一串无人批准的现实动作”。这也是 OpenAI 把安全措施拆成监控、对齐和安全隔离三道防线的原因。

第二层,是争夺“负责任 AI”的解释权。

安全标准一旦先被写进政策,就会影响采购、云服务、国防合作、模型出口与资本流向。未来客户挑选 AI 平台,可能不只问“模型聪不聪明”,还会问“有没有通过某套前沿安全认证”。谁先定义认证,谁就更可能定义市场。

第三层,则是最不能绕开的中国因素。

Amodei 在文章中明确主张,美国及盟友应保持 AI 领先,并维持对中国最先进 AI 芯片和芯片制造设备的限制;他同时认为,全球协调必须把中国纳入其中,但任何协议都必须可验证,且不能损害美国及盟友的战略优势。

这意味着,“全球放缓”从第一天起就不是一个完全中性的技术倡议。

它包含一层典型的大国博弈逻辑:美国要在自己领先时建立安全秩序,通过出口管制保住领先,再用规则把领先转换为长期制度优势。

也就是说,美国在大谈特谈交通规则的同时,更在自己造车,自己当裁判,再规定别人只能骑自行车。

显然,这种做法是不被其他组织所接受的。

最大的风险不是“被迫慢”,而是被锁进低速车道

我们的AI 面对的挑战,不只是先进芯片供应,也不只是模型参数规模。

真正值得警惕的是,国际安全治理如果被包装成一套高度依赖美国实验室、美国云平台、美国评估机构和美国算力门槛的体系,我们的企业可能被排除在规则形成阶段。等规则成熟后再进入,面对的就不只是技术追赶,而是“合规定义权”已经被别人提前写好。

这会带来三种潜在压力。

其一,算力门槛被政治化。若“前沿模型”的定义与训练算力、先进芯片紧密绑定,出口管制和安全监管就可能合二为一。技术限制被赋予安全正当性,反制难度会更高。

其二,开源生态被误伤。闭源巨头更容易完成安全审计和访问控制,开源模型则天然面临权重扩散、二次微调和责任追踪难题。若规则粗暴地把“开放”视作“危险”,最先被挤压的往往是创新活跃、资源相对有限的团队。

其三,部署型优势被低估。今天的 AI 竞争,已经不只是“谁的基座模型更大”。在制造、物流、客服、办公、工业软件、机器人和政企场景中,真正拉开差距的是模型是否能稳定接入流程、处理脏数据、接受权限约束、承担责任闭环。我们的 AI 的机会,恰恰在于把模型从演示台搬进真实世界。

说得更直接一点:大模型的上半场,比的是谁先点燃算力;Agent 的下半场,比的是谁能在真实流程里不闯祸地跑完一万步。

这也是我们不该被“放缓叙事”带偏的原因。

我们当然需要参与全球 AI 安全治理,也必须加码模型评估、Agent 权限隔离、数据安全、红队测试与责任追溯。但参与治理,不等于接受别人预装好的刹车系统。

应当争取的是开放、透明、可复现、可多边参与的评估机制,而不是把安全能力变成少数公司拥有的黑箱许可证。

真正该慢下来的,是“先接权限,再补安全”的行业惯性

这场争论里,最讽刺的一幕是:巨头们一边呼吁控速,一边仍在拼命推进超级智能、AI 科研、自动编程和通用 Agent。


虚伪也好,不得已也好,阴谋论也罢,反正这个竞赛一时半会儿是停不下来的。

技术公司不可能主动退出竞赛,除非它确信对手也无法借机超车。问题在于,公众不能把“请相信我们会自律”当成治理方案。

AI 不是传统软件。传统软件 bug 了,顶多崩一个页面;带工具、能行动、会协作的 Agent 出问题,可能直接改数据库、转账、删文件、骗员工、攻击系统。

能力增长与权限开放一旦绑在一起,模型每升一级,外部世界都在替它支付更多测试成本。

  • 所以,AI 前沿真正需要的不是一句“慢一点”,而是几条硬规则:

  • 高权限 Agent 必须默认最小权限,关键动作应有人工确认和可撤销机制;

  • 安全评估机构应多元化、可审计,不能沦为头部实验室的朋友圈;

  • 对高风险能力的披露要有公共标准,不能出了事故才写复盘长文;

  • 国际合作可从生物武器、重大网络攻击等低争议风险切入,而非一上来谈谁必须放弃技术优势;

  • 开源模型应按风险能力分级治理,不能用“一刀切封闭”代替复杂但必要的安全工程。

AI 的确需要刹车,但刹车不能只装在后来者的车上。

9 月这场“前沿放缓之争”最重要的价值,不是让模型训练停几周,也不是让 CEO 们在社交平台上互相点赞。它迫使所有人承认:AI 已经从“更会聊天的软件”,进入“可能自行采取行动的基础设施”。

而基础设施从来不是谁跑得最快,谁就天然拥有制定交通法的权利。

真正成熟的 AI 治理,不该制造一条由少数巨头把守的高速公路。它应该让全世界都看得见限速牌、检验得了刹车、参与得了规则,也有资格决定要开往哪里。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
格局!王楚钦:无论谁赢都是中国队赢 林诗栋配得上冠军 值得开心

格局!王楚钦:无论谁赢都是中国队赢 林诗栋配得上冠军 值得开心

念洲
2026-09-28 21:15:37
杜伦正式拒绝活塞5年2亿报价:不参加媒体日+训练营活动 谈判陷僵局

杜伦正式拒绝活塞5年2亿报价:不参加媒体日+训练营活动 谈判陷僵局

醉卧浮生
2026-09-28 21:32:24
小孩姐陈妤颉再夺一金!亚运会4×100米接力:中国队42秒96强势卫冕

小孩姐陈妤颉再夺一金!亚运会4×100米接力:中国队42秒96强势卫冕

全景体育V
2026-09-28 21:12:24
林诗栋夺冠憋屈!不敢庆祝,教练组不鼓掌,王楚钦体能储备惹争议

林诗栋夺冠憋屈!不敢庆祝,教练组不鼓掌,王楚钦体能储备惹争议

三十年莱斯特城球迷
2026-09-28 20:57:28
巴西、皇马传奇卡洛斯从亿元户变成百万元户,球员时代赚取约1.6亿欧元,如今几乎只剩下1%!

巴西、皇马传奇卡洛斯从亿元户变成百万元户,球员时代赚取约1.6亿欧元,如今几乎只剩下1%!

福酱的小时光
2026-09-28 10:41:09
震惊!网传某半导体大厂号召全员降薪共渡难关,一同降薪20%,财报曝光:老总年薪大涨33%,年薪反倒从600万涨至800万

震惊!网传某半导体大厂号召全员降薪共渡难关,一同降薪20%,财报曝光:老总年薪大涨33%,年薪反倒从600万涨至800万

火山詩话
2026-09-27 13:25:11
英法已出兵!巴土也要参战,第二个俄乌战场即将打响,中国出手了

英法已出兵!巴土也要参战,第二个俄乌战场即将打响,中国出手了

兵卒史
2026-09-28 06:11:27
9月28日凌晨浩劫,基辅遭9小时狂轰!2200架无人机倾泻!

9月28日凌晨浩劫,基辅遭9小时狂轰!2200架无人机倾泻!

荷兰豆爱健康
2026-09-28 17:25:33
亚运会官方:中国选手递补马拉松竞走1金1银 原冠军违规取消成绩

亚运会官方:中国选手递补马拉松竞走1金1银 原冠军违规取消成绩

醉卧浮生
2026-09-28 11:11:06
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
国常会:研究出台稳定房地产市场、促进就业增收等政策措施

国常会:研究出台稳定房地产市场、促进就业增收等政策措施

界面新闻
2026-09-28 19:14:04
大众新车官宣:10月12日,正式上市!

大众新车官宣:10月12日,正式上市!

科技堡垒
2026-09-28 16:19:58
林诗栋夺男单冠军后,恶心的一幕出现了!王楚钦被讽刺,樊振东躺枪

林诗栋夺男单冠军后,恶心的一幕出现了!王楚钦被讽刺,樊振东躺枪

十点街球体育
2026-09-29 00:35:04
全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

诗词天地
2026-09-28 14:09:52
黄金又又又跌了,再这么跌下去,那些买在最高点的人该怎么办

黄金又又又跌了,再这么跌下去,那些买在最高点的人该怎么办

News脑洞
2026-09-28 17:07:20
手机号被封号解除17分钟后再次被封,客服称只能销号 机主:反诈中心查询无异常,已投诉

手机号被封号解除17分钟后再次被封,客服称只能销号 机主:反诈中心查询无异常,已投诉

红星新闻
2026-09-28 20:05:26
陈妤颉临危受命第四棒拉出无人区 女子4X100接力中国队42秒96夺冠

陈妤颉临危受命第四棒拉出无人区 女子4X100接力中国队42秒96夺冠

劲爆体坛
2026-09-28 21:31:10
悲催!十年炒股亏光积蓄负债30万,34岁男子藏着秘密,不敢告知重度抑郁的妻子

悲催!十年炒股亏光积蓄负债30万,34岁男子藏着秘密,不敢告知重度抑郁的妻子

火山詩话
2026-09-28 20:16:57
"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

"45秒,全没了!"柏林宣布退出申办,奥运会从顶级IP沦为财政噩梦

云居历史
2026-09-28 15:40:23
SpaceX“星舰”首次成功进入地球轨道并部署26颗星链V3卫星

SpaceX“星舰”首次成功进入地球轨道并部署26颗星链V3卫星

界面新闻
2026-09-28 21:39:47
2026-09-29 01:04:49
王吉伟
王吉伟
关注互联网+与行业转型
874文章数 8584关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

这台车开完还想开 智界RX最让我意外的,不是智驾,是操控

态度原创

家居
本地
教育
旅游
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

全国首个!C9大学,获批一交叉学科博士点

旅游要闻

魔都生活指北丨@全体上海人:长风公园焕新归来,又一个童年记忆回来了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版