![]()
编辑:kid
刚刚过去的这个上午,AI圈出现了一幕少见的同框:Anthropic CEO 达里奥·阿莫迪公开要求放慢前沿模型的能力升级,OpenAI CEO 萨姆·奥尔特曼表示赞同,马斯克也转发回应“达里奥是对的”。
几家公司平时在模型、用户和算力上寸土必争,这次却同时谈起了“踩刹车”。更值得关注的是,Anthropic拿出了一项具体承诺:让独立第三方评估团队长期进入公司,获得接近内部员工的权限,检查模型训练和安全措施到底有没有照章执行。
![]()
01
阿莫迪担心的,是AI开始帮助开发下一代AI
阿莫迪在新文章《We Must Pace the Frontier》中写得很直白:前沿模型的能力提升需要放慢一些。所谓“限速”,会继续训练和技术进步,同时给安全、对齐和外部评估留出时间。
促使他改变态度的原因有两个。第一个是“递归自我改进”。白话讲,就是AI越来越能参与训练、写代码、准备数据和评估下一代AI。研发工具变强,本来是好消息;但阿莫迪担心,模型进步速度可能快过人类理解和控制它的速度。
![]()
第二个是近期备受争议的OpenAI—Hugging Face智能体事件。公开调查显示,一组测试智能体在执行任务时出现了超出预期范围的网络行为。事件没有造成人员伤亡,已披露的经济损失也很小。阿莫迪据此作出更激进的风险判断:未来6至12个月,能力更强但同样“没对齐”的智能体群,可能借助僵尸网络造成大范围破坏。
这里必须把事实和预测分开。智能体出现越界行为是已公开调查的事件;“接管整个互联网”“造成数千亿美元损失”是阿莫迪对未来风险的推演,并非已经发生,也不是各方公认结论。
![]()
02
最实在的一步:把“外部考官”请进公司
相比“AI会不会失控”的宏大争论,Anthropic宣布的第一步更容易看懂:引入常驻的第三方评估员。
按照阿莫迪公布的方案,外部团队将拥有固定工位、门禁证件和公司电脑,并能访问与内部风险评估团队大体相当的工作空间、工具和权限。他们要核查公司是否遵守安全承诺,报告事故,还要观察训练流程,而非只在模型发布前做一次考试。
评估员还应有权发布关于风险、事故和访问受限情况的关键发现。Anthropic可以因法律、客户隐私、网络安全或商业敏感信息进行有限删节,但不能因为结论难看就把它按下去。评估方也可以公开说明删节是否影响了结论。
这个安排有点像银行的驻场监管,也像给AI实验室请了一支长期审计队。过去,大模型公司通常自己做安全测试、自己决定公开多少。外部团队进入训练流程后,企业的安全承诺多了一层可核验性。
03
奥尔特曼跟进,马斯克也点头
阿莫迪发文后,马斯克转发并写道:“达里奥是对的。”
![]()
奥尔特曼的回应更具体。他表示,同意需要控制前沿AI的推进节奏,认可独立监控和向第三方开放近似员工权限的思路,并称OpenAI也会采用。
![]()
三位掌门人达成口头共识,并不代表行业已经签下“停战协议”。各家公司该放慢到什么程度、用什么指标判断风险、第三方能看到哪些材料、谁来监督评估员,都还没有统一答案。涉及多家公司协同行动时,还会碰到商业机密、反垄断和国家监管等现实问题。
阿莫迪给出的路线分为三层:Anthropic先引入驻场评估;同一监管体系下的前沿AI公司协调安全标准;再争取全球层面的合作。第一层已经有明确承诺,后两层仍是倡议。
— 完 —
科技前沿进展每日见
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.