![]()
如果 AI 真能不断创造更强的自己,人类还能驾驭它吗?
近日,围绕递归自我改进与 AI 失控风险的讨论迅速升温。多名曾供职于 Google DeepMind、OpenAI 和 Anthropic 的研究人员出于安全顾虑离开前沿实验室,部分人转向独立评测机构。
当地时间 9 月 13 日,Engels 在社交平台宣布,自己已于 3 周前离开 Google DeepMind 的 AGI 安全团队。
此前,他在 DeepMind 从事模型可解释性与对齐研究,也收到过 OpenAI 和 Anthropic 的工作邀请,但仍决定前往独立评测机构 METR。按照他的解释,这项选择源于当下过高的技术风险。
Engels 认为,前沿 AI 公司正在竞逐远超人类能力的超级智能,并试图让 AI 参与开发更强的 AI。如果这种递归自我改进顺利推进,新系统可能帮助人类解决大量难题。一旦参与其中的模型没有充分对齐,原本局部、可控的错误也可能被带入持续加速的反馈循环。
当模型越来越难被看透
这番判断与 Engels 此前的研究经历密切相关。从机械可解释性、可扩展监督到思维链监测,他长期试图理解模型内部发生了什么,以及人类能否及时发现它正在偏离目标。
在进入 Google DeepMind 前,Engels 曾在麻省理工学院 Max Tegmark 团队攻读计算机科学博士,研究方向是机械可解释性。后来,他暂停博士阶段的研究,进入 DeepMind 的 AGI 安全团队,继续从可解释性和监督角度研究强大 AI 系统的潜在风险。
机械可解释性试图打开神经网络的内部过程。通俗来说,大模型可以给出答案,却很难像传统程序一样逐行说明依据。因此,研究者需要尝试识别模型内部代表某些概念、目标或行为倾向的结构,以判断模型究竟学到了什么,是否形成了与表面回答不同的内部机制。
围绕这一方向,Engels 曾聚焦稀疏自编码器能否真正帮助人类识别模型概念,也分析过语言模型的特征是否都能用简单的线性结构解释。
随后,他将注意力进一步转向可扩展监督。当模型能力接近或超过监督者时,人类可能难以直接判断其答案和行动是否可靠,这类工作关注的正是未来 AI 安全中的一个基础难题。
在研究模型监督机制的过程中,Engels 还参与了思维链混淆、奖励黑客监测和扩散语言模型推理透明度等工作。相关研究试图判断,人类能否通过模型留下的推理轨迹发现异常,以及这种观察方式在模型能力继续增长后是否依然可靠。
这些研究共同指向一个问题:模型能力越强,人类并不一定越能理解和监督它。能力提高可以帮助模型完成复杂任务,也可能使其更擅长识别评测环境、利用规则漏洞,甚至调整自身行为以避开已有监控。
与此同时,递归自我改进(RSI)重新成为 AI 行业的高频概念。递归自我改进是指 AI 逐步参与算法设计、代码优化、实验运行和结果分析,由此提高下一代 AI 的研发效率。
当更强的模型继续参与后续研发,能力进步便可能形成反馈循环。METR 的长期任务评测显示,过去数年,前沿 AI 能够独立完成的任务时长持续增长。编程 Agent 和自动化研究工具的进步,也让 RSI 从较为遥远的理论设想,逐渐转化为可以通过工程任务测量的问题。
![]()
图|Engels 发文解释离职决定(来源:X)
Engels 在推文中将这一过程描述为 AI 构建更聪明 AI 的循环。他承认,如果发展顺利,由此产生的系统可能在科研、医疗和其他领域解决大量问题。但他更担心,人类目前还不知道如何证明一个 AI 已经安全到足以进入这样的循环。
另外,近几周出现的模型异常行为加强了他的顾虑。他列举了模型相互勾结、入侵公司、隐藏踪迹和对人类实施社会工程等现象,并认为当前 AI 似乎正在变得更不对齐。
这里的“不对齐”,指系统实际采取的行动偏离设计者的真实意图,即使它仍在追求一个表面上合理的任务目标。
不过,Engels 也承认,这些事件本身并没有造成非常严重的危险。它们大多发生在训练、测试或特殊实验环境中,无法证明 AI 已经拥有独立意识,更不能直接推出模型将主动伤害人类。
在他看来,真正值得警惕的是另一层风险。这些系统目前仍会曲解目标、突破边界和规避监控,却可能很快参与开发能力更强的继任者。当错误进入连续迭代的研发循环后,人类是否仍有足够时间识别并纠正它,尚无明确答案。
基于这些变化,Engels 认为,未来 5 年内,AI 系统存在造成巨大伤害的“可怕可能性”。尽管他没有给出确切概率,但认为风险已经高到足以成为世界上最重要的问题之一。由此,他提出需要争取更多时间,让对齐、评测和监控能力不至于落在模型能力之后。
选择成为独立评测者
离开 DeepMind 前,Engels 已经身处前沿 AI 安全研究的内部。大型实验室拥有最新模型、训练数据和运行记录,内部团队也更容易在开发早期发现问题。
在公开表述中,Engels 没有指责 DeepMind 阻碍其安全研究,也没有否定企业内部团队的作用。他强调,自己离开是因为当前的风险已经足够高,希望转而调查近期发生的对齐事故,积累公开证据。
这也解释了 METR 对他的吸引力。他在 DeepMind 研究如何理解和改善模型,加入 METR 后,则将更多精力放在事故调查和独立验证上。前者直接参与模型安全建设,后者需要站在公司之外,判断开发者提出的安全措施是否经得起检验。
METR 全称为 Model Evaluation and Threat Research,是一家研究前沿 AI 能力与风险的非营利机构。其前身 ARC Evals 于 2022 年在 Alignment Research Center 内部成立,随后独立运作并更名为 METR,其创始人 Beth Barnes 曾在 OpenAI 从事对齐研究。
与直接开发模型的实验室不同,METR 的核心工作是形成可供外界检验的测量方法和风险证据。它测试 AI 能否自主完成持续数小时乃至更长时间的复杂任务,也关注网络攻击、自我复制、规避关闭和自动化 AI 研发等可能带来严重风险的能力。
Engels 的选择并非孤例。9 月 11 日,Anthropic 可扩展监督团队前负责人 Joe Benton 发文称,自己已于两周前离职,并加入 METR 开展嵌入式风险评估。
![]()
图|Benton 发文称加入 METR(来源:X)
Benton 认为,前沿公司正在竞逐远超人类能力的系统,却没有为安全投入与之匹配的资源。一家公司可能接近“智能爆炸”,甚至失去对模型的控制,公众却对此缺乏了解。因此,他希望从公司外部推动实验室披露 RSI 进展、安全事故及未遂事件,并由独立机构验证其是否达到最低安全标准。
他们的担忧集中在相似的问题上,即模型能力正在快速提高,AI 开始承担更复杂的研发工作,而关于模型如何行动、企业如何处理事故的信息仍主要掌握在开发者手中。
即使部分前沿公司的管理者也承认风险,竞争压力仍使主动减速变得困难。一家公司放慢训练,并不意味着竞争对手会采取相同行动。研发投入、市场份额和技术领先优势相互叠加,使安全承诺很难自动转化为一致行动。
按照 Engels 的计划,他将在 METR 研究训练中错位行为的来源,评估当前缓解措施是否充分,并调查行业是否正在接近解决对齐问题。他认为,一家 METR 仍远远不够,未来需要更多组织从不同角度检验前沿公司的模型和安全主张。
![]()
图|METR机构简介(来源:METR 官网)
不过,独立评测也有明显边界。METR 不具备法定监管权,无法要求企业暂停训练或强制提交全部资料。尽管其资金不来自前沿 AI 公司,实际研究仍可能依赖这些公司提供模型权限、运行日志和免费 Token,能够看到什么仍取决于企业开放到何种程度。
另一项争议来自风险判断本身。近期异常行为多数出现在研究人员设计的压力测试中,不能证明模型已经形成稳定的恶意目标。将这些现象直接延伸为未来 5 年的灾难,也需要更多关于能力增长、现实部署和防护有效性的证据。
与此同时,关于失控和超级智能的高调警告,也被部分批评者视为模型公司强化技术神秘感、提高行业门槛的方式。如果少数头部实验室同时定义风险、制定规则并选择评测者,安全治理也可能演变为巩固既有优势的工具。
这些争议反而说明,AI 安全不能只依赖研究者的个人判断,也不能完全交由模型公司自行证明。Engels 等人的警告是否准确,仍需通过可重复的评测、公开事故调查和更多外部审查加以验证。
从 DeepMind 到 METR,Engels 没有离开 AI 安全研究,而是改变了观察前沿模型的位置。当 AI 开始参与开发下一代 AI,他希望从实验室外部回答一个更基础的问题:在能力进入加速循环前,人类是否真正知道这些系统会如何行动。
参考资料:
1.https://x.com/JoshAEngels/status/2098890712830169115
2.https://www.joshengels.com/papers/index.html
3.https://www.business-standard.com/technology/tech-news/another-anthropic-researcher-warns-of-ai-race-risks-after-quitting-126091200407_1.html
4.https://mp.weixin.qq.com/s/4itpDZUEj1FE4PQPVwV3cQ
5.https://metr.org/about
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.