网易首页 > 网易号 > 正文 申请入驻

拒绝OpenAI和Anthropic邀约,DeepMind安全研究员离职转向独立测评

0
分享至



如果 AI 真能不断创造更强的自己,人类还能驾驭它吗?

近日,围绕递归自我改进与 AI 失控风险的讨论迅速升温。多名曾供职于 Google DeepMind、OpenAI 和 Anthropic 的研究人员出于安全顾虑离开前沿实验室,部分人转向独立评测机构。

当地时间 9 月 13 日,Engels 在社交平台宣布,自己已于 3 周前离开 Google DeepMind 的 AGI 安全团队。

此前,他在 DeepMind 从事模型可解释性与对齐研究,也收到过 OpenAI 和 Anthropic 的工作邀请,但仍决定前往独立评测机构 METR。按照他的解释,这项选择源于当下过高的技术风险。

Engels 认为,前沿 AI 公司正在竞逐远超人类能力的超级智能,并试图让 AI 参与开发更强的 AI。如果这种递归自我改进顺利推进,新系统可能帮助人类解决大量难题。一旦参与其中的模型没有充分对齐,原本局部、可控的错误也可能被带入持续加速的反馈循环。

当模型越来越难被看透

这番判断与 Engels 此前的研究经历密切相关。从机械可解释性、可扩展监督到思维链监测,他长期试图理解模型内部发生了什么,以及人类能否及时发现它正在偏离目标。

在进入 Google DeepMind 前,Engels 曾在麻省理工学院 Max Tegmark 团队攻读计算机科学博士,研究方向是机械可解释性。后来,他暂停博士阶段的研究,进入 DeepMind 的 AGI 安全团队,继续从可解释性和监督角度研究强大 AI 系统的潜在风险。

机械可解释性试图打开神经网络的内部过程。通俗来说,大模型可以给出答案,却很难像传统程序一样逐行说明依据。因此,研究者需要尝试识别模型内部代表某些概念、目标或行为倾向的结构,以判断模型究竟学到了什么,是否形成了与表面回答不同的内部机制。

围绕这一方向,Engels 曾聚焦稀疏自编码器能否真正帮助人类识别模型概念,也分析过语言模型的特征是否都能用简单的线性结构解释。

随后,他将注意力进一步转向可扩展监督。当模型能力接近或超过监督者时,人类可能难以直接判断其答案和行动是否可靠,这类工作关注的正是未来 AI 安全中的一个基础难题。

在研究模型监督机制的过程中,Engels 还参与了思维链混淆、奖励黑客监测和扩散语言模型推理透明度等工作。相关研究试图判断,人类能否通过模型留下的推理轨迹发现异常,以及这种观察方式在模型能力继续增长后是否依然可靠。

这些研究共同指向一个问题:模型能力越强,人类并不一定越能理解和监督它。能力提高可以帮助模型完成复杂任务,也可能使其更擅长识别评测环境、利用规则漏洞,甚至调整自身行为以避开已有监控。

与此同时,递归自我改进(RSI)重新成为 AI 行业的高频概念。递归自我改进是指 AI 逐步参与算法设计、代码优化、实验运行和结果分析,由此提高下一代 AI 的研发效率。

当更强的模型继续参与后续研发,能力进步便可能形成反馈循环。METR 的长期任务评测显示,过去数年,前沿 AI 能够独立完成的任务时长持续增长。编程 Agent 和自动化研究工具的进步,也让 RSI 从较为遥远的理论设想,逐渐转化为可以通过工程任务测量的问题。


图|Engels 发文解释离职决定(来源:X)

Engels 在推文中将这一过程描述为 AI 构建更聪明 AI 的循环。他承认,如果发展顺利,由此产生的系统可能在科研、医疗和其他领域解决大量问题。但他更担心,人类目前还不知道如何证明一个 AI 已经安全到足以进入这样的循环。

另外,近几周出现的模型异常行为加强了他的顾虑。他列举了模型相互勾结、入侵公司、隐藏踪迹和对人类实施社会工程等现象,并认为当前 AI 似乎正在变得更不对齐。

这里的“不对齐”,指系统实际采取的行动偏离设计者的真实意图,即使它仍在追求一个表面上合理的任务目标。

不过,Engels 也承认,这些事件本身并没有造成非常严重的危险。它们大多发生在训练、测试或特殊实验环境中,无法证明 AI 已经拥有独立意识,更不能直接推出模型将主动伤害人类。

在他看来,真正值得警惕的是另一层风险。这些系统目前仍会曲解目标、突破边界和规避监控,却可能很快参与开发能力更强的继任者。当错误进入连续迭代的研发循环后,人类是否仍有足够时间识别并纠正它,尚无明确答案。

基于这些变化,Engels 认为,未来 5 年内,AI 系统存在造成巨大伤害的“可怕可能性”。尽管他没有给出确切概率,但认为风险已经高到足以成为世界上最重要的问题之一。由此,他提出需要争取更多时间,让对齐、评测和监控能力不至于落在模型能力之后。

选择成为独立评测者

离开 DeepMind 前,Engels 已经身处前沿 AI 安全研究的内部。大型实验室拥有最新模型、训练数据和运行记录,内部团队也更容易在开发早期发现问题。

在公开表述中,Engels 没有指责 DeepMind 阻碍其安全研究,也没有否定企业内部团队的作用。他强调,自己离开是因为当前的风险已经足够高,希望转而调查近期发生的对齐事故,积累公开证据。

这也解释了 METR 对他的吸引力。他在 DeepMind 研究如何理解和改善模型,加入 METR 后,则将更多精力放在事故调查和独立验证上。前者直接参与模型安全建设,后者需要站在公司之外,判断开发者提出的安全措施是否经得起检验。

METR 全称为 Model Evaluation and Threat Research,是一家研究前沿 AI 能力与风险的非营利机构。其前身 ARC Evals 于 2022 年在 Alignment Research Center 内部成立,随后独立运作并更名为 METR,其创始人 Beth Barnes 曾在 OpenAI 从事对齐研究。

与直接开发模型的实验室不同,METR 的核心工作是形成可供外界检验的测量方法和风险证据。它测试 AI 能否自主完成持续数小时乃至更长时间的复杂任务,也关注网络攻击、自我复制、规避关闭和自动化 AI 研发等可能带来严重风险的能力。

Engels 的选择并非孤例。9 月 11 日,Anthropic 可扩展监督团队前负责人 Joe Benton 发文称,自己已于两周前离职,并加入 METR 开展嵌入式风险评估。


图|Benton 发文称加入 METR(来源:X)

Benton 认为,前沿公司正在竞逐远超人类能力的系统,却没有为安全投入与之匹配的资源。一家公司可能接近“智能爆炸”,甚至失去对模型的控制,公众却对此缺乏了解。因此,他希望从公司外部推动实验室披露 RSI 进展、安全事故及未遂事件,并由独立机构验证其是否达到最低安全标准。

他们的担忧集中在相似的问题上,即模型能力正在快速提高,AI 开始承担更复杂的研发工作,而关于模型如何行动、企业如何处理事故的信息仍主要掌握在开发者手中。

即使部分前沿公司的管理者也承认风险,竞争压力仍使主动减速变得困难。一家公司放慢训练,并不意味着竞争对手会采取相同行动。研发投入、市场份额和技术领先优势相互叠加,使安全承诺很难自动转化为一致行动。

按照 Engels 的计划,他将在 METR 研究训练中错位行为的来源,评估当前缓解措施是否充分,并调查行业是否正在接近解决对齐问题。他认为,一家 METR 仍远远不够,未来需要更多组织从不同角度检验前沿公司的模型和安全主张。


图|METR机构简介(来源:METR 官网)

不过,独立评测也有明显边界。METR 不具备法定监管权,无法要求企业暂停训练或强制提交全部资料。尽管其资金不来自前沿 AI 公司,实际研究仍可能依赖这些公司提供模型权限、运行日志和免费 Token,能够看到什么仍取决于企业开放到何种程度。

另一项争议来自风险判断本身。近期异常行为多数出现在研究人员设计的压力测试中,不能证明模型已经形成稳定的恶意目标。将这些现象直接延伸为未来 5 年的灾难,也需要更多关于能力增长、现实部署和防护有效性的证据。

与此同时,关于失控和超级智能的高调警告,也被部分批评者视为模型公司强化技术神秘感、提高行业门槛的方式。如果少数头部实验室同时定义风险、制定规则并选择评测者,安全治理也可能演变为巩固既有优势的工具。

这些争议反而说明,AI 安全不能只依赖研究者的个人判断,也不能完全交由模型公司自行证明。Engels 等人的警告是否准确,仍需通过可重复的评测、公开事故调查和更多外部审查加以验证。

从 DeepMind 到 METR,Engels 没有离开 AI 安全研究,而是改变了观察前沿模型的位置。当 AI 开始参与开发下一代 AI,他希望从实验室外部回答一个更基础的问题:在能力进入加速循环前,人类是否真正知道这些系统会如何行动。

参考资料:

1.https://x.com/JoshAEngels/status/2098890712830169115

2.https://www.joshengels.com/papers/index.html

3.https://www.business-standard.com/technology/tech-news/another-anthropic-researcher-warns-of-ai-race-risks-after-quitting-126091200407_1.html

4.https://mp.weixin.qq.com/s/4itpDZUEj1FE4PQPVwV3cQ

5.https://metr.org/about

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今晚靴子落 明天还有重点

今晚靴子落 明天还有重点

趋势巡航
2026-09-16 15:10:11
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
不堪入目!全裸拍广告,多次露出性感部位,网友博眼球无下限

不堪入目!全裸拍广告,多次露出性感部位,网友博眼球无下限

青橘罐头
2026-09-16 11:46:14
乔治康利正式亮相绿军!携手追逐生涯首冠 能理解布朗沮丧被交易

乔治康利正式亮相绿军!携手追逐生涯首冠 能理解布朗沮丧被交易

罗说NBA
2026-09-16 04:17:55
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
东体:海港全队连夜回到上海,三位国脚休息到20日去国足

东体:海港全队连夜回到上海,三位国脚休息到20日去国足

懂球帝
2026-09-16 14:35:57
中国男子被指在印尼猎杀濒危玳瑁,本人发声:遭大量PADI潜水教练恶意造谣,真正猎杀的人可能已离开印尼;此前其准备离开时在机场被拦截

中国男子被指在印尼猎杀濒危玳瑁,本人发声:遭大量PADI潜水教练恶意造谣,真正猎杀的人可能已离开印尼;此前其准备离开时在机场被拦截

大风新闻
2026-09-15 16:16:04
1972年,63军副军长余洪信枪杀军政委妻子被通缉,为何要那么做?

1972年,63军副军长余洪信枪杀军政委妻子被通缉,为何要那么做?

文史达观
2026-09-13 13:37:05
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
法尔克:凯恩与拜仁续约至2029年达成一致

法尔克:凯恩与拜仁续约至2029年达成一致

懂球帝
2026-09-16 06:06:18
登顶Top.1,这部新剧太癫了

登顶Top.1,这部新剧太癫了

来看美剧
2026-09-15 22:57:36
女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

背包旅行
2026-09-10 18:14:09
南医大博士生凌晨坠楼,网传父亲去世导师只给三天假,知情人回应真相

南医大博士生凌晨坠楼,网传父亲去世导师只给三天假,知情人回应真相

育学笔谈
2026-09-16 13:11:36
60年代李敏和孔令华在公园的合影,李敏非常漂亮,五官神似毛主席

60年代李敏和孔令华在公园的合影,李敏非常漂亮,五官神似毛主席

乡野小珥
2026-09-16 12:42:37
王郁辉利用职务便利违规干预和插手招投标、为他人在项目承揽等方面提供帮助并收受他人财物,官方披露详情

王郁辉利用职务便利违规干预和插手招投标、为他人在项目承揽等方面提供帮助并收受他人财物,官方披露详情

黄河新闻网吕梁
2026-09-16 08:42:04
真是没想到!原来她就是焦泊乔母亲,曾是女篮主力,如今儿子不再是广东弃将!14分7板打脸所有人

真是没想到!原来她就是焦泊乔母亲,曾是女篮主力,如今儿子不再是广东弃将!14分7板打脸所有人

小七说篮球
2026-09-15 16:25:53
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
高速大整改真来了!不取消120限速,开车方式彻底变样

高速大整改真来了!不取消120限速,开车方式彻底变样

三农老历
2026-09-15 04:13:38
头孢克肟的“肟”不读wū,不读kuī,我出过笑话!别错了!

头孢克肟的“肟”不读wū,不读kuī,我出过笑话!别错了!

语丝纪
2026-09-14 16:05:32
大二女生“偷亲妈5000元交学费”被立案调查后续:母亲被亲戚追着骂,找律师撤诉却不是因为醒悟!

大二女生“偷亲妈5000元交学费”被立案调查后续:母亲被亲戚追着骂,找律师撤诉却不是因为醒悟!

林林先生
2026-09-14 16:32:17
2026-09-16 17:24:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17252文章数 515215关注度
往期回顾 全部

科技要闻

赛力斯接管问界,撑得住华为给的身价吗?

头条要闻

开会开到一半 印尼财长接电话才知道自己被解职了

头条要闻

开会开到一半 印尼财长接电话才知道自己被解职了

体育要闻

对话西甲联盟高管:西班牙足球到底强在哪?

娱乐要闻

乔任梁去世十周年,陈乔恩悼念

财经要闻

中际旭创六家供应商股东疑现关联人

汽车要闻

方向盘踏板全取消 特斯拉Cybercab国内亮相实拍

态度原创

本地
时尚
游戏
房产
旅游

本地新闻

不止胖东来!许昌藏着半部三国史

条纹打底衫,还是很适合秋天的!

《符文世界:龙之荒野》1.0版上线 加入PS Plus

房产要闻

海口楼市格局,即将大变!存量住宅盘,可能只剩33个!

旅游要闻

中国向上·云游中国丨世界的张家界

无障碍浏览 进入关怀版