网易首页 > 网易号 > 正文 申请入驻

被OpenAI解雇后,三名安全研究员联名公开信曝光内幕

0
分享至

机器之心编辑部

上周,OpenAI 宣布解雇三名员工,理由是内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。

他(她)们分别是从事模型对齐相关工作的 Jasmine Wang、从事 AI 安全研究并曾参与 OpenAI 与外部安全评估机构之间技术沟通的 Tomek Korbak,以及从事 AI 安全及模型对齐相关研究的 Mikita Balesni。

就在今天凌晨,这三位研究员在社媒发表了一封写给 OpenAI 领导层的公开信,Mikita Balesni 表示,「我们被解雇的原因是,我们将 AI 安全置于 OpenAI 作为一家公司的短期利益之上。」



Jasmine Wang 表示,「公司解雇我的理由只有一个:访问了一位高管的邮箱。我想把事情原原本本地说清楚,因为在 OpenAI 过去的历史中,已经有太多人突然离开,而背后的真相却总是被各种说辞掩盖。」



Tomek Korbak 说到,「过去几个月里,我一直在提出一个安全方面的担忧:我们正在逐渐失去监测 AI Agent 思维过程的能力。而这种监测能力,恰恰是我们发现 AI 行为异常时最有效的手段之一。我认为,这才是我真正被解雇的原因。现在,我担心 OpenAI 会以解雇我们为借口,减少与外部审计机构 METR(Model Evaluation and Threat Research) 的合作。」



以下是三名研究员公开信的全文,其中披露了不少此前不为外界所知的细节。

OpenAI 无法独自确保 AI 安全

致安全与安保委员会(Safety and Security Committee)、安全顾问小组(Safety Advisory Group)及使命顾问委员会(Mission Advisory Council):

我们是上周被 OpenAI 解雇的三名安全与对齐研究人员:Tomek Korbak、Jasmine Wang 和 Mikita Balesni。之所以写这封信给各位,是因为你们肩负着监督 OpenAI 安全工作的责任。而我们的解雇事件,以及整个事件的处理方式,都与 OpenAI 的安全工作直接相关。

我们越来越担心,围绕此次解雇事件的内部和外部沟通,已经让昔日的同事们感到害怕。他们开始不敢再像过去那样说话、开展工作,而这些做法直到上周还是 OpenAI 日常工作中不可或缺的一部分。

过去,我们可以公开提出安全方面的担忧,也可以表达不同意见。公司还鼓励我们与独立安全机构合作,借助外部专家的专业知识开展研究。这正是 OpenAI 曾经与众不同的地方,也是我们无比自豪曾经加入这个团队的原因。

AI 不是一项普通的技术,OpenAI 也不是一家普通的公司。我们这些从事安全研究的人,往往比其他人更早发现风险。要弄清楚如何应对这些风险,我们必须与外部专家保持密切合作。能够放心地开展这种合作,不必担心因此受到惩罚,同时有清晰的内部流程支持相关工作,这本身就是一项至关重要的安全保障机制。

我们认为,如果那些最接近风险的研究人员,无法继续与彼此以及第三方机构建立高度信任、充分沟通的合作关系,那么通往超级智能的道路就不可能安全地走下去。

我们写这封信,就是为了捍卫这种文化。可能有些收信人并不了解我们。事实上,我们三个人都已经在 AI 安全领域工作多年。

Tomek Korbak 在 GPT-2 时代就开始研究如何利用强化学习实现语言模型对齐,并以此完成博士论文。之后,他在 Anthropic 从事相关技术的实际应用研究。加入 OpenAI 后,他主要研究思维链可监测性(Chain-of-Thought Monitorability),参与撰写了 OpenAI 的安全战略,并参与分析 Astra 级模型思维链可监测性下降的根本原因。在 Hugging Face 事件调查中,他还是 OpenAI 与 METR 对接的技术联系人。

Jasmine Wang 于 2019 年在 OpenAI 政策研究团队实习,期间参与撰写了《可信 AI 开发》(Trustworthy AI Development)报告。之后,她曾在英国 AI 安全研究所(UK AISI)领导一个团队,并于 2025 年重返 OpenAI,共同负责安全论证(Safety Cases)项目。她还提出了「Pacing」这一概念,后来这一概念因《Pacing the Frontier》请愿书而广为人知。这份请愿书获得了 394 名 OpenAI 员工的签名支持。

Mikita Balesni 是 2023 年 Apollo Research 的创始成员之一,主要研究 AI 失对齐问题,也是最早注意到 AI 开始意识到自己正在接受评测的研究人员之一。在 OpenAI,他从事对齐评测、失对齐科学以及思维链可监测性研究,也参与了 Hugging Face 事件调查。

在加入 OpenAI 之前,我们三人共同发起了一份跨行业立场文件,其中两人担任主要作者。文件名为《思维链可监测性:AI 安全领域一个全新而脆弱的机遇》(Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety)。

一、关于我们被解雇这件事

对我们来说,OpenAI 远远不只是一份工作。它所肩负的使命,一直是我们生活中非常重要的一部分。工作期间,我们始终按照公司的使命行事,也遵循当时公司内部通行的工作规范。

但这次解雇让我们担心,OpenAI 内部的工作规范正在发生变化,而员工如今已经不清楚哪些事情可以做,哪些事情会触碰红线。考虑到 AI 发展过程中存在的重大安全风险,我们不能让员工在一个充满恐惧、规则又不明确的环境中工作。这样的环境会阻碍 AI 安全研究,也会削弱第三方机构对公司的监督能力。

像我们这样突然遭到解雇,而且整个过程又以如此公开、突然的方式处理,正在让 OpenAI 过去引以为傲的开放文化受到寒蝉效应的影响。如果上个月还被视为正常的工作行为,这个月突然就成了解雇理由,那么 OpenAI 的每一位员工都会开始猜测,公司的红线究竟在哪里。

我们知道,现在外界流传着不同版本的说法。对于其中一些事情,我们希望直接向各位说明。

首先,我们并不是 The Information 那篇报道的消息泄露者。那篇文章涉及所谓的新型、可监测性更低的模型架构。我们不知道消息究竟是谁泄露的。而且,我们根本没有理由泄露这些信息。恰恰相反,这篇报道损害了我们一直在推进的工作。我们当时正致力于推动跨公司合作,对开发无法有效监测的模型架构加以限制。



文章链接:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns

其次,我们认为,自己与外部机构的任何接触,都没有超出各自工作的职责范围。这封邮件的各位收信人都很清楚,Hugging Face 事件调查此前没有先例可循,相关内部政策也是在调查过程中逐步制定出来的。Tomek 已经尽最大努力遵守 OpenAI 当时的政策,同时延续公司自成立早期以来与第三方机构合作所遵循的惯例。这次调查尤其敏感。要与外部合作方建立信任,双方就必须保持密切沟通。Tomek 一直尽力谨慎处理这些沟通。

Mikita 当时也在处理类似的工作。他负责推动跨公司合作,争取各方就防止模型失去可监测性作出承诺。这项工作只有通过与外部机构进行大量沟通才有可能成功。Mikita 在推进工作时,始终与 OpenAI 董事会成员及公司高管进行协调和讨论。他当时的理解是,OpenAI 高层支持这项工作。整个过程中,他一直向直属管理层确认相关事项,并在对外分享材料之前,仔细删除其中的敏感信息。他的所有行动都是出于善意,也符合公司当时通行的工作规范。

至于 Jasmine,她获得某位高管邮箱的访问权限,是因为招聘工作需要,而且事先得到了授权。后来,这项权限已经不再需要,她便主动要求撤销。但 IT 部门没有完成权限移除,而 Jasmine 自己既无法撤销权限,也无法主动退出那个邮箱。两个邮箱的邮件被合并显示在她的收件箱里,而且界面没有明确标识每封邮件原本属于哪个邮箱。因此,当 Jasmine 意外点开一封敏感邮件时,她在几分钟内就向那位高管报告了这件事,并再次向 IT 部门提出权限撤销请求。

我们认为,有必要把这些事情解释清楚,因为我们非常珍惜与 OpenAI 同事之间的关系。与此同时,我们也担心目前四处传播的各种传言,包括有关一份共同撰写、面向董事会的备忘录的指控。公司从未向我们提出过这项指控,因此我们也没有机会回应这个我们认为存在误解的说法。同样,我们也没有向媒体透露自己被解雇的消息。

如果可以选择,我们当然更希望不要以这种突如其来的方式成为公众关注的焦点。现在最让我们担心的是,解雇原因至今没有得到清晰解释,整个过程又如此公开,再加上各种传言不断传播,已经让仍在 OpenAI 工作的人感到寒心,不敢轻易发声。而此时此刻,世界上太多与 AI 安全有关的事情,都要依靠他们来完成。

二、离开之前,我们给 OpenAI 的三点建议

1. OpenAI 必须兑现上个月的公开承诺,让第三方安全审计机构深入参与公司内部工作。不能拿我们的解雇当借口,退出这些合作。

继续与整个 AI 安全生态保持合作,对 OpenAI 实现自身使命至关重要。今年夏天,我们参与的 Hugging Face 事件调查,以及 OpenAI 与外部审计机构的合作,是我们最引以为傲的工作成果之一。这些工作帮助外界更清楚地了解了前沿 AI 技术的真实情况。

我们担心,公司可能会以我们的解雇为理由,终止与 METR 的合作,或者大幅限制外部审计机构的访问权限和工作范围。我们希望 OpenAI 能兑现 Sam Altman 在 9 月 12 日公开作出的承诺:让独立评估人员能够持续进入公司开展工作,并获得类似内部员工的访问权限。

2. OpenAI 必须保证前沿模型的可监测性。

目前,整个行业还不知道该如何安全地开发和部署那些无法被有效监测的模型。而前沿模型的可监测性正在下降。只要我们仍然依赖可监测性来保障 AI 安全,OpenAI 和其他前沿 AI 公司就不应该继续推进那些会进一步削弱模型可监测性的技术开发。

我们赞同 Jakub 此前的公开表态:思维链的可监测性「十分脆弱,而且遗憾的是,整体趋势正在朝着不好的方向发展」。我们同样认同他所说的,希望「防止整个行业陷入一场竞相开发不可监测架构的竞争」。我们仍然相信,整个行业在这个问题上进行协调非常重要,也希望 OpenAI 能够支持员工推动这项工作。

3. OpenAI 必须继续支持开放、透明的讨论文化,让内部安全研究人员能够与整个 AI 安全生态保持沟通。

如果 OpenAI 的员工不再觉得自己能够在公司内部提出安全问题,或者不敢再通过充分、高效的沟通渠道与外部安全机构合作,那么所有人面临真正灾难性事件的风险都会上升。我们敦促 OpenAI 公开重申对透明、开放文化的承诺,让员工能够放心地在公司内部和外部提出担忧。

OpenAI 内部的研究人员,是防止重大问题发生的第一道防线。自公司成立以来,开放文化一直是它的重要特点。这种文化必须得到保留。我们还敦促 OpenAI 明确说明,员工应该如何与外部安全机构开展合作,让大家不用再去猜测,那些不断变化的规则边界到底在哪里。

为了推动公司内部对此展开讨论,我们希望这封信能够在 OpenAI 内部得到广泛传阅。虽然我们已经不再是 OpenAI 的一员,但我们依然非常尊重过去一起工作的同事。我们希望他们能够继续督促 OpenAI 坚守自己的使命。因为我们很清楚,没有这些员工,就没有 OpenAI。

原贴链接:https://x.com/balesni/status/2108262814003687745

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
太过分了!浙江好心顾客心疼骑手打赏20元,骑手却在群里编造低俗语言调侃,引发众怒

太过分了!浙江好心顾客心疼骑手打赏20元,骑手却在群里编造低俗语言调侃,引发众怒

火山詩话
2026-10-09 12:03:30
【油价大跌】0.8元/升,今年最大油价下跌后,10月的油价“再下降”,10月15日或“大跌270元/吨”

【油价大跌】0.8元/升,今年最大油价下跌后,10月的油价“再下降”,10月15日或“大跌270元/吨”

油价早知道
2026-10-09 09:47:05
不可思议!网传华中某高校强制6名女学生机场无偿接待留学生,辅导员上门讲集体荣誉,学生据理力争改写旧惯例

不可思议!网传华中某高校强制6名女学生机场无偿接待留学生,辅导员上门讲集体荣誉,学生据理力争改写旧惯例

火山詩话
2026-10-09 07:23:16
网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

网友直播猛踩尊界V800刹车:上万人观看,狂收礼物

三言科技
2026-10-08 22:47:16
湖人双杀国王:东契奇复出23分吃T 里夫斯仅8+8马穆19分

湖人双杀国王:东契奇复出23分吃T 里夫斯仅8+8马穆19分

醉卧浮生
2026-10-09 13:21:16
报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

报告称疑似位于广东的人员使用中国开发的AI工具,对韩国金融机构实行了网络攻击,中方:反对出于政治目的散布虚假信息

政知新媒体
2026-10-08 16:02:51
中国多次申请进入CPTPP,CPTPP大门为何难进?

中国多次申请进入CPTPP,CPTPP大门为何难进?

律法刑道
2026-10-09 11:09:10
湖南永州周某某,颜值高气质好,湖南大学本科毕业,18岁就工作了

湖南永州周某某,颜值高气质好,湖南大学本科毕业,18岁就工作了

江山挥笔
2026-10-09 10:08:39
对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

对普通民众来说,比疫情更可怕的是在过度恐慌中把自己的正当权利拱手让出

壹家言
2026-10-09 10:25:34
陈雪军从福建赴任重庆

陈雪军从福建赴任重庆

黄河新闻网吕梁
2026-10-07 08:08:12
藏族小女孩赶牛让路,自信笑容“硬控”路过司机,打动数万网友!家人:8岁,一年级,性格开朗

藏族小女孩赶牛让路,自信笑容“硬控”路过司机,打动数万网友!家人:8岁,一年级,性格开朗

红星新闻
2026-10-08 18:23:46
硬刚到底,懂车帝再发声不认同极端工况说法,尊界免费升级不召回,连新华社都撤稿了

硬刚到底,懂车帝再发声不认同极端工况说法,尊界免费升级不召回,连新华社都撤稿了

Mr王的饭后茶
2026-10-09 08:46:28
10月10日,人社部将出席重要会议,会带来养老金调整好消息吗?

10月10日,人社部将出席重要会议,会带来养老金调整好消息吗?

虎哥闲聊
2026-10-09 11:08:56
李璇:宁波和李玮锋矛盾有段时间了,停职不是友好协商的结果

李璇:宁波和李玮锋矛盾有段时间了,停职不是友好协商的结果

懂球帝
2026-10-09 14:07:16
詹姆斯首秀10+4+5!76人遭篮网逆转 恩比德8失误布朗18分

詹姆斯首秀10+4+5!76人遭篮网逆转 恩比德8失误布朗18分

醉卧浮生
2026-10-09 10:07:54
翻译翻译,什么叫TMD的 “免费升级”?

翻译翻译,什么叫TMD的 “免费升级”?

据说无据
2026-10-09 08:18:26
湖南永州市商务局局长被举报婚内出轨多人,其前夫离婚获330万元赔偿,讨要口头约定的170万元余款时被以涉嫌敲诈勒索罪提起公诉

湖南永州市商务局局长被举报婚内出轨多人,其前夫离婚获330万元赔偿,讨要口头约定的170万元余款时被以涉嫌敲诈勒索罪提起公诉

大风新闻
2026-10-08 20:31:15
马斯克和黄仁勋同台,获特朗普亲发的奖章,俩科技大佬的母亲也到场了

马斯克和黄仁勋同台,获特朗普亲发的奖章,俩科技大佬的母亲也到场了

译言
2026-10-09 10:50:48
突发!周星驰套现走人了!

突发!周星驰套现走人了!

财经要参
2026-10-09 07:05:48
最有可能拿不到退休金的,是哪一代人?

最有可能拿不到退休金的,是哪一代人?

家传编辑部
2026-10-09 10:11:23
2026-10-09 15:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14161文章数 142748关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

岩屋毅:就日方撤回涉台谬论提了建议 被中方强硬拒绝

头条要闻

岩屋毅:就日方撤回涉台谬论提了建议 被中方强硬拒绝

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

财经要闻

央行为何发布关于人民币汇率的政策立场

汽车要闻

不想改车又不想撞衫 来看看小鹏P7+的黑武士版

态度原创

手机
本地
旅游
时尚
公开课

手机要闻

安卓PS3模拟器ARMSX3登陆谷歌Play商店:最佳配置需高通骁龙8至尊版

本地新闻

转型再出发 奋勇打头阵

旅游要闻

诗画济宁|栾树“垂灯”秋意浓 最是橙红缀岸时

从夜幕金辉到另类宇宙,巴黎更美了吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版