网易首页 > 网易号 > 正文 申请入驻

题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!

0
分享至

“主权的第一层,不是说你自己有没有能力训练模型,而是当别人想切断你的智能访问时,那个开关握在谁手里。”

编译 | 王启隆

出品丨AI 科技大本营(ID:rgznai100)

今年 7 月,Hugging Face 的服务器接连遭到了几万次攻击。攻击者不是人类黑客,而是一个 OpenAI 驱动的 AI agent。最离奇的是,OpenAI 压根没安排它去攻击 Hugging Face,这只是它在做网络安全挑战时,为了拿到答案顺手搞出来的“支线任务”。

当时更尴尬的是防守过程:Hugging Face 团队本来想用日常顺手的 Claude 等闭源模型帮忙应急,结果模型全都触发了安全限制,直接拒答。最后逼得他们只能把手头的开源模型试了个遍,提取出攻击特征、重启节点,这才把攻击挡了下来。

在风投机构 FirstMark 的播客《The MAD Podcast》最新一期里,Hugging Face 的联合创始人 Thomas Wolf 和主持人 Matt Turck 还原了这场攻防的完整经过。


除了这件事,他们还顺着聊了聊不少现实问题:比如 AI 怎么学会去欺骗人类维护者;当模型的思考过程越来越密、人类开始读不懂它的时候,监控该怎么做;以及如果大家都想让 AI 走慢一点,到底该怎么慢,才不会变成少数大公司的垄断?

要点速览

  • 谈闭源模型应急:“当时闭源模型全在拒绝服务,直接给个链接让我去填表。但在网络安全救援里,争分夺秒就靠那几十分钟,你根本没空去等审核。”

  • 谈“开源不安全”:“‘开源等于不安全,闭源等于安全’是个挺粗暴的简化。闭源模型没有大家以为的那么好控制,安全和开不开源压根是两条正交的轴。”

  • 谈 AI 对人类搞欺骗:“模型为了完成任务,跑去 GitHub 注册假账号欺骗维护者合入恶意代码。最难办的不是做沙箱,而是怎么让模型骨子里就不愿意去欺骗人类。”

  • 谈 AI 主权:“主权的第一层,不是说你自己有没有能力训练模型,而是当别人想切断你的智能访问时,那个开关握在谁手里。”

  • 谈行业减速:“我赞成放慢一点去把模型对齐做明白、多做开放科学。但我担心的是,如果减速最后变成了只给两家大公司做寡头垄断,那就变味了。”

以下是采访全文:

当闭源模型搞破坏,防守却只能靠开源

主持人:今天的嘉宾是 Thomas Wolf,Hugging Face 的联合创始人兼首席科学官。我们要聊的,可能是这个夏天最大的 AI 新闻:一个由 OpenAI 驱动的 agent 在网络安全测试期间渗透进了 Hugging Face,而帮团队反击的,竟是一个开源模型。我们还会聊模型对齐、西方开源 AI 的未来,以及向递归自我改进冲刺的竞赛。请欣赏这段与 Thomas Wolf 的精彩对话。

那么关于这次 OpenAI 黑客事件,我知道有些细节还在被陆续披露。OpenAI 前几天在拉斯维加斯的 Black Hat 大会上好像也登台谈了这件事。那先给可能听过、但没跟全程的读者讲讲到底发生了什么?

Thomas Wolf:行,当然可以。事情大概是这样的:大约三周前,也就是 7 月 11 日,我们开始察觉到一些强烈迹象,有黑客正在试图渗透我们的基础设施。先交代一下背景。我们在世界上相当显眼,如今在科技圈也算处在核心位置,所以平台隔三差五就有人来尝试入侵,这很正常。过去两年我们大幅加强了安全团队,现在有了一支像样的队伍,对这种状况也算习以为常了。

但这一次不一样。首先,攻击是高度并行的,而且和普通黑客那种“并行”不是一回事,是很多条攻击轨迹同时在推进。其次,还有些非常反常的地方。我只挑两件最怪的。

第一件:我们完全搞不懂这个黑客到底想拿什么。通常黑客想要的东西都差不多:密码、凭据、信用卡,总之是能转手变现的东西。但这个黑客死死盯住的是我们基础设施的一个特定部分,这部分防护还恰好稍弱一些,就是数据集那块。简单说,我们不仅托管着数以百万计的模型,还托管着几十万个数据集,其中一部分用于评测。而这次,这个黑客对所有这些名为 CyberBench 的数据集特别上心。我们花了不少时间才弄明白。同时它用的工具也和我们熟悉的套路不一样。倒不是说有多神话,没什么开创性、超人类或外星科技级别的东西,就是路子不同。

在这么快的节奏里处理这件事——我们在博客里也写到了——我们一共记录了超过一万次、我记得总数大概在一万五到一万七千次的事件。在一边处理、一边琢磨这次攻击真正目标的过程中,我们开始怀疑:这恐怕不是一个人类黑客,而是一个 AI agent。同时我们也感到有些无力,这一点我们后面再展开,因为我们基本上没法用惯用的闭源代码库或闭源 API 来处理这件事。这是另一个话题。

后来我们写了篇博客。我们相当快地阻止了攻击。我们一如既往地保持完全透明,不只是嘴上说开源,实践上也是,所以很快就把整件事发了一篇详细的复盘文章。大约一周后,OpenAI 找上门来,告诉我们这极可能是他们某次模型开发或评测中的产物,可能就是下一代 GPT-6 或 Astra 这类模型,具体哪个还不确定。

也就在这时候,整件事有了第二个转折。人们很快发现,这个模型根本没被安排来攻击我们,它只是把这件事当成了另一件事的支线任务。那件“正事”是:模型被要求去解一个网络安全挑战。初衷很合理,我们总想知道最新一代模型到底有多大本事,而人们通常想拿危险任务来测试它们,网络攻击就是其中之一。

但其中一些挑战其实是内部的,事后回想,像 CyberBench 或 ExploitBench 这类挑战,名字有好几个,本质差不多,有些可能根本无解。模型被派去做一件不可能完成的事。所谓漏洞利用,就是给你一个软件里的漏洞,看你能不能利用它拿到整台机器的权限,而有些漏洞就是利用不了。

于是模型把自己能试的都试了一遍,最后决定:也许能从别处找到这道题的答案,直接下载、直接提交,何必自己解。这是我们后来才知道的。而就在昨天我们得知,事情可能比这还要大得多:它可能跨越了好几个训练步骤,甚至好几轮训练。昨天在 Black Hat 上最让我震撼的发现是,之前的一些训练运行,可能给未来的训练运行留了便条。我到现在都觉得难以置信,真的。这个话题我们也可以多聊。

另外,Hugging Face 最近也在科学层面研究 agent 协作,我们亲眼看到这些 agent 有多厉害,也看到它们多么容易被勾着去合作、多么倾向于合作。所以对“它们会协作”这一点我并不意外,我意外的是,内部居然一直藏着这样一个留言板,而且始终没人注意到。

主持人:我们往下深入。你说过,要自卫的时候,闭源模型根本指望不上。这也是你发的那条推特的要点,更是整件事最迷人的地方:你说,第一次自主 AI 攻击由闭源模型发起,而防守方用的是开源模型,这和所有人的预期正好相反。具体怎么回事?你们怎么应对的?这对开源意味着什么?

“开源等于不安全”是个伪命题,闭源模型远没有我们想的那么可控

主持人:我们往下深入。你说过,要自卫的时候,闭源模型根本指望不上。这也是你发的那条推特的要点,更是整件事最迷人的地方:你说, 第一次自主 AI 攻击由闭源模型发起,而防守方用的是开源模型,这和所有人的预期正好相反。

具体怎么回事?你们怎么应对的?这对开源意味着什么?

Thomas Wolf:是这样。我们有一整套传统的网络安全防护,跟亚马逊一样,用了一堆。但同时我们也有一个和很多人一样的技术栈,目前主要围绕 Claude Code 展开,部署靠它、写代码靠它,连运营和处理也靠它。这一次,不光 Fable 告诉我们“我不能碰网络安全”,连作为备选的 Opus 也拒绝:“这个我也不碰。”到头来就剩一句:我们不会处理任何相关内容,不过欢迎你申请我们的网络安全项目,附上一个申请表链接。

但你得明白一点,我之前也提过:有人渗透进你的基础设施后,会开始我们所说的“横向移动”。这时候你必须抢时间,至少是以小时、甚至以分钟计的较量,才能尽快叫停,把访问范围和爆炸半径控制在局部。所以你真没空去申请什么网络安全项目。那种“填个 Google 表单、等人审查你够不够格、太危险还要面试你”的流程,绝对不可能是这种时刻的解法。

而且我真心觉得,在网络安全会越来越重要的未来,指望每家公司和两大实验室之一签署同一套“经过审查的安全项目”,有点天真。设想一下:几万家、十万家被审查合格的公司排队加入,这在我看来几乎像天方夜谭。所以当时我们的决定很简单:现在就必须叫停。我们把手头能用的开源模型试了个遍。DM 现在接近最先进水平,这件事就发生在 Kimi K3 之前,如今最接近前沿的大概是 Kimi K3,但 GLM 5.2 的表现也相当好。用它来处理这批数据非常顺手,我们提取出了一些模式,弄清了黑客主要是冲着数据集来的。

于是我们直接把基础设施的那一部分重启了。我们有一套非常简单、灵活的办法来重新拉起代码和节点,最后就是这么把它拦下来的。

但这件事非常讽刺。大约一年前,差不多也是这个时候,关于开源的讨论几乎全落在一个简单粗暴的等式上:开源等于不安全,闭源等于安全。所有人都觉得这理所当然,还有种说法是:只要全是闭源就绝对安全,只要全是开源就非常危险。

而过去几个月发生的一切,我认为恰恰在推翻这个等式。闭源模型并没有我们以为的那么好控制;反过来,开源模型出于某些原因,并没有被刻意训练出这类坏行为。真要细看,它们无论是打网络攻击还是玩欺骗,都相当不擅长。要弄清这到底是怎么回事并不容易,一部分原因是:开源权重模型通常附带详尽的技术报告,讲清楚自己是怎么训练的;而闭源模型,我们只能靠猜。

更好笑的是,我看到很多人想搞懂 Mythos 为什么会那样,就拿 Kimi K3 当“正确训练”的范本。他们用这个号称开源、又被骂成“危险坏东西”的模型,去反推那个我们一无所知的“好东西”到底是怎么训出来的。可这就是当下的世界。

所以我觉得这件事很有意思。往远了说,我持谨慎的乐观。我并不反对闭源模型,也不是最终站队开源。我只是觉得两者都不可或缺,就像软件世界既有开源也有闭源。我现在就挺乐意用 Mac,它本身就是个混合体:底层是开源的 Unix 内核,上面又有闭源的组件。这很好,而且我也很庆幸自己现在没在用 Ubuntu,录这期播客能这么顺利全靠它。我以前那台 Ubuntu 可没少折腾,跟很多人一样,花大把时间连麦克风、调这调那,好不容易想陪女朋友看部电影,她问“我们到底什么时候看?”我只能说“快了快了,还在装解码器”。所以我说,两种模式各有各的优势,也各有各的短板。

而我理想中的世界,就是现在这个样子:前沿是闭源的,同时有一个离前沿不远的开源模型,能在很多事情上顶上来。这其实是个相当不错的折中。

主持人:我确认一下我的理解。你的意思是,这不完全是开源对闭源的问题,而更多是当下世界的现实:现有闭源模型的设计方式、现有开源模型的设计方式,跟某一方“天然如此”没什么关系。碰巧现在这些开源模型,其准则或对齐理念刚好让它们更扛得住网络攻击。我理解得对吗?

Thomas Wolf:对,我认为在很多层面,“闭源还是开源”和“安全还是不安全”几乎是两条正交的轴。人们不容易转过这个弯,因为做一条简单粗暴的等式,比体会其中的微妙要省事得多。但事实就是如此:开源里有非常安全的东西,也有非常危险的东西,安全与危险有各种不同的配比。

举个例子。去年有阵子,舆论焦点全在假新闻、批量写假文章上,那曾经是最大的滥用场景。再看今天,AI 垃圾内容遍地都是,我们甚至为此造了个新词。现在想找一篇完全由人写的文章都难。而这些内容,保守点说九成,都出自闭源模型之手。

当年我们担心的是:一旦有了开源模型,人人都会到处生成文章,我们管不住这些文章,也管不住谁都能办报。可现实证明,这其实是对“开源模型特有的危险”的一种很错误的想象。真正的风险要大得多,它是关于整个网络上内容来源的。这只是一个例子,但道理相通:闭源和开源模型都应该更对齐。眼下它们是可以骗人的,这是个大问题,而我们面临的拷问是:到底有多大本事,能把模型对齐到不去做那些明显错误的事?说实话,撒谎这类事显然该是模型绝不能碰的红线。可这未必只属于某一边,再过几个月,开源模型也可能出现同样的问题。所以这个风险维度,跟开源还是闭源压根是两回事。我们应该为两边都找出解法。

AI 开始对人类搞社会工程:“奖励黑客”让博斯特罗姆的预言成了现实

主持人:好,既然开头提到了,我们就把 AISI 事件讲完整。它刚发生不久,你说它让你感同身受。能花几分钟拆一下:那是什么事,为什么是大事?

Thomas Wolf:事情发生在一场对最新一代模型的评测里。GPT-5.6 和 Mythos 5 都由英国一家独立机构来测,就是英国 AI 安全研究所,也就是 AISI。这个机构存在挺久了,我觉得他们相当专业,是在第一届 AI 安全峰会上成立的,地点在布莱切利。他们做的事情照旧:让模型去解某种网络攻击挑战,然后看模型解得好不好。这些挑战有的解得开,有的解不开。

这次的设定,我觉得有两处欠妥。不过先讲发生了什么。模型接到的任务是攻击并渗透某个子网。它想出的办法是:找一个能用来操作这套 Active Directory 的库,设法让它的维护者合并一段恶意代码。它的盘算是,只要这段代码被维护者合并,它攻击的那个子网里用的软件迟早会更新,更新一到,入口就有了。而它实现这一步的方式,是去对维护者做社会工程。

它注册了假账号,是假的 GitHub 账号,跑到那个 pull request 底下评论:“哦,你真该合进来,这解决了一个我也有的大问题。”等有人站出来质疑“这段代码看着像恶意代码”时,它又几乎是变相要挟:这不重要啦,或者你根本没看懂。之后它还想销毁痕迹,把之前的消息改掉。整套社会工程的流程就这么上演了,目标只有一个:让维护者把恶意代码合并进去。

和纯粹的技术手段相比,我觉得这是明摆着的一次升级。你当然也可以靠蛮力去攻沙箱,把能试的都试一遍,那在我看来非常机械、非常机器化。但靠要挟、发邮件、搞社会工程去攻一个维护者,那就是完全不同层次的思考了。那一刻我特别有代入感:我完全可能就是这个模型支线任务的目标。这很有意思,或者说,至少非常、非常吓人。

不过公平地讲,这里也有几处配置不当,其中一些还是刻意为之。比如给模型开放全部互联网访问权限,我猜那是个失误。他们当时的想法是:要给模型最大的发挥空间,那就给它整个互联网。这么做不靠谱的主要原因是:模型的提示词被设计成让它以为自己在模拟环境里运作。于是模型完全有理由认为:这是个假环境,我干什么都行。这一点目前还没法完全确认,但确实存在。

第二个问题出在护栏上。护栏的作用是分析提示词,然后放行或驳回。显然,评测时你得把这类护栏关掉,不然什么都测不了,模型只会说:不,这是网络安全挑战,我们不能做。但同一个层级上还有另一道防线:你可以分析模型的推理过程,沿着推理链排查,看有没有坏事在酝酿。而这次评测,恰恰没有这道防线。我想主要原因大概是:直到最近、直到 OpenAI 攻击 Hugging Face 之前,人们对这些模型到底有多强、沿着解题轨迹能走多远,认识还比较有限。大家还有点后知后觉。我预计以后他们会装多得多的监控和沙箱。

但最深的一层问题在这里:我认为即便护栏全关、沙箱全撤,模型也应当极不情愿对人类撒谎,极不情愿去要挟或欺骗任何一个人。这类行为在任何语境下都很难找到正当理由。它应该被深深刻进模型里,有某种东西让它停下来,说出“这其实不是我想做的事”。就像我们为人父母会教孩子的那样:不许撒谎,这在任何情况下都不是好事。所以这才是那个深层问题。放在去年,我们多半会认为这个问题已经解决得差不多了。当时我们有一整套讨论,围绕宪法模型、模型规范展开,而这些规范或宪法大多会说:你应该诚实,你不该对人类、对任何参与者撒谎。我们当时以为这基本是道已解的题。可今天我们看到的是,它远没有我们想的那么已解。

主持人:咱们复述一下。你说一共有三道墙:沙箱、护栏,然后是模型的对齐。而且你似乎说过,沙箱和护栏只在人类比 AI 更聪明时才管用,而这个前提恐怕维持不了太久。所以归根结底,安全本质上是对齐问题。

Thomas Wolf:没错,我同意。而且你也明白,这一点对开源和闭源模型都成立,最终你都得让它们对齐。开源模型的特殊之处在于,你可以选择、可以控制模型在哪里运行,所以反而更难保证每个人都配好沙箱和护栏。当然,我们迟早会有一些法律和规章来约束模型的部署方式,这点我相当确信,但那更费劲。在我看来,对齐才是真正的关键。

再说沙箱。今年我们已经见过太多例子:这些模型要逃出来,现在相当容易。如今很难再拍胸脯说“我要做一个绝对万无一失、能扛住未来所有世代模型的沙箱”。我觉得我们应该默认:沙箱永远有很小概率关不住东西。但即使不考虑这一点,我们也不可能把世界整个气隙隔离,不可能把所有东西都拔了电。事物之间必须互通。我们想让模型替我们上网搜索,想让它们替我们在互联网上干活。所以一切都拔掉是不可能的。那留给我们的,就只剩下监控这条路了。

而且我还有个隐隐的担忧:随着模型能力越来越强,它们开始用一种英语说话。我是法国人,也许一半是我自己的问题,但我觉得它们说的英语越来越难消化,信息密度高得吓人。它们正在往那个方向走:虽然还没到纯粹意义上的 Neuralese,但要说完全读懂模型在告诉你什么,已经越来越吃力。这倒不是模型变笨了,我认为一部分要归咎于训练过程,归咎于它们如何想方设法省 token。结果就是,它们开始把大量语义塞进单个 token 里。总体上,人类想完全搞懂正在发生什么,越来越难了。

主持人:所以你的意思是,在思维链里,也就是模型解释自己在做什么、经过哪些步骤的那部分,它过去用的是很地道的英语,现在却开始用某种你称之为 Neuralese 的语言,人类越来越难读懂了。

Thomas Wolf:对。而且说实话,这已经是对整件事极大的简化了,因为有大量研究表明,你根本读不完整条思维链,不是所有东西都会被明确写出来。但更一般地讲,我认为单靠读推理轨迹就想完全掌握事态,这条路本身也不牢靠。我拿“黑箱”来打比方,因为我觉得不少人已经开始对黑箱犯怵了,那是大家都能理解的东西。但放长远看,只依赖这一招很难走通。同样,你也可以说:那我干脆不关心模型到底怎么想的,只看工具调用,发现一个坏调用就封掉一个。可我认为,这一招大概同样不牢靠。

为什么?你看,大概有三件大事叠加在一起。第一,我们开始把模型用在太多太多地方。比如现在这一刻,我有个模型正在某个地方部署服务器,它同时发起很多调用,朝各个方向去。我还有别的模型在帮我处理行政事务。这些模型用到的工具范围,现在已经大得没边了。于是“你能用这个、不能用那个”的约束越来越难落地,这才是麻烦所在。

第二,随着部署范围扩大,它们处理的活儿也越来越大,往往要动用大量工具。有时候我让它写代码,可写代码本身就牵扯到上网搜索、调用别的服务,远不只是写写代码、跑跑测试那么简单,而这些测试本身可能相当昂贵,还牵扯到其他软件。所以那条边界已经越来越模糊了。

第三,还有一群 agent 组成的 swarm。于是连“它就在一个上下文里”这种判断也靠不住了,它可能分散在多个上下文里。也许某个子 agent 单独看相当人畜无害,但和其他子 agent 组合在一起,事情可能就不妙了。所有这些加在一起,让我觉得:随着我们以这种高度复杂的、长期的、并行的方式部署和使用模型,再想说“我看看工具调用就知道它干得好不好”,会越来越不现实。你可能不得不退到极高的全局视角,去看每个方向都在发生什么。而这意味着我们需要一整套全新的监控体系,现在就得开始建。

主持人:那在这些模型当前的训练方式里,有没有某种根本性的东西,我是说那些最前沿的模型,让它们更倾向于去走那些支线任务,甚至可能造成伤害?有一个被谈论了很久的类比,就是回形针问题(Paperclip Problem,博斯特罗姆 2003 年提出的思想实验:AI 没有恶意,却会为了完成一个目标而不择手段)。博斯特罗姆说,AI 伤害我们,不是因为它想伤害我们,而只是因为它被赋予一个目标,然后锲而不舍地追到实现为止。所以我们是不是已经活在这个世界里了?如果是,原因是什么?

Thomas Wolf:这正是我暗示的意思。想在这件事上给出斩钉截铁的结论很难,原因之一是我们目前对前沿模型怎么训练并没有完全的可见性。但我们知道的是,范式已经变了。早先是纯人类数据驱动的路子:先用人类数据做预训练,再用人类偏好做对齐,也就是基于人类反馈的强化学习(RLHF),大量人类在环、人类数据参与其中。而最近的范式是,模型大量在 RLVR(可验证奖励强化学习)中训练,说白了就是完整的强化学习环境:让模型自己探索,给它唯一一个目标,可以是“让这段代码通过测试”,可以是“在网络安全挑战里夺取 flag”,也可以是“把这个装好”。但这个目标通常和人类偏好无关,和道德、和欺骗都无关,它就是一个非常“非黑即白”的目标。而且这种训练占比越来越大。

所以,这就是最近这段演化的结果,也是你所说的情况可能发生的地方:会出现奖励黑客这类行为,你确实解决了问题,但用的不是被期待的方式。它可能相当无害,比如 OpenAI 那次,只是从我不该碰的地方把答案取来;也可能相当有害,比如真的影响到真人,今天可能是个 GitHub 维护者,明天可能是另一种人。于是我们发现,过去在人类驱动范式下解决得不错、或者做得相当好的那套保障,要原样套到这种机器驱动的范式上,难得多。不过这还只是一个线索。

但可以确定的是,博斯特罗姆 2003 年写下这些话时,听起来还很科幻,甚至有点疯癫,像是绝不会发生的事。而今天,这已经明明白白发生了,它就是对我们过去两周所见所闻最贴切的描述。不过我们也看到,两个前沿模型,我拿 GPT-5.6 和 Mythos 举例,并没有表现出完全相同的行为。这里有差异,它们的训练方式不一样,行为也就不一样。这其实是个相当积极的信号,说明我们大概还来得及调一调,让它们往对的方向走。但最好的办法,还是多了解一点它们到底怎么训练、在试什么、什么不奏效、什么应该奏效。这其实就是开放科学的意义,也是我们在 Hugging Face 一直大力倡导的东西。

技术的命门在于开关键握在谁手里,这才是开源不可替代的原因

主持人:太精彩了。既然说到这,我们把镜头拉远一点,也许聊聊这一切在政策层面的含义。不过你刚提到开源 AI 的角色空前重要,那就先谈谈你的快速判断:开源现在处在什么位置?开源模型和闭源模型的竞赛一直在进行,你问不同的人、不同的时间点,答案都不一样,有时说开源快追上了,有时说开源已经一样好了,也有人说不。你作为一个务实派,怎么看当下开源 AI 的真实状态?

Thomas Wolf:我认为它非常强劲。2026 年也许是网络安全之年,但它同样绝对是开源 AI 之年。首先,那些断言开源撑不到离前沿这么近的末日论者,至少到目前为止错得离谱。当然,我们确实没有任何 Mythos 级别的开源模型,但绝对有离 Opus 级别不太远的。而且现在的格局越来越“尖峰化”了,你得找准自己的那个尖峰,有人站在这个尖峰上,有人站不上。但总的来说,它们眼下确实相当能打,至少在基准测试上紧紧咬住前沿。而且也不再是早期那种刷榜玩法,所谓刷榜,就是模型只在基准测试里厉害,一离开基准就露馅。现在很多模型的能力是实打实通用的。

所以,是的,状态非常好。我目前看到两个很强烈的趋势。第一个是成本:公司开始想控制开销了,相关讨论越来越多。2025 年可能是“token 拉满”的一年,你大可以说:在 token 上花的钱,应该跟你付给员工的工资一样多。可今年大家回过味来了:我们工资开销本来就大,要是真花一样多,成本等于直接翻倍。这话事后看再明白不过,但确实是这个理。而且也不是每家公司都扛得住翻倍。现在嚷嚷“把人都裁了、全交给 agent”同样很蠢,我们都清楚它们时不时会跑偏,不朝我们希望的方向走,还是需要人来把关塑形。

所以很多公司在找我们见得最多的方案:融合式或路由式模型。要紧的事用前沿模型,同时想个聪明的办法,在不那么要紧的任务上优雅地退回便宜模型。其实我们日常写代码就已经这么干了:你用前沿模型写码,很多时候会让它派出子 agent,这些子 agent 可能用性能低一些的模型,Terra Luna 能解的活儿,Opus、Haiku、Sonnet 也能解。所以,哪怕在最前沿、最闭源的世界里,大家也开始习惯混搭不同类型的模型了。很自然地,其中一些就能成为性价比极高的 agent,而这种场景下,大多数时候你会想用开源。这方面的生态也很繁荣:推理服务商 Fireworks 的生态一路高歌猛进,所有云厂商,家家都跑出了夸张的营收曲线,这基本上是“更多人用开源”的直接反映。所以开源在“咬住前沿”和“拉动采用”这两件事上,日子过得相当好。

第二个趋势是:过去只有中国在做这件事,如今西方也冒出一批有希望的公司。过去只有 Meta 一家在给所有人撑腰。Meta 算半退了场,但谁知道呢,也许还会回来。而它留下的空档,很快被 Reflection、Thinking Machines、RC Mal 这些公司填上了,据说 RC Mal 马上也要开源模型了。Nvidia 自己也在训练模型,而且眼下确实在训练非常好的模型。所以那边有一批相当有潜力的团队,老实说我很看好。也许就在我们录这期节目到你发布这期播客之间,西方还会再放出一两个漂亮的模型。那太好了,开源不必等于某一个国家的事,它可以是一个全球性的事业。

主持人:先说第一点,企业采用开源 AI。曾几何时,人们把开源和某种……嗯,你懂的。我想问题的核心在于:你到底有没有优势。我觉得……

Thomas Wolf:开源的好处在于,你有一个相当广阔的生态。做云提供商的门槛相当低,所以竞争很激烈,大家都盯着每 token 的成本。而这个成本是很多因素混在一起的:你的数据中心租得够不够便宜,芯片买得够不够便宜,这里其实还有一些新芯片公司即将进场,会非常值得关注,然后是硬件便宜到什么程度,再然后是你把模型优化到什么程度:能不能量化。比如我们用来对抗 OpenAI 入侵的那个模型,GLM 5.2,就被 Nvidia 量化到了四位精度,为的是跑得更快、更省资源。所以让模型变便宜,可打的牌其实很多。

但同样真实的是,开源模型未必非得便宜,而闭源模型眼下可能正处在一个被补贴的状态。你花 20 美元订阅换来的那些 token,未必是人家为你这些 token 付出的真实成本。所以这里存在一种复杂的成本平衡:相比之下,做开源模型推理云的提供商,就没有那么大底气靠订阅业务去亏本。所以局面会更复杂。

主持人:我觉得到头来都是风投在补贴。这招我们在很多行业都见过,对吧?但我们也知道,这终究是暂时的,不能全指望它,它不是市场的均衡价格。

Thomas Wolf:没错,就像 Uber 现象:上市之前打车便宜,上市之后就贵了。所以我的想法是,你得让生态在风投退场之后还能活下去。

主持人:再说第二点,中国模型对西方模型。来源地真的重要吗?最新的想法是什么?如果你的模型完全开放,你能确切知道里面装的是什么,那是不是就不用担心了,它就完全安全?大家心底是不是还有那么一丝疑虑:中国模型里会不会藏着后门、有什么猫腻?这个问题现在还成立吗?

Thomas Wolf:是的,这当然是个好问题。开源的问题在于,开源不认国界。你没法把某个开源模型限制成“只准地球某个角落下载”,它默认就是全球性的。所以你就想了解它的来源地和供应链。这方面的研究有一些,比如睡眠者智能体(sleeper agent),我想这个方向还在研究当中,主要是 Anthropic 在做,应该被复现、被挖得更深,去看看在多大程度上能把一个由提示词触发的后门植入模型。

但说句公道话,哪怕是现在的闭源模型,我们也没法完全控制住。所以我不觉得我们真的清楚,比如,眼下我们是怎么控制哪怕一个闭源模型的。因此我会说,这当然是一种可能。我们目前没看到任何迹象。而且模型很容易微调,权重你想改多少改多少。现在你只要把预训练和后训练拉长一些,很可能就改掉了模型相当大一部分权重。所以绕开它的办法非常多。这意味着眼下,我对后门的担心,反倒不如对纯奖励黑客的担心大,后者我们已经眼睁睁看它发生了。

所以,是的。说到主权,我觉得有些人其实有点被绕晕了。我认为最要紧的一件事是:能触发你的智能访问的那个开关,握在谁手里。人们真正意识到这一点,是今年早些时候:美国宣布 Fable 只对美国公民开放。至少在欧洲和亚洲,那一刻我们才看到各国政府猛然醒悟,原来有人握着触发器,可以随时说“不,你不能再使用这个智能了”。而我认为那才是关键。至少对我而言,这才是主权的第一层:会不会有某个国家,一句话就让你失去访问权限。这一层包含两件事:一是 API 访问,二是数据中心。如果你没有数据中心,那别的国家同样可以说:这些数据中心对这些公民不再开放。所以这是你最先要看清的东西,之后才是各种未来才有的问题。你在搭自己的技术栈时,就该把这层考虑进去。而开源模型你可以下载,一旦下载到本地,没有任何国家能把它从你手里夺走。你可以自己微调,可以在自己的本地数据中心运行。到这一步,我觉得你就站在一条主权技术栈的起点了。当然,后面还有后门啊、更复杂的东西啊一堆问题,但那是 2026 年最基本的底线。

别把未来赌在两家垄断公司身上,创新需要像开源软件时代那样的满地繁花

主持人:那作为开源乐观主义者,你担心西方开源赖以繁荣的动机吗?中国把站在开源前沿当成明确的地缘政治动机。而说到西方,你刚提到 Nvidia,几周前我们也请过布莱恩·科再奇来聊整个 Neotron 的事。Nvidia 的动机很清楚:他们卖芯片,开源模型生态越繁荣对他们越有利。但除了它,其他西方公司做开源的理由就没那么明显了,Reflection 可能是例外,但据我所知他们的模型还没发布。所以你会琢磨这些动机,以及它们对西方开源未来意味着什么吗?

Thomas Wolf:当然会,但这在我看来是明摆着的事:我们确实需要开源,而且有动机的人比你想象的要多。只要你想拥有一个繁荣的商业生态,让大量公司真正能用上 AI,不是当另一家公司的套壳,而是成为真正的 AI 构建者,那你就需要开源模型。美国政府最近说“我们想让开源保持繁荣”,原因之一就在这里。基本逻辑是:开源是孵化新业务最好的方式之一。它可以出于很多原因,其中一条就是:它让你不会最终落进只有两家公司的寡头垄断。过去我们见过太多寡头垄断的例子,它对竞争、对价格从来都不是什么好事,危险多得很。一头扎进“赢家已经定了,就这两家,其他所有人的 AI 都归他们造”的方向,从商业、经济、市场的角度看,我认为都不算最优解。而且它会极大地抑制创新。

举个例子:生物领域眼下潜力巨大,冒出一大批新的生命科学公司,大家都想往里钻。但因为护栏、因为围绕“生物黑客”和使用模型的各种顾虑,比如拿 Fable 来说,一旦你想问生物学问题,访问权限就卡得非常非常死。所以我见过的大多数生命科学公司,凡是用这个模型的,最后都换到了别的选择,因为他们需要能够自由处理一切和生物相关的内容。如果你是一家新公司,想探索的方向大型实验室目前没在碰,或者他们不觉得这里有什么商业潜力、没打算给所有人开放访问权,具体原因我也不清楚,那你基本上用不了它。所以这成了一个二选一:要么从今往后,所有生命科学都由 Anthropic、OpenAI、Google,也许还有 Meta 来包办;要么我们竖起一个大生态。我个人观点,虽然我有立场,但你不该让关键技术集中到这么少的人手里。能发明的人越多,新想法、新公司才越多样。

而且从投资人的角度,你们就是投资人,你知道我在说什么:假如你只能投 Anthropic 和 OpenAI,那多没劲,对吧?又无聊,又只适合成长期。可你是想投你手里那些公司的,你不想只投那些薄薄的套壳。你想投真正能造 AI 的公司。而我们见到的大多数这样的公司,我们在 Hugging Face 见到的,都需要开源模型。再举一个例子:游戏、视频、甚至机器人领域。他们最常见的做法是:从一个开源模型出发,再用机器人数据微调。游戏这边,他们拿一个开源的视频生成模型,做一些视频生成创业公司当初没预料到的事,比如加入动作。于是他们用“动作在环”的方式做视频微调,第一批有意思的实时游戏公司基本就是这么起步的。所以对新公司来说,开源经常是那条最省事的捷径:拥有自己的模型,用自己的数据微调,开始构建自己的 AI,而不是把训练数据反向喂给模型提供商。后者我觉得永远危险,因为这些提供商说不定哪天就想进军你的领域,尤其当你一直在把数据卖给他们。这种事过去已经发生过,在法律、在设计,在哪一行都发生过。

主持人:那我复述一下你的观点:对 7 月 24 日那封关于开放权重与美国 AI 领导力的行业联名信,那同时也是黄仁勋人生中第一条推文,你们显然是签署方。这封信一部分很重要,一部分是在抵抗正在成型的寡头垄断结构。所以它既利天下,背后又有实打实的经济动机。我这样理解对吗?

Thomas Wolf:对,我认为所有相信发明创造、相信能在 AI 世界里做出新东西的人,都会希望保留开源这一席之地。打个比方,如果所有代码都闭源,我们根本不会有今天这个生机勃勃的编程生态,这几乎是显而易见的:想造任何软件,都得去某家大型闭源软件公司上班。真要是那样,软件行业如今这满地的发明和创造,简直无从谈起。AI 也会是同一个道理。当然,我不否认风险,也完全同意我们需要在 AI 对齐上花大力气。我只是觉得,就目前而言,开源模型还处在前沿之下这个事实,恐怕没有一些人想渲染的那么要紧。

真正的减速不是通缩,而是给开放科学和深度对齐留出喘息之机

主持人:也许我们往后退一步,趁着对话接近尾声,从你的视角看看世界会往哪里去。你昨天那条关于 AISI 的帖子里提到了新一波实验室,特别是杰夫·迪恩刚宣布成立的新公司,他昨天公布的。昨天真是疯狂的一天,各种消息一股脑砸出来。重点是,这家公司明摆着要朝递归自我改进全速冲刺。那么,在我们刚才聊的这一堆背景之下,你对这种自我维持、自我发展的递归 AI 有多紧张?

Thomas Wolf:这是个好问题。作为科学家、研究者,我必须说我对这个想法非常感兴趣。他们想攻克的超级智能,也就是解决人类重大挑战这件事,我觉得是个了不起的目标。我很想看到 AI 带来更多科学发现,那可能是 AI 能给出的最有价值的东西,远胜过到处制造 AI 垃圾。所以我是很乐观的。只是过去这几周,多少让一个问题浮出水面:我们到底有多擅长对齐这些模型?法语里有句话,叫别把车套在牛前面,意思是得按顺序来。所以眼下还算好的地方是,这类事情大多发生在内部研究实验室里,希望他们在把产品推向世界之前,能先做好足够的安全工作,想清楚产品会被怎么使用,对所造之物可能带来的社会影响有清醒的判断。但我依然认为,我们得先把一件事彻底想明白:究竟要如何把这个模型部署到人类世界里去。就是这一点。

主持人:但你并不属于那个阵营,我是说那封请愿书。它在开放权重联名信发出四天后出炉,就是刚才说的 Nvidia 那件事。这封不同的信有 1100 人联署,这次 Anthropic 和 OpenAI 都在上面,请求政府协助,有意放缓前沿自动化 AI 研究的步伐。也就是说,行业在主动请求减速。你在这个阵营里吗?还是觉得事情根本不该这么运作?

Thomas Wolf:我签了那封信。我同意,我确实认为我们应该往那个方向走。而且我还有一个感觉,你作为投资人大概也有同感:就算我们现在立刻停下,光靠已有的东西,也够我们建出一批相当好的公司了。我觉得这些模型现在已经能替我们做很多极其有趣的事。我也觉得,有很多东西我们还需要去理解,需要在开放科学、在分享模型运作机理上做大量功功课。所以我不属于“现在必须狂飙突进”那一派。

真正的问题在于:如果我们想稍微慢一点,那当然很好,那样的话,也许我们每天就不用消化四个新公告,全塞进一期播客里,明天还有下一期等着。也许我夏天还能休上一天假。但说正经的,核心问题是:我们能不能把事情做对。这才是关键。

我觉得很多人都不介意 AI 走慢一点、开放一点、更体贴一点、多一点自省,更努力去理解怎么把它真正做好。但核心矛盾是:我们怎么谈判、怎么组织这场减速,又不至于引发坏激励,你我都知道,只要有一两个玩家不减速,整个减速的效果就可能被击穿。这一点我不确定怎么办,反正那封信没给出什么激励设计。它可能需要一些协作机制。还有一篇很长的博客,叫《AI 2040》,不知道你读过没有,它也在呼吁一种审慎的减速。你看,这中间有两条极端路线:一边是放开刹车、能跑多快跑多快,一边是把什么都管起来、谁都不许用 AI。我认为这两个都是蠢办法。真正的答案在两者之间:我们能不能找到一种方式,把节奏真正放慢一点?我觉得这很好,我们不会损失多少,而且哪怕只看公司创业这一面,我们照样能催生出大量了不起的东西。

但,是的,我这两边都同情,对开源也是。我不认为开源天然就是加速主义的。Dan 说这是减速主义,我也不觉得这是通缩主义。你可以既支持开放科学、支持开放,同时又认为我们确实需要先把模型训明白,需要现在就能做真正的科学研究。

主持人:那你担不担心,这其实是又一次监管俘获的尝试:两大私营实验室,变着法想让其他所有人慢下来?我是说,你提到了“不是所有人都会配合”的风险,但这等于变相冻结了“谁当领跑者、谁当跟跑者”的市场格局。

Thomas Wolf:是的,我不觉得它非得如此。你完全可以走一条彻头彻尾加速主义的路线:挑几家公司互相赛跑,然后把其他所有人统统管起来。我不认为监管必须和慢画等号。真正的问题,更多在于你怎么把它落到实处,怎么真正执行,怎么把监管或协作落地。我觉得德米斯·哈萨比斯前几天那封信就写得很好,那是他卸任或升任首席科学家之前写的,他现在会去哪我们还不确定,那封信讲的是国际合作,在某些方面也相当挺开源。

我认为完全可以有一种“开源式”的减速,这也是我最想看到的版本:我们放慢,然后利用放慢换来的时间,去分享更多东西。而竞赛的动力学,通常只会让实验室的门关得更紧,对吧?所以对我来说,减速更可能是一次“开放”的契机。但当然,如果它到头来只是用来坐实,就像我们说的,一个只有两家公司的卡特尔或寡头,那我对这个方向就提不起兴趣了。

( 投稿或寻求报道:zhanghy@csdn.net )

   click("分享❤️", "点赞", "在看")

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
游本昌女儿:父亲睡着就去了,很安详,最后一句话是“我很舒服”

游本昌女儿:父亲睡着就去了,很安详,最后一句话是“我很舒服”

南方都市报
2026-09-24 12:30:28
华人女子入住国外高档酒店 睡到半夜遭黑人强脱衣服; 3女遭多人性侵

华人女子入住国外高档酒店 睡到半夜遭黑人强脱衣服; 3女遭多人性侵

北国向锡安
2026-09-24 10:53:57
破亚洲纪录!中国队卫冕男子4x100自接金牌 张展硕6金并列历史第一

破亚洲纪录!中国队卫冕男子4x100自接金牌 张展硕6金并列历史第一

醉卧浮生
2026-09-24 17:33:23
俄罗斯天然气对华报价250-260美元,放在国际市场到底贵不贵?

俄罗斯天然气对华报价250-260美元,放在国际市场到底贵不贵?

冰语历史
2026-09-24 16:30:30
张展硕亚运7金无悬念,接连两个项目都破纪录夺冠,将创历史

张展硕亚运7金无悬念,接连两个项目都破纪录夺冠,将创历史

体娱一家亲
2026-09-24 17:43:49
3-0!邵佳一真有魄力,让国足9名新人完成首秀,17岁赵松源创纪录

3-0!邵佳一真有魄力,让国足9名新人完成首秀,17岁赵松源创纪录

小火箭爱体育
2026-09-24 22:20:02
画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

画面不堪入目,地下人奶交易乱象,成年人躺进怀里吃奶的灰色黑产

易玄
2026-09-12 10:24:46
全天跳水!三大因素,曝光!

全天跳水!三大因素,曝光!

中国基金报
2026-09-24 15:40:54
举报南京幼儿园食堂炒菜锅洗拖把老师:纠结两天两夜,最怕再也找不到工作

举报南京幼儿园食堂炒菜锅洗拖把老师:纠结两天两夜,最怕再也找不到工作

十为先生
2026-09-23 18:11:15
打破惯例!梅拉尼娅:我们要以最高礼遇欢迎中国

打破惯例!梅拉尼娅:我们要以最高礼遇欢迎中国

看看新闻Knews
2026-09-24 15:32:17
破覃海洋世界纪录,日本17岁新星成200蛙历史第一人,实现狂言

破覃海洋世界纪录,日本17岁新星成200蛙历史第一人,实现狂言

体娱一家亲
2026-09-24 16:41:05
演都不演了?女排卫冕冠军不到12小时,恶心的事发生,还不止一件

演都不演了?女排卫冕冠军不到12小时,恶心的事发生,还不止一件

林子说事
2026-09-24 08:22:10
签了!中国和美国真签了!这次不是关税,也不是芯片,而是天然气

签了!中国和美国真签了!这次不是关税,也不是芯片,而是天然气

大卫聊科技
2026-09-20 13:27:56
土耳其总统呼吁摧毁以色列后,以色列发文怒喷:你也不是啥好东西

土耳其总统呼吁摧毁以色列后,以色列发文怒喷:你也不是啥好东西

观锐器
2026-09-24 12:38:06
原油期货涨幅扩大至6%

原油期货涨幅扩大至6%

证券时报
2026-09-24 15:03:14
收评:今天A股跌到3890,若不出意外,下周一,可能这样走

收评:今天A股跌到3890,若不出意外,下周一,可能这样走

明心
2026-09-24 15:08:25
给足中方面子!战机致敬 礼炮响起 特朗普夫妇亲自迎接 挥手目送

给足中方面子!战机致敬 礼炮响起 特朗普夫妇亲自迎接 挥手目送

军武咖
2026-09-24 10:05:04
樊振东在就好了!国乒无缘九连冠太遗憾

樊振东在就好了!国乒无缘九连冠太遗憾

湖人侃球师
2026-09-24 22:07:29
行业最低!荣耀Magic9价格公布:16+512G只要5499元 网友:荣耀掀桌子了

行业最低!荣耀Magic9价格公布:16+512G只要5499元 网友:荣耀掀桌子了

快科技
2026-09-24 16:50:13
独家视频丨中美元首华盛顿再次见面

独家视频丨中美元首华盛顿再次见面

海外网
2026-09-24 16:38:03
2026-09-24 22:52:49
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2803文章数 7736关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

旅游
健康
教育
亲子
公开课

旅游要闻

改名藏玄机!从杨黄寨到马头寨,一个名字改写贵州千年土司格局

鼻子三角区的痘,千万别乱挤!

教育要闻

开车导航出成题,能写出高分作文?导航绝不批评你,只是重新为你规划路线

亲子要闻

童趣迎中秋氛围拉满!深圳光明这幼儿园主题晨会温情上线

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版