网易首页 > 网易号 > 正文 申请入驻

AlphaGo核心作者:十年了,LLM还没学到那场棋局「神之一手」的精华

0
分享至

2016 年 3 月,首尔四季酒店。

人机大战第二局进行到中途,AlphaGo 把一颗黑子落在了第五线上。现场解说一时语塞,有人怀疑程序出了 bug,因为在职业棋手的常识里,这手棋近乎于白送。



后来的故事大家都知道了。AlphaGo 不仅赢下了那一局,还以 4:1 的总比分击败了李世石。赛后李世石说了一段被反复引用的话:「我原以为 AlphaGo 只是基于概率计算的机器。但看到那一手,我改变了想法。AlphaGo 一定有创造力。」

那就是著名的第 37 手。

十年过去,当年亲手造出 AlphaGo 的人却站出来说了一句:那一手棋所依赖的能力,今天的 AI 恰恰没有。



说这话的人是 Thore Graepel,AlphaGo 的核心作者之一,长期从事机器学习研究。最近他做了一个颇耐人寻味的决定 —— 离开 Google DeepMind,去创业做一件他认为更要紧的事:给机器装上真正的推理能力。



那个辛辣的观点出自他最近发布在 MIT Technology Review 上的一篇文章,文章标题非常直接,就叫「别被骗了 ——LLMs 不会推理」。看完这篇文章,图灵奖得主 Yann LeCun 表示赞赏,强调「真正的推理必须涉及搜索,LLM 不具备这一能力」。



Thore Graepel 为什么这么说?我们一起来看看这篇文章写了什么。

第 37 手不是「灵光一闪」,而是推理的产物

很多人对第 37 手的叙事是「机器直觉的神话时刻」——AI 电光石火之间,看到了人类千年棋谱之外的妙手。Graepel 说,这是大家对 AlphaGo 最大的误解。



要理解这一点,得先拆开 AlphaGo 的内部构造。它由两套系统组成:一套是策略网络(policy network),通过学习海量人类棋谱,来预测「高手在这一局面会怎么下」,这是直觉的部分。另一套是搜索机制,它不关心某手棋「看起来像不像人下的」,而是显式地构建一棵包含数千个分支的博弈树,逐一推演每个候选落点通向的未来。

关键在于:在策略网络眼里,第 37 手平平无奇 —— 职业人类棋手下出这一手的概率大约只有万分之一。如果只听直觉的,这一手根本不会被选中。是搜索机制在深算之后发现,这手「不像话」的棋通向一个更好的终局。

Graepel 借用了卡尼曼那个著名的框架来解释这件事。人类的思考分为两种模式:系统 1 快、凭直觉、毫不费力;系统 2 慢、一步步来、审慎权衡。AlphaGo 恰好是这两种模式在机器上的罕见合体:神经网络提供「这手棋有戏」「这个局面要赢」的直觉,搜索机制负责把这些直觉放到未来的攻防变化里去检验。缺了任何一半都不行:光有直觉,永远走不出第 37 手;光有暴力搜索,也根本筛不动围棋那天文数字般的可能性。

这里还有一个常被忽略的对比。1997 年深蓝击败卡斯帕罗夫,靠的是人类硬编码的规则,每秒评估 2 亿个棋局位置,向前看六到八步。而围棋的复杂度完全是另一个量级,一颗子的价值取决于几十个回合之后厚势与实地的消长,哪怕只算所有变化的一小部分,超级计算机也得算上几十亿年。所以 AlphaGo 必须学会「一眼看清局势」,甚至创造人类从未想过的下法。它不是靠算力碾压赢的,这一点至关重要。

大语言模型:一个被练到极致的系统 1

再来看今天的 AI。

大语言模型的工作原理,归根到底是一遍又一遍地预测下一个 token。这本质上就是系统 1 在运转:快速、联想式、在几乎所有人类写过的领域里都能完成令人惊艳的模式补全,但它没有「想一想再回答」这个环节。

ChatGPT 横空出世后不久,业界就意识到光有语言流畅度撑不起真正的用处。补救方案大家都很熟悉了:让模型别急着回答,先生成中间步骤,把问题拆开、把中间结果带下去 —— 也就是思维链(chain of thought)。

思维链的提升是实打实的,尤其在数学和代码上。但 Graepel 指出了一个容易被兴奋情绪掩盖的事实:这些中间推理步骤,仍然是同一个「预测下一个 token」的过程,只是在给出最终答案前多迭代了一会儿而已。 它并没有像 AlphaGo 的搜索那样,引入一个真正独立的推理机制。直觉被拉长了,但并没有因此变成审慎。

他进一步列出三个短板,说明聊天机器人做的事为什么够不上「科学家所承认的那种推理」。

第一,模型没有一份明确的、可持续更新的、可供检查的认知状态。它此刻在考虑哪些假设、对各种解释抱有多大信心、在权衡哪些证据、还有哪些问题悬而未决。这些东西本该随着新信息的到来被系统性修订,但模型内部并没有这样一本「开放的账簿」。

第二,模型没有做到「知道什么」和「如何运用知识」之间的分离。知识和推理死死缠绕在神经网络的权重里,不存在一套独立、显式表达的信念体系。

第三,也是最微妙的:思维链看起来像深思熟虑,但研究已经表明,模型经常在事后编造它们。答案是走一条路得出的,报告给你的却是另一条路。一个「听起来很有道理的故事」,和一段「真实发生的推理」,是两回事。

推理是真是假,有那么重要吗?

如果只是聊天闲聊,推理是真是假可能无所谓。但在我们真正在乎的高风险领域 —— 医疗、工程、科学研究 —— 一个系统得出什么结论和如何得出结论同样重要。出了错,比如在诊断和治疗上出了错,我们需要能定位错在哪一环:是推理过程出了问题,是采信了无效证据,还是做了错误假设?一个只会事后编故事的系统,在这类场景里是无法被信任、也无法被追责的。

这也正是 Graepel 离开 DeepMind 的原因。他认为我们需要一种全新的机器推理路径,而灵感恰恰来自十年前的 AlphaGo。

AlphaGo 随时维护着一份它对当前局面全部认知的记录,也就是那棵博弈树。树里装着它考虑过的所有变化、所有可能的未来,每一手、每个局面都标注着神经网络的判断。随着推演深入,它不断更新这棵树,最终综合树里的信息决定落子。

Graepel 认为,通用推理系统也该如此:维护一个认知状态,明确表达哪些是已确认的、哪些存疑、哪些已被排除、哪些问题仍然开放。而「推理」,就是一连串改变这个认知状态的「动作」—— 推导结论、拆解问题,以及最关键的:决定下一步该问什么问题、做什么计算、跑什么实验。

当然,开放世界的推理比下棋难得多。围棋棋盘上的状态完全可见、规则固定;而现实世界里,当前局面只被部分知晓,可选的动作又多又杂,行动的后果充满随机性甚至完全未知。

但好消息是,LLM 和其他神经模型这些年的进展,恰好给这件事提供了零件:LLM 可以基于已知信息和可用资源,提议解决问题的路径;可以通过 API 和代码与工具交互;可以帮助评估一个论断是否被现有证据支持。最重要的是,系统里必须有一个独立的「裁判」,按「这一步究竟消解了多少不确定性」来评估每个推理动作 —— 只有在证据支持的情况下才更新信念。规则一旦立起来,系统就能积累经过认证的知识,并从过去的推理经验中学习、改进自己的推理策略。

Graepel 给这个图景起了一个很形象的说法:打了兴奋剂的科学方法。目标只有一个,产出经得起审视的知识。

更大的系统 1,不会自动长出系统 2

文章的最后,他把态度亮得清清楚楚:靠把系统 1 做得更大,到不了可信任的机器智能。规模能磨利直觉,但磨不出审慎。

第 37 手之所以重要,是因为一台机器守住了一个局面、称量了可能的未来,然后选中了那手连它自己的「直觉」都大概率会否决的棋。

而人类社会恰恰需要更多这样的「神之一手」,在药物发现、新材料、气候、医疗诊断这些领域。那里的棋盘完全不像围棋,甚至没人把规则递到我们手上。这样的洞见,只会来自真正会推理的系统:结论出自一段可审计的证据、推断与信念修正的链条,而不是一个事后编出来的、令人信服的故事。

十年前,AlphaGo 用第 37 手告诉世界,机器可以超越人类的直觉。

十年后,它的创造者之一在提醒我们:别让流畅的语言骗了你,那一次真正的飞跃,至今还没有在 LLM 身上发生第二次。

你说LLM不会推理,站得住脚吗?

这篇观点文发表后,在 X 上引发了不小的争议。

最犀利的质疑来自多伦多大学教授 David Duvenaud(神经 ODE 那篇 NeurIPS 最佳论文的作者之一)。他提到:Graepel 给 LLM 定的三条罪状 —— 没有可检查的认知状态、知识与推理不分离、事后编造解释 —— 放在人类身上同样成立。「按这个标准,我能算会推理吗?」



Graepel 回应说:你单靠自己也推理不好;给你纸笔,就好得多;再让你严格遵循科学方法,才算得上出色的推理者。诀窍从来不是跟着意识流走,而是把过程结构化 —— 否则任何人都逃不过认知偏差。



Duvenaud 立刻抓住了这句话的弦外之音:「那听起来,我们只要给 LLM 配上类似的工具,就能按你的定义实现真正的推理了 —— 这该不会正是你打算做的事吧?」



Graepel 这套「纸笔增强论」还引来了其他网友的质疑。网友 KingBroken 指出,纸笔本质上是工作记忆的外挂,它让你能同时推理更多数据,但并没有「无中生有」地改变推理能力的存在;不过它有个额外的好处:写下来的文字和数字,恰好就是人类「认知状态」可检查的证据。



紧接着,网友 Daniel Grant 问出了一个更尖锐的问题:照这么说,人类的推理方式就等于「现有模型 + 外挂系统」,那你是在构建一个内部推理能力比两者都强的模型?还是我漏掉了什么细微差别?



对于这些质疑,Graepel 还没有给出回复。

另一种声音则压根觉得这场讨论多余。网友 visimo-dino 直言「不敢相信还有人写这种文章」:LLM 已经在太多事情上表现出色,「不会推理」的说法要么可笑、要么无关紧要,况且同类文章早就发过几百篇了。



Graepel 没有纠缠,只丢了三个问题回去:在无法验证的领域它们可靠吗?产出过强有力的新科学理论吗?你敢让它决定你的医疗方案吗?对方倒也坦率,承认「目前还没有」,但把锅甩给了现有的强化学习方法而非 LLM 架构本身 —— 言下之意,假以时日都能解决。这大概是两派人真正的分歧所在:一方认为缺的是时间,方认为缺的是架构。



还有一条评论问出了很多人心里的八卦:DeepMind 为什么不支持这项研究?Graepel 的回答算得上直白:前沿实验室都在押注 scaling,而可审计的推理无法单从 scaling 中涌现,它需要一种不同的架构。「有时候,激进的新想法在大组织内部更难实现」。提问者 Robert Sperry 的失望溢于言表:在所有实验室里,他原本最期待 DeepMind 会是那个最努力寻找 Transformer 之外答案的人。



也有人把矛头指向了更根本的地方。评论者 Katherine Moore 只留下一句话:「语言本身就是错误工具,靠它做不出可靠的推理。」Graepel 认真接住了这个更激进的立场,并顺势抛出一个开放问题:推理确实需要某种知识表示,如果自然语言太模糊,那能不能用形式化语言对现实世界推理?那样的语言会长什么样?。他没有给答案,但这或许正是接下来一些人创业要回答的问题。



参考链接:https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
金门之战为何受挫?表面缺船少舟,实则肖锋与韩先楚在打法上产生了难以调和的分歧

金门之战为何受挫?表面缺船少舟,实则肖锋与韩先楚在打法上产生了难以调和的分歧

磊子讲史
2026-07-20 11:32:09
官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

官方说死了9个人,幸存者说至少三千,那列装满尸体的火车,开了两百节车厢,一路开进了《百年孤独》

古代经典
2026-09-17 12:10:18
为何说朱瑞是最高级别阵亡将领?他的真实地位,远不只是炮兵司令

为何说朱瑞是最高级别阵亡将领?他的真实地位,远不只是炮兵司令

纪史行者
2026-10-01 06:30:06
伊布:金球奖应颁给能在顶级赛场改变比赛的人,亚马尔配得上

伊布:金球奖应颁给能在顶级赛场改变比赛的人,亚马尔配得上

懂球帝
2026-10-04 10:13:13
14.9元一盒牛肉卷,是碎肉加胶水粘的?网友天塌了,曾年销11亿

14.9元一盒牛肉卷,是碎肉加胶水粘的?网友天塌了,曾年销11亿

李砍柴
2026-09-26 21:50:35
俄罗斯发出威胁将对基辅发动“大规模”打击,警告外交官及外国人离开基辅!被曝正谋划把基辅炸回“石器时代”:使用多达1000枚导弹、无人机

俄罗斯发出威胁将对基辅发动“大规模”打击,警告外交官及外国人离开基辅!被曝正谋划把基辅炸回“石器时代”:使用多达1000枚导弹、无人机

每日经济新闻
2026-10-04 17:20:00
莫文蔚纪念与德国丈夫结婚15周年 17岁的初恋

莫文蔚纪念与德国丈夫结婚15周年 17岁的初恋

乡野小珥
2026-10-04 16:27:53
从8499跌到4298,这台华为老旗舰反而成了"最值得捡漏"的Mate

从8499跌到4298,这台华为老旗舰反而成了"最值得捡漏"的Mate

小柱解说游戏
2026-10-03 12:29:50
高水平外资,在打骨折卖商业大楼

高水平外资,在打骨折卖商业大楼

老凤说财经
2026-08-03 11:17:22
又一女间谍曝光!国安部披露:大量航天机密外泄,作案手段太高超

又一女间谍曝光!国安部披露:大量航天机密外泄,作案手段太高超

云深不知在何处
2026-09-30 00:00:56
【爆款】《回自家被当捞女,信托一出全麻了》沈听晚 温时序 沈砚舟 沈祈安 沈楚漾(林楚漾) 江行之 陈知珩

【爆款】《回自家被当捞女,信托一出全麻了》沈听晚 温时序 沈砚舟 沈祈安 沈楚漾(林楚漾) 江行之 陈知珩

菲菲爱时尚
2026-09-30 13:23:27
订单火爆!这一产业,悄然走红海外!

订单火爆!这一产业,悄然走红海外!

证券时报
2026-10-04 17:36:06
贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

贾乃亮带甜馨迪拜出游!甜馨长到认不出!和贾乃亮搞怪自拍

喜欢历史的阿繁
2026-10-05 00:15:37
靠带错路一战成名的粤J2888T,千里奔赴,已经抵达洛阳

靠带错路一战成名的粤J2888T,千里奔赴,已经抵达洛阳

音乐时光的娱乐
2026-10-04 17:00:19
经济部长:失去C罗对葡萄牙是坏消息,他是国家最知名的人

经济部长:失去C罗对葡萄牙是坏消息,他是国家最知名的人

懂球帝
2026-10-05 00:01:08
奉劝60‑70岁男人:到这年纪贪色,是人生致命大坑

奉劝60‑70岁男人:到这年纪贪色,是人生致命大坑

观观说事
2026-09-04 22:30:03
一人演9个专家,3年诈骗80亿,退休工人摇身一变成了“神医”?

一人演9个专家,3年诈骗80亿,退休工人摇身一变成了“神医”?

打小我就醜
2026-10-03 16:36:09
这名迪拜航空副驾驶为何空中行凶

这名迪拜航空副驾驶为何空中行凶

新京报
2026-10-04 09:41:04
原来,刘欢上奥运会先签保密协议,违约就赔100万,老婆都不能讲

原来,刘欢上奥运会先签保密协议,违约就赔100万,老婆都不能讲

谢葥邮轮摄影
2026-09-29 19:29:04
3场比赛3次首发!在伊万科维奇手下被弃用,却成为了邵佳一的国家队主力

3场比赛3次首发!在伊万科维奇手下被弃用,却成为了邵佳一的国家队主力

篮球圈里的那些事
2026-10-04 17:46:18
2026-10-05 00:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14123文章数 142744关注度
往期回顾 全部

科技要闻

苹果确认:iPhone 18 Pro Max有问题

头条要闻

外军机群高速冲向解放军轰-6K 飞行员霸气应对

头条要闻

外军机群高速冲向解放军轰-6K 飞行员霸气应对

体育要闻

32胜0负!德约2-1逆转头号种子兹维列夫 第7次晋级中网四强

娱乐要闻

高晓松悄悄复出:官媒没给他留体面

财经要闻

OpenAI前安全部门员工:公司文化已崩坏

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

手机
艺术
教育
时尚
军事航空

手机要闻

iPhone18 Pro:首销破百万,国产旗舰首销总和不到人一半!

艺术要闻

震惊!吴冠中为何把自己的画展叫“叛徒画展”?真相远比你想的扎心!

教育要闻

中国石油(华东)27届保研1261人:材料科学47个毕业生保34个

谭卓&胡一天,邀你一起“网”下面基

军事要闻

驻冲绳美军士兵抢劫杀人 日本向美国提出抗议

无障碍浏览 进入关怀版