![]()
物理学家、机器学习先驱Thore Graepel已正式离开谷歌DeepMind,创立一家新的AI初创公司。作为2016年《自然》杂志AlphaGo论文的作者之一,Graepel押注于其十年前共同发明的结构化搜索与规划技术,旨在将AlphaGo的推理能力从围棋棋盘扩展至充满不确定性的物理世界。
媒体报道指出,Graepel的离职加剧了人工智能行业历史上最集中的一次单一实验室人才流失潮。他强调:“我们需要回到架构层面,从根本上重新设计它,以便进行正确的推理。”其个人网站将新项目描述为“将类AlphaGo推理能力带入前沿AI,使机器能够在现实世界的不确定性中规划和行动。”
十年磨一剑:从TrueSkill到AlphaGo
Graepel的职业生涯专注于构建能在不确定性下进行推理的机器。2003年至2015年任职微软剑桥研究院期间,他共同开发了TrueSkill(Xbox Live匹配引擎)和AdPredictor(必应广告点击率预测模型),二者均基于因子图和消息传递推理技术。
2015年加入DeepMind后,Graepel与David Silver等人共同发表了AlphaGo论文。2016年,AlphaGo击败李世石成为AI历史里程碑。此后,他持续参与AlphaGo Zero、AlphaZero及MuZero的研发。在两次任职DeepMind之间,他曾担任Altos Labs高级副总裁,负责构建跨AI、计算生物学和软件工程的研究团队。2025年,Graepel回归DeepMind担任杰出研究科学家,领导后AGI未来相关工作,并兼任伦敦大学学院机器学习主席及合作式AI基金会董事会成员。
技术赌注:显式搜索优于隐式预测
要理解Graepel的新方向,需厘清AlphaGo与大语言模型(LLM)的本质区别。LLM通过单次前向传递逐token生成内容,仅做预测而非搜索。相比之下,AlphaGo结合策略网络、价值网络与蒙特卡洛树搜索(MCTS),在推理时构建决策树并运行数千次模拟前瞻。
当前OpenAI o1和Google Gemini Thinking等模型虽通过思维链近似这种推理,但仍是隐式的。Graepel认为,显式的结构化搜索配合学习型世界模型,才是让AI在连续、动态且严酷的物理环境(如机器人操作、手术辅助)中可靠运作的关键。这类场景没有可延续的token流,必须通过推理处理状态空间。
MuZero是这一理念的先驱,它能在未被赋予规则的情况下学习环境动力学模型。Graepel的新项目旨在解决将此类模型应用于物理世界的挑战:构建足够准确的学习型世界模型,以支持在传感器不完美、后果不可逆的现实条件下进行可靠前瞻。
DeepMind人才流失潮背后
Graepel的离职是DeepMind创始团队分散的最新篇章。2026年1月,AlphaGo主要架构师David Silver离职创立Ineffable Intelligence,获11亿美元种子轮融资;同年6月,诺贝尔奖得主John Jumper加入Anthropic,Gemini联合负责人Noam Shazeer加盟OpenAI;8月,首席科学家Jeff Dean等人共同创立Discovery Loop,Demis Hassabis则转任董事长兼Alphabet首席科学家。
英国AI人才情报公司Zeki Data数据显示,DeepMind在EMEA地区的招聘份额从2022-23年的49%骤降至2025-26年的18.6%,入职/离职比例从12:1降至2:1。同期,OpenAI和Anthropic的招聘分别增长97%和152%。
知情人士透露,离职潮源于竞争对手提供高薪及IPO前股权的激烈挖角,以及研究人员对DeepMind日益侧重Gemini商业化、收紧出版规则的不满。尽管Hassabis驳斥了负面叙事,称DeepMind仍拥有顶尖人才阵容,但风险资本正加速流向AI初创公司。自2025年初以来,风投已向该领域投入188亿美元,为资深科学家创业提供了充足弹药。
未来展望
Graepel尚未披露新公司的投资者、团队或名称。他计划于11月在伦敦政治经济学院发表题为“从AlphaGo到AGI”的演讲,首次公开阐述其理念。对于欧洲AI生态而言,继Ineffable Intelligence之后,Graepel的加入进一步巩固了英国作为独立于中美算力优势之外的前沿AI集群地位。
常见问题解答
为何2026年如此多资深DeepMind研究人员离职?
多重因素叠加所致。外部方面,Anthropic和OpenAI等竞争对手提供难以匹敌的高薪及IPO前股权;内部方面,研究人员对DeepMind侧重Gemini商业化而牺牲长周期科学探索感到不满,部分离职更直接由计算资源被重新分配触发。此外,活跃的风投环境使DeepMind校友能以高估值快速融资创业。Zeki Data数据显示,DeepMind在EMEA的研究人才份额三年内从49%跌至18.6%。
类AlphaGo推理与当前AI模型有何不同?
大语言模型基于前文预测下一个token,无显式搜索过程。类AlphaGo推理则在推理时构建显式搜索树,由策略网络提议探索方向,价值网络评估前景,并通过数千次模拟前瞻选择动作。虽然o1等模型通过思维链隐式近似这一过程,但显式搜索在结构上更具原则性,尤其适用于具有已知或可学习结构的问题。
AlphaGo对阵李世石的第37手为何重要?
该步“五线肩冲”被人类评论员初判为失误,策略网络估计人类走出此步的概率仅为万分之一。然而,搜索系统识别出其高价值,最终被证实为改变战局的战略杰作。这证明了系统能通过评估未探索的未来,在高维空间中发现真正新颖的解决方案,这正是Graepel希望扩展至物理世界的核心能力。
从棋盘游戏转向机器人技术面临哪些风险?
核心挑战在于世界模型的准确性。棋盘游戏规则精确、离散,MCTS可低成本运行数百万次模拟。而物理环境连续、部分可观测且后果不可逆。构建能支持可靠多步前瞻且不出现灾难性退化的学习型世界模型,仍是未解的研究难题。MuZero虽在简单环境中验证了可行性,但将其扩展至开放物理世界是Graepel团队必须攻克的关键障碍。
【星途科讯 图文丨LCC 首发于ZAKER科技,转载请注明出处】
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.