网易首页 > 网易号 > 正文 申请入驻

AI开始「研究自己」:Mechanist开启机器智能机制科学

0
分享至



近期发表于 Nature Machine Intelligence 的论文 Towards principled knowledge editing methods for large language model reasoning [1],从知识编辑切入,进一步探索大模型如何使用知识进行推理以及如何通过主动干预观察模型内部变化。而如果这种探究模型内部如何学习、组织和使用知识的「实验」不再完全依赖人类完成,而是交给 AI 自己呢?让它提出假设、寻找机制、设计实验、验证结果,甚至进一步干预模型。

正如医生、心理学家和脑科学家从不同层面研究人类自身,理解我们的行为、认知与大脑机制,我们也可以进一步追问:AI 能否成为研究机器智能自身的「科学家」?这正是 Mechanist 正在探索的问题。

  • Paper: https://arxiv.org/abs/2608.12036v2
  • Code: https://github.com/zjunlp/Mechanist
  • Project Web Site: http://mechanist.openkg.cn/

让 AI 自己寻找「智能是怎么产生的」



与传统 AI Scientist 主要帮助科学家研究药物、材料和生物学问题不同,Mechanist 关注的是一个更底层的问题:模型是如何获得这些知识、内部怎么计算这些知识?

Mechanist 将机理研究过程组织成「假设生成,实验执行,结果验证,迭代修正」的完整闭环。但理解模型机理并不容易:大模型的智能由输入、内部表征与海量参数的复杂交互共同产生,往往牵一发而动全身,很难仅凭行为相关性定位真正起作用的因果机制。为支撑可靠的机理发现,Mechanist 构建了两类基础资源:

一是Scientific Knowledge Graph 辅助提出猜想,包括由约1.3 万篇可解释性研究论文构成的机理知识图谱,以及覆盖26 个学科、4300 万篇论文的跨学科知识库;二是大模型智能机理的基础分析工具库,涵盖32 类机制分析、因果干预与验证方法。

Mechanist 并不是简单地让大模型总结论文或编写实验代码,而是让 AI 真正「做」机制研究。它需要提出可证伪的假设,设计并执行实验,再根据结果验证和修正自己的判断。只有当结论能够经受不同模型、数据和方法的检验,才被视为一个更可靠的机制发现。

Mechanist 发现了什么?

Mechanist 最有意思的地方在于,它并没有停留在自动科研的流程展示,而是进一步发现了一些此前并不显然的模型内部规律。

模型究竟如何区分并使用「我知道的事实」和「别人相信的事实」?



例如,模型知道「2026 年世界杯决赛将在 Jersey 举行」,但如果告诉它「James 认为决赛将在洛杉矶」,再分别问「现实中的决赛在哪里」和「James 认为在哪里」,模型需要同时维护两种不同的知识状态。

Mechanist 将上述现象划分为 World Knowledge、Personal Belief 和 Attributed Belief 三种情境,并观察到 GPT、Gemini、Claude、Qwen、Pythia、OLMo 等多个模型在这三种情境中均普遍存在错误:有时别人的错误信念会干扰模型自己的事实判断;有时模型自己的知识又会反过来覆盖它对他人信念的判断。

Mechanist 没有停留在行为层面,而是继续向模型内部追踪。研究发现,在 Pythia-1B 中,仅约 0.05% 的参数就与这类 belief-state reasoning 高度相关,并且可以进一步分成不同功能的 attention heads:L4.H1(第 4 层的第 1 个 head,后面与此同理) 主要参与 Attributed Belief,而 L9.H1、L7.H5、L12.H1 等 heads 与 Personal Belief 密切相关。因果干预给出了更强的证据:比如关闭 L4.H1 后,Attributed Belief 准确率从 0.86 降至 0.34,而 Personal Belief 保持不变。这说明模型内部可能并不存在一个笼统的信念区域,相反,不同的信念状态可能由相对独立的内部计算机制承担 [2-4]。

Mechanist 还追踪了这些机制是怎么形成的。在 Pythia-1B 的预训练过程中,Attributed Belief 相关能力很早就出现,而 Personal Belief 则在后续训练中逐渐形成;随着训练推进,对应 heads 的因果重要性也同步增强。这意味着,模型的高级认知能力并非在训练完成后突然出现,而可能伴随着特定内部机制逐步形成。研究者因此不仅可以追问模型「具有什么能力」,还可以进一步追踪能力何时出现、由哪些机制支撑,以及这些机制如何随训练演化,从而将研究从静态的模型解释推进到对智能形成过程的探索。

找到机理之后,还能控制和改进

如果机制研究只能告诉我们「这里有一个 head」,价值仍然有限。Mechanist 继续做了一步:直接干预这些 belief heads,就像直接拧动「模型内部的旋钮」[5-6]。这种机理干预方法比单纯给模型增加 prompt 提示更有效,在 Pythia-410M、Pythia-1B 和 Pythia-2.8B 上分别带来 +15.3%、+8.8% 和 +3.5% 的提升,同时保持较低的错误破坏率。于是,一个完整的因果链条出现了:发现行为→定位机制→因果验证→主动干预→能力提升。

基于机理设计的生物发现

同样的思路还被用于 Evo2 这样的生物序列基础模型。如果想生成具有更高 α- 螺旋含量的 DNA 序列,传统方法通常需要生成大量候选,再通过结构预测进行筛选。Mechanist 则尝试找到模型内部与 α- 螺旋相关的特征,然后直接进行 steering。在 900 条生成序列上,目标特征干预将平均预测 α- 螺旋含量从 43.8% 提升到 56.6%。这意味着模型内部那些原本用于「解释」的特征,实际上还可以进一步变成控制模型行为的旋钮。

从知识编辑,到机器智能的「实验科学」

回过头看,知识编辑与 Mechanist 正在形成一条系统的研究路线:Understand AI, Improve AI. 这不是简单地把模型拆开看,而是理解之后能够重新控制它。

知识编辑最初关注的是模型知道错了怎么改,随后逐渐深入到知识存在哪里、如何连接、模型为什么相信某些知识,以及改变这些知识和内部机制后,能否进一步影响模型的推理与行为。Mechanist 则将这一思路进一步自动化,形成编辑、观察、验证、再干预的闭环,让模型机制研究从被动分析走向主动实验。

这也引出了一个更大的问题:未来的 AI 能否研究自己的机制,并根据研究结果不断改进自己?现阶段讨论的递归自我改进(RSI),往往强调 AI 自动写代码、生成数据、优化训练过程。但如果 AI 只是不断试错,却无法理解自己为什么成功、为什么失败,这种自我改进本质上仍然更接近自动化搜索 [7-8]。

真正的递归改进或许需要更进一步:发现问题、理解机制、设计实验、验证假设、定向干预,再观察干预后的变化。从这个意义上看,Mechanist 探索的不只是一个新的 AI Scientist 系统,而是一种面向机器智能的研究范式:把大模型作为实验对象,把机制发现作为科学问题,把因果干预作为实验手段。

从改变模型中的一个知识开始,到理解智能为何产生、如何被干预,再到机器智能能否依据对自身机制的理解持续改进自己。这或许正是 通过 Mechanism Science of AI 通向 AGI 的一条路径。

参考文献

[1] Towards principled knowledge editing methods for large language model reasoning, Nature Machine Intelligence, 2026

[2] Language models cannot reliably distinguish belief from knowledge and fact,Nature Machine Intelligence, 2025

[3] Language Models Use Lookbacks to Track Beliefs, ICLR, 2026

[4] How Large Language Models Encode Theory-of-Mind: A Study on Sparse Parameter Patterns, npj Artificial Intelligence, 2025

[5] Toward universal steering and monitoring of AI models, Science, 2026

[6] Steering Llama 2 via Contrastive Activation Addition, ACL, 2023

[7] AlphaEvolve: A coding agent for scientific and algorithmic discovery, 2025

[8] Accelerating scientific discovery with Co-Scientist, Nature, 2026

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京通告全球,世界最大组织诞生,中俄辛苦25年,美国劫难到了?

普京通告全球,世界最大组织诞生,中俄辛苦25年,美国劫难到了?

历史点行
2026-09-06 09:43:22
王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

娱乐团长
2026-09-06 21:00:57
中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

刘姚尧的文字城堡
2026-09-06 15:47:42
说真的,如果没有中美金融战,房地产就是国家下的一盘完美大棋

说真的,如果没有中美金融战,房地产就是国家下的一盘完美大棋

坠入二次元的海洋
2026-09-06 03:18:53
中国跳水队亚运会名单公布,全红婵遗憾退出,必须承认存在这3个影响

中国跳水队亚运会名单公布,全红婵遗憾退出,必须承认存在这3个影响

懂球社
2026-09-04 21:09:40
“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

芊芊子吟
2026-03-05 19:45:03
记者:西甲已被玷污,如果我是皇马我就退出西甲

记者:西甲已被玷污,如果我是皇马我就退出西甲

懂球帝
2026-09-06 19:00:12
1人NBA+5人NCAA!男篮明年世界杯欲组最强阵容,冲击奥运会希望大增

1人NBA+5人NCAA!男篮明年世界杯欲组最强阵容,冲击奥运会希望大增

篮球圈里的那些事
2026-09-06 18:37:25
田中心不再是神话!三分球一个不中,全队27中3,被德国打回原形

田中心不再是神话!三分球一个不中,全队27中3,被德国打回原形

南海浪花
2026-09-06 06:37:42
一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

一夜输光几十万,打工小伙喝下整瓶百草枯:被伤透的妻子选择放弃治疗

民生故事会
2026-09-05 23:23:10
华为三折叠预订半小时秒光!网友:这不是手机,是“电子茅台”

华为三折叠预订半小时秒光!网友:这不是手机,是“电子茅台”

国货
2026-09-05 09:58:42
丰田新车官宣:9月21日,正式上市

丰田新车官宣:9月21日,正式上市

科技堡垒
2026-09-06 11:39:30
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
重庆贸促会原党组成员、副会长章晓风接受审查调查

重庆贸促会原党组成员、副会长章晓风接受审查调查

界面新闻
2026-09-06 19:01:27
七胜一负!塞尔比赛季第二冠板上钉钉,下一站抢走赵心童世界第一

七胜一负!塞尔比赛季第二冠板上钉钉,下一站抢走赵心童世界第一

夜深聊球
2026-09-06 20:12:18
中国会不会出现第2个毛主席?外国专家曾说:天才出现具有偶然性

中国会不会出现第2个毛主席?外国专家曾说:天才出现具有偶然性

傲傲讲历史
2026-09-05 16:30:30
中超积分榜:成都还差1分,津门虎再逃降级区,重庆10轮不胜

中超积分榜:成都还差1分,津门虎再逃降级区,重庆10轮不胜

乒烧泳球
2026-09-06 22:04:19
特朗普特使带给乌克兰的是一份“投降协议”

特朗普特使带给乌克兰的是一份“投降协议”

山河路口
2026-09-06 13:43:53
演员黄海冰,为了带老婆进组,他推掉一堆优质剧本,导演都替他喊可惜

演员黄海冰,为了带老婆进组,他推掉一堆优质剧本,导演都替他喊可惜

财叔
2026-09-05 22:50:32
张嘉益现状:白发染黑太年轻,住西安大别墅,与二婚妻子甜蜜依旧

张嘉益现状:白发染黑太年轻,住西安大别墅,与二婚妻子甜蜜依旧

云深不知在何处
2026-09-06 19:23:54
2026-09-06 23:19:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

旅游
艺术
教育
时尚
房产

旅游要闻

活力中国调研行|从一趟旅游列车的突围看“交旅融合”消费潜力

艺术要闻

艾琳·汉森 2026年油画新作

教育要闻

2905人!长江大学2026级研究生新生大数据出炉!

金秋最流行的鞋子,“红色”更时髦!

房产要闻

突发重磅!海口出台楼市新政!

无障碍浏览 进入关怀版