网易首页 > 网易号 > 正文 申请入驻

让大模型真正学会「发现」,设计下一个实验

0
分享至



许多科学发现问题,本质上是在开放空间中面向特定奖励的决策问题。近期,伦敦大学学院汪军老师领导的团队发布了大发现模型(Large Discovery Models, LDMs),专门用于解决科学发现领域中 “如何设计下一个实验” 的问题。

LDM 是一套递归式的基础模型架构,核心是将生成式基础模型与高斯过程奖励模型相结合:基础模型依托历史信息与上下文,在开放空间中持续拓展、重塑当前的有效搜索空间;高斯过程则在该搜索空间内,基于实验历史构建贝叶斯奖励信号,评估各个候选方案用于下一轮实验的价值。LDM 能够依据实验数据与基础模型的上下文更新完成实时迭代,奖励信号也可以通过后训练融入基础模型参数,由此形成快、慢两套学习闭环。



  • 论文:https://arxiv.org/abs/2608.15669 Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search.
  • 项目网站: https://largediscovery.net/
  • 项目 GitHub: https://github.com/yzailab/Large-Discovery-Models
  • Hugging Face: https://huggingface.co/collections/Yangtze-ailab/large-discovery-model-v01
  • 提供反馈:https://largediscovery.net/feedback/

LDM v0.1 在 Auto-Research(神经网络训练)、抗体设计、多目标分子优化三个场景取得初步验证:

  • Auto-Research BPB 下降幅度是纯大模型反思的2.4 倍;
  • 抗体设计结合能相对纯大模型反思平均降幅达18.2%;
  • 分子多目标超体积相对纯大模型反思和贝叶斯搜索提升 >60%。

为什么科学发现需要另一种大模型

近年来,大语言模型已经从对话、文本生成,拓展到数学、代码等领域的复杂推理与问题求解。其中一项关键技术,是依托可高效验证的奖励信号开展测试时搜索(Test‑time search)或强化学习。但在科学研究场景下,实验反馈对应的真实奖励来源于机理复杂且尚未探明的高成本实验,同时设计或假设空间往往规模庞大,甚至具备开放性。

纯大语言模型拥有丰富的结构先验,可以编写代码、生成蛋白序列与 SMILES 表达式,但往往会将语言流畅度、生成似然度视作方案质量的评判标准,无法基于实验反馈校准自身的生成分布与不确定性;传统贝叶斯优化(BO)能够依靠后验均值和方差做出审慎决策,却通常局限于预先给定的有限搜索空间,很难探索全新模块、全新基团或是全新的序列家族。



图 1:大模型从生成、推理到开放式发现的演化。基于昂贵的黑盒实验评估,LDM 在开放式空间中不断迭代和改进实验设计。

Large Discovery Model(LDM)融合生成模型与贝叶斯优化两者的优势,搭建起完整的实验闭环:生成模型拓展候选方案的边界,代理模型为每一个候选方案输出可靠的决策价值。模型不仅会在已知范围内优化,还能够判断何时探索不确定性较高的区域,甚至提出过往候选集合中从未出现过的全新方向。

探索与利用之外,我们还需要 “发现”



图 2:从利用、探索到发现。真正的 “发现” 会把尚未被表示的区域变成可搜索的新区域。

我们对开放式设计空间的认知可以被划分进 “认知矩阵”:

  • “已知的已知”,指处于搜索范围内、性能已经被充分掌握的候选集合,可在该范围内通过利用(exploitation)寻找确定性的高质量解。
  • “已知的未知”,指已经纳入搜索范围,但性能尚不明确的候选集合,可在该范围内开展探索(exploration),实现由未知向已知的转化。
  • 而 “未知的未知” 完全不在当前搜索范围或模型的表征范围之内,这就需要依靠发现(discovery),把全新的领域纳入搜索范围。

传统序贯优化讨论 exploration–exploitation:利用是在已知高价值区域精修,探索是在当前表示范围内收集信息。LDM 进一步强调 discovery—— 当候选池饱和时,模型要改变表示本身,把新机制、新结构或新家族纳入搜索。

生成模型结合统计模型,快慢两个学习闭环

LDM 由生成模型与经验价值模型共同驱动。生成模型输出程序、蛋白序列、分子等开放式候选方案;高斯过程(GP)基于已获取的实验数据,估算候选方案的价值与不确定性,从中选出最值得开展评估的设计批次。



图 3:LDM 的完整学习回路。快环在每次实验后更新数据与上下文;慢环把高价值搜索轨迹蒸馏进模型参数。

LDM 基于以下核心公式来构建下一次提议的分布:



pθ,α 是大模型的生成先验,aₜ(x) 是 GP 奖励模型所导出的 acquisition value;θ 为大模型权重,α 为大模型推理参数,η 控制价值信号强度。该分布既保留生成多样性,又把实验预算推向更有价值的候选。

快学习闭环:用真实观测决定下一步

每一轮中,LLM 根据当前上下文生成开放式候选,灵活调整和扩张搜索边界;GP 用已观测数据,提供奖励的预期与不确定性。再通过 acquisition function(如 UCB、EI 或多目标 EHVI)给出实验优先级。高价值候选既可能表现更好,也可能显著减少不确定性。

  • 生成:LLM 提出结构化、开放式候选的基础分布
  • 筛选:GP 奖励模型基于真实观测构建采集函数,使基础分布向具有高实验价值的方向倾斜。
  • 实验:通过 Test-time search (TTS)选择高实验价值的候选,用于代价昂贵的实验评估
  • 更新:新结果写回数据与上下文,用于下一轮的实验决策

慢学习闭环:把高价值决策蒸馏进模型

快环解决单个任务中对于实验反馈的持续、快速适应,慢环则负责把 “基于经验提出新设计” 的元能力固化到模型参数中。LDM 保留 TTS 中的候选、搜索状态和采集函数值,构造按采集函数值加权的训练数据,从而通过 SFT 把 “何时利用、何时探索、何时跨出旧边界” 的策略蒸馏进生成模型。

慢闭环学习的不是静态高分答案,而是潜在的实验价值。即便某个候选方案当前预测均值并不高,只要它能够打开全新搜索区域、或是为后续搜索提供新信息,就依然具备优先开展实验的价值。

三类任务:LDM 是怎样在快闭环中 “发现” 的

论文在代码、抗体和小分子三类开放式设计任务上测试 LDM。重点不只是终点分数,而是它能否跨过平台、切换搜索区域,并形成新的候选家族。这三类任务的设计空间是完全不同的模态:

  • 代码:Auto-Research 可改变程序表示
  • 序列:2011 规模的 CDRH3 组合空间
  • 分子:开放式 SMILES 字符串空间,双目标 Pareto 优化

场景一|AutoResearch:从调参走向发现新训练机制

该任务的目标是,在固定硬件与训练时长约束下持续修改 NanoGPT 的 train.py 脚本,实现验证集 BPB 指标最小化。LDM 依靠大模型维护动态参数空间,有效参数空间会随着训练机制的迭代持续变化,同时搭建高斯过程代理模型,确定下一轮待尝试的方案。



图 4:Auto-Research 代表性轨迹。搜索先后引入 Muon optimizer、value embeddings、n-gram memory 等机制,平台期通过 reflection 改写候选方向。

该性能曲线并非固定空间内参数调优带来的平滑变化,而是伴随着新机制的发现,参数空间被持续改写。例如引入 Muon 优化器、value embeddings、n‑gram memory 等机制后,性能出现明显跃升;当搜索在 768 维附近进入平台期,反思模块将搜索方向切换至更窄的结构。在 H100 实验阶段,对比 Karpathy 基线 0.9767 的 BPB 数值,LDM 在相同初始条件下实现的 BPB 绝对降幅,是纯大模型反思方案的 2.4 倍。

切换至 B200 硬件后,LDM 主动拓宽参数搜索空间,BPB 进一步下降至 0.902291,在 Auto‑Research 排行榜取得世界第一,且性能大幅领先其他方案。

场景二|抗体设计:在 20¹¹ 序列空间中跳出局部最优

CDRH3 的序列包含 11 个可编辑位点,每个位点可在 20 种氨基酸中选择,整体组合空间规模达到 2011。论文针对 5 种抗原,各分配 200 次评估预算,以结合能作为评价指标(数值越低代表效果越好),验证模型能否在高度崎岖的序列空间中挖掘全新的基序(motif)家族。



图 5:对抗原 1NSN_S 的最终结果,数值越低越好。

综合五个抗原的实验结果,相较于纯大语言模型方案,LDM 的平均结合能降低 18.2%。生成模型负责拓展当前搜索的序列邻域,代理模型再通过采集函数完成筛选。大语言模型在这类专业空间中缺少充足数据构建先验,而高斯过程可以利用实验反馈弥补大语言模型在领域先验不足时的盲目生成问题;同时大语言模型对局部搜索范围做出约束,避免传统贝叶斯优化在超大序列空间内做无效探索。

场景三|小分子设计:跨骨架扩张 Pareto 前沿

在开放的 SMILES 分子字符串空间中,LDM 需要同时优化 KRAS G12D 的 docking 评分与神经网络活性预测。用帕累托前沿所支配的超体积衡量双目标下的综合表现,预算为 80 次评估。与边界明确的序列空间不同,有效 SMILES 无法穷举,传统搜索很容易停滞在局部化学家族或预先给定的搜索范围。



图 6:80 次评估后的平均 Pareto 超体积。

LDM 的帕累托超体积相对纯 LLM 反思提升 62.4%,相对传统多目标贝叶斯优化提升 63.1%。只有基础生成模型,候选缺少可靠的实验价值评估;只有贝叶斯优化,开放式结构创新不足。两者结合后,搜索才能在不同分子骨架之间扩张 Pareto 前沿。

模型从慢闭环中学到了什么?

如果只看任务内结果,LDM 仍可能被理解成一个更强的测试时搜索器。论文进一步把具有高采集函数值的生成策略蒸馏到 Qwen3.5-9B,比较基础模型、直接生成微调和带推理思维链(CoT)的微调,以检验慢环是否改善了下一轮搜索的提案质量。

9B 学生模型超过 30B 代码模型参考



图 7:nanoGPT 微调结果。带推理的 Qwen3.5-9B 经过微调优于 Qwen3-Coder-30B。

LDM 的微调并不是简单复刻最优搜索轨迹,而是学习如何依托历史数据与上下文,有效反思并输出具备高潜力的全新方向。实验结果表明,慢闭环可以在同等测试时搜索预算下,优化生成模型的候选输出分布。另外两项任务中也观察到相同规律。

跨任务泛化:学到的是答案,还是研究策略?

论文设置两级分布外(OOD)测试:训练时完全移除抗体设计任务,只用 Auto-Research 与小分子轨迹微调;随后,直接在抗体设计任务上对模型进行测试。

跨任务模型在 5 个抗原中的 4 个上接近或超过直接见过抗体数据的模型,说明 “如何基于经验提出新设计” 是具有一定跨任务迁移性的元能力。

失败同样重要:唯一明显失败的 1H0D_C 的原因在于其最优区很窄,需要构造特定芳香 / 疏水 motif;没有蛋白领域知识时,模型难以从零发现这种序列。慢闭环迁移的是管理认知不确定性并平衡利用、探索的能力,不会凭空迁移蛋白领域的 de novo 设计知识。LDM 把通用研究决策与领域生成能力分开,也暴露了两者各自的边界。

总结

LDM 为开放式科学空间中的实验设计提供了一种新的递归式基础模型架构。面对机制未知、成本高昂的实验反馈,LDM 能确定最值得尝试的下一步实验;当现有搜索范围达到饱和时,完成新区域的发现,持续调整、扩张搜索边界。

LDM 并不是简单拼接大语言模型与贝叶斯优化,而是将科学发现建模为两套不同时间尺度的学习系统:快闭环依靠真实实验持续校准模型;慢闭环把反复生效的决策策略沉淀到模型参数。

LDM 距离真正的自动化科学家仍存在一些差距:目前实验大多依赖仿真软件作为评估模拟器,而非真实实验室的湿实验结果;高斯过程在极高维、长时程、强非平稳的场景下会遇到可扩展性问题,针对不同模态的搜索空间,还需要针对性设计高斯过程核函数与表征方案。研究团队将在后续的迭代中力图解决这些挑战,并在更多场景开展模型训练和实验。

感兴趣的读者可以持续关注并可以通过开头的链接向团队提出反馈意见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

流史岁月
2026-07-06 18:00:06
93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

93岁原卫生部副部长曹泽毅:我从不养生,只做7件事,比补品管用

小方说跑步
2026-08-22 09:10:06
大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大量美军死伤!伊朗发起猛烈反击,特朗普:把他们从地球上抹去

大国之翼
2026-09-02 06:31:38
78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

78岁连路都走不稳还开演唱会,全网骂声一片,她却扬言回馈粉丝

手工制作阿歼
2026-08-31 03:18:11
51年曾泽生从朝鲜回国,见过主席之后回家警告妻子:北京不能待了

51年曾泽生从朝鲜回国,见过主席之后回家警告妻子:北京不能待了

浩渺青史
2026-09-02 02:35:51
触碰红线!韩方拒换涉台标牌,中方撤展走人,李在明道歉也没用

触碰红线!韩方拒换涉台标牌,中方撤展走人,李在明道歉也没用

原来仙女不讲理
2026-09-04 01:39:33
普京表示俄罗斯女性生育头胎年龄已趋近西欧,生三个孩子应成为常态,日韩没有特别军事行动,生育率却比俄罗斯还低

普京表示俄罗斯女性生育头胎年龄已趋近西欧,生三个孩子应成为常态,日韩没有特别军事行动,生育率却比俄罗斯还低

极目新闻
2026-09-04 11:26:24
我在西藏旅游,一个喇嘛见我后突然跪下:活佛,我们等了您百年

我在西藏旅游,一个喇嘛见我后突然跪下:活佛,我们等了您百年

千秋文化
2026-01-29 21:35:02
锦鲤女星让大佬很放心!动物女星的公关不专业!

锦鲤女星让大佬很放心!动物女星的公关不专业!

八卦疯叔
2026-09-04 10:30:05
婚外胚胎案最新:警方和法院均认为重婚证据不足

婚外胚胎案最新:警方和法院均认为重婚证据不足

看看新闻Knews
2026-09-03 21:55:20
1.7亿不要!要960万啊!?

1.7亿不要!要960万啊!?

柚子说球
2026-09-04 00:14:02
人人影视回归变正版,会员25元1个月

人人影视回归变正版,会员25元1个月

第一财经资讯
2026-09-03 23:18:00
武大被举报女教授:勾引导师,花10年瓦解其家庭,俩女儿受伤太大

武大被举报女教授:勾引导师,花10年瓦解其家庭,俩女儿受伤太大

小鋭有话说
2026-09-04 11:55:11
手贱一时爽,出事泪两行!网友真实经历又好笑又后怕

手贱一时爽,出事泪两行!网友真实经历又好笑又后怕

阿莱美食汇
2026-09-03 11:17:25
易建联为妻儿建的洛杉矶豪宅烧成灰,如今2000平空地估价曝光,数字让人意外,中介爆出实情

易建联为妻儿建的洛杉矶豪宅烧成灰,如今2000平空地估价曝光,数字让人意外,中介爆出实情

LULU生活家
2026-08-31 15:33:38
毛人凤带人硬闯张治中府邸,正要动手抄家,书房里的一样东西让他冷汗直流

毛人凤带人硬闯张治中府邸,正要动手抄家,书房里的一样东西让他冷汗直流

纪史行者
2026-08-23 02:45:07
52次失误还能赢? 郑钦文用一场“丑陋的胜利”,撕碎美网AI预测

52次失误还能赢? 郑钦文用一场“丑陋的胜利”,撕碎美网AI预测

玫瑰枪口抵心脏w
2026-09-04 07:52:15
深圳"彩电一哥"康佳退市:曾千万签发哥,把张曼玉"印"上飞机

深圳"彩电一哥"康佳退市:曾千万签发哥,把张曼玉"印"上飞机

深圳微时光
2026-09-03 19:02:07
TVB女星公开母亲丧礼惹争议,被批借丧事博流量,白事当喜事拍

TVB女星公开母亲丧礼惹争议,被批借丧事博流量,白事当喜事拍

未来展望
2026-09-04 09:54:06
伊朗终于想起来,中国手里的4千亿美元,成了他们翻身破局关键?

伊朗终于想起来,中国手里的4千亿美元,成了他们翻身破局关键?

浯江孤舟
2026-08-28 09:31:09
2026-09-04 12:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13915文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

梦碎的王子六年后“羞辱”回归 国王表态

头条要闻

梦碎的王子六年后“羞辱”回归 国王表态

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

GPT-6 Astra上线,AGI时代真到来了吗?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

游戏
家居
手机
公开课
军事航空

HD-2D《最终幻想:共鸣》宣布10月22日发售

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

华为CMM-AL00新机入网搭载6615mAh大电池

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版