网易首页 > 网易号 > 正文 申请入驻

LLM驱动的贝叶斯优化:偏好引导科学发现框架

0
分享至

LLM驱动的贝叶斯优化:偏好引导科学发现框架

UNLEASHING LLMS IN BAYESIAN OPTIMIZATION:

PREFERENCE-GUIDED FRAMEWORK FOR SCIENTIFICDISCOVERY

https://arxiv.org/pdf/2605.17976



摘要

科学发现日益受到昂贵实验和有限资源的约束,凸显了在人工智能驱动的科学中实现高效优化的必要性。贝叶斯优化虽因平衡探索与利用而被广泛采用,但在高维设置中常表现出冷启动性能缓慢和可扩展性差的问题,这限制了其在现实世界科学问题中的适用性。为克服这些挑战,我们提出了LLM引导的贝叶斯优化(LGBO),这是首个将大语言模型的语义推理持续整合到优化循环中的LLM偏好引导贝叶斯优化框架。与以往仅将LLM用于热启动初始化或候选点生成的工作不同,LGBO引入了一种区域提升偏好机制,将LLM驱动的偏好嵌入每一次迭代,以稳定且可控的方式偏移代理模型的均值。理论上,我们证明在最坏情况下LGBO的表现不会显著差于标准贝叶斯优化,而在偏好与目标一致时则能实现显著更快的收敛。实验上,LGBO在物理、化学、生物学和材料科学的各种干燥基准测试中一致优于现有方法。尤为突出的是,在一项新的Fe-Cr电池电解液湿实验室优化中,LGBO在6次迭代内达到最佳观测值的90%,而标准贝叶斯优化和现有LLM增强基线则需要10次以上。综合来看,这些结果表明LGBO为将LLM整合到科学优化工作流程中提供了一条有前景的方向。

1 引言

传统实验方法长期推动着科学发现。然而,其劳动密集和耗时的特性持续限制着新见解出现的速度。为缓解这些瓶颈,自驱动实验室将机器人执行与人工智能相结合,实现了系统化、高通量的探索。在这些平台中,贝叶斯优化已成为一种强大策略,在平衡探索与利用的同时,提供了有原则的不确定性量化。

贝叶斯优化已在多个科学领域取得成功,但面临两个众所周知的挑战。第一,早期实验数据的稀缺使得冷启动优化缓慢且低效。第二,高维参数空间带来维度灾难,进一步限制了可扩展性。这些问题往往在最需要贝叶斯优化的场景——即探索性、高成本的科学任务中——阻碍了其应用。已提出了多种加速策略,包括迁移学习、嵌入方法和自适应划分。然而,这些方法均未完全解决冷启动瓶颈。

近期尝试将大语言模型引入贝叶斯优化。第一类工作利用LLM进行预热,让模型在优化循环开始前提出初始设计点。当任务与模型知识良好对齐时,此策略可提供强先验,从而加速原本缓慢的冷启动阶段。第二类工作利用LLM在循环过程中提出候选点,然后由标准采集函数进行重新排序或筛选。这些方法展示了语言先验的潜力,但也存在一个关键局限:LLM的引导仅被松散地嵌入优化循环中——要么仅在初始化时注入一次,要么在后续被采集函数覆盖。这引出了一个核心问题:

我们能否设计一个在整个优化过程中更充分整合LLM偏好的贝叶斯优化框架,而非将其局限于预热初始化或辅助候选点提案?

为此,我们提出了LLM引导的贝叶斯优化(LGBO)框架。LGBO不将LLM局限于一次性建议,而是将其视为专家先验,在整个采集过程中提供偏好和方向性引导。这使得优化器在LLM推理具有信息性时能够加以利用,同时在信号较弱或存在噪声时保持鲁棒性。

我们还在多样化的科学优化任务中评估了这一框架。结果表明,当LLM引导具有信息性时,能够大幅加速贝叶斯优化,而在信号较弱时性能仍具有竞争力。此外,我们提供了确保框架一致性的理论保证。我们的贡献如下:

  1. 我们提出了一种LLM偏好贝叶斯优化框架,通过持续偏好引导将LLM专业知识融入贝叶斯优化,超越了现有的热启动或候选点提案范式。

  2. 我们提供了理论保证,表明对齐的LLM引导能够显著加速收敛,即使在误导性引导下,额外代价也具有可证明的上界。

  3. 我们在广泛的科学优化任务套件上验证了该框架,涵盖多种干燥基准测试和一项湿实验室电解液优化实验,证明了其通用性和实用价值。

2 相关工作

在本节中,我们回顾现有研究并分析其局限性。我们首先介绍将大语言模型融入贝叶斯优化的方法,然后转向人在回路的贝叶斯优化方法,其中专家偏好引导搜索过程,最后讨论这两条线索如何与我们的框架相关联。

2.1 贝叶斯优化中的大语言模型

在回顾LLM如何被整合之前,先回顾一下什么是贝叶斯优化会有所帮助。贝叶斯优化提供了一种在直接测试目标昂贵且耗时的情况下搜索最佳解决方案的方法。其核心思想是将真实目标视为一个“黑箱”:我们可以尝试不同输入并观察输出结果,但我们不知道其精确公式。为使搜索更高效,贝叶斯优化构建一个代理模型——通常是高斯过程——基于已测试过的点来近似该黑箱。在每一步中,该代理模型会随新观测结果而更新,并且定义在代理模型上的采集函数会提出下一个待评估的点。随后从真实黑箱中获得新的输出结果,之后代理模型再次更新,循环往复。

近期,研究探索了利用大语言模型来辅助这一贝叶斯优化过程。LLAMBO利用LLM通过信息丰富的初始点来热启动优化,并基于过往评估生成候选样本。然而,每次迭代的最终决策仍然由代理模型上的标准采集函数做出,使得LLM的推理仅被间接涉及。后续研究在领域特定设置中探索了类似思路。ADO-LLM将LLM辅助的候选点提案应用于模拟电路设计,ReasoningBO则强调了上下文推理如何丰富候选点生成。最近,LLINBO提出了一个更为系统的“LLM在回路中”的框架,专门针对贝叶斯优化的早期探索阶段设计,以解决冷启动问题。此外,在科学发现领域之外,其他领域也涌现出若干LLM-贝叶斯优化方法。例如,BOPRO是一种通过上下文学习将大语言模型作为隐式贝叶斯先验的方法。相比之下,CAKE则利用LLM构建针对特定任务定制的核函数,从而在复杂输入空间上实现结构化且数据高效的优化。

然而,在上述所有框架中,LLM都被视为辅助组件而非回路中的有机组成部分,其引导仅被部分且间接地纳入。这一差距推动了将不断演化的模型偏好持续且系统地嵌入优化回路的开发需求。

2.2 贝叶斯优化中的人类专家

一个自然的灵感来源是人在回路的贝叶斯优化,其中算法利用了专家通常更容易提供偏好或定性指导而非精确数值标签这一事实。早期关于基于偏好的贝叶斯优化的研究形式化了如何将此类比较判断整合到采集策略中。更近期的系统通过建模专家可靠性或通过定向查询逐步获取知识来扩展这一思路,表明即使在不完整或有噪声的情况下,专家反馈也能显著提高样本效率。

ColaBO提供了一个通用框架,其中专家指定一个偏好,优化器根据沿这些采样路径识别出的最佳候选与该偏好的对齐程度,对采样路径进行重新加权。该设计对输入通常稳定且在初始化时一次性给出的人类专家有效。然而,当将LLM作为专家时,出现了两个挑战。首先,由于ColaBO仅接受初始偏好,它无法自然地整合优化过程中更新的引导,使得LLM持续推理的能力未被充分利用。其次,如果偏好随时间被修正,所需的采样路径重新加权将需要持续更新,这可能引入不稳定性甚至发散。这些因素使得ColaBO不太直接适用于LLM引导的贝叶斯优化,并表明需要能够以稳定方式嵌入不断演化的模型偏好的框架。

3 LLM引导的贝叶斯优化

我们提出LLM引导的贝叶斯优化(LGBO),这是一个以稳定且易处理的方式将大语言模型整合到贝叶斯优化中的框架。其关键挑战在于如何在不牺牲数学严谨性的前提下融入外部偏好:标准贝叶斯优化纯粹依赖于数据驱动的后验分布,而针对人类专家的基于偏好的扩展则假设反馈是稀疏的、稳定的或一次性的。相比之下,LLM引导是迭代的、粗略的,且可能带有噪声。直接将此类信号注入采集函数可能使优化循环失稳。

LGBO通过区域提升偏好(region-lifted preference)机制应对这一挑战,该机制将LLM建议转化为轻量级先验,从而偏移代理模型的均值,但保持其协方差不变。这种设计使得语义引导能够持续地被纳入,同时保留贝叶斯优化的统计特性。第3.1节提供标准贝叶斯优化和已有专家引导贝叶斯优化的预备知识,第3.2节介绍作为LGBO框架核心部分的区域提升偏好,第3.3节详述优化循环,第3.4节给出理论保证。

3.1 预备知识

我们首先回顾贝叶斯优化的基本设定以及融入外部偏好所面临的挑战。


3.2 核心工具:区域提升偏好







3.3 LGBO 框架

LGBO 在连续循环中将这些区域提升偏好整合到贝叶斯优化中。LLM 的输出并非直接改变采集函数,而是在每次迭代中重塑代理模型。这既保持了鲁棒性,又允许语义引导随实验数据一同演化。

从热启动到持续引导。先前的方法以有限的方式使用 LLM:要么提供一次性的初始化,要么提供辅助候选点而后由采集函数进行筛选。在两种情况下,引导仅与优化循环松散地连接。LGBO 与这些方法不同,它将 LLM 偏好嵌入到每一次迭代中。在每一次迭代中,代理模型不仅受新收集的实验数据的影响,还受更新的 LLM 偏好的影响,这些偏好通过区域提升先验被系统地纳入。这种设计使得语义信号(如领域启发式或定性趋势)能够在整个过程中塑造代理模型,确保 LLM 推理与数据同步演化,并成为优化循环中持久的一部分。

工作流程。LGBO 循环如图 1 所示,遵循标准贝叶斯优化的结构,但有一个关键修改:在每次迭代中注入区域提升更新。该过程始于初始化阶段,LLM 基于先验知识提供起始点。每次评估之后,高斯过程代理模型被重新训练,并以结构化提示词查询 LLM,该提示词包含固定组件(领域知识、约束条件和所需输出格式)以及一个动态用户提示词,其中汇总了实验历史及上一轮的推理轨迹。随后模型输出一个带置信度分数的点或区域,该输出被转换为区域提升偏好,并作为均值偏移应用于代理模型的均值,同时保持协方差不变。随后采集函数(如 EI 或 UCB)基于此更新后的代理模型选择下一个实验。通过重复这一循环,LGBO 持续整合语义引导,同时采集函数对决策制定保持完全控制。完整的提示词规范见附录 B。


语义引导的优势。这种设计使得 LGBO 能够利用纯数据驱动方法无法触及的 LLM 推理的某些方面。例如,模型可以突出由化学直觉(如“较高温度和较低浓度可能加速反应产率”)或跨领域类比(如在材料成分之间建立相似性)所建议的区域。通过将此类区域信号嵌入代理模型,LGBO 将探索引导至具有科学意义的区域,同时不放弃贝叶斯优化的统计严谨性。

保证。我们的框架提供了两种互补的保证:在引导不相关或具有误导性的最坏情况下,所引发的提升仅会放大代理模型的范数界,因此遗憾值仍保持在标准贝叶斯优化的常数倍以内;当引导与真实目标一致时,有效半径缩小,从而产生更严格的遗憾界(见第 3.4 节)。因此,LGBO 被证明是安全的,同时在偏好具有信息性时能够显著加速收敛。

3.4 理论保证


这种“冻结提升”设定是一个合理的抽象,因为在科学优化任务中,具备领域知识的 LLM 往往表现出结构上连贯的行为:一旦模型识别出与接近最优或高质量区域相关的特征,其建议区域倾向于聚集在相似区域附近,而非在迭代间剧烈波动。因此,固定方向可作为稳定类别区域偏好的代表性替代,同时避免了分析完全自适应序列的技术复杂性。



4 实验

我们在两种设置中评估 LGBO:干燥实验,使用预先收集的公共数据集;以及湿实验,在实际实验室中进行。干燥实验提供有限的设计-响应配对集合,可从中确定离线最优值。虽然该最优值可能与底层物理系统的真实全局最优值不一致,但它可作为算法比较的一致参考。相比之下,湿实验涉及一项正在进行中的任务,数据有限、存在测量噪声且最优值未知,代表了优化必须在实验室约束下进行的现实场景。

4.1 实验设置

基线方法。采用两种代表性方法进行比较:(i) GPBO,使用Matérn-5/2核的标准高斯过程贝叶斯优化框架;(ii) LLAMBO(Liu等),一种最先进的LLM增强贝叶斯优化方法,利用语言模型进行热启动初始化和候选点生成。

实现细节。所有方法使用相同的代理模型(带Matérn-5/2核的高斯过程)和对数 q E I 采集函数。高斯过程超参数在每次迭代后通过边际似然重新优化。每次运行以两次初始评估开始:GPBO使用Sobol初始化,而 LLAMBO和 LGBO为公平起见共享相同的LLM建议点。结果以五次随机种子的均值±方差偏差报告。对于基于LLM的方法,我们使用 Intern-S1-241B,一个科学领域的预训练大模型(Bai等,2025)。提示词的设计使得任务特定目标或种子不被暴露,确保LLM无法依赖记忆的知识。

干燥实验数据集。使用四个基准数据集来评估跨科学领域的通用性。详细规范见附录C:


4.2 干燥实验

图2展示了LNP3的主要结果。性能轨迹(左图)显示LGBO收敛更快且达到比两种基线更高的最终目标值:GPBO受困于冷启动,而LLAMBO改善了早期进展但很快趋于平稳。轨迹热图(右图)进一步显示,LGBO在随机种子间的收敛一致性远高于其他方法,而GPBO和LLAMBO表现出较大的变异性。这种稳定性并非偶然:通过区域提升持续纳入具有领域信息的LLM偏好,LGBO保持了连贯的搜索方向,避免了无信息性的探索。为完整起见,附录D.1提供了采样点的配对图,显示LGBO避免了大范围的无信息探索区域,与其降低的方差和更快的收敛一致。


在其他基准测试中(图3),LGBO一致地实现了更强的性能。在HPLC上,任务噪声很高,所有方法波动均较大,但LGBO仍保持了最高的最终性能。在Cross-barrel上,低维设计空间使GPBO表现尚可,但LGBO达到了最佳的韧性,并在最优值附近进行了更有效的探索。在Concrete上,LGBO和LLAMBO均受益于LLM热启动,但LGBO进一步更快地逃离局部最优,最终获得更高的抗压强度。综合来看,这些结果突显了LGBO在含噪、简单和实际工程设置中的鲁棒性和通用性。


湿实验。在Fe-Cr电解液优化中(图4),LGBO快速识别出有前景的区域,并在第六次迭代时超过最佳观测值的90%,而基线方法需要更多的评估次数。随着优化的推进,LGBO稳步改进其代理模型并集中于高性能区域,获得了更高的最终性能和更低的运行间方差。相比之下,GPBO和LLAMBO探索分散且往往次优的区域;后者进一步受限于采集函数筛选,当高斯过程代理模型较粗糙时,该方法无法利用LLM引导。综合来看,这些结果表明LGBO能够有效地将领域知识转化为加速且更可靠的收敛。


4.3 消融实验

为厘清LGBO中不同组件的贡献,我们在HPLC数据集上进行了两项消融实验,该数据集作为主要结果之外的代表性基准。

不同LLM骨干网络。为评估鲁棒性,我们将Intern-S1替换为不同规模和能力的骨干网络:Intern-S1-mini-7B,以及两个更大的通用大语言模型,Qwen3-235B-Instruct和Qwen3-235B-Thinking。如图5所示,较大的模型表现出更强的稳定性,且当在科学领域进行预训练时稳定性进一步增强。同时,Thinking变体倾向于达到更高的最终值但收敛更慢,很可能是因为在严格提示下,其指令遵循能力较Instruct模型更弱。这些结果表明LGBO不绑定于特定LLM:更大的模型或经过领域预训练的模型可以提供更丰富的引导,但框架本身仍广泛适用于不同的骨干网络。

随机区域提升。我们将LLM建议替换为大小和置信度匹配的随机提升区域。为消除热启动效应,LGBO也使用与GPBO相同的Sobol点进行初始化。如图5所示,随机引导不仅阻止了早期的快速收敛,还迫使优化器花费更多轮次进行探索。这证实了LGBO的优势来源于LLM提供的信息性语义线索,而非仅仅来自提升机制本身。

关于初始化。LGBO和LLAMBO均从相同的LLM建议初始化点开始,这是近期文献中的常见做法。然而,LLAMBO并未达到与LGBO相同的加速效果,这表明增益并非仅来自初始化,而是来自LGBO对LLM偏好的持续整合。

5 结论

本文介绍了LLM引导的贝叶斯优化,一个偏好驱动的框架,通过新颖的区域提升偏好机制将LLM整合到贝叶斯优化中。LGBO在提供持续引导的同时,保留了贝叶斯优化的严谨性。我们建立了遗憾界,表明LGBO在最坏情况下与贝叶斯优化相当,并在引导一致时加速收敛。消融研究证实其增益源于通过区域提升持续纳入LLM偏好,且该框架广泛适用于不同的LLM骨干网络。在四个干燥基准测试和一个新的湿实验室Fe-Cr电解液任务中,LGBO相比GPBO和LLAMBO实现了更快的收敛、更低的方差和更强的鲁棒性,展示了其在科学发现中的前景。

原文链接:https://arxiv.org/pdf/2605.17976

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
抽烟又火了?医生研究发现:心梗病人在抽烟时,多注意3点!

抽烟又火了?医生研究发现:心梗病人在抽烟时,多注意3点!

健康之光
2026-10-05 12:05:12
爆红的是万象城,封神的是立白!它早已默默托举芳村三十年

爆红的是万象城,封神的是立白!它早已默默托举芳村三十年

小蜜情感说
2026-10-05 11:13:33
楼市已达天花板?专家预测5年后房价:大城市20000、小城市3000

楼市已达天花板?专家预测5年后房价:大城市20000、小城市3000

抽象派大师
2026-10-03 03:23:44
再见了鹿晗,再见了朱亚文,再见了童谣,娱乐圈迎来疯狂大洗牌

再见了鹿晗,再见了朱亚文,再见了童谣,娱乐圈迎来疯狂大洗牌

麦芽是个小趴菜
2026-10-05 18:29:43
全网最痛真相:兰越峰被开除根本不冤?不!是整个行业装睡的人赢了

全网最痛真相:兰越峰被开除根本不冤?不!是整个行业装睡的人赢了

后世的君子
2026-10-04 10:29:37
杜伦续约5年2亿后发声:我想终身效力活塞 外界很多说法都是假的

杜伦续约5年2亿后发声:我想终身效力活塞 外界很多说法都是假的

罗说NBA
2026-10-05 05:41:45
3年跌7成!南沙给所有追新区的人,上了昂贵一课

3年跌7成!南沙给所有追新区的人,上了昂贵一课

阿离家居
2026-10-05 17:07:17
祖宗都投胎了,我们纸钱烧给谁?中国人的死后世界的千年BUG

祖宗都投胎了,我们纸钱烧给谁?中国人的死后世界的千年BUG

轩逸阿II
2026-10-03 09:57:23
叶剑英坦言:毛主席用三次“神指挥”,折服了所有的将帅

叶剑英坦言:毛主席用三次“神指挥”,折服了所有的将帅

纪史行者
2026-10-02 06:00:10
视频丨“佤邦联合军”副总司令落网画面公开,住所查获大量珠宝豪车

视频丨“佤邦联合军”副总司令落网画面公开,住所查获大量珠宝豪车

澎湃新闻
2026-10-05 14:44:10
几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

几千块真的可以难倒英雄汉!东莞父亲掏不出女儿高中9300元学费急哭,兜里仅剩3000元

捣蛋窝
2026-09-01 17:05:01
小米新机突然官宣:10月12日开售,国补2299元

小米新机突然官宣:10月12日开售,国补2299元

搞机小帝
2026-10-04 21:47:21
最美的着装,最美的假期,最美的你

最美的着装,最美的假期,最美的你

疾跑的小蜗牛
2026-10-04 20:15:28
越来越多人得胰腺癌,医生揭露凶手,竟是冰箱久放的3种食物

越来越多人得胰腺癌,医生揭露凶手,竟是冰箱久放的3种食物

健康科普365
2026-10-03 22:25:05
港澳豪门一个没到,四太的500人答谢宴到底在办给谁看?

港澳豪门一个没到,四太的500人答谢宴到底在办给谁看?

喜欢历史的阿繁
2026-10-03 06:15:07
吴越官宣喜讯仅1天,携蒋勤勤高调秀恩爱的陈建斌,终于不装了

吴越官宣喜讯仅1天,携蒋勤勤高调秀恩爱的陈建斌,终于不装了

观察者海风
2026-10-05 10:45:28
郑钦文澄清庆祝动作:既不是美少女战士也不是C罗 是《神兵小将》

郑钦文澄清庆祝动作:既不是美少女战士也不是C罗 是《神兵小将》

醉卧浮生
2026-10-05 19:31:46
含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

含大量硼砂,别再给家里人吃了!这10类食物最易掺硼砂,别害自己

健康之光
2026-09-25 07:25:20
波塔波娃宣布结束2026赛季,郑钦文来到武网替补位次第1位

波塔波娃宣布结束2026赛季,郑钦文来到武网替补位次第1位

懂球帝
2026-10-05 03:19:09
美国心血管病发病率下降过半,医生:只因做好了这5件事,速看

美国心血管病发病率下降过半,医生:只因做好了这5件事,速看

健身狂人
2026-10-04 11:52:21
2026-10-05 22:36:49
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

本地
教育
健康
家居
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

聪明的父母,大多是“农民思维”

刷酸祛痘,为什么有人翻车?

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版