AI智能体是否已经能够可靠地充当科学协作者?它们能否更进一步,作为自主科学家开展工作?Stevens是美国阿贡国家实验室(ANL)计算、环境与生命科学(CELS)理事会副主任、实验室杰出研究员,同时也是芝加哥大学计算机科学教授。在TPC26大会的主题演讲中,他概述了自己如何通过涉及科学论文复现和模型基准测试的大规模实验,来更好地理解利用自主AI智能体加速科学发现所需具备的条件。
![]()
Stevens不仅希望衡量模型性能,还希望评估大规模部署AI智能体的实际需求。这包括测试协调机制以及支持日益复杂的科学工作流所需的资源。
实验中最具雄心的部分之一是教AI智能体如何复现科学论文。虽然复现已有研究听起来不如做出新发现那样令人兴奋,但Stevens认为,复现为衡量当今AI系统的能力和局限提供了一种切实可行的方式。
"这里的基本目标是将论文交给智能体,让它尽一切努力复现这篇论文。阅读论文,梳理出主要思想、主要工具、假设和前提的表格,然后进行并行实现。"Stevens说,"这确实很有意思,可以看到它怎么成功、怎么失败——但这也是做科学的基本构建模块,对吧?我们正试图收集关于吞吐量和所需资源的信息,以及到底需要什么样的资源。"
该项目目前涵盖约100篇论文,要求智能体理解科学方法、识别必要的工具和数据集,并复现已发表的成果。在此过程中,智能体正在生成新的研究问题,帮助Stevens估算最终将AI驱动科学从复现扩展到原创发现可能需要什么条件。
该项目最重要的发现之一是:AI智能体证明了它们能够复现有意义的科学工作部分。Stevens的实验使用覆盖度和与原始结果的一致性等指标来评估每次复现尝试。在目前评估的论文中,智能体在覆盖度上的平均得分约为7.5,一致性上约为8。超过一半的论文在两项指标上得分均超过8。
![]()
性能因研究类型不同而差异显著。数学论文、理论推导,以及基于开源软件和可访问数据集的研究通常产生了最强的结果。在某些情况下,智能体甚至能够改进已发表的成果——实现比原始工作中报告的更低的错误率。Stevens表示,成功复现的最强预测因素是作者是否公开了其代码。
该项目也揭示了重要的局限性。当论文依赖专有软件和不可访问的数据集时,智能体表现不佳。它们在处理文档记录不全的方法或物理实验时也不理想。Stevens观察到,许多科学论文包含从未被明确记录的隐含假设,这使得准确复现变得困难。
尽管存在这些挑战,结果仍然足以令人振奋,推动项目超越了简单的复现。智能体现在正在从其分析的论文中生成后续研究问题,并为未来聚焦原创科学发现的实验奠定基础。结果还使Stevens能够开始估算扩展AI驱动科学工作流所需的资源。最初作为论文复现实验的项目,迅速演变为理解支持大量科学智能体所需基础设施的更广泛努力。
"这确实很有意思,因为它让我们能够通过复现项目中的资源需求推演到——如果你想将科学加速推进到新的开放性问题,可能需要多少资源。"
该项目还被用于估算进一步扩展基于智能体的科学研究所需的条件。在10天内复现1,000篇科学论文将需要数百个并行智能体、大约200,000 GPU小时、数百万CPU小时和数百TB的存储。他将这一推演描述为理解未来AI驱动科学发现基础设施需求的一种方式。
![]()
Stevens表示,团队正在以复现作为基线来估算原创研究所需的工作量。早期结果表明,追求新发现可能需要比复现已有工作多10到30倍的资源——具体取决于问题的复杂度。
如果复现是通向自主发现的第一步,那么Stevens的项目为构建能够加速科学的AI系统的前景与挑战,提供了一个初步的洞察。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.