Deep Origin本月宣布,其AI药物发现框架在一种癌症免疫疗法酶的筛选中实现了近31%的命中率,比常见的基于机器学习的方法高出近100倍。该公司表示,这一突破得益于其将物理模拟与AI方法相结合的研究路径,其中包括新型共折叠模型(co-folding model)。
![]()
计算药物发现领域的一大挑战在于,既要保证模型的准确性,又要具备泛化能力。基于深度学习的新型共折叠模型,如AlphaFold和Boltz-1,在海量已存分子数据库上训练而成,从而提升了模型的预测能力。在某些场景下,这些模型的准确率可超过80%。
然而,当这些模型面对全新化合物时,准确率会大幅下降,预测哪些配体(ligand)能与哪些蛋白质结合,变得更像是在碰运气。Deep Origin表示,在实际应用中,由于大量假阳性结果的存在,基于AI的虚拟筛选方法仅能发现约1%的新药候选分子。
Deep Origin试图通过其AI药物发现框架来克服这一局限,该框架包含两款产品:DODock——一款融合AI能力与物理原理的分子对接引擎,以及DOScore——用于在超大规模化学空间中估算热力学结合亲和力的引擎。
DODock将扩散模型与基于物理的搜索和优化阶段相结合,后者建立在Vina风格能量函数(DOFast)和增强型全局优化器之上。
"我们的目标是,将学习型组件精准地放在它们能产生价值的地方(生成和排序对接构象),而在泛化能力至关重要的环节,保留一个可解释、低参数的物理模型。"该公司在官网写道。
"一旦机器学习生成了候选构象,一个精简的物理模型会对其进行优化——它基于分子间的物理相互作用进行推理,而非依赖与训练数据的相似性。这些优化后的构象随后被排序,最终输出我们的结构结果。"
Deep Origin表示,物理学的应用使DODock能够建立在第一性原理之上,而非依赖已有数据。这是一个重要的区别,因为它确保了软件在面对全新靶点时仍能保持准确性,而纯AI方法在此场景下准确率会下降。
Deep Origin称,AI与物理建模的结合是其方法的核心差异化优势。将基于C++和Fortran的成熟物理引擎重构为GPU可运行版本,也是一项并非每家公司都能跨越的技术障碍。
"构建物理-机器学习混合系统,需要在量子力学、分子动力学力场和可微分神经网络架构之间实现深度集成,"该公司对媒体表示,"大多数初创公司缺乏将二者融合的架构能力和技术储备。"
该公司由Michael Antonov和Garegin Papoian于2022年创立。公司表示,它对AI驱动药物发现这一挑战持长远视角。
"这不是一次简单的'追逐里程碑'式的短期努力。"
![]()
"虚拟筛选已被广泛应用超过40年,却极少真正产出过药物。"Deep Origin首席科学官Garegin Papoian说道,"这个领域已经习惯了低准确率的上限。我们致力于通过物理学与机器学习的结合来改变这一现状,确保我们的方法在全新靶点上依然保持准确性——而这正是仅靠训练数据无法覆盖的地方。"
零泄露划分(zero-leakage split)也是Deep Origin方法的重要方面。在机器学习中,常见做法是保留一部分训练数据用于评估,以避免"数据窥探"问题。Deep Origin表示,为了测试和验证其AI,他们使用了一种"严格的双重相似性过滤"机制:剔除任何序列同源性达到30%及以上的蛋白质,以及Tanimoto相似度超过0.4的配体。
(Tanimoto相似度是一种用于比较两个对象或集合相似程度的数学指标,1表示完全匹配,0表示完全不匹配。)
综合以上方法,Deep Origin能够在没有已有晶体学数据(关于晶体内部原子、离子和分子的结构信息)或已知小分子配体的情况下,成功针对全新生物靶点进行虚拟筛选。该公司声称,在纯AI和机器学习方法失效的场景中,其构象预测准确率仍能保持在50%至89%之间。
这家总部位于旧金山的公司已融资8200万美元,目前正在BioRxiv上发表一篇论文,介绍其实验室湿实验验证工作——针对一个包含超过800亿种化合物的合成分子库进行了筛选。
![]()
Deep Origin特别强调了四个靶点的筛选结果,包括CD73(核苷酸酶)、IRAK4(激酶)、Factor XIa(蛋白酶)和IL-17A(蛋白质-蛋白质相互作用(PPI)靶点)。
在所有四个靶点上,Deep Origin筛选出的命中分子"展现出高度的骨架新颖性——与已知配体相比,ECFP4 Tanimoto相似度仅为0.22–0.27"。
"我们的筛选发现了全新的化学物质,而非对现有药物的微小改造。"公司表示。
特别是在CD73这一靶点上(CD73在抑制肿瘤生长中具有重要作用),Deep Origin实现了30.6%的命中率——即能找到与该酶结合的配体,这一表现比纯AI/ML方法高出约100倍。
这些结果验证了Deep Origin的方法论,首席执行官Antonov表示。
![]()
"真正关键的是,一个筛选模型在面对无人攻克过的靶点时表现如何——所以我们用严格的数据集划分和专门设计的极限案例来测试我们的模型,"Antonov说道,"决定有多少分子进入实验室后能真正成药的,是模型在这些严苛测试中的表现,而不是被夸大的基准测试成绩。"
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.