![]()
图片来自Chan Zuckerberg Initiative
克里斯汀.豪瑟|撰文
潘展| 编译
生物学家正绕过培养皿,在计算机中借助人工智能驱动的虚拟细胞开展实验。
得益于虚拟细胞技术,药物研发正蓬勃发展。这些由人工智能驱动的活细胞模型,业已成为生物医学研究中不可或缺的工具。它们能帮助科学家在进行实验室前,先通过计算机模拟测试治疗方法,从而节省时间、资金。
01
虚拟细胞发展的历程
人工智能正迅速成为生物学领域最强大的 “显微镜”。顶尖研究中心正借助这项技术开发虚拟细胞——即基于人工智能,对所有生命形式的核心模块进行模拟。其模型可能对健康领域产生的影响,因此再怎么强调都不为过。
“我们的愿景是洞悉细胞的一切:分子结构及其功能,细胞在生命体中的相互作用与运作方式,以及它们的应激反应机制等。若这一愿景得以实现,将在治疗、预防和管理疾病方面为我们提供巨大助力。” 陈・扎克伯格基金会(CZI)一名研究者表示。
为探寻该技术的历史以及未来发展方向,接下来我们将深入探讨虚拟细胞:包括其定义、研发机构,以及它们如何塑造医学的未来。
![]()
02
虚拟细胞首个里程碑突破
首个虚拟细胞诞生于十多年前。为何如今人们对它的关注度才大幅攀升呢?
答案在于,与斯坦福大学团队在2012年所构建的模型相比,如今的虚拟细胞模型其运作方式存在根本性差异。
当时,研究者构建的虚拟细胞将生殖支原体(Mgen)的所有分子过程拆解为28个模块,来实现对该细胞的建模。每个模块都由专属的数学方程式和生物学规则调控,举个简化的例子:“若基因A被表达,则基因B会被激活”。
为制定这些调控指令,该团队查阅了900多篇论文、书籍以及各类数据库,本质上是将科学界关于生殖支原体运作机制的所有已知知识,提炼成了28个算法。模型构建完成后,能够模拟生殖支原体从诞生到分裂的完整生命周期,整个过程耗时约10小时——与真实生殖支原体细胞的分裂时长大致相当。
能够观察这一过程本身就具有重要价值,但虚拟细胞的真正效用在于,研究人员可对其进行实验操作。他们无需借助CRISPR基因编辑技术,只需敲击键盘就能“敲除”某个基因,随后通过运行模拟程序,预测该基因缺失会对生殖支原体产生何种影响。在这个过程中,若发现有趣的现象,再投入时间开展实验。
多数情况下,虚拟细胞的预测结果会与实验结果相符。当二者出现偏差时,问题通常出在那些科学界尚未充分了解的基因上。这一现象合乎逻辑:模型的性能受限于其编程。若科学家想改进模型,就必须更新相关算法。
在斯坦福大学取得这一突破性进展后的数年里,其他研究团队也采用相同方法构建了各自的虚拟细胞:即把已知文献中的知识提炼成基于规则的算法。
03
AI助力虚拟细胞更快发展
如今构建虚拟细胞的人工智能通常采用的是一种名为 “转换器(Transformer)” 的特定模型。谷歌研究人员于2017年首次提出这种AI架构,如今它已成为众多顶尖生成式AI的基础。
基于转换器的AI通过对海量数据集进行训练,学会识别“标记(token,即小型数据单元)”之间的关联。训练完成后,这类AI能通过预测序列中最可能出现的下一个标记,生成新的内容。
转换器是AI最显著的特点之一,能够生成未包含在其训练数据中的内容。例如,一款AI图像生成器即使没有被明确展示过用意大利面条做成的猫应该是什么样子,也能生成一张逼真的照片。
如今,研究人员正基于转换器架构构建虚拟细胞,其成果令人瞩目。例如CZI开发的转录组转换器模型(TranscriptFormer),训练数据集涵盖了1.12亿个细胞的图像、RNA序列及其他生物数据。这些细胞源自12个不同物种,其进化史跨度长达15亿年。研究人员只需向该模型输入所研究细胞的数据,即便该细胞来自未纳入模型训练数据的物种,AI也能预测出细胞类型、感染状态等关键信息。
“展望未来,虚拟细胞模型的目标是成为实验系统的数字孪生体或计算替代物,”哈佛大学助理教授马林卡・日特尼克(Marinka Zitnik)表示,“例如一个经过验证的虚拟细胞可通过计算机模拟药物或基因干预的结果,这有望减少对动物实验的需求,或为实验室研究设计提供指导。”
生物医学研究领域的非营利机构Arc研究所也在开展虚拟细胞研发工作。该机构近期开放了其首个模型——STATE的使用权限,其训练数据包括近1.7亿个细胞的观测数据,以及超过1亿个细胞的扰动数据。扰动数据记录的是细胞在药物、基因编辑或其他外部刺激干扰正常功能时所产生的反应。
研究人员只需输入细胞的转录组(即在特定时刻所有活跃表达的基因的完整集合)以及所设想的干扰因素,STATE就能预测细胞的基因表达模式可能发生的变化。这为科学家提供了一种无需实际开展实验,即可测试疾病治疗潜在效果的方法。
通过反向运行这一过程,STATE甚至能为研究人员指出此前被忽略的有潜力的干预方向。
“你可以选取一个处于患病状态的细胞——比如具有阿尔茨海默病转录组特征的细胞,再选取一个健康状态的细胞,然后问模型:‘我需要进行哪些干预,才能让这个细胞从患病状态转变为健康状态?’”Arc 研究所首席技术官戴维・伯克(David Burke)解释道。
伯克表示,根据干预类型的不同,STATE预测的准确率在40%至60%之间。他认为,当AI预测结果的准确率达到75%时,生物学家就可以开始据此而无需开展真实实验了。
数据可以提升虚拟细胞的稳定性,但虚拟细胞的改进空间究竟有多大,目前仍无定论。若能获取足够多的高质量数据,是否有可能构建出一个单一模型,精准预测细胞在各种可能的干预条件下发生的所有变化,能否开发出一个揭示细胞间相互作用机制的模型,我们是否有能力构建出完整组织、器官乃至整个生物体的虚拟模型。
这些目标如果能实现,生物学领域将迎来转折点——从一门“观察生命”的科学,转变为一门“可模拟、可预测生命”的科学。这将为医学、寿命研究以及对健康的认知带来革命性影响。
https://www.freethink.com/artificial-intelligence/virtual-cells
主题:氧化性左旋核酸与阿尔兹海默病;嘉宾:许代超(中科院上海有机化学研究所生物与化学交叉研究中心 研究员)
:714-6863-0945
![]()
Deep Science预印本
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.