网易首页 > 网易号 > 正文 申请入驻

GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

0
分享至


新智元报道


AlphaFold之后的最大震撼来了。

刚刚,OpenAI 总裁 Greg Brockman转发的一条消息,足以引爆整个科技与医药圈。

知名科学家 Andrew Aiginin 在X上发布了激动人心的消息——

在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强AI!


不仅拿到了跑分第一,Astra 还在短短 1 小时内,直接手搓出了复杂的抗体机理交互式可视化页面。

一直以来,圈内都有一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」

比如 AlphaFold 之于蛋白质折叠,LLM通常只被当成写代码和读文献的辅助工具。

但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!

它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。

而这一切并非偶然。构建该测试基准的顶尖 AI 制药团队Insilico Medicine在 arXiv 上放出一篇21页重磅论文。


标题:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

论文:https://arxiv.org/pdf/2608.18940

这篇论文,不仅首次揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更向我们展示了:从小分子化学合成,到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界!

AlphaFold 之后的科学范式转移,或许才刚刚开始。

37.98分!GPT-6登顶权威「DDD基准测试」

实测结果显示:GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。


AI 学者 Rim Shayakhmetov 发出难以置信的惊叹:

「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」


没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。

发现抗体只是开始,「成药」才是真正的死亡之谷

要理解 GPT-6 Astra 这一成绩的含金量,我们首先得弄懂一个医药界的残酷现实。

Andrew写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」

这句话,道出了全球无数新药研发人员的血泪史。

在过去,当我们谈论抗体药物研发时,大家最关注的是「结合力」。

通俗点说,就是这个抗体能不能精准地像钥匙插进锁孔一样,识别并结合到病毒或癌细胞的靶点上。

早期的AI模型(比如AlphaFold)已经在「预测结合」这件事上做得非常出色了。

但是!能结合 ≠ 能变成药。

这就好比谈恋爱。男女双方看对眼了,一见钟情,这只是第一步。你们能不能走进婚姻的殿堂?能不能经受住柴米油盐的考验?

在药物研发中,这个「柴米油盐的考验」被称为「成药性」。


现实中,无数看似结合力极强的「完美抗体」,一旦进入真实的生理环境或工业生产环节,就会暴露出致命缺陷:

它会不会聚集成团?

它的结构稳不稳定?

它到底能不能表现得像一款真正的「药」?

这些属性统称为抗体可开发性。

这是整个生物制药界的「死亡之谷」。

它导致了一个极其惨烈的局面:全球每年有成千上万个抗体分子在实验室里表现优异,但最终倒在了「成药性」的评估阶段。

药企为此烧掉了几十亿美金,耗费了几年甚至十几年时间,最终颗粒无收。

而今天,GPT-6 Astra 宣布,它能比目前世界上任何其他前沿模型,更精准地预测这些成药性特征。

揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试

有人可能会问:这会不会又是一个「刷榜」成绩?

绝对不是。

Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。

在他们发布的论文中,我们看到了这个测试体系多么硬核。

虽然推文讨论的是「大分子抗体」,但这篇论文展示了该团队在「小分子化学」领域建立评测标准的恐怖深度。了解了这个背景,你才会明白 Astra 的夺冠有多么不可思议。

在论文中,研究团队聚焦了另一个制药界的世纪难题:单步逆合成。



简单来说,逆合成就是「化学界的倒推法」——给你一个目标药物分子,你需要倒推出可以用哪些现成的、便宜的化学原料来合成它。

过去的 AI 评测是怎么做的?

给 AI 一个目标分子,AI 吐出一个合成路径,如果跟已有的专利数据库(比如 USPTO)里的一模一样,就算 100 分。

但这在真实世界里几乎行不通。因为合成路径天生就是「一对多」的,传统的「单一标准答案」评估法,极大地限制了 AI 探索未知的能力。

为此,Insilico 团队构建了令人发指的测试环境:

1.URSA-expert-2026 基准:这是一个包含 100 个由机器生成、并由顶尖人类化学专家手动确认合成可及性的全新分子数据集。它与任何公开的训练数据完全隔离,彻底杜绝了模型「背题」的可能性。

2.ChemCensor 打分系统:他们不看模型是不是完美复刻了专利,而是开发了 ChemCensor 框架,从「反应中心映射」、「官能团兼容性」等最底层的化学物理规则出发,去判断模型生成的反应是否具备真正的化学合理性)。

正是在这种「剥壳见骨」的物理/化学规律考核下,传统的 LLM几乎都失败了。

在早期的 Top-1测试中,哪怕是强如 GPT-5.5、Gemini 3.1 Pro,其表现依然无法超越最顶尖的专用传统化学模型(如 MHNreact、LocalRetro)。

「大力出奇迹」的通用 LLM ,似乎碰壁了。

4500万数据,LLM被「逼出」科学直觉的?

通用 LLM 拼不过专用模型,那该怎么办?

论文给出的答案震撼了业界——不要换模型,换一种激发通用模型潜力的方法。

研究团队在论文中提出了三大杀招,彻底解锁了大模型在化学领域的封印:

第一招:Top-K 提示词范式

既然逆合成是「一对多」,那就不要让 LLM 只猜一次。

团队在 Prompt 中明确要求:「给我 15 种不同的答案」。

奇迹出现了,仅仅是切换到 Top-K模式,几乎所有的大模型(GPT-5.5, Claude Opus系列)在化学合理性和多样性上都迎来了爆发式增长。


Gemini 3.1 Pro 在 Top-15 模式下性能飙升,直接成为最强 LLM 基线。

这证明,大模型是有科学知识的,只是过去的提问方式不对。

第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)

为了训练出专门针对化学限制对齐的语言模型(C3LM),团队不惜算力,利用虚拟合成引擎和 ChemCensor 框架,硬生生构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。


第三招:强化学习中的新颖性奖励


在微调 C3LM 模型时,他们引入了 GRPO 强化学习算法。

奖励函数极其刁钻:模型给出的合成路径不仅要符合 ChemCensor 的化学合理性,而且如果模型能想出一种连 4500 万训练集里都没有、但依然合理的全新反应,将会获得额外的巨大奖励。

结果是什么?

经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中,终于一举击败了 MHNreact 等所有传统专用 SSRS 模型!

数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。


论文的核心结论是:大语言模型不仅能处理自然语言,只要给予正确的环境和激励,它们完全可以掌握最深奥的化学键、官能团和合成逻辑!

降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管

如果你看懂了上面这篇论文,你就会明白 Bogdan 博士为什么会把 GPT-6 Astra 的成绩和这篇论文联系在一起。

在这篇论文中,Insilico 团队费尽九牛二虎之力,用 4500 万条数据微调、用强化学习对齐、用 Top-K提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。

然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!

这绝对是降维打击。

过去,我们要解决抗体稳定性问题,需要专业团队设计专门的三维图神经网络。

而现在的 GPT-6 Astra,它的通用世界模型中似乎已经内化了物理、化学、生物的底层逻辑。

它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样,「直觉」判断出一个蛋白质分子在溶液中为什么会聚集。

此外,Astra 展现出的工程效率同样令人胆寒。

Andrew Aiginin 提到:「顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」

在传统药企,做这样一个系统,整个流程少说也要两三周。

现在,1个小时,一个人,一个通用大模型,就能解决了。

AlphaFold 之后,真正的范式转移

GPT-6在抗体基准上的跑分第一,宣告着通用大模型已经显出AGI雏形,在人类最顶尖智力活动中取得的实质性统治。

这个榜单第一,宣告了这个新时代的到来——

未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的ASI提出正确的 prompt。

小分子逆合成被突破了,大分子抗体成药性被突破了。

从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。

参考资料:

https://arxiv.org/html/2608.18940

https://x.com/gdb/status/2098167375342239957

https://x.com/andrewaiginin/status/2098078245350518884

编辑:Aeneas 大卫

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
5战3场0分!没投射没组织没防守的三无后卫,凭什么留在国家队?

5战3场0分!没投射没组织没防守的三无后卫,凭什么留在国家队?

弄月公子
2026-09-10 23:40:21
列宁遗体每年烧掉100多万,民众要求下葬,普京:我在,谁也不能动

列宁遗体每年烧掉100多万,民众要求下葬,普京:我在,谁也不能动

一姐说军史
2026-09-11 14:42:04
上海体育局给刘翔5个选择! 名记:哪个都不错 但他一个都没看上

上海体育局给刘翔5个选择! 名记:哪个都不错 但他一个都没看上

念洲
2026-09-11 08:14:39
14岁被送上导演的床,17岁拍全裸写真,被操控半生,如今怎样了?

14岁被送上导演的床,17岁拍全裸写真,被操控半生,如今怎样了?

兵卒史
2026-08-15 05:43:32
Lisa现身纽约宝格丽晚宴,彻底恢复韩流铁刘海妆造,粉丝该买单了

Lisa现身纽约宝格丽晚宴,彻底恢复韩流铁刘海妆造,粉丝该买单了

芊手若
2026-09-10 22:28:31
刚上大一的孩子家长赶紧看!大学真正的分水岭,就在开学第一个月

刚上大一的孩子家长赶紧看!大学真正的分水岭,就在开学第一个月

户外阿毽
2026-09-08 15:57:07
侵吞上亿善款?官方发文,宣布54岁韩红新身份,这回真扬眉吐气

侵吞上亿善款?官方发文,宣布54岁韩红新身份,这回真扬眉吐气

冰语历史
2026-09-11 16:15:52
套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

套现146亿后跑路新加坡就能万事大吉?国家新规重拳出击:只要钱还在中国赚,拿了绿卡也照样得补税!申通前老板如意算盘,这下彻底落空了

人生录
2026-08-16 00:05:13
重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

扬子晚报
2026-09-10 15:32:19
1991年法国,姜文与刘晓庆的居家日常抓拍,爱过一场,彼此成全

1991年法国,姜文与刘晓庆的居家日常抓拍,爱过一场,彼此成全

娱你同欢
2026-09-11 11:36:43
WTT澳门赛:5人提前晋级8强!日本队占2席,世界冠军连赢3局翻盘

WTT澳门赛:5人提前晋级8强!日本队占2席,世界冠军连赢3局翻盘

科技社Alpha
2026-09-10 23:59:52
注意!商业地产到期需补缴巨款!

注意!商业地产到期需补缴巨款!

樱桃大房子
2026-09-09 12:12:20
iPhone 18 Pro Max全球价格对比,国行到底贵不贵

iPhone 18 Pro Max全球价格对比,国行到底贵不贵

搞机小帝
2026-09-10 18:30:59
宇树科技跌破2000亿:谁在裸泳,谁在接盘

宇树科技跌破2000亿:谁在裸泳,谁在接盘

懂财帝
2026-09-11 11:24:04
iPhone买对不买贵,目前“最香”的3款苹果手机,已经进入清仓期

iPhone买对不买贵,目前“最香”的3款苹果手机,已经进入清仓期

叮当当科技
2026-09-10 06:58:38
婚前买房、协议公证、不行就滚:21岁张家齐的清醒,到底动了谁的奶酪?

婚前买房、协议公证、不行就滚:21岁张家齐的清醒,到底动了谁的奶酪?

喜欢历史的阿繁
2026-09-10 01:38:11
2026年养老金计发基数陆续公布,9月后,新退休人员都能重算补发吗?

2026年养老金计发基数陆续公布,9月后,新退休人员都能重算补发吗?

碎月导师
2026-09-11 14:27:41
罗永浩连用7个“抄的”吐槽苹果折叠屏iPhone Duo

罗永浩连用7个“抄的”吐槽苹果折叠屏iPhone Duo

上观新闻
2026-09-11 08:40:55
宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

捣蛋窝
2026-09-09 13:59:20
比赖清德更极端!如若2028年她执掌台湾,武力收台或将到来?

比赖清德更极端!如若2028年她执掌台湾,武力收台或将到来?

混沌录
2026-08-30 21:25:08
2026-09-11 17:36:50
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16161文章数 67057关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

游戏
旅游
家居
教育
本地

首届日本恐怖游戏大奖揭晓 《寂静岭f》强势登顶

旅游要闻

阿塞拜疆旅游局官员:阿中旅游合作富有成效

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

为什么越在意孩子感受,孩子越脆弱

本地新闻

拼假 13 天国内长线路线合集

无障碍浏览 进入关怀版