网易首页 > 网易号 > 正文 申请入驻

AI能否独立开展科研?ASI-Bench为科学自主性建立评测标尺

0
分享至



如果超级智能有黎明,
我们现在大概在黎明破晓前。
天还没亮,但地平线上已经有光了。



ASI-Bench 想做的是在天亮之前,造一把能测量「AI 距离人类智能上限还有多远」的尺子 —— 量一量 AI 到底走到了哪里。

ASI-Bench 是由清华大学人工智能学院助理教授陈勇超联合全球科学家团队,携手麻省理工学院、哈佛大学、卡内基梅隆大学、中国科学技术大学、微软研究院等十余所机构开发的 —— 一个专为衡量 AI 系统科学自主性而设计的基准测试。



  • 论文地址:https://arxiv.org/abs/2608.17271
  • 贡献入口:https://asibench.apexin.ai/submit
  • GitHub:https://github.com/apexin-ai/ASI-Bench

目前 ASI-Bench 已向更多研究者开放贡献:https://asibench.apexin.ai/submit



为什么 ASI 重要

AI 过去几年的强大,主要建立在一件事上:学习人类已经知道的东西,然后更快更准地调用。模型可以在越来越多的考试和 benchmark 上拿高分,但这些高分大多说明同一件事 —— 它理解、调用和重组已有知识的能力很强。

但知识的边界不是这样推开的 —— 不是靠更熟练地调用已知来推开的。

研究本质上都是排列组合。真正具有变革意义的发现,往往不只是对已有知识更高明的重组,而是在概率密度极低的未知地带,找到此前从未被探索过的组合—— 在那些还没被观测、没被概念化、甚至还没被意识到是问题的地带。

面对这些地带,AI 需要自己判断:这个问题该怎么研究?用什么方法?观察哪些现象?如果第一步走错了,能不能自己发现并换一条路?

这不只是推理能力,是创新性和执行力的结合。AI 从掌握已知走向探索未知这一步,就是 ASI 之所以重要的原因。

科学研究是观察这种能力最自然的场景。科研本身就是在不确定条件下探索未知 —— 提出问题、选择方法、执行实验、理解结果、修正方向。它天然同时需要知识、判断和执行。如果 AI 能独立推进一个研究课题,它才开始接近自主智能。

但问题来了:如果无法评测,就没法判断 AI 到底走到了哪一步。

ASI-Bench 是什么

ASI(Artificial Superintelligence)在这个语境下不是科幻概念,而是一个具体定义:AI 从掌握和执行人类已有知识,走向自主探索未知、创造新知识并将其真正执行出来。它需要三样东西同时具备。

通用智能

ASI 不能只在数学、代码或某一个垂直领域里强。它应该能面对不同领域的问题,理解新的科学目标,把研究能力迁移过去。

创新性

ASI 不只是调用已有方法。它需要自己在缺少现成路径时提出假设、选择技术路线、判断什么信息重要,并根据新出现的现象调整方向。创新性最关键的测试条件是:人类不再把完整方法告诉它,只告诉它一个需要研究的方向。

自主执行力

有想法不等于能完成研究。模型还需要把想法变成具体步骤 —— 调用工具、写代码、跑实验、排查错误,最终交付可以检查的结果。

三者缺一不可。只有通用智能没有创新性,模型只是个覆盖面广的知识库。只有创新想法没有执行力,模型提了一堆方向但没法验证。只有执行力没有创新性,模型按人给的方法做得很好,但自己开不了新路。

现在的基准为什么不够用?

现有 benchmark 分别把这三个能力推得很远,但各自只测了一个切面。



Humanity's Last Exam 有 2500 道题覆盖 100 多个学科,前沿模型得分很低,充分体现了知识难度 —— 但它以封闭式问答为主,不要求模型处理数据或选择研究方法。

Terminal-Bench 2.0 的 89 个终端任务前沿系统完成率低于 65%,Agents' Last Exam 最难一级的通过率不到 1%—— 它们测了长程执行,但任务目标和验证标准已经给定,重点是把活干完,不是决定该干什么。

没有一个 benchmark 同时测通用智能、创新性和执行力。也没有一个 benchmark 在同一个科研项目里系统地逐步撤去人类的方法指导,看 AI 自己还能走多远。

ASI-Bench做的就是这件事。

ASI-Bench 怎么工作

ASI-Bench 的机制不复杂,但逻辑很直接:同一个科研项目,同一个输入数据,同一个评分标准,只改变提供给模型的方法论信息量。

设计核心是信息梯度。



同一个科研项目,喂给 AI 四次,每次给的指导量不同:

  • B1 给完整方法和实现步骤,测的是执行力 —— 你能不能照着做。
  • B2 只给方法名称,不给细节,测的是能不能把方法名变成可执行的流程。
  • B3 什么都不给,只有科研目标、原始数据和约束条件,AI 得自己选方法、搭流程、跑实验、判结果 —— 这是创新性的核心测试。
  • B4 在 B3 基础上加一些正确但无关的干扰信息,看 AI 会不会跑偏。

B1 到 B3 的差距,就是模型对人类方法指导的依赖程度。它直接回答一个问题:人类一步步放手,模型到底还能走多远?

60 道题覆盖 11 个领域 —— 数学、物理、化学、生物、天文、材料、地球科学、医学 / 生物统计、计算机、机器人、电子工程 —— 不同领域的知识结构、数据形式和方法选择完全不同,同一个系统必须在全部领域接受评测,没法只靠某个垂直能力吃分。

结果是什么?

在 60 个 project-level 科研任务上,团队测试了 Codex、Apex Research、Claude Code、Kimi Code、MiMo Code 和 OpenHands 6 种 agent harness,搭配 GPT-5.5、GPT-5.6 Sol、Claude Opus、Kimi、DeepSeek、GLM、MiniMax、MiMo 等不同 backbone model,共形成 18 组 Harness× Model 组合。



当模型在 B1 条件下获得完整方法指导时,18 组配置的平均 Scientific Score 为 50.92 分;当指导逐步减少,到 B3 中不再提供具体方法时,平均分下降到 27.17 分,相比 B1 下降 23.75 分,接近一半。

这种下降并不只发生在较弱的模型上。

表现最好的组合 Codex + GPT-5.6 Sol (ultra),在 B1 中得到 71.78 分,在 B3 中也下降到 51.60 分;这已经是全部 18 组配置中 B3 的最高成绩。另一个例子是 Claude Code + Claude Opus 5:B1 得分达到全表最高的 72.29 分,但在减少方法信息后,B3 只有 40.70 分。

最大的性能损失发生在第一次撤掉详细方法指导时:从「提供完整方法」的 B1 到「只提供方法名称」的 B2,所有配置平均下降 21.28 分。之后从 B2 到 B3,平均分只进一步下降约 2.47 分。

这意味着,真正决定模型能否完成这些科研任务的,并不只是有没有一个方法名称,而是当详细的方法路径不再由人类提供后,模型能否自己完成科学建模、方法选择和研究路径设计。

进一步的失败分析也呈现出相同趋势:62% 的失败集中在科学决策环节,包括科学建模、方法选择和鲁棒性判断;只有约 26% 属于纯数值执行问题。换句话说,当前 AI 在这些任务上的主要瓶颈,并不是 “算不对”,而是在人类指导退出之后,不知道应该算什么、为什么这样算,以及下一步应该怎么做。

分数低不是 benchmark 的缺点。恰恰相反,它说明这把尺子还有足够大的区分空间。

凭什么相信这些数字

高难度但不可靠的 benchmark 没有意义。题目本身、参考结果和评分方法都可信,分数才有意义。

ASI-Bench的每个任务都经过四个阶段构建:有来源依据的科研问题收集、领域专家筛选与任务工程化、AI 辅助审计加四轮人工审查、沙箱端到端执行验证。

四眼原则、双人复核制(Four Eyes Principle/Four-Eyes Check)

第一轮,每个任务至少分配给两名非作者 reviewer 独立审查。第二轮重新分配 reviewer,检查上一轮的修改是否落实。第三轮重点做 B1-B4 的 agent trajectory 分析。第四轮优先由同领域 reviewer 检查,再加一轮 Claude Code scan。

AI 审计不只查文字。它检查科学逻辑、prompt 层级、参考文件、评分代码、信息泄漏和 agent 轨迹,重点识别目标与 scorer 不一致、隐藏信息泄漏、硬编码答案和非预期捷径。

每个任务还要通过沙箱端到端执行:环境检查、reference solution 自评、受限工具运行、matched instances 和 controlled random seeds。reviewer 继续查结果文件、日志和中间轨迹,发现 runtime failure 或评分不一致就返修。

做对科学问题,才能拿高分

Richards-Topmodel 水文模型任务,最能说明团队的工作方式。

任务构建过程中,团队发现 generic baseline 拿到了过高分数,评分 rubric 没有抓住核心科学机制,模型不需要真正理解水文过程就能得分。这是不能接受的。

于是团队重新调整了权重、单位和边界条件:调整后,generic baseline 降到 11.3-17.0,正确方法拿到 89.5-100,reference 拿到 100。分数分布回到了它应有的样子。

一个 task 的构建,不只是写 prompt。反复检查科学机制、评分逻辑和真实模型行为,直到做对科学问题与拿到高分真正一致,这是团队对每一个任务的标准。



ASI-Bench 适合谁

模型团队:

如果你做了一个新的基础模型或推理模型,除了想在已有 benchmark 上把分数提高几个百分点,还想证明自己真的更聪明 —— 来跑 ASI-Bench。尤其是在 B3 低信息条件下涨分,比在 B1 涨分更能说明智能层面的进步。

AI Scientist/AI for Science 方向的开发者:

如果你做了一个 AI Scientist 系统或研究 agent,想知道它离开完整人类指导后还能不能把研究做下去,来跑ASI-Bench。四层梯度能告诉你问题出在哪:B1 到 B2 掉得多,说明知道方法名但实现不出来;B2 到 B3 掉得多,说明能实现给定方法但不会自己选方法。

Agent 框架开发者:

如果你想比较不同模型或不同 agent 架构 —— 同一个模型搭不同 harness,或者不同模型搭同一个 framework,ASI-Bench的项目级任务比短任务更有区分度。

现在分数还很低,benchmark 远未饱和。任何显著提升,都是系统在更高阶智能能力上真正进步的证明。如果你认为自己的模型真的更聪明了 —— 来ASI-Bench上证明它。



来自社区,也需要社区:你将定义 ASI 的未来

ASI-Bench 的第一版 60 道题,来自多个学科领域研究者的贡献—— 清华大学、MIT、CMU、中科大、波士顿大学、伊利诺伊大学香槟分校、昆士兰大学、Flatiron Institute、Microsoft Research 等机构的研究者参与了任务构建和审查。

衡量 Superintelligence 的标准,不可能由一个团队单独定义。



团队希望更多研究者贡献自己领域真正有价值、足够困难的任务。你可以通过以下方式参与:

  • 提交课题想法:你所在领域里真正困难、有研究价值、适合检验 AI 能力的问题
  • 构建完整任务:数据、环境、输入输出、参考结果和运行方式
  • 设计评分 Rubrics:什么样的结果算完成,关键步骤是什么,怎么计分
  • 审查与反馈:发现已有任务的问题,提出修正建议
  • 提交运行结果:用自己的模型和 Agent 跑分,提交可验证的结果

当未来的 ASI 系统真正具备独立开展科学研究的能力时,评估这种能力的标准将由我们今天共同定义。让下一代 AI 面对的不只是人类已经写下答案的问题,而是人类真正希望它帮助解决的问题。

ASI-Bench 是通往超越人类智能上限之路上的第一把刻度清晰的尺子。

天还没亮,但我们已经可以开始量了。它已经告诉我们一个初步的结论:当前 AI 离真正的自主科研还有明显的距离 —— 能执行不等于能独立,能完成指定任务不等于能自主决定研究路径。这个距离,正是接下来需要一步步缩短的。

欢迎更多团队、研究者和模型来ASI-Bench上跑分、提交任务、一起完善这把尺子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全网呼吁手机涨价再狠一点

全网呼吁手机涨价再狠一点

老斯基财经
2026-09-05 15:55:42
47岁秦岚冻龄真相:我从不跑步,因为跑步真的会“垮脸”

47岁秦岚冻龄真相:我从不跑步,因为跑步真的会“垮脸”

小方说跑步
2026-09-04 13:57:40
库皮扬斯克北:乌军重大突破

库皮扬斯克北:乌军重大突破

YY团长
2026-09-06 08:02:13
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
18.6 万美金!唐斯把布伦森卡给买了!!

18.6 万美金!唐斯把布伦森卡给买了!!

柚子说球
2026-09-05 19:03:46
不止陪睡陪玩!强吻袭胸摸腿,乱象有多荒诞,权力才是骚扰的底色

不止陪睡陪玩!强吻袭胸摸腿,乱象有多荒诞,权力才是骚扰的底色

喜欢历史的阿繁
2026-09-06 14:09:13
签证申请暴跌96%:日本收紧外国人政策,代价初显

签证申请暴跌96%:日本收紧外国人政策,代价初显

澎湃新闻
2026-09-04 12:59:30
阿隆索曾力劝切尔西引进皇马中场,如今居莱尔已是皇马阵中的 “灯塔”—— 擅长用直塞球穿透对手防线

阿隆索曾力劝切尔西引进皇马中场,如今居莱尔已是皇马阵中的 “灯塔”—— 擅长用直塞球穿透对手防线

福酱的小时光
2026-09-06 12:09:45
每体:滕哈格表示奈斯塔德想留队,巴萨一度提出800万欧报价

每体:滕哈格表示奈斯塔德想留队,巴萨一度提出800万欧报价

懂球帝
2026-09-06 14:25:35
苹果首款折叠屏新命名出炉:iPhone Duo 下周正式揭晓

苹果首款折叠屏新命名出炉:iPhone Duo 下周正式揭晓

快科技
2026-09-05 08:18:13
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

LULU生活家
2026-09-02 19:51:47
9至10月大督查来袭!中央巡视国务院暗访全覆盖,3类问题重点严查

9至10月大督查来袭!中央巡视国务院暗访全覆盖,3类问题重点严查

生活魔术专家
2026-09-06 12:56:20
武大师生持续发酵!教授过往经历被深挖,网友:白眼狼,没良心!

武大师生持续发酵!教授过往经历被深挖,网友:白眼狼,没良心!

金哥说新能源车
2026-09-06 02:21:47
她是窦唯的女儿,12岁患精神疾病,24岁前3次进ICU,她与窦靖童为何同父不同命?

她是窦唯的女儿,12岁患精神疾病,24岁前3次进ICU,她与窦靖童为何同父不同命?

黎兜兜
2026-09-05 21:08:32
太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

太过分了!凤姐下场连发帖子撕景甜,评容貌、咒断子绝孙,引发网友怒骂

火山詩话
2026-09-04 06:34:14
心理学:但凡见到一个男人两手空空、脚穿旧布鞋,但气场很出众,他绝对大有来头

心理学:但凡见到一个男人两手空空、脚穿旧布鞋,但气场很出众,他绝对大有来头

心理观察局
2026-09-06 07:13:08
吃人血馒头的印度,即将遭受天谴

吃人血馒头的印度,即将遭受天谴

百味朱砂
2026-09-05 13:41:33
行母习惯玩剧组夫妻!黄磊投资综艺亏麻了!

行母习惯玩剧组夫妻!黄磊投资综艺亏麻了!

八卦疯叔
2026-09-06 10:20:06
从休赛期狂练到主动休息,KD的转变让训练师都意外

从休赛期狂练到主动休息,KD的转变让训练师都意外

竞技风云录
2026-09-05 12:13:09
稻盛和夫:人必须出门,必须社交,必须见不同的人——脑子才会思考,才感觉自己活着

稻盛和夫:人必须出门,必须社交,必须见不同的人——脑子才会思考,才感觉自己活着

杏花烟雨江南的碧园
2026-08-30 15:15:03
2026-09-06 14:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13924文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

头条要闻

男子官网订购特斯拉到外地提车 晚到10分钟未领到补贴

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

家居
房产
亲子
艺术
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

突发重磅!海口出台楼市新政!

亲子要闻

平时忙碌,亏欠了孩子很多陪伴。趁着闲暇,带两个小朋友出门撒欢,看着他们开心奔跑的样子,瞬间觉得一切都值得,简单的幸福莫过于此。

艺术要闻

有光的静物花卉,俄罗斯当代画家维罗尼卡·洛巴列娃

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版