网易首页 > 网易号 > 正文 申请入驻

全球竞逐RSI,这支华人团队已跑通规模化闭环

0
分享至

10 月 6 日,OpenAI 公开了 AI 产出的 722 篇数学论文,包括准黎曼猜想的相关证明。前 Google 科学家、xAI 联合创始人 Christian Szegedy 表示,数学家穷尽一生攀登的险峰,机器可乘飞机直接抵达。但 Szegedy 认为,数学不是走向终结,而是探索方式的改变 —— 人们可以借助飞机,抵达更多未境之地,他自己对此兴奋不已。

这架飞机,能否继续飞向更广阔的科学与工程前沿 —— 从癌症机理、衰老干预,到尚无成熟路径的复杂工程难题?

全球 AI 实验室正将目光投向 RSI(递归自我改进):让 AI 不只完成任务,还能参与下一代 AI 的设计、训练与改进。这场系统性探索才刚刚开始,大多数探索尚处于早期。

而一支华人团队,已经把 RSI 带入了规模化运行。它打造的 Novix,将自我改进机制嵌入真实的前沿算法与工程任务,让 AI 在解决问题的过程中,持续吸收顶尖专家的判断与反馈,并将这些经验用于自身的下一轮改进。



官网链接:Novix.science

成立仅半年,Novix 通过口碑传播,已服务 20 万名专家,覆盖 40 多个国家和地区、500 多所高校及科研机构。用户中包括来自清华大学、北京大学、苏黎世联邦理工学院、剑桥大学、卡内基梅隆大学、南洋理工大学、新加坡国立大学和东京大学等机构的研究者。

不同学科和领域的实际研究已经在平台上展开:水坝群如何进行生态泄洪调度,钢材在未知地震加载下会有怎样的循环响应,低成本空气质量监测网络如何实现跨站点校准、城市干道协同控制、金融市场高频流动性建模,还有 AI 模型的后训练。

Novix 由石宇、汤嘉斌等人创立,核心成员来自 Google、微软、Meta、智谱和 Kimi,曾主导或参与 Microsoft Copilot、Kimi K2、AgentOS 和 AutoAgent 等项目。

这支华人团队为什么能率先把 RSI 推向全球规模化闭环?

答案在于,Novix 在产品、系统与算法层面,重新定义 AI 与人类顶智专家的协同进化关系。Novix 将这套机制称为 Co-Evolutionary RSI—— 协同进化式 RSI。

“机器负责加速边界的探索,人类把价值、审美和选择持续写进系统。” 石宇说。“两者共同组成一个持续运行、自我改进的智能进化系统。”

在这个回路里,AI 主动提出方向、展开解空间、执行任务并验证结果;专家持续反馈什么是重要的问题、什么证据足以成立、采用怎样的评价标准(rubrics),以及哪些方向符合自己的审美与长期判断。每一次采用、否决、纠偏和反馈,都会成为下一轮探索的新目标与新标准,并进一步改进系统的任务分解、工具使用、harness 与模型能力。

真实高难任务持续暴露系统的能力边界,专家反馈不断推动系统进化,进化后的 AI 再去解决更难的问题。Novix 规模化的,正是这个在前沿算法与工程领域中持续运行的 RSI 飞轮。

石宇说:“能真正把 RSI 做到规模化的,一定是最能杠杆人类顶尖专家审美的系统。”

让每位科学家都有自己的 AI 自主实验室

Novix 在与全球专家的持续协作中,学习每位研究者关注的问题、判断证据的方式与探索偏好,再主动提出候选方向并完成验证。科学家在关键节点选择继续、暂缓或纠偏,也可以重新定义评价标准;这些判断随即成为下一轮探索的起点。

把这种关系放进一个典型的材料研究场景:一位 PI 不必每天给系统写出完整任务,只需在候选方向中判断哪些值得推进、哪些证据不足、哪些异常值得追问;余下的探索、实验和验证由 AI 持续展开。随着判断不断积累,系统逐渐形成贴合这位研究者的探索路径。

为了探索那些连人类都尚未知晓答案的领域,最重要的是研究解空间中最值得推进的下一步。科学家的每一次选择,都在告诉系统什么是好问题、怎样判断证据、愿意承担怎样的风险,以及什么结果真正有价值。同一个基础模型,因此会沿着不同专家的 taste 生长出不同的探索路径。





不同领域的人机协同进化环境。在酶工程(图上)中,一个 “提高工业酶性能” 的目标,逐步变成关于突变组合、实际反应条件和实验取舍的具体问题;在离散扩散语言模型(图下)中,一个新型文本生成方向,逐步展开为训练、生成速度、推理能力等不同研究路线

汤嘉斌表示:“通用模型倾向于提出近似相同的问题分布,而人类专家的反馈才是决定 RSI 系统在探索人类未知时的种子变量。”

协作越久,任务分布、判断标准、失败记录和探索脉络越完整,最终沉淀为属于个人或实验室难以复制的研究资产和数据壁垒。这些数据保留在专属空间中,只服务于对应的用户或组织。

会做,正在成为 Agent 的标配;知道什么值得做,才是探索式智能的分水岭。Novix 不等待科学家交付一张完整的任务清单,而是持续发现、筛选并验证值得推进的下一步。

当 AI 把执行与验证的边际成本压到接近于零,决定研究上限的就不再是 “能试多少次”,而是 “知道什么值得试”。执行被无限放大,科学家的 taste 就成为智能进化的方向盘。

Novix 想要放大顶尖专家判断的作用半径。过去,这样的判断可能只能影响一名学生、一个项目或一次实验,如今被转化为持续驱动 AI 探索知识边界的系统变量。

团队产品合伙人施蓓提到 “衡量这套系统的尺度,不是一次完成多少任务,而是专家的一次判断能把探索推进多远。”

三个前沿任务中的 RSI 闭环

方向确定后,Novix 会组织多个 Agent 调度算力、处理数据、设计方法、搭建环境并运行训练或仿真。科学家不必介入每次工具调用,只在证据、标准或方向需要变化时介入。石宇把科学家一次判断所能支撑的探索方向的优化,称为 “人类审美的杠杆”。

前沿科研不是把既定任务一路跑到底:实验会推翻假设,新证据会迫使系统修改策略,局部指标的提升也可能让研究偏离真正的问题。“产品与系统机制的设计必须容纳这个过程。” 石宇说。

因此,Novix 把材料、目标、评价标准、工具调用、中间产物和失败记录保留在同一工作空间。研究者不必盯住每一步,却能在需要时追溯系统为什么修改参数、哪条路径失败、偏差从哪里出现。失败不是被清理的噪声,而是系统资产:它既告诉 Agent 哪条路走不通,也暴露工具、环境、评估器和模型还缺什么。

三个公开任务提供了更具体的观察窗口:训练模型、调度复杂基础设施、预测材料在未知工况下的响应。它们过去都高度依赖顶尖专家的持续参与。

让 AI 自主端到端完成模型后训练

这是 RSI 核心的一类任务:Agent 直接参与模型能力的训练与选择。Novix 自主完成数据构造、训练代码、SFT、GRPO 或 RFT、检查点比较与最终交付。在 SynLogic 的 135 道固定评测题上,Qwen2.5-7B 准确率从 8.89% 提升至 37.78%;在 ScienceWorld 的 30 项代表任务中,Qwen2.5-7B-Instruct 平均得分从 11.2667 提升至 35.6333。



过程中还有一次堪称 “神来之笔” 的判断:后续强化学习的训练 loss 仍在下降,Novix 却发现模型在真实任务探针中的得分从 38.7 跌至 21.1—— 模型只是更会拟合训练轨迹,却没有变得更会解决问题。Novix 主动否决了这次更新,恢复并交付表现更好的模型。AI for AI 最关键的能力,不是让每一轮训练都继续,而是判断模型是否真的变得更聪明,并在必要时停止、回退和重新选择进化方向。



更重要的是,这些训练任务不只改进被训练的模型。数据、日志、失败路径与评测结果也会回流 Novix,用于改进它自身的任务分解、工具选择、评估器和模型,由此形成 AI for AI 的递归闭环。

在多约束情况下求解联邦水坝耦合控制

在一项基于真实河流记录的泄洪调度模拟任务中,Novix 需要为哥伦比亚河与斯内克河上的八座水坝逐小时分配泄洪量。泄洪能帮助幼鱼绕开发电机组,却会抬高水中的总溶解气体,带来生态风险;上游的调整还会延迟影响下游。

在约 3.57 小时的有效用时内,Novix 完成了 578 次工具调用,反复数据处理、算法开发、运行实验,并根据反馈持续修正预测与控制策略。它发现一处气体传播时距被错误设为 44 小时,重新推导后将其修正为 16 小时;还发现,预测误差降低并不必然改善调度效果,于是放弃跨季节表现不稳定的方案,转而根据预测误差对调度成本的影响重新设计优化目标。候选方案形成后,验证仍在继续 —— 它不仅检查预测是否准确,还检验这些预测能否带来更好的决策。



Novix 在发电要求、气体上限和复杂运行规则之间,找到八座水坝协同运行的控制策略。

最终,Novix 在研究期间不可见的 16 个独立测试周中取得 0.719264 的得分,较题方专家参考方案高出 6.50%,所有控制指令均通过执行约束检查。它交付的不是一份泛泛的调度建议,而是一套能够逐坝、逐小时输出决策的可执行控制器。这个案例展示了 Novix 如何通过持续调用工具、纠正预测和调整策略,把一个复杂问题推进到经过验证、可以运行的结果。

预测钢材在未知地震加载下的循环响应

地震发生时,钢结构会反复承受拉伸和压缩。要预测它在这样的过程中如何变形,不能只看某一次受力:此前经历了什么,也会影响材料接下来的表现。因此,从已有试验中建立的模型,能否适用于另一种受力过程,是材料研究中需要检验的问题。

Novix 从已有拉伸和循环试验出发,自主提出本构假设、修改数值实现并反复验证。在 60 个研究期间不可见的加载历程上,它取得 0.620034 的题方保留测试得分,约为专家参考解 0.310910 的 1.99 倍,所有实例均返回有效结果。





60 个实例全部生成有效结果,且全部超过基础方案。证明 Novix 能够从有限的既有试验中提出本构假设、构建模型、完成参数标定,再把获得的材料规律迁移到从未见过的加载路径上

这些任务的共同点在于,答案无法一次生成,必须在实验、失败和评价中不断收敛。

而每一次收敛留下的数据、失败路径与专家判断,都会回流系统,成为下一轮探索的起点。这也正是 RSI 闭环在真实任务中的样子。

更强智能时代的人机关系

石宇曾在微软参与 Microsoft Copilot 从零到亿级用户的增长,并作为 MS AgentOS 创始产品经理推进前沿 AI 产品化。汤嘉斌拥有香港大学博士学位,曾参与 Kimi K2 后训练,并主导 AutoAgent 和 AI-researcher 开源项目。

团队其他成员包括来自 Meta、微软的算法研究人员,以及具有 Google、微软和 Amazon 产品经验的成员,覆盖模型后训练、Agent 系统、基础设施与产品设计。这组背景也解释了 Novix 团队为什么会把模型改进、Agent 系统和用户长期协作视为同一个问题。

他们在实践中愈发感到,顶级专家不是一份等待 AI 提取完毕的静态知识库。他会被新证据说服,会对意外结果产生兴趣,也会放弃过去坚持的解释。AI 带回的新发现会改变人的判断,人的新判断又会改变 AI 的下一轮探索。Co-Evolution 让双方在不断出现的新问题中共同进化。

即便 Agent 有一天超越人类既有的智力边界,这种协同仍会继续产生价值。开放式任务的方向会在真实任务、专家反馈和新的科学发现中不断演化;越多具有不同 taste 的专家进入回路,系统获得的目标、标准和现实约束就越丰富,能够抵达的知识边界也越广。

更强的基础模型会抬高所有人的能力下限,却不会抹平不同研究者的问题意识。通用能力决定 AI 能做多少事,长期协作形成的 taste 决定这些能力被用于什么问题。两条能力轴线相互正交:基础模型越强,个体化探索引擎的分化价值反而越大。

RSI 越向前发展,人类最稀缺的判断越会成为智能递归的关键变量。

Novix 已经把这场 Co-evolution 做成了一座每个科学家都能拥有的 AI 自主实验室。在这里,AI 不知疲倦地展开探索,科学家不断收获研究成果,用并自己的 taste 决定什么值得进入下一轮研究。

这也是 Novix 正在验证的协同进化 RSI 路径 ——AI 探索未知,人类选择未来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
友邦倾覆之后:叙利亚与委内瑞拉变局中的中国利益账

友邦倾覆之后:叙利亚与委内瑞拉变局中的中国利益账

民间胡扯老哥
2026-10-09 08:03:18
必须严惩!乒协和警方同时出手!42岁王皓被上百人围堵辱骂,家人无辜被牵连,1年前樊振东的话又应验了!国乒饭圈这剂毒药,终究捅破了天

必须严惩!乒协和警方同时出手!42岁王皓被上百人围堵辱骂,家人无辜被牵连,1年前樊振东的话又应验了!国乒饭圈这剂毒药,终究捅破了天

锐评利物浦
2026-10-09 08:52:51
火箭一夜4消息!申京晒姚明合影,队记曝欧文交易筹码+KD减负计划

火箭一夜4消息!申京晒姚明合影,队记曝欧文交易筹码+KD减负计划

锅子篮球
2026-10-09 09:22:39
曾拒唱国歌!前U17国足核心消失18个月后改过自新:我热爱中国

曾拒唱国歌!前U17国足核心消失18个月后改过自新:我热爱中国

念洲
2026-10-08 21:37:15
30万养出“共享女友”?B站百万粉博主被绿,自己连小三都算不上,顶多算小十一

30万养出“共享女友”?B站百万粉博主被绿,自己连小三都算不上,顶多算小十一

杭城村叔
2026-10-09 09:05:58
触目惊心!沙特惊现大规模伤亡!伊朗炸毁美使馆,美方曝损毁全貌

触目惊心!沙特惊现大规模伤亡!伊朗炸毁美使馆,美方曝损毁全貌

铁锤简科
2026-10-07 13:23:43
没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

没想到,负债累累的前夫黄有龙,竟给50岁赵薇留下“一手好牌”

妙知
2026-10-03 13:49:21
内鬼浮出水面!柬埔寨电诈园区幕后黑手,竟是我们信任的商会会长

内鬼浮出水面!柬埔寨电诈园区幕后黑手,竟是我们信任的商会会长

梦史
2026-06-22 23:45:10
至亲逐一离世,蒙嘉慧看淡名利,“我已经没有赚钱的欲望”!

至亲逐一离世,蒙嘉慧看淡名利,“我已经没有赚钱的欲望”!

BenSir本色说
2026-10-08 23:36:34
不出意外,中超第27轮冠军+一个降级队产生!蓉城和海牛拿1分谁更难?

不出意外,中超第27轮冠军+一个降级队产生!蓉城和海牛拿1分谁更难?

刀锋体育
2026-10-09 10:57:13
尊界汽车回应“V800刹车踏板支架断裂”:自首批车辆交付以来,在用户实际使用中,未发生制动踏板支架底座断裂故障;将提供免费升级选择

尊界汽车回应“V800刹车踏板支架断裂”:自首批车辆交付以来,在用户实际使用中,未发生制动踏板支架底座断裂故障;将提供免费升级选择

极目新闻
2026-10-08 21:23:02
特略:现在的巴萨就像压路机;若在12年的巴萨亚马尔很难首发

特略:现在的巴萨就像压路机;若在12年的巴萨亚马尔很难首发

懂球帝
2026-10-08 18:13:28
太突然!WCBA开赛在即,5大国手却集体缺席!中国女篮4人将齐聚澳洲!27岁李月汝6个字官宣新赛季去向!真相没那么简单

太突然!WCBA开赛在即,5大国手却集体缺席!中国女篮4人将齐聚澳洲!27岁李月汝6个字官宣新赛季去向!真相没那么简单

篮球热嗖
2026-10-09 08:53:40
二刷《兰香如故》才看懂:韩粱冻死宫门外,不是愚忠,是拿一颗人头布下的“换命局”

二刷《兰香如故》才看懂:韩粱冻死宫门外,不是愚忠,是拿一颗人头布下的“换命局”

喵喵的追剧笔记
2026-10-08 22:06:50
没忍住?日本21岁女警和29岁男警多次发生关系,把警局当酒店

没忍住?日本21岁女警和29岁男警多次发生关系,把警局当酒店

老头的传奇色彩
2026-10-05 20:00:51
53岁蔡少芬一家韩国被偶遇!脸部凹陷瘦成干尸,皮肉松垮不敢认

53岁蔡少芬一家韩国被偶遇!脸部凹陷瘦成干尸,皮肉松垮不敢认

冰语历史
2026-10-07 15:29:54
高市早苗该对日本政商界给予适当尊重,注意言行

高市早苗该对日本政商界给予适当尊重,注意言行

新民周刊
2026-10-09 10:14:05
断送补给47天,仁爱礁57号舰上菲军支撑不住了,开始有人紧急就医

断送补给47天,仁爱礁57号舰上菲军支撑不住了,开始有人紧急就医

史智文道
2026-10-09 11:53:01
总人口没到我国1%,研发战机比美俄更先进,武器从不依赖进口

总人口没到我国1%,研发战机比美俄更先进,武器从不依赖进口

雪儿爱追剧
2026-09-23 17:01:06
冯禧与许嵩婚后首次晒照,素颜逛动物园,配文“咱俩好像撞纹儿了”

冯禧与许嵩婚后首次晒照,素颜逛动物园,配文“咱俩好像撞纹儿了”

娱乐嗑学家.
2026-10-07 18:49:20
2026-10-09 13:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14159文章数 142748关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

男子看房发现有十几个人急交10万定金 回家感觉不对劲

头条要闻

男子看房发现有十几个人急交10万定金 回家感觉不对劲

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

财经要闻

日薪120元,我给机器人当“老师”

汽车要闻

不想改车又不想撞衫 来看看小鹏P7+的黑武士版

态度原创

教育
亲子
游戏
公开课
军事航空

教育要闻

到2027年,将培育20个标杆!北京城乡学校共同体建设方案发布

亲子要闻

母亲的6大奇迹太暖心了!

《宝可梦集换式卡牌游戏》滑板盲袋10月17日发售!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版