网易首页 > 网易号 > 正文 申请入驻

刚刚,中国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

0
分享至


新智元报道



大额免费Token Plan:https://discovery-home.intern-ai.org.cn/https://api.atria-asi.ai/,https://zenmux.ai/atria-asi/atria-dawn-preview

项目网站:https://atria-asi.ai/

模型权重:https://huggingface.co/internlm/Atria-Dawn-Preview

Paper链接:https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

20 分钟,一个 MiniOS操作系统搭建了起来。

AI4AI 设计并训练一个超过 4 亿参数的天气预测模型,1 分钟,预测未来一周的全球天气。

这是智能体模型Atria Dawn Preview在此次展示中完成的两项任务。

上海人工智能实验室联合复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构,共同发布了这一智能体新模型。


模型能做什么,自然是发布的看点。但这一次,团队还把目光转向了另一件事:这个模型,究竟是怎么被研发出来的?

在 Atria 的后训练过程中,研发人员普遍使用编程智能体辅助工作。写代码、执行实验、分析结果,AI 已经参与其中。

于是,一个问题浮了出来:当 AI 开始帮忙「造 AI」,人类还在忙什么?

越来越多的操作交给 AI 之后,AI工程团队的劳动究竟减少了多少,又有多少转移到了不容易被看见的地方?

Atria 团队收集了研发中的人机交互记录,尝试把这些分工拆开来看。

AI 连续执行的背后,谁在决定下一步?

回看模型研发,人类的工作一直在变。

早期,人们为模型标注数据。后来,通过偏好反馈告诉模型什么样的回答更好。如今,AI 开始参与代码编写、实验执行和结果分析。

人机协作的范围,就这样从训练数据的生产,延伸到了研发流程本身。

沿着数据、训练与评估三个环节,可以看到这一变化:


一些过去需要研究者一步步完成的操作,现在可以交给智能体连续推进。

但研发中,还有一类工作很难用代码行数来衡量。

问题该怎么定义?哪条技术路线值得尝试?实验结果究竟支持了什么判断?继续投入,还是及时换方向?

这些决定可能只需要几句话,却会影响后面一连串操作。

因此,想知道 AI 在研发中贡献了多少,就需要沿着过程往回看:方案是谁提出的,选择是谁作出的,卡住之后又是谁把方向纠正过来的。

这也是 Atria 团队分析交互记录的出发点。

769 条任务记录,拆开 AI 研发背后的人类劳动

团队分析了56 名参与者的 769 条任务记录,并结合智能体日志,观察研发中的人机分工。

其中,739 项任务明确回答了是否使用 AI,713 项涉及 AI,使用率达到96.5%

在这批被调查的研发工作里,用 AI 已经相当普遍。

不过,96.5% 回答的是「有没有用」,还没有回答「承担了多少」,更没有回答「谁在作决定」。

真正值得展开的,是接下来几组数字。

约三分之一的已完成任务,参与者认为「没有 AI 就做不成」


455 项已完成、使用了 AI,且获得有效可行性回答的任务中,151 项被参与者判断为:如果没有 AI,自己负责的部分就无法完成。

占比33.2%

这里有一个明确前提:任务范围、质量要求和其他资源保持不变。

也就是说,对这些参与者而言,AI 的作用已经延伸到任务是否可行。一部分原本受资源或个人能力限制的工作,有了 AI,才进入了能够完成的范围。

当然,这里的「做不成」,来自参与者对当时情况的回顾性判断。

这些任务可能确实超出了参与者在给定条件下、不借助 AI 所能完成的范围,也可能是 AI 的使用改变了他们对自身能力和任务可行性的判断。

参与者认为任务离不开 AI,并不意味着最终选择也由 AI 作出。要理解 AI 在工作中的作用,还需要进一步区分:谁提出方案,谁作出最终选择。

AI 经常出方案,多数最终选择仍由人作出


再看技术决策。

在执行岗位参与者报告的567 项方法或参数决策中,AI 提出方案的比例达到64.6%

其中,最常见的协作方式是:AI 提出,人类选择。

这一组合占全部此类决策的55.4%

如果把视线放到最终选择上,分工就更加清楚:85.5%的方法或路线决策由人类作出最终选择,AI 作出最终选择的比例为9.2%

在目标或范围、验收标准两个环节,人类作出最终选择的比例,也分别达到93.4%81.9%

甚至在那 151 项被参与者认为「没有 AI 就无法完成」的任务中,仍有144 项由人类最终选择目标,占比95.4%

两件事同时发生了。研究者依赖 AI 完成工作,AI 也经常参与技术方案的形成;与此同时,人类仍然承担着多数最终选择。

哪些方案值得采用,哪些结果符合要求,研究应该朝哪个方向推进,这些判断构成了人类工作的重要部分。

把整个任务简单标成「人做的」或「AI 做的」,很容易把中间的分工混淆。方案提出、最终选择和具体执行,需要分别看。

遇到困难,76.0% 经人类帮助继续推进,只有 0.7% 由人类接管


智能体卡住之后,会发生什么?

团队请参与者回顾了每项任务中最关键的一次困难。在记录了困难及应对方式的588 项任务中,76.0% 经人类介入后继续推进,由人类接管主要工作的比例只有0.7%

人类最常做的两件事,分别是:

  • 补充背景或澄清需求:35.2%。

  • 诊断问题或改变方法:34.7%。

另有23.0%的任务由 AI 自行恢复推进。

这让「人类介入」有了更具体的样子:研究者补上缺失的信息,判断问题出在哪里,或者调整方法,智能体随后继续执行。

修改产出时,也出现了类似的分工。

在明确记录主要 AI 产出去向的627 项任务中,354 项发生了实质性修改,占比56.5%

而在这些需要实质性修改的任务中,75.4% 由 AI 根据人类反馈完成修改

初稿是 AI 写的,修改稿也可能是 AI 写的。

但两版之间,人类指出了什么问题、提出了什么要求,同样影响着最终结果。

如果只统计生成内容、代码量或直接编辑次数,这部分通过反馈完成的工作,就很容易被低估。

8 项基准,两项第一、两项第二

研发过程之外,Atria Dawn Preview 本身的能力,也是此次发布的重点。

团队对模型进行了评测,并与其他基线模型展开对比。具体结果如下:


在团队给出的8 项基准对比中,Atria Dawn Preview 取得了两项第一、两项第二

  • AutomationBench、CyberGym:得分最高。

  • SkillsBench、Workspace-Bench-Lite:位列第二。

这组结果展现了它有竞争力的智能体能力。

分数之外,团队还给出了三个 Demo,分别对应模型训练、软件开发和网络安全。它们把模型组织工作、使用工具、根据反馈继续推进的过程,放到了具体任务里。

禁用网络搜索,训练一个超过 4 亿参数的天气模型

第一个任务,直接让 AI 参与全球天气预测模型的设计与训练。

任务提供了超过 100 GB 的全球气象数据,同时禁用了网络搜索。Atria Dawn Preview 需要基于这些数据,构建能够学习气象变量变化规律的预测模型。

在这一过程中,它设计了一个参数量超过 4 亿的 ViT 骨干网络,完成45,000 步训练,学习69 个气象变量随时间的演化规律。

最终,系统能够在1 分钟内,预测未来一周的全球天气

在该案例的评测设置下,系统使用了更少的训练数据,部分预测指标优于英伟达的经典天气预报模型FourCastNet

而任务最终交付的,是一个经过训练、能够运行的天气预测系统。模型设计之后,训练和运行也实际完成了。

20 分钟,从自然语言需求到 MiniOS

第二个任务,转向软件开发。

Atria Dawn Preview 从自然语言需求出发,在20 分钟内构建了一个 MiniOS,把文字描述转化为可运行的软件成果。

这一案例关注的是完整项目如何推进:组织开发工作、实现代码,并最终交付一个能够运行的系统。

自然语言需求进入任务流程,可运行的软件成为最终产出。

进入隔离靶场,把漏洞发现、修复和环境恢复接起来

第三个任务发生在隔离靶场中。

Atria Dawn Preview 从网站分析和攻击面排查开始,进一步完成漏洞发现、利用、与修复。

过程中,模型不仅要识别网站结构和潜在风险,还要通过多轮测试排除错误判断、定位真实漏洞,并完成攻击、修复和复验。

这项任务覆盖了从发现潜在漏洞,到验证漏洞是否成立,再到修复漏洞的过程。

三个案例,让基准分数之外的执行过程变得更具体:模型如何安排工作,如何利用工具反馈,以及如何把任务推进到最终结果。

AI 帮忙造 AI,下一轮还能继续吗?

把模型能力与研发过程放在一起看,Atria 的这次实践提供了两个观察角度。

一边,是后训练得到的模型能够完成哪些任务。

另一边,是完成这次后训练,人和 AI 各自承担了什么。

如果 AI 的能力继续提升,这两条线就会进一步交汇,触及递归自我改进

AI 参与模型研发,推动能力提升;提升后的能力,再投入下一轮研发,带来进一步改进。

但要让这个过程持续运转,还有问题需要回答。团队将注意力放在了其中两点。

AI 做得更快,检验能不能跟上?

当 AI 能够更快地修改训练流程、构建工具和开展实验,研究者会得到更多结果,也需要及时判断哪些结果值得相信。

训练信号可靠吗?评估漏掉了什么?自我修改有没有偏离原来的目标?

这些问题,都需要有相应的检验。

一轮实验中没有被发现的错误,可能被带进下一轮,继续影响后续判断。

因此,研发自动化向前推进时,独立评估、可追溯的过程记录,以及异常情况下的暂停和回退机制,也需要跟上。

实验数量和执行速度可以增加,改进是否可靠,仍然要经过验证。

下一次,能不能由 AI 主动请人帮忙?

人类什么时候介入,是这次观察的一部分。

再往前一步,AI 能否自己判断:什么时候需要人类参与?

目标不够明确,证据彼此冲突,或者问题必须依赖现实世界的反馈,这些时候,继续执行未必能解决问题。

模型需要识别:哪些事情可以自行处理,哪些需要补充信息、专业判断或明确授权。

这也可能改变人的工作方式。研究者可以在关键节点提供判断和帮助,而不必持续指挥每一步操作。

但有效的求助,需要模型把问题说清楚。

卡在哪里,有哪些不确定性,为什么需要人类参与,得到的反馈又该如何用于后续行动,这些都是能力的一部分。

从 AI 辅助研发走向递归自我改进,还有多远,需要在一轮轮实践中检验。

Atria Dawn Preview 展示了模型能够把任务推进到什么程度。Atria 的研发记录,则让人看见了这些成果背后的协作过程。

96 人,65 名在校生,这支团队的另一面

Atria 背后,是一支学生广泛参与的年轻研发团队。

按学生与 AI Lab 正式员工统计,96 名主要成员中,有 65 名在校生,占比超过三分之二

其中,博士生 33 人,本科及硕士生 32 人,与31 名正式员工共同参与项目研发。专项组长中的学生比例达到70%

团队汇聚了上海人工智能实验室、复旦大学、中科院软件所、中国人民大学、中科院自动化所、华东师范大学和哈尔滨工业大学等机构与高校的研究力量。

不同高校、不同培养阶段的青年学生,在同一个大模型后训练项目中开展协作,也共同参与了这次关于 AI 能力与人机分工的实践。

而 Atria 这个名字,也藏着团队对这项工作的理解。

Atria 是南三角座的主星,和此前 Delta、长江三角洲与三角形的意象天然呼应;atrium 原意是中庭、汇聚空间,像一个让不同学校、团队与学科在这里相遇、协作的场所。

一颗星,指向更远的探索;一个中庭,容纳不同的人与想法。Atria 也许正代表着这样一种可能:让更多人一起,把智能体能力推向下一步。


参考资料:

https://github.com/atria-asi/Atria-Dawn-Preview/blob/main/atria-dawn-preview.pdf

编辑:大卫

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
交锋:何春晓不会想到,马憩在审讯室放那盒烤肠包含了四层含义!

交锋:何春晓不会想到,马憩在审讯室放那盒烤肠包含了四层含义!

春日在捕月
2026-09-14 19:15:27
1973年毛主席收到一封信后痛哭?叶剑英拍案而起,周恩来罕见发火

1973年毛主席收到一封信后痛哭?叶剑英拍案而起,周恩来罕见发火

窥史
2026-09-14 12:00:49
“上5休1上5休3上3休7上3休1”,提醒:早点设闹钟

“上5休1上5休3上3休7上3休1”,提醒:早点设闹钟

都市快报橙柿互动
2026-09-14 09:39:08
招行三任副行长接连落马:退休不是 "保险箱"

招行三任副行长接连落马:退休不是 "保险箱"

经理人杂志
2026-09-14 15:46:47
巴萨新赛季最薄弱位置出炉,不是中锋和中后卫,却让亚马尔很头疼

巴萨新赛季最薄弱位置出炉,不是中锋和中后卫,却让亚马尔很头疼

大卫的篮球故事
2026-09-14 16:43:25
一艘被击沉至少四次的航母,一场没有残骸的永远胜利

一艘被击沉至少四次的航母,一场没有残骸的永远胜利

寰球经纬所
2026-09-13 14:04:46
追觅科技被曝6至8月离职裁员近万人

追觅科技被曝6至8月离职裁员近万人

驱动中国
2026-09-14 21:18:03
塔利班治下的阿富汗  仿佛坠入中世纪般的处境

塔利班治下的阿富汗 仿佛坠入中世纪般的处境

那些看得见的老照片
2026-08-24 07:00:27
舟山60岁渔民落水失踪11天,家人已办完后事,今天竟奇迹生还回家!面色不错,就是皮肤晒黑了……

舟山60岁渔民落水失踪11天,家人已办完后事,今天竟奇迹生还回家!面色不错,就是皮肤晒黑了……

都市快报橙柿互动
2026-09-13 22:27:38
央行:8月末,广义货币(M2)余额356.81万亿元,同比增长7.5%

央行:8月末,广义货币(M2)余额356.81万亿元,同比增长7.5%

每日经济新闻
2026-09-14 17:11:05
蔡琳否认因语言不通离婚,坦言长期争吵耗尽了能量,连生娃都是自己开车去医院

蔡琳否认因语言不通离婚,坦言长期争吵耗尽了能量,连生娃都是自己开车去医院

电影侦探社
2026-09-12 15:51:45
为什么China GT会沦为国际笑柄?

为什么China GT会沦为国际笑柄?

小眼睛小世界
2026-09-14 04:18:38
72岁台湾老兵回大陆探亲,酒醉后失言令女儿大惊:您是共产党员?

72岁台湾老兵回大陆探亲,酒醉后失言令女儿大惊:您是共产党员?

大运河时空
2026-04-12 10:50:03
北京下命令了!2027年底前,所有中小学必须一律取消校外配餐

北京下命令了!2027年底前,所有中小学必须一律取消校外配餐

解说阿洎
2026-09-13 12:03:34
谢育新:当年因参赛资格问题无缘荷甲;为谢维军抓住机会高兴

谢育新:当年因参赛资格问题无缘荷甲;为谢维军抓住机会高兴

懂球帝
2026-09-14 18:58:26
东风、歼50、004都得靠边站,中国最强武器是什么?

东风、歼50、004都得靠边站,中国最强武器是什么?

北海史记
2026-09-11 09:10:43
闹大了!山西大学女生只因食堂打饭给男生打得更多,认为被轻视公然批判,​食堂阿姨委屈发帖回应

闹大了!山西大学女生只因食堂打饭给男生打得更多,认为被轻视公然批判,​食堂阿姨委屈发帖回应

火山詩话
2026-09-12 14:14:12
澳门输光10亿水落石出后,黄晓明坦言遭遇白眼狼,叶柯baby被拖下水

澳门输光10亿水落石出后,黄晓明坦言遭遇白眼狼,叶柯baby被拖下水

梦回千年aa
2026-09-13 07:09:00
王励勤再次调整亚运阵容安排,松岛辉空坦言不在乎世一

王励勤再次调整亚运阵容安排,松岛辉空坦言不在乎世一

最爱乒乓球
2026-09-14 00:09:19
四大地方航空,三家资不抵债!

四大地方航空,三家资不抵债!

民航之翼
2026-09-12 22:28:20
2026-09-14 22:07:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16182文章数 67069关注度
往期回顾 全部

科技要闻

时隔近9年,特斯拉新款Roadster拟十一发布

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

头条要闻

多人医保被登记为"死亡" 当地医保局:每天都有人找来

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹采访视频曝光,原来早有预兆

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

纯电续航960km/迪迪虾上车 腾势N8L纯电售29.98万元起

态度原创

房产
家居
健康
艺术
教育

房产要闻

网易房产|《让爱驻下》云首发!以一首歌,致敬广州赶路人

家居要闻

2026建博会(广州) 公装联探展交流活动

耳石症vs颈椎病,头晕的原因差太多

艺术要闻

著名油画家 马一平风景油画欣赏

教育要闻

初三家长最容易做错的三件事

无障碍浏览 进入关怀版