网易首页 > 网易号 > 正文 申请入驻

谷歌DeepMind研究员宣称Gemini 4已实现RSI!

0
分享至


新智元报道


RSI来了!

我们的模型正式超越了我。我已经没什么能再教它的了。是时候去追寻我的咖啡师梦想啦 :)☕

说出这番话的人,是Google DeepMind研究员 Zirui Wang。

他的履历从CMU到Apple Foundation Models再到xAI,最后落脚DeepMind,妥妥的AI圈「六边形战士」。



一个亲手调教模型长大的研究员,公开说出「我教不动它了」。

这到底是肺腑之言,还是精心设计的一波营销?

不管怎样,沉默了整整七个月的谷歌,带着Gemini 4 Argon杀回来了。

而且这一次,它绑定了一个现在最热词——RSI。

RSI,全称Recursive Self-Improvement,递归自我改进。AI自己改进自己,改进完的AI再改进自己,像滚雪球一样越滚越大。

哲学家David Chalmers早在2010年就给出了核心论断:智能的提升,必然带来设计更高智能系统的能力的提升。

这是一个自我加速的循环,一旦启动,理论上就不会停。

这也是为什么RSI被视为从AGI通往超级智能的「最后一块拼图」。同时也是整个AI安全领域最令人不安的话题。

因为一旦这个雪球真的滚起来了,人类还刹得住车吗?

所以当DeepMind研究员在社交媒体上大喊「RSI来了」的时候,半个AI圈都炸了。

Gemini 4 Argon在跑分层面确实交出了一份让竞争对手坐不住的成绩单。

独立评测机构Artificial Analysis给出的综合智能指数是53分,直接追平GPT-6 Astra,比上一代Gemini 3.1 Pro Preview飙升了23分。


更亮眼的是幻觉率——仅15%,是所有高分模型里最低的。对比之下,Astra的幻觉率高达51%,Sol是54%。换句话说,Argon不光聪明,还特别「实诚」,不瞎编。

在Vals Index这个涵盖金融、法律、编程、税务的综合知识工作榜上,Argon以68.9%登顶全部41个模型的第一。

这是Gemini系列有史以来第一次坐上这把交椅。

在金融Agent测试中拿到65.4%同样高居榜首,在Vibe Code Bench上也以91.91%紧咬Sonnet 5.5的92.39%,仅差半个身位。

而在Text Arena盲测中,Argon以1525的Elo分暂列第一,在代码编写、高难度提示词、创意写作等多个赛道都展现了压倒性优势。


这些数据放在一起看,至少说明一件事:谷歌不是回来「凑数」的。

但RSI的证据,到底在哪?

跑分归跑分,RSI归RSI。

Zirui Wang那条帖子让人激动,但「模型超越了我」和「模型能自主改进自己」之间,还差很远。

AlphaGo赢了李世石,并不代表AlphaGo能自己发明新的棋类游戏。

目前最接近RSI「实锤」的证据,来自谷歌的三个内部案例。

第一个:自主优化数据中心,释放300+TiB内存。

Argon组成的智能体团队,自主扫描谷歌全网的性能遥测数据,精准定位到了内存优化空间,并且自主提交修改代码。

上线后直接腾出了超过300 TiB内存,预计最终可达500 TiB到1 PiB。

在谷歌的体量下,这是千万美元级别的成本节约。

第二个:用Rust重写80万行C/C++系统内核。

搞底层开发的人都知道,动内核代码就像拆弹——一个指针错误,整个系统原地爆炸。

但Argon正在主导把谷歌底层代码(包括Fuchsia Zircon内核)从C/C++迁移到内存安全的Rust。

AI碰80万行内核代码,这件事本身就是一个里程碑。

第三个:手撕3.2万行SIMD底层指令,视频解码性能飙升2.7倍。

谷歌开源视频解码项目libgav1里有一段3.2万行的SIMD代码,人类工程师写起来都叫苦连天。

Argon通过多轮编译实验反复迭代,直接用安全Rust完成了重写,新版本速度是原Rust移植版的2.7倍,逼平了高度优化的C++版本,且逐帧输出完全一致。

这三个案例,说明Argon确实具备了在真实工程环境中「自主发现问题——自主设计方案——自主迭代优化」的能力。

这和传统的「人类写好提示词让AI干活」有本质区别——它开始自己找活干了。

但严格来说,这仍然是DeepMind所定义的「模型辅助训练优化」,而非完整的RSI闭环。

真正的RSI需要一个更强有力的证据:不只是模型能改进自己,而是改进后的模型,要比改进前更擅长改进自己。

也就是说「自我改进的能力」本身也在被改进,形成一个越转越快的飞轮。

DeepMind在九月中旬发布的Dream-RSI论文框架,提出让AI智能体通过「回放」历史探索来优化未来的搜索策略,在算法工程和GPU内核优化上都展现出了显著提升。


Google DeepMind开发者关系负责人Logan Kilpatrick也在播客中公开表示,他们已经观察到了「递归自我改进的早期迹象」。


所以更准确的判断可能是:我们正站在RSI的门槛上,已经能看见门里面的东西了。

但还没有迈进去。

跑分之外:真实世界的「照妖镜」

偏偏就在Argon发布的同一天,彭博社甩出了一记暗拳:谷歌内部并非铁板一块。


据报道,部分接触过内部评测的员工坦言,Argon跑分很漂亮,但真正干活时——尤其是前端设计之类的实际编程任务,表现「参差不齐」。

AI专家Edwin Chen直指行业通病「Benchmaxxing」:工程师们疯狂适配标准测试拿高分,却忽略了让模型真正好用。

独立评测数据也印证了这种担忧。

Argon在Terminal Bench 4上只拿到57%,落后Claude Sonnet 5.5的64%和Opus 5.5的60%。在Code Arena网页开发榜上排名第八,虽然进步了21名,但在最硬核的编程智能体战场上,Claude仍然是程序员的首选。

Hacker News上抢先体验过的用户给出的评价是:长程注意力很好、能把事做完,但打磨和稳定性差一截。任务一变大就容易封顶。

不过,对于谷歌来说,Argon还有一张王牌:价格。

百万输入Token仅2美元,输出Token 10美元,单任务综合成本1.99美元——只有GPT-6 Astra的六成,更是Claude Opus 5.5的三分之一。

手握全球最大TPU算力集群的谷歌打起价格战来,OpenAI和Anthropic确实难受。

再加上百万Token的输出上限(从前代的64K原地飞升到1M),这意味着AI终于不用在复杂推理到一半的时候「断气」了。

这种持续深度思考的能力,可能比任何单项跑分都更有长远意义。

三强鼎立:终局远未到来

Gemini 4 Argon并没有碾压所有对手,但它完成了一个更重要的任务——

把谷歌从「观众席」拉回了「牌桌」。

当前的AI前沿已经形成了清晰的三国杀格局:谷歌凭知识工作、超长上下文和网络安全防御守住了自己的地盘;OpenAI在科学推理和Agentic Coding上依旧领跑;Anthropic的Claude牢牢占据着硬核编程的高地。没

有绝对的霸主,只有交替领先的追逐赛。

而RSI这个让全行业既兴奋又恐惧的概念,可能确实在某个我们看不清的角落里,开始缓慢地转动它的齿轮了。

从DeepMind的Dream-RSI论文到Argon在工程实战中展现的自主迭代能力,种种迹象表明,AI「自己教自己」的那一天正在逼近。

只是,从「研究员教不动模型了」到「模型开始自己教自己」,这中间的距离,可能比我们想象的要远。也可能,比我们想象的要近。

毕竟,Argon只是Gemini 4的入门款。谷歌说,真正的大招还在后面。

至于Zirui Wang的咖啡师梦想☕ ——建议先别辞职。

万一下一代模型连拉花都会了呢?

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

编辑:所罗门

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本亚运会举重项目全部结束,16枚金牌被瓜分。

日本亚运会举重项目全部结束,16枚金牌被瓜分。

有态度网友19ILam
2026-10-01 15:46:40
中央明确:公职人员违法违纪后工资待遇规定

中央明确:公职人员违法违纪后工资待遇规定

审计之家
2026-09-29 08:17:17
没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

没有退路!中国国防部已经向全世界亮明:解放军全员整装待发。

小马姨
2026-09-25 20:41:19
黄仁勋与李在镕同框,承诺英伟达将延续与三星电子长达33年的合作

黄仁勋与李在镕同框,承诺英伟达将延续与三星电子长达33年的合作

IT之家
2026-09-30 20:37:08
出道39年不温不火,老婆却靠一首歌吃了38年,如今成春晚常客

出道39年不温不火,老婆却靠一首歌吃了38年,如今成春晚常客

完善法
2026-09-30 10:24:30
下半年来最强冷空气,国庆来袭!广东天气要降温了

下半年来最强冷空气,国庆来袭!广东天气要降温了

TIME中珠视界
2026-10-01 07:55:18
拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

拉夫罗夫主动让出位子,功成身退时机刚好,普京早已安排别人顶上

深析古今
2026-10-01 05:24:44
那英悼念刘欢事态升级!官方介入,荒谬事出现 恐步入郭德纲后尘

那英悼念刘欢事态升级!官方介入,荒谬事出现 恐步入郭德纲后尘

江启
2026-09-30 13:48:58
外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

外挂相机?华为这步棋,把整个行业都打懵了,是进步还是倒退?

大卫聊科技
2026-09-30 13:18:16
1980年王光美看话剧,见李雪健后拒绝握手:你长得太像林彪了!

1980年王光美看话剧,见李雪健后拒绝握手:你长得太像林彪了!

明月清风阁
2026-09-29 15:10:21
五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

五百名医生已证实:维生素B12与甲钴胺的真相,最好花点时间看看

路医生健康科普
2026-08-03 15:25:14
霍尔木兹海峡,突发大消息!

霍尔木兹海峡,突发大消息!

证券时报
2026-09-27 08:08:14
国行苹果重磅新功能过审!终于要来了

国行苹果重磅新功能过审!终于要来了

花果科技
2026-09-30 14:30:02
两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

荔子言
2026-09-08 14:55:50
民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

民进党,极有可能在下一届台湾地区选举后,成为长期一家独大政党

趣文说娱
2026-09-06 14:26:45
中央对交公粮农民政策 权威解读

中央对交公粮农民政策 权威解读

爱下厨的阿椅
2026-09-12 11:41:23
一个充满血腥的名字:他疯狂杀害67人杀伤10人,多数为灭门惨案!

一个充满血腥的名字:他疯狂杀害67人杀伤10人,多数为灭门惨案!

路之意
2025-03-22 08:56:16
世乒赛刚夺冠,王楚钦母亲首次公开未来儿媳,3 个要求字字扎心

世乒赛刚夺冠,王楚钦母亲首次公开未来儿媳,3 个要求字字扎心

冷紫葉
2026-05-27 12:44:32
中国0-1澳大利亚夺季军,越南垫底,踢的如此混乱跟换大卫有关系

中国0-1澳大利亚夺季军,越南垫底,踢的如此混乱跟换大卫有关系

暗香暗香
2026-09-30 23:34:55
新加坡新法落地!辱骂印度裔最高坐牢,印度裔街头高呼:我们就是美国的犹太人

新加坡新法落地!辱骂印度裔最高坐牢,印度裔街头高呼:我们就是美国的犹太人

步论天下事
2026-10-01 09:35:16
2026-10-01 19:23:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16324文章数 67099关注度
往期回顾 全部

科技要闻

5999元起!华为Mate 90系列发布

头条要闻

迪拜客机乘客披露救治细节:机长倒在血泊 手几乎被切断

头条要闻

迪拜客机乘客披露救治细节:机长倒在血泊 手几乎被切断

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

艺术
时尚
教育
旅游
军事航空

艺术要闻

米芾临摹的《十七帖》,还原王羲之真实的细节,别再被其他版本误导了!

在米兰,用时装唤醒内心的自我

教育要闻

已知条件如下,求途中阴影部分的面积是多少?

旅游要闻

尽显大明风华!南京明故宫地铁站成新晋打卡地

军事要闻

美防长宣布组建“自主作战司令部”

无障碍浏览 进入关怀版