网易首页 > 网易号 > 正文 申请入驻

才三周Flash就换代!谷歌上新两款Gemini 3.8:编程与推理能力升级,向RSI迈出一大步

0
分享至

谷歌又一次加快了Gemini模型的迭代速度。

美东时间9月2日周三,谷歌宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,Gemini 3.8是其迄今“最强的推理和编程模型”,两款模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。

谷歌DeepMind研究员姚顺宇在模型发布后评价道:"对模型而言,这只是迈出了一小步;但对于RSI(递归自我改进)来说,这是一次巨大飞跃。"

这句话揭示出谷歌当前技术路线的核心逻辑:让AI模型具备足够强的代码能力,从而使其能够参与自身乃至下一代模型的研发过程,最终打通整个研发闭环。

距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌就再次推出新版本。谷歌表示,此次是其六周内第三次发布Flash模型;独立AI基准测试机构Artificial Analysis则指出,3.8 Flash已是谷歌不到四个月内推出的第四款Flash模型。

在性能提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash的引导价格与3.7 Flash相同,为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。Artificial Analysis评测显示,3.8 Flash高推理档在其综合智能指数中获得59分,较3.7 Flash提高3分,并以每项任务约0.58美元的成本进入“智能程度—任务成本”性价比前沿。

从长周期编程到自主智能体,3.8 Flash更强调“把事做完”

Gemini 3.8 Flash此次的核心升级,是从单次代码生成进一步转向长周期的软件工程和自主智能体。

谷歌表示,3.8 Flash在DeepSWE v1.1长周期软件工程测试中,能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。与此同时,新模型在金融、法律等专业领域的智能体测试中也有所提升,在HLE-Verified测试中的得分达到54.9%。

这背后的关键变化,是谷歌让模型“做得更多”。

面对复杂任务时,3.8 Flash被设计为执行额外的推理步骤,并持续迭代调用工具。当模型遭遇不确定性时,它不会直接输出低置信度答案,而是通过消耗更多Token在内部完成自我验证与反思。由于基础单价极低,即便经过多轮循环迭代产生了更多Token消耗,整体调用成本仍低于直接调用GPT-5.6。

这一设计哲学与RSI的核心逻辑高度吻合:一个能够在Agent循环中快速、廉价地反复迭代的模型,天然具备参与自动化研发流程的条件。

谷歌的逻辑是,速度与极低的推理成本本身就是一种智力形态——在一个完整的Agent工作流中,每秒钟完成更多次推理循环,效果上等同于提升了模型的实际解题能力。

谷歌展示的案例也更加接近实际生产环境,包括通过Antigravity仅凭一个提示生成可运行的3D游戏、生成能够运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。

这也意味着,Flash系列的定位正在发生变化:它不再只是一个追求速度和低成本的“小模型”,而是逐渐成为谷歌推动AI智能体落地的重要底层模型。

独立评测:智能指数升至59分,但“多做事”也意味着更高Token消耗

Artificial Analysis的独立测试进一步印证了3.8 Flash的能力提升。

该机构数据显示,Gemini 3.8 Flash高推理档的Artificial Analysis Intelligence Index得分为59分,比3.7 Flash的56分高3分;中推理档得分57分,低推理档则为52分。高推理档的输出速度约为305 Token/秒,位居其评测模型前列。

不过,性能提升并非完全没有代价。

Artificial Analysis指出,虽然谷歌维持了3.7 Flash的Token价格,但3.8 Flash高推理档每项任务的实际成本约为0.58美元,较3.7 Flash的0.40美元高约40%。原因在于,新模型平均每项任务的输出Token数量增加约30%,同时智能体评测中的交互轮数也有所增加。

换句话说,单价没有上涨,但模型为了完成更复杂的任务“思考得更多、调用得更多”,实际使用成本反而有所增加。

这也解释了谷歌为什么同时保留不同推理档位。Artificial Analysis数据显示,3.8 Flash中推理档每项任务成本约0.41美元,低推理档约0.24美元。对于追求成本效率的应用,开发者可以降低推理强度,或者继续使用3.7 Flash。

3.8 Flash Cyber瞄准网络安全:漏洞发现与自动打补丁

与通用版3.8 Flash同步发布的,是专门面向网络安全领域的Gemini 3.8 Flash Cyber。

谷歌称,新模型具备“前沿水平”的漏洞发现和自动修复能力,并重点强化了防御侧应用。其在CyberGym行业基准中的漏洞自主发现表现超过Gemini 3.5 Flash Cyber以及规模明显更大的前沿模型。

在谷歌内部覆盖20种编程语言的真实漏洞测试中,3.8 Flash Cyber的成功率超过70%;在CWE-Bench自动补丁测试中,pass@1达到47.2%,接近领先前沿模型的47.8%,但成本明显更低。

谷歌还公布了几个实际应用案例。

Chrome安全团队发现,3.8 Flash Cyber生成的正确漏洞补丁数量,是规模更大的商业模型的2.6倍;网络安全公司Wiz的内部渗透测试显示,该模型的召回率比其他前沿模型高7.5至9.7%,成本则低2.3至5.2倍。

谷歌云漏洞研究团队甚至利用该模型在不到两小时内发现了一项关键基础设施漏洞,而谷歌称这类漏洞过去通常需要数月才能完成研究和发现。

Fairwind计划启动,650多家机构获网络安全AI“优先通道”

伴随Gemini 3.8 Flash Cyber发布,谷歌还推出了Fairwind计划,将网络安全AI进一步推向政府、关键基础设施和大型企业。

根据谷歌公告,Fairwind是一个限制访问的项目,面向政府机构以及可信赖的云客户和网络安全合作伙伴开放。参与者可以使用Gemini 3.8 Flash Cyber,并结合谷歌的CodeMender工具,实现漏洞发现、验证和自动修复。

谷歌表示,参与机构需要将模型访问权限限制在内部网络安全、事件响应或渗透测试团队,并部署多因素身份验证等安全措施。目前Fairwind已经拥有超过650家全球合作伙伴,覆盖政府、关键基础设施以及核心技术平台。

这意味着谷歌此次并不只是发布一个网络安全模型,而是在尝试建立一个面向防御方的AI安全生态。

尤其值得注意的是,谷歌强调Fairwind将首先为政府和对社会韧性至关重要的企业提供访问权限,包括医疗、电信、能源和金融等关键基础设施运营商,以及维护广泛软件基础设施的技术平台。

Flash高频迭代,谷歌押注“更便宜的智能体”落地

从3.6 Flash到3.7 Flash,再到如今的3.8 Flash,谷歌正在明显加快Flash系列的更新节奏。

而与早期Flash模型强调“快”和“便宜”相比,如今的3.8 Flash更加突出长周期推理、工具调用、软件工程和自主智能体能力。谷歌试图证明的是:不一定需要最大规模的模型,才能完成越来越复杂的真实工作。

价格则成为谷歌扩大这一战略的重要杠杆。

3.8 Flash继续维持每百万输入Token 0.75美元、输出Token 3.75美元的年底前引导价格,同时提供1M Token上下文窗口,并支持文本、图像、语音和视频输入。消费者可以通过谷歌AI Pro和Ultra订阅使用,开发者则可以通过Antigravity、谷歌AI Studio和Android Studio调用,企业用户可通过Gemini Enterprise使用。

对于谷歌而言,这种策略的意义在于:在AI竞争从“谁的模型最强”逐渐转向“谁能让智能体以合理成本完成更多实际任务”的过程中,Flash系列可以凭借成本和速度优势抢占更大规模的应用入口。

而此次同时推出通用智能体模型和网络安全专用模型,也显示谷歌正在把Gemini的竞争重点从单纯的聊天和问答,进一步推向编程、企业工作流以及能够直接创造经济价值的AI执行任务

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马斯克预言,接下来全世界将面临一场危机,或许只有中国是个例外

马斯克预言,接下来全世界将面临一场危机,或许只有中国是个例外

侃故事的阿庆
2026-09-06 10:09:26
我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

我老公对我真的是生理性喜欢,我俩今年四十五,他每天晚上都要抱着我睡,不是那种敷衍的搭把手,是真抱

徐侠客有话说
2026-08-13 11:03:24
陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

阿废冷眼观察所
2026-09-06 07:05:54
一场2-0 让郑钦文确定对手!美网16强已出12席 中国金花造31年神迹

一场2-0 让郑钦文确定对手!美网16强已出12席 中国金花造31年神迹

侃球熊弟
2026-09-06 04:26:08
哈弗茨:我们知道比赛会很难;射门打后卫裆下门将很难看到球

哈弗茨:我们知道比赛会很难;射门打后卫裆下门将很难看到球

懂球帝
2026-09-07 02:15:17
阿里42岁前高管美国失踪,发现时死于车内,好友:半月前就不对劲

阿里42岁前高管美国失踪,发现时死于车内,好友:半月前就不对劲

大鱼简科
2026-09-06 09:29:49
韦世豪对峙河南球迷视频曝光!做出怪异手势,主场冲冠战将停赛

韦世豪对峙河南球迷视频曝光!做出怪异手势,主场冲冠战将停赛

奥拜尔
2026-09-07 00:13:36
美国上演了最荒谬的一幕,简直就是没救了!

美国上演了最荒谬的一幕,简直就是没救了!

一个坏土豆
2026-09-06 19:12:08
1650多个!韩国娱乐公司在印度搞女团选秀,结果首轮直接爆了

1650多个!韩国娱乐公司在印度搞女团选秀,结果首轮直接爆了

一盅情怀
2026-09-04 12:28:09
哇塞!重磅!乐福!这一等,就是整整12年……

哇塞!重磅!乐福!这一等,就是整整12年……

体育新角度
2026-09-06 21:58:56
珍视明回应滴眼液抽检事件:初步认为不合格与运输温度、摆放方式相关

珍视明回应滴眼液抽检事件:初步认为不合格与运输温度、摆放方式相关

每日经济新闻
2026-09-06 21:14:11
他放弃中国籍改名归化日本,如今率队"三杀"国羽夺冠,已成心腹大患

他放弃中国籍改名归化日本,如今率队"三杀"国羽夺冠,已成心腹大患

体坛小二哥
2026-09-06 22:50:03
阿森纳球迷嘲讽切尔西新援“该去大俱乐部”,罗杰斯赛后未回应

阿森纳球迷嘲讽切尔西新援“该去大俱乐部”,罗杰斯赛后未回应

林间小温柔
2026-09-07 03:07:34
虽说阿姨有30多岁了,但是这样打扮一下反而比年轻的女生更有魅力

虽说阿姨有30多岁了,但是这样打扮一下反而比年轻的女生更有魅力

美女穿搭分享
2026-09-06 09:40:17
炖排骨时,这3味佐料是"大忌"!放错了等于白炖,肉柴汤腥不好吃

炖排骨时,这3味佐料是"大忌"!放错了等于白炖,肉柴汤腥不好吃

思思夜话
2026-09-06 11:34:28
白宫打响第一枪!特朗普证实:停火方案已出,俄乌个人恩怨太深

白宫打响第一枪!特朗普证实:停火方案已出,俄乌个人恩怨太深

让生活充满温暖
2026-09-05 21:54:32
13500元起!iPhone Ultra折叠屏来了,与华为小米阔折叠差距多大?

13500元起!iPhone Ultra折叠屏来了,与华为小米阔折叠差距多大?

小兔子发现大事情
2026-09-04 10:34:05
不查不知道一查吓一跳,在杭州坐拥千万豪宅的CoCo,私下究竟多壕

不查不知道一查吓一跳,在杭州坐拥千万豪宅的CoCo,私下究竟多壕

锅锅爱历史
2026-09-02 16:50:45
前4场西甲送4次助攻,戈登是本世纪第三人

前4场西甲送4次助攻,戈登是本世纪第三人

懂球帝
2026-09-06 23:26:32
斯诺克赛程:19局10胜决出冠军,塞尔比冲第27冠,小特终结者变新王?

斯诺克赛程:19局10胜决出冠军,塞尔比冲第27冠,小特终结者变新王?

刘姚尧的文字城堡
2026-09-06 08:52:51
2026-09-07 03:28:49
华尔街见闻官方 incentive-icons
华尔街见闻官方
中国领先的金融商业信息提供商
151852文章数 2654650关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
本地
教育
公开课
军事航空

房产要闻

突发重磅!海口出台楼市新政!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

教育要闻

又有多所学校人事有变化!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版