网易首页 > 网易号 > 正文 申请入驻

才三周Flash就换代!谷歌上新两款Gemini 3.8:编程与推理能力升级,向RSI迈出一大步

0
分享至

谷歌又一次加快了Gemini模型的迭代速度。

美东时间9月2日周三,谷歌宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,Gemini 3.8是其迄今“最强的推理和编程模型”,两款模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。

谷歌DeepMind研究员姚顺宇在模型发布后评价道:"对模型而言,这只是迈出了一小步;但对于RSI(递归自我改进)来说,这是一次巨大飞跃。"

这句话揭示出谷歌当前技术路线的核心逻辑:让AI模型具备足够强的代码能力,从而使其能够参与自身乃至下一代模型的研发过程,最终打通整个研发闭环。

距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌就再次推出新版本。谷歌表示,此次是其六周内第三次发布Flash模型;独立AI基准测试机构Artificial Analysis则指出,3.8 Flash已是谷歌不到四个月内推出的第四款Flash模型。

在性能提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash的引导价格与3.7 Flash相同,为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。Artificial Analysis评测显示,3.8 Flash高推理档在其综合智能指数中获得59分,较3.7 Flash提高3分,并以每项任务约0.58美元的成本进入“智能程度—任务成本”性价比前沿。

从长周期编程到自主智能体,3.8 Flash更强调“把事做完”

Gemini 3.8 Flash此次的核心升级,是从单次代码生成进一步转向长周期的软件工程和自主智能体。

谷歌表示,3.8 Flash在DeepSWE v1.1长周期软件工程测试中,能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。与此同时,新模型在金融、法律等专业领域的智能体测试中也有所提升,在HLE-Verified测试中的得分达到54.9%。

这背后的关键变化,是谷歌让模型“做得更多”。

面对复杂任务时,3.8 Flash被设计为执行额外的推理步骤,并持续迭代调用工具。当模型遭遇不确定性时,它不会直接输出低置信度答案,而是通过消耗更多Token在内部完成自我验证与反思。由于基础单价极低,即便经过多轮循环迭代产生了更多Token消耗,整体调用成本仍低于直接调用GPT-5.6。

这一设计哲学与RSI的核心逻辑高度吻合:一个能够在Agent循环中快速、廉价地反复迭代的模型,天然具备参与自动化研发流程的条件。

谷歌的逻辑是,速度与极低的推理成本本身就是一种智力形态——在一个完整的Agent工作流中,每秒钟完成更多次推理循环,效果上等同于提升了模型的实际解题能力。

谷歌展示的案例也更加接近实际生产环境,包括通过Antigravity仅凭一个提示生成可运行的3D游戏、生成能够运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。

这也意味着,Flash系列的定位正在发生变化:它不再只是一个追求速度和低成本的“小模型”,而是逐渐成为谷歌推动AI智能体落地的重要底层模型。

独立评测:智能指数升至59分,但“多做事”也意味着更高Token消耗

Artificial Analysis的独立测试进一步印证了3.8 Flash的能力提升。

该机构数据显示,Gemini 3.8 Flash高推理档的Artificial Analysis Intelligence Index得分为59分,比3.7 Flash的56分高3分;中推理档得分57分,低推理档则为52分。高推理档的输出速度约为305 Token/秒,位居其评测模型前列。

不过,性能提升并非完全没有代价。

Artificial Analysis指出,虽然谷歌维持了3.7 Flash的Token价格,但3.8 Flash高推理档每项任务的实际成本约为0.58美元,较3.7 Flash的0.40美元高约40%。原因在于,新模型平均每项任务的输出Token数量增加约30%,同时智能体评测中的交互轮数也有所增加。

换句话说,单价没有上涨,但模型为了完成更复杂的任务“思考得更多、调用得更多”,实际使用成本反而有所增加。

这也解释了谷歌为什么同时保留不同推理档位。Artificial Analysis数据显示,3.8 Flash中推理档每项任务成本约0.41美元,低推理档约0.24美元。对于追求成本效率的应用,开发者可以降低推理强度,或者继续使用3.7 Flash。

3.8 Flash Cyber瞄准网络安全:漏洞发现与自动打补丁

与通用版3.8 Flash同步发布的,是专门面向网络安全领域的Gemini 3.8 Flash Cyber。

谷歌称,新模型具备“前沿水平”的漏洞发现和自动修复能力,并重点强化了防御侧应用。其在CyberGym行业基准中的漏洞自主发现表现超过Gemini 3.5 Flash Cyber以及规模明显更大的前沿模型。

在谷歌内部覆盖20种编程语言的真实漏洞测试中,3.8 Flash Cyber的成功率超过70%;在CWE-Bench自动补丁测试中,pass@1达到47.2%,接近领先前沿模型的47.8%,但成本明显更低。

谷歌还公布了几个实际应用案例。

Chrome安全团队发现,3.8 Flash Cyber生成的正确漏洞补丁数量,是规模更大的商业模型的2.6倍;网络安全公司Wiz的内部渗透测试显示,该模型的召回率比其他前沿模型高7.5至9.7%,成本则低2.3至5.2倍。

谷歌云漏洞研究团队甚至利用该模型在不到两小时内发现了一项关键基础设施漏洞,而谷歌称这类漏洞过去通常需要数月才能完成研究和发现。

Fairwind计划启动,650多家机构获网络安全AI“优先通道”

伴随Gemini 3.8 Flash Cyber发布,谷歌还推出了Fairwind计划,将网络安全AI进一步推向政府、关键基础设施和大型企业。

根据谷歌公告,Fairwind是一个限制访问的项目,面向政府机构以及可信赖的云客户和网络安全合作伙伴开放。参与者可以使用Gemini 3.8 Flash Cyber,并结合谷歌的CodeMender工具,实现漏洞发现、验证和自动修复。

谷歌表示,参与机构需要将模型访问权限限制在内部网络安全、事件响应或渗透测试团队,并部署多因素身份验证等安全措施。目前Fairwind已经拥有超过650家全球合作伙伴,覆盖政府、关键基础设施以及核心技术平台。

这意味着谷歌此次并不只是发布一个网络安全模型,而是在尝试建立一个面向防御方的AI安全生态。

尤其值得注意的是,谷歌强调Fairwind将首先为政府和对社会韧性至关重要的企业提供访问权限,包括医疗、电信、能源和金融等关键基础设施运营商,以及维护广泛软件基础设施的技术平台。

Flash高频迭代,谷歌押注“更便宜的智能体”落地

从3.6 Flash到3.7 Flash,再到如今的3.8 Flash,谷歌正在明显加快Flash系列的更新节奏。

而与早期Flash模型强调“快”和“便宜”相比,如今的3.8 Flash更加突出长周期推理、工具调用、软件工程和自主智能体能力。谷歌试图证明的是:不一定需要最大规模的模型,才能完成越来越复杂的真实工作。

价格则成为谷歌扩大这一战略的重要杠杆。

3.8 Flash继续维持每百万输入Token 0.75美元、输出Token 3.75美元的年底前引导价格,同时提供1M Token上下文窗口,并支持文本、图像、语音和视频输入。消费者可以通过谷歌AI Pro和Ultra订阅使用,开发者则可以通过Antigravity、谷歌AI Studio和Android Studio调用,企业用户可通过Gemini Enterprise使用。

对于谷歌而言,这种策略的意义在于:在AI竞争从“谁的模型最强”逐渐转向“谁能让智能体以合理成本完成更多实际任务”的过程中,Flash系列可以凭借成本和速度优势抢占更大规模的应用入口。

而此次同时推出通用智能体模型和网络安全专用模型,也显示谷歌正在把Gemini的竞争重点从单纯的聊天和问答,进一步推向编程、企业工作流以及能够直接创造经济价值的AI执行任务

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
被身家亿万亲爹吸血多年,现37岁无人问津的释小龙,到底做错了啥

被身家亿万亲爹吸血多年,现37岁无人问津的释小龙,到底做错了啥

草莓信箱
2026-09-05 09:58:06
太可恶!男子随身携带剪刀,在上海医院专挑幼童下手!恶行不止一起

太可恶!男子随身携带剪刀,在上海医院专挑幼童下手!恶行不止一起

上观新闻
2026-09-06 11:46:28
羽协4个月3人被查!消失9年,带出92个冠军的李永波,今现状如何

羽协4个月3人被查!消失9年,带出92个冠军的李永波,今现状如何

皮皮电影
2026-09-06 12:10:21
中国女篮4分险胜!全队25次失误仍赢球,韩旭狂轰22分14板

中国女篮4分险胜!全队25次失误仍赢球,韩旭狂轰22分14板

体坛小李
2026-09-06 22:27:31
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
北京夏联83-78青岛 球员评价:4人优秀,3人及格,2人低迷

北京夏联83-78青岛 球员评价:4人优秀,3人及格,2人低迷

篮球资讯达人
2026-09-06 22:14:51
张雪机车周末双登领奖台 2026世界超级摩托车锦标赛法国站第二回合完赛

张雪机车周末双登领奖台 2026世界超级摩托车锦标赛法国站第二回合完赛

封面新闻
2026-09-06 21:50:25
碧桂园若爆雷,问题大过恒大!看到许家印结局,杨氏父女疯狂求生

碧桂园若爆雷,问题大过恒大!看到许家印结局,杨氏父女疯狂求生

铭记历史呀
2026-09-05 18:54:06
2027年运势最强的4个生肖!自带金运加持,贵人财神爷庇护!

2027年运势最强的4个生肖!自带金运加持,贵人财神爷庇护!

毅谈生肖
2026-09-06 09:33:42
媒体人直言:张宇辰该早点去打高水平比赛

媒体人直言:张宇辰该早点去打高水平比赛

晚风知我意21
2026-09-05 22:35:35
明天A股就开盘!就问你怕不怕!

明天A股就开盘!就问你怕不怕!

龙行天下虎
2026-09-06 19:52:11
关于两岸统一,黄智贤交底后,邱毅发声亮了,不简单

关于两岸统一,黄智贤交底后,邱毅发声亮了,不简单

观星赏月
2026-09-06 14:08:28
天狂有雨,人狂有祸:人再有本事,也不要得罪这四种人,切记!

天狂有雨,人狂有祸:人再有本事,也不要得罪这四种人,切记!

金沛的国学笔记
2026-09-05 18:20:17
13亿没白交:保变被印度掏空技术扫地出门,如今新规焊死技术闸门

13亿没白交:保变被印度掏空技术扫地出门,如今新规焊死技术闸门

无情有思ss
2026-08-19 06:21:47
NBA总决赛最强5次个人表演:乔丹场均41分仅第二,第一却没夺冠

NBA总决赛最强5次个人表演:乔丹场均41分仅第二,第一却没夺冠

兵哥篮球故事
2026-09-06 20:26:11
撒贝宁:本以为生了龙凤胎已经够幸福,没想到,如今幸福又升级了

撒贝宁:本以为生了龙凤胎已经够幸福,没想到,如今幸福又升级了

白面书誏
2026-09-06 13:20:56
折叠屏iPhone系统界面提前曝光?这些细节暴露真假

折叠屏iPhone系统界面提前曝光?这些细节暴露真假

科技兽
2026-09-06 23:05:27
女人假装高潮的3个信号,看懂后让她体验一次真正的爽与满足

女人假装高潮的3个信号,看懂后让她体验一次真正的爽与满足

精彩分享快乐
2026-09-04 12:00:12
阿里42岁前高管美国失踪,发现时死于车内,好友:半月前就不对劲

阿里42岁前高管美国失踪,发现时死于车内,好友:半月前就不对劲

大鱼简科
2026-09-06 09:29:49
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
2026-09-06 23:55:00
华尔街见闻官方 incentive-icons
华尔街见闻官方
中国领先的金融商业信息提供商
151850文章数 2654648关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

亲子
手机
旅游
健康
公开课

亲子要闻

工程车小故事:淘气的小警车

手机要闻

华为最贵手机发布前瞻:三折叠防窥屏+阔屏游戏神器,钱包又要扛不住了

旅游要闻

浙江绍兴葫芦娃爷爷,游客太多影响休息:狠心剪掉7个葫芦娃

脑梗取栓成功≠活下来,还有这三关

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版