网易首页 > 网易号 > 正文 申请入驻

刚刚,Gemini 3.8 Flash 来了,结果惨遭对手嘲讽

0
分享至

好好好,谷歌也开始按月更大模型了。

就在刚刚,距离 Gemini 3.7 Flash 发布仅仅过去三周,Google Gemini 3.8 Flash 和专攻网络安全的 Gemini 3.8 Flash Cyber 同时登场。


算下来,短短 6 个星期,Gemini Flash 产品线已经完成了 3 次大版本迭代,平均每三周就有一个新模型出现。

放在过去的大模型行业里,这种更新速度几乎难以想象。


更值得关注的是,谷歌内部一套新的模型开发方式也逐渐显露出来:越来越多 Agent、强化学习和工具调用方面的新能力,开始优先出现在体量更小、修改成本更低的 Flash 上。

而且最近突然加速的还不止谷歌。

就在 Gemini 3.8 发布前后,Meta 刚刚也更新了 Muse Spark 1.3,把 Agent 长任务、编码能力和推理效率列为这一代模型的主要升级方向。


更有意思的是,Meta AI 负责人 Alexandr Wang 发布新模型之后,也再次阴阳怪气地调侃道:「我真不想这么说,但是……Gemini 是谁?」


Pro 难产,Flash 被推上了主桌

先看主角 Gemini 3.8 Flash。

谷歌给它的定位相当高,称其为目前谷歌最智能的推理与编程模型之一,重点瞄准端到端自主 Agent 工作流,以及需要持续运行较长时间的软件工程任务。

从官方公布的 Benchmark 来看,谷歌显然希望推动 Flash 摆脱「便宜、快速模型」的固有定位,进一步承担复杂任务的执行。


在 DeepSWE v1.1 长周期软件工程测试中,Gemini 3.8 Flash 可以自主处理复杂的端到端工程问题,成绩超过了不少体量更大的前沿模型。


面对金融和法律等专业场景,它同样提升明显。


在 Vals Finance Agent V2、Harvey's Legal Agent Benchmark 等测试中,3.8 Flash 都显著领先上一代 3.7 Flash;涵盖 STEM、人文与专业知识的 HLE-Verified 测试里,它拿到了 54.9% 的成绩。


至于这款模型是怎么做到的,就不得不提谷歌这次重点强化的Agentic loops,也就是模型在完成复杂任务时持续推理、调用工具、检查结果并修正方案的能力。

过去很多 Coding 模型更像一次性给答案,生成一段代码以后,后续能不能运行、哪里需要修改,往往还得依赖用户继续介入。

现在的 3.8 Flash,则越来越像一个愿意把活干完的「打工圣体」。

面对复杂任务,它可以主动增加推理步骤,连续调用不同工具,根据执行结果重新评估方案,并在发现问题以后继续修改。

因此,当用户把 effort level 调高以后,模型会投入更多推理和 Token 预算,以换取更高的复杂任务完成率;面对普通任务,也可以降低 effort level,把响应速度和使用成本控制下来。

官方 Demo 更能说明这种变化。

在 Google Antigravity 中,只需要给出一个相对简单的循环任务指令,Gemini 3.8 Flash 就可以持续调用工具,完成一个可玩的 3D 巫师闯关游戏,其中包括谜题、环境叙事以及由 Nano Banana 生成的纹理资源。


它甚至还能做出一个完全可玩的 DOS 版 Google Maps,其中包括街景和导航功能。

不过根据网友的真实测试,3.8 Flash 的优缺点也变得更加鲜明。

目前比较一致的感受,是它真的非常快,而且便宜得惊人,但「做得快」和「最终成品最好」之间,暂时还不能完全画上等号。

AI/ML API 用完全相同的提示词,让 Gemini 3.8 Flash 和 Claude Opus 5 分别制作四个独立的 Three.js 物理场景,包括针刺气球、水球坠落、蘑菇云以及动态原子模型。


Gemini 3.8 Flash 总成本只有 0.12 美元,Claude Opus 5 则花了 1.86 美元,价格相差超过 15 倍;与此同时,Flash 完成每个场景都不到 70 秒,Opus 5 最慢则接近 5 分钟。

另一位,开发者 Tim Jayas 的结果更加夸张。他把同一个提示词分别交给 Gemini 3.8 Flash 和 Opus 5,Opus 5 花了整整 24 分钟,3.8 Flash 只用了 37 秒。


不过另一批测试,也暴露了 Flash 很典型的另一面。

开发者 Aditya 用 Gemini 3.8 Flash 和 Kimi K3 制作同一个 Sticky Ball 游戏时就发现,Flash 生成速度极快,消耗的 Token 也明显更少,但最终游戏体验明显落后于 K3,在运动机制、移动表现和整体游戏设计上都有差距。


类似情况也出现在一个高复杂度的纽约城市场景测试里。

博主 AI Pulse Daily 使用完全相同的提示词测试 Gemini 3.8 Flash、3.7 Flash 和 Opus 5,要求模型生成一个细节密集的 Three.js 纽约城市场景。

结果 3.8 Flash 整座城市只放了 6 棵树,甚至比三周前 3.7 Flash 的 10 棵还少,而 Opus 5 塞进了 1840 棵。


提示词明确要求的人行横道条纹、水下焦散和色差效果,3.8 Flash 也全部略过;与此同时,它却主动加入了 5 个摄像机预设、3 个后处理开关、标题卡和实时时钟,其中不少功能根本没有出现在用户要求里。

另外,在价格方面,Gemini 3.8 Flash 的输入价格仍然为每百万 Token 0.75 美元,输出为每百万 Token 3.75 美元,与三周前降价后的 Gemini 3.7 Flash 保持一致,目前的优惠价格将持续到 2026 年底。

对于谷歌来说,Flash 的角色已经越来越明确:它既负责成本和速度,也一定程度上承担过去更多由旗舰模型负责的复杂任务。

Gemini 的新能力,为什么总在 Flash 首发?

与 Gemini 3.8 Flash 一起发布的,还有专门针对网络安全任务训练的 Gemini 3.8 Flash Cyber。

后者通过新的 Fairwind 计划向经过审核的防御者开放,能力重点集中在漏洞发现、渗透测试以及自动生成安全补丁等场景。

Gemini 3.8 Flash Cyber 在标准 CyberGym 漏洞发现 Benchmark 中明显超过上一代 Gemini 3.5 Flash Cyber,同时也超过了多款体量更大的前沿模型。


在谷歌内部覆盖 20 种编程语言的真实代码测试中,它发现漏洞的成功率超过 70%。

自动修复漏洞方面,Gemini 3.8 Flash Cyber 在 CWE-Bench 上取得了 47.2% 的 Pass@1,与表现最好的前沿模型 47.8% 已经非常接近,而模型运行成本明显更低。


Chrome 安全团队给出的内部结果显示,Gemini 3.8 Flash Cyber 生成的正确漏洞补丁数量,可以达到部分大型商业模型的 2.6 倍。

安全公司 Wiz 的测试同样显示,使用该模型进行渗透测试以后,漏洞召回率提高了约 7.5% 至 9.7%,与此同时,成本下降约 2.3 至 5.2 倍。

谷歌云漏洞研究团队还披露过一个更加极端的案例,他们利用 Gemini 3.8 Flash Cyber,在不到两个小时的时间里发现了一处严重基础漏洞,而按照传统研究流程,类似问题通常可能需要数月时间才能被定位。

值得一提的是,在 Gemini 3.8 Flash 系列模型发布前,《华尔街日报》就曾披露 Gemini 3.8 Flash 在谷歌内部的代号为 Skimaki。

员工曾经在内部代码工具 Jetski 中,让它与 Anthropic 的 Claude Opus 进行对比测试,结果不少谷歌工程师反而更加偏好自家的新模型。

代码能力重新成为谷歌重点竞争的战场,而 Flash 目前显然承担了相当重要的角色。

对比之下,谷歌过去一年在旗舰模型上的进展经历了不少波折。

Gemini 3.0 在去年 11 月发布以后曾经短暂取得领先,随后 OpenAI 和 Anthropic 的新模型继续向前推进,谷歌的优势没有维持太久。


Noam Shazeer、Jeff Dean 等重要技术人物也在今年夏天陆续离开。

原本计划继续推进的 Gemini Pro 新版本同样遭遇调整。

皮查伊曾在今年 5 月透露新版 Pro 可能在随后一个月到来,但谷歌内部准备的 Gemini 3.5 Pro 方案最终被取消,其中一个重要原因,就是相对于 Flash 系列的能力提升不够明显。

更远一些的 Gemini 4 虽然已经完成部分预训练工作,目前仍然处在后训练阶段,距离正式发布还有一段距离。

谷歌随后也调整了 DeepMind 的管理层,Koray Kavukcuoglu 接手更多管理职责,新管理层给团队提出的一项明确要求,就是进一步加快模型研发与发布速度。


大哥难产,只能靠小老弟 Flash 出来扛大旗了。

不过 Flash 最近近乎疯狂的更新频率,背后其实对应着大模型研发方式正在发生的一次变化。

单纯依靠扩大模型规模获得能力增长,边际收益已经没有前几年那么明显;强化学习、Agent training、工具调用和其他后训练技术的重要性,则持续上升。

《华尔街日报》提到一个很关键的细节:Flash 规模相对较小,因此修改和重新训练模型所需要消耗的算力更低,谷歌内部可以让多个团队同时尝试不同方案。

换成规模庞大的 Pro 系列以后,每一次模型调整都会涉及更多 GPU、训练时间以及跨团队资源协调,同样一种后训练实验,试错成本自然高得多。


与此同时,谷歌今年明显增加了对强化学习和后训练的投入,还从 OpenAI 招募了后训练负责人 Barret Zoph 担任研究副总裁。

资源投入方式变化以后,一个结果逐渐显现出来:新的 Agent 训练方法、RL 策略以及工具调用机制,更容易先在 Flash 上进行实验,并在验证有效以后迅速进入正式版本。

从产品开发方式来看,现在的 Flash 多少有点 Gemini「高速开发分支」的意思。

模型更小,修改成本更低,所以谷歌可以让多个团队同时尝试不同的 Agent training、RL 和工具调用方案,三周左右就完成一次新版本迭代。


Pro 系列承担的任务则越来越接近真正意义上的旗舰版本,只有能力提升达到足够大的幅度以后,投入巨量算力和内部资源更新一次才更划算。

说到底,谷歌未必一开始就计划让 Flash 扛起这面大旗。但阴差阳错的是,这种局面恰好撞上了大模型研发重心的变化。

伴随着强化学习、Agent training 和工具调用越来越重要,模型体量更小、实验成本更低的 Flash,反而在短时间内比 Pro 更适合快速后训练。

因此在旗舰模型难产的情况下,谷歌反倒提前摸到了 Flash 模型下半场更重要的能力:也就是更快训练、更快验证,以及更快把新的后训练成果交到用户手里。

当然,这一切的前提是,Gemini 4 最终能争点气,不再让人失望。

我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
湖北省委书记岗位被年轻人顶替,转头进海边干出中国核电的里程碑

湖北省委书记岗位被年轻人顶替,转头进海边干出中国核电的里程碑

阿天爱旅行
2026-09-04 06:19:22
0-0国安刚1夜!海港传来主帅穆斯卡特消息,梅伦多说的很实在

0-0国安刚1夜!海港传来主帅穆斯卡特消息,梅伦多说的很实在

各地精彩不容错过
2026-09-06 11:08:17
越聪明的人,越是「脑袋空空」?复旦大学:高智商者,大脑修剪冗余神经连接,关键脑区皮层更薄;且左右脑发育呈高度不对称

越聪明的人,越是「脑袋空空」?复旦大学:高智商者,大脑修剪冗余神经连接,关键脑区皮层更薄;且左右脑发育呈高度不对称

梅斯医学
2026-09-04 07:55:54
又内乱了!德云社元老级人物离开,发文内涵郭德纲,彻底撕破脸面

又内乱了!德云社元老级人物离开,发文内涵郭德纲,彻底撕破脸面

访史
2025-08-31 15:25:43
每公里成本0.84元!特斯拉无人驾驶网约车Cybercab正式发布,将在北京上海多地展示

每公里成本0.84元!特斯拉无人驾驶网约车Cybercab正式发布,将在北京上海多地展示

澎湃新闻
2026-09-04 10:12:42
武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

武大女教授风波升级:两人出轨细节被扒,大胆又荒唐,早不是秘密

石辰搞笑日常
2026-09-06 05:03:05
杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

杨颖马尔代夫被偶遇,一身奢侈品素颜扎低马尾,脸都被墨镜挡住了

东方不败然多多
2026-09-06 15:04:36
中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

中国之所以重视印度共产党,并非因其亲华立场,而是因为一旦它成功,极有可能在印度再造出一个超级工业国

人生录
2026-09-06 00:05:19
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
余承东又官宣享界V8了,说实话,大家真的厌倦鸿蒙智行不停的发布新车

余承东又官宣享界V8了,说实话,大家真的厌倦鸿蒙智行不停的发布新车

春雨说科技
2026-09-05 12:42:22
数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

舒山有鹿
2026-07-25 09:57:20
郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

郭涛儿子落榜!被迫上北电国际班,一年学费12万,上完学至少80万

寒士之言本尊
2026-09-04 19:27:54
为啥买熟食的人变少了?行家:一斤鲜牛肉煮出两斤酱牛肉,啥原因

为啥买熟食的人变少了?行家:一斤鲜牛肉煮出两斤酱牛肉,啥原因

铜臭的历史味
2026-09-04 00:51:38
性关系:想多活25年,74岁以后,请死死记住这8句话

性关系:想多活25年,74岁以后,请死死记住这8句话

荷兰豆爱健康
2026-08-17 04:51:26
居委会的“权力清单”:2026年新规落地,7件民生大事意味着什么

居委会的“权力清单”:2026年新规落地,7件民生大事意味着什么

你在偷看谁
2026-08-25 20:54:50
房价下跌时间表来了?一线2万、二线8000元、三四线2000元会成现实吗

房价下跌时间表来了?一线2万、二线8000元、三四线2000元会成现实吗

坠入二次元的海洋
2026-09-06 12:01:04
全球最“开放”的国家:男女不注重隐私,性交易合法,政府给补贴

全球最“开放”的国家:男女不注重隐私,性交易合法,政府给补贴

轩逸阿II
2026-08-24 08:56:08
来感受一下泰国的绝望

来感受一下泰国的绝望

智先生
2026-09-03 22:58:31
冉莹颖给爸爸三婚妻子塞钱:“我不是给他的,是给您拿的”

冉莹颖给爸爸三婚妻子塞钱:“我不是给他的,是给您拿的”

韩小娱
2026-09-06 08:44:41
学英语就是崇洋媚外?胡锡进硬刚汤家凤:偏激、狭隘、蠢货

学英语就是崇洋媚外?胡锡进硬刚汤家凤:偏激、狭隘、蠢货

蜜桔娱乐
2026-09-05 19:52:38
2026-09-06 16:04:49
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6773文章数 26904关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

马克龙42岁继女爱上小20岁男友 上演妈妈的忘年恋剧情

头条要闻

马克龙42岁继女爱上小20岁男友 上演妈妈的忘年恋剧情

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

时尚
健康
房产
本地
数码

金秋最流行的鞋子,“红色”更时髦!

脑梗取栓成功≠活下来,还有这三关

房产要闻

突发重磅!海口出台楼市新政!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

TCL在IFA串起AI家!印刷OLED秀肌肉,还有「墨水屏」手机

无障碍浏览 进入关怀版