网易首页 > 网易号 > 正文 申请入驻

Gemini 3.8 Flash 光速发布:干活挺勤快,就是没开窍

0
分享至


以近乎下饺子的速度,Gemini 又双叒更新了。

今天凌晨,Gemini 3.8 Flash 正式上线。这已经是 Google 在六周之内发布的第三款 Flash 模型


看起来,Google 要把「小步快跑」的战略贯彻到底。但我比较担心的是,按这个速度,在 Gemini 4 出来之前 3.x 的版本号好像不太够用了……

从版本号上看这只是一个常规更新,但 Google 给 Flash 系列模型安排的任务却越来越重。官方说法称,它的目标是编写和修改大型项目、反复调用工具、独立完成持续数小时的复杂工作。

这些一般用来衡量顶级 Agentic 模型的活儿,如今都委派给了 3.8 Flash。


Flash 系列原本的意义是跑得更快、花得更少,但现在,它不得不代替迟迟没有出现的 3.5 Pro,证明 Google 仍有能力留在牌桌上。

看官方跑分,Google 似乎真的做到了;但社区反馈和我们的简单测试得出了一个相反的结论:

六周连更三代,Gemini 3.8 Flash 依然「圣质如初」。

三周一个新模型,跑分已逼近 Opus 5

Google 将 Gemini 3.8 Flash 称为「迄今最聪明的 Flash 模型」,主要面向长程软件工程、自主 Agent 和复杂企业工作流。

话都这样说了,那最显眼的提升自然是编程。

在测试长程软件工程能力的 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 71.0% 的成绩,相比 3.7 Flash 的 65.3% 又提高了近 6 个百分点,距离 Claude Opus 5 的 74.0% 只剩一步之遥——要知道,一个半月以前的 3.6 Flash 只有 49%。


而在跨越 STEM、人文和专业知识的 HLE-Verified 中,3.8 Flash 得分 54.9%,略高于 Opus 5 的 54.4%。

在部分多模态测试中,优势甚至更为明显:复杂图表理解测试 CharXiv Reasoning 得分 86.2%,超过 Opus 5 的 83.7%;采用 Agent 模式处理长视频时,LVBench 得分达到 87.8%,更是碾压 GPT-5.6 Sol 和 Opus 5 在内的一众顶级模型。


金融和法律也是 Google 重点宣传的方向。3.8 Flash 在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 中均超过 3.7 Flash 及其他更昂贵的前沿模型。


只看这些数字,一款价格远低于 Opus 5 的 Flash 模型,似乎已经在编程、图表、视频和部分专业任务中摸到了旗舰模型的门槛。

好消息是,这些能力提升算是「免费升级」,因为 3.8 Flash 和不久前发布的 3.7 Flash 价格保持一致:每百万 Token 输入 0.75 美元,输出 3.75 美元。

原则上这只是限时优惠价格,2027 年 1 月 1 日起,输入输出价格将分别恢复至 1.5 美元和 7.5 美元。


其实早在 3.6 Flash 发布时,Google 就说过这优惠价只会持续到年底;但现在看来,他们更新模型的速度已经明显快过更新价格。说不定这个优惠政策,能熬走四五代模型。

Google 解释称,3.8 Flash 之所以能完成更困难的任务,主要是因为它「更加努力」。也就是说,面对复杂问题时,它会执行更多推理步骤、反复调用工具,并在过程中检查自己的工作。


代价是,它可能比 3.7 Flash 消耗更多的 Token。Google 甚至建议,如果任务更重视计算效率,可以选择降低推理档位,或者继续使用 3.7 Flash。从这个角度来看,3.8 Flash 所谓的更强,似乎有相当一部分来自这种推理上的「强制超频」。

与 3.8 Flash 一起发布的还有 3.8 Flash Cyber。在顶尖大模型越狱发动攻击已经变成一种新的 benchmark 的当下,Cyber 可以说是专门给网络安全机构和网络基础设施维护者用来发现、修复漏洞的专用「补锅匠」。


Google 表示,在一项覆盖 20 种编程语言的内部漏洞发现测试中,其成功率超过 70%。不过,这款模型只通过 Fairwind Program 提供给可信的网络安全机构,普通用户还是接触不到。

速度很 Flash,结果也还是 Flash

为了彰显对 3.8 Flash 的宣传所言非虚,Google 在官方博客中准备了几段炫技演示。

其中一个是完整的 3D 魔法城堡。玩家扮演巫师在城堡中探索,场景里包含谜题、环境叙事、可交互物品和完整关卡,纹理由 Nano Banana 负责生成。


另一个案例则把 Google Maps 塞进了 DOS 界面。它复刻了早年的计算机视觉风格,功能相当完善,可以搜索地点、规划路线,甚至进入街景界面。


至少从官方视频来看,这些已经是具备交互功能和基本产品逻辑的完整 Demo 了。

但 Google 说的话吧,我们也就姑且听听,毕竟前天他们还向《华尔街日报》爆料称内部工程师编程时更喜欢用 3.8 Flash 而不是 Opus 5……

结果怎样,还是要实测了才知道。

所以,我们也拿了两个类似的任务,简单测试了下 3.8 Flash 的成色。

第一项测试是利用 Three.js 搭建一个空客 H145 直升机的 3D 模型。3.8 Flash 没让我等太久,仅用不到一分钟就拆解完了需求,然后以恐怖的速度倾泻出代码;又过了 109 秒,场景和模型就都做好了。


提示词:Create a realistic 3D model of an Airbus H145 helicopter in Three.js. Use the standard factory demonstrator color scheme, emphasizing the compact fuselage, Fenestron enclosed tail rotor, and detailed rotor assembly. Use clean geometry, realistic PBR materials, soft studio lighting, and a neutral background in Three.js。

单从生成速度来看,它的确对得起 Flash 的名头。

但打开看结果,有点不对劲了。功能倒是齐全的,基本光照也有,但机身细节、部件关系和运动方式都相当粗糙。跑是能跑,但和 H145 直升机的关系约等于鸡仔饼与鸡仔的关系。

一直有看爱范儿的读者应该熟悉,这正是昨天我们报道 Fable 5.1 时援引过的测试案例。怎么说呢?由奢入俭难啊……


图|X@@HarshithLucky3

第二项测试是 3D 水流模拟,要求设置可替换的地形,来模拟降雨和地表径流在地形上的移动。同样是两分钟做出来,但这个火山口好像有点漏水……


提示词:Build an interactive 3D water simulation in this empty repository.Generate a procedural mountain landscape from a deterministic seed. Water must flow downhill according to the local terrain gradient, collect in depressions, and form visible streams and lakes.Use TypeScript, Vite, and Three.js. Do not use a prebuilt physics engine or external 3D assets.

这类结果的微妙之处在于,它在工程上确实不是完全失败。任务能结项,代码通常能运行,要求的功能也齐全,但显然离官方案例有着肉眼可见的距离。

X 上的首批用户反馈也出现了类似分裂。一方面,3.8 Flash 的响应速度普遍得到认可;但与此同时,它在真实编程和生成任务中依然容易草率理解需求,迅速交出一个形式完整、但细节一塌糊涂的结果。


图|X@aipulseda1ly

这未必就代表着 Google 伪造了跑分。更有可能,官方和用户测试已经是完全不同的使用方式。

在魔法城堡的案例里,官方明确提到,它是由 3.8 Flash 在 Antigravity 中通过循环指令持续工作,并调用 Nano Banana 生成了场景纹理。

换句话说,官方样例里模型通常有专门设计的 Agent 框架、工具环境和明确的多轮测试标准,而我们用的时候,通常只是给它一段一次性的自然语言指令。

Google 展示的是 3.8 Flash 被整套技术栈托举之后的上限;我们接触到的,是模型单独工作时的下限。因此,3.8 Flash 有可能是个不错的 Agent 零件,但离单独撑起一套可靠的自主工作流还有距离。


图|X@adxtyahq \| 看见球丝滑入墙的一瞬间谁绷得住呢?

更值得注意的是,Google 声称 3.8 Flash 会更认真地推理、调用工具和检查结果,但实际体验很难感受到这种「勤奋」。哪怕将推理等级调到最高,它给人的感觉也不是深思熟虑规划后作答,而是快速堆出一个能交差的结果。

Google 原本想证明,Flash 模型也能在部分场景干旗舰模型的重活,但至少现阶段,它的判断力、稳定性和完成度和旗舰模型相比还是有很明显的差距。

模型之间,等级森严。

Google 不争第一,反而可能赢得更多

就在 3.8 Flash 发布前一天,Google AI Studio 负责人 Logan Kilpatrick 放出了一段与 Google DeepMind 新掌门人 Koray Kavukcuoglu 的访谈。


Koray 在采访中承认,Google 当前的模型「略低于前沿」,但也相当直接地回应了外界关于 Google 已经放弃最强模型竞争的说法:

除了站在前沿,没有别的事情对我们更重要。我百分之百确定,我们会回到前沿。

但表态和现实是两回事。爱范儿此前获悉,Gemini 3.5 Pro 交付失败之后,Google 短期内不再押注 Fable、Opus 级别的超大规模模型,而是将更多资源转向成本更低、迭代更快的 Flash。

当然,这不代表 Koray 说的是空话。Gemini 4 仍然承担着带领 Google 重返第一梯队的长期目标,但不在第一梯队,人也是要吃饭的——在那之前,Flash 要负责守住用户、产品、开发者和收入。

不过,「前沿」有时是一种诅咒。

OpenAI 即将推出的 Astra 已经达到了所谓「关键级」网络安全能力,可以在较少人工介入的情况下发现未知漏洞;研究者也担心,下一代模型可能逐渐采用越来越难观察内部推理过程的架构,让依靠思维链监控危险行为变得更困难。


Anthropic 的 Fable 5.1 则展示了另一种代价——它的能力大幅领先,但社区反馈表示,长任务、子 Agent 和复杂工作流甚至会在两个简单问题后就吞噬掉 Max 订阅计划的五小时额度。

当前沿模型继续前进,它们带来的还有更难控制的能力、更昂贵的推理过程,以及监管机构的巨大压力。

从这个角度来看,3.5 Pro 的失败未必完全是坏事。

转向 Flash 以后,Google 可以将数月一次的前沿模型豪赌,变成像普通软件一样持续更新。新的 Flash 模型可以迅速进入 Gemini App、AI Studio、Antigravity 乃至 Google 搜索,在真实使用中暴露问题,再以「周更」的节奏修修补补。


图|Android Police

如果 3.5 Pro 没有失败,Google 未必会这么决绝地走上这条路。

Gemini App 的月活跃用户已经超过 10 亿,成为 Google 历史上增长最快的产品;从去年五月至今,它增加了约 6 亿用户。

可见,增长不需要最强的模型。

大多数人不会让 AI 独自连续工作九个小时,也不会要求它发现零日漏洞。他们只是想搜索资料、修改照片、总结邮件、做心理咨询或者写一篇小说给自己看。这种时候,没有被长程任务优化污染的 Gemini,反而能写出更好的文字。

即将在中国市场补上空缺的 Apple Intelligence 也是如此。它首先要解决的是通知、文本、图片、Siri 和跨应用操作问题,而非在 benchmark 中击败谁。


对于要被塞进数亿台手机、浏览器和办公软件的 AI 而言,速度快、成本低、能够高并发运行,比拿下排行榜第一更重要。


图|3.8 Flash 惊人的输出速度

退出最强模型的消耗战,可能是一门更轻松的生意。

可这也意味着,在 Gemini 4 真正出现之前,为 Google 技术力代言这项工作只能由 Flash 强行顶上。

于是,Gemini 3.8 Flash 成了一款绝无仅有的奇怪模型。


图|Artificial Analysis

它既要足够快、足够便宜,塞进搜索、手机和十亿人的日常;又要像旗舰模型一样长时间工作、反复调用工具,承担复杂编程和 Agent 任务。

理想很美,现实很糟。两种相反目标的张力之下,3.8 Flash 只能在官方跑分里冒充一会儿 Pro 的样子。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国女孩在韩国遇害案真相大白了!这个案子,差点就被凶手洗白了

中国女孩在韩国遇害案真相大白了!这个案子,差点就被凶手洗白了

放开他让wo来
2026-08-31 22:37:06
世界上最大的盗版网站,正在保存人类文明的火种

世界上最大的盗版网站,正在保存人类文明的火种

码农翻身
2026-08-26 08:59:39
580倍里程差的真相:Waymo在特斯拉Cybercab发布会前夜,发了一篇“不点名”的檄文

580倍里程差的真相:Waymo在特斯拉Cybercab发布会前夜,发了一篇“不点名”的檄文

数读网约车
2026-09-01 11:40:47
官方:欧足联对贡多齐、格林伍德以及费内巴切启动纪律程序

官方:欧足联对贡多齐、格林伍德以及费内巴切启动纪律程序

懂球帝
2026-09-03 15:32:09
练肌肉=存寿命!一副哑铃,5个动作锻炼全身肌群,有效抗衰老、延寿

练肌肉=存寿命!一副哑铃,5个动作锻炼全身肌群,有效抗衰老、延寿

增肌减脂
2026-09-01 22:30:08
沈敏会见余姚市委书记沃勇特,深化省地合作助力余姚创新发展

沈敏会见余姚市委书记沃勇特,深化省地合作助力余姚创新发展

科技武林门
2026-09-03 22:34:30
县城女老师成为大龄剩女重灾区?网友:收入低,眼光高,缺少社会经验

县城女老师成为大龄剩女重灾区?网友:收入低,眼光高,缺少社会经验

带你感受人间冷暖
2026-08-24 00:12:17
3300万粉丝网红,偷税被罚347.7万元

3300万粉丝网红,偷税被罚347.7万元

第一财经资讯
2026-09-03 19:05:43
郑钦文世界排名飙升27位,收获5大利好,美网女单32强决出22席了

郑钦文世界排名飙升27位,收获5大利好,美网女单32强决出22席了

小齐艰难度日
2026-09-04 06:28:34
王菲最后那一拽,不是因为清醒,而是因为宋妍霏是“自己人”。

王菲最后那一拽,不是因为清醒,而是因为宋妍霏是“自己人”。

再来一杯冰美式
2026-09-02 23:14:38
一句“紫禁城中静悄悄”,郭德纲9月演出清单变得空荡荡

一句“紫禁城中静悄悄”,郭德纲9月演出清单变得空荡荡

听心堂
2026-09-02 16:12:43
悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

悲剧还是发生了!黑龙江女子因酷热将空调连续开了一天一夜,期间紧紧关闭门窗。随后她开始剧烈头痛、恶心头晕...

LULU生活家
2026-08-26 19:42:18
让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

让大众中国告诉常州星宇: 再复制富士康式的悲剧,后果会如何

冷观互联网
2026-09-01 16:23:40
罕见存款利率倒挂,存5年、3年、2年利息不如存1年

罕见存款利率倒挂,存5年、3年、2年利息不如存1年

21世纪经济报道
2026-09-03 15:54:10
随着28岁日本球星首秀一剑封喉+里尔1-0,法甲最新积分榜出炉

随着28岁日本球星首秀一剑封喉+里尔1-0,法甲最新积分榜出炉

俯身冲顶
2026-09-04 05:12:39
听说这是孙宇晨珍藏的景甜照片

听说这是孙宇晨珍藏的景甜照片

年代回忆
2026-08-28 16:24:14
我22岁那年和38岁的女房东之间,发生过一段至今不敢提的往事

我22岁那年和38岁的女房东之间,发生过一段至今不敢提的往事

千秋文化
2026-09-02 19:30:56
韩女星拒为中国奶茶代言,给100亿韩元也不行,真面目被网友戳穿

韩女星拒为中国奶茶代言,给100亿韩元也不行,真面目被网友戳穿

揽星河的笔记
2026-09-03 18:20:51
常州星宇股份生产人员一年少了3182人,公司劳务外包工时持续增加,小时工留任奖加到3元;此前被曝“羞辱式”批量劝退应届生

常州星宇股份生产人员一年少了3182人,公司劳务外包工时持续增加,小时工留任奖加到3元;此前被曝“羞辱式”批量劝退应届生

大风新闻
2026-09-03 10:37:06
迈莎锐改装版极氪9X真在国内开售,90.9万起有值不值?

迈莎锐改装版极氪9X真在国内开售,90.9万起有值不值?

玩车改装分享
2026-09-04 00:42:06
2026-09-04 07:59:00
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39365文章数 2602460关注度
往期回顾 全部

数码要闻

HKC“天启27Q320B”26.5英寸显示器首销,3199元

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

头条要闻

媒体:美国驻华大使馆关心灾情的方式令人不适

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

科技要闻

英伟达129亿美元拿下Hugging Face

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

本地
时尚
家居
健康
公开课

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

女人到了60岁衣服少穿大红大绿,试试这些纯色单品,高级又耐看

家居要闻

2026建博会(广州) 公装联探展交流活动

脑梗能否取栓,关键看这几点!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版