网易首页 > 网易号 > 正文 申请入驻

最强模型“跳票”,市值一夜蒸发2000亿美元!谷歌连上三款“省油”模型,死磕每一个token的钱

0
分享至


整理 | 华卫

昨夜,在 Alphabet 发布财报前一天,谷歌一口气推出了三款全新的 Gemini 模型,全部属于主打“快速、低成本”的 Flash 系列,重点聚焦于提升复杂智能体(agentic)工作流中的运行效率,并降低 token 消耗。其核心特性很明确:效率优先于绝对性能。

短短一周内,xAI 的 Grok 4.5、OpenAI 的多版本 GPT-5.6 以及 Moonshot AI 的 Kimi K3 相继发布;与此同时,Anthropic 的 Fable 5 已登顶多项榜单。而在这个“被全面超车的夏天”,谷歌当前给出的回应是:更便宜的模型。

牺牲峰值性能,

换取效率和更低的价格

根据谷歌的说法,这一全新的 Flash 系列旨在通过更强的能力与更高的性价比,优化 AI 智能体的开发。该系列共包括三款模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及面向安全场景的 Gemini 3.5 Flash Cyber。

其中,Gemini 3.6 Flash 是其旗舰模型中的“主力款”,主打在质量与效率之间取得最佳平衡。谷歌表示,相比前代,其知识截止时间更新至 2026 年 3 月,在编程、知识型任务以及多模态推理能力上均有所提升,同时将平均输出 token 消耗降低了 17%。


同时,在部分使用场景中,Gemini 3.6 Flash 相比 3.5 Flash 最多可减少 65% 的输出 token。在后“token 精打细算”的时代,它确实在“省 token”方面有所表现,且这已经成为一个颇具意义的指标。通过减少中间推理步骤与工具调用,该模型显著压缩了多步骤 AI 工作流的整体运行成本。在基准表现上,Gemini 3.6 Flash 在代码修改准确率、机器学习研究、计算机操作、文档解析以及报告生成等任务中均有明显提升。包括 Heavia 和 Harvey 在内的企业客户表示,在视觉处理、图表分析和数据提取等多模态任务中,模型表现得到了显著增强。


关键的是,该模型的成本也更低,其输入价格为每百万 token 1.50 美元,输出价格从每百万 token 9 美元降至 7.5 美元。随着人们对 AI 使用成本的认知不断提高,这一点确实进一步增强了市场竞争力。但在性能对比层面,Gemini 3.6 Flash 并没有让人眼前一亮。

在大多数关键基准测试中,它似乎落后于 Anthropic 的 Claude Sonnet 5 以及 OpenAI 的 GPT-5.6;甚至在诸如智能体编程(agentic coding)等任务上,也开始被最新的 Grok 4.5 甩在后面。考虑到 Gemini 3.6 Flash 的价格并没有比竞争对手便宜太多,大致与 Grok 4.5 和 GPT-5.6 持平。因此,它要在这场模型大战中找到自己的定位,难度不小。


Gemini 3.5 Flash-Lite 是该系列中“最快、最具性价比”的模型,主要面向高吞吐的智能体搜索和大规模文档处理场景。该模型每秒可生成 350 个 token,和 3.6 Flash 一样,在延续前代性能的基础上进一步提升了整体效率。谷歌表示,Flash-Lite 在多个代理和编程基准测试中击败了旧款 3 Flash,包括 SWE-Bench Pro 和 OSWorld-Verified。与其直接前身 3.1 Flash-Lite 相比,其终端工作台 2.1 评分从 31% 提升至 54%。

该模型的价格也更低,其输入为每百万 token 0.30 美元、输出为每百万 token 2.50 美元,为高负载企业应用提供了更具性价比的解决方案。

可以看出,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 两款模型背后押注的是同一个战略判断:大多数 AI 使用场景,并不需要“前沿级大脑”,而是一个足够快、足够便宜的模型。今年早些时候,谷歌 CEO Sundar Pichai 表示:“企业已经在透支全年 token 预算,而现在才 5 月。”他在接受采访时称,组合使用 Flash 系列模型,每年可以为企业节省超过 10 亿美元。

目前,这两款模型背已向 Gemini 企业用户以及 Gemini 应用用户开放,3.5 Flash-Lite 也将在不久后接入 Google 搜索。

对标 Mythos 的“平价替代”

但有严格限制

最具针对性的发布,是 Gemini 3.5 Flash Cyber。该模型基于 Gemini 3.5 Flash 打造,并针对网络安全任务进行了专门优化,用于发现和修复软件漏洞。据悉,谷歌将其集成进 Google DeepMind 的代码安全智能体 CodeMender 中,该系统由多个 Flash Cyber 子智能体并行运行,并将结果汇总成一份统一报告,是谷歌进军网络安全专用模型的一次尝试。

谷歌将 Flash Cyber 定位为大型安全模型的“高性价比替代”,声称其在某项关键基准测试上可达到前沿模型水平,但成本仅为其一小部分。在 CyberGym 基准测试中,该模型取得了 83.2% 的成绩,仅比 OpenAI 的 GPT-5.5-Cyber(85.6%)低约 2 个百分点,尽管其模型规模要小得多。值得注意的是,CyberGym 是目前少数包含竞品模型对比的基准测试之一,各模型分数差距非常接近,而谷歌的优势主要体现在更低的 token 成本上。


在另一项测试中,Google 云漏洞研究团队利用该模型扫描公开 API,仅用两小时就发现了远程代码执行漏洞,并生成了可绕过安全防护的有效利用代码。在实际应用中,Google 的 Big Sleep 团队使用该模型检测 Google Chrome 和 Safari 中的关键漏洞,其表现超过了标准 Flash 模型以及 Anthropic 的 Claude Opus 4.6。在扫描 V8 JavaScript 引擎的代码提交时,Flash Cyber 发现了 55 个已确认的独立问题,而标准 3.5 Flash 发现 47 个,Opus 4.6 发现 36 个;其中有 10 个漏洞是其他模型完全未能识别的。

此外,Anthropic 在 AI 安全领域的领先地位也受到挑战。Mythos 是该模型的“隐形对手” ,但定价高达每百万输入 token 10 美元、输出 50 美元。

不过,谷歌也承认,这类模型在“进攻”和“防御”两方面同样强大,因此必须严格控制访问权限。目前,Flash Cyber 仅通过 CodeMender,在试点计划中向政府机构及可信合作伙伴开放,用于检测并修复安全漏洞。至于 CodeMender 智能体本身,则已通过 Gemini Enterprise Agent 平台提供预览版(但使用的是标准 Gemini 模型),支持 C/C++、Go、Java、Python、Ruby、Rust 和 TypeScript 等多种编程语言。

其竞争对手在网络安全能力上也采取了类似的访问限制策略。Anthropic 对其 Claude Mythos 实施了受限访问,而 OpenAI 则通过“可信访问”计划,仅向经过验证的用户开放 GPT-5.6 的部分防御能力。

关键模型缺席,曝 Gemini 4 开启预训练

尽管谷歌在 3.6 Flash 上有所推进,但更引人注意的,其实是“没有发布的东西”。

目前,谷歌在公开榜单前十中甚至没有一款模型。谷歌原计划在 6 月推出的旗舰模型 Gemini 3.5 Pro,至今仍在测试阶段,而华尔街正以该模型作为衡量 Google 旗下 Google DeepMind 是否能够与 Anthropic 和 OpenAI 保持竞争力的重要信号。去年 11 月,Gemini 3 系列模型的推出,一度显示出 Google 在经历多年落后后重回 AI 竞赛前列,甚至促使 OpenAI 在内部拉响“红色警报”,加速推进其 GPT 模型的研发。

7 月 17 日,据外媒报道,Gemini 3.5 Pro 的延期,据称是因为其未能达到内部预期,尤其是在编程能力方面,而这恰恰已成为企业级 AI 最具商业价值的应用场景之一。6 月下旬,团队曾尝试通过更新训练数据(即模型学习所依赖的大规模数据集)来进行改进,但结果依然令人失望。受该消息影响,Alphabet Inc. 的股价单日下跌约 4.4%,市值蒸发约 2000 亿美元。

有 10 名现任和前任谷歌员工透露,包括研究人员和管理层在内的许多人担心,随着竞争对手 Anthropic 和 OpenAI 推出能力超过 Gemini 模型,公司可能会在市场上失去优势。这些不愿具名的知情人士表示,谷歌在模型发布前需要协调多个层级的利益相关方,同时还要努力将 AI 融入其庞大的产品体系,包括搜索、地图以及 YouTube,这种复杂性也可能导致发布进度放缓。

谷歌对此的回应,是把目光投向更远处。该公司表示,已经启动了迄今为止“最雄心勃勃的一次预训练”,目标直指 Gemini 4。但这更多是一种意图表达,而非已经落地的能力。也就是说,Gemini 4 也很可能已经在预训练阶段。因此,与其说 Gemini 3.6 是一次重大升级,不如说更像是在“真正的大版本到来之前”,提醒市场 Gemini 仍然存在的一次展示。

这次谷歌的三款模型发布,率先传达出“效率优先”的策略。整体来看,这一策略是自洽的:在企业开始精打细算 token 成本的年份,用“便宜 + 快速”占领中端市场,同时为旗舰模型争取时间。并且,该策略也不止体现在软件层面。据了解,谷歌同时在研发自研芯片,以更低成本运行 Gemini。

但这场赌局能否成立,取决于两点:Gemini 3.5 Pro 能否尽快落地,以及 Gemini 4 最终是否不只是一次“训练中的承诺”。

https://ai.google.dev/gemini-api/docs/latest-model

https://www.reuters.com/business/google-updates-lightweight-gemini-models-flagship-still-delayed-2026-07-21/

https://www.bloomberg.com/news/articles/2026-07-16/google-gemini-launch-delayed-as-tech-falls-short-of-internal-goals

声明:本文为 AI 前线整理,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

做 AI 的谁还没点技术焦虑,来 AICon 深圳站,吃颗技术定心丸! 大会限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理13269078023 进行咨询。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
9月11日,人社部、财政部关于2026年上调退休人员基本基本养老金的通知正式公布之前,9月份养老金开始发放,有的没变化,有的变多了,你呢

9月11日,人社部、财政部关于2026年上调退休人员基本基本养老金的通知正式公布之前,9月份养老金开始发放,有的没变化,有的变多了,你呢

白昼说故事
2026-09-11 08:58:55
巅峰对战!美网女单决赛:萨巴伦卡再遇莱巴金娜 澳网决赛纽约重现

巅峰对战!美网女单决赛:萨巴伦卡再遇莱巴金娜 澳网决赛纽约重现

爱奇艺体育
2026-09-11 12:05:41
荷媒狠批阿贾克斯两大新援:状态严重不达标,职业态度遭公开质疑

荷媒狠批阿贾克斯两大新援:状态严重不达标,职业态度遭公开质疑

懂球帝
2026-09-11 00:32:44
开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

开学第一周,妈妈深夜一封信火了:孩子你记住,自逼为王,人逼为将,不逼为卒

男孩派
2026-09-04 09:47:52
梅根被警告别跟国王叫板!查尔斯签个字就废王子,哈里害怕吗?

梅根被警告别跟国王叫板!查尔斯签个字就废王子,哈里害怕吗?

小椰的奶奶
2026-09-11 03:36:14
屏下前摄还没藏好?iPhone Duo真机被曝“纱窗效应”,网友:不如用挖孔!

屏下前摄还没藏好?iPhone Duo真机被曝“纱窗效应”,网友:不如用挖孔!

泡泡网
2026-09-10 17:07:04
房子买错了真的太痛苦!这5种房子千万别碰,谁买谁后悔

房子买错了真的太痛苦!这5种房子千万别碰,谁买谁后悔

Home范
2026-08-29 10:55:46
存款大势已定!从2026年9月起,银行储蓄市场这4个信号值得警惕

存款大势已定!从2026年9月起,银行储蓄市场这4个信号值得警惕

说故事的阿袭
2026-09-11 10:59:03
40岁大姐相亲28岁小伙,见面直接直言要孩子,小伙:先同居再考虑

40岁大姐相亲28岁小伙,见面直接直言要孩子,小伙:先同居再考虑

阿凯销售场
2026-09-11 12:05:34
最聪明的国民党将领!登机赴台中途溜走,蒋介石终生未能等到他

最聪明的国民党将领!登机赴台中途溜走,蒋介石终生未能等到他

历史人文2
2026-09-10 10:17:57
40万亿美债压顶,美国终于想明白了:把中国踢出美元体系等于自杀

40万亿美债压顶,美国终于想明白了:把中国踢出美元体系等于自杀

麓谷隐士
2026-09-11 00:05:07
新华日报:吸纳就业该成为企业的光环

新华日报:吸纳就业该成为企业的光环

澎湃新闻
2026-09-08 07:16:09
马科斯请来四大帮手,眼看要把莎拉逐出政坛,菲律宾突发激烈冲突

马科斯请来四大帮手,眼看要把莎拉逐出政坛,菲律宾突发激烈冲突

湘评中外
2026-09-11 13:07:30
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
中国女篮惨败法国,应立即淘汰宫鲁鸣三大嫡系,张子宇严重拖后腿

中国女篮惨败法国,应立即淘汰宫鲁鸣三大嫡系,张子宇严重拖后腿

宗介说体育
2026-09-11 09:28:36
97年师范毕业分到小县城,报到时走错了单位,没成想竟走对了人生

97年师范毕业分到小县城,报到时走错了单位,没成想竟走对了人生

兰姐说故事
2025-06-11 10:00:10
日本记者门田隆将声称,中国是“无法无天”的国家!

日本记者门田隆将声称,中国是“无法无天”的国家!

果妈聊娱乐
2026-09-11 13:06:16
在韩女留学生遇害,一段见不得光的关系曝光,网友:曾是恋人关系

在韩女留学生遇害,一段见不得光的关系曝光,网友:曾是恋人关系

凡知
2026-09-11 10:28:18
华人女子国外失联最新!找到人体遗骸,已死好几月,婆婆成嫌疑人

华人女子国外失联最新!找到人体遗骸,已死好几月,婆婆成嫌疑人

小鋭有话说
2026-09-10 16:02:39
 2004年,马加爵在案发前因病卧床,林某带回两份盒饭在317宿舍与他分食。这点温情,为何最终还是没能阻止四天后那场震惊全国的血案?

 2004年,马加爵在案发前因病卧床,林某带回两份盒饭在317宿舍与他分食。这点温情,为何最终还是没能阻止四天后那场震惊全国的血案?

人生录
2026-08-27 00:05:16
2026-09-11 14:27:00
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1725文章数 170关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

自称停止资助后遭学生催捐男子删帖 当地:正在排查中

头条要闻

自称停止资助后遭学生催捐男子删帖 当地:正在排查中

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

17岁拿下世界第一,还被亲妈吐槽?

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
教育
家居
数码
公开课

艺术要闻

22位中国当代画家的人物油画作品

教育要闻

梯形一半模型的简单应用,你会吗

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

国产GPU新进展!龙芯9A1000预计明年上半年上市 价格取决于显存成本

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版