过去几个月,Gemini在中文互联网上有个杀伤力不小的外号:“美国大豆包”。这个称呼吐槽的是它身上长期存在的反差:发布会上基准成绩漂亮、上下文窗口巨大、免费额度充足,真正用起来却偶尔理解跑偏,一本正经地给出错误答案。被用户指出问题后,它还可能先送上一大段夸奖和道歉,情绪价值给得很足,事情却没办好。
在Gemini 3.5 Flash发布后,这种调侃一度升级为:“这是最快告诉你错误答案的AI。”如今,Google带着Gemini 3.8 Flash回来了。这是其六周内推出的第三款Flash,也是不到四个月内的第四次Flash更新。新模型在Artificial Analysis Intelligence Index上获得59分,与xhigh档位下的GPT-5.6 Sol和medium档位下的Grok 4.6持平;在DeepSWE v1.1上,它甚至超过大多数体量更大的前沿模型,登上长程软件工程榜首。
![]()
更关键的是,Gemini 3.8 Flash仍能保持每秒约300 Token的输出速度,约为许多主流模型的4—6倍。“美国大豆包”这次似乎真的变聪明了。Google没有直接把Flash做成一款缩小版Pro,而是让模型思考更多、反复调用工具、执行更多轮次,并为此消耗更多Token。
![]()
一款模型可以拥有极高的Token输出速度,每项评测任务的加权生成时间却比上一代更长。理解这组看似矛盾的数据,才是理解Gemini 3.8 Flash的关键。
Flash冲进第一梯队
自2026年初以来,Google一直没有发布前沿级别的Gemini Pro模型。原本承诺在今年6月推出的Gemini 3.5 Pro至今没有出现,据称原因之一是它的编程能力未能达到Google的预期。8月初,Google DeepMind的管理层也发生变化。Demis Hassabis卸任CEO、转任董事长,Koray Kavukcuoglu接过管理工作,职衔则变成了高级副总裁。Google CEO Sundar Pichai随后试图安抚外界,但这并没有完全消除市场的疑虑:Google是否还准备继续争夺前沿模型的最高位置?
与此同时,Flash系列进入了高速迭代。Gemini 3.5 Flash、3.6 Flash、3.7 Flash和如今的3.8 Flash接连发布,Google更新低价模型的速度,已经超过其他实验室迭代同类产品的速度。Flash原本是Google模型家族里的经济型产品线,主打低成本和高速度,能力通常低于Pro系列。到了Gemini 3.8 Flash,这条边界已经开始模糊。
开启高推理档位后,Gemini 3.8 Flash在Artificial Analysis Intelligence Index上获得59分,比上一代提高3分。它与xhigh档位下的GPT-5.6 Sol、medium档位下的Grok 4.6持平,距离最高档位下的GLM-5.3和Kimi K3只有1分,距离最高档位下的GPT-5.6 Sol和高档位下的Grok 4.6也只有2分。
再往上,Claude Opus 5获得63分,Claude Fable 5.1以66分位居榜首。Gemini 3.8 Flash没有拿下绝对最高分,却已经进入当前第一梯队。Google暂时没有依靠Pro重返模型能力的最前沿,却让Flash回到了帕累托前沿:在当前市场上,很难找到一款智能水平比它更高、成本又比它更低的模型。
Token单价没涨,完成任务却贵了40%
![]()
今年年底前,Gemini 3.8 Flash将沿用上一代的API推广价格:每百万输入Token 0.75美元,每百万输出Token 3.75美元,缓存输入则按正常输入价格的10%计费。优惠期结束后,价格将翻倍,恢复至每百万输入Token 1.50美元、每百万输出Token 7.50美元。
按照Artificial Analysis的测算,高推理档位下的Gemini 3.8 Flash完成一项Intelligence Index评测任务,平均成本为0.58美元,是该机构测得的同等智能水平中最便宜的模型。作为对比,Anthropic最新的通用旗舰模型Claude Fable 5.1完成同类任务约需3.76美元,成本是Gemini 3.8 Flash的6倍以上。最高推理档位下的GPT-5.6 Terra,单任务成本为0.53美元,与Gemini 3.8 Flash接近,但智能水平得分为57分,比后者低2分。
Gemini 3.8 Flash的Token单价没有上涨,单任务成本却比Gemini 3.7 Flash高出约40%,从0.40美元增至0.58美元。在Artificial Analysis的Intelligence Index评测中,新模型每项任务的加权平均输出Token增长30%,达到约4.8万个,同时在智能体评测中执行了更多轮次。
Google将这种变化形容为“3.8 Flash works harder”。面对复杂任务时,它会增加推理步骤、反复调用工具,并可能在较高推理档位下消耗更多Token,以换取更好的最终结果。它消化这些额外计算的关键,正是速度。Artificial Analysis测得,Gemini 3.8 Flash在高推理档位下平均每秒输出约305个Token,是榜单第二名Meta Muse Spark 1.2的两倍左右,后者为每秒154个Token。
GPT-5.6 Luna以每秒126个Token位居其后,Nemotron 3 Ultra和DeepSeek V4 Pro 0813分别为每秒112个和80个Token。相比之下,Claude系列模型在榜单上的位置明显靠后:启用fallback的Claude Fable 5.1每秒输出66个Token,Claude Opus 5则为每秒56个Token,还不到Gemini 3.8 Flash的五分之一。
由于输出Token增加了30%,Gemini 3.8 Flash在这套评测中的单任务加权生成时间仍从2.2分钟升至2.5分钟,增幅约14%。这项指标只统计模型生成输出所需的时间,不包含首Token延迟和其他系统开销,不能直接等同于Agent完成整项工作的真实耗时。
换句话说,3.8 Flash吐Token更快,却也生成了更多Token。300 TPS抵消了部分额外Token带来的时间开销,但没有让加权生成时间继续缩短。这也说明,评价Agent模型只看Token单价已经不够。模型为了完成任务会生成多少Token、执行多少轮,以及能以多快的速度消化这些Token,才是决定真实成本和体验的关键变量。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.