谷歌发布了Gemini 3.8 Flash。这次发布最引人注目的地方在于,它在几个关键基准测试上击败了Claude Opus 5——虽然优势不算大,但赢面确实存在。
在HLE-Verified基准上,Gemini 3.8 Flash拿到了54.9%的成绩,而Claude Opus 5是54.4%。0.5个百分点的差距,说不上碾压,但在这个级别的模型对决中,任何一项领先都值得注意。
![]()
三个基准,三种赢法
除了HLE-Verified,谷歌还公布了另外两项测试结果。Terminal-Bench 2.1测试的是智能体能否真正操作终端,完成困难的编程、安全、机器学习、数据科学和系统任务。Gemini 3.8 Flash在这个测试中拿到了89.4%的任务完成率,这个数字在同类评估设置下算是相当高的水平。
更值得关注的是Harvey法律智能体基准。Gemini 3.8 Flash得分10.0%,Claude Opus 5是6.7%。单看数字会觉得低得离谱,但这个基准采用了一种极其严格的全通过规则:一个法律工作流只有在所有必需标准全部通过时才算得分,包括事实、结论、引用、结构和分析,而且是在复杂的基于文件的法律工作中进行评估。在这种规则下,10%已经是一个有意义的领先。
价格没涨,但成本可能变
谷歌没有提高每token的价格。不过官方也提醒了一个细节:在更困难的任务上,Gemini 3.8 Flash可能会思考更久、调用更多工具,这意味着它会消耗更多token。所以即使token单价不变,完成某个任务的总成本也可能上升。
这个逻辑其实很直接——模型变强了,但更强的能力往往需要更多的计算资源来支撑。对于开发者来说,选择模型时除了看基准分数,还得估算一下实际任务的总开销。
更新节奏明显加快
这次发布还有一个值得留意的信号:谷歌在官方推文中提到,Gemini 3.8 Flash是"Gemini智能体与编程能力的又一次跃升",并且这是六周内更新的第三个Flash型号。
这种更新频率在主流AI模型里并不多见。通常大模型发布后会有几个月的稳定期,谷歌选择在六周内连续推三次Flash更新,说明他们在小步快跑地迭代,而不是憋大招一次性放出。对于开发者来说,这意味着可以更快地用上新能力,但也需要更频繁地跟进版本变化。
怎么看待这次领先
回到基准测试本身。Gemini 3.8 Flash在三个测试中都有领先,但领先幅度各不相同。HLE-Verified上只赢了0.5个百分点,Terminal-Bench 2.1上优势明显,Harvey法律基准上则是规则极其严格下的相对领先。
这些数字说明什么?至少说明谷歌这次发布的模型在编程、智能体操作和法律工作流这几个方向上确实有竞争力。但基准测试终究是基准测试,真实场景中的表现还需要开发者自己跑一跑才知道。
谷歌在推文里说"这个模型做起来很有趣,期待看到大家的反馈"。现在模型已经发布,接下来就看社区怎么用了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.