网易首页 > 网易号 > 正文 申请入驻

“美国豆包”又又又更了,15%价格叫板Opus 5,姚顺宇高度评价

0
分享至


智东西
编译 王涵
编辑 心缘

智东西9月3日消息,昨晚,谷歌发布其迄今为止最强的推理与编程模型Gemini 3.8在保持低成本的同时,Gemini 3.8在定量及专业领域以及端到端自主解决复杂工程问题方面,有了进一步提升。

谷歌DeepMind研究员姚顺宇说:“(这次模型发布)对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。”


新推出的Gemini 3.8包含两款模型:

  • Gemini 3.8 Flash:主力模型,上下文窗口为100万个token,在软件工程、智能体任务以及专业领域中的关键多步推理等方面,相较3.7 Flash均有明显提升。
  • Gemini 3.8 Flash Cyber:网络安全模型,在漏洞检测和自动修补方面达到前沿水平,将通过全新的Fairwind计划向受信任的防御者开放。

两个模型共享同一套基础智能,由长时运行的Agentic loop进一步加速。这类loop用于递归评估和优化底层模型,使该共享核心的编程、推理能力获得显著提升。

基准测试方面,Gemini 3.8 Flash在14项测试中有8项成绩排名第一超过了Claude Opus 5和GPT-5.6 Sol,分别是金融分析测试Vals Finance Agent v2、法律工作流测试Harvey Legal、终端代码测试Terminal-bench 2.1、复杂图表推理CharXiv、长视频理解LVBench以及跨学科专家难题HLE-Verified、生物学真实科研任务LABBench2。

在Artificial Analysis智能指数上,Gemini 3.8 Flash取得59分与GPT-5.6 Sol和Grok 4.6的非最高推理配置持平

在推理成本上,Gemini 3.8 Flash(high)每个智能指数任务成本为0.58美元,是在同等级智能水平下成为最便宜的模型。中等推理模式下,Gemini 3.8 Flash的每任务成本降至0.41美元,低推理模式下降至0.24美元

价格方面,Gemini 3.8 Flash目前采用优惠定价,为每百万输入token 0.75美元、每百万输出token 3.75美元,其标准定价为每100万输入token 1.5美元、每100万输出token 7.5美元

对比来看,Claude Opus 5定价为输入每百万Token 5美元、输出每百万Token 25美元,是Gemini 3.8 Flash标准定价的3倍多。

GPT-5.6 Sol定价为输入每百万Token 5美元、输出每百万Token 30美元,是Gemini 3.8 Flash标准定价的3到4倍;Terra定价为输入2.5美元、输出15美元,约为Gemini 3.8 Flash标准定价的2倍;Luna定价为输入1美元、输出6美元,则更为便宜。


在外网,已经有不少开发者体验了Gemini 3.8 Flash。

有开发者对比了Gemini 3.8 Flash和Claude Opus 5。对于同一个海浪模拟器任务,Opus 5耗时24分钟,3.8 Flash仅用了37秒,但Opus 5的成果细节处理较完善。


该开发者对此很乐观,说:“如果给Gemini和Opus 5相同的时间,Gemini在质量上也会把Opus彻底碾压。”


外网AI模型测评博主Lumina对比了Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6,全部开到最高配置,用同一套提示词生成罗马斗兽场,结果如下:

Lumina评价称:“Gemini 3.8 Flash比Gemini 3.8 Flash明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。”


在官宣推文的评论区中,多数用户留言期待Pro版本模型发布。



与谷歌前后脚,Meta在今日凌晨发布了Muse Spark 1.3

在Artificial Analysis智能指数排行上,Muse Spark 1.3超越了Gemini 3.8 Flash(high),仅次于Claude Fable 5.1和Claude Opus 5。

Meta首席AI官、超级智能实验室创始人Alexandr Wang(汪涛)转发了该推文,还明呛谷歌:“gemini是谁?”


一、一句话生成可交互DOS版谷歌地图,但鹈鹕脚踩不到单车上

Gemini 3.8 Flash能在8项基准测试中超过Claude Opus 5和GPT-5.6 Sol,表现着实亮眼,那Gemini 3.8 Flash在实际应用中表现如何呢?

在博客中,谷歌团队放出了几个Gemini 3.8 Flash的实测案例:

Gemini 3.8 Flash仅凭一个简单的提示词,配合Google Antigravity中的循环指令,就构建出了这款游戏。该游戏融合了谜题、环境叙事,并利用Nano Banana生成的纹理,打造出一个沉浸式3D关卡,玩家将扮演一位巫师在城堡中探索穿行。


Gemini 3.8 Flash还可以仅凭单个提示词,就构建出了一个功能完整的DOS版谷歌地图,完全可交互,支持地点查询、路线规划和街景浏览


用户可以使用美国地质调查局的真实数据集,用Gemini 3.8 Flash构建地形图,并可在其中探索实时横截面、2D投影以及科学解释


Hardware Anatomy是一个由Gemini 3.8 Flash构建的交互式3D可视化工具,能够生成符合物理尺寸比例的硬件设备拆解图,并基于Three.js实现逼真渲染。它可以自动将设备分解为多个层级,用户可通过拆解滑块进行展开和查看。


在X上,有很多开发者发出了自己用Gemini 3.8 Flash做出的成果。

中国AI博主Chasen实测了“鹈鹕踩单车”,感叹称:“这输出速度简直了,其实 10s 就把整体代码写完了,后面的是验证和再输出一次。”

可以看到,Gemini 3.8 Flash生成的内容在整体画面色彩上比较协调,体现出来了单车在向前行驶。但美中不足的是鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了。


还有开发者用Gemini 3.8 Flash生成了纯Three.js的DeBerti Design 2019 款福特F-250 “Transformer” 工作卡车,3D汽车模型各组件齐全,还可以进行交互。


目前,Gemini 3.8 Flash可以通过Google AI Studio、Android Studio或Gemini API直接调用,开发者也可以在Google Antigravity和Stitch里体验智能体工作流。

企业用户在Gemini Enterprise中使用Gemini 3.8 Flash。订阅了AI Pro或 Ultra的普通消费者可以在Gemini应用、谷歌搜索的AI Mode以及谷歌表格里体验该模型。

二、编程、金融、法律、多步推理全领先,每任务成本仅0.58美元

回过头来,我们再来看看Gemini 3.8 Flash在基准测试上的具体表现。

在长周期软件工程基准测试DeepSWE v1.1上,Gemini 3.8 Flash在端到端自主解决复杂工程问题方面的表现超过了大多数更大的前沿模型,而成本却比其他模型降低许多。


此外,在专业知识领域。Gemini 3.8 Flash在需要高级分析和报告能力的定量及专业领域,如Vals Finance Agent V2和Harvey法律智能体基准中,Gemini 3.8 Flash的表现均优于Gemini 3.7 Flash和其他前沿模型。



Gemini 3.8 Flash在人类最终测试HLE-Verified基准上还取得了54.9%的成绩,证明了其在STEM、人文学科和专业领域中进行多步推理的能力。


在任务完成速度上,在高推理模式下,Gemini 3.8 Flash的平均输出速度约为每秒300个token,每任务耗时2.5分钟,略优于GPT-5.6 Luna和 GPT-5.6 Terra。在低推理模式下,Gemini3.8 Flash的任务耗时缩短至0.8分钟,在“智能水平vs.每任务耗时”的权衡中达到了帕累托前沿


四、漏洞发现能力超GPT-5.6 Sol,2小时挖出人工数月发现的漏洞

与Gemini 3.8 Flash一同发布的,还有专注于安全领域的Gemini 3.8 Flash Cybe。

Gemini 3.8 Flash Cyber在用于漏洞发现的标准行业基准CyberGym上,超越了GPT-5.6 Sol、Mythos 5和GPT-5.5-Cyber


此外,谷歌团队还在一个更加全面的内部基准上评估了Gemini 3.8 Flash Cyber,该基准要求模型在涵盖20种编程语言的复杂代码库中发现各种漏洞。在这一评估中,该模型的成功率超过70%,相较谷歌前代模型能力大幅提升。


谷歌团队分享称,在开发Gemini 3.8 Flash Cyber时,他们重点致力于为防御者赋予专家级能力,使其在面对攻击者时占据主动。正因如此,谷歌团队从一开始便将漏洞修复作为模型的投入重心,并优先于漏洞利用等攻击性能力。

在外部补丁能力测试CWE-Bench上,Gemini 3.8 Flash Cyber的pass@1达47.2%,而领先的前沿模型为47.8%,但前者的成本却显著更低。Gemini 3.8 Flash Cyber也已经处于帕累托前沿了。

在实际应用中,谷歌团队已率先将Gemini 3.8 Flash Cyber应用于谷歌内部代码的安全防护。

Chrome安全团队发现,Gemini 3.8 Flash Cyber为Chrome漏洞生成正确补丁的数量,是那些规模更大的顶尖商业模型的2.6倍

Wiz公司在其内部渗透测试基准上的评估显示,Gemini 3.8 Flash Cyber的召回率比其他前沿模型高出7.5~9.7个百分点,而成本仅为后者的2.3~5.2分之一

谷歌云漏洞研究团队则利用Gemini 3.8 Flash Cyber模型,在不到2小时内就发现了一个关键的基础性漏洞,而这类漏洞的常规研究和发现通常需要耗费数月之久。

目前,网络安全领域的受信任机构(政府、关键基础设施等)需要通过Fairwind计划单独申请访问Gemini 3.8 Flash Cyber。

结语:六周连发三版Flash,谷歌或押注递归自我改进

谷歌在六周内迎来了第三次Flash版本更新,其迭代速度之快令人瞩目。

然而,在技术快速迭代的背后,用户对旗舰级Pro版本的期待依然强烈。与此同时,Meta也在同日发布了Muse Spark 1.3,可以看出AI模型赛道的竞争之激烈。

对于谷歌而言,如何平衡发布节奏、满足不同用户群体的需求,并在激烈的市场竞争中持续保持技术领先,仍是值得长期关注的课题。

值得注意的是,谷歌DeepMind研究员姚顺宇的评价或许暗示了谷歌真正押注的方向,可能并非某一款具体模型,而是让模型能够自我迭代、自我进化的底层能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
泽连斯基宣布停袭莫斯科,限时两天,喊话俄方对等停火

泽连斯基宣布停袭莫斯科,限时两天,喊话俄方对等停火

娱圈观察员
2026-09-06 04:13:04
“尊界暴跌 90%” 骗了多少人?碾压外国豪车,却被贴上惨败标签

“尊界暴跌 90%” 骗了多少人?碾压外国豪车,却被贴上惨败标签

数评时代
2026-09-05 18:25:06
“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

“乱港分子”周庭:弃保潜逃加拿大,扬言“永不回国”,如今怎样

芊芊子吟
2026-03-05 19:45:03
住建部正式发文!一个时代结束了

住建部正式发文!一个时代结束了

新浪财经
2026-09-04 23:55:17
中国女篮锁定附加赛!美国队险胜意大利:提前一轮晋级世界杯八强

中国女篮锁定附加赛!美国队险胜意大利:提前一轮晋级世界杯八强

陌识
2026-09-07 05:00:39
5比0横扫瓦伦西亚,巴萨四连胜背后藏着一个完美首秀

5比0横扫瓦伦西亚,巴萨四连胜背后藏着一个完美首秀

星河漫山野
2026-09-07 02:26:33
2000年,歹徒长途客车起色心,3名女子被强奸5次,43人冷眼旁观!

2000年,歹徒长途客车起色心,3名女子被强奸5次,43人冷眼旁观!

法网恢恢
2026-09-06 23:15:14
龙岩任免7名干部

龙岩任免7名干部

海峡网
2026-09-06 10:06:32
中美看病费用差距明显,中国做CT约200元,美国却需要7000美元!

中美看病费用差距明显,中国做CT约200元,美国却需要7000美元!

凡知
2026-09-05 15:27:34
世界地图改了!中国显示面积变小,为何只有美国一票反对?

世界地图改了!中国显示面积变小,为何只有美国一票反对?

蓝星杂谈
2026-09-06 21:05:52
王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

王思聪度假结束回东京,晒出一桌子高端日料!女友懒懒被其宠上天

娱乐团长
2026-09-06 21:00:57
普京密谈3小时!美国方案曝光?克里米亚归俄,乌克兰不入北约?

普京密谈3小时!美国方案曝光?克里米亚归俄,乌克兰不入北约?

刘襈说体坛
2026-09-07 03:38:00
中国女排叛徒:戏耍郎平叛逃美国 被国家队除名,如今下场大快人心

中国女排叛徒:戏耍郎平叛逃美国 被国家队除名,如今下场大快人心

天天热点见闻
2026-09-06 09:09:25
全球货币支付排名:美元涨到50.99%,欧元跌至21.78%,人民币呢

全球货币支付排名:美元涨到50.99%,欧元跌至21.78%,人民币呢

张嘴说财经
2026-09-06 17:20:58
美国女篮3分险胜!全队迷失&克拉克6中0,中国女篮坐收渔利

美国女篮3分险胜!全队迷失&克拉克6中0,中国女篮坐收渔利

体坛小李
2026-09-07 06:16:26
巴基斯坦军方公布战果

巴基斯坦军方公布战果

上观新闻
2026-09-05 06:09:39
“去香港看演唱会被取消低保”引热议,网友称表妹前往香港看演唱会,全家低保资格被取消

“去香港看演唱会被取消低保”引热议,网友称表妹前往香港看演唱会,全家低保资格被取消

第一财经资讯
2026-09-07 00:03:12
这场断交秀实在是太突然了

这场断交秀实在是太突然了

阿尔法34号
2026-09-06 09:04:03
美网:6连胜,郑钦文世界排名飙升41位!连爆5大冷门16强决出10席

美网:6连胜,郑钦文世界排名飙升41位!连爆5大冷门16强决出10席

求球不落谛
2026-09-06 04:22:00
一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

第一财经资讯
2026-09-05 12:44:09
2026-09-07 06:47:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12552文章数 117166关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

数码
本地
时尚
公开课
军事航空

数码要闻

科沃斯IFA放大招!家用机器人矩阵刷屏欧洲

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

金秋最流行的鞋子,“红色”更时髦!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版