网易首页 > 网易号 > 正文 申请入驻

刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5

0
分享至


新智元报道


谷歌沉寂7个月,终于掏出了大的。

北京时间10月1日凌晨,Google DeepMind发布Gemini 4 Argon。这是其 7 个月来首款非 Flash 级专有模型。


Artificial Analysis的智能指数上,它拿到53分,追平GPT-6 Astra和Fable 5.1,比GPT-6.1 Sol高1分,幻觉率降至 15%。



模型在 AutomationBench-AA 和 Terminal Bench 上 Agent 能力大幅提升,同时在 CWE-bench 网络安全基准并列第一,可自主发现、验证漏洞并生成 PoC。


目前已向选定用户 rollout,支持 1M 上下文和多模态输入,直接冲击前沿模型价格战格局。

同一套评测里,按首发折扣计算,完成一个任务平均花1.99美元,为 GPT-6 Astra 的 60%。


分数追平,账单变薄。光看这两项,谷歌这次足够让人重新考虑该把任务交给谁。

但我把分数、报价和用量放在一起看,最有意思的地方出现了。这款模型算得便宜,却算得很费。打折结束,同样的任务甚至会比Astra更贵。



前三回来了,账得重新算

所谓沉寂7个月,有一个明确范围。Argon是谷歌超过7个月来第一款高于Flash级别的闭源模型,期间谷歌仍有Flash产品。


这次53分,比上一款非Flash模型Gemini 3.1 Pro Preview高23分,比Gemini 3.8 Flash高12分。AA据此判断,谷歌重回智能水平最高的3家实验室之列。

智能指数可以理解为一组能力测试的综合成绩。Argon用high推理档,Astra和Sol用max档,同分说明它们在这套评测里处于相近水平,具体工作还得分开看。

对长期关注OpenAI和Anthropic的用户,这个变化很直接。选前沿模型时,谷歌又成了值得认真比较的选项。不过Argon目前只向部分用户推送,尚未公开可用。


谷歌准备怎样吸引这些用户?报价很有诚意。

Token可以粗略理解为模型读写文字时计数的小片段。当前每百万Token,Argon输入收2美元,输出收10美元。两项单价都是Opus 5.5的一半、Astra的1/5。

反复使用同一段材料,还涉及缓存。符合缓存条件的输入可以享受95%的折扣,比Gemini 3.8 Flash的90%更低,首发期间每百万缓存输入Token只收0.10美元。


看起来相当划算。可用模型的人付的是整张账单,单价只是其中一项。

Argon平均每个任务输出6.2万Token,Astra只用2.7万。如果把推理过程比作打草稿,它的草稿纸要多写1倍多。每页便宜,架不住写得长。

算到任务成本,Argon的1.99美元确实低于Astra的3.26美元、Opus 5.5的5.98美元和Fable 5.1的7.63美元。但Sol只要0.72美元,Argon约是它的2.7倍。

更影响长期选择的是,2美元和10美元属于首发5折促销,谷歌还没公布结束日期。

恢复输入4美元、输出20美元的标准价后,按同一评测口径,单任务成本会变成3.98美元,约为Astra的1.2倍。

这些美元数字还有一个共同前提,它们是智能指数测试里的平均任务成本。你让模型改代码、查材料,输入有多长、输出多少、能用上多少缓存,都会改变账单。1.99美元不能当成所有工作的统一报价。

这就很有意思了。单价只有对手的1/5,任务账单却要付六成;促销结束,还会反超。打算长期接入的人,得拿自己的任务试算,用量和折扣条件都算进去。


少说错话,也有代价

钱算清了,还得回答一个问题。53分的Argon,究竟好用在哪里?

我最在意的是它处理「不知道」的方式。

在AA-Omniscience测试里,Argon的幻觉率为15%,是智能指数45分以上模型中最低的。Astra为51%,Sol为54%。AA的解释是,Argon更愿意承认不知道,减少猜错后仍然给答案的情况。

这对用户很有吸引力。碰到不熟悉的问题,回答越流畅,核对起来越容易掉以轻心。模型肯停下来承认能力有限,至少能让人知道哪里还需要查证。

不过,少编答案,和多答对题,是两件事。

Argon在这项测试里的准确率为50%,比Astra的63%低13个百分点,甚至比Gemini 3.1 Pro Preview低5个百分点。综合分为42,接近Astra的43,与Sol相同。

你可以欣赏它的克制,同时承认它答对的问题没有Astra多。15%的幻觉率也仅属于这项测试,不能直接当成所有日常回答的错误率。

真正动手干活的Agent能力,则呈现出另一种参差。

AutomationBench-AA上,Argon以77.5%拿到第一。但Terminal Bench 4里,它得57%,虽然比Gemini 3.1 Pro Preview提高53个百分点,仍落后于Sonnet 5.5、Opus 5.5和Astra。


AA-Briefcase也有类似反差。它满足评分细则的比例达到65%,为AA测到的最高值,分析质量和呈现质量却偏低。能按要求交活,与交出一份分析透彻、表达清楚的成果,中间仍有距离。


安全领域的成绩更抓人。CWE-bench v1检查模型能否真正修好漏洞,Argon以68%并列第一。谷歌还称,它能自行发现、验证漏洞,生成PoC,也就是证明漏洞确实存在的验证示例。

修得怎样,终于可以沿着代码往下看了。

在Text Arena上,Gemini 4 Argon排名第一。




谷歌已经让它干上了机房里的活

比榜单更让我在意的,是谷歌自己的使用情况。

据谷歌透露,Argon智能体已经分析数据中心的性能数据,找到内存优化点,相关改动随后上线,释放了超过300 TiB内存。


这段过程很具体。有正在运行的系统,有性能数据,有改动,也有部署后的结果。它给模型能力提供了评测之外的证据。

这里的300 TiB说的是释放出来的内存容量,不能直接换算成省下多少电费或服务器采购费,材料没有给出这样的账。

同一份材料还提到,Argon正参与把C/C++代码迁移到Rust,涉及超过80万行内核代码,部署前要经过大量审计和测试。这里要分清,迁移仍在推进,不能把80万行都算成已经上线的成果。

视频解码器的例子则更完整。谷歌称,智能体用安全Rust替换了3.2万行SIMD代码。这类代码负责让多份数据并行处理,对运行效率很重要。

结果是,现有Rust版本快了2.7倍,视频输出保持一致。速度提高,结果还得对得上,工程工作的要求就落在这里。

Argon支持1M Token上下文,可以接收文字、图片、视频和语音,输出文本。

对于漫长任务,Gemini API新增的Long Decode Continuation允许长回复暂停,再通过后续调用接着输出,让推理最长跑到1M输出Token,避免请求超时。

这里有两个不同的长度。上下文决定它一次能容纳多少材料,输出上限决定它能把过程持续多长。分次接着输出,解决了长任务被请求超时打断的问题,至于最后做得对不对,仍要靠检查和测试。

能连续处理更长的工作,才有条件应付那些没法几句话收工的工程任务。当然,前面的用量账也会一路跟着。

OpenAI、Anthropic和谷歌的竞争,因此又有了三方较量的意味。用户既能比较分数和价格,也终于有更具体的工程成果可看。

折扣什么时候结束,榜单还能领先多久,都有变数。谷歌已经让AI参与改造自家基础设施,这件事更值得追踪。

下一次模型发布,我想多看一点这样的结果。修好了什么,省下了什么,哪些改动已经上线。53分令人兴奋,真正用起来之后留下的成果,才值得长期买单。

参考资料:

https://x.com/ArtificialAnlys/status/2105392625788637299

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/

https://x.com/sundarpichai/status/2105387952478277979

编辑:Aeneas 大卫

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
139票赞成,0票反对,匈牙利传来新消息!

139票赞成,0票反对,匈牙利传来新消息!

故事终将光明磊落
2026-09-30 16:26:44
不用怀疑,小米今年55万辆的目标,不可能完成了!

不用怀疑,小米今年55万辆的目标,不可能完成了!

互联网.乱侃秀
2026-10-01 12:40:30
刘欢为啥爱办家宴?高晓松爆料:北京三里屯的一件事,让他没办法

刘欢为啥爱办家宴?高晓松爆料:北京三里屯的一件事,让他没办法

兵卒史
2026-10-01 13:53:14
夺冠仅6天,迎1大噩耗!全家为日本效力的张本智和,终究自食恶果

夺冠仅6天,迎1大噩耗!全家为日本效力的张本智和,终究自食恶果

阿讯说天下
2026-10-01 04:14:27
民进党的谎言:“大陆在撒谎”

民进党的谎言:“大陆在撒谎”

海峡导报社
2026-10-01 07:46:03
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
亚运网球女单半决赛:10月1日,第二场王曦雨PK比埃拉盼爆冷

亚运网球女单半决赛:10月1日,第二场王曦雨PK比埃拉盼爆冷

薇说体育
2026-10-01 11:56:20
葡媒:C罗已做出不可逆的决定,不会再代表葡萄牙国家队出战

葡媒:C罗已做出不可逆的决定,不会再代表葡萄牙国家队出战

懂球帝
2026-10-01 04:50:06
没想到,游本昌追悼会上,上影副团长陈龙因一个举动实现口碑暴涨

没想到,游本昌追悼会上,上影副团长陈龙因一个举动实现口碑暴涨

枫尘余往逝
2026-09-30 16:17:34
多所高校发文“过紧日子”,北大明确禁赴黄山、九寨沟、三亚海滨等21个景区开会

多所高校发文“过紧日子”,北大明确禁赴黄山、九寨沟、三亚海滨等21个景区开会

山西晚报
2026-09-29 10:48:20
帮助稳定飞机的以色列乘客:我抓住袭击者,勒住他并把他弄了出去

帮助稳定飞机的以色列乘客:我抓住袭击者,勒住他并把他弄了出去

元宝课堂
2026-10-01 09:24:13
广东一25岁画师约稿被骗4万元,凌晨从32楼坠亡,同社画师:她单张画才赚250元,被骗后每天都在努力画画还钱;曾发文求约稿称“精神崩溃”

广东一25岁画师约稿被骗4万元,凌晨从32楼坠亡,同社画师:她单张画才赚250元,被骗后每天都在努力画画还钱;曾发文求约稿称“精神崩溃”

扬子晚报
2026-09-30 13:00:19
1-2!输球不可怕,可怕的是赛后安东尼奥的这番话:让人很揪心!

1-2!输球不可怕,可怕的是赛后安东尼奥的这番话:让人很揪心!

田先生篮球
2026-09-30 16:55:07
小米澎程锁单量大幅下滑,直播当众翻车惹的祸?

小米澎程锁单量大幅下滑,直播当众翻车惹的祸?

汽车有文化
2026-09-30 08:47:07
17条中日航线取消全部航班

17条中日航线取消全部航班

航旅圈
2026-10-01 00:16:45
iPhone18Pro国内销量炸了,卖这么好,简直没天理

iPhone18Pro国内销量炸了,卖这么好,简直没天理

科技头版Pro
2026-09-29 14:31:30
风向大变!C罗任性离营风波,连葡萄牙本土媒体都不再选择力挺

风向大变!C罗任性离营风波,连葡萄牙本土媒体都不再选择力挺

冷眼看尽世间繁华
2026-10-01 14:55:43
还得是谷歌,Gemini 4 发布,猛的离谱。。。

还得是谷歌,Gemini 4 发布,猛的离谱。。。

苍何
2026-10-01 07:14:23
CCTV5+直播国足VS巴勒斯坦!U23打强队不落下风,老大哥别掉链子

CCTV5+直播国足VS巴勒斯坦!U23打强队不落下风,老大哥别掉链子

刀锋体育
2026-10-01 12:18:45
出道39年不温不火,老婆却靠一首歌吃了38年,如今成春晚常客

出道39年不温不火,老婆却靠一首歌吃了38年,如今成春晚常客

完善法
2026-09-30 10:24:30
2026-10-01 15:35:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16322文章数 67099关注度
往期回顾 全部

科技要闻

华为Mate90系列发布,售价5999元起

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

头条要闻

以乘客讲述惊魂一刻:我用耳机线捆住袭击者 他很安静

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

宋佳二封金鹰视后 内娱奖项史即将改写

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

时尚
数码
教育
手机
旅游

裤子不用买太多花哨的类型,日常多穿牛仔裤,大方减龄又不出错

数码要闻

技嘉推出AI TOP 100 B850台式整机,支持5090单卡或R9700双卡

教育要闻

有没有逻辑思维比较强的,请指点迷津

手机要闻

华为Mate90起售价5999元起 一家四口手握四代华为 门店选机直呼真香

旅游要闻

文博盛宴迎国庆 江口沉银博物馆推出系列主题活动

无障碍浏览 进入关怀版