网易首页 > 网易号 > 正文 申请入驻

疯狂一夜:Gemini Flash 冲上前排,Meta 转身追平 Fable 5

0
分享至

AI范儿 · 今日速评⏱ 6 分钟

昨晚我本来只想看一眼 Gemini 3.8 Flash 的更新,结果越看越精神。

Google 刚用一个价格很低的 Flash 模型冲到 DeepSWE 榜首附近,Meta 前后脚发布 Muse Spark 1.3,又在同一项测试里把成绩往上推了一截。

我把两张官方测试表放在一起看,这两个模型在多数关键项目上都超过了 GPT-5.6 Sol。3.8 Flash 的反差尤其大,它只是 Gemini 家族里的快速低价型号。

Gemini 3.8 Flash 多项能力超过 GPT-5.6 Sol;Muse Spark 1.3 的综合水平已经对标 Claude Fable 5。这就是两次发布最需要知道的结论

所以我觉得,这一晚有意思的地方并不只是榜首换了人。Google 把 Flash 推到了旗舰模型的桌上,Meta 则把 Muse 直接送到 Fable 5 旁边。

一分钟看懂

以当前榜单最前排的模型 GPT-5.6 Sol、Claude Fable 5 和 Opus 5 为参照物:

1Gemini 3.8 Flash:定位仍是快速、低价,但编程、金融分析、法律任务和复杂推理已经超过 GPT-5.6 Sol,部分能力贴近 Opus 5。

2Muse Spark 1.3:第三方综合榜已经来到 Fable 5 的水平,最明显的进步是能在长时间、跨工具的任务里把事情做完。

3普通人会感到的变化:模型不只回答问题,还能读长资料、改完整项目、操作软件,并在中途遇到问题时继续处理。


▲ 图:Gemini 3.8 Flash 与 3.8 Flash Cyber,来源 Google

01Flash 到底多强

Google 在六周内更新了三次 Flash。我最初以为这次还是常规升级,无非更快一点、更便宜一点。

看完表才发现,3.8 主要补的是长程编程、Agent 执行和专业领域推理。

Flash 原本承担的是快速、低价、大批量任务。现在 3.8 Flash 在多项测试里压过 GPT-5.6 Sol,部分项目甚至贴住或超过 Opus 5。

一个“经济适用型”模型打出了旗舰成绩,这才是这次发布最夸张的地方。

它支持文本、图片、音频、视频和 PDF 输入,拥有100 万 Token 上下文,一次可以塞进大型代码库、长文档或多段视频材料。

最大输出 64K,适合生成完整代码、报告和长篇分析,不用写到一半突然收摊。


▲ 图:Google 公布的 Gemini 3.8 Flash Benchmark 表

表很长,普通人没必要逐行背。我挑三个最能说明问题的地方。

DeepSWE会给模型一个真实代码仓库和待解决的问题,看它能不能跨多个文件完成修改并通过测试。3.8 比 3.7 提升 8.4 个百分点,已经紧贴 Claude Opus 5。

Terminal-Bench不让模型只写答案,而是要求它在终端里输入命令、检查结果、处理报错,直到任务完成。3.8 在这项测试里排到表中第一。

金融分析、法律工作流、终端编程、复杂图表理解和跨学科推理都超过了 GPT-5.6 Sol。知识工作、通用 Agent 和电脑操作仍然落后,这块还谈不上横扫。

⚠️ 价格提醒每百万 Token 输入 0.75 美元,输出 3.75 美元。这是 2026 年底前的推广价,2027 年将涨到 1.50 美元和 7.50 美元。

不过 Google 自己也提醒了一句:高推理档位会多思考、多调用工具。单价低,不保证每个任务的总成本都低。便宜模型认真加起班来,也会吃 Token。

还有一个安全专用版

Gemini 3.8 Flash Cyber 专门负责发现漏洞和自动打补丁。Google 称,它在覆盖 20 种编程语言的内部测试中,漏洞发现成功率超过 70%;在 CWE-Bench 上,修复能力已经贴近领先模型。

不过普通开发者暂时用不到。它只通过 Fairwind Program 向政府机构、关键基础设施运营方和可信软件维护者开放,也没有公布独立的公开 API 价格。

02Muse 到了什么水平


▲ 图:Artificial Analysis Intelligence Index v4.1.1,2026 年 9 月 2 日

再看 Muse。

Artificial Analysis 把九类测试合成一个综合指数,既看知识和推理,也看编程、工具使用与长文本处理。它有点像模型的综合考试,比盯着某一门单科更能看出整体水平。

在这张全模型榜单里,Muse Spark 1.3 的 max 档与带 Tool Fallback 的 Claude Fable 5 处在同一水平。Tool Fallback 可以简单理解成:遇到合适的问题时,模型能借助工具完成任务。

Muse 只落后于 Fable 5.1 和 Claude Opus 5,已经站到最前排。

上一代 Muse Spark 1.2 还和一批中上游模型挤在一起,1.3 直接跳到了 Fable 5 旁边。Google 的 Gemini 3.8 Flash 也进入前十。最近这一波更新,榜单前排已经挤得像晚高峰地铁。

有一点要说清楚:Muse Spark 1.3 的 max 档还在做额外安全测试,发布当天尚未开放。眼下可以直接调用的是其他推理档位。


▲ 图:Meta 公布的 Muse Spark 1.3 Benchmark 表

我再翻 Meta 自己的测试表,发现这次提升很集中:把长任务做完。

长程软件工程比 1.2 提升约20 个百分点,电脑操作提升约 19 个百分点。面对 50 万到 100 万 Token 的超长上下文,检索能力提升超过 40 个百分点。

长程软件工程测试看它能不能接手一个完整代码任务;电脑操作测试看它会不会点击、输入并在多个软件之间切换;超长上下文测试则像把一本巨厚资料塞进去,再让它准确找回其中一个细节。

Muse Spark 1.3 在这些关键项目里多数超过 GPT-5.6 Sol,终端编程与它持平;综合能力则对标 Fable 5。

普通用户可以把它理解成:已经有能力连续处理一项复杂工作,而不只是在对话框里回答几个问题。

编码效率同样有改善。Meta 内部比较显示,相较 1.2,新版平均少用约 20% 的工具调用和 25% 的 Token。能力涨了,干活反而更省,这才是 Agent 最实在的升级。

Meta API 价格标准版每百万 Token 输入 1.25 美元、输出 4.25 美元。Contributor 版只要 0.10 美元和 0.20 美元,但需要允许 Meta 使用输入和输出数据改进模型。

Contributor 的折扣很凶,代价也写在小字里。代码、客户资料和内部文档比较敏感的话,这个价格看看就好。

Muse Spark 1.3 已进入 Muse Code 和 Meta Model API。Meta 还预告了更大的模型和开放权重版本,目前都没有具体时间。

03国外模型也卷起来了

过去几个月,AI 圈最热闹的画面一直在国内。DeepSeek、千问、GLM、Kimi、MiniMax 轮番更新,价格往下压,能力往上抬,隔几天就有人改一次榜单。

国外这边反而相对平静,尤其是 Google 和 Meta,一度给人一种已经从最激烈的模型竞赛里退下去的感觉。

结果这周,两家全回来了。

美国甚至还在周三。Anthropic、Google、Meta 已经连续放出了 Claude Fable 5.1、Gemini 3.8 Flash 和 Muse Spark 1.3。

三家公司,两天左右,三款新模型。

Google 用一个低价快速型号,在多项测试里超过 GPT-5.6 Sol;Meta 上一版还不算突出,这一版直接冲到 Fable 5 的综合水平。

原本被认为落后的两家公司,一夜之间又挤回了第一梯队。

这才是我觉得最夸张的地方。以前一个模型领先,优势还能维持几个月。现在一次更新就可能把差距抹掉,榜首甚至撑不过一天。谁都不敢停,停一下,下一个排行榜可能就掉队了。

现在还没有正式出牌的,似乎只剩 OpenAI。市场传言 GPT-6 可能也会在本周出现,一场好戏又等着上演了!

参考资料

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ https://research.meta.ai/blog/introducing-muse-spark-1-3 https://www.anthropic.com/claude-fable-and-mythos-5-1 https://dev.meta.ai/docs/pricing-rate-limits/ https://artificialanalysis.ai/models/muse-spark-1-3 https://www.axios.com/2026/09/01/openai-astras-cyber-critical

Muse Spark 1.3 这次追到 Fable 5,你觉得 Meta 真回来了,还是先等实测?

觉得有用 → 点个❤️在看转给朋友

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
欧盟市场留给我们的窗口期只剩下16个月。

欧盟市场留给我们的窗口期只剩下16个月。

流苏晚晴
2026-09-02 19:04:44
“摸奶子”再惹争议,OPPO的流量反噬开始了

“摸奶子”再惹争议,OPPO的流量反噬开始了

品牌头版
2026-05-13 10:18:15
中美谈判结束,中方上将登机回国,台海大局已定,美F-16战机改道

中美谈判结束,中方上将登机回国,台海大局已定,美F-16战机改道

影孖看世界
2026-09-08 23:51:14
中俄确定出席,金砖峰会召开前,印度申办奥运会,莫迪准备梭哈了

中俄确定出席,金砖峰会召开前,印度申办奥运会,莫迪准备梭哈了

临云史策
2026-09-08 16:42:42
不相信身边任何人,逃亡8年的悍匪周克华,多次躲过大规模围捕,却栽在一段四个月的私情上

不相信身边任何人,逃亡8年的悍匪周克华,多次躲过大规模围捕,却栽在一段四个月的私情上

黑句本
2026-09-06 10:57:26
难怪都说碰到行为举止怪异的人要远离!看了网友分享,我总算明白了

难怪都说碰到行为举止怪异的人要远离!看了网友分享,我总算明白了

另子维爱读史
2026-09-08 21:07:29
墙倒众人推,盟友们开始对老大动手了

墙倒众人推,盟友们开始对老大动手了

一个坏土豆
2026-09-08 21:03:40
浙江瑞安一电动车店爆炸起火引燃楼上4层

浙江瑞安一电动车店爆炸起火引燃楼上4层

黄河新闻网吕梁
2026-09-08 16:05:10
华为拿下玛莎拉蒂,全网破防了!

华为拿下玛莎拉蒂,全网破防了!

财经三分钟pro
2026-09-08 15:25:19
“把孩子吃死你就老实了!”一个红薯叶窝窝头让孩子奶奶被骂惨!网友:这婆婆揍起来没有心理负担!

“把孩子吃死你就老实了!”一个红薯叶窝窝头让孩子奶奶被骂惨!网友:这婆婆揍起来没有心理负担!

林林先生
2026-09-08 11:51:39
开通不到一周盲道已多处开胶,上海一吴淞江大桥被指施工太过潦草,建设单位:全部铲掉重新铺

开通不到一周盲道已多处开胶,上海一吴淞江大桥被指施工太过潦草,建设单位:全部铲掉重新铺

扬子晚报
2026-09-08 07:20:10
浙江高考理科第一名,却选择中文专业,如今在宁波开书店,已写完三篇小说,他说:为亏得少一点,正“厚着脸皮”接受“北大”标签吸引流量

浙江高考理科第一名,却选择中文专业,如今在宁波开书店,已写完三篇小说,他说:为亏得少一点,正“厚着脸皮”接受“北大”标签吸引流量

都市快报橙柿互动
2026-09-08 22:23:24
徐峥怎么突然就销声匿迹了,根本不是单纯过气,原来是整个影视圈都不敢用他

徐峥怎么突然就销声匿迹了,根本不是单纯过气,原来是整个影视圈都不敢用他

草莓解说体育
2026-08-30 07:32:51
女子自称“遭4岁男童摸臀”,被质疑维权过度,律师:事发位置发生自然触碰属正常情况,女子若是故意混淆概念发视频,涉嫌寻衅滋事

女子自称“遭4岁男童摸臀”,被质疑维权过度,律师:事发位置发生自然触碰属正常情况,女子若是故意混淆概念发视频,涉嫌寻衅滋事

封面新闻
2026-09-08 16:19:46
直到宗庆后人设崩塌,才懂赌王临终前,把私生子交给何超琼含金量

直到宗庆后人设崩塌,才懂赌王临终前,把私生子交给何超琼含金量

揽星河的笔记
2025-07-18 22:29:50
韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

王新喜
2026-09-07 23:38:09
我给一个老板做了18年司机,老板去世后,老板娘给了我80万遣散费

我给一个老板做了18年司机,老板去世后,老板娘给了我80万遣散费

千秋文化
2026-08-24 20:41:49
北京一网友称在速8酒店房间被大蜈蚣咬伤,酒店回应:当晚立即带客人去检查,已无大碍,费用由酒店承担,虫子或从下水道钻出,属突发情况

北京一网友称在速8酒店房间被大蜈蚣咬伤,酒店回应:当晚立即带客人去检查,已无大碍,费用由酒店承担,虫子或从下水道钻出,属突发情况

潇湘晨报
2026-09-08 16:09:11
四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

四妻共侍一夫仅开胃菜,何超琼曝家族猛料,所以她拒绝再婚生子

乐天闲聊
2026-09-06 23:07:19
悲催啊!朱女士爆料和丈夫都是81年出生,曾是同事,在班车上相识相恋,如今直言“相信活着”

悲催啊!朱女士爆料和丈夫都是81年出生,曾是同事,在班车上相识相恋,如今直言“相信活着”

火山詩话
2026-08-08 06:18:15
2026-09-09 06:23:00
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
832文章数 684关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

头条要闻

律师:摸臀事件女子拉伤男童系人身伤害 男童父母可索赔

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

教育
旅游
艺术
本地
时尚

教育要闻

别不信,试试这道题目,还真有不少家长都做不出来

旅游要闻

探访金刚碑温泉老村 名人故居有了不同的打开方式

艺术要闻

毛泽东写给蒋的钢笔信,硬笔书法天花板!

本地新闻

宁波,中国制造的隐藏大佬

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

无障碍浏览 进入关怀版