网易首页 > 网易号 > 正文 申请入驻

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

0
分享至


新智元报道


太卷了。

九月才过去3天,就已经有五个前沿模型发布了!

Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。

就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。

小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!


Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。

他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。


Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。

跑分显示,这次 Muse Spark 1.3 的提升更大。

它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。


在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。

亚历山大王嘲讽谷歌

「吸别家模型尾气」

最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。

Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。

在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。

Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分


不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。

在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。

在Terminal-Bench 2.1它拿下88.8 分。

在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。


在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。


在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。

在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。


而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。

面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」

谷歌真是虎落平阳。


有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」


Less is More:1美元跑2小时的性能怪兽

跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。

Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。

正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。



它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。

针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。


它变得更聪明利落,代码风格更干净,废话更少。

而这种减法带来的直接后果,就是成本的断崖式下跌。

下面就是一个非常震撼的真实实测案例。

开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。


他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。

这两个模型都运行了大约 2 个小时,结果惊人。

Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。

而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!


这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」

在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。


在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)


Codedamn创始人、开发者Mehul Mohan直呼:

Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。


在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。

作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。

甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。

它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。


Alexandr Wang的狂飙,小扎的终极野心

Muse Spark 1.3 的横空出世,离不开其背后的操盘手。

今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。

短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。

如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。

他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。

也就是说,Meta看下一个ASI风口——「智能体工程」。

Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。


要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。

1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。

当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。

2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。

Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。

它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。

为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。


狂欢背后:我们被「刷榜」骗了吗?

不过,Muse Spark 1.3也同样受到了质疑。

知名 AI 机构 BridgeMind发了一段引人深思的话:

Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。

Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。

因为,这个月的AI发布如出一辙,分数飙升,真实世界的体验却毫无长进。

这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。


这段话,精准地击中了当前大模型行业的痛点。

有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:

Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。


现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。

DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。

而Muse Spark 1.3 也露出了马脚。

在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。

比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。

这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。


大模型的下半场,到底比什么?

今天 Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。

首先,基座模型的「参数红利」正在见顶。

单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。

未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。

另外,「智能体工程」才是胜负手。

大模型之争,已经从「谁更会说话」转向「谁更能干活」。

未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。

像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。

参考资料:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

编辑:Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一位字节员工吐槽:外人一听年薪60万,下意识就换算成月薪5万。实际上,基本工资可能还不到一半,剩下的是年终奖、季度奖、股票,还有税

一位字节员工吐槽:外人一听年薪60万,下意识就换算成月薪5万。实际上,基本工资可能还不到一半,剩下的是年终奖、季度奖、股票,还有税

纯洁的微笑
2026-09-05 12:13:47
炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

炮制张氏叔侄十年冤狱,女神探聂海芬,民众为何强烈要求从严追责

墨策讲历史
2026-07-21 16:45:48
31.8万起!2027款宝马BMW X3上市:配置疯狂加码 硬刚奔驰GLC

31.8万起!2027款宝马BMW X3上市:配置疯狂加码 硬刚奔驰GLC

快科技
2026-09-07 11:11:05
小米多款新车正式发布,这定价太狠了!

小米多款新车正式发布,这定价太狠了!

花果科技
2026-09-07 21:49:20
日本提供新证据,官方地图已承认钓鱼岛属于中国,高市无法抵赖

日本提供新证据,官方地图已承认钓鱼岛属于中国,高市无法抵赖

麓谷隐士
2026-09-06 00:16:57
乌克兰最要命的问题来了:如果仗打完了,留下几百万女人怎么办?

乌克兰最要命的问题来了:如果仗打完了,留下几百万女人怎么办?

麓谷隐士
2026-08-23 00:10:04
这些“啼笑皆非”的穿帮镜头,如今个个成了经典,你都看过哪些?

这些“啼笑皆非”的穿帮镜头,如今个个成了经典,你都看过哪些?

莹莹的历史说
2026-09-06 04:36:27
日韩全崩!女篮世界杯惊现大变天,中国女篮垫底恐成亚洲独苗?

日韩全崩!女篮世界杯惊现大变天,中国女篮垫底恐成亚洲独苗?

智脑的趋势
2026-09-07 11:22:02
目标冲击60亿,《满江红2》志向远大,沈腾将上演“自己打自己”

目标冲击60亿,《满江红2》志向远大,沈腾将上演“自己打自己”

影视高原说
2026-09-07 14:09:21
欧美港口:拆掉中国设备!工人拆完,领导:混蛋我让你拆的是 Logo

欧美港口:拆掉中国设备!工人拆完,领导:混蛋我让你拆的是 Logo

麓谷隐士
2026-09-08 00:05:03
相隔30年,中国士兵装备仍然追不上奥匈帝国士兵!

相隔30年,中国士兵装备仍然追不上奥匈帝国士兵!

弹痕驿站
2026-09-07 16:07:43
为什么英语主科地位之争扯出了教育公平?

为什么英语主科地位之争扯出了教育公平?

小眼睛小世界
2026-09-07 04:18:16
金·卡戴珊在汉密尔顿的摩纳哥周末坚持穿古驰高跟鞋

金·卡戴珊在汉密尔顿的摩纳哥周末坚持穿古驰高跟鞋

奇思妙想生活家
2026-09-06 03:33:36
10999元起!小米18 Fold中折叠手机发布:首发玄戒O3自研芯+长鑫LPDDR6

10999元起!小米18 Fold中折叠手机发布:首发玄戒O3自研芯+长鑫LPDDR6

快科技
2026-09-07 22:26:16
9岁丧父16岁超市卖饮料,给赵长鹏生3个孩子,如今成币圈女掌门!

9岁丧父16岁超市卖饮料,给赵长鹏生3个孩子,如今成币圈女掌门!

凡知
2026-08-31 13:00:37
国产手机集体涨价遇冷,经销商懵了,消费者:我可以三年半不换

国产手机集体涨价遇冷,经销商懵了,消费者:我可以三年半不换

小蜜情感说
2026-09-06 02:41:28
央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

平说财经
2026-08-29 07:39:18
他是文强的儿子,父亲被执行死刑母亲被判8年,他现在又是如何呢

他是文强的儿子,父亲被执行死刑母亲被判8年,他现在又是如何呢

磊子讲史
2026-07-04 16:53:05
王晶赌上全部!刘德华甄子丹古天乐首度同框,这部港片能救市吗?

王晶赌上全部!刘德华甄子丹古天乐首度同框,这部港片能救市吗?

手工制作阿歼
2026-09-06 02:17:46
静待白马王子:是我在视线与地平线之间为你留出的可调节焦距

静待白马王子:是我在视线与地平线之间为你留出的可调节焦距

疾跑的小蜗牛
2026-09-01 20:50:57
2026-09-08 02:31:00
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16128文章数 67048关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

游戏
数码
房产
家居
艺术

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

数码要闻

存储吃紧!华硕、技嘉计划再次上调显卡售价:最高涨幅500元

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

无障碍浏览 进入关怀版