网易首页 > 网易号 > 正文 申请入驻

Meta发最强模型打响价格战,小扎对谷歌贴脸开大!北大校友立大功

0
分享至


新智元报道


太卷了。

九月才过去3天,就已经有五个前沿模型发布了!

Anthropic的Fable 5.1和Mythos 5.1、谷歌的Gemini 3.8 Flash和Cyber,以及Meta的Muse Spark1.3……RSI,肯定已经到来了。

就在昨晚,谷歌的Gemini 3.8 Flash刚成为轻量霸主,Meta就来踢馆了。

小扎在X上霸气官宣:Muse Spark 1.3 今日正式发布,它以前沿性能,带来几乎便宜到无需计量的体验。这是我们在编程和智能体工作方面迄今实现的最大飞跃!


Meta 超级智能实验室的掌舵人 Alexandr Wang也连发三条X,揭秘了这次「王炸」的核心杀手锏。

他表示,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少 ~20%,token 消耗减少 ~25%,并且在长周期任务中能更好地保持需求,「用户会明显感受到这次飞跃」。


Muse Spark 1.3 一发布,昨晚刚发布的 Gemini 3.8 Flash 就略显尴尬了。

跑分显示,这次 Muse Spark 1.3 的提升更大。

它不仅在跑分上反超了GPT-5.6 Sol 和 Fable 5,Max 推理强度下的 Artificial Analysis 智力指数已经达到 62 分,妥妥进入当前第一梯队。


在五个月里,Meta已经不知不觉迭代了4个Muse Spark版本了。

亚历山大王嘲讽谷歌

「吸别家模型尾气」

最近,AI第一梯队可是非常拥挤。GPT-5.6把持着王座,Fable 5.1后来居上,Gemini 3.8 Flash正弯道超车。

Muse Spark 1.3 的出现,直接打乱了所有人的阵脚。

在最能体现模型真实长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3直接超越Opus 5和GPT-5.6 Sol,还把刚发布的 Gemini 3.8 Flash 甩在身后,拿下了当前的最高分。

Muse Spark 1.3:75.4 分

Claude Opus 5:74.0 分

GPT-5.6 Sol:73.0 分


不仅如此,在其他几项关键的开发者指标中,Muse Spark 1.3 也展现出了不容小觑的性能。

在SWEAtlas CodeBase QnA,它拿下 59.4 分,超越 GPT-5.6 Sol 和 Opus 5。

在Terminal-Bench 2.1它拿下88.8 分。

在MRCR 512K-1M上,它居然拿到惊人的 98.1 分!(作为对比,GPT-5.6 Sol 在这项上仅有 73.8 分,简直是碾压)。


在 Agent能力上,它也基本追平了最前沿的水平,在 JobBench、OSWorld 等测试中与Opus 5仅剩几个百分点的微弱差距。


在Artificial Analysis上,Muse Spark 1.3把Gemini 3.8 Flash明显甩在身后。

在智能指数上,它获得了62分,与Claude Fable 5持平,跻身顶尖行列。


而在最受开发者关注的成本方面,Muse的输入成本比Fable 5低8倍,输出成本低近12倍,性价比拉满。

面对如此亮眼的战绩,Meta的首席AI官Alexandr Wang直接阴阳起来:「在Artificial Analysis智能指数上,Gemini啥也不是,只能吃别家模型的汽车尾气。」

谷歌真是虎落平阳。


有人戏称:「谷歌辛辛苦苦四个月发了4个Gemini Flash版本,Meta这边五个月里一口气迭代了 4 个 Muse Spark⁺。但谷歌刚领跑了几个小时,就被 Meta 超车了,这剧情太精彩了。」


Less is More:1美元跑2小时的性能怪兽

跑分高固然厉害,但在如今的AI圈,真正让开发者兴奋的,永远是好用且便宜。

Muse Spark 1.3 之所以被称为性价比之王,是因为它不仅跑得快,还特别会省钱。

正如 Alexandr Wang 所言,Muse Spark 1.3「便宜到不值一提」,「前沿性能,成本只是零头」。



它走了一条与以往大模型「大力出奇迹、疯狂堆叠参数」完全不同的路——做减法。

针对长周期编程和更优的指令遵循能力,Muse Spark 1.3进行了专门训练,从而减少不必要的交互轮次,并让输出更加简洁。


它变得更聪明利落,代码风格更干净,废话更少。

而这种减法带来的直接后果,就是成本的断崖式下跌。

下面就是一个非常震撼的真实实测案例。

开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与Fable 5.1 xHigh 进行了对比。


他给出的 Prompt中包含一条严苛的「自我改进规则」:如果独立评委的评分低于 9.5/10,智能体必须继续改进代码并重新尝试。

这两个模型都运行了大约 2 个小时,结果惊人。

Muse Spark 1.3 简直像一个不知疲倦的超级打工人,它根本停不下来,足足进行了 20 轮自我改进循环,每次启动 3 个智能体——相当于在 2 小时内跑了 60 多次智能体运行。

而完成这极其庞大、复杂的长程推理任务,总成本竟然不到 1 美元!


这位开发者惊呼:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」

在宏观定价上,Meta 展现出了极大的诚意。新模型加量不加价,维持了每百万 token 输入 1.25 美元、输出 4.25 美元的定价。


在定价上,Muse Spark 1.3的贡献者版「muse-spark-1.3-contributor」更是国外模型定价的地板。(代价,就是要把数据用于改进Meta的产品。)


Codedamn创始人、开发者Mehul Mohan直呼:

Muse Spark 1.3 的贡献者层定价简直离谱得不真实,这就是美国 AI 实验室的「DeepSeek 定价时刻」。


在 Artificial Analysis 的统计中,在同等智力水平(得分59以上)的模型里,Muse Spark 1.3 的单任务成本仅为 0.55美元,是绝对的最优解。

作为对比,同等智力(61分)的 Grok 4.6 成本为 0.94 美元,GPT-5.6 Sol 需要 0.95 美元,Claude Opus 5 更是高达 1.23 美元。

甚至,开发者 Kartik指出,Muse Spark 1.3 似乎具备了类似于 Sol 和 Fable 的「循环深度」推理能力。

它不是在一瞬间生成答案,而是懂得在内部进行逻辑推演,这使得它的token效率高得惊人。


Alexandr Wang的狂飙,小扎的终极野心

Muse Spark 1.3 的横空出世,离不开其背后的操盘手。

今年 7 月,Meta发布 Muse Spark 1.1,主打 的是1M 超长上下文和计算机操作。

短短不到两个月,1.3 版本就已经把长程编码能力推到了 GPT-5.6 的档次。

如此快速的迭代,正是Alexandr Wang 接手 Meta 超级智能实验室后带来的成果。

他们的终极目标是什么?正如小扎和 Alexandr Wang 反复强调的两个词:「智能体」和「便宜到忽略不计」。

也就是说,Meta看下一个ASI风口——「智能体工程」。

Meta AI负责人Alexandr Wang在接受Axios采访时明确表示,所有的可用性改进,都是为了服务小扎多次提及的宏伟蓝图——打造 7×24 小时在线的个人智能体。


要想让一个智能体 24 小时帮你处理邮件、写代码、分析数据,它必须具备两个条件。

1.极度聪明且稳定:它需要撑住极长的对话线程(长线程),能够并行处理多个工作流。

当指令模糊时,它要懂得主动提问;当遇到阻碍时,它要懂得向人类求助;在执行关键操作前,它要懂得确认。最重要的是,不产生幻觉。

2.极度便宜:如果个人智能体运行一天的成本高达几十美元,那它永远只能是少数人的玩具。

Muse Spark 1.3 的出现,本质上就是为 7×24 小时个人智能体铺路。

它就像一个成熟的资深工程师,你给一个目标,它就能自己规划、自己纠错、自己交付。

为此,北大校友、Meta研究员孙之清透露Meta团队对此前的牛油果avocado模型再次后训练,实现了更好的测试scaling。


狂欢背后:我们被「刷榜」骗了吗?

不过,Muse Spark 1.3也同样受到了质疑。

知名 AI 机构 BridgeMind发了一段引人深思的话:

Gemini 3.8 Flash 和 Muse Spark 1.3 今天同时发布。两者在基准测试上看起来都很出色。

Muse Spark 1.3 目前在智能指数上与 Fable 5 并列……我想感到兴奋。但我没有。

因为,这个月的AI发布如出一辙,分数飙升,真实世界的体验却毫无长进。

这令人沮丧。我对基准测试的信任每周都在减少,而对那些玩弄基准的实验室,我的信任更是所剩无几。


这段话,精准地击中了当前大模型行业的痛点。

有网友对Muse Spark 1.3、Gemini Flash 3.8z在后端级3D约束下做了压力测试,结果两个模型的老底都被揭穿了:

Muse Spark 1.4并没有那么好,而Gemini Flash 3.5纯纯在刷榜。


现在,各大实验室已陷入「为了跑分而训练」的怪圈。一个模型发布,必定伴随着几张吊打友商的雷达图和排行榜截图。

DeepSWE、Tau3-Bench、GPQA,成了各家疯狂「刷题」的目标。

而Muse Spark 1.3 也露出了马脚。

在 Artificial Analysis 的深度报告中,我们也能看到它的一丝退步。

比如,在 AA-Omniscience测试中,xhigh 和 max 版本都有所下降。原因是它的「弃权率」变高了——当它不确定时,它更倾向于不回答,而不是胡编乱造。

这降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分提升得那么夸张。


大模型的下半场,到底比什么?

今天 Muse Spark 1.3和Gemini 3.8 Flash的发布,可以让我们得出以下几个判断。

首先,基座模型的「参数红利」正在见顶。

单纯靠扩大参数规模来提升智力的路径,边际效益已经越来越低。

未来,谁能像 Muse Spark 1.3 一样,在系统架构上引入类似「循环深度」的推理机制,在工具调用上做极致的「减法」,谁就能获得真正的体验跃升。

另外,「智能体工程」才是胜负手。

大模型之争,已经从「谁更会说话」转向「谁更能干活」。

未来的核心壁垒不是单一跑分,而是在极低成本下,长程任务的真实落地能力。

像 Muse Spark 1.3 这样,用不到 1 美元跑完 60 次试错循环的模型,将彻底重塑商业模式。

参考资料:

https://x.com/SPAC89/status/2095284969614475744

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/AIatMeta/status/2095234385129963666?s=20

https://artificialanalysis.ai/zh/models/muse-spark-1-3

https://x.com/EdwardSun0909/status/2095236891574780275?s=20

编辑:Aeneas

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
全世界只剩2架,我国有一架,美国出3000万购买被拒

全世界只剩2架,我国有一架,美国出3000万购买被拒

疯狂的小历史
2026-09-05 10:01:05
这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

小樾说历史
2026-09-07 02:41:03
澳洲人开始效仿华人, 纷纷在自家阳台做起了这件事! 一年能省下这个数

澳洲人开始效仿华人, 纷纷在自家阳台做起了这件事! 一年能省下这个数

澳微Daily
2026-09-03 15:53:40
降至18℃!长沙降温时间确定,冷空气又要来了

降至18℃!长沙降温时间确定,冷空气又要来了

鲁中晨报
2026-09-07 14:43:09
“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

“大量蛇精,蜈蚣精来了!”浙江真人版“葫芦爷爷”事件,走向了最魔幻的一幕……

桌子的生活观
2026-09-07 12:34:38
费迪南德:换作是我,我会在防线中使用海文或约罗中的一人

费迪南德:换作是我,我会在防线中使用海文或约罗中的一人

懂球帝
2026-09-08 00:55:10
陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

陈思诚一家三口罕见合体,10岁朵朵黏着爸爸抹眼泪,佟丽娅站一旁刻意避嫌

阿废冷眼观察所
2026-09-06 07:05:54
一路走好!不到72小时,5位名人接连离世,最小37岁,最大97岁

一路走好!不到72小时,5位名人接连离世,最小37岁,最大97岁

往史过眼云烟
2026-09-07 22:06:46
10年内入狱2次,爆火后“包一晚”40万,如今的她过得怎么样?

10年内入狱2次,爆火后“包一晚”40万,如今的她过得怎么样?

混沌录
2025-07-17 22:33:44
才播4集,全国收视率第一!央八这部年代谍战剧《交锋》,王凯周依然欧豪彭昱畅领衔主演,又是2026年度黑马

才播4集,全国收视率第一!央八这部年代谍战剧《交锋》,王凯周依然欧豪彭昱畅领衔主演,又是2026年度黑马

猫飞电影
2026-09-07 23:31:22
知名品牌创办人宣布与结婚逾20年的妻子分道扬镳,价值400多亿元财产待分割

知名品牌创办人宣布与结婚逾20年的妻子分道扬镳,价值400多亿元财产待分割

19楼
2026-09-07 08:16:48
突发!詹姆斯最新决定!又挨骂了...

突发!詹姆斯最新决定!又挨骂了...

左右为篮
2026-09-07 00:10:37
死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

趣味萌宠的日常
2026-09-07 15:12:42
9月7日人民币对美元中间价调贬8个基点

9月7日人民币对美元中间价调贬8个基点

证券时报
2026-09-07 09:38:03
演员黄渤回应“家门口骑车摔成锁骨骨折”:手里抓着手机,捏刹车的时候没整明白

演员黄渤回应“家门口骑车摔成锁骨骨折”:手里抓着手机,捏刹车的时候没整明白

极目新闻
2026-09-07 22:48:26
路边碰到一群精神小妹,我想知道他们的出路在哪

路边碰到一群精神小妹,我想知道他们的出路在哪

皮蛋儿电影
2026-09-05 16:09:44
默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

青青衫书生
2026-09-06 23:15:53
俄罗斯不放行,美国特使只能转乘火车!泽连斯基应付那俩货可真累

俄罗斯不放行,美国特使只能转乘火车!泽连斯基应付那俩货可真累

鹰眼Defence
2026-09-07 15:41:55
上汽新车官宣:9月10日 ,正式预售

上汽新车官宣:9月10日 ,正式预售

科技堡垒
2026-09-05 10:32:59
毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

毛主席为何拒绝给董存瑞题词?得知缘由后,众人钦佩:伟人高明

文史道
2025-07-03 20:21:14
2026-09-08 01:32:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16128文章数 67048关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

教育
旅游
房产
本地
公开课

教育要闻

最新!清华附、十一学校大动作!

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版