网易首页 > 网易号 > 正文 申请入驻

AI巨头又开始“互卷”!Google、Meta同时出手:Gemini 3.8、Muse Spark 1.3重磅发布

0
分享至

整理 | 屠敏

出品 | CSDN(ID:CSDNnews)

这两天,AI 领域热闹非凡,大模型市场迎来了一轮密集更新。

9 月 1 日,Anthropic 刚刚发布 Claude Fable 5.1 和 Claude Mythos 5.1,主打编码、知识工作和长时间 Agent 任务。紧接着,Google 和 Meta 也在同一时间带来新模型:Google 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,Meta 则发布 Muse Spark 1.3。

短短几天,三家头部 AI 公司接连出手,而且不约而同地把重点放在了编码、Agent 和复杂任务执行上。大模型的竞争,正在从单纯比拼“谁的回答更聪明”,进一步转向比拼谁能真正把事情做完。


仅三周,Gemini 3.8 Flash 就来了

回看 Gemini 3.7 Flash 版本的发布,也只不过是三周前的事情。

如今 Google 加快了模型版本迭代的步伐,最新带来了 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。官方表示,这是目前最智能的 Flash 模型,重点提升软件工程、Agent 任务和多步骤推理能力。


其中,Gemini 3.8 Flash 最大的特点,是在保持 Flash 系列速度和成本优势的同时,开始向更高能力的模型靠近。


它支持 100 万 Token 上下文,输入价格为每百万 Token 0.75 美元,输出为3.75 美元。模型还支持低、中、高三档 thinking 强度,可以在性能、延迟和成本之间进行调整。

在 DeepSWE v1.1 这一长程软件工程测试中,Google 自己公布的数据显示,Gemini 3.8 Flash 可以自主处理复杂工程问题。


在 Vals Finance Agent V2 和 Harvey’s Legal Agent Benchmark 等专业 Agent 测试中也超过上一代。HLE-Verified 得分则达到 54.9%,证明了其能够处理 STEM、人文和专业领域的多步骤推理。


第三方测试同样给出了不错的结果。

Artificial Analysis 测试显示,Gemini 3.8 Flash 在最高推理强度下拿到 59分,比 Gemini 3.7 Flash 的 56 分提高 3 分;中等推理强度为 57 分,低推理强度为 52 分。

这与 Anthropic 的 GPT-5.6 Sol和 SpaceXAI 的 Grok 4.6 仅差一点。


不过,Google 也很坦率:3.8 Flash 会“想得更多”。

在处理复杂任务时,这款模型会表现得更加细致,会增加推理步骤,并反复调用工具。有时,为了尽可能提升任务表现,模型会消耗更多 Token,尤其是在更高推理强度下。

Google 对此建议道:对于算力效率是首要考量的应用场景,开发者可以选择较低的推理强度,以减少 Token 开销;也可以继续使用 Gemini 3.7 Flash。后者目前仍得到完整支持,适合那些更看重效率和成本的工作负载。


Gemini 3.8 Flash Cyber:Google 把网络安全单独拎出来

随着 Gemini 3.8 Flash 一起发布的,还有 Gemini 3.8 Flash Cyber,同样值得关注。

这个版本不是面向普通用户的“加强版 Gemini”,而是专门用于网络安全防御,目前通过 Google 新推出的 Fairwind Program 提供给一组受信任的防御者。

Google 重点测试了两个能力:发现漏洞和自动修复漏洞。

在用于查找漏洞的行业标准基准测试 CyberGym中,Gemini 3.8 Flash Cyber达到前沿水平,并超过了 Gemini 3.5 Flash Cyber 以及更大的模型。


在 CWE-Bench 漏洞修复测试中,模型 pass@1 达到 47.2%,与领先前沿模型的 47.8% 非常接近,但 Google 强调其成本明显更低。更直接的例子来自实际使用:Chrome 安全团队发现,3.8 Flash Cyber 生成的正确漏洞补丁数量,是体量更大的商业模型中最佳结果的 2.6 倍。


Google 还披露,Cloud Vulnerability Research 团队利用该模型在不到 2 小时内发现了一个关键基础漏洞,而这类漏洞通常可能需要数月研究。

当然,这一能力也意味着更严格的访问控制。Google 表示,Gemini 3.8 Flash 已经加入针对网络攻击和 CBRN 相关滥用的安全措施,而 Cyber 版本因为需要提供更完整的网络安全能力,因此只开放给可信防御方。


Meta Muse Spark 1.3 同台竞技,Alexandr Wang 调侃:“Gemini 是谁?

同一天,Meta AI Research 也拿出了 Muse Spark 1.3,是继今年 8 月发布 Muse Spark 1.2 后,短时间内再次升级的一代模型。

一直热衷于为自家模型“站台”的 Meta AI 负责人 Alexandr Wang,在新模型发布后也不忘调侃一番,直接在社交平台上发问:“我真不想这么说,但是……Gemini 是谁?”


相比 Google 和 Anthropic 此前更明显的模型升级,Meta 这次并没有改变 Muse Spark 的定位,而是继续围绕 Agent 和编程能力加码。

官方表示,Muse Spark 1.3 重点提升了 Agentic 任务和编程任务的表现,并针对真实使用场景进行了大量优化,让模型不仅在测试中表现更好,也能更稳定地处理需要多步骤执行的复杂任务。


详细来看,Muse Spark 1.3 针对 Agent 和编码任务进行了优化,可以在一个较长的对话线程中同时处理多个工作流。面对开放式任务,它能够利用工具收集上下文、发现计划中的缺口并主动修正,同时在任务过程中记住已经获得的信息。

这种能力在实际工作中尤其重要。比如用户要求模型根据 CFD 仿真数据和 CAD 文件制作一份航空工程报告,Muse Spark 1.3 不仅需要读取不同类型的输入,还要提取仿真数据、整理性能指标、生成表格、分析气动性能,最后按照指定结构输出 PDF。


Meta 展示的另一个案例则要求模型处理音频工程任务,根据时间码定位贝斯轨道中的错误音符、噪声和爆音,再完成编辑和混音。


在与用户协作方面,Muse Spark 1.3 也进行了优化。面对存在歧义的要求,模型会主动请求澄清;执行过程中遇到无法解决的问题时,也可以向用户寻求帮助,并在执行重要操作前进行确认。

对于长时间任务,它还可以根据场景选择持续汇报进度,或者尽量减少打扰,在后台完成工作。

编程也是此次升级的重点。Meta 表示,Muse Spark 1.3 针对长周期编码任务和常见软件工程工作流进行了优化,在没有必要的情况下会减少交互轮次,同时让代码更加简洁。

根据 Meta 工程师的测试,在相同类型的任务中,Muse Spark 1.3 相比 Muse Spark 1.2 的工具调用次数减少约 20%,Token 使用量减少约 25%。这意味着新模型并非单纯依靠更多推理和工具调用完成任务,而是在减少无效操作的同时提高执行效率。


安全方面,Muse Spark 1.3 也针对 Agent 和编码场景进行了优化,包括增强对抗恶意输入和 Prompt Injection(提示词注入)的能力,并改进对高风险、不可逆操作的判断,在必要情况下会暂停执行并请求用户确认。

目前,Muse Spark 1.3 已经上线 Muse Code 和 Meta Model API。此前提供的推理模式现已开放,而更高强度的 Max Reasoning 模式将在完成额外安全测试后推出。

对于这一新版本,Alexandr Wang 表示,这一升级也是 Meta 继续推进“个人 Agent”的一部分,目标是让 Agent 未来能够长期运行,替用户完成任务。


不同模型碰到一起,真正比的是“干活能力”

事实上,把这几款模型放在一起看,会发现一个很明显的变化。

这轮新品已经很难单纯用“谁的模型更聪明”来概括。

Claude Fable 5.1 目前在 Artificial Analysis 综合智能指数上以 66 分排名第一,它的优势集中在复杂推理、编码和专业知识工作,但最高强度下也会消耗大量 Token。

Gemini 3.8 Flash 则更像一个高性价比的“工作马”。最高推理强度下达到 59 分,开发者还可以主动降低 thinking 强度,把单任务成本进一步压低。

Muse Spark 1.3 则把重点放在长任务执行效率上。它不只是提高模型本身的能力,还试图让 Agent 少调用几次工具、少消耗一些 Token,并在复杂任务中更好地保持上下文和执行约束。

这也是为什么最近模型发布越来越频繁,却越来越不像过去那种简单的“刷榜”。


模型已经开始进入一个新的竞争阶段:不仅要回答得对,还要能连续工作;不仅要能写代码,还要能自己运行、测试和修改;不仅要完成任务,还得控制完成任务的 Token 和时间成本。

从这个角度看,Anthropic、Google 和 Meta 这几款新品虽然走的是不同方向,但最终瞄准的是同一个问题——当大模型不再只是聊天机器人,而是开始真正替用户执行任务时,谁能让它们干得更久、更稳、更快,而且成本还能接受。

接下来大模型赛道的竞争真正值得看的,可能已经不是下一款模型能把榜单提高几分,而是这些模型进入真实工作流之后,究竟谁能最先把“Agent 自己干活”从演示变成日常工具。

参考:

https://research.meta.ai/blog/introducing-muse-spark-1-3

https://x.com/ArtificialAnlys/status/2095247787277553929/photo/1

https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

https://artificialanalysis.ai/articles/gemini-3-8-flash?utm_source=chatgpt.com

https://artificialanalysis.ai/-breakdown

文末福利|AI 开学季硬核资料免费领

2026 奇点智能技术大会限时送出两份技术礼包:

Łukasz Kaiser 历届演讲视频 + PPT

Transformer 八子之一、OpenAI 资深研究科学家,带你理解推理模型与大模型第一性原理。

Agent 实战训练营录播课

覆盖 Agent 架构、基座模型、Skill、Agentic Infra 等核心技术,从理论到企业级落地。

扫码免费领取,两套硬核资料一次带走。

11 月 20—21 日

北京万达文华酒店

2026 奇点智能技术大会,现场见。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
武汉一小区4名儿童竟爬上26层楼顶天台,在仅有三四十厘米高的护栏边沿玩耍,旁边就是80多米高空!业主群曾紧急预警

武汉一小区4名儿童竟爬上26层楼顶天台,在仅有三四十厘米高的护栏边沿玩耍,旁边就是80多米高空!业主群曾紧急预警

扬子晚报
2026-09-06 19:47:52
第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

第二个许家印!又一首富栽了!世界500强竟是假的,千亿帝国清零

蜉蝣说
2026-07-17 09:47:08
看了6遍《平凡的世界》才醒悟:穷人翻身最忌讳的,就是拼命努力,真正走出去的人,都狠心在这两件事上做“反人性”的投资

看了6遍《平凡的世界》才醒悟:穷人翻身最忌讳的,就是拼命努力,真正走出去的人,都狠心在这两件事上做“反人性”的投资

心理观察局
2026-09-04 06:53:04
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

纯洁的微笑
2026-09-02 12:19:46
回旋镖来了!普京表示要结束战争,泽连斯基才醒悟,俄军换了打法

回旋镖来了!普京表示要结束战争,泽连斯基才醒悟,俄军换了打法

凉羽亭
2026-09-06 11:34:01
中小学一定要买校服吗?教育部回应

中小学一定要买校服吗?教育部回应

新京报
2026-09-06 09:27:11
原来真的有人能被爱到这种程度!网友:幸福在此刻具象化了

原来真的有人能被爱到这种程度!网友:幸福在此刻具象化了

夜深爱杂谈
2026-08-01 21:21:09
首钢83-78夺冠!赵睿轮休,小将8中7轰15分成奇兵,王凯终于爆发

首钢83-78夺冠!赵睿轮休,小将8中7轰15分成奇兵,王凯终于爆发

萌兰聊个球
2026-09-06 22:30:42
9月7日将要上市的3款SUV

9月7日将要上市的3款SUV

鸭梨说车
2026-09-06 21:23:20
利智:被李连杰宠爱37年,外人看来是掉进蜜罐,甜蜜背后全是眼泪

利智:被李连杰宠爱37年,外人看来是掉进蜜罐,甜蜜背后全是眼泪

趣味八卦
2026-09-06 23:10:40
甲钴胺最大的危害您知道吗?为什么很多人就算疼痛难忍,也不服用

甲钴胺最大的危害您知道吗?为什么很多人就算疼痛难忍,也不服用

健康科普365
2026-08-31 22:00:05
调查发现:男性若长期不喝酒,用不了半年,身体或出现这6个改变

调查发现:男性若长期不喝酒,用不了半年,身体或出现这6个改变

芹姐说生活
2026-06-29 23:28:34
一天花5.3万!郑钦文美网开销曝光,26天烧掉138万,打网球太烧钱

一天花5.3万!郑钦文美网开销曝光,26天烧掉138万,打网球太烧钱

观鱼听雨
2026-09-06 21:32:19
逆天!3少年轮奸女学生并笑着拍下了全程,结果法官:不用坐牢,他们还小

逆天!3少年轮奸女学生并笑着拍下了全程,结果法官:不用坐牢,他们还小

北美省钱快报
2026-06-02 04:45:28
乌克兰一天要面对约300架俄无人机,最贵的防空导弹不能这么烧

乌克兰一天要面对约300架俄无人机,最贵的防空导弹不能这么烧

桂系007
2026-09-06 23:33:42
特朗普特使及女婿已乘火车抵达乌克兰首都基辅,泽连斯基明确乌方核心诉求;此前俄乌均作出临时停火3天安排

特朗普特使及女婿已乘火车抵达乌克兰首都基辅,泽连斯基明确乌方核心诉求;此前俄乌均作出临时停火3天安排

扬子晚报
2026-09-06 22:32:41
朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

朱可夫晚年亲口承认:德军撤出莫斯科那一夜,并非俄军打赢了,是斯大林下了一道没人敢提的命令,如何在一夜之间捏碎了德军的铁血意志?

辛某人
2026-08-10 17:10:00
广州都市圈提速,佛山东莞中山清远谁先起飞

广州都市圈提速,佛山东莞中山清远谁先起飞

石辰搞笑日常
2026-09-07 00:00:26
狂不自知!韩国政府口出狂言,李在明向我国施压,中方早有言在先

狂不自知!韩国政府口出狂言,李在明向我国施压,中方早有言在先

铁锤侃侃而谈
2026-09-06 09:56:43
2026-09-07 01:19:00
CSDN incentive-icons
CSDN
成就一亿技术人
26925文章数 242322关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
本地
数码
艺术
公开课

房产要闻

突发重磅!海口出台楼市新政!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

数码要闻

联想ThinkPad E16 2026笔记本新增酷睿5 320版本,7299元

艺术要闻

张大千的终极秘密:心中没“仙气”,画一万遍也白搭!他这句话点醒了无数人!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版