昨晚硅谷一口气放出了三件大事,每一件都在指向同一个方向:智能正在以夸张的速度变便宜。Google 发布 Gemini 3.8 Flash,在 DeepSWE v1.1 基准上拿到约 74% 的成绩,单任务成本只要 2.36 美元;Meta 的 Muse Spark 1.3 紧随其后,成绩 75.4%,工具调用和 token 消耗分别砍掉 20% 和 25%;还有一家叫 Mostik 的初创公司,干脆提出让 AI 模型之间直接交换内部表示,把推理成本压到原来的 1/20。
三件事放在一起看,一个更根本的变化浮出水面:AI 的成本计量方式正在从「每百万 token 多少钱」转向「修好一个 Bug 多少钱」。
![]()
成本计量正在换单位
过去几年,大家讨论 AI 成本,最常看的数字是每百万 token 的价格。但 Agent 出现以后,这套计量方式越来越不够用——一个 coding agent 可能连续运行 100 步,一个 research agent 可能搜索几十个网页。真正重要的问题变成了:修好一个 Bug 多少钱?完成一份研究多少钱?
Google 和 Meta 的实践说明,成本下降不只是 API 单价降了,更关键的是完成任务所需的计算量在减少。Google 这次把 frontier 级别能力压进了 Flash 价格区间:Gemini 3.8 Flash 在 DeepSWE v1.1 上约 74% 的成绩,和 Claude Opus 5、GPT-5.6 Sol 相当,但单任务成本只要 2.36 美元,而 Claude Opus 5 需要 11.84 美元。同级别软件工程能力,执行成本差了近五倍。
Google 还允许模型在遇到复杂任务时主动 work harder,进行更多推理——因为 token 已经便宜到可以这么做了。
Meta 在解决 Agent 最烧钱的问题
Muse Spark 1.3 的亮点不在 benchmark 涨了多少分,而在长 thread 中维护多个 workflow 的能力:遇到模糊任务主动询问,解决不了的问题主动请求帮助,涉及不可逆操作先确认。这些能力在 Chatbot 时代不如分数性感,但在 Agent 时代可以直接换算成钱——少犯一次错误就是一次推理优化。
一个 Agent 最浪费钱的地方,很多时候不是正常思考,而是跑偏。Meta 这次做的事情,本质上是在减少 Agent 跑偏的概率。
Mostik 想扔掉打印机
Mostik 的思路更激进。它让不同模型的内部表示之间建立 Bridge,直接交换 latent representation,而不是用自然语言沟通。实验里把 GLM-5.2 753B 和 Qwen 3.5 桥接,混合系统的能力居中,但推理成本只有完整 GLM 的 1/20。
有个比喻很贴切:大家过去一直在研究怎么把打印费降下来,Mostik 想干脆把打印机扔掉。如果通信的双方本来都是 AI,模型之间为什么还需要用为人类设计的语言交流?
这个方向指向一种未来:端侧只需要运行 0.xB 的小模型,通过潜空间通信调用远程大模型。
便宜到可以随便用,产品边界才会被重塑
很多技术爆发不在「第一次能用」,而在「终于便宜到可以随便用」。今天让 Agent 花几十美元完成一个小任务不划算,但如果成本降到几毛钱,很多今天看起来疯狂的产品可能就成立了。
智能正在以非常夸张的速度变得便宜,而且这种降价已经不只是 API 单价下降。当强大的智能真的便宜到可以被随意调用,AI 产品的边界会被彻底重塑。这么聪明的 AI,最后到底可以便宜到什么程度?一旦那一天到来,很多今天看起来还非常疯狂的 AI 产品,可能才刚刚开始。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.