![]()
![]()
导语
2022 年末,ChatGPT 把大模型推到聚光灯下。此后的三年多里,最吸引注意力的始终是能力上限:模型还能变得多聪明,还能解决多难的问题。Scaling Law 驱动参数、数据和算力不断扩张,推理模型又把这条能力曲线往前推了一截。谁能站上 frontier,谁就更容易获得技术声量、开发者关注和资本溢价。
到了 2026 年,另一套评价体系开始逐渐浮出水面。
Google 密集迭代 Flash,OpenAI 将 GPT-5.6 拉出 Sol、Terra、Luna 等不同档位,并大幅下调 Luna、Terra 的价格,智谱、Qwen、DeepSeek 也把效率和价格越来越明确地写进产品策略。
9 月 22 日,Anthropic 发布 Claude Opus 5.5 时,也把“效率”直接放到了核心位置:在能力继续提升的同时,典型工作负载的运行成本较 Claude Opus 5 下降 40%,输出速度提升超过 30%,cache read 价格下降 60%。
这意味着,降低单位任务成本已经不再只是效率型模型的差异化策略。最靠近 frontier 的模型,也开始同时争夺更低 token 消耗、更低任务成本和更快交付。全球大模型竞争正在从单纯追逐能力上限,向一场更完整的效率竞赛扩展。
各家旗舰模型继续负责探索智能上限,大量真实 workload 则开始流向能力足够、价格更低、速度更快的模型。这种效率叙事甚至开始深入模型设计本身。近期备受关注的 Jev 模型就选择放弃自由文本生成,专门处理分类、评分和路由等结构化决策,让 Agent 中大量简单判断以更小的计算开销完成。所以当模型能力已经跨过任务门槛,继续堆更昂贵的智能未必是最经济的选择。
行业开始用“智能—成本”帕累托前沿(Pareto frontier)描述这种变化。把模型的智能水平和完成任务的成本放在同一张图里,前沿上的模型构成了当时最有效率的一组选项。如果一个模型已经能够找到能力更高、成本还更低的替代品,它就会落到所谓“斩杀线”以下,面临提高能力或降低价格的压力。开发者的调用随之迁移,token 流量和收入也会跟着重新分配。
这种变化已经出现在真实流量里。OpenRouter 数据显示,2026 年 6 月,中国模型的调用量份额已经超过美国模型。MiMo 是其中增速很快的一条线。MiMo-V2.5 发布两个月后,在 OpenRouter 上的调用量增长约 616%,随后在 7 月登上周榜和月榜第一。
![]()
现在,这条路线推进到了 MiMo V2.6。9 月 22 日,小米正式发布并开源 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash,同时提供 V2.6-Pro-Ultraspeed 高速模式,分别瞄准高频 Agent 与 Coding、复杂专业任务和低延迟实时场景。
Artificial Analysis Intelligence Index 显示,MiMo-V2.6-Pro 得分 46,超过 GLM-5.3、Qwen3.8 Max、Kimi K3 等模型,位列国产模型第一、全球开源模型第一,与 GPT-5.6 Sol 相差 1 分。
![]()
几乎同期发布的 Grok 4.7 在 high 和 xhigh 两档推理强度下,Intelligence Index 同样为 46,与 MiMo-V2.6-Pro 持平;但其 Cost per Intelligence Index Task 分别达到 2.73 美元和 3.74 美元。相比之下,MiMo-V2.6-Pro 的单任务成本约为 0.13 美元,前两者分别约为它的 21 倍和 29 倍。在同样的智能水平下,MiMo V2.6 表现出了显著的效率优势,Grok 4.7 发布即在“智能—成本”维度落后。
当越来越多公司开始沿着同一条“智能—成本”曲线竞争,MiMo V2.6 带来的问题就不只是新模型有没有排到第一。更值得追问的是,这种效率能不能持续,能不能换来更多调用、进入更多真实任务,并最终沉淀为一家模型公司的商业价值。
![]()
从军备竞赛到效率竞赛
当模型真正接入生产环境,最先变得具体的往往是账单。
Scaling Law 过去几年持续奏效。更多数据、算力和训练资源带来更强模型,“大力出奇迹”形成了一套有效的产业逻辑。但与供给侧的军备竞赛同步发生的,是需求侧对成本越来越敏感。
早期大模型主要用来聊天和做 demo,一次请求多花一点 token 并不显眼。当模型真正进入 Coding、Agent、搜索、企业软件之后,调用从偶发行为变成持续运行的基础设施成本。一个用户一天调用十次和一个 Agent 每小时调用几十次模型,经济模型完全不同。
于是需求侧开始关心:在给定预算下,究竟能够购买多少智能;完成相同水平的工作,又能把成本压到多低——“单位智能成本”成为竞争核心。
MiMo 最近几代产品几乎一直沿着这条曲线推进。到 MiMo-V2.5,能力继续提升的同时,API价格又在 5 月进行了一次大幅调整,最高降幅达到 99%。
MiMo V2.6 延续了 V2.5 已经形成的模型分层,并进一步覆盖不同效率区间:
Flash 负责大量高频调用,重点服务 Agent 和 Coding
Pro 承担复杂 Coding、长程 Agent、多模态理解等高价值工作
Ultraspeed 模式用于实时交互和响应敏感的场景,目标输出速度最高达到 1000 TPS。
V2.6 模型同时支持文本、图像、视频和音频全模态输入,能力重点落在 Coding、Agent、Design、Research 和 Cyber 安全研究上。
从最新的 Artificial Analysis 数据看,MiMo-V2.6-Pro 的 Intelligence Index 已经从上一代 MiMo-V2.5-Pro 的 26 分提高到 46 分,提升约 77%。横向来看,这一成绩超过 GLM-5.3、Qwen3.8 Max 和 Kimi K3,成为目前得分最高的国产模型和开源模型。
![]()
同时,V2.6 系列继续沿用 V2.5 的 API 定价。小米披露,MiMo-V2.6-Pro 实测单任务成本为 0.13 美元;在同等智能水平下,价格约为海外模型的 1/20 至 1/60。46 分的智能水平叠加 0.13 美元的单任务成本,让 MiMo-V2.6-Pro 在开源阵营里稳稳占住能力和价格两个维度的优势。
RAIR Lab 创始人、机器学习工程师兼畅销书作者 Sebastian Raschka 在阅读 MiMo V2.6 技术报告后评价称,MiMo V2.6 “simply the best (for now)”——“目前就是最好的模型”,并指出它在开放权重模型 benchmark 的加权平均中位列第一。当有人追问这些“efficiency tweaks”究竟有多大价值时,Raschka 的回答很直接:“它们在训练和推理阶段都能省下数百万美元。”
![]()
![]()
MiMo V2.6 这次的技术重点,集中在 Agentic Reinforcement Learning 的规模化。它把强化学习放到代码库、浏览器、终端、工具调用和多模态环境里,让模型通过多轮尝试、反馈和修正,提升完成真实任务的能力。
MiMo 团队把 V2.6 的强化学习扩展拆成三条线:第一,扩大训练 batch 和吞吐,每一步包含 1568 个 prompt、约 2.5 万条 rollout,单步消耗 27 亿到 37 亿 token,并支持最高 1M 上下文;第二,扩大训练环境,将 Coding、通用工作流、视觉网页生成、Cyber 安全等任务放进同一套 RL 体系;第三,扩大评分器算力,引入 groupwise agentic grading,对同一组解法进行质量比较。
评分机制是 V2.6 的一个关键变化。传统代码 RL 常用测试是否通过来给奖励,但真实软件开发还会看改动是否克制、逻辑是否清楚、是否符合代码库习惯、有没有引入副作用。MiMo V2.6 用 GRS 和 GAR 两类方法,把实现质量、行为质量和 reward hacking 检测纳入训练信号,让模型在通过测试之外,也学习更接近工程实践的解法。
为了支撑这种训练,MiMo V2.6 还建设了一整套工程系统,包括冻结 MoE router 稳定专家负载、多 harness rollout 池、统一 trajectory 表示、控制面和数据面解耦、训练/推理一致性,以及训练前后的 reward hacking 检测。这些底层机制共同服务于一件事:让模型可以在更复杂、更长程、更接近真实工作的任务里持续优化。
这也让 V2.6 的效率叙事有了更具体的技术来源。单位智能成本的下降,来自模型架构、训练环境、评分机制和推理系统的共同优化,而不只是一次价格调整。
9 月中旬,MiMo 团队直接把其中一部分过程放到了网上:实时看板展示训练 step、token 消耗、累计成本和能力指标。Jina AI 的创始人 Han Xiao 转发这张训练看板时开玩笑说:“只是别让 CFO 看到这个。”但从模型公司的经营视角看,这张表恰恰是 CFO 应该看到的东西。
![]()
这些数字把“效率”从一个抽象的技术概念,变成了一张更接近投入产出表的东西:模型公司烧进去多少钱,最终换来了多少能力增长。
对 MiMo 来说,这也是“效率”从技术概念进入资本的第一步。模型训练更省钱只是起点;如果这部分优势无法转成开发者采用量,低成本本身并不会形成商业价值。MiMo-V2.5 发布两个月后,在 OpenRouter 上的调用量增长约 616%。这至少给出了一个阶段性反馈,即更有竞争力的“智能—成本”组合,已经推动真实 workload 向 MiMo 迁移。小米也正在尝试证明:效率改善能够转化成使用规模。
![]()
聪明只是起点,完成任务才产生价值
模型行业过去习惯用 token 算钱。API 会分别给输入、输出、缓存等环节定价,因此每百万 token 的价格很容易被横向比较,也成了开发者最熟悉的一组数字。
但当模型进入真实生产环境后,token 用量并不天然对应商业价值。一个程序员在意的是代码最终能不能运行,研究团队在意的是报告有没有完成,销售团队在意的是客户线索有没有完成筛选、分析和触达。因此,真正与商业结果靠得更近的指标,是成功完成一项任务需要付出的总成本。
有意思的是,MiMo 最新的 Token Plan 除了给出 Credits,也直接告诉用户一个套餐大约能够完成多少项中高复杂任务:Pro 套餐的 700M Credits 对应约 1400 个中高复杂任务,Max 的 1600M Credits 对应约 3200 个。
这种评价方式也已经开始进入模型 benchmark。Artificial Analysis 的部分图表直接将智能指数和 Cost per Task 放在一起比较;Google 在评估 Gemini 3.8 Flash Cyber 时,也会把任务成功率与 Cost per Rollout 放到同一张坐标图里。
![]()
![]()
![]()
一项工作从模型给出一次正确回答,到最终被软件系统稳定交付,中间往往还有很长的一段路。Research Agent 需要理解目标、规划步骤、检索网页、筛选来源、调用工具、管理上下文、验证事实,再把结果整理成可交付内容;Coding Agent 还要理解代码库、调用终端、运行测试、处理报错,发现问题以后重新修改。
于是,benchmark 上多刷几分所带来的价值,必须放进整个任务系统里重新计算。响应速度、工具调用稳定性、重试次数,以及最终到底有没有把任务做完,都会进入同一个账本。
如果把这组关系压缩成一个粗略的表达式,可以写成:模型价值 ≈ 任务成功率 × 速度与稳定性 ÷ 完成任务的总成本。
这套算法对 Agent 尤其重要。一次聊天可能只调用几轮模型,一项长程 Agent 任务却可能系统性持续几十轮、几百轮。单次推理里看似不大的价格差,放到完整任务里会被成倍放大。假设一项工作创造 10 元价值,而每次执行需要 20 元推理成本,产品很难形成健康的商业模式;当成本降到 5 元,自动化开始有经济意义;继续降到 1 元,此前不会交给 AI 的低价值、高频工作也会进入自动化范围。
智能越来越便宜,会同时扩大存量和增量市场。已经采用 AI 的企业可以用同样预算处理更多工作,此前算不过经济账的任务也开始进入 AI 能力覆盖区。所以单次调用价格下降时,调用次数、任务数量和一项任务内部消耗的智能量仍可能增长得更快。
底层模型之上,小米的产品目标越来越接近“把一件工作做完”。MiMo Code 用 Agent harness 串起设计、规划、编码、测试和 review;MiMo Claw 进入办公与多任务执行;MiMo Desktop 覆盖文档、网页、图片等复杂素材,并通过 Smart 模式按任务复杂度、交付要求和执行成本自动选择模型与路径。
在 CUA 任务实测中,MiMo Desktop 完整生成了 Excel、PPT 和 PDF,核心计算准确,PPT 页数和内容结构符合要求,PDF 视觉检查也没有明显排版事故。尤其是它正确算出了“同比增长率最高地区”为华东,而不是照搬错误参考答案,有实事求是的计算能力。总体看,它已经跑通了一个完整办公任务闭环,属于可用性很强的一次 CUA 结果。
![]()
![]()
![]()
![]()
更复杂的股票估值任务进一步拉高了办公 CUA 任务的难度。在另一个实测任务中,Agent 需要基于给定财务数据生成 Excel 财务模型、PowerPoint 投资备忘录和 PDF 导出文件。最终结果全部跑通:Excel 中包含 2021-2030 年财务预测、DCF 估值、敏感性分析和检查区;PPT 按 6 页投资备忘录结构呈现,PDF 也完整导出,排版清晰。独立复核显示,基准情形下每股内在价值约为 104.35 元,对应“低估”结论,与模型结果一致。从任务链条看,已经覆盖了财务建模、汇报材料制作和 PDF 交付,说明 MiMo Desktop 已能够完整支持多软件协同办公的完整工作流。
![]()
![]()
![]()
![]()
如果把任务从办公软件切到更开放的交互环境,类似趋势也能看到。
在 3D 复刻游乐园案例中,模型用 Three.js 生成了一个可浏览的夜间游乐园场景:城堡主体、摩天轮、旋转木马、水面、灯光秀和烟花系统都具备清晰视觉识别度,并提供全景、城堡仰视、摩天轮、旋转木马等多视角切换。这个案例验证的是模型对复杂地标、动态装置、夜景氛围和镜头组织的综合生成能力。它的交互更偏观赏和展示,任务目标、角色行动和状态反馈相对有限,但作为 3D 场景生成样本,已经具备非常强的完成度。
这两个样本把评估从单次回答带向可运行、可交互、可检查的任务交付。办公任务测的是数据理解、GUI 操作和结果核对;3D 复刻游乐园测的是空间建模、视觉还原、动态效果、镜头组织和前端实现。它们共同把“智能×成本”从抽象指标,拉回到用户能够直接体验的结果里。
![]()
谁离最终结果更近,谁可能拿走更多价值
当模型的竞争单位延伸到一项完整工作,“智能—成本”前沿影响的就不再只有 API 市场。它会继续向 Agent、workflow 和最终应用传导,重新决定一项任务产生的收入应该由谁拿走。
MiMo 恰好是一个比较完整的观察样本。
最底层是模型,“斩杀线”的含义很直接。MiMo-V2.5 已经通过价格和调用规模证明,效率足够突出时,开发者会迁移 workload。相同成本下能力更弱、相同能力下价格更贵的模型,会逐渐失去调用。
到了 Agent 层,价值分配开始变复杂。基础模型足够便宜以后,完成任务的成本还会被 harness、工具调用、memory、context management 和失败重试继续放大。MiMo Code、MiMo Claw 和 MiMo Desktop 所做的事情,本质上都是把模型能力继续向任务结果推进,并尽可能把这些额外成本压下来。
比如 MiMo Desktop 的 Smart 模式会主动考虑执行成本来选择路径。对用户而言,它最终交付的是 PPT、网页、文档或其他工作成果;至于背后调用了哪一个模型、调用多少次,正在逐渐退到产品内部。
价值也会沿着这个方向继续移动。
基础模型仍然可以通过规模化调用获得收入;Agent 平台通过编排、工具和执行环境获得一部分价值;真正掌握企业数据、客户关系和 workflow 的产品,则离付费结果更近。这里所发生的并不是把钱从模型层简单搬到应用层的过程,各层能够拿走多少,取决于谁能提高任务成功率、降低完成任务的总成本,并控制最终的交付入口。
对小米来说,这一点尤其重要。它同时拥有模型和下游场景。MiMo V2.6 能够提供“智能—成本”前沿的底层智能,MiMo Code、MiMo Claw、MiMo Desktop 可以在软件层继续吸收这些能力;再下层还有手机、汽车和家庭设备。模型效率因此有机会在小米内部沿着更长的价值链传递。
这也让“斩杀线 = 价值分配线”有了更具体的含义。MiMo 站在新的“智能—成本”前沿上,首先吸引的是模型调用;当这些调用继续进入 Agent 和工作流,价值又可能进一步留在软件和产品体系里。当然最终能够留下多少,则要看这些产品能不能持续完成真实任务,并形成付费。
![]()
大模型公司的新价值锚
模型公司进入商业化深水区以后,单看模型在 benchmark 榜单上的成绩已经很难解释公司的全部价值。它只能解释一个时间点的技术位置。更值得长期跟踪的,是多条价值曲线能不能同时向好的方向移动。
第一条是单位智能成本。
MiMo 从 V2 到 V2.5,再到 V2.6,已经连续把“效率”放在产品核心。到了 V2.6,最直接的一组数字就是 Intelligence Index 46 分,以及 0.13 美元的单任务成本。
对投资人来说,真正有复利的是单位智能成本下降的斜率。一代模型偶然卖得便宜,很容易被竞争对手复制;如果模型架构、训练和推理工程能够让每一代产品都用更少的钱获得更多智能,这家公司就在持续扩大可以商业化的任务边界。
第二条是需求曲线。
MiMo-V2.5 发布两个月后,OpenRouter 调用量增长约 616%。这组数据证明效率变化已经能够影响开发者选型,但新的“智能—成本”前沿能不能再一次换来调用增长,并且把一次性的尝鲜变成长期 workload,仍然是不小的挑战。因此模型发布后的 token volume、开发者留存、API 使用频率,会比单纯榜单名次更接近商业价值。
第三条曲线落在任务。
MiMo Code、MiMo Claw 和 MiMo Desktop 已经让小米有了把底层调用转化成真实工作的产品载体。Token Plan 甚至开始直接用“约可完成多少中高复杂任务”来解释套餐价值。随着模型能力继续提高,真正值得观察的是每一美元模型成本能支撑多少 Coding、Research、办公和 Agent 任务,以及这些任务有没有稳定进入用户的日常 workflow。只有当 token volume 不断沉淀成 task volume,模型公司的收入才会从“卖算力和智能”逐渐接近“卖生产力”。
最后一条是资本效率。
投入端,小米公开训练看板让外界第一次可以比较一笔训练成本究竟带来了多少能力提升;产出端,小米又拥有一整套现成的产品和终端去消费这份智能。MiMo Code、MiMo Claw 和 MiMo Desktop 已经形成软件端入口,手机、汽车和家庭设备则提供更大的潜在承载空间。
今年 6 月推出的 Miloco 2.0,就是这种复用逻辑的一个例子。底层模型能力进入全屋智能以后,一笔基础模型研发投入不必只依赖 API 收入回收,还可以成为已有硬件和服务的智能层。一个底层能力如果能同时进入开发工具、桌面工作流、手机、汽车和家庭,同样一笔研发费用就会被更多任务和更多设备共同摊薄。
这也是 MiMo 作为“智能基座”的商业想象力所在:一边持续降低生产智能的成本,一边扩大同一份智能的消费场景。模型本身成为一层共用基础设施后,衡量它的方式也必须覆盖这些外溢价值。
![]()
最强定义上限,效率决定规模
最前沿模型的更新,未来依然会占据最多的注意力。它们会继续刷新数学、科学、代码和复杂推理的能力边界,告诉整个行业“机器今天最多能做到什么”。但商业世界更频繁面对的,是写代码、查资料、分析数据、处理文档、完成客服、操作软件和驱动设备。这些任务对智能有要求,也对价格极其敏感。
真正形成大规模调用和持续收入的模型,往往要同时跨过两条线:能力足够完成工作,成本又低到可以被高频消费。
MiMo V2.6 已经把“智能—成本”前沿向外推了一步。下一步,是延续 V2.5 已经出现的调用增长,再通过 MiMo Code、MiMo Claw、MiMo Desktop 和小米终端生态把这些智能送进真实任务,那么“效率”就会从一个模型指标,逐渐变成商业杠杆。
最强模型继续定义智能的天花板,而决定 AI 能以多快速度进入商业世界的,越来越可能是另一条曲线:同样的钱,可以购买多少智能;这些智能,又能完成多少工作。
“斩杀线”的商业意义也正在这条路径上逐渐清晰。它改变开发者选择什么模型,token 流向哪些平台,哪些 Agent 能够真正跑进生产环境,并最终重新划分 AI 产业链最核心的一件事——收益最终留在谁手里。
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.