记者丨雷晨
编辑丨陶力 骆一帆
9月22日,小米发布并开源新一代MiMo大模型,包括全模态旗舰模型MiMo-V2.6-Pro和高效推理模型MiMo-V2.6-Flash,同时上线Pro版本的超高速模式V2.6-Pro-UltraSpeed和MiMo Desktop桌面客户端正式版,后者同步推出会员订阅方案。
第三方测评平台Artificial Analysis综合智能指数显示,MiMo-V2.6-Pro得分为46分,在当前开源权重模型中排名第一,超过了Kimi K3的44分和GLM-5.3的45分,也高于上一代MiMo-V2.5-Pro的26分。该榜单上,GPT-6 Astra和Claude Fable 5.1均为53分。
![]()
第三方测评平台Artificial Analysis综合智能指数显示,MiMo-V2.6-Pro得分为46分,在当前开源权重模型中排名第一
同一平台的智能指数单任务成本榜单显示,MiMo-V2.6-Pro单任务成本为0.13美元。小米方面称,同等智能水平下,该模型价格仅为海外模型的二十分之一至六十分之一,API定价沿用V2.5系列。
这次发布五日前,训练过程已经提前公开。9月17日凌晨,小米MiMo大模型团队负责人罗福莉在X平台发文,披露MiMo-V2.6正处于强化学习中间阶段,并上线实时训练页面,公开进度、Token消耗与成本数据。在国内大模型厂商中,将后训练环节以实时页面公开,此前尚无先例。
强化学习训练首度直播,小米六天花了347万美元
据小米方面披露,本轮强化学习的后训练耗时不到六天,Pro版本训练成本约262万美元,Flash版本约85万美元,各完成30步,累计约75万条轨迹。罗福莉在发文中称,这六天背后,是长达半年的基础研究积累和工程试错。训练中途,公开页面显示的数据是另一个量级。9月17日下午,两个版本累计成本已超过135万美元,每小时成本约3.1万美元。
成本曲线之外,页面同时披露了训练配置。罗福莉介绍,本次训练从三个方面扩展规模:算力上,采用大Batch与全异步架构,单次更新使用1568个样本,支持百万级上下文长度训练,单步训练Token达2.7B至3.7B;环境与工具上,构建覆盖代码、通用、视觉、安全等方向的多任务训练体系,并混合多个Harness框架运行;评估计算上,通过组内相对比较,为长程任务提供更精准、多样的奖励信号。
![]()
罗福莉发文截图
![]()
图为小米MiMo大模型团队负责人罗福莉(资料图)
结果显示,训练任务平均通过率分别相对提升25%和12%。在样本外的长程软件工程评测基准DeepSWE v1.1中,Flash版本得分由48.8升至65.68,Pro版本由58.4升至72.57。罗福莉称,MiMo-V2.6可能是目前国产开源模型中投入算力最多的模型之一。
投行测算提供了另一个观察角度。高盛研报称,按avg@3口径,两个版本在DeepSWE基准最高取得67.86分和72.57分,Flash版本提升超过19分,Pro版本提升超过14分。成本折算上,Flash每百万Token约10美元,Pro约35美元,同等支出下Flash的分数增幅更高。该行估计,两个版本的训练分别基于约4000个和8000个H200等效GPU集群。直播过程中出现的中途干预包括基建错误重跑、不良模式数据集、零梯度任务与GPU显存不足。高盛认为,这意味着强化学习的瓶颈已经转向工程优化。
罗福莉在发文中将问题归结为“强化学习究竟能扩展到多远”。她表示,强化学习是模型自我提升路径中可扩展性较强的方向之一。小米将本次发布定义为探索RSI(递归自我改进)路径的关键一步。
开源是本次动作的另一面。除Pro与Flash模型权重及技术报告外,小米同步开放了蒸馏版本MiMo-V2.6-Distill-Qwen-9B及配套强化学习代码,包括7000余个高质量任务环境、端到端训练框架与轻量化Harness。小米方面表示,开放这些资源意在帮助研究者复现和验证相关结果。以该蒸馏模型为起点开展训练,SWE-bench Verified得分由61.1升至66.2,Terminal Bench 2.1得分由37.1升至52.8。
46分登顶开源榜,距全球最强模型仍有差距
46分之外,榜单给出了更完整的坐标。综合智能指数总榜上,排在MiMo-V2.6-Pro之前的是GPT-6 Astra、Claude Opus 5、Fable 5.1和Muse Spark 1.3四款闭源模型,小米是前五名中唯一的开源权重模型。
按小米方面的说法,在多数智能体评测中V2.6-Pro已比肩Claude Opus 5和GPT-5.6 Sol,在综合智能指数上与榜首仍有7分差距。
价格方面,单任务成本指标与榜单捆绑出现,指向的是大模型竞争的旧命题:同等智能水平下的成本下探。本次发布口径聚焦“价格不变、能力跃升”。上一代V2.5系列于今年4月以MIT协议开源,更早的V2系列随后于6月30日全面下线,开发者已完成迁移。不到半年再发新一代,小米模型迭代节奏仍在加快。
参数规模并非本次发布与前代的显著差异。小米方面称,MiMo-V2.6的预训练架构和参数规模与上一代保持一致,能力提升主要来自后训练环节。这一表述与五天前的直播相互印证:研发重心压在强化学习扩展上,而非继续堆叠参数。
产品侧,新模型被接入更多入口。MiMo Desktop桌面客户端正式版同步上线,订阅会员可使用Pro与Flash模型;UltraSpeed超高速模式宣称提供最高20倍输出速度。小米此前发起的邀测活动将在一周后结束,获邀用户切换模型名称后方可继续使用。
据小米方面介绍,MiMo-V2.6-Pro在提示与交互下参与金属有机框架材料筛选,用于吸附全氟和多氟烷基物质,将约一个月的研发周期压缩至两到三天;在Lean 4中协助完成Li-Yorke定理“周期三蕴含混沌”主定理的形式化,形成6000余行源码并通过内核核验。北京大学材料科学与工程学院特聘研究员窦锦虎评价,模型在该任务中展现的研究能力达到训练有素的博士研究人员水平。
高盛在研报中维持小米集团-W“买入”评级,12个月目标价39港元。该行预计,V2.6系列将巩固小米在代理编码与多模态整合上的定位,并提供更高的API定价潜力,同时可能与DeepSeek一道,继续为市场定价结构带来扰动。该行还预计,采用HySparse新架构的MiMo-V3可能在2027年初发布,稀疏比率由V2和V2.5系列的7:1提升至11:1,进一步推高效率前沿并压低推理成本。
对小米而言,MiMo的商业化账目已有雏形。据小米2026年二季度财报,智能电动汽车及AI等创新业务分部中,其他相关业务收入10亿元,同比增长56.50%,财报明确提及,该增长部分得益于MiMo大模型系列相关AI业务收入增加。
出品丨21财经客户端21世纪经济报道
编辑丨金珊
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.