网易首页 > 网易号 > 正文 申请入驻

IMO 42分满分刷屏后,小红书开源同系列模型!

0
分享至

智猩猩AI整理

编辑:金水

如果上个月你被"AI 首次在 IMO 国际数学奥林匹克拿下官方认证 42/42 满分"刷过屏,那背后那个模型到底怎么做到的,可能直到最近才有人讲清楚。

8 月 17 日,研究者 @GenAI_is_real(Chayenne Zhao)在 X 上发了一篇长文《dots3-note Preview: What Does an LLM Contestant Do to Take On the IMO?》。


从 Proof-Verify-Refine 循环、TEMPO 训练方法、自我评价机制一路拆到超长程 Agent 的推理挑战,把模型设计、强化学习和系统工程串成了一条完整线索。

紧接着,小红书 dots studio 官方账号转发了这篇文章。

并回应:"长期推理不仅是一个模型问题,也是一个强化学习和系统问题。这正是我们希望在 dots3-note 预览版正式发布时能够引发的那种技术讨论。感谢您细致的解析!"

而这份讨论的主角,就是小红书旗下的 AI 实验室 dots.studio 在 Apache 2.0 许可下开源的dots3-note preview。

dots3 系列中第一个开放权重的版本,也是该系列目前最轻量的一员。

权重已同步上线 Hugging Face 与 ModelScope,社区追问了一个月,终于等来了它。

小红书做基础模型并不算新事。

此前 dots.llm1、dots.tts、FireRed 等一批项目都曾开源。

但这一次,公开资料指向的方向与过去不太一致,官方给出的定位,是「迈向真实世界长时程智能体的一个步骤」。


01

这次开源是

一个什么样的模型

dots3-note preview 是一个混合专家(MoE)模型,总参数 280B,每次推理只激活 16B。

原生上下文512K token、同时理解文本·视觉·语音三种模态,并且专门针对复杂推理和长程 Agent 任务做了优化。

视觉用 MoE ViT(7B/1.2B),音频用 800M 稠密编码器,多模态独立建模后由语言主干统一输出。

它是 dots3 系列的成员,而完整系列将由 note / jazz / aria三档组成,分别覆盖不同的任务复杂度、响应速度和计算成本。

note 是其中最轻量的一档。

换句话说,它走的是"把模型做精,而不是做大"的路线。

光看参数你可能没感觉,但官方给了一组横向对比:

在多项任务上,dots3-note 可以比肩甚至超过参数规模数倍于自身的大尺寸模型。

比如它面对的是 GLM 5.2(743B/39B)、Kimi K3(2.8T/104B)这一量级对手,激活参数却只有它们的零头。

评测覆盖的维度包括个人助理 Agent、编程与计算机使用、信息获取、复杂推理,以及多模态感知。

所以更准确的说法是,它不是一个又一个"答题机器",而是一个面向"长程 Agent + 真实生活"的模型。

它的野心,是从封闭、可验证的单道题,走向开放、模糊、可能拖上几天几周的真实生活任务。

02

从「答题」,转向「长时程干活」

为什么这件事难?

因为过去的范式是"答题":一道题、一个答案、对错分明。

可真实世界里的任务更像"干活"。

跨好几天、需求会变、环境在动,而且常常没有标准答案。

把模型从答题者训练成能长时程干活的 Agent,正是 dots3-note 想要解决的核心命题。

难点卡在训练上,长程任务一次探索要十几小时,传统 RL 等整条轨迹结束才给奖励,慢且难归因;

PPO 的 critic 用固定算力估计价值,不如 actor 会推理反思,复杂任务上估计不准。

dots studio 给出的解法是TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

思路很巧妙,把一条很长的轨迹切成多个 macro-step,每个阶段包含多轮模型与环境的互动;

当一个阶段结束,让同一个 Agent 从"执行者"切换成"评价者",通过推理和工具调用来估算"当前这个状态,未来还能拿多少回报",并在轨迹结束之前就把这个评价变成训练信号。

训练过程中,模型既学"怎么行动",也学"怎么评价自己"。

效果很直接,在 ARC-AGI-3 上,TEMPO 的平均得分比基础版本高 31.5%,比 GRPO 高20.6%,而且越到任务深水区,领先越明显。


在这个基础上,团队还强调递归自我评价(recursive self-critiquing)。

让模型在缺少外部奖励信号时,也能自己判断进展到了哪一步。

这被认为是从"可验证的长程任务"走向"模糊的真实生活任务"的关键,也是他们下一步的重点方向。

另一块是陌生环境在线学习,用数千个不依赖先验知识的新颖超长程环境,训练模型在测试时从探索中学习、更新记忆。

当任务长度明显超过上下文窗口,模型会逐渐学会主动生成对后续决策有用的记忆。

一句话总结这套方法论,评价比生成更简单,让模型学会给自己打分,长程强化学习才真正跑得动。

下文那个"放置骑士"的实测,会让你直观看到 critic 是怎么工作的。

03

实测表现如何

官方公布了一份自测成绩表,对比对象包括 Claude Opus 4.8、GPT-5.5、Kimi K3、GLM 5.2 与 DeepSeek V4 等模型。

结果呈现明显的分化。

在抽象推理与逻辑类任务上,dots3-note 表现突出。



上图是官方自测成绩,来源 dots.studio 官方 Hugging Face 模型页公开配图 。

ARC-AGI-2 得分为 81.39,高于 Claude Opus 4.8 的 72.1;在难度更高的 ARC-AGI-3 上得 6.9,Claude 为 1.5,GPT-5.5 为 0.4。IFBench 上得 80.4,高于 Claude 的 62.2。

然而在更接近真实工程的智能体编码任务上,它明显落后于第一梯队。

Terminal-Bench 2.1 上得 75.1,低于 Kimi K3 的 88.3 与 GLM 5.2 的 81;SWE-bench Pro 上 61,低于 Claude 的 69.2;Toolathlon 上 55.6,而 Kimi 为 76.5。

这一短板并未被否认。



上图是另一组官方自测成绩(多模态维度),来源 dots.studio 官方模型页公开配图 。

SemiAnalysis 的图表中,其 Terminal-Bench 得分仍高出图表中最优的美国开源模型 4.9 分,但与头部闭源模型的差距依然存在。

04

实测案例大赏

数学、代码这些目标清晰、结果可验证的场景,Agent 已经跑得很顺。

但 dots3-note 挑了一块难啃的骨头,真实生活里那些没有标准答案、需求还会变、能拖几小时甚至几天的任务。

它接过户型图和两款冰箱参数,算出墙面剩余空间后还主动提醒"到现场复尺确认";

它参考 9 张界面图,自主选定 SwiftUI + RealityKit 方案,端到端写出 12 个 Swift 文件、1876 行代码,自建 Xcode 工程编译出 BUILD SUCCEEDED;

它没专门练过《杀戮尖塔 2》,却从战斗反馈里学机制、一路权衡玩到 33 层;

在 ARC-AGI-3 里它用 Self-Critiquing 把修正后的规则写进"记事本",320 步解完全部 6 关。

在婚礼筹备、咖啡电商、全周期旅游这类模拟生活任务里,它跨阶段维护状态,并在机型、天气、航班变化后持续更新行程。


而在"放置骑士"这样的隐藏约束游戏里,critic 对两条轨迹给出明显不同的价值估计,正好呼应上节说的"评价比生成更简单"。

这些任务的共同点是:信息散在图里文里,用户自己都未必一次想清楚要什么,模型得边探索、边记新信息、边自我纠错,才能交付结果。

同一套能力,最终在 IMO 2026 上拿下官方认证 42/42 满分,分支版本递归生成证明,并用工具调用反复自我评估增强。

05

使用教程

模型已按 Apache 2.0协议开源,同时放出 BF16 与 FP8 两个权重版本,发布在 Hugging Face 与 ModelScope,模型结构也已提交至 Transformers,可直接加载。

pip install accelerate pillow torchcodec kernels==0.16.0 "transformers @ git+https://github.com/huggingface/transformers.git@refs/pull/47844/head"

想快速上手,最省事的是申请官方 API,入口在 dots studio 技术博客里,填表即可排队。

运行最小化本地推理示例:

print(processor.decode(outputs[0, inputs.input_ids.shape[1] :], skip_special_tokens=True))

如果打算自己部署,官方建议用 SGLang 或 vLLM,在单个 8 卡节点上跑 FP8 权重即可;

BF16 更吃显存,需按可用显存、并发和输入模态调整上下文长度。

更完整的部署参数(Transformers / SGLang / vLLM 三套方案)可参考官方 README。

06

总结

综合来看,本次开源的真正价值,不在于单项跑分的高低,也不在于参数规模的大小,而在于它首次将长时程智能体、多模态与完全开源三者结合在同一次发布中。

一家以内容社区为主业的公司,愿意将仍处探索阶段的成果以 Apache 2.0 许可整体公开,这一姿态本身构成了一个有讨论价值的信号。

长时程智能体能否最终跑通,目前尚无定论。

但方向的选择与开源的意愿,二者是相互独立的议题。

回看过往 dot 系列的开源记录,这一次发布延续了其一贯的开放策略。

至于这一步由谁先走、又如何走完,需要交由后续的独立复现与持续评测来回答。

关注+星标,获取AI前沿进展与优质开源项目

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
最新:乌克兰完全清除利曼的俄军突出部!再收复5块区域

最新:乌克兰完全清除利曼的俄军突出部!再收复5块区域

项鹏飞
2026-09-08 19:46:09
17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

17个月后欧盟大门或关闭,996就是强迫劳动,9成中小企业却还没醒

浯江孤舟
2026-08-10 10:00:15
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

阿握聊事
2026-09-09 12:29:01
这个民族被称为不生病的民族,以杏子为主食,平均寿命125岁

这个民族被称为不生病的民族,以杏子为主食,平均寿命125岁

小豫讲故事
2026-09-07 06:00:24
王震用拐杖指着参加许世友葬礼的众将叹气:你们千万不能学他

王震用拐杖指着参加许世友葬礼的众将叹气:你们千万不能学他

纪史行者
2026-09-09 06:00:11
70岁后不要做的6大体检,不仅没用还伤身,为您揭秘!

70岁后不要做的6大体检,不仅没用还伤身,为您揭秘!

鬼菜生活
2026-09-04 05:17:54
苹果首款折叠屏iPhone命名"iPhone Duo",售价1999美元,10月上市

苹果首款折叠屏iPhone命名"iPhone Duo",售价1999美元,10月上市

龙剑秀南
2026-09-09 14:21:11
紧急送医才几天,38岁赵丽颖传来“喜讯”,原来冯绍峰真没说错

紧急送医才几天,38岁赵丽颖传来“喜讯”,原来冯绍峰真没说错

乡野小珥
2026-09-09 08:20:59
复盘曼城2-0波尔图:恩佐高级货属性尽显,蓝月中场重塑很成功

复盘曼城2-0波尔图:恩佐高级货属性尽显,蓝月中场重塑很成功

里芃芃体育
2026-09-09 11:40:13
梅根回怼国王不留情面,这次彻底撕破脸了

梅根回怼国王不留情面,这次彻底撕破脸了

红袖说事
2026-09-09 02:17:56
站回“光”里!1100亿CPO龙头秒涨停

站回“光”里!1100亿CPO龙头秒涨停

格隆汇
2026-09-09 11:50:34
快看!肯辛顿宫发布乔治伊顿公学官方肖像照

快看!肯辛顿宫发布乔治伊顿公学官方肖像照

智慧生活笔记
2026-09-09 08:05:36
与辛柏青再婚真相大白后,吴越传来好消息,连陈建斌也难以反驳

与辛柏青再婚真相大白后,吴越传来好消息,连陈建斌也难以反驳

阿讯说天下
2026-09-09 11:43:20
苏麻喇姑墓:地上建筑早已不复存在,如今地面仅剩一座宝顶,成为唯一遗迹

苏麻喇姑墓:地上建筑早已不复存在,如今地面仅剩一座宝顶,成为唯一遗迹

凉州辞
2026-09-07 06:45:03
以色列国防科技走向全球:小巧精确的“口袋杀手”迎来了量产时代

以色列国防科技走向全球:小巧精确的“口袋杀手”迎来了量产时代

Nee看
2026-09-08 16:27:24
人民日报这段话刷屏:请告诉你的孩子,人生这条路上,不会有人一直催着你、管着你、叫你起床、看你写作业……

人民日报这段话刷屏:请告诉你的孩子,人生这条路上,不会有人一直催着你、管着你、叫你起床、看你写作业……

阿呆爸
2026-09-08 22:24:52
2026款五羊 S150上市 售价0.598万元起

2026款五羊 S150上市 售价0.598万元起

车质网
2026-09-07 13:50:08
DeepSeek 大幅降价

DeepSeek 大幅降价

赛博禅心
2026-09-09 00:37:06
5999元,华为刚推出的6.3英寸小阔屏,估计又要卖爆了

5999元,华为刚推出的6.3英寸小阔屏,估计又要卖爆了

刘奔跑
2026-09-07 20:49:29
长沙“摸臀案”变罗生门!4岁男孩碰了女生屁股,3次调解未果,双方要对簿公堂,网友调侃:坚决判决4岁男人猥亵

长沙“摸臀案”变罗生门!4岁男孩碰了女生屁股,3次调解未果,双方要对簿公堂,网友调侃:坚决判决4岁男人猥亵

火山詩话
2026-09-08 11:37:49
2026-09-09 15:20:49
智猩猩
智猩猩
AI 技术内容与服务平台
83文章数 3关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

头条要闻

反制美国 加拿大总理发表全国动员应战讲话

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

房产
手机
亲子
教育
公开课

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

手机要闻

澎湃 OS4.0 更新进度曝光!分批推送,你的手机什么时候能升级?

亲子要闻

爸爸说女儿长得像他,谁知4岁女儿却不乐意了,非说不像爸爸

教育要闻

2026年成都少儿英语启蒙机构对比评测:兼顾兴趣培养与打基础

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版