网易首页 > 网易号 > 正文 申请入驻

IMO 42分满分刷屏后,小红书开源同系列模型!

0
分享至

智猩猩AI整理

编辑:金水

如果上个月你被"AI 首次在 IMO 国际数学奥林匹克拿下官方认证 42/42 满分"刷过屏,那背后那个模型到底怎么做到的,可能直到最近才有人讲清楚。

8 月 17 日,研究者 @GenAI_is_real(Chayenne Zhao)在 X 上发了一篇长文《dots3-note Preview: What Does an LLM Contestant Do to Take On the IMO?》。


从 Proof-Verify-Refine 循环、TEMPO 训练方法、自我评价机制一路拆到超长程 Agent 的推理挑战,把模型设计、强化学习和系统工程串成了一条完整线索。

紧接着,小红书 dots studio 官方账号转发了这篇文章。

并回应:"长期推理不仅是一个模型问题,也是一个强化学习和系统问题。这正是我们希望在 dots3-note 预览版正式发布时能够引发的那种技术讨论。感谢您细致的解析!"

而这份讨论的主角,就是小红书旗下的 AI 实验室 dots.studio 在 Apache 2.0 许可下开源的dots3-note preview。

dots3 系列中第一个开放权重的版本,也是该系列目前最轻量的一员。

权重已同步上线 Hugging Face 与 ModelScope,社区追问了一个月,终于等来了它。

小红书做基础模型并不算新事。

此前 dots.llm1、dots.tts、FireRed 等一批项目都曾开源。

但这一次,公开资料指向的方向与过去不太一致,官方给出的定位,是「迈向真实世界长时程智能体的一个步骤」。


01

这次开源是

一个什么样的模型

dots3-note preview 是一个混合专家(MoE)模型,总参数 280B,每次推理只激活 16B。

原生上下文512K token、同时理解文本·视觉·语音三种模态,并且专门针对复杂推理和长程 Agent 任务做了优化。

视觉用 MoE ViT(7B/1.2B),音频用 800M 稠密编码器,多模态独立建模后由语言主干统一输出。

它是 dots3 系列的成员,而完整系列将由 note / jazz / aria三档组成,分别覆盖不同的任务复杂度、响应速度和计算成本。

note 是其中最轻量的一档。

换句话说,它走的是"把模型做精,而不是做大"的路线。

光看参数你可能没感觉,但官方给了一组横向对比:

在多项任务上,dots3-note 可以比肩甚至超过参数规模数倍于自身的大尺寸模型。

比如它面对的是 GLM 5.2(743B/39B)、Kimi K3(2.8T/104B)这一量级对手,激活参数却只有它们的零头。

评测覆盖的维度包括个人助理 Agent、编程与计算机使用、信息获取、复杂推理,以及多模态感知。

所以更准确的说法是,它不是一个又一个"答题机器",而是一个面向"长程 Agent + 真实生活"的模型。

它的野心,是从封闭、可验证的单道题,走向开放、模糊、可能拖上几天几周的真实生活任务。

02

从「答题」,转向「长时程干活」

为什么这件事难?

因为过去的范式是"答题":一道题、一个答案、对错分明。

可真实世界里的任务更像"干活"。

跨好几天、需求会变、环境在动,而且常常没有标准答案。

把模型从答题者训练成能长时程干活的 Agent,正是 dots3-note 想要解决的核心命题。

难点卡在训练上,长程任务一次探索要十几小时,传统 RL 等整条轨迹结束才给奖励,慢且难归因;

PPO 的 critic 用固定算力估计价值,不如 actor 会推理反思,复杂任务上估计不准。

dots studio 给出的解法是TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。

思路很巧妙,把一条很长的轨迹切成多个 macro-step,每个阶段包含多轮模型与环境的互动;

当一个阶段结束,让同一个 Agent 从"执行者"切换成"评价者",通过推理和工具调用来估算"当前这个状态,未来还能拿多少回报",并在轨迹结束之前就把这个评价变成训练信号。

训练过程中,模型既学"怎么行动",也学"怎么评价自己"。

效果很直接,在 ARC-AGI-3 上,TEMPO 的平均得分比基础版本高 31.5%,比 GRPO 高20.6%,而且越到任务深水区,领先越明显。


在这个基础上,团队还强调递归自我评价(recursive self-critiquing)。

让模型在缺少外部奖励信号时,也能自己判断进展到了哪一步。

这被认为是从"可验证的长程任务"走向"模糊的真实生活任务"的关键,也是他们下一步的重点方向。

另一块是陌生环境在线学习,用数千个不依赖先验知识的新颖超长程环境,训练模型在测试时从探索中学习、更新记忆。

当任务长度明显超过上下文窗口,模型会逐渐学会主动生成对后续决策有用的记忆。

一句话总结这套方法论,评价比生成更简单,让模型学会给自己打分,长程强化学习才真正跑得动。

下文那个"放置骑士"的实测,会让你直观看到 critic 是怎么工作的。

03

实测表现如何

官方公布了一份自测成绩表,对比对象包括 Claude Opus 4.8、GPT-5.5、Kimi K3、GLM 5.2 与 DeepSeek V4 等模型。

结果呈现明显的分化。

在抽象推理与逻辑类任务上,dots3-note 表现突出。



上图是官方自测成绩,来源 dots.studio 官方 Hugging Face 模型页公开配图 。

ARC-AGI-2 得分为 81.39,高于 Claude Opus 4.8 的 72.1;在难度更高的 ARC-AGI-3 上得 6.9,Claude 为 1.5,GPT-5.5 为 0.4。IFBench 上得 80.4,高于 Claude 的 62.2。

然而在更接近真实工程的智能体编码任务上,它明显落后于第一梯队。

Terminal-Bench 2.1 上得 75.1,低于 Kimi K3 的 88.3 与 GLM 5.2 的 81;SWE-bench Pro 上 61,低于 Claude 的 69.2;Toolathlon 上 55.6,而 Kimi 为 76.5。

这一短板并未被否认。



上图是另一组官方自测成绩(多模态维度),来源 dots.studio 官方模型页公开配图 。

SemiAnalysis 的图表中,其 Terminal-Bench 得分仍高出图表中最优的美国开源模型 4.9 分,但与头部闭源模型的差距依然存在。

04

实测案例大赏

数学、代码这些目标清晰、结果可验证的场景,Agent 已经跑得很顺。

但 dots3-note 挑了一块难啃的骨头,真实生活里那些没有标准答案、需求还会变、能拖几小时甚至几天的任务。

它接过户型图和两款冰箱参数,算出墙面剩余空间后还主动提醒"到现场复尺确认";

它参考 9 张界面图,自主选定 SwiftUI + RealityKit 方案,端到端写出 12 个 Swift 文件、1876 行代码,自建 Xcode 工程编译出 BUILD SUCCEEDED;

它没专门练过《杀戮尖塔 2》,却从战斗反馈里学机制、一路权衡玩到 33 层;

在 ARC-AGI-3 里它用 Self-Critiquing 把修正后的规则写进"记事本",320 步解完全部 6 关。

在婚礼筹备、咖啡电商、全周期旅游这类模拟生活任务里,它跨阶段维护状态,并在机型、天气、航班变化后持续更新行程。


而在"放置骑士"这样的隐藏约束游戏里,critic 对两条轨迹给出明显不同的价值估计,正好呼应上节说的"评价比生成更简单"。

这些任务的共同点是:信息散在图里文里,用户自己都未必一次想清楚要什么,模型得边探索、边记新信息、边自我纠错,才能交付结果。

同一套能力,最终在 IMO 2026 上拿下官方认证 42/42 满分,分支版本递归生成证明,并用工具调用反复自我评估增强。

05

使用教程

模型已按 Apache 2.0协议开源,同时放出 BF16 与 FP8 两个权重版本,发布在 Hugging Face 与 ModelScope,模型结构也已提交至 Transformers,可直接加载。

pip install accelerate pillow torchcodec kernels==0.16.0 "transformers @ git+https://github.com/huggingface/transformers.git@refs/pull/47844/head"

想快速上手,最省事的是申请官方 API,入口在 dots studio 技术博客里,填表即可排队。

运行最小化本地推理示例:

print(processor.decode(outputs[0, inputs.input_ids.shape[1] :], skip_special_tokens=True))

如果打算自己部署,官方建议用 SGLang 或 vLLM,在单个 8 卡节点上跑 FP8 权重即可;

BF16 更吃显存,需按可用显存、并发和输入模态调整上下文长度。

更完整的部署参数(Transformers / SGLang / vLLM 三套方案)可参考官方 README。

06

总结

综合来看,本次开源的真正价值,不在于单项跑分的高低,也不在于参数规模的大小,而在于它首次将长时程智能体、多模态与完全开源三者结合在同一次发布中。

一家以内容社区为主业的公司,愿意将仍处探索阶段的成果以 Apache 2.0 许可整体公开,这一姿态本身构成了一个有讨论价值的信号。

长时程智能体能否最终跑通,目前尚无定论。

但方向的选择与开源的意愿,二者是相互独立的议题。

回看过往 dot 系列的开源记录,这一次发布延续了其一贯的开放策略。

至于这一步由谁先走、又如何走完,需要交由后续的独立复现与持续评测来回答。

关注+星标,获取AI前沿进展与优质开源项目

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
穆里尼奥挖到宝藏!皇马无名猛将爆发!一人打爆国米防线

穆里尼奥挖到宝藏!皇马无名猛将爆发!一人打爆国米防线

澜归序
2026-09-09 08:05:49
小米新车路测被调侃“公款度假旅游”,雷军回应:看起来很美,实际非常辛苦

小米新车路测被调侃“公款度假旅游”,雷军回应:看起来很美,实际非常辛苦

金融界
2026-09-08 11:48:06
苹果保密工作白做了 手机壳厂提前曝光折叠屏命名:就叫iPhone Duo

苹果保密工作白做了 手机壳厂提前曝光折叠屏命名:就叫iPhone Duo

快科技
2026-09-08 18:47:08
直接起飞,爆广东队签约超级外援,给崔永熙打替补,还有更大惊喜

直接起飞,爆广东队签约超级外援,给崔永熙打替补,还有更大惊喜

宗介说体育
2026-09-09 10:22:52
队史第9人!湖人官宣为杰克逊立雕像 曾为紫金军带来5座总冠军奖杯

队史第9人!湖人官宣为杰克逊立雕像 曾为紫金军带来5座总冠军奖杯

罗说NBA
2026-09-09 06:03:03
新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

新一轮机关事业单位大清理 , 这6种人员将被辞退 , 多地重拳出击!

细说职场
2026-09-09 10:19:14
知错能改!欧冠悼念泥石流遇难者 皇马正确表述“中国与尼泊尔”

知错能改!欧冠悼念泥石流遇难者 皇马正确表述“中国与尼泊尔”

念洲
2026-09-09 09:04:42
嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

嫁78岁法国老头水落石出,42岁李宇春私生活曝光,丝毫不感到意外

一盅情怀
2026-09-09 10:53:30
阿根廷总统米莱说:“既然英国当年能把香港归还给中国,那为什么就不能把马尔维纳斯群岛,还给阿根廷呢?”

阿根廷总统米莱说:“既然英国当年能把香港归还给中国,那为什么就不能把马尔维纳斯群岛,还给阿根廷呢?”

回京历史梦
2026-09-08 17:43:17
中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

中美紧张,中日紧张,中英紧张,中加紧张,中印紧张,中韩紧张,中欧紧张…… 各类消息看多了,怎么感觉每天都在过得很紧张?

扶苏聊历史
2026-09-08 12:05:38
“4岁男童被指摸臀事件”当事女子账号已被禁止关注;此前回应“蹭流量”称干自媒体需要流量;伊能静发声:建议家长都更有法律意识

“4岁男童被指摸臀事件”当事女子账号已被禁止关注;此前回应“蹭流量”称干自媒体需要流量;伊能静发声:建议家长都更有法律意识

极目新闻
2026-09-08 18:26:30
不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

不可思议啊!深圳网约车司机苦等10多分钟还要求再等,拒绝后女生当场大哭,家长拦车不让走

火山詩话
2026-09-09 08:27:38
美国将于9月29日禁止进口加拿大乳制品、酒类 和机动车辆

美国将于9月29日禁止进口加拿大乳制品、酒类 和机动车辆

每日经济新闻
2026-09-09 08:50:11
德国选择党赢得选举,魏德尔说了2句话,72岁默克尔“重出江湖”

德国选择党赢得选举,魏德尔说了2句话,72岁默克尔“重出江湖”

临云史策
2026-09-08 16:30:05
皇马2-1国际米兰,赛后评分:不是姆巴佩第一,皇马8号第一

皇马2-1国际米兰,赛后评分:不是姆巴佩第一,皇马8号第一

侧身凌空斩
2026-09-09 04:56:05
长沙“摸臀案”变罗生门!4岁男孩碰了女生屁股,3次调解未果,双方要对簿公堂,网友调侃:坚决判决4岁男人猥亵

长沙“摸臀案”变罗生门!4岁男孩碰了女生屁股,3次调解未果,双方要对簿公堂,网友调侃:坚决判决4岁男人猥亵

火山詩话
2026-09-08 11:37:49
原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

快科技
2026-09-07 19:36:21
中国不抢油了,反而更可怕。现在全球都在等中国高价回来抢油,然而并没有全世界都给看麻了呀,大工业克苏度原油储备的地到底在哪里?

中国不抢油了,反而更可怕。现在全球都在等中国高价回来抢油,然而并没有全世界都给看麻了呀,大工业克苏度原油储备的地到底在哪里?

回京历史梦
2026-09-08 17:46:57
赖清德宣称大陆错误运用联大第2758号决议文,台外事部门宣称联合国应寻求适当方式接纳台湾参与,国台办:自取其辱,必遭挫败

赖清德宣称大陆错误运用联大第2758号决议文,台外事部门宣称联合国应寻求适当方式接纳台湾参与,国台办:自取其辱,必遭挫败

政知新媒体
2026-09-09 11:21:00
研究表明:性生活越频繁,射精和勃起问题越少!

研究表明:性生活越频繁,射精和勃起问题越少!

黯泉
2026-04-05 20:40:12
2026-09-09 11:47:00
智猩猩
智猩猩
AI 技术内容与服务平台
81文章数 3关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

夫妻俩花12万做龙凤胎被安排去异地移植 检测只怀单胎

头条要闻

夫妻俩花12万做龙凤胎被安排去异地移植 检测只怀单胎

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭麒麟最便宜贵公子争议,本人未回应

财经要闻

8月CPI同比涨0.8% PPI环比由降转涨

汽车要闻

坦克700申报信息曝光 长轴距版轴距增150mm/首搭6座

态度原创

手机
本地
家居
旅游
亲子

手机要闻

苹果iPhone Ultra或定价2199美元 国行1万5起

本地新闻

宁波,中国制造的隐藏大佬

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

陕西渭南:“群星”耀蒲城

亲子要闻

家长下单给娃定制“矫形”头盔 到货变成“头部固定器”

无障碍浏览 进入关怀版