智猩猩AI整理
编辑:金水
如果上个月你被"AI 首次在 IMO 国际数学奥林匹克拿下官方认证 42/42 满分"刷过屏,那背后那个模型到底怎么做到的,可能直到最近才有人讲清楚。
8 月 17 日,研究者 @GenAI_is_real(Chayenne Zhao)在 X 上发了一篇长文《dots3-note Preview: What Does an LLM Contestant Do to Take On the IMO?》。
![]()
从 Proof-Verify-Refine 循环、TEMPO 训练方法、自我评价机制一路拆到超长程 Agent 的推理挑战,把模型设计、强化学习和系统工程串成了一条完整线索。
紧接着,小红书 dots studio 官方账号转发了这篇文章。
并回应:"长期推理不仅是一个模型问题,也是一个强化学习和系统问题。这正是我们希望在 dots3-note 预览版正式发布时能够引发的那种技术讨论。感谢您细致的解析!"
而这份讨论的主角,就是小红书旗下的 AI 实验室 dots.studio 在 Apache 2.0 许可下开源的dots3-note preview。
dots3 系列中第一个开放权重的版本,也是该系列目前最轻量的一员。
权重已同步上线 Hugging Face 与 ModelScope,社区追问了一个月,终于等来了它。
小红书做基础模型并不算新事。
此前 dots.llm1、dots.tts、FireRed 等一批项目都曾开源。
但这一次,公开资料指向的方向与过去不太一致,官方给出的定位,是「迈向真实世界长时程智能体的一个步骤」。
![]()
01
这次开源是
一个什么样的模型
dots3-note preview 是一个混合专家(MoE)模型,总参数 280B,每次推理只激活 16B。
原生上下文512K token、同时理解文本·视觉·语音三种模态,并且专门针对复杂推理和长程 Agent 任务做了优化。
视觉用 MoE ViT(7B/1.2B),音频用 800M 稠密编码器,多模态独立建模后由语言主干统一输出。
它是 dots3 系列的成员,而完整系列将由 note / jazz / aria三档组成,分别覆盖不同的任务复杂度、响应速度和计算成本。
note 是其中最轻量的一档。
换句话说,它走的是"把模型做精,而不是做大"的路线。
光看参数你可能没感觉,但官方给了一组横向对比:
在多项任务上,dots3-note 可以比肩甚至超过参数规模数倍于自身的大尺寸模型。
比如它面对的是 GLM 5.2(743B/39B)、Kimi K3(2.8T/104B)这一量级对手,激活参数却只有它们的零头。
评测覆盖的维度包括个人助理 Agent、编程与计算机使用、信息获取、复杂推理,以及多模态感知。
所以更准确的说法是,它不是一个又一个"答题机器",而是一个面向"长程 Agent + 真实生活"的模型。
它的野心,是从封闭、可验证的单道题,走向开放、模糊、可能拖上几天几周的真实生活任务。
02
从「答题」,转向「长时程干活」
为什么这件事难?
因为过去的范式是"答题":一道题、一个答案、对错分明。
可真实世界里的任务更像"干活"。
跨好几天、需求会变、环境在动,而且常常没有标准答案。
把模型从答题者训练成能长时程干活的 Agent,正是 dots3-note 想要解决的核心命题。
难点卡在训练上,长程任务一次探索要十几小时,传统 RL 等整条轨迹结束才给奖励,慢且难归因;
PPO 的 critic 用固定算力估计价值,不如 actor 会推理反思,复杂任务上估计不准。
dots studio 给出的解法是TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization)。
思路很巧妙,把一条很长的轨迹切成多个 macro-step,每个阶段包含多轮模型与环境的互动;
当一个阶段结束,让同一个 Agent 从"执行者"切换成"评价者",通过推理和工具调用来估算"当前这个状态,未来还能拿多少回报",并在轨迹结束之前就把这个评价变成训练信号。
训练过程中,模型既学"怎么行动",也学"怎么评价自己"。
效果很直接,在 ARC-AGI-3 上,TEMPO 的平均得分比基础版本高 31.5%,比 GRPO 高20.6%,而且越到任务深水区,领先越明显。
![]()
在这个基础上,团队还强调递归自我评价(recursive self-critiquing)。
让模型在缺少外部奖励信号时,也能自己判断进展到了哪一步。
这被认为是从"可验证的长程任务"走向"模糊的真实生活任务"的关键,也是他们下一步的重点方向。
另一块是陌生环境在线学习,用数千个不依赖先验知识的新颖超长程环境,训练模型在测试时从探索中学习、更新记忆。
当任务长度明显超过上下文窗口,模型会逐渐学会主动生成对后续决策有用的记忆。
一句话总结这套方法论,评价比生成更简单,让模型学会给自己打分,长程强化学习才真正跑得动。
下文那个"放置骑士"的实测,会让你直观看到 critic 是怎么工作的。
03
实测表现如何
官方公布了一份自测成绩表,对比对象包括 Claude Opus 4.8、GPT-5.5、Kimi K3、GLM 5.2 与 DeepSeek V4 等模型。
结果呈现明显的分化。
在抽象推理与逻辑类任务上,dots3-note 表现突出。
![]()
![]()
上图是官方自测成绩,来源 dots.studio 官方 Hugging Face 模型页公开配图 。
ARC-AGI-2 得分为 81.39,高于 Claude Opus 4.8 的 72.1;在难度更高的 ARC-AGI-3 上得 6.9,Claude 为 1.5,GPT-5.5 为 0.4。IFBench 上得 80.4,高于 Claude 的 62.2。
然而在更接近真实工程的智能体编码任务上,它明显落后于第一梯队。
Terminal-Bench 2.1 上得 75.1,低于 Kimi K3 的 88.3 与 GLM 5.2 的 81;SWE-bench Pro 上 61,低于 Claude 的 69.2;Toolathlon 上 55.6,而 Kimi 为 76.5。
这一短板并未被否认。
![]()
![]()
上图是另一组官方自测成绩(多模态维度),来源 dots.studio 官方模型页公开配图 。
SemiAnalysis 的图表中,其 Terminal-Bench 得分仍高出图表中最优的美国开源模型 4.9 分,但与头部闭源模型的差距依然存在。
04
实测案例大赏
数学、代码这些目标清晰、结果可验证的场景,Agent 已经跑得很顺。
但 dots3-note 挑了一块难啃的骨头,真实生活里那些没有标准答案、需求还会变、能拖几小时甚至几天的任务。
它接过户型图和两款冰箱参数,算出墙面剩余空间后还主动提醒"到现场复尺确认";
它参考 9 张界面图,自主选定 SwiftUI + RealityKit 方案,端到端写出 12 个 Swift 文件、1876 行代码,自建 Xcode 工程编译出 BUILD SUCCEEDED;
它没专门练过《杀戮尖塔 2》,却从战斗反馈里学机制、一路权衡玩到 33 层;
在 ARC-AGI-3 里它用 Self-Critiquing 把修正后的规则写进"记事本",320 步解完全部 6 关。
在婚礼筹备、咖啡电商、全周期旅游这类模拟生活任务里,它跨阶段维护状态,并在机型、天气、航班变化后持续更新行程。
![]()
而在"放置骑士"这样的隐藏约束游戏里,critic 对两条轨迹给出明显不同的价值估计,正好呼应上节说的"评价比生成更简单"。
这些任务的共同点是:信息散在图里文里,用户自己都未必一次想清楚要什么,模型得边探索、边记新信息、边自我纠错,才能交付结果。
同一套能力,最终在 IMO 2026 上拿下官方认证 42/42 满分,分支版本递归生成证明,并用工具调用反复自我评估增强。
05
使用教程
模型已按 Apache 2.0协议开源,同时放出 BF16 与 FP8 两个权重版本,发布在 Hugging Face 与 ModelScope,模型结构也已提交至 Transformers,可直接加载。
pip install accelerate pillow torchcodec kernels==0.16.0 "transformers @ git+https://github.com/huggingface/transformers.git@refs/pull/47844/head"想快速上手,最省事的是申请官方 API,入口在 dots studio 技术博客里,填表即可排队。
运行最小化本地推理示例:
print(processor.decode(outputs[0, inputs.input_ids.shape[1] :], skip_special_tokens=True))如果打算自己部署,官方建议用 SGLang 或 vLLM,在单个 8 卡节点上跑 FP8 权重即可;
BF16 更吃显存,需按可用显存、并发和输入模态调整上下文长度。
更完整的部署参数(Transformers / SGLang / vLLM 三套方案)可参考官方 README。
06
总结
综合来看,本次开源的真正价值,不在于单项跑分的高低,也不在于参数规模的大小,而在于它首次将长时程智能体、多模态与完全开源三者结合在同一次发布中。
一家以内容社区为主业的公司,愿意将仍处探索阶段的成果以 Apache 2.0 许可整体公开,这一姿态本身构成了一个有讨论价值的信号。
长时程智能体能否最终跑通,目前尚无定论。
但方向的选择与开源的意愿,二者是相互独立的议题。
回看过往 dot 系列的开源记录,这一次发布延续了其一贯的开放策略。
至于这一步由谁先走、又如何走完,需要交由后续的独立复现与持续评测来回答。
关注+星标,获取AI前沿进展与优质开源项目
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.