No.0347
Science Partner
Bring you to the side of
![]()
导 读
最近,Kimi K3发布,最容易传播的当然是那个大数字:总参数达到2.8万亿。
但只盯着参数,就像判断一家企业强不强,不能只盯着它有多少员工。真正决定企业战斗力的,是这些人怎么分工、怎么协作,干完以后又如何验收。
清华大学公共管理学院长聘副教授陈天昊近日在朋友圈分享了自己阅读Kimi K3技术报告强化学习部分后的五点观察:九个专家模型参与后训练、智能体自动扩展知识图谱、统一的白盒智能体环境、可暂停和分叉的沙箱,以及依据任务实际完成程度给予奖励。
这五点看似都是工程细节,连在一起却说明了一件更大的事:过去的大模型,主要在学习怎样把话说对,下一代人工智能,开始学习怎样把事情做成。
走,跟伙伴君来!
今日主笔|晶恒
Kimi K3最值得看的,不是参数,而是它怎样把AI训练成“办事的人”
一、从先培养九个老师傅,再教出一个全能徒弟
现实中的工作千差万别。
回答一道知识题,和调查一个行业不是一回事。写一小段代码,和维护一个大型软件项目也不是一回事。即使是同一道题,有时只需迅速判断,有时却需要反复搜索、推理和验证。
K3没有一开始就要求一个模型什么都会,而是先训练了九个专家模型。
研发团队把任务分成三个领域,每个领域又设置三种不同的思考投入程度,形成“三乘三”的专家组合。可以把它理解为先找来九位老师傅:有人擅长知识推理,有人擅长使用工具,有人擅长写代码;同一领域里,又有人负责普通任务,有人专攻疑难杂症。
接下来,再让这些老师傅共同训练一个统一模型。
它采用的办法叫“多教师在策略蒸馏”。这个名字很复杂,道理却不难:不是老师直接把标准答案递给学生,而是先让学生自己做,老师再沿着学生已经走出的路线,对每一步作出评价。
过去不少强化学习更像期末考试。学生交卷后,只得到一个总分。考了六十分,他知道自己没学好,却不知道究竟错在第三题,还是最后一道大题。
K3则更像老师傅站在徒弟旁边,看着他操作:不但知道那道题对哪道题错,还能告诉学生这一步方向对了,下一步走偏了,这里虽然绕远,但还能救回来。
反馈从“最后打一个分”,变成“过程中的连续纠偏”。模型学到的也不只是答案,而是解决问题的方法。
二、AI现在缺的,可能不是更多资料,而是更多好题
我们过去总觉得,训练大模型就是不断给它“喂数据”。
文章越多、代码越多、图片越多,模型自然越聪明。这个逻辑在预训练阶段没有错,但进入智能体时代以后,问题变了。
一个人看过一万本管理学著作,不等于他会经营一家企业;背过所有法律条文,也不等于他能独立处理一宗复杂案件。
知识和办事能力之间,还隔着大量真实任务。
K3为此引入了一个可以持续扩展的知识图谱。它的主要用途,不是简单给模型增加一本百科全书,而是自动寻找新知识、组合新概念,进而生成新的训练任务。
比如,系统从计算机科学、物理、生物医学等大领域出发,不断向下寻找更具体的概念,再检索论文、专业文章和代码资料,把不同知识点组合起来,形成需要搜索、分析、编程或调用工具才能完成的题目。
这有点像一座自动运转的出题工厂。
传统题库的问题是,模型练得越多,越容易记住套路。题目看似不同,骨架可能完全一样。结果就是考试成绩很高,一遇到现实中的陌生问题便无从下手。
能够自动探索和更新的知识图谱,则可以不断把模型推向它没见过的角落。
这也意味着,以 K3 为标志,未来人工智能企业的重要资产,不只是拥有多少数据,还包括能不能持续生产高质量任务。毕竟,书架上有多少书是一回事,能不能设计出真正锻炼人的工作,又是另一回事。
三、不能只会开一种车,也不能只会用一种智能体
大模型和智能体经常被混为一谈,其实不是同一个东西。
大模型更像司机,智能体框架则是一整辆车。除了司机,还包括方向盘、导航、仪表盘、工具箱、记忆系统和交通规则。
同一个模型放进不同的智能体框架,表现可能差别很大。有的框架善于管理文件,有的擅长调用搜索,有的可以调动多个子智能体共同工作,还有的会自动整理和压缩长时间积累的信息。
如果模型始终在同一种框架中训练,就像一个人只会开某一款车,只要按钮换个位置,操作逻辑稍微变化,立刻生疏甚至就不会了。
K3因此搭建了一套“白盒”环境,把智能体拆成提示词、工具、记忆、技能、上下文管理等模块,再用不同方式重新组合。
模型在训练中不能只背下一套固定流程,而要学会观察:我现在拥有什么工具,工具之间是什么关系,这项任务应该如何安排,原来的计划失败以后又该怎样调整。
这比单纯让模型多答几道题困难得多,却更接近真实工作。
因为现实中真正有能力的人,不是只会使用一个软件、遵循一套表格,而是换了平台、换了团队、换了流程之后,仍然能找到完成任务的办法。
四、想让AI大胆试错,先给它造一座虚拟城市
智能体要学会办事,就必须真正操作电脑。
它要打开文件、运行程序、安装工具、修改代码,也可能做出研究人员没有预料到的操作。能力越强,尝试越复杂,出错时造成的破坏也可能越大。
所以,不能让它直接在真实系统里随便折腾。
K3使用的AgentENV,可以理解为一座为人工智能准备的虚拟城市。里面有操作系统、有软件、有文件,也有接近真实工作的任务环境。模型可以在里面试错,但这些操作尽量不会影响外部系统。
这个环境有三个很实用的功能。
一是暂停。模型进入长时间思考时,环境可以先停住,等它想好下一步再恢复,不必让整套机器一直空转。
二是分叉。任务进行到某个节点,系统可以复制出一个完全相同的现场。评估程序在副本里检查文件、运行测试,不会破坏模型原来的工作进程。
三是快照。做到关键步骤时先存档,后面失败了,可以退回原处,而不用从第一步重新开始。
听起来很像打游戏,但对智能体训练非常重要。
人类学习一项复杂技能,也需要练习场、模拟器和复盘机制。飞行员不能第一次驾驶飞机就直接载客,外科医生也不能只看完教材便独立上手。
人工智能同样如此。既要让它充分探索,又不能让一次错误变成真实事故。安全不再是模型训练完成后临时加上的围栏,而是训练系统本身的一部分。
五、别听AI说“我完成了”,直接去检查现场
K3最值得注意的一点,是它开始改变奖励标准。
过去评价大模型,往往看答案是否正确、文字是否流畅。可一旦模型开始执行复杂任务,只看它最后说了什么,就很容易出问题。
因为大模型最擅长的,恰恰是把话说得像真的一样。
它可能告诉你:“邮件已经发送,文件已经整理,程序已经修复。”但这些表述本身,并不能证明任务真的完成。
K3在部分智能体训练任务中,更重视对最终环境状态的检查。
模型说邮件发了,就查看发件箱里有没有;说代码修好了,就重新运行测试;说材料整理完了,就检查文件是否存在、内容是否完整、格式是否符合要求。
奖励来自事情究竟完成到了什么程度,而不是模型对自己工作的描述。
这一步很重要,因为它区分了两个完全不同的能力:一个是“能够解释自己做了什么”,另一个是“确实把事情做成了”。
过去的大模型更像考场里的高材生。你出题,它作答,答案写完,任务也就结束了。
未来的智能体更像刚进入公司的年轻员工。它要查资料、操作系统、调用工具、处理突发情况,最后交付一个能够被别人检查的结果。培养这样的人工智能,光给它更多书是不够的。它还需要老师傅、练习任务、工作工具、安全沙箱和一套不听汇报、只看结果的验收制度。
综上,Kimi K3真正值得关注的,并不是它装下了多少参数,而是它展示了 AI一种新的训练思路:不再满足于让人工智能显得聪明,而是开始要求它对任务结果负责。
![]()
![]()
![]()
![]()
![]()
![]()
再次诚挚致谢陈天昊教授。
我是晶恒,咱们下期见~
本文仅作科普分享使用,欢迎小伙伴们点、收藏、关注,以备不时之需,当然更欢迎您把 介绍给周边可能需要的更多伙伴们呀。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.