网易首页 > 网易号 > 正文 申请入驻

强化学习之父Sutton最新访谈:合成数据是巨大错误,大模型只完成了四分之一的智能

0
分享至



当前,大模型主要通过预训练和后训练获得能力,上线后参数通常不再更新,只能借助上下文、知识库或重新训练适应变化。如何让 AI 在部署后持续学习,正成为行业需要突破的基础问题。

8 月 18 日,红杉资本旗下播客《Training Data》发布了一期围绕 AI 持续学习的对谈,受访者为强化学习奠基人、2024 年图灵奖得主 Rich Sutton。此外,参与访谈的嘉宾还有 Sutton 的前学生、Oak Lab 联合创始人 Khurram Javed,对谈由红杉资本合伙人 Sonya Huang 和 Alfred Lin 主持。

访谈从 Sutton 2019 年发表的《苦涩的教训》谈起,延伸至合成数据、世界模型和持续学习,并讨论智能体如何从真实经验中形成抽象概念。Sutton 认为,部署后便停止改变的模型,还称不上完整的智能系统。大模型虽是重要突破,却主要解决了语言能力,只覆盖智能的一部分。

基于这一判断,Sutton 正将持续学习推进为一条完整的技术路线。就在上个月,他与 Khurram Javed 创立 AI 初创公司 Oak Lab,并提出以经验学习、时间抽象和规划为核心的 OaK 架构,希望智能体能从连续经历中实时学习,不断更新认知并改进决策。

“止步不前”的智能

在今天,大模型看起来无所不知,却有一个容易被忽略的特点:它们的大部分能力都在上线前形成,经过预训练和后训练后,模型参数便基本固定。此后即使每天接触大量用户和新信息,也不会像人一样把这些经历转化为新的长期能力。


图|访谈现场(来源:YouTube)

Sutton 认为,这种静态范式混淆了知识与学习的边界。尽管模型可以记住一段对话,也可以借助外部知识库回答最新问题,但这些都不等于真正的学习。

这是因为上下文只是暂时改变模型当前能够看到的信息,模型内部的知识结构并未随之更新。另外,当对话结束或窗口被清空后,这些信息也可能随之消失。

这一区别在产品端并不明显。一个 AI 助手可以根据用户反馈修改答案,甚至借助记忆功能表现得越来越了解用户,给人一种“它正在学习”的感觉。但如果模型权重没有变化,那么它只是利用当前提供的信息完成推理,并没有形成可以长期保留的新认识。

不过,让模型继续更新参数,也没有想象中简单。Khurram Javed 等人在《Nature》发表的研究显示,标准深度学习模型在接连学习新任务时,吸收新知识的能力会逐渐下降。研究人员将这种现象称为“可塑性损失”,也就是模型训练得越久,反而越难学会新的东西。

为解决这一问题,现有训练方式往往会采用大量混合数据。Khurram Javed 解释,现有训练通常借助大批量数据,减弱单个样本对原有能力的冲击。但随着真实经验不断增多,而智能体需要保存并反复训练全部历史数据,计算和存储成本将答复增加。

合成数据因此被不少研究者视为一种解决方案。既然高质量的人类数据有限,就让模型自动生成题目、回答或模拟环境,再用这些内容训练下一代模型。

不过,Sutton 在访谈中将这种路径称为一个“巨大的错误”。在他看来,它扩大了数据规模,却没有改变 AI 依赖外部数据生产者的基本方式。

Sutton 指出,任何模拟环境都只能保留现实的一部分,许多因素很难被完整写入模拟器。合成的世界可以很大,但它仍然由有限规则构成,与现实的复杂程度存在差距。

在访谈中,Sutton 又以自动驾驶为例。企业可以让车辆在模拟环境中行驶数十亿公里,再由工程师根据真实路测调整系统。他认为,更合理的路径应当是让车辆直接从驾驶经验中发现预测偏差、修正环境模型,并将新的认识用于下一次决策。

这也是 Sutton 重提“苦涩的教训”的原因。他认为,能够利用更多计算资源、从数据中自主发现规律的通用方法,最终将胜过植入大量专家知识的系统。例如,AlphaGo Zero 未使用人类棋谱训练,仅凭自我对弈便击败此前的 AlphaGo。

大语言模型在一定程度上延续了这条路线。尽管它没有依靠专家逐条编写规则,而是从大规模文本和计算中学习语言结构。但 Sutton 认为,互联网文本终究是由人类整理出来的有限知识,如果模型始终依赖更多文本和人工反馈,它的进步仍会受到人类数据供给能力的限制。

不过,Sutton 也明确表示,他并不主张抛弃已有知识。而问题在于,当前模型常常把这些知识固定在部署前的参数中,此后只负责调用,很少用新的经历检验和修正它们。

他预测,当前大模型可能只覆盖了智能的四分之一,剩余部分还包括感知、行动、规划,以及在长期经验中持续改变自身的能力。缺少这些环节,模型即使再博学,也只能停留在上线时的状态。

Oak Lab 要实现持续学习

Sutton 团队认为,实现真正的持续学习,核心在于解决深度学习中的灾难性遗忘问题。朴素的单样本权重更新会快速覆盖原有知识,让模型失去之前积累的能力,这也是过去持续学习难以落地的核心障碍。

为解决这一问题,他们提出两个关键的技术方向:第一个方向是“步长优化”,通过为不同参数设置不同的更新速度,已经承载稳定知识的参数变化较慢,需要学习新内容的部分则可以更快调整。第二个是“生成与检验”,即不断提出新的内部特征或神经单元,再检验它们是否有助于模型学习。

基于上述思路,团队提出“持续反向传播”算法,相关成果此前已于《Nature》发表。这种算法在标准反向传播的基础上,持续加入少量随机初始化的新单元,再由反向传播检验其价值。Sutton 认为,如果将这一机制与步长优化结合,有望形成新一代持续深度学习算法。

不过,这类算法不能直接套用在已经训练好的静态模型上,而要用它们从头训练新的基础模型。模型在积累知识的同时,也会学习今后应当如何更新自身,从而有望在吸收新知识时减少对原有能力的破坏。

持续深度学习只是第一步,更长远的目标是让模型自主构建抽象与世界模型。Sutton 认为,当前的 AI 系统要么使用人类预设的规则模型,要么只能做低层级的时序预测,目前还无法自主生成高层抽象并基于抽象进行规划推理。

Sutton 团队最大的野心,是构建覆盖从微观细节到宏观决策的全谱系知识系统。真正的心智应该可以持续更新,同时始终保持内在的自洽与连贯,不会因为持续学习陷入混乱。


图|Oak Lab首页(来源:公司官网)

这也正是 Oak Lab 的核心使命。这家成立于 2026 年 7 月的初创公司,目标是在五到十年内打造出万亿参数规模、运行功耗仅 20 瓦的持续学习心智模型。

20 瓦大致和人类大脑的功耗水平相当,这意味着智能的提升不再单纯依赖算力堆砌,而是通过算法效率的飞跃实现。

针对这一目标,Sutton 按照摩尔定律作出估算:如果计算效率每 18 个月提高一倍,10 年大约可以带来两个数量级的提升。这意味着,假如现在能以约 2,000 瓦实现相应规模,未来将可能将功耗降至 20 瓦。

不过,最终形态不会是一个无所不能的单一心智。由于没有任何单个系统可以学完所有知识,同一种基础架构会衍生出大量不同的实例。按照两人的设想,同一种基础架构会产生多个智能体,它们因所处环境和自身经历不同,形成各自的知识与能力。

谈到公司的未来,Khurram Javed 表示,Oak Lab 初期不会追求快速扩张。新范式需要团队成员对研究方向形成高度共识,因此公司将从小规模团队起步,再逐步扩充至数个核心小组,以保持研究效率和方向一致。

参考资料:

1.https://www.youtube.com/watch?v=xH7U7w9Qzlo

2.https://oaklab.ai/mission

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
郭德纲篡改红歌事件通报来了:相关单位合计被罚没近65万,郭德纲的处罚一句带过

郭德纲篡改红歌事件通报来了:相关单位合计被罚没近65万,郭德纲的处罚一句带过

Mr王的饭后茶
2026-09-07 19:13:17
死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

死在加州路边的阿里总监:最残忍的不是没钱,是枕边人不如网友亲

杰丝聊古今
2026-09-07 09:12:22
保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

保利集团董事长贺平的人生颇具传奇色彩:他娶了邓小平的女儿为妻,还曾低调斥资3000万元收回三件国宝

z千年历史老号
2026-09-07 11:43:45
阿根廷总统震怒“香港回归中国,英国凭什么还霸着马岛?”

阿根廷总统震怒“香港回归中国,英国凭什么还霸着马岛?”

以色列飛飛
2026-09-07 12:00:05
湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

湖南经济为什么掉队了?当地县中医药主任轻飘飘的一句话,让人寒毛倒竖

回旋镖
2026-09-07 12:45:44
周末悄悄到账3600亿,是在防什么?

周末悄悄到账3600亿,是在防什么?

大猫财经Pro
2026-09-07 13:55:58
以牙还牙,中国稀土正式断供!2026年9月4日,路透社透露,在中国把RBA纳入反制清单后,不少中国稀土供应商叫停了对美发货

以牙还牙,中国稀土正式断供!2026年9月4日,路透社透露,在中国把RBA纳入反制清单后,不少中国稀土供应商叫停了对美发货

扶苏聊历史
2026-09-07 17:32:06
余承东:建议苹果用户买华为阔直板当备用机 备用几天就可能成为主力机

余承东:建议苹果用户买华为阔直板当备用机 备用几天就可能成为主力机

快科技
2026-09-07 17:09:20
“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

“女孩赴港看演唱会全家低保被取消”引热议,制度底线不能被“热爱”冲垮

新民周刊
2026-09-07 16:55:42
破冰之旅!时隔两年台官员顶着中国台北四个字登陆,国台办亮底线

破冰之旅!时隔两年台官员顶着中国台北四个字登陆,国台办亮底线

面包夹知识
2026-09-07 18:24:48
南京连夜成立联合调查组

南京连夜成立联合调查组

政知新媒体
2026-09-07 13:31:40
给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

背包旅行
2026-09-07 18:50:04
看完账单一身冷汗!深圳三口之家一年花31.4万,都是“刚需”,居然还只是租房

看完账单一身冷汗!深圳三口之家一年花31.4万,都是“刚需”,居然还只是租房

火山詩话
2026-09-06 11:35:39
30年没离开过上海的保安,突然“被北京法院判了”,账户被冻结、欠债百万…

30年没离开过上海的保安,突然“被北京法院判了”,账户被冻结、欠债百万…

上观新闻
2026-09-07 12:38:31
细节曝光!江西低保女生赴港追星,返程后全家2000元补助被清零,女方家庭情况曝光后全网吵翻

细节曝光!江西低保女生赴港追星,返程后全家2000元补助被清零,女方家庭情况曝光后全网吵翻

李晚书
2026-09-07 07:40:43
英格兰公开赛:丁俊晖4-3绝杀!首爆大冷,中国00后新星1-4出局了

英格兰公开赛:丁俊晖4-3绝杀!首爆大冷,中国00后新星1-4出局了

小火箭爱体育
2026-09-07 19:48:28
伊朗在美军舰上空试验特殊武器 警告美方老实点

伊朗在美军舰上空试验特殊武器 警告美方老实点

看看新闻Knews
2026-09-07 16:25:04
幼儿园园长直言:入园不哭的孩子,多半出自这5种家庭,对照看看

幼儿园园长直言:入园不哭的孩子,多半出自这5种家庭,对照看看

小书虫妈妈
2026-09-05 17:35:32
严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

严肃警告:不要买!不要吃!里面含有硼砂,危害健康,别害了自己

健身狂人
2026-09-06 13:46:44
欧盟愤怒: 中国货轮来时 2.4 万集装箱满载, 回去啥都不拉合适吗?

欧盟愤怒: 中国货轮来时 2.4 万集装箱满载, 回去啥都不拉合适吗?

江启
2026-09-07 11:21:14
2026-09-07 23:39:02
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17207文章数 515205关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

本地
艺术
旅游
教育
军事航空

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

艺术要闻

Denisenko Olga:俄罗斯当代女画家

旅游要闻

外籍游客同比增长37.9% 看成都开放能级何以一路“扶摇直上”|成都发展

教育要闻

70%比50%大百分之几

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版