网易首页 > 网易号 > 正文 申请入驻

启发学习:让大模型认知从外化到内生

0
分享至



过去两年,大模型几乎重写了人机协作的默认想象:写代码、查资料、做分析,似乎都能 “一问即答”。但仔细看会发现,当下很多能力并不是模型自己长出来的,而是人为地在外面包了一层又一层框架。

人类先定流程、写 Skills、建知识库;参数继续变大,工具链继续变厚。Agent、Skills、Function Calling、RAG、Harness 轮番上场,把临时判断固化成可调用的工作流。这套做法有效,也撑起了眼下的繁荣。

问题在于,能力上限往往卡在脚手架上。换场景就要重写流程,换工具就要重排提示和权限。系统看起来更能干,知识却越来越多地挂在流程外面。另一条路更接近人类怎么学:复盘成败,把结构相近的问题连起来,把一次有效推理留到下次还能用。

现在主流方案多停在接口与检索,很少把 “经验怎么复用” 写进推理本身。外挂和算力人人都能堆,更难的是,让模型在新问题上自己调用旧经验。我们把这条路线命名为 “启发学习(Inspirational Learning)”,并把它集成到推理侧,取名 Isaac(源自牛顿的名字,寓意 “站在巨人肩膀上”)。

人类智慧如何进化:

从旧经验里 “启发” 出新知识

近现代科学史里,重大突破很少从零开始。例如,库仑受牛顿万有引力思维模式启发,提出库仑定律;霍兰德把达尔文自然选择的逻辑迁移到计算机领域,遗传算法随之出现。最常见的路径,是把已知结构搬到新领域:类比、迁移、再重组。



图 1-a:库仑受牛顿万有引力思维模式启发,提出库仑定律。



图 1-b:霍兰德借达尔文自然选择逻辑,发展出遗传算法。

启发学习:认知的进化飞轮



图 2:启发学习的认知进化飞轮。类比检索、逻辑重组、内生注入与经验沉淀形成闭环。

图 2 给出了启发学习的四个步骤:类比检索(Analogical Retrieval)、逻辑重组(Re-composition)、内生注入(Endogenous Injection)和经验沉淀(Experience Loop)。面对新领域、新问题,检索聚焦的不是字面相似的文本,而是经验库里其它领域解答过的类似问题的思路;注入阶段把这些思路整理后合并进当前输入;沉淀阶段再把新题的思维链抽象成可复用条目,写回经验库。我们把该流程集成形成推理侧框架 Isaac:不改基座权重,也不重新训练,只在推理时注入跨领域经验。模型还是原来的模型,但解题时旁边多了一批 “结构相近的旧题” 来做指导、做参考。

技术底座:

Prompt 注入与网络层注入

要把启发学习跑起来,先得说清经验从哪里输入模型。团队把它拆成两条路,Prompt 注入:基座参数不动,把检索到的跨域示范写进上下文,让模型在给定示范下推理。网络层注入:基座仍冻结,但在中间层隐状态上加一个可训练的轻量适配器,用残差方式改表征,减轻源域与目标域的分布差距。对应团队提出的工作分别是域不变神经元检索(DIN-Retrieval,下称 DIN)和思维链引导的域适配(CoDA),合在一起构成 Isaac 的方法底座。



图 3:DIN 框架(Prompt 注入)。识别域不变神经元,构造 DIN 向量并检索跨域示范,再写入上下文提示。图片来源:DIN-Retrieval 论文。

DIN 做的是 Prompt 注入,核心是示范怎么选。源域有标签、目标域无标签时,先对隐状态做 token 均值,再按源、目标联合分布算神经元级 z-score;两侧激活极性一致、且超过阈值的维度,称为域不变神经元(必要时只保留幅度最大的前 K 维)。只用这些维度构造向量,在子空间里用余弦相似度找源域示范,并用 MMR 去掉太像的重复样本。示范与目标查询拼成提示后送进冻结基座。这样一来,跨域检索不再只靠文本嵌入是否相近,而是看域更稳的子空间里结构是否对齐。



图 4:CoDA 框架(网络层注入)。轻量适配器以残差方式调制中间隐状态;均方误差蒸馏源域思维链教师态,MMD 对齐源域与目标域增强表征。图片来源:CoDA 论文。

CoDA 做的是网络层注入。只把示范塞进提示,有时不够:源域和目标域差得大,共享推理模式仍难复用。做法是把冻结大模型按层拆开,前面抽特征、后面生成,中间插适配器,残差调制隐状态(增强态 = 原隐状态 + 适配器输出)。源域用 “问题 + 思维链” 得到教师隐状态;源域与目标域的原输入经适配器后得到学生增强态。训练两项损失一起优化:均方误差让源域增强态靠近教师态,MMD 对齐源、目标增强态分布。推理时基座仍冻结,只对目标输入过适配器,也不需要目标域思维链标注。和纯检索式上下文学习相比,这一步把迁移做到了中间表征上。

图 3、图 4 分别对应两条路:DIN 负责找对齐的示范并写入提示;CoDA 在隐空间里对齐推理相关表征,服务无标签目标域。可以先检索再适配,也可以按能不能训中间模块、能不能读隐状态,二选一。Isaac 把它们放在推理侧:基座权重不变,靠 Prompt 注入和(或)网络层注入复用旧经验。下面先看评测设置,再看增益。

评测基准:编程、推理、科学问答与科研编码

实验用了四个公开热门基准,用以全方位评价启发学习的解题能力,特别是解难题的能力。HumanEval 测函数级代码生成:按函数签名与说明补全 Python,用单元测试判对错。StrategyQA 测隐式多跳推理:题是是非题,但不写出推理步骤,模型得自己补策略。ScienceQA 测科学问答:题来自中小学科学课,多为选择题,部分带图。SciCode 测科研编程:题从真实科研流程拆成子任务,要把领域知识写成能跑的代码。四个任务覆盖编程、策略推理、科学问答和科研代码,后面的对比都基于这套设置。

从数据里各摘一例,方便对照题型:

HumanEval(HumanEval/127)-- 实现 intersection (interval1, interval2):判断两闭区间交集长度是否为素数,返回 “YES” / “NO”。例如 intersection ((-1, 1), (0, 4)) 应返回 “NO”。

StrategyQA -- Does citrus grow well in places with 24-hour days in the summer?(答案:no)。题面是是非题,但不给推理步骤,需要自己补出 “极昼地区的气候与光照是否适合柑橘” 这类隐含链条。

ScienceQA -- Which better describes the Daintree rain forest ecosystem? 配图选择题。选项有 “全年温暖、生物多样” 和 “冬季寒冷、土壤肥沃” 等;正确答案是前者,要结合图像与选项判断。



图 5:ScienceQA 示例题配图(Daintree rain forest)。题目要求判断哪一项更准确地描述该生态系统。

SciCode(problem CG) -- 实现共轭梯度法 cg (A, b, x, tol),求解对称正定线性系统 Ax = b。任务拆自真实数值计算流程,输出需通过数值测试。

实验效果:标准基准上的增益

我们对比了主流大模型的零样本接口与接入 Isaac 后的表现。HumanEval 上,Claude 达到 100.0%(公开榜首约 95.1%);StrategyQA 上,Qwen3-8B 达到 82.3%,接近公开 SoTA;ScienceQA 上,Doubao 达到 98.0%(公开榜首约 91.3%);SciCode 等科研编程任务上,多家模型也有稳定正向增益。

按模型看,增益并不均匀。同一套接入方式下,较弱模型的绝对提升往往更大:StrategyQA 上 Grok-4.5 提高 13.5 个百分点,ScienceQA 上 Gemma-4-31B 提高 12.7 个百分点,HumanEval 上 14B 级模型提高 8.5 个百分点;更强的模型仍可能继续抬高上限。

以上实验数据说明,大模型提质不见得只靠预训练或后训练侧的 scaling。在推理侧复用跨域经验,也能大幅提高任务性能,是一条与堆参数、堆算力并行的路线,也是一条可单独检验的路线。









图 6:跨模型零样本(灰)与接入启发学习 / Isaac(蓝)后的增益。a,StrategyQA;b,ScienceQA;c,HumanEval;d,SciCode。图片来源:Inspirational Learning Pitch Deck。

从会补证据,到会复盘、会举一反三

启发学习想解决的,不是再给模型多接一个工具,而是让它在新题上复用旧经验。现有多个基准上,这条路带来了跨模型、跨任务的大幅增益,我们相信,该方法可以在更广泛的任务上普适和泛化。

外挂和算力还会继续加,与此同时,更值得做的是把复盘和举一反三做成稳定能力,将大模型的认知从外化迁移到内生,让模型激活自身的学习能力,实现真正的自我进化,这也是我们认为启发学习能为整个 AI 行业做出的贡献。

团队文章:

  • https://arxiv.org/abs/2604.05383
  • DIN:通过前向激活识别源域目标域中的领域不变神经元实现跨域检索及上下文知识迁移
  • https://arxiv.org/abs/2604.05396
  • 系统性验证了跨域上下文知识迁移在纯文本推理任务中的存在性
  • https://arxiv.org/abs/2604.19488
  • CoDA:用源域目标域数据训练额外轻量网络并在推理时进行激活干预实现在模型网络层维度的跨域知识迁移

作者简介

颜见智, 2022 年获得吉林大学概率论与数理统计专业硕士学位,现为哈尔滨工业大学和鹏城实验室联合培养计算机科学专业博士研究生。研究方向主要集中在自然语言处理、统计机器学习、大模型压缩及大模型推理优化等领域,已在 ACL 和 EMNLP 上发表了多篇论文。邮箱:yanjzh@pcl.ac.cn

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1人NBA+5人NCAA!男篮明年世界杯欲组最强阵容,冲击奥运会希望大增

1人NBA+5人NCAA!男篮明年世界杯欲组最强阵容,冲击奥运会希望大增

篮球圈里的那些事
2026-09-06 18:37:25
郑钦文第4轮对手出炉!将战大满贯6冠得主 已输7次+奥运夺唯一胜利

郑钦文第4轮对手出炉!将战大满贯6冠得主 已输7次+奥运夺唯一胜利

我爱英超
2026-09-06 04:32:57
9月6日金价,震惊!下周黄金变天——我偏把这层皮撕给你看

9月6日金价,震惊!下周黄金变天——我偏把这层皮撕给你看

叮当当科技
2026-09-06 09:52:15
上海交大调查发现:若60岁前没患这几种疾病,患癌几率或微乎其微

上海交大调查发现:若60岁前没患这几种疾病,患癌几率或微乎其微

今日养生之道
2026-09-06 03:30:46
巴基斯坦军方公布战果

巴基斯坦军方公布战果

上观新闻
2026-09-05 06:09:39
不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

不到一年,被捧上神坛的“英雄”成了“人人喊打的过街老鼠”

小马姨
2026-09-01 10:37:59
武大风波持续!知情人曝付某没去上班,妻子在同校,曾某是乖乖女

武大风波持续!知情人曝付某没去上班,妻子在同校,曾某是乖乖女

董董历史烩
2026-09-06 13:58:19
宁静再谈花少2:小爽是好人,坏的是其他人!节目真人秀真有意思

宁静再谈花少2:小爽是好人,坏的是其他人!节目真人秀真有意思

观鱼听雨
2026-09-04 21:38:02
5天4个涨停板!股民:新的妖股种子!

5天4个涨停板!股民:新的妖股种子!

数据挖掘分析
2026-09-06 15:09:30
你无意间撞见过啥大秘密?网友:我也撞见过我闺蜜妈妈的那啥

你无意间撞见过啥大秘密?网友:我也撞见过我闺蜜妈妈的那啥

解读热点事件
2026-09-05 00:15:12
内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

内娱的审美该醒醒了,张子枫林允一起参加活动,一个干瘪一个饱满

小椰的奶奶
2026-09-04 16:41:42
曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

曝景甜与孙宇晨闹掰的真相:男方设局想套牢她,5000万美金是房款

生命之泉的奥秘
2026-08-29 20:53:20
父亲用扁担送双胞胎姐妹上大学!俩人高考差3分,考入同一大学,住同一寝室

父亲用扁担送双胞胎姐妹上大学!俩人高考差3分,考入同一大学,住同一寝室

封面新闻
2026-09-04 23:39:05
国王被蒙在鼓里好几天,哈里先联系安全官员,查尔斯震怒:像话吗

国王被蒙在鼓里好几天,哈里先联系安全官员,查尔斯震怒:像话吗

小怪吃美食
2026-09-06 14:32:00
最高9.3分,夯爆了

最高9.3分,夯爆了

来看美剧
2026-09-05 17:59:31
手机涨价潮遇冷:一场没人接盘的“价格游戏”!

手机涨价潮遇冷:一场没人接盘的“价格游戏”!

小柱解说游戏
2026-09-06 01:35:34
网红狗头萝莉回应月入十万:人员成本就要六七万,还没算其它运营成本

网红狗头萝莉回应月入十万:人员成本就要六七万,还没算其它运营成本

韩小娱
2026-09-06 15:45:48
纪委倒查持续加码!在职、退休一视同仁,这五类红线切莫心存侥幸

纪委倒查持续加码!在职、退休一视同仁,这五类红线切莫心存侥幸

职场资深秘书
2026-09-06 16:25:17
哈里梅根再曝严重分歧:男方欲重启半进半出王室模式,女方坚决拒绝

哈里梅根再曝严重分歧:男方欲重启半进半出王室模式,女方坚决拒绝

全球吃瓜现场
2026-09-05 17:25:08
龚爽好友发文悼念,曝龚爽低调抗癌5年,2大因素加重病情,更多细节曝光

龚爽好友发文悼念,曝龚爽低调抗癌5年,2大因素加重病情,更多细节曝光

叨唠
2026-09-05 23:58:23
2026-09-06 19:44:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13931文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

杨紫成90后首位白玉兰影后!《家业》热播曝爸爸暖喊:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
本地
家居
教育
军事航空

房产要闻

突发重磅!海口出台楼市新政!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

教育部:把不必要的检查、评比、填表真正减下来,让老师把心安放在课堂,把爱倾注给孩子。(来源:央视新闻)

军事要闻

美伊互袭油轮 伊朗军方称或对美进行更大规模打击

无障碍浏览 进入关怀版