网易首页 > 网易号 > 正文 申请入驻

大模型也会刷题、看提示、迎合老师:我们可能一直在错误地评价AI

0
分享至


认知神经科学前沿文献分享

论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8

引言

假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。

但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。

我们还会说他真正掌握了数学推理吗?

今天的大模型,可能正面对同样的评价问题。

模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:

高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?

2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者王彭和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。

这篇文章提出的是一个更加克制、也更加有意思的观点:

教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。

核心理论

分数不是能力本身

教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释

1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;

2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;

3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;

4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。

所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方

五个教育心理学“镜头”

教育心理学视角

对应的AI实践

作者要求追问的问题

课程设计

数据筛选、难度排序、任务调度、奖励塑形

换一种任务分布后,能力还能迁移吗?

教学脚手架

Few-shot示例、思维链、提示词、工具调用

撤掉或扰动支持后,表现是否崩溃?

评估与效度

Benchmark、排行榜、奖励模型

测到的是能力,还是刷题技巧?

社会学习

模仿学习、RLHF、RLAIF

模型学到了原则,还是迎合某类老师?

伦理对齐

安全训练、拒答规则、宪法式原则

行为是否能跨语言、角色和情境保持稳定?

第一副镜头:训练数据也是一份“课程表”

课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。

文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:

  • 更快收敛是否带来了更好的迁移?

  • 训练中定义的“困难样本”,真的代表概念难度吗?

  • 课程是否缩窄了模型接触的数据分布?

  • 换一种表达、领域或任务后,提升是否仍然存在?

第二副镜头:提示词可能只是“拐杖”

文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计。

Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。

但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试:

  • 不再要求逐步思考,准确率还剩多少?

  • 换一种提示模板,效果是否消失?

  • 删除示例或更改示例顺序,模型是否崩溃?

  • 在结构相同、表面不同的问题上,方法能否迁移?

如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。

第三副镜头:Benchmark也会诱发“应试教育”

当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。

开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:

  • 训练集和测试集污染;

  • 对题型和表达格式的熟悉;

  • 利用标注瑕疵和风格线索;

  • 针对排行榜进行专项训练;

  • 通过奖励模型的漏洞获得高分。

这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。

第四副镜头:RLHF里的“老师”是谁

通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。

问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:

  • 标注者来自什么文化和职业背景;

  • 标注规范如何书写;

  • 标注者是否一致;

  • 什么风格更容易被判为“高质量”;

  • 少数群体的偏好是否被平均值淹没。

模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。

因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。

文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。

第五副镜头:安全拒答不等于道德理解

模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。

这不等于它:

  • 理解了伤害为什么错误;

  • 形成了稳定价值观;

  • 具备人类意义上的道德判断;

  • 在所有新情境中都会坚持相同原则。

作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。

五点建议

作者最终把框架压缩为五件事:

  1. 记录训练课程

    :公开不同阶段的数据来源、顺序和难度特征;

  2. 开展脚手架撤除实验

    :报告有提示和无提示、使用工具和不使用工具时的差异;

  3. 把Benchmark当成高风险测量工具

    :提前识别捷径,并设定更新与退役机制;

  4. 审计教师信号

    :记录人类标注者和AI教师的构成、规范、一致性与来源;

  5. 区分行为与理解

    :可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。

这五条其实构成了一份很实用的模型评测审查表

核心结论

文章把大模型开发重新描述为一套类似教育过程的系统:

  • 训练数据及其顺序,相当于课程设计;

  • 提示词、示例、思维链和工具,相当于教学脚手架;

  • 人类反馈和AI反馈,相当于教师评价与社会化;

  • Benchmark相当于考试;

  • 对齐训练相当于某种功能意义上的规范教育

作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子

分享人:王彭,天天

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿」

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
足坛大地震!曼城或被逐出英超!哈兰德领衔群星遭皇萨哄抢

足坛大地震!曼城或被逐出英超!哈兰德领衔群星遭皇萨哄抢

奶盖熊本熊
2026-10-02 07:44:32
农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

农业农村部:在充分尊重农民意愿基础上盘活利用闲置农房,让农民多一份财产性收入!

极目新闻
2026-09-29 13:50:07
美股收盘:三大指数集体上涨;半导体、存储板块多数上涨,SK海力士涨超5%,美光科技涨超3%;油价、金银价格齐涨

美股收盘:三大指数集体上涨;半导体、存储板块多数上涨,SK海力士涨超5%,美光科技涨超3%;油价、金银价格齐涨

中新经纬
2026-10-02 06:22:23
危险信号出现!俄罗斯正式公布动用核武器条件,目标却不是乌克兰

危险信号出现!俄罗斯正式公布动用核武器条件,目标却不是乌克兰

月下守候
2026-10-02 08:09:00
泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

泽连斯基走出总统府,画面传到俄军指挥中心,基辅无秘密冒头就打

吃瓜小侦探
2026-10-01 18:53:55
迪拜航空劫机事件成“罗生门”,以色列和伊朗疑似打嘴仗

迪拜航空劫机事件成“罗生门”,以色列和伊朗疑似打嘴仗

红星新闻
2026-10-01 15:00:24
《神探》国庆档首日夺冠,古天乐新片7小时票房仅92万,成本超1亿

《神探》国庆档首日夺冠,古天乐新片7小时票房仅92万,成本超1亿

靠谱电影君
2026-10-01 08:25:21
年轻人穿件印着“1945年8月15日 日本投降”的T恤逛车展,被骂成极端分子,这事儿有点荒唐

年轻人穿件印着“1945年8月15日 日本投降”的T恤逛车展,被骂成极端分子,这事儿有点荒唐

网络易不易
2026-07-11 10:38:35
新加坡一酒店华人员工拒绝中文沟通引爆热搜!中国游客怒斥:“这难道不是种族歧视”?!

新加坡一酒店华人员工拒绝中文沟通引爆热搜!中国游客怒斥:“这难道不是种族歧视”?!

新加坡万事通
2026-09-30 18:53:54
WTT中国大满贯:男单世界冠军横扫,国乒3场3-0,首日仅输1场外战!

WTT中国大满贯:男单世界冠军横扫,国乒3场3-0,首日仅输1场外战!

刘姚尧的文字城堡
2026-10-01 21:39:44
葡萄牙4-2胜丹麦,主帅强硬表态未向C罗道歉,C罗离队后球队表现如何?两人彻底闹僵了吗?

葡萄牙4-2胜丹麦,主帅强硬表态未向C罗道歉,C罗离队后球队表现如何?两人彻底闹僵了吗?

之乎者也小鱼儿
2026-10-02 07:35:29
出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

出轨女子第二波聊天记录曝光,虎狼之词惊呆吃瓜网友,她嫌丢人开始批量投诉了

汉史趣闻
2026-09-01 17:55:01
张家齐直播回应“被指说话强势”:我要是不强势,我就不会是奥运冠军;此前张家齐在综艺中与母亲相处模式引热议

张家齐直播回应“被指说话强势”:我要是不强势,我就不会是奥运冠军;此前张家齐在综艺中与母亲相处模式引热议

极目新闻
2026-09-29 11:29:47
澳门纪律部队首次以中式队列步操亮相

澳门纪律部队首次以中式队列步操亮相

澎湃新闻
2026-10-02 07:34:18
原来最喜欢刘欢的,不是毛阿敏也不是那英,而是频繁去他家里的她

原来最喜欢刘欢的,不是毛阿敏也不是那英,而是频繁去他家里的她

凡知
2026-10-01 11:29:30
金牌数量腰斩!国羽启动深度改革,教练组先行洗牌,多项主力组合面临拆对

金牌数量腰斩!国羽启动深度改革,教练组先行洗牌,多项主力组合面临拆对

小兰看体育
2026-10-02 00:05:04
男排半决赛时间出炉!中国队再遇老对手很难打,2日18点20分开打

男排半决赛时间出炉!中国队再遇老对手很难打,2日18点20分开打

老吴说体育
2026-10-01 20:53:35
109岁老红军范希贤逝世,曾在“文夕大火”中叫醒周恩来、叶剑英

109岁老红军范希贤逝世,曾在“文夕大火”中叫醒周恩来、叶剑英

观察者网
2026-10-01 10:27:07
中国取消高市早苗“日本首相”称呼

中国取消高市早苗“日本首相”称呼

凤眼论
2026-10-01 13:16:35
最近值得看的五部电视剧,《无可替代》排在第二,你在追哪一部?

最近值得看的五部电视剧,《无可替代》排在第二,你在追哪一部?

周老师讲电影
2026-10-02 08:00:46
2026-10-02 08:40:49
PsyBrain脑心前沿
PsyBrain脑心前沿
追踪脑科学新动态,聚焦认知与神经新研究
685文章数 23关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

家居
房产
旅游
健康
游戏

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

旅游要闻

在雄安,诗意双节踏秋来

刷酸祛痘,为什么有人翻车?

《羊蹄山之魂》更新加入QSSR 关原回响等同步推出

无障碍浏览 进入关怀版