网易首页 > 网易号 > 正文 申请入驻

大模型也会刷题、看提示、迎合老师:我们可能一直在错误地评价AI

0
分享至


认知神经科学前沿文献分享

论文信息:Peng Wang、Fred Paas,Five Educational-Psychology Lenses for Training and Evaluating AI Models,Educational Psychology Review,2026。DOI:10.1007/s10648-026-10195-8

引言

假设一名学生在老师提供例题、解题模板和关键提示时,数学考试拿到了满分。

但只要撤掉模板、换一种题目表述,或者把数字和情境稍作修改,他的成绩就迅速下降。

我们还会说他真正掌握了数学推理吗?

今天的大模型,可能正面对同样的评价问题。

模型在Benchmark上不断刷新纪录,发布会上充满“推理能力提升”“对齐能力增强”“接近专家水平”等表述。但一个越来越难以回避的问题是:

高分究竟代表模型获得了稳定能力,还是代表它越来越会做特定形式的考试?

2026年发表于《Educational Psychology Review》的一篇文章,尝试用教育心理学重新审视AI训练与评估。作者王彭和 Fred Paas 提出了五种观察视角:课程设计、教学脚手架、评估效度、社会学习和伦理对齐。

这篇文章提出的是一个更加克制、也更加有意思的观点:

教育心理学积累了大量识别死记硬背、应试训练、教师依赖和评分投机的方法。这些方法,同样可以用来审查大模型的能力声明。

核心理论

分数不是能力本身

教育测量学家 Messick 的有一个著名的效度理论,其观点是:效度不是一张试卷天然具有的属性,而是我们能否根据考试成绩,合理推断被测者具备某种能力,放在大模型上,这意味着:一个模型在数学Benchmark上得了90分,并不自动证明它具备“数学推理能力”。还需要排除至少四种替代解释

1. 支持依赖:只有在特定提示词、思维链或工具存在时才能答对;

2. 代理指标优化:学会了能拿分的表面特征,而不是目标能力;

3. 评分者特异性迎合:学会讨好某类标注者,而非形成稳定行为;

4. 应试与污染:见过测试题、相似题,或专门针对Benchmark进行优化。

所以关键或许不在于模型得了多少分,这个分数究竟允许我们对模型作出什么推断?或许是更值得关注的地方

五个教育心理学“镜头”

教育心理学视角

对应的AI实践

作者要求追问的问题

课程设计

数据筛选、难度排序、任务调度、奖励塑形

换一种任务分布后,能力还能迁移吗?

教学脚手架

Few-shot示例、思维链、提示词、工具调用

撤掉或扰动支持后,表现是否崩溃?

评估与效度

Benchmark、排行榜、奖励模型

测到的是能力,还是刷题技巧?

社会学习

模仿学习、RLHF、RLAIF

模型学到了原则,还是迎合某类老师?

伦理对齐

安全训练、拒答规则、宪法式原则

行为是否能跨语言、角色和情境保持稳定?

第一副镜头:训练数据也是一份“课程表”

课程学习并不是新概念。机器学习中早已存在从简单样本到复杂样本、困难样本挖掘、任务分阶段训练以及自适应课程等方法。

文章的新意不在于再次告诉我们“数据顺序很重要”,而是要求开发者证明:

  • 更快收敛是否带来了更好的迁移?

  • 训练中定义的“困难样本”,真的代表概念难度吗?

  • 课程是否缩窄了模型接触的数据分布?

  • 换一种表达、领域或任务后,提升是否仍然存在?

第二副镜头:提示词可能只是“拐杖”

文章认为,所谓“提示词工程”,从教育学角度看更接近教学脚手架设计。

Few-shot示例类似教师提供例题;思维链提示类似要求学生写出解题步骤;检索、计算器和外部工具则提供额外支持。

但脚手架的核心不只是“加上以后成绩提高”,而是要进行渐隐测试:

  • 不再要求逐步思考,准确率还剩多少?

  • 换一种提示模板,效果是否消失?

  • 删除示例或更改示例顺序,模型是否崩溃?

  • 在结构相同、表面不同的问题上,方法能否迁移?

如果一撤掉“让我们一步一步思考”,模型就不会推理,那么更谨慎的结论应当是:这个模型在特定外部结构支持下表现较好。

第三副镜头:Benchmark也会诱发“应试教育”

当一个指标开始决定资源、声誉和模型排名时,它就不再只是测量工具,也会反过来改变训练行为。

开发者会围绕它选数据、调参数、设计提示和修补错误。最终出现的提升,可能来自:

  • 训练集和测试集污染;

  • 对题型和表达格式的熟悉;

  • 利用标注瑕疵和风格线索;

  • 针对排行榜进行专项训练;

  • 通过奖励模型的漏洞获得高分。

这和学校中的“教学围着考试转”非常相似:学生分数提高了,但考试与真实能力之间的关系反而变弱。

第四副镜头:RLHF里的“老师”是谁

通过人类反馈进行强化学习,本质上会让模型更倾向于产生标注者喜欢的回答。

问题在于,“人类偏好”从来不是一个天然统一的变量。它取决于:

  • 标注者来自什么文化和职业背景;

  • 标注规范如何书写;

  • 标注者是否一致;

  • 什么风格更容易被判为“高质量”;

  • 少数群体的偏好是否被平均值淹没。

模型可能没有学会一个普遍原则,只是学会了某一批评分者喜欢的语言风格。

因此文章提出,不应只报告一个平均偏好分数,还应报告评分者间一致性、不同评分者群体的影响,以及模型在不同语言、角色设定和社会情境中的稳定性。

文章还进一步指出,用另一个AI生成训练数据时,那个AI同样是“老师”。它自身的偏见、行为倾向和隐含规则,可能作为“隐藏课程”传递给下一代模型。

第五副镜头:安全拒答不等于道德理解

模型在常见危险提示下稳定拒答,只能证明它在这些条件下表现出了可靠行为。

这不等于它:

  • 理解了伤害为什么错误;

  • 形成了稳定价值观;

  • 具备人类意义上的道德判断;

  • 在所有新情境中都会坚持相同原则。

作者建议用新的价值冲突、提示改写、角色切换、多语言输入和对抗性包装来测试对齐。如果模型换个角色、换种语言或换个叙事框架就改变立场,那么所谓对齐可能只是模板化服从。

五点建议

作者最终把框架压缩为五件事:

  1. 记录训练课程

    :公开不同阶段的数据来源、顺序和难度特征;

  2. 开展脚手架撤除实验

    :报告有提示和无提示、使用工具和不使用工具时的差异;

  3. 把Benchmark当成高风险测量工具

    :提前识别捷径,并设定更新与退役机制;

  4. 审计教师信号

    :记录人类标注者和AI教师的构成、规范、一致性与来源;

  5. 区分行为与理解

    :可靠拒答可以称为可靠行为,不应直接写成“内化了价值观”。

这五条其实构成了一份很实用的模型评测审查表

核心结论

文章把大模型开发重新描述为一套类似教育过程的系统:

  • 训练数据及其顺序,相当于课程设计;

  • 提示词、示例、思维链和工具,相当于教学脚手架;

  • 人类反馈和AI反馈,相当于教师评价与社会化;

  • Benchmark相当于考试;

  • 对齐训练相当于某种功能意义上的规范教育

作者认为,现有大模型取得更高分,并不等于它获得了更强的能力。它可能只是更依赖提示、更擅长迎合评分者,或者更会钻评测规则的空子

分享人:王彭,天天

审核:PsyBrain 脑心前沿编辑部

你好,这里是「PsyBrain 脑心前沿」

专注追踪全球认知神经科学的最尖端突破

视野直击 Nature, Science, Cell 正刊 及核心子刊与顶级大刊

每日速递「深度解读」与「前沿快讯」

科研是一场探索未知的长跑,但你无需独行。欢迎加入PsyBrain 学术社群,和一群懂你的同行,共同丈量脑与心智的无垠前沿。

点击卡片进群,欢迎你的到来

一键关注,点亮星标 ⭐ 前沿不走丢!


一键分享,让更多人了解前沿

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“让企退人员闭嘴”翻车!千万人的民生事,凭什么不让人表达观点

“让企退人员闭嘴”翻车!千万人的民生事,凭什么不让人表达观点

笑熬浆糊111
2026-09-21 08:59:01
放弃中网、接受罚款,37岁张帅如何时隔8年再进亚运决赛?

放弃中网、接受罚款,37岁张帅如何时隔8年再进亚运决赛?

云天之巅明
2026-10-02 07:40:41
金日成综合大学80周年校庆!崔龙海、李日焕等老校友穿校服出席

金日成综合大学80周年校庆!崔龙海、李日焕等老校友穿校服出席

IN朝鲜
2026-10-01 14:58:37
幼儿园活动孩子抽中30份榴莲,妈妈果断请假带娃去游乐园,反抽中樱桃家长内涵

幼儿园活动孩子抽中30份榴莲,妈妈果断请假带娃去游乐园,反抽中樱桃家长内涵

菁妈育儿
2026-09-30 17:20:46
辣眼睛!江苏“扒灰”婚闹,新娘被哄写下侮辱字眼,喜公公嗨翻了

辣眼睛!江苏“扒灰”婚闹,新娘被哄写下侮辱字眼,喜公公嗨翻了

凡知
2026-10-01 14:25:59
法媒:波尔多跌入法第六级;阵容身价暴跌99.98%

法媒:波尔多跌入法第六级;阵容身价暴跌99.98%

懂球帝
2026-10-02 03:24:07
若是不出意外!2027年起,烂尾楼、断供、法拍房或迎来“大变局”

若是不出意外!2027年起,烂尾楼、断供、法拍房或迎来“大变局”

一些小事
2026-10-02 08:31:30
演都不演了!林诗栋夺金后,恶心一幕出现,连日媒都看不下去了

演都不演了!林诗栋夺金后,恶心一幕出现,连日媒都看不下去了

青青衫书生
2026-10-01 15:59:05
上海房东不再低价卖房了,上海浦东一小区去年113平从1060万跌到960万,今年又反弹到988万。房东又有涨价的底气

上海房东不再低价卖房了,上海浦东一小区去年113平从1060万跌到960万,今年又反弹到988万。房东又有涨价的底气

捣蛋窝
2026-10-01 18:03:35
女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

加油丁小文
2026-09-01 07:09:58
条纹背心+抹茶瑜伽裤,轻熟穿搭藏不住好曲线

条纹背心+抹茶瑜伽裤,轻熟穿搭藏不住好曲线

只要高兴就好
2026-10-02 07:57:22
“走树下往身上掉”,美国白蛾泛滥,北京野生动物园办抓“毛毛虫”大赛,3天抓了37斤,4000条只能排第二,装满虫子的塑料盒堆成“小山”

“走树下往身上掉”,美国白蛾泛滥,北京野生动物园办抓“毛毛虫”大赛,3天抓了37斤,4000条只能排第二,装满虫子的塑料盒堆成“小山”

扬子晚报
2026-10-01 09:55:50
是谁下令轰炸中国大使馆?克林顿自传承认错误,幕后“元凶”遭暗杀!

是谁下令轰炸中国大使馆?克林顿自传承认错误,幕后“元凶”遭暗杀!

历史龙元阁
2026-09-30 13:00:30
小沈阳砸了2亿的大片,捧老婆当导演,观众不买账,预售仅940万

小沈阳砸了2亿的大片,捧老婆当导演,观众不买账,预售仅940万

靠谱电影君
2026-09-30 16:53:51
美国国务院确认:已撤销超过25万个签证!

美国国务院确认:已撤销超过25万个签证!

大洛杉矶LA
2026-10-02 07:10:21
他播了26年新闻,一次错都没出过;化疗完,他挑了身体最好的一天,回主播台做完了人生最后一次播报

他播了26年新闻,一次错都没出过;化疗完,他挑了身体最好的一天,回主播台做完了人生最后一次播报

LULU生活家
2026-10-02 08:34:49
金日成综合大学校庆

金日成综合大学校庆

周边问题研究所
2026-10-01 18:10:51
从80万份爆卖到“全是皮”差评,鲍师傅超长蛋挞翻车只用了八天

从80万份爆卖到“全是皮”差评,鲍师傅超长蛋挞翻车只用了八天

ZAKER新闻
2026-09-30 17:53:43
海底捞推出藕汤锅底,工作人员:洪湖藕汤锅底累计销量已超100万份,消费者对其认可度非常高

海底捞推出藕汤锅底,工作人员:洪湖藕汤锅底累计销量已超100万份,消费者对其认可度非常高

极目新闻
2026-10-01 11:31:22
突然发现,陈妤颉居然是五五分的身材,简直颠覆短跑运动员选材标准

突然发现,陈妤颉居然是五五分的身材,简直颠覆短跑运动员选材标准

言过于诚
2026-09-26 21:46:42
2026-10-02 09:20:49
PsyBrain脑心前沿
PsyBrain脑心前沿
追踪脑科学新动态,聚焦认知与神经新研究
685文章数 23关注度
往期回顾 全部

科技要闻

“分手”15天后,华为与赛力斯签约新五年

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

头条要闻

有关伊朗制裁问题 中国在联大投下反对票

体育要闻

“今天的表现,我们可以昂首离开球场”

娱乐要闻

奚梦瑶晒四太豪礼!22只龙凤镯近300万

财经要闻

智谱发上亿Token 能挽回开发者信任吗?

汽车要闻

2027款极氪001将于明年一季度上市 现款猎装同步推新配色

态度原创

房产
艺术
旅游
数码
健康

房产要闻

4000+/平!华侨城,直接把海口楼市的地板给掀了!

艺术要闻

第四届中国美术奖铜奖获得者——李卓

旅游要闻

在雄安,诗意双节踏秋来

数码要闻

8月扫地机器人均价创年内低点!石头科技线上销额登顶

刷酸祛痘,为什么有人翻车?

无障碍浏览 进入关怀版