网易首页 > 网易号 > 正文 申请入驻

微软×UIUC:给每个学生造一个「数字分身」,AI教师终于有了陪练

0
分享至



User simulator 正在进入 AI agent 训练流程。客服、电商、医疗问诊、网页操作等场景里,研究者会构造模拟用户,让 agent 在上线前经历更多交互,测试策略、话术和鲁棒性。

教育场景也需要这样的模拟用户,只是这里的「用户」,也就是「学生」,更难模拟:一个学生有相对稳定的知识边界、错误习惯和学习轨迹;学生模拟强调的是学生认知动态的保真,同一句指导,可能让一个学生改正错误,也可能让另一个学生只学会套答案。

这也是学生数字孪生受到关注的原因。AI 教师要学习个性化指导,需要看到学生对教学内容、教学策略的反应。真实学生反馈可以提供这些信号,而获取往往要通过学生参与人类测试,成本很高。

直接让大模型扮演学生,看起来是省事的方案。如果告诉它「你是一个基础薄弱的小学生」,模型可以立刻换成小学生口吻,也能表现出犹豫和不确定。

但角色语气和认知水平不是一回事。一个模型可以用低龄学生的语气回答「我不太懂」,下一句却给出微积分级别的推理。它看起来在扮演学生,实际反馈仍然受模型自身知识储备影响。

用于 AI 教师训练时,这种偏差会带来问题。AI 教师得到的不是某个学生在当前能力边界下的反应,而是一个高能力模型经过人设包装后的反应。

微软和 UIUC 近期的合作研究 StudentSim,正是从这个问题出发。教育学里评价一次指导是否有效,不仅只看学生独立作答时的表现,也要看学生在接受帮助后能走多远。Vygotsky 提出的「最近发展区」讨论的就是这件事:学生当前能独立完成什么,和在教师支持下能够完成什么,中间的差距反映了教学可以介入的空间。

放到学生模拟器上,这个思想对应两类能力。第一,模拟器要能复现学生独立作答时的状态,包括能力边界、错误习惯和常见选择。第二,模拟器要能在读到教师指导后产生相应变化,表现出这个学生在帮助下可能出现的认知状态的更新。

StudentSim 把这两类能力分别定义为 behavioral fidelity 和 guidance responsiveness,并用真实学生记录训练个性化学生模拟器。这样得到的 AI 学生,不只输出一个「像学生」的回答,还要能对教学指导作出可测的响应。



  • 论文标题:StudentSim: Training LLM-based Student Simulators
  • 论文链接:https://arxiv.org/abs/2609.01591
  • 项目代码:https://github.com/microsoft/StudentSim
  • 项目主页:https://microsoft.github.io/StudentSim/
  • Hugging Face Paper 主页:https://huggingface.co/papers/2609.01591

AI 教师正在变得越来越会讲题。但一个更难的问题是:它怎么知道自己讲得有没有用?

在真实课堂里,教师不能只输出答案。学生听完之后会不会改正错误,会不会暴露新的误区,会不会因为提示太直接而跳过思考,才是教学是否有效的关键信号。对于 AI 教师来说,这个反馈尤其昂贵。每改一次教学策略,都需要真实学生参与、等待他们完成学习,再用 human study 验证效果。这个过程往往以周为单位,远慢于今天大模型和 AI 教师的迭代速度。



这正是 StudentSim 想解决的问题:它是一个基于真实学生数据训练的个性化学生模拟器框架,目标是为每个学生训练一个对应的模拟器,让它既能复现该学生的错误和能力边界,又能在读到教师指导后产生合理更新。

研究团队同时提出 StudentSimEval,用统一协议评估学生模拟器的两个核心能力:behavioral fidelity 和 guidance responsiveness。前者衡量模拟器是否像目标学生,后者衡量它是否能在教师指导后向正确方向更新。

这两个指标对应了 AI 教师训练中最需要的两类信号:一个个性化起点,以及一个可被教学干预影响的学习动态。

为什么 prompt 一个 LLM 还不够?

过去的学生建模方法大致分成两类。

一类是知识追踪和行为预测模型。它们基于真实学习轨迹,通常后验记录学生状态。但这类方法缺少自然语言指导输入通道。换句话说,它们能比较精确地追踪学生过去怎么做,却很难回答「如果老师这样讲,学生会不会改」。

另一类是 LLM 角色扮演。给大模型一段充足的学生画像,让它扮演某个水平的学生,再让它读教师解释并给出反应。这类方法能流畅处理自然语言指导,但问题在于认知水平不保真。一个 LLM 可以用幼儿园语气说话,却仍然带着远超目标学生的知识和推理能力。

StudentSim 试图解决这两大问题:直接从学生数据中训练模拟器。



框架采用两阶段训练。第一阶段,将同一领域内多个学生的记录汇总,训练一个 domain-level base simulator,让模型学习该领域中常见的错误模式、回答格式和指导后的修正路径。第二阶段,再用单个学生自己的少量记录进行 specialization,得到一位学生对应的一支模拟器。

这种设计针对的是真实教育数据中的常见难题:单个学生的数据通常很稀疏,但同一领域里不同学生之间又共享大量结构性规律。StudentSim 先学习群体先验,再学习个体差异。

三个领域,60 个学生

为了避免只在单一任务上验证,研究团队构建了 StudentSimEval,覆盖国际象棋、第二语言英语写作和基础数学三个领域,共 60 名学生。

在国际象棋中,模拟器需要预测某个玩家在棋盘位置上的下一步走法,并在读到自然语言教练指导后更新走法。在二语写作中,模拟器需要生成符合特定学习者错误分布的英文作文,并根据教师修改建议改写片段。在数学中,模拟器需要预测学生会给出哪个解,并在读到教师指导后改正。

所有方法都在相同的 per-student training records 上拟合,并在相同 held-out records 上评估。

结果显示,StudentSim 在三个领域的 fidelity 和 responsiveness 上均超过最强可用基线。



例如,在国际象棋任务中,StudentSim 的 behavioral fidelity 达到 0.5150,高于 Maia2 的 0.4535,也明显高于 GPT-5.4 的 0.2316;guidance responsiveness 达到 0.9067,高于 GPT-5.4 的 0.7186 和 Maia2 的 0.2721。

这个结果也呈现出两类基线的典型短板。Maia2 能较好预测人类棋手的 move distribution,但没有自然语言指导输入通道,因此 responsiveness 较低。GPT-5.4 能读懂指导并做出响应,但无法稳定复现具体学生的能力、习惯和错误,因此 fidelity 较低。StudentSim 则同时提升了两项指标。

从学生模拟器到 AI 教师强化学习

论文还进一步验证了 StudentSim 能否作为 AI 教师训练中的反馈信号。



研究团队在国际象棋教学场景中构建了一个训练教师模型的 RL proof of concept。训练过程中,AI 教师根据真实学生记录中的错误走法生成指导;冻结的学生模拟器读到指导后输出修正走法;奖励函数根据修正走法相对原错误走法的 Stockfish 质量提升来更新教师模型。

对照组包括不做 RL 的 SFT 教师模型,以及使用 GPT-5.4 作为学生模拟器 reward 的 RL 教师模型。三组共享同一个 tutor policy、同一个 SFT 起点和相同 GRPO 设置,区别只在 reward 来源。

最终由 8 名国际象棋评估者进行盲评。StudentSim reward 训练出的 AI 教师在三项指标上均最高:accuracy 90.5%,guidance quality 3.31,personalization 3.93。相比之下,No RL 的 accuracy 为 75.7%,GPT-5.4 reward 为 71.6%。

研究团队强调,这并非是「最强 AI 教师」的声明,而是为了验证一个更基础的问题:一个同时具备 fidelity 和 responsiveness 的学生模拟器,是否能为 AI 教师优化提供有用的代理反馈。结果表明,StudentSim 作为 reward 来源,比单纯 prompt frontier LLM 更有效,也更适合本地部署和定制。

对 AI 教育系统来说,这意味着一个新的训练闭环:真实学生数据不只用于评估 AI 教师,也可以用于训练可复用的学生模拟器;这些模拟器再为 AI 教师的策略优化提供高通量反馈。

作者简介

杨可,UIUC 计算机第四年在读博士,导师为翟成祥教授,本科毕业于清华大学。研究方向为 AI agents、语言模型、信息检索与多模态基础模型,同时关注 AI 系统中的偏见与歧视问题。曾在 Amazon AWS、Microsoft Research Deep Learning Group、Google 实习。个人主页:https://empathyang.github.io

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国产手机失算了,集体涨价几百上千,原以为门庭若市,结果门可罗雀

国产手机失算了,集体涨价几百上千,原以为门庭若市,结果门可罗雀

王新喜
2026-09-04 11:21:22
中国女篮拒绝输球!全力击败捷克队,王思雨复出,央视直播

中国女篮拒绝输球!全力击败捷克队,王思雨复出,央视直播

体坛瞎白话
2026-09-05 08:38:03
儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

橘子约定
2026-08-30 14:06:45
开纯电车跑了一趟云南,回来后我默默把车挂上了二手平台

开纯电车跑了一趟云南,回来后我默默把车挂上了二手平台

民间马后炮
2026-09-03 19:49:21
985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

985硕士李雷阳遇难,入职仅5天刚穿上白制服,聊天记录看哭无数人

小嵩
2026-09-05 14:38:43
绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

绝平被吹!1-2主场惨遭逆转 13.6亿卫冕冠军惨遭爆冷开局3轮不胜

狍子歪解体坛
2026-09-05 07:20:00
我空降到老婆公司当总裁,开会时坐在她旁边,她男助理竟一脚踹开我的椅子:这是我的位置,你滚开,老婆当场傻眼了

我空降到老婆公司当总裁,开会时坐在她旁边,她男助理竟一脚踹开我的椅子:这是我的位置,你滚开,老婆当场傻眼了

晓艾故事汇
2026-09-04 08:32:39
杨小菁,当选许昌市委书记(附简历)

杨小菁,当选许昌市委书记(附简历)

大风新闻
2026-09-05 16:42:02
网友反映甘肃兰州榆中县存在“染色莴笋”,当地农业农村局工作人员表示:问题莴笋已查封(销毁)

网友反映甘肃兰州榆中县存在“染色莴笋”,当地农业农村局工作人员表示:问题莴笋已查封(销毁)

大风新闻
2026-09-05 14:47:15
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
君子报仇十年不晚!72名以议员直接绕开中国,支持台湾加入国际组织,可他们没想到中国转头支持巴勒斯坦建国

君子报仇十年不晚!72名以议员直接绕开中国,支持台湾加入国际组织,可他们没想到中国转头支持巴勒斯坦建国

扶苏聊历史
2026-09-05 17:13:58
破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

破船永久不走了!国防部这次不再忍,没等菲方闯岛直接给了下马威

吕醿极限手工
2026-09-04 17:54:15
大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

新智元
2026-09-05 08:01:01
韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

韩媒放狠话!汉字并非中国独有,它是亚洲瑰宝,韩国也将实施全民汉字教育

小徐讲八卦
2026-09-04 13:48:19
海拔3200米沙漠连夜搜救,1岁裸体走失男童被找到,事件详情披露

海拔3200米沙漠连夜搜救,1岁裸体走失男童被找到,事件详情披露

扬子晚报
2026-09-05 10:55:31
武大学术圈妲己上位后续:女方被曝更多猛料,她从小就是乖乖女!

武大学术圈妲己上位后续:女方被曝更多猛料,她从小就是乖乖女!

小娱乐悠悠
2026-09-05 14:51:35
罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

罗志祥复出登上热搜,《极限挑战》导演发布长文:六人齐聚才是极限挑战,并询问观众是否期待重拍

新浪财经
2026-09-05 12:05:31
一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

一辆中国SUV让《纽约时报》实测10天,并推出整版报道;美消费者破防:我们可能永远买不到

第一财经资讯
2026-09-05 12:44:09
“韩国考虑向霍尔木兹海峡派遣海军”,韩媒披露原因

“韩国考虑向霍尔木兹海峡派遣海军”,韩媒披露原因

参考消息
2026-09-05 17:29:04
武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

武大举报风波升级!终于查实:付磊教授的原配妻子为汪海英,曾任该校的行政干部

火山詩话
2026-09-05 17:49:34
2026-09-05 19:52:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13924文章数 142729关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

头条要闻

知名摇滚歌手何勇去世 崔健曾评价"这小子真了不起"

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

数码
游戏
健康
艺术
公开课

数码要闻

IFA2026现场直击:绿联双馆齐发,AI全家桶抢占C位

《漫威金刚狼》男主曾演XBOX大作:建模差距引热议

脑梗取栓成功≠活下来,还有这三关

艺术要闻

为啥骂赵孟頫的人,晚年都幡然醒悟,看他这幅顶级行书就知道了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版