把大模型蒸馏成小模型,结果学生比老师还差——这个现象在工程里并不少见。原因不在学生学得不够努力,而在它学错了对象。
学生学到的是"过度自信"
![]()
常规蒸馏的做法,是让学生去模仿教师输出的那一个最高概率答案。但原文指出,教师给出的往往是过度自信的、接近独热(one-hot)的输出,而不是背后真正的概率分布。
学生照单全收,学到的就是这种"笃定"的姿态。
两个后果同时发生
原文把这种失败描述得很直接:学生模型既能力更弱,又更自信地犯错。也就是说,它不只是答得差,还答得理直气壮。
- 能力下降:没有学到教师真正的判断依据
- 自信上升:继承了教师被压缩后的确定性表达
问题的根源,是蒸馏过程中丢失了概率分布这一层信息。学生模仿的是结果,不是教师做判断时的完整依据。
为什么这件事值得注意
蒸馏本意是用更小的成本换接近的效果。但如果目标只是复刻那个最可能的答案,学生拿到的就是一个被削平了信息的教师,能力与校准度同时受损。
原文给出的判断是:朴素蒸馏经常失败,原因正在于此。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.