网易首页 > 网易号 > 正文 申请入驻

美国RLHF权威学者发长文科普:Fable 5 不可能蒸馏出K3!

0
分享至

“对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。”

开源大模型领军人物 Nathan Lambert 在 X 上发帖说。


Nathan Lambert 是全球顶尖大模型后训练、RLHF(人类反馈强化学习)权威学者。

他应该是看不下去 针对 K3 的一堆胡乱指责,写了篇关于蒸馏的小作文进行科普。

Nathan Lambert 说,即使 K3 使用了 Claude 等前沿模型生成的数据,这更可能发生在 SFT(监督微调)阶段,用于帮助模型学习推理模式,而不是简单“复制”一个美国顶级模型的能力。

“蒸馏确实可能被使用了,但大家高估了它对最终模型能力的影响。”他分析称,蒸馏最多只是模型训练早期的助推器。

从初始 SFT 数据,到达到 Kimi K3、GLM-5.2 这样的性能水平,中间仍需要大量的数据筛选、强化学习、训练策略优化等复杂过程。真正决定模型上限的,是后训练体系和工程能力,而非是否拥有某个强大的“教师模型”。

他直接发推指出,“中国实验室在 RL 期间并没有使用 Fable / 最强的模型作为教师,那不是蒸馏的工作方式”。

Nathan Lambert还无奈的说,“对于那些指责我在蒸馏问题上充当中国水军的人,我想说:我很早以前就一直担心这个问题。如今,我们才刚刚开始感受到在开放模型领域落后的代价。如果美国不想办法支持本土开放模型的发展,未来情况只会变得更加糟糕。”

以下为博文全文——

我目前对于蒸馏技术的使用方式,以及它究竟能带来多少性能提升的一些看法。

先说明背景:Anthropic 确实曾表示,DeepSeek 等模型正在使用他们的模型参与一种基于强化学习(RL)的数据生成流程,但这并不意味着这种方式带来了显著的性能提升。

这些案例中的样本数量非常少,很可能只是用于初始化一个内部模型,或者进行小规模训练实验。

真正将蒸馏作为关键步骤使用的阶段,是 SFT(监督微调)和/或中期训练(midtraining)阶段(把 SFT 和 midtraining 完全分开来看其实并不合理,因为两者在培养模型推理行为方面存在连续性)。

这也是为什么一些中国模型在输出时会出现“I’m Claude(我是 Claude)”之类的行为。

原因在于,在进行下一词预测(next-token prediction)训练时,模型会学习一些“特征”(features),这些特征实际上是由大量 token 聚类形成的模式,并且会经常出现在模型输出中。

这种 SFT 数据通常是通过绕过 API 原本设计的行为限制,获取模型的推理过程 token(reasoning tokens)生成的。

如果不能直接获得模型的推理token,那么这些数据会非常难以用于训练,而且很可能不会包含类似“我是 Claude”这样的行为模式。

目前,高质量 SFT 数据集的规模通常在 百万级提示词(约 O(1 million prompts)),并配套高质量回答。如今,获取这些提示词往往才是最困难的部分——尤其是那些经过精心设计、未来可以用于强化学习(RL)的环境型任务提示。不过,这更多影响的是 SFT 阶段。

说到底,SFT 蒸馏真正可能发挥巨大作用的地方,是当模型进入一个新的专业领域时。

一个很好的例子是 CripPT 物理基准测试,在这个领域,美国实验室目前领先很多。

理论上,可以获取一些专业领域的问题提示,然后让一个前沿模型生成答案,用这些数据作为新模型初始 SFT 的训练材料。

但是,即便拥有了一套初始 SFT 数据,要让一个模型达到 GLM 5.2 和 Kimi K3 这样的性能水平,仍然需要大量工作。


SFT 阶段只是构建后训练(post-training)体系的开始,后续还有一个漫长且艰苦的过程,包括:


  • 生成更多 SFT 数据;
  • 对数据进行筛选(类似 rejection sampling,拒绝采样);
  • 通过大规模强化学习不断优化模型行为。

对于 Kimi K3 和 GLM-5.2 这样的模型,从时间线来看,Fable 5 很可能没有作为它们的蒸馏教师模型产生影响。不过,未来模型可能会从 Fable 5 这类前沿模型中获益。

而随着后训练越来越依赖诸如 多教师在线策略蒸馏(multi-teacher on-policy distillation) 等技术,而不仅仅是强化学习,SFT 蒸馏究竟如何影响最终模型,变得更加复杂。

整个过程包含很多环节,而且强化学习已经在最终模型能力中占据越来越重要的比例。

这里最关键的一点是:在上述 SFT 阶段,最强的教师模型通常并不是最容易被整合进后训练流程的模型。

例如,目前领先的完全开放推理模型 SFT 项目——如 Open Thoughts 和 OLMo——在尝试更新训练流程、使用最强模型作为教师时,都遇到了很大困难。

很多时候,真正优秀的教师模型反而是一些规模更小、出人意料的模型。

这意味着,推动蒸馏进步的可能并不一定是最顶尖的闭源模型!整个过程非常复杂。

综合来看,目前关于后训练阶段的证据表明,蒸馏的重要性正在下降。

过去,在强化学习尚未大规模应用之前,蒸馏的重要性更高,因为在基础模型(base model)之上,通过 SFT 获得的性能提升占最终能力的比例更大。

但随着 RL 规模扩大,这种趋势正在改变。我认为这一趋势还会持续,尤其是在开放权重模型(open-weight models)越来越强的情况下。

同时,教师模型存在的不确定性,也削弱了一种常见观点——即开放模型只是通过“蒸馏洗白”(distillation washing)获得能力。

因为如果必须依赖 Claude 或 GPT 的 API 才能实现蒸馏,那么开放模型的发展空间会受到限制。

但现实可能恰恰相反,开放模型可能本身更容易被蒸馏,因为它们更容易修改、更容易实验、更方便研究人员进行调整和迭代。

这才是目前蒸馏竞争格局中更值得关注的方向。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

天天热点见闻
2026-08-29 08:53:35
正式确定!CBA顶级外援完成转会,加盟新疆男篮

正式确定!CBA顶级外援完成转会,加盟新疆男篮

体坛瞎白话
2026-09-06 17:12:32
华为常务董事余承东:刘德华将亮相下午新品发布会

华为常务董事余承东:刘德华将亮相下午新品发布会

CNMO科技
2026-09-07 10:07:05
200亿龙头,被107个应届生上了一课

200亿龙头,被107个应届生上了一课

凤凰网财经
2026-09-01 23:50:47
王凯《交锋》首播收视第1,观众评价出奇一致,惊险刺激尺度大

王凯《交锋》首播收视第1,观众评价出奇一致,惊险刺激尺度大

孤傲何妨初
2026-09-07 09:00:27
银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

银行催你换三代社保卡?内部员工坦白 3 个真话,别再被套路了

娱乐圈见解说
2026-09-05 03:26:57
2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

2026年,中国小学一年级新生人数迎来了一个历史性的转折点。

一口娱乐
2026-09-07 07:59:43
急眼了,德国总理向全世界喊话了。

急眼了,德国总理向全世界喊话了。

果妈聊娱乐
2026-09-06 08:27:51
日本急了,高市早苗亲自强烈抗议

日本急了,高市早苗亲自强烈抗议

牛弹琴
2026-09-06 08:51:53
英国网红在泰国接受增大术后死亡

英国网红在泰国接受增大术后死亡

张可象博士
2026-09-06 17:48:35
比米饭还升糖的6种蔬菜,晚上尽量少吃!很多人天天当减肥菜吃

比米饭还升糖的6种蔬菜,晚上尽量少吃!很多人天天当减肥菜吃

刘哥谈体育
2026-09-06 11:21:35
加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

加拿大一咖啡店将“美式咖啡”改名“加式咖啡”,“为表达不满”

南方都市报
2026-09-06 11:41:02
威廉凯特对哈里梅根亮出“沉默杀”:他们回英做臣民!

威廉凯特对哈里梅根亮出“沉默杀”:他们回英做臣民!

全球奇趣娱乐八卦
2026-09-07 05:55:13
太惨烈!伊朗精锐被困隧道数月,真主党士兵出洞即被杀

太惨烈!伊朗精锐被困隧道数月,真主党士兵出洞即被杀

老马拉车莫少装
2026-09-04 20:38:48
性感与反差:是我在镜面与目光之间为自己留出的可调节反射率

性感与反差:是我在镜面与目光之间为自己留出的可调节反射率

疾跑的小蜗牛
2026-09-06 20:42:05
40岁宋仲基近况曝光!与宋慧乔离婚已经7年,如今娶英国美女婚姻幸福

40岁宋仲基近况曝光!与宋慧乔离婚已经7年,如今娶英国美女婚姻幸福

代军哥哥谈娱乐
2026-09-06 09:45:51
美国母亲杀害3个亲生孩子案审判无效!陪审团11比1僵持,检方或将重审

美国母亲杀害3个亲生孩子案审判无效!陪审团11比1僵持,检方或将重审

华人生活网
2026-09-07 04:18:27
去世的人为何头七回家,老道:不是看望亲人,而是要带走这两件东西

去世的人为何头七回家,老道:不是看望亲人,而是要带走这两件东西

古怪奇谈录
2025-08-19 17:13:32
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
美网惊现“王炸组合”!费德勒千金配休伊特公子,基因太强了

美网惊现“王炸组合”!费德勒千金配休伊特公子,基因太强了

陈意小可爱
2026-09-06 02:16:56
2026-09-07 11:27:00
AI先锋官 incentive-icons
AI先锋官
AIGC大模型及应用精选与评测
660文章数 104关注度
往期回顾 全部

科技要闻

OpenAI内部开卷! 头部员工一天烧掉5万元

头条要闻

两个女生同名同姓、同年同月同日生 考上同校同个专业

头条要闻

两个女生同名同姓、同年同月同日生 考上同校同个专业

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

张柏芝带儿子冲浪,一起看风景

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
家居
数码
本地
公开课

《神鬼寓言4》NPC全手搓!拖这么久就有原因的

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

69元起 小米智能开关2开售:单零火兼容、支持小米澎湃智联

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版