网易首页 > 网易号 > 正文 申请入驻

张一鸣为什么反对蒸馏?

0
分享至

嗅态

嗅产业冷暖,书人文姿态


作者 | 石灿

7月,字节跳动Seed团队召开了一场内部会议,会议提及的内容包括把的原因,也就是集中力量,才能在算力和数据上有优势。

8月初,更重要的信息才被国内外多家媒体报道出来,字节跳动创始人张一鸣在会上谈到了“模型蒸馏”。他反对“模型蒸馏”。

在业内,模型蒸馏被普遍视作一种提升效率的替代方案。通过学习领先模型,较小的模型能在更短时间内获取部分能力,从而降低算力成本、缩短研发周期。对追赶者而言,这是一条见效快、成本低的技术选择。

蒸馏可以帮助模型更快追上一个已经存在的目标,却很难回答目标之外还有什么。根据会议内容可以看得出来,字节明确了Seed团队对基础模型研发路线的取舍。

过去半年,世界范围内的AI大模型百花齐放。其中,字节跳动在多模态领域持续布局,视频生成模型Seedance推出后引发市场热烈讨论,深刻影响着AI视频生成领域;而在语言模型领域,海外的Claude、Gemini不断推高上限,国内的DeepSeek、智谱、月之暗面也在推理和代码等垂直方向密集迭代。

面对未知地带,张一鸣选择让Seed自己去找答案。代价是更多算力、更长训练周期、大量可能没有结果的实验,以及产出常人能够理解的组织耐心。这样的选择未必马上反映在AI大模型榜单上,却决定了一家公司有没有能力走进没有现成答案的地方。

环顾四周,中国大模型行业发展到今天,不同公司间的技术路线之分或许就在这里。而字节的处境,与其他大模型公司,格外不同。


蒸馏背后的能力之争

字节对模型蒸馏的限制,比外界想象得更彻底。

限制覆盖了整个外部模型生态。美国前沿闭源模型不能用于蒸馏,开源模型同样被纳入禁区。为了把规则真正落到研发环节,字节内部还通过API调用检测等方式加强管理,减少研发团队借助外部模型输出提升能力的空间。

表面上看,张一鸣反对蒸馏是对一种技术路径的取舍,放到Seed的发展阶段来看,背后其实是对大模型研发路线的一次选择。

张一鸣的判断很明确。训练大模型是一项高难度、长周期的工程,模型能力最终需要建立在预训练、数据、算法和工程体系的长期积累上。即使Seed的产出当前与全球前沿水平仍有差距,字节也愿意承受阶段性的落后,把自主训练这条路完整走一遍。

这场关于蒸馏的讨论,也由此超出了技术方法本身。中国大模型逐渐逼近全球前沿之后,一个更重要的问题摆到了行业面前:当追赶进入更深水区,大模型公司真正比拼的究竟是什么?

理解这场分歧,需要先回到模型蒸馏在大模型产业中的具体位置。

模型蒸馏本身是一项成熟的技术。简单来说,就是用能力更强的“教师模型”去引导规模较小的“学生模型”,在大幅降低参数与推理成本的同时,提升模型的部署效率。如今,这已是行业优化模型性能的通用手段。

行业的争议焦点,其实集中在另一类行为上——利用竞争对手的闭源模型接口,通过大规模调用获取输出数据,再拿这些数据去训练自己的基础模型。这种做法在业内通常被称为模型“黑盒蒸馏”。

这种模式的吸引力显而易见。对资源有限的团队来说,直接调用领先模型生成高质量样本,能省去海量的数据构建成本,让新模型在代码、数学和逻辑推理等硬指标上实现“弯道超车”。此前,不少开源社区也是借由这种“教师模型”输出的迁移,快速把小模型的性能提升了上去。

但是,蒸馏天然存在“教师模型天花板”,基础模型的竞争,终究不单是榜单分数的比拼,更是数据体系、架构演进、预训练、强化学习及工程能力的综合沉淀。若训练数据大量源自对手模型,最终也只能学到对方的能力边界,难以摸到真正的动力内核。

对于立志冲进全球第一梯队的大模型公司来说,长期依赖外部模型的输出,无异于将自身的上限交给了对手。更深层的问题在于,研发组织的长期演化。

大模型竞争本质上是一场技术基础设施的建造工程。许多硬功夫必须在长期的自主探索中熬出来,比如,高质量数据治理、训练系统优化、算法创新、强化学习设计。如果团队习惯靠外部数据去拉高指标,组织就极其容易退化为一套仅围绕数据筛选和微调优化的工程打法,进而失去对底层模型规律的探索能力。

与此同时,外部模型蒸馏还面临着日趋严峻的商业与合规风险。美系大模型巨头陆续升级产品接口的异常监测,并在服务条款里限制数据采集与模型训练。拿竞品模型的输出来训练自家产品,不仅在行业里引发了关于研发边界的讨论,也在知识产权和服务条款的合规层面上带来不少变数。

曾引起一阵波澜的事件发生在今年2月,Anthropic控诉DeepSeek、Moonshot和MiniMax大规模利用Claude进行所谓的“蒸馏攻击”,指其通过数万个账号产生了超过1600万次交互。7月,月之暗面发布新一代模型Kimi K3后,也迅速被美国公司关注和指控。也就是说,模型蒸馏正在从一个纯粹的技术问题,变成知识产权、服务条款和国际AI竞争中的焦点议题。

毕竟字节家大业大,TikTok在美国的一举一动都被盯着,前些年经历了严酷的调查,它能承担的合规风险跟一般创业公司根本不在一个量级。张一鸣这时候对蒸馏表现出来的谨慎,说白了,就是宁可走得慢一点、贵一点,也绝不能在底层版权和合规上给对手留下一丁点把柄。

随着美系巨头不断收紧API权限与审计风控,靠“借力”维系的技术路径正面临更多不确定性。减少对外部数据供给的依赖,不仅是为了应对眼下的合规与法务风险,也是字节在为未来参与全球市场竞争,提前进行的一场研发体系筹谋。


守住创造能力的组织机制

张一鸣对大模型路线的新判断,正在改变Seed团队的研发方式。

放弃依赖外部模型蒸馏,意味着Seed需要承担更高的不确定性。缺少成熟参照之后,训练数据如何构建、模型架构如何调整、能力突破来自哪里,都需要研发团队自行探索。基础模型研发天然伴随大量失败实验,真正考验的是组织对于长期探索的承受能力。

一次大规模预训练通常需要数月周期,新方向可能投入巨大资源,却无法立即产生明显结果。如果评价体系过度依赖短期排名和阶段性成果,研究团队很难持续探索未知路径。

近期,多家媒体报道称,字节跳动Seed正在推进超大规模基础模型研发。《金融时报》报道,字节正在训练一个可能达到数万亿参数规模的模型,目前仍处于研发阶段,最终参数规模和发布时间尚未确定。

超大规模训练计划释放出了一个清晰的信号,字节希望继续通过扩大预训练规模,寻找模型能力提升空间。Seed在视频模型领域的探索,极大地增强了字节在底层训练路线上的信心。

今年2月,字节接连推出视频生成模型Seedance 2.0和图片生成模型Seedream 5.0 Lite。两款视觉模型很快进入行业视野,Seedance 2.0尤其突出,内测阶段便在国内外社交平台刷屏,成为当时讨论度最高的视频生成模型之一。

热度很快转化成收入。据36氪6月报道,Seedance 2.0已经成为火山引擎MaaS业务最重要的增长来源,单月贡献收入超过10亿元。火山引擎也在4月将2026年MaaS业务营收目标上调至150亿元,而2025年全年MaaS收入约为15亿元。

大模型竞争进入深水区后,组织方式也面临调整。

长期以来,字节依靠多领域的赛马机制推动创新,多个小团队通过快速试错寻找机会,再根据结果投入资源。这套方法适合互联网应用层面的产品竞争,却难以完全适配基础模型研发。一次训练需要消耗大量算力,多方向并行探索会带来显著资源压力。

因此,Seed正在提高核心模型研发的资源集中度。《晚点LatePost》报道称,字节正在整合Coding相关研发资源,并吸引包括DeepSeek研究人员在内的技术人才加入Seed,强化相关方向布局。

组织能力成为大模型竞争的重要变量。基础模型研发涉及算力、数据、算法、人才体系等多个环节,任何单点突破都难以决定最终结果。研发团队需要面对长周期投入,也需要承担探索失败带来的不确定性。

Gartner预测,到2028年,约三分之一企业软件将具备AI Agent能力,超过60%的生成式AI应用将通过企业级AI平台部署。对于火山引擎和豆包等商业化业务而言,底层模型能力决定未来竞争空间,应用层产品可以快速迭代,基础模型能力则需要长期积累。

其实,张一鸣最底层的行动逻辑,是守住创造能力的组织机制。沿着这条线看,字节近期围绕模型、组织和研发体系的一系列动作,都指向同一个目标——把决定技术突破的关键变量尽可能留在内部。

这种思路带着非常强的平台原生主义。平台时代最重要的能力,就是控制。控制算法,控制流量,控制数据,控制分发,也控制价值链上的关键节点。到了AI时代,这套方法论继续向模型研发延伸。模型、数据、算力、人才和产品需要咬合在同一套体系里,任何一个关键环节长期依赖外部,都会削弱整体的自主进化能力。

因此,张一鸣真正警惕的,或许是研发能力被外部技术路径牵引。蒸馏能够缩短差距,API能够迅速补齐能力,但长期依赖外部动能,会让字节内部的研发体系逐渐失去寻找下一次突围的能力。

对于字节来说,真正的壁垒来自人才密度、资源体量、组织效率和长期投入共同形成的研发机器。这也是江湖上把字节称为App工厂的原因之一。

回顾过往字节的战役来看,一整套打法都是张一鸣熟悉且熟练的。把关键要素系统化,把资源组织调动起来,再通过持续迭代,把阶段性的落后变为后发赶超的自身优势。

面对字节本次在AI竞赛中的关键会议判断,张一鸣要守住的是造炮的体系,一旦下一次技术突破发生时,字节依然能够自己造出炮来。


大模型竞争,路线各异

围绕模型蒸馏形成的讨论,往深处看,已经触及中国大模型产业进入下一阶段后的路线分化。

过去几年,中国模型公司的共同任务明确,就是尽快缩短与全球前沿模型之间的能力差距。开源模型、合成数据、模型蒸馏、工程优化都成为重要工具,中国团队由此表现出很强的追赶效率。

斯坦福大学《2025年AI Index》记录了这一过程。2023年底,中美顶尖模型在MMLU、MMMU、MATH和HumanEval上的差距分别达到17.5、13.5、24.3和31.6个百分点。到2024年底,四项差距已经收窄至0.3、8.1、1.6和3.7个百分点。到了2026年3月,中美顶尖模型综合性能差距进一步收窄至2.7%。阿里和DeepSeek都已经进入全球头部模型序列。

追赶速度背后,有一个更加值得关注的资源反差。2025年,美国私人AI投资达到2859亿美元,中国约124亿美元,前者达到后者23倍。美国机构同期推出59个具有代表性的AI模型,中国为35个。资源投入差距依然巨大,模型能力差距却持续缩小。工程效率由此成为中国大模型产业最鲜明的竞争能力之一。

我更关心的是,当能力差距缩小以后,中国模型公司会怎样回答下一个问题。

下一代能力究竟从哪里来?

答案已经出现明显分化。

DeepSeek走出了一条富含本土特色的效率路线。DeepSeek-V3采用MoE、MLA、FP8训练等方法,把模型架构、训练系统和硬件利用率放在同一个工程体系里优化。6710亿参数的V3,每个Token只激活370亿参数,完整训练消耗约278.8万H800 GPU小时。DeepSeek随后又把R1产生的推理能力蒸馏到小模型,并明确允许开发者利用模型输出继续微调和蒸馏。技术突破、成本压缩和开放扩散,在DeepSeek体系里可以同时发生。

阿里的Qwen又是另一条路径。Qwen持续推进基础模型能力,同时不断扩大模型尺寸、开源版本和工具体系,再把模型接入阿里云、Model Studio和企业Agent生态。到了2026年,阿里云已经把模型、AI基础设施、开发平台和Agent产品放进同一套企业服务体系。Qwen承担的角色逐渐超出单一模型,更接近阿里AI生态的一层公共底座。

Kimi选择把有限资源投向几个明确方向。长上下文、代码、复杂任务和Agent长期保持较高优先级。2026年7月发布的Kimi K3达到2.8万亿参数,支持100万Token上下文,重点指向长周期编程、知识工作和复杂推理。创业公司的资源约束更加明显,技术路线因此需要更锋利,集中力量寻找可以建立领先位置的能力支点。

把张一鸣的选择放在这样的产业坐标里观察,就逐渐清晰了。

字节走的是一条带有强烈平台原生主义色彩的路线,核心是控制产生能力的关键变量。沿着张一鸣过去十多年的创业经历来看,逻辑具有很强的连续性。平台时代,字节把算法、数据、流量和产品放进一个闭环生态系统里,通过对关键变量的控制形成竞争优势。进入AI时代,控制范围继续向模型、算力、人才和基础研究延伸。

下一阶段的大模型竞争,核心问题将回到能力来源。谁能够持续发现新的模型能力增长路径,谁更有机会获得长期主动权。

故而,蒸馏在张一鸣的判断中,涉及的不只是模型成绩,还关系到核心生产能力从哪里产生。一旦核心生产能力长期来自竞争对手,研发团队寻找新路径、验证新方法和定义前沿的能力都会受到影响。

DeepSeek更强调用技术创新提高智能生产效率,再通过开放扩大模型影响力。Qwen希望模型成为云计算和产业生态的基础层。Kimi把资源集中到少数能力方向寻找突破。字节则试图把决定模型进化的关键生产要素留在内部,再依靠资源密度、组织能力和产品规模不断放大优势。

大模型公司之间的路线分化,并不能简单归结为“工程派”与“原创派”的对立。真正值得观察的,从来不是用不用蒸馏这种技术手段,而是各家公司把最核心的筹码押在了哪里。

随着奋力追赶全球前沿的阶段告一段落,差异早已落在了更底层的公司哲学上。中国大模型公司正沿着各自的资源禀赋、组织基因与商业位置,驶向完全不同的轨道。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
北京一女子称喝羽衣甘蓝类果汁饮品后持续腹泻一周,涉事门店回应

北京一女子称喝羽衣甘蓝类果汁饮品后持续腹泻一周,涉事门店回应

半岛晨报
2026-09-06 12:30:05
老板娘问我看见几个八字?我该怎么回答?

老板娘问我看见几个八字?我该怎么回答?

太急张三疯
2026-09-06 12:15:15
赵勇最新回应!王媛媛离队实情揭晓,中国女排备战要点公布

赵勇最新回应!王媛媛离队实情揭晓,中国女排备战要点公布

林子说事
2026-09-06 12:28:04
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

瞎说娱乐
2026-08-22 16:07:15
今晚开播!40集反谍剧空降,演员阵容雄厚,有望成下一个《狂飙》

今晚开播!40集反谍剧空降,演员阵容雄厚,有望成下一个《狂飙》

尺素a
2026-09-06 10:33:42
是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

是时候揭开真相了:当年对越作战的损失或许远超人们想象,仅从那些牺牲的将门之后就能看出端倪

人生录
2026-08-26 00:05:15
上厕所时,大便前头干硬,后头软黏,说明什么?看完涨知识了

上厕所时,大便前头干硬,后头软黏,说明什么?看完涨知识了

芹姐说生活
2026-09-03 23:27:20
只换一人,利物浦从地狱到天堂!伊劳拉神换人,让全英超看呆了

只换一人,利物浦从地狱到天堂!伊劳拉神换人,让全英超看呆了

日常万物志
2026-09-06 07:18:03
罗斯谈詹姆斯:句句破防!亲口坦言一生遗憾!

罗斯谈詹姆斯:句句破防!亲口坦言一生遗憾!

观星娱记
2026-09-06 09:23:30
儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

儿童患癌越来越多!再三呼吁:这些东西少给孩子吃!危害大

橘子约定
2026-08-30 14:06:45
世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

世界领先!石油可能要变“白菜价”?中国新技术让国力再次飙升!

小蜜情感说
2026-09-06 12:47:12
1000万欧!身价超国足!史上最强U23诞生,他们才是冲击2030年世界杯的希望

1000万欧!身价超国足!史上最强U23诞生,他们才是冲击2030年世界杯的希望

篮球圈里的那些事
2026-09-05 18:07:58
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

观星赏月
2026-09-06 05:31:21
体制内能闯多大的祸?评论区前途一片黑暗

体制内能闯多大的祸?评论区前途一片黑暗

康富贵碎碎念
2026-08-31 11:21:37
网红餐饮店被上海警方刑事立案,执法当天有蟑螂爬过,此前被曝用鸭肝冒充鹅肝

网红餐饮店被上海警方刑事立案,执法当天有蟑螂爬过,此前被曝用鸭肝冒充鹅肝

上观新闻
2026-09-06 14:25:29
意甲建队成本:尤文5.5亿欧最高,米兰第三国米第四罗马第六

意甲建队成本:尤文5.5亿欧最高,米兰第三国米第四罗马第六

懂球帝
2026-09-06 14:03:06
9月7日白露,牢记:1不穿,2不坐,3要戴,4多吃,千万别大意!

9月7日白露,牢记:1不穿,2不坐,3要戴,4多吃,千万别大意!

简食记工作号
2026-09-05 01:08:20
萨里:如果罗马继续这样的表现,冠军争夺将会一直持续到最后

萨里:如果罗马继续这样的表现,冠军争夺将会一直持续到最后

懂球帝
2026-09-06 09:38:08
别再考虑夺冠了!张雪机车想获得车队第二和车手第一 只剩理论上的可能性了!

别再考虑夺冠了!张雪机车想获得车队第二和车手第一 只剩理论上的可能性了!

沉睡月亮m
2026-09-06 04:49:08
2026-09-06 15:55:00
嗅态 incentive-icons
嗅态
写故事,说观点,做文字匠人。
107文章数 31关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

马克龙42岁继女爱上小20岁男友 上演妈妈的忘年恋剧情

头条要闻

马克龙42岁继女爱上小20岁男友 上演妈妈的忘年恋剧情

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

房产
旅游
健康
艺术
手机

房产要闻

突发重磅!海口出台楼市新政!

旅游要闻

Chinamaxxing出圈:入境流量如何变文旅新增长点

脑梗取栓成功≠活下来,还有这三关

艺术要闻

2026 潮涌宁波—第六届综合材料绘画展 入选作品(三)

手机要闻

飞傲预热全球首款便携安卓数字转盘DT11,零售价预计2000元左右

无障碍浏览 进入关怀版