AI范儿 · 深度长文
这几天,很多人都在读 DeepSeek V4 的技术报告,我当然也不例外。
对技术圈来说,DeepSeek 每次发技术报告,就好像是一次"开卷考试"。
因为他们不只会告诉我们模型有多强、跑分多厉害,还会把背后的技术架构、训练方法、工程细节,甚至算力和成本都摊开来讲。
这次也一样。
大家都在讨论百万 Token、榜单表现、国产算力、价格。但我发现,很多人可能忽略了一个非常有意思的细节。
它叫Muon。
模型是怎么训练的、用了哪些创新方法,是每一次技术报告当中的重头戏。
这一次,DeepSeek V4 主要在解决三个特别朴素的问题。
第一个问题:内容太长,看不过来
百万 Token 听起来很酷,但背后有个麻烦:模型每生成一个字,都可能要回头翻前面非常长的内容。
这就像你让一个人读完一百万页资料,然后每回答一个问题,都要把前面所有资料重新翻一遍。
传统 Attention 机制的问题就在这里:上下文越长,计算量和显存压力会快速膨胀。
不是模型不想看,而是完整看一遍的成本实在太高了。
DeepSeek 一贯以来的风格都是把成本往死里降(毕竟我们是真缺算力),所以这次 DeepSeek V4 引入了两个新的东西:CSA 和 HCA。
![]()
你可以把它理解成两种"省力读书法":先把内容压缩,再挑重要部分看。
这样模型不需要每次都把所有内容完整扫一遍,长文本才有可能真正跑起来。
第二个问题:模型太深,信息容易传丢
大模型不是一层两层,而是很多层神经网络叠在一起。
信息从第一层传到最后一层,有点像接力跑。层数越多,中间越容易出现变形、衰减,甚至训练不稳定。
我们都知道一个成语叫"三人成虎"吧,谣言传多了,假的也像真的,说的就是信息在传递过程中不断失真。
所以 DeepSeek V4 引入了一个叫 mHC 的东西。
它可以理解成给层与层之间的信息传递加了一套更稳定的"接力通道",让重要信息在深层网络里不容易跑偏。
![]()
这个东西在今年元旦的时候 DeepSeek 已经单独发过论文,当时就引起了不小的关注。这次在 V4 里面出现,完全是情理之中。
第三个问题:模型太大,训练太难
DeepSeek V4 训练了 30T+ tokens。
大家都知道,规模大到一定的数量级,已经不是"多喂点数据"那么简单了,它会面临一个巨大的工程问题。
模型可能学得慢,可能训练不稳定,甚至训练到一半直接崩了。
V4 的论文里面也提到了,训练过程遇到了突然抽风的情况,误差率突然爆炸,而且会反复出现。
这时候,Muon 就出现了。
它不是模型,也不是功能,而是训练模型时的"学习方法"。它决定模型每一步该怎么调整参数,往哪个方向改,改多大。
所以,如果说 CSA/HCA 解决的是"看得太多太贵",mHC 解决的是"传得太远不稳",那么 Muon 解决的就是:
这么大的模型,怎么才能更快、更稳地学会。
01Muon 到底是什么
Muon 其实就是训练大模型时用的优化器。
通俗讲,模型训练就是不断犯错、不断修改参数的过程,这就好比我们教一个小孩学游泳,它会不断犯错、我们不断的给他纠正,最后他终于学会了。
如果你教一个孩子,这样的方法还应付得过来,假设让你同时教 1000 个孩子,你肯定直接崩溃了。
这就是传统方法遇到的问题,一旦遇到超大规模、超多参数的模型训练,成本和效率根本扛不住。
现在假设有套 AI 系统,让随时监控到每个孩子的动作姿势以及各种我们需要知道的数据,如果发现错了,直接进行提示,也许我们可以轻松应对 1000 个孩子的教学。
![]()
Muon 的作用也类似:这个优化器决定的是,模型每次犯错之后,下一步到底该往哪个方向改,改多大。
它让模型在训练时更快收敛,也更稳定。
DeepSeek V4 论文里也明确说,他们在大部分模块中使用 Muon,原因是它能带来更快收敛和更好的训练稳定性。
这句话翻译成人话就是:它能让模型少走弯路,学得更快,也更不容易训崩。
![]()
△图:DeepSeek V4技术报告中关于Muon的单独章节
02有意思的"梦幻联动"
有意思的是,这么关键的东西并不是 DeepSeek 自己发明的。
DeepSeek V4 论文在 Muon 这一节里引用了两篇工作:Jordan et al., 2024 和 Liu et al., 2025。
这里的 Liu et al., 2025,正是月之暗面团队之前围绕 Muon 做的大模型训练研究。
![]()
△图:月之暗面关于 Muon 的论文
换句话说,DeepSeek 这次用上的 Muon,背后不只是一个优化器名字,也包含了包括月之暗面在内的一系列前沿研究积累。
这听起来很有戏剧性。
DeepSeek 和月之暗面,在模型产品和开源生态里,毫无疑问是竞争关系。
但到了底层训练方法上,它们却在同一个关键方向上出现了交集。
这不是"谁抄谁",更不是简单合作。
而是开源最有意思的地方:表面上大家在竞争,底层技术却会互相流动。
03开源不只是免费
很多人误以为,开源就是免费。
这样理解就太偏了,而且把开源看小了。
开源真正有价值的地方,不只是"我把东西免费给你用",而是我把一条被验证过的技术路径,交给更多人继续往前推。
在很多前沿领域,大家其实都在摸着石头过河。只不过,有人把自己摸到的经验封闭起来,写成专利,锁在公司内部。
也有人愿意把它写成论文、放出代码、开放模型,让更多人看到这条路到底走不走得通。
一个团队先摸到了一块石头,另一个团队就不必从河边重新开始试探。它可以站在这个基础上,把问题继续往下做。
DeepSeek 一直以来都在做这样的事情,现在我们看到国内越来越多的模型公司都在做这件事。
今天我们终于看到,一直以为独立作战的他们,开始梦幻联动了,这件事情特有意义。
在很多前沿的领域,技术并不会完全按照公司边界流动。论文、开源、社区和工程实践,会让不同团队的经验彼此影响。
04同一条河,同一块石头
放到今天这个环境里,这件事更有意义。
国内公司做大模型,大家都要面对更高的算力压力,也要面对更复杂的外部限制。
这个时候,开源就不只是理想主义,它也是一种现实选择。不过大家不要误解,开源是针对全世界,不只是国内。
大家都在同一条河里摸索。有人愿意把摸到的石头标出来,后来的人就能少摔几跤,也能把精力放到更难的问题上。
所以,当我们讨论 DeepSeek V4 的时候,当然可以讨论它的参数规模、百万 Token、榜单成绩,也可以讨论它到底用了多少国产算力。
但我觉得,像 Muon 这个细节同样值得被看见。
它让我们看到,大模型公司之间不只有竞争,也存在一种更隐性的技术交汇。
表面上,大家都在争夺下一代最强开源模型的位置。但在更底层的技术世界里,一篇论文、一个优化器、一套工程实践,可能会被不同团队继续接力。
这不是谁输谁赢的问题,而是整个生态一起往前走的方式。
这才是"开源之火,可以燎原"真正动人的地方。
Muon 这种"竞争对手之间的技术接力",你觉得未来会更多还是更少?评论区聊聊你的看法觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.