网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4 背后,竟然藏着一个月之暗面的影子

0
分享至

AI范儿 · 深度长文

这几天,很多人都在读 DeepSeek V4 的技术报告,我当然也不例外。

对技术圈来说,DeepSeek 每次发技术报告,就好像是一次"开卷考试"。

因为他们不只会告诉我们模型有多强、跑分多厉害,还会把背后的技术架构、训练方法、工程细节,甚至算力和成本都摊开来讲。

这次也一样。

大家都在讨论百万 Token、榜单表现、国产算力、价格。但我发现,很多人可能忽略了一个非常有意思的细节。

它叫Muon

模型是怎么训练的、用了哪些创新方法,是每一次技术报告当中的重头戏。

这一次,DeepSeek V4 主要在解决三个特别朴素的问题。

第一个问题:内容太长,看不过来

百万 Token 听起来很酷,但背后有个麻烦:模型每生成一个字,都可能要回头翻前面非常长的内容。

这就像你让一个人读完一百万页资料,然后每回答一个问题,都要把前面所有资料重新翻一遍。

传统 Attention 机制的问题就在这里:上下文越长,计算量和显存压力会快速膨胀。

不是模型不想看,而是完整看一遍的成本实在太高了。

DeepSeek 一贯以来的风格都是把成本往死里降(毕竟我们是真缺算力),所以这次 DeepSeek V4 引入了两个新的东西:CSA 和 HCA。


你可以把它理解成两种"省力读书法":先把内容压缩,再挑重要部分看。

这样模型不需要每次都把所有内容完整扫一遍,长文本才有可能真正跑起来。

第二个问题:模型太深,信息容易传丢

大模型不是一层两层,而是很多层神经网络叠在一起。

信息从第一层传到最后一层,有点像接力跑。层数越多,中间越容易出现变形、衰减,甚至训练不稳定。

我们都知道一个成语叫"三人成虎"吧,谣言传多了,假的也像真的,说的就是信息在传递过程中不断失真。

所以 DeepSeek V4 引入了一个叫 mHC 的东西。

它可以理解成给层与层之间的信息传递加了一套更稳定的"接力通道",让重要信息在深层网络里不容易跑偏。


这个东西在今年元旦的时候 DeepSeek 已经单独发过论文,当时就引起了不小的关注。这次在 V4 里面出现,完全是情理之中。

第三个问题:模型太大,训练太难

DeepSeek V4 训练了 30T+ tokens。

大家都知道,规模大到一定的数量级,已经不是"多喂点数据"那么简单了,它会面临一个巨大的工程问题。

模型可能学得慢,可能训练不稳定,甚至训练到一半直接崩了。

V4 的论文里面也提到了,训练过程遇到了突然抽风的情况,误差率突然爆炸,而且会反复出现。

这时候,Muon 就出现了。

它不是模型,也不是功能,而是训练模型时的"学习方法"。它决定模型每一步该怎么调整参数,往哪个方向改,改多大。

所以,如果说 CSA/HCA 解决的是"看得太多太贵",mHC 解决的是"传得太远不稳",那么 Muon 解决的就是:

这么大的模型,怎么才能更快、更稳地学会。

01Muon 到底是什么

Muon 其实就是训练大模型时用的优化器

通俗讲,模型训练就是不断犯错、不断修改参数的过程,这就好比我们教一个小孩学游泳,它会不断犯错、我们不断的给他纠正,最后他终于学会了。

如果你教一个孩子,这样的方法还应付得过来,假设让你同时教 1000 个孩子,你肯定直接崩溃了。

这就是传统方法遇到的问题,一旦遇到超大规模、超多参数的模型训练,成本和效率根本扛不住。

现在假设有套 AI 系统,让随时监控到每个孩子的动作姿势以及各种我们需要知道的数据,如果发现错了,直接进行提示,也许我们可以轻松应对 1000 个孩子的教学。


Muon 的作用也类似:这个优化器决定的是,模型每次犯错之后,下一步到底该往哪个方向改,改多大。

它让模型在训练时更快收敛,也更稳定

DeepSeek V4 论文里也明确说,他们在大部分模块中使用 Muon,原因是它能带来更快收敛和更好的训练稳定性。

这句话翻译成人话就是:它能让模型少走弯路,学得更快,也更不容易训崩。


△图:DeepSeek V4技术报告中关于Muon的单独章节

02有意思的"梦幻联动"

有意思的是,这么关键的东西并不是 DeepSeek 自己发明的。

DeepSeek V4 论文在 Muon 这一节里引用了两篇工作:Jordan et al., 2024 和 Liu et al., 2025。

这里的 Liu et al., 2025,正是月之暗面团队之前围绕 Muon 做的大模型训练研究。


△图:月之暗面关于 Muon 的论文

换句话说,DeepSeek 这次用上的 Muon,背后不只是一个优化器名字,也包含了包括月之暗面在内的一系列前沿研究积累。

这听起来很有戏剧性。

DeepSeek 和月之暗面,在模型产品和开源生态里,毫无疑问是竞争关系。

但到了底层训练方法上,它们却在同一个关键方向上出现了交集。

这不是"谁抄谁",更不是简单合作。

而是开源最有意思的地方:表面上大家在竞争,底层技术却会互相流动。

03开源不只是免费

很多人误以为,开源就是免费。

这样理解就太偏了,而且把开源看小了。

开源真正有价值的地方,不只是"我把东西免费给你用",而是我把一条被验证过的技术路径,交给更多人继续往前推。

在很多前沿领域,大家其实都在摸着石头过河。只不过,有人把自己摸到的经验封闭起来,写成专利,锁在公司内部。

也有人愿意把它写成论文、放出代码、开放模型,让更多人看到这条路到底走不走得通。

一个团队先摸到了一块石头,另一个团队就不必从河边重新开始试探。它可以站在这个基础上,把问题继续往下做。

DeepSeek 一直以来都在做这样的事情,现在我们看到国内越来越多的模型公司都在做这件事。

今天我们终于看到,一直以为独立作战的他们,开始梦幻联动了,这件事情特有意义。

在很多前沿的领域,技术并不会完全按照公司边界流动。论文、开源、社区和工程实践,会让不同团队的经验彼此影响。

04同一条河,同一块石头

放到今天这个环境里,这件事更有意义。

国内公司做大模型,大家都要面对更高的算力压力,也要面对更复杂的外部限制。

这个时候,开源就不只是理想主义,它也是一种现实选择。不过大家不要误解,开源是针对全世界,不只是国内。

大家都在同一条河里摸索。有人愿意把摸到的石头标出来,后来的人就能少摔几跤,也能把精力放到更难的问题上。

所以,当我们讨论 DeepSeek V4 的时候,当然可以讨论它的参数规模、百万 Token、榜单成绩,也可以讨论它到底用了多少国产算力。

但我觉得,像 Muon 这个细节同样值得被看见。

它让我们看到,大模型公司之间不只有竞争,也存在一种更隐性的技术交汇。

表面上,大家都在争夺下一代最强开源模型的位置。但在更底层的技术世界里,一篇论文、一个优化器、一套工程实践,可能会被不同团队继续接力。

这不是谁输谁赢的问题,而是整个生态一起往前走的方式。

这才是"开源之火,可以燎原"真正动人的地方。

Muon 这种"竞争对手之间的技术接力",你觉得未来会更多还是更少?评论区聊聊你的看法觉得有用 → 点个❤️在看转给还不知道的朋友点个赞 告诉我你看完了关注「AI范儿」,下次更新第一时间收到

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
救援人员因为害怕,放下灭火器后跑了!这次真的太丢人了

救援人员因为害怕,放下灭火器后跑了!这次真的太丢人了

走读新生
2026-09-06 23:20:07
卖萌的御姐:不是反差,是在锋利与柔软之间为己留出的可调节棱角

卖萌的御姐:不是反差,是在锋利与柔软之间为己留出的可调节棱角

疾跑的小蜗牛
2026-09-07 20:32:42
女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

篮球快餐车
2026-09-07 16:00:07
广西河池警方通报一起刑事案件:致一女子死亡,嫌疑人行凶后跳楼身亡

广西河池警方通报一起刑事案件:致一女子死亡,嫌疑人行凶后跳楼身亡

界面新闻
2026-09-07 10:19:50
“高速公路收费期限届满后由政府统一管理,可收取车辆通行费”

“高速公路收费期限届满后由政府统一管理,可收取车辆通行费”

观察者网
2026-09-07 18:03:38
看看朝鲜的下场,就能明白我们为什么不支援俄罗斯了!虽然朝鲜几乎倾尽所有地支援了俄罗斯,但是俄罗斯大概率并不会优先考虑朝鲜的感受

看看朝鲜的下场,就能明白我们为什么不支援俄罗斯了!虽然朝鲜几乎倾尽所有地支援了俄罗斯,但是俄罗斯大概率并不会优先考虑朝鲜的感受

扶苏聊历史
2026-08-25 16:22:06
2-0横扫侮辱中餐的美国名将!萨巴伦卡霸气17连胜 连续6年美网8强

2-0横扫侮辱中餐的美国名将!萨巴伦卡霸气17连胜 连续6年美网8强

风过乡
2026-09-07 08:41:16
日本女篮惨败20分!世界杯1胜2负,凭小分幸运出线,晋级附加赛

日本女篮惨败20分!世界杯1胜2负,凭小分幸运出线,晋级附加赛

格斗社
2026-09-08 02:02:18
28岁中国籍留英博士生被指强奸虐待7人,之前因下药并性侵10名女性被英国法庭判处终身监禁,曾提出化学阉割以换取较轻判刑,但被法官拒绝

28岁中国籍留英博士生被指强奸虐待7人,之前因下药并性侵10名女性被英国法庭判处终身监禁,曾提出化学阉割以换取较轻判刑,但被法官拒绝

大风新闻
2026-09-07 21:03:05
房子遭人强拆,因反抗坐3年牢!出狱后扬言:不赢官司就杀人

房子遭人强拆,因反抗坐3年牢!出狱后扬言:不赢官司就杀人

就一点
2026-09-07 16:12:17
医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

观星赏月
2026-09-07 00:44:10
一部"极其普通"的手机,凭什么卖649美元?

一部"极其普通"的手机,凭什么卖649美元?

固件更新中
2026-09-07 00:25:42
正式官宣!中国男篮国手王俊杰完成签约,加盟香港金牛

正式官宣!中国男篮国手王俊杰完成签约,加盟香港金牛

体坛瞎白话
2026-09-07 16:47:03
呼吁“取消英语主科地位”的汤家凤,成了笑话

呼吁“取消英语主科地位”的汤家凤,成了笑话

行者殷涛
2026-09-07 14:24:44
难以置信,郑钦文2-0斯瓦泰克,诞生6个不可思议,又一个大翻盘

难以置信,郑钦文2-0斯瓦泰克,诞生6个不可思议,又一个大翻盘

南海浪花
2026-09-08 02:16:18
李亚鹏自曝,李嫣除了英语全不及格,一年百万学费换来什么

李亚鹏自曝,李嫣除了英语全不及格,一年百万学费换来什么

历史点行
2026-09-03 16:00:37
美网超级冷门!郑钦文2-0晋级八强,奖金532万,斯瓦泰克被打崩溃

美网超级冷门!郑钦文2-0晋级八强,奖金532万,斯瓦泰克被打崩溃

侃球熊弟
2026-09-08 01:44:47
丝袜称将制定特殊战术针对郑钦文,诺娃分析萨巴打法直言很了解她

丝袜称将制定特殊战术针对郑钦文,诺娃分析萨巴打法直言很了解她

网球之家
2026-09-07 23:11:59
惠州女子被控“发视频寻衅滋事”遭羁押608天后检方撤诉,获43.68万元国家赔偿

惠州女子被控“发视频寻衅滋事”遭羁押608天后检方撤诉,获43.68万元国家赔偿

封面新闻
2026-09-07 20:34:09
黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

黄智贤正式变节,邱毅发文确认,馆长也表态了,统派不适合投机者

精彩一网打尽
2026-09-06 15:42:24
2026-09-08 02:52:49
AI范儿 incentive-icons
AI范儿
AI范儿是一个专注于人工智能领域的资讯和学习平台,提供最新的人工智能资讯
830文章数 684关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

游戏
旅游
教育
艺术
本地

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

教育要闻

老师真的太卑微了!家长就因为排座位,冲进教室质问:你是不是收了别的家长钱?凭什么我家孩子就只能坐角落!

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

无障碍浏览 进入关怀版