网易首页 > 网易号 > 正文 申请入驻

DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布

0
分享至

编辑|泽南

来自 DeepSeek 团队的底层 AI 芯片工具开源了。

9 月 30 日上午,DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,覆盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。根据 DeepSeek 的介绍,这些组件与其此前面向英伟达平台开源的组件一一对应。



此次发布包含 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别承担矩阵运算、跨设备通信、常规向量计算与访存、稀疏注意力和数据筛选等任务,共同支撑模型运行中的关键环节。

华为则将双方围绕昇腾 950 及超节点开展的联合创新成果在 CANN 社区开源,覆盖模型部署、大规模训练、超长文本 KV Cache 池化与 Agentic RL 等实践,并披露了 DeepSeek-V4.1-Flash 的部分离线推理性能数据。

开源项目链接:

  • TileLang: https://github.com/tile-ai/tilelang
  • DeepGEMM Ascend: https://github.com/deepseek-ai/DeepGEMM-Ascend
  • DeepEP Ascend: https://github.com/deepseek-ai/DeepEP-Ascend
  • TileKernels: https://github.com/deepseek-ai/TileKernels
  • FlashMLA: https://github.com/deepseek-ai/FlashMLA
  • DeepSelect: https://github.com/deepseek-ai/DeepSelect

这次开源让我们得以了解 DeepSeek 在国产 AI 算力上开发工具、核心算子和通信组件等方面的进展。而对于开发者来说,现在也可以在更接近模型实际需求的工具基础上开展优化,减少从底层重新实现关键能力的工作。

把前沿模型的算子开发经验带到昇腾

对大模型而言,芯片的理论算力只是起点。模型中的运算如何拆分、数据如何搬运、计算与访存如何衔接都会影响硬件最终能发挥多少性能。这些工作很大一部分落在算子实现上。

用较底层的语言编写算子,开发者就可以精细控制硬件,但也需要处理更多执行细节。模型结构持续变化,新算子不断出现,开发效率与性能优化便需要同时考虑。TileLang试图解决的正是这个问题。据 DeepSeek 的介绍,其希望提供一种编程更简单、同时能够充分利用芯片计算资源的高级语言,降低高性能算子的开发难度。

DeepSeek 表示,相比于 CUDA 语言,TileLang的编程模型能够简化代码逻辑、提高算子开发效率和项目可靠性。同时,其设计又强调充分利用硬件资源。团队称,这条技术路线已经在英伟达平台得到验证,目前承载了 DeepSeek V4 系列模型训练中大部分算子的实现。

此次开源的昇腾版本进一步将这一编程方式扩展到国产算力平台。DeepSeek 表示,相比昇腾原生的 Ascend C 底层语言,TileLang 昇腾版大幅简化了编程模型,同时保持硬件性能。据团队披露,DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

这意味着此次发布已经覆盖了一组源于真实模型训练需求的算子。对于研究者来说,新模型结构往往需要新的计算方式,如果算子的实现与调优门槛下降,验证模型想法所需的工程投入也有望降低。

这套高级语言仍然需要硬件软件接口的支撑。华为介绍,昇腾通过开放的 Ascend C 编程接口与 PTO ISA 底层指令体系,支持 TileLang 的编译对接,有经验的开发者也可以继续进行底层手工调优。

五项组件,覆盖计算与通信关键环节

与 TileLang 一同发布的计算和通信组件,为开发者提供了可复用的基础能力。



这几项能力覆盖了不同类型的性能瓶颈。矩阵运算关系到计算单元的利用率,向量计算与访存关系到数据处理效率,稀疏注意力和筛选算子则服务于模型更具体的计算需求。

当模型跨越多张加速卡运行时,通信会成为单独需要优化的环节。单卡上的计算再快,如果数据无法及时到达下一步计算所在的设备,整个任务仍然会等待。

DeepSeek 表示,在多项关键测试用例中,此次开源组件的计算与通信性能已接近硬件上限。此次成套开源后,模型团队可以复用已经实现的基础组件,把更多精力投入自身的模型结构和应用需求,在某个环节出现瓶颈时,也能够查看并进一步修改实现。

超节点上的通信优化

此次合作还涉及昇腾 950 机型和 128 卡超节点方案,双方对计算与通信进行了联合优化。

华为提供的方案包括 SuperPoD Flex 与 UBL128 组网。据介绍,UBL128 超节点采用全互联设计,昇腾同时提供 ASC-COMM 高性能自定义通信编程库,支持通信算子以及通算融合算子的开发。

在此基础上,DeepSeek 开发了高性能 DeepEP 通信库,覆盖 EP、CP、PP、FSDP 等模式下的通信算子,分别对应专家并行、上下文并行、流水线并行和全分片数据并行等模型分布式执行方式。

这些并行方式需要传输的数据不同,通信发生的时机也不同。例如,专家并行需要把数据分发给相应专家,再汇聚计算结果。通信与计算的组织方式,会影响设备是否需要等待以及整个任务的执行效率。

华为披露,相关测试中 Dispatch 带宽达到 375 GB/s,Combine 带宽达到 347 GB/s,并称其接近硬件上限。对于大模型集群,这类优化的意义在于让新增的硬件资源能够更有效地参与计算。模型规模扩大、上下文变长,都会改变计算和通信的需求。可见,双方的合作深入到了模型计算方式与硬件互联之间。

V4.1 Flash 推理数据

在具体部署上,华为披露了基于 EP32 部署策略的 DeepSeek-V4.1-Flash 离线推理测试结果。



TPOT 衡量输出阶段每个 token 的生成耗时,吞吐则衡量单位时间内输出的 token 数量。两组结果呈现了不同 token 生成时延目标下的吞吐表现:在通稿给出的测试中,允许更长的 TPOT,对应更高的每卡输出吞吐。

数据均来自 Offline 推理模式,统计的是不带框架的纯模型性能,不包含 Serving 调度和框架负载均衡的影响,所列测试条件还包括 ContextLength 为 128K,以及 DSpark 投机接受率为 0.85。实际服务还需要考虑请求调度、负载变化和框架开销。

作为一组注明条件的模型执行测试,这些结果为评估昇腾平台上的部署方案提供了参考。对于准备开展部署的团队,能够复现测试并了解参数选择,往往比单独看到一个性能数字更有用。

可复用的联合优化成果

此次计划开放的实践,覆盖从单卡、单机到大规模部署的多个场景,也包含基于 PyTorch 原生框架的模型预训练、低精度量化训练、LoRA 微调和 Agentic RL 等内容。

其中,超长文本 KV Cache 池化涉及长上下文推理中的缓存管理,Agentic RL 则进一步涉及智能体与环境交互过程中的训练基础设施。这些方向说明,对大模型的联合优化正在延伸到模型部署与训练的具体流程。

此次的开源可以帮助开发者理解一项能力如何进入完整任务。计算库和通信库提供可调用的实现,部署及训练实践则提供组合这些实现的参考路径,减少团队各自探索配置与调优方法的成本。

对昇腾软件生态而言,这次发布增加了一套来自前沿模型实际需求的高级语言工具和基础组件,也给其他团队提供了可研究、可修改的工程范本。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
年轻人没性生活不生娃,北大调查:罪魁祸首不是加班,是"没工作"

年轻人没性生活不生娃,北大调查:罪魁祸首不是加班,是"没工作"

知识圈
2026-09-24 14:52:42
网红“溜溜凳”检测报告遭打假,华谊检测:相关报告、网站都是假的,已报案

网红“溜溜凳”检测报告遭打假,华谊检测:相关报告、网站都是假的,已报案

红星资本局
2026-09-30 12:25:03
iPhone18Pro国内销量炸了,卖这么好,简直没天理

iPhone18Pro国内销量炸了,卖这么好,简直没天理

科技头版Pro
2026-09-29 14:31:30
法国穆斯林女人怒了:超市里怎么可以卖含酒精的糖果?

法国穆斯林女人怒了:超市里怎么可以卖含酒精的糖果?

步论天下事
2026-09-26 10:37:49
吃完饭就躺着容易生病吗?医生:不仅不长胖,可能还有2个好处

吃完饭就躺着容易生病吗?医生:不仅不长胖,可能还有2个好处

健康之光
2026-09-08 17:57:25
国防部罕见说重话!直接用出"根除"二字,一旦开打势必连根拔起

国防部罕见说重话!直接用出"根除"二字,一旦开打势必连根拔起

共工之锚
2026-09-29 00:38:23
“公章是假的,红头文件是伪造的”

“公章是假的,红头文件是伪造的”

中国新闻周刊
2026-09-29 22:18:04
它才是被低估的“国民好油”,营养远超想象!可惜很多人不知道

它才是被低估的“国民好油”,营养远超想象!可惜很多人不知道

中国疾控动态
2026-09-29 10:21:23
财经老王丨买房也有“国补”了!最高可节省利息近5万元

财经老王丨买房也有“国补”了!最高可节省利息近5万元

极目新闻
2026-09-29 23:00:15
一个编辑器顶掉两个,我删了VS Code和Notepad++

一个编辑器顶掉两个,我删了VS Code和Notepad++

薛定谔的BUG
2026-09-29 22:37:31
2009年,刘欢的年收入大概在3200万左右

2009年,刘欢的年收入大概在3200万左右

岁月有情1314
2026-09-28 11:22:02
原来他才是国乒的聪明人,亚运会零冠收官后,早已为自己留好退路

原来他才是国乒的聪明人,亚运会零冠收官后,早已为自己留好退路

泠泠说史
2026-09-30 06:57:16
童瑶夫妇大理游,老公出镜住1000元洱海民宿,结婚7年未怀孕生子

童瑶夫妇大理游,老公出镜住1000元洱海民宿,结婚7年未怀孕生子

椰黄娱乐
2026-09-28 10:47:17
体制内领导到什么级别才能有独立办公室?

体制内领导到什么级别才能有独立办公室?

职场资深秘书
2026-09-30 12:19:43
广州男篮官宣!徐昕新赛季继续征战CBA,冲击NCAA失败

广州男篮官宣!徐昕新赛季继续征战CBA,冲击NCAA失败

国篮会自强
2026-09-30 13:34:02
轮到中国反击了,解放军正式出兵,菲败局已定,仁爱礁迎来大结局

轮到中国反击了,解放军正式出兵,菲败局已定,仁爱礁迎来大结局

通鉴史智
2026-09-29 09:30:57
没想到,欠债上亿后失联的密春雷,早就给妻子董卿安排好,“退路”

没想到,欠债上亿后失联的密春雷,早就给妻子董卿安排好,“退路”

80后房车生活
2026-09-30 05:53:00
17岁陈妤颉凡尔赛:4块奖牌导致我超重了 接下来要苦学备战高考了

17岁陈妤颉凡尔赛:4块奖牌导致我超重了 接下来要苦学备战高考了

风过乡
2026-09-30 08:19:43
鲁比奥称卖武器给台湾“意味着我们就没有了”,美对台军售需考虑自身国防需求,国台办:坚决反对建交国同中国台湾开展任何形式的军事联系

鲁比奥称卖武器给台湾“意味着我们就没有了”,美对台军售需考虑自身国防需求,国台办:坚决反对建交国同中国台湾开展任何形式的军事联系

政知新媒体
2026-09-30 10:55:33
中方舰群抵近马尼拉湾后!菲律宾外交部回应了,来了一出嘴硬腿软

中方舰群抵近马尼拉湾后!菲律宾外交部回应了,来了一出嘴硬腿软

元宝课堂
2026-09-28 17:01:10
2026-09-30 15:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14113文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

头条要闻

妈妈把12岁儿子留在出租屋独居 带着另外3个孩子搬走

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

金鹰这夜,演员争辉,有惊喜,反差

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

真实力用“大考”亮出来 猛士X700开启预售 24.98万起

态度原创

游戏
健康
时尚
数码
军事航空

N卡为《巫师3RE》打造最佳体验 DLSS+强力光追

刷酸祛痘,为什么有人翻车?

老板,我的脑子好像忘在家里了

数码要闻

徐梦桃空降南京!TCL Q9M Art以壁纸美学诠释SQD冠军画质

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版