网易首页 > 网易号 > 正文 申请入驻

DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布

0
分享至

编辑|泽南

来自 DeepSeek 团队的底层 AI 芯片工具开源了。

9 月 30 日上午,DeepSeek 宣布开源面向华为昇腾算力平台的基础设施组件,覆盖 TileLang 高级语言编译工具、高性能计算库和分布式通信库。根据 DeepSeek 的介绍,这些组件与其此前面向英伟达平台开源的组件一一对应。



此次发布包含 DeepGEMM、DeepEP、TileKernels、FlashMLA 和 DeepSelect,分别承担矩阵运算、跨设备通信、常规向量计算与访存、稀疏注意力和数据筛选等任务,共同支撑模型运行中的关键环节。

华为则将双方围绕昇腾 950 及超节点开展的联合创新成果在 CANN 社区开源,覆盖模型部署、大规模训练、超长文本 KV Cache 池化与 Agentic RL 等实践,并披露了 DeepSeek-V4.1-Flash 的部分离线推理性能数据。

开源项目链接:

  • TileLang: https://github.com/tile-ai/tilelang
  • DeepGEMM Ascend: https://github.com/deepseek-ai/DeepGEMM-Ascend
  • DeepEP Ascend: https://github.com/deepseek-ai/DeepEP-Ascend
  • TileKernels: https://github.com/deepseek-ai/TileKernels
  • FlashMLA: https://github.com/deepseek-ai/FlashMLA
  • DeepSelect: https://github.com/deepseek-ai/DeepSelect

这次开源让我们得以了解 DeepSeek 在国产 AI 算力上开发工具、核心算子和通信组件等方面的进展。而对于开发者来说,现在也可以在更接近模型实际需求的工具基础上开展优化,减少从底层重新实现关键能力的工作。

把前沿模型的算子开发经验带到昇腾

对大模型而言,芯片的理论算力只是起点。模型中的运算如何拆分、数据如何搬运、计算与访存如何衔接都会影响硬件最终能发挥多少性能。这些工作很大一部分落在算子实现上。

用较底层的语言编写算子,开发者就可以精细控制硬件,但也需要处理更多执行细节。模型结构持续变化,新算子不断出现,开发效率与性能优化便需要同时考虑。TileLang试图解决的正是这个问题。据 DeepSeek 的介绍,其希望提供一种编程更简单、同时能够充分利用芯片计算资源的高级语言,降低高性能算子的开发难度。

DeepSeek 表示,相比于 CUDA 语言,TileLang的编程模型能够简化代码逻辑、提高算子开发效率和项目可靠性。同时,其设计又强调充分利用硬件资源。团队称,这条技术路线已经在英伟达平台得到验证,目前承载了 DeepSeek V4 系列模型训练中大部分算子的实现。

此次开源的昇腾版本进一步将这一编程方式扩展到国产算力平台。DeepSeek 表示,相比昇腾原生的 Ascend C 底层语言,TileLang 昇腾版大幅简化了编程模型,同时保持硬件性能。据团队披露,DeepSeek 训练中用到的每一个 TileLang 算子,在昇腾上都有对应的高性能实现。

这意味着此次发布已经覆盖了一组源于真实模型训练需求的算子。对于研究者来说,新模型结构往往需要新的计算方式,如果算子的实现与调优门槛下降,验证模型想法所需的工程投入也有望降低。

这套高级语言仍然需要硬件软件接口的支撑。华为介绍,昇腾通过开放的 Ascend C 编程接口与 PTO ISA 底层指令体系,支持 TileLang 的编译对接,有经验的开发者也可以继续进行底层手工调优。

五项组件,覆盖计算与通信关键环节

与 TileLang 一同发布的计算和通信组件,为开发者提供了可复用的基础能力。



这几项能力覆盖了不同类型的性能瓶颈。矩阵运算关系到计算单元的利用率,向量计算与访存关系到数据处理效率,稀疏注意力和筛选算子则服务于模型更具体的计算需求。

当模型跨越多张加速卡运行时,通信会成为单独需要优化的环节。单卡上的计算再快,如果数据无法及时到达下一步计算所在的设备,整个任务仍然会等待。

DeepSeek 表示,在多项关键测试用例中,此次开源组件的计算与通信性能已接近硬件上限。此次成套开源后,模型团队可以复用已经实现的基础组件,把更多精力投入自身的模型结构和应用需求,在某个环节出现瓶颈时,也能够查看并进一步修改实现。

超节点上的通信优化

此次合作还涉及昇腾 950 机型和 128 卡超节点方案,双方对计算与通信进行了联合优化。

华为提供的方案包括 SuperPoD Flex 与 UBL128 组网。据介绍,UBL128 超节点采用全互联设计,昇腾同时提供 ASC-COMM 高性能自定义通信编程库,支持通信算子以及通算融合算子的开发。

在此基础上,DeepSeek 开发了高性能 DeepEP 通信库,覆盖 EP、CP、PP、FSDP 等模式下的通信算子,分别对应专家并行、上下文并行、流水线并行和全分片数据并行等模型分布式执行方式。

这些并行方式需要传输的数据不同,通信发生的时机也不同。例如,专家并行需要把数据分发给相应专家,再汇聚计算结果。通信与计算的组织方式,会影响设备是否需要等待以及整个任务的执行效率。

华为披露,相关测试中 Dispatch 带宽达到 375 GB/s,Combine 带宽达到 347 GB/s,并称其接近硬件上限。对于大模型集群,这类优化的意义在于让新增的硬件资源能够更有效地参与计算。模型规模扩大、上下文变长,都会改变计算和通信的需求。可见,双方的合作深入到了模型计算方式与硬件互联之间。

V4.1 Flash 推理数据

在具体部署上,华为披露了基于 EP32 部署策略的 DeepSeek-V4.1-Flash 离线推理测试结果。



TPOT 衡量输出阶段每个 token 的生成耗时,吞吐则衡量单位时间内输出的 token 数量。两组结果呈现了不同 token 生成时延目标下的吞吐表现:在通稿给出的测试中,允许更长的 TPOT,对应更高的每卡输出吞吐。

数据均来自 Offline 推理模式,统计的是不带框架的纯模型性能,不包含 Serving 调度和框架负载均衡的影响,所列测试条件还包括 ContextLength 为 128K,以及 DSpark 投机接受率为 0.85。实际服务还需要考虑请求调度、负载变化和框架开销。

作为一组注明条件的模型执行测试,这些结果为评估昇腾平台上的部署方案提供了参考。对于准备开展部署的团队,能够复现测试并了解参数选择,往往比单独看到一个性能数字更有用。

可复用的联合优化成果

此次计划开放的实践,覆盖从单卡、单机到大规模部署的多个场景,也包含基于 PyTorch 原生框架的模型预训练、低精度量化训练、LoRA 微调和 Agentic RL 等内容。

其中,超长文本 KV Cache 池化涉及长上下文推理中的缓存管理,Agentic RL 则进一步涉及智能体与环境交互过程中的训练基础设施。这些方向说明,对大模型的联合优化正在延伸到模型部署与训练的具体流程。

此次的开源可以帮助开发者理解一项能力如何进入完整任务。计算库和通信库提供可调用的实现,部署及训练实践则提供组合这些实现的参考路径,减少团队各自探索配置与调优方法的成本。

对昇腾软件生态而言,这次发布增加了一套来自前沿模型实际需求的高级语言工具和基础组件,也给其他团队提供了可研究、可修改的工程范本。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1953年梁漱溟怒怼毛主席:工人九天之上,农民九地之下!

1953年梁漱溟怒怼毛主席:工人九天之上,农民九地之下!

瑾瑜聊情感
2025-07-02 17:43:04
科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

科学家已确认,在南极几千米厚的冰盖下,还藏着“另一个世界”!

抽象派大师
2026-09-30 04:53:56
三位“讲师”之死

三位“讲师”之死

梳子姐
2026-09-29 16:03:34
台湾媒体人黄智贤终于露出了原型,全力帮助绿营助选!

台湾媒体人黄智贤终于露出了原型,全力帮助绿营助选!

总在茶余后
2026-09-30 15:39:02
深一度|石雨豪:亚运金牌与背后的十年

深一度|石雨豪:亚运金牌与背后的十年

澎湃新闻
2026-09-29 19:24:09
印度运动员:与杭州亚运会相比,本届赛事是一次退步

印度运动员:与杭州亚运会相比,本届赛事是一次退步

懂球帝
2026-09-30 15:30:41
ESPN:唐斯愿降薪续约,但认为尼克斯要求不合理

ESPN:唐斯愿降薪续约,但认为尼克斯要求不合理

懂球帝
2026-09-30 10:28:23
中国亚运男足1比2惜败韩国无缘决赛,韩国足球确实已经到头

中国亚运男足1比2惜败韩国无缘决赛,韩国足球确实已经到头

李广专业体育评论
2026-09-30 15:59:37
很讽刺,没有男性造谣北理工裴老师

很讽刺,没有男性造谣北理工裴老师

关尔东
2026-09-29 23:29:56
中国人可能都没想到:最先超越特斯拉的,不是大众,是比亚迪

中国人可能都没想到:最先超越特斯拉的,不是大众,是比亚迪

兴趣知识
2026-09-30 04:46:59
印国防部机密文件揭示中印战争真相:尼赫鲁没入侵中国,战争本可避免

印国防部机密文件揭示中印战争真相:尼赫鲁没入侵中国,战争本可避免

紫罗兰侃
2026-09-28 06:00:49
女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

女子怀疑医生在其子宫装监听器,手机一放歌就异常!两次告上法庭

砚田文化
2026-09-18 08:34:48
发现没?人民币变“金贵”了!今天手里30万,抵得上几年前几十万

发现没?人民币变“金贵”了!今天手里30万,抵得上几年前几十万

时尚的弄潮
2026-09-30 06:22:53
胡歌低调现身游本昌遗体告别仪式,含泪送别爷叔最后一程。

胡歌低调现身游本昌遗体告别仪式,含泪送别爷叔最后一程。

徐醇老表哥
2026-09-30 15:24:42
邱中建同志逝世

邱中建同志逝世

人民资讯
2026-09-30 06:33:21
亚奥理事会官宣评选男女MVP:7金王张展硕+5金王余依婷李冰洁领跑

亚奥理事会官宣评选男女MVP:7金王张展硕+5金王余依婷李冰洁领跑

醉卧浮生
2026-09-30 13:12:20
何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

感恩每一刻
2026-09-30 06:07:27
中国254!日本183!国乒连夜回京备战:张本智和又传来一大坏消息

中国254!日本183!国乒连夜回京备战:张本智和又传来一大坏消息

热点一触即发
2026-09-30 06:28:03
拆开睡了六年的床,我看到了不该看的东西

拆开睡了六年的床,我看到了不该看的东西

果壳
2026-09-29 16:12:57
2599元塞进12GB内存,这台310克迷你主机想清楚了一件事

2599元塞进12GB内存,这台310克迷你主机想清楚了一件事

灰度测试中
2026-09-29 15:53:24
2026-09-30 17:56:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14113文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

头条要闻

国足主教练回应不敌韩国:我们被在欧洲踢球的对手压制

体育要闻

石雨豪:亚运金牌与背后的十年

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

中央财政首次贴息房贷 定向支持首套刚需

汽车要闻

华为乾崑ADS 5上车 纵横G700限时权益价30.49万起

态度原创

旅游
艺术
数码
公开课
军事航空

旅游要闻

假期,就去北京这里摘板栗!

艺术要闻

八闽丹青奖 入选油画作品选

数码要闻

Marshall发布Bromley 150派对音箱:售价3999元

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版